Hacktoberfest 2026:维护者为十月标记出来的 issue,仍然开放、适合新手。 浏览 Hacktoberfest issue

DeduplicateKafkaSinkTransformer should work with fields from payload

未关闭
#239 0 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看

还没有人认领这个 Issue。

评估

难度
3/5
预计耗时
1-2 天
新手友好度
42/100
Issue 类型
缺陷
描述清晰度
基本清楚
活跃度
停滞
技术栈
kafka, scala, spark

调研方向

复现代码位于 driver/src/test/scala/za/co/absa/hyperdrive/driver/drivers/KafkaToKafkaDeduplicationAfterRetryDockerTest.scala 的第 73-74 行;先将两个 transformer 设置都改为 value.record_id,然后运行该测试。接着跟踪 DeduplicateKafkaSinkTransformer 和报告的 Avro 解析异常;当测试使用来自 payload 的 ID 字段通过时,即表示完成。

由索引模型根据 Issue 内容生成。

描述

enhancement

When changing https://github.com/AbsaOSS/hyperdrive/blob/develop/driver/src/test/scala/za/co/absa/hyperdrive/driver/drivers/KafkaToKafkaDeduplicationAfterRetryDockerTest.scala#L73-L74

to

      "transformer.[kafka.deduplicator].source.id.columns" -> "value.record_id",
      "transformer.[kafka.deduplicator].destination.id.columns" -> "value.record_id"

the test fails with the following exception:

org.apache.spark.SparkException: Malformed records are detected in record parsing.
Caused by: org.apache.avro.AvroTypeException: Found null, expecting string

Even if this behavior is documented, it may never have been working.

主要语言
Scala
星标
47
派生
14
PR 合并指标
30 天内没有已合并 PR

环境准备

这个项目没有提供开发容器、Dockerfile 或贡献指南,环境需要你自己搭建:先看它的 README,通用步骤见我们的新手贡献指南。

从这里开始

  1. 先读完整个 Issue,再读项目的贡献指南。
  2. 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
  3. Fork 仓库,在一个分支上完成修改。
  4. 提交 Pull Request,并在描述里引用这个 Issue 编号。

AbsaOSS/hyperdrive 的其他 Issue

查看 AbsaOSS/hyperdrive 的全部 Issue

相似的 Issue

更多 Scala Issue

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。