Hacktoberfest 2026:维护者为十月标记出来的 issue,仍然开放、适合新手。 浏览 Hacktoberfest issue

ADD gz decompression in parallel like pigz

未关闭
#624 0 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看

还没有人认领这个 Issue。

评估

难度
5/5
预计耗时
一周以上
新手友好度
30/100
Issue 类型
功能
描述清晰度
需要澄清
活跃度
停滞
技术栈
python

调研方向

从 issue 中描述的 ctx.read_csv 入口点开始,跟踪 .gz 输入是如何解压的。确定并行 gzip 解压适合接入的位置,以及应如何与报告的 pigz 和 read_csv 耗时进行对比测量。当所请求的 gzip CSV 读取路径提供经过验证的性能的并行解压时,即视为完成。

由索引模型根据 Issue 内容生成。

描述

enhancement

Hi,

In our case, we would like to read a big CSV file compressed in .gz format.

We would like to use the read_csv function like this:

ctx.read_csv('myfile.csv.gz',file_extension=".csv.gz", delimiter=';', has_header=True, schema_infer_max_records=0, file_compression_type='gzip')

However, this decompression is not parallel like pigz (54 seconds) compared to 800 seconds when using the read_csv function.

If you could take a look...

主要语言
Python
星标
605
派生
176
平均合并
1 天 23 小时
30 天内合并 PR
8

贡献指南

这个仓库没有索引到贡献指南

从这里开始

  1. 先读完整个 Issue,再读项目的贡献指南。
  2. 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
  3. Fork 仓库,在一个分支上完成修改。
  4. 提交 Pull Request,并在描述里引用这个 Issue 编号。

apache/datafusion-python 的其他 Issue

查看 apache/datafusion-python 的全部 Issue

相似的 Issue

更多 Python Issue

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。