Support optional Parquet page index writes
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 2/5
- Tiempo estimado
- 1-3 horas
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Bien especificado
- Estado de actividad
- Estancado
- Stack tecnológico
- python
- Área
- data-engineering
Línea de trabajo
Comienza revisando PR #3829 y, después, inspecciona _get_parquet_writer_kwargs, mkdocs/docs/configuration.md y las pruebas unitarias y de integración mencionadas. Se considera terminado cuando la propiedad opt-in sigue siendo false de forma predeterminada, habilita la escritura del índice de páginas de PyArrow cuando es true y las pruebas documentadas pasan.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Feature Request / Improvement
PyIceberg doesn't expose Parquet page index writing, even though PyArrow supports it with ParquetWriter(write_page_index=True).
Use case / motivation
Page indexes let readers such as ClickHouse skip non-matching pages during predicate evaluation, avoiding decoding work for selective queries. Tables written by PyIceberg currently lack these indexes, so page-level pruning is not possible regardless of reader support.
Proposed change
Add an opt-in write.parquet.page-index-enabled table property, default false, to preserve current output and file sizes. When enabled, PyIceberg passes write_page_index=True to PyArrow's ParquetWriter.
Implementation
PR #3829 adds the table property, threads it through _get_parquet_writer_kwargs, documents it in mkdocs/docs/configuration.md, and includes unit and integration test coverage.
Tooling note
I developed this with assistance from DS v4 Pro and reviewed the changes myself.
References
- #3829
- Lenguaje dominante
- Python
- Estrellas
- 1.1k
- Forks
- 589
- Merge medio
- 1 d 20 h
- PR fusionados (30 d)
- 68
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de apache/iceberg-python
-
kind:bug
Dificultad 1/5 Menos de una hora Aptitud para principiantes 92/100
apache/iceberg-python#4006 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
apache/iceberg-python#3996 ·
-
Deletion vector bitmap count is read from the blob and used as a loop bound without validation Abiertobug
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
apache/iceberg-python#3979 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
apache/iceberg-python#3885 ·
-
[Bug] PyArrowFileIO fails to propagate s3.ssl.ca-cert to pyarrow.fs.S3FileSystem tls_ca_file_path Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
apache/iceberg-python#3866 · 1 comentario ·
Todos los issues de apache/iceberg-python
Issues similares
-
bug confirmed issue
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
open-webui/open-webui#30750 · 1 comentario ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
enhancement
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
OpenwaterHealth/openmotion-bloodflow-app#604 · 1 comentario ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
-
good first issue
Dificultad 1/5 Menos de una hora Aptitud para principiantes 90/100