Isolate Avro usage in parquet-cli to commands that require Avro
Los mantenedores suelen responder en 2 días
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 35/100
- Tipo de issue
- Refactorización
- Claridad
- Bastante claro
- Estado de actividad
- Tranquilo
- Stack tecnológico
- java
- Área
- cli, data-engineering
Línea de trabajo
Comienza rastreando los puntos de entrada de parquet-cli para los comandos cat, head, scan, schema, conversion y rewrite, incluido el fallback existente de GroupReadSupport. Reproduce los fallos con data/nested_lists.snappy.parquet, shredded_variant/case-001.parquet y data/int96_from_spark.parquet. El trabajo estará terminado cuando la inspección de Parquet y las reescrituras físicas utilicen rutas nativas, mientras Avro se mantenga para los flujos de trabajo de conversión y las entradas que no sean Parquet.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Motivation
parquet-cli still uses Avro as an internal row model in places where users are only trying to inspect Parquet files. Valid Parquet is not always valid Avro, so Parquet inspection should not require Parquet schemas or records to round-trip through Avro.
cat/head already has a group-reader fallback for one class of problem: Avro schema conversion failures such as invalid Avro field names. That fallback is useful, but it is still a special case. Other inspection paths, such as scan, still use the Avro-backed data path for Parquet input.
Concrete examples:
- Invalid Avro field names:
original-instructionandcolumn with known typeare valid Parquet field names but invalid Avro names. This already required acat/headgroup-reader fallback. - Nested Parquet structures:
data/nested_lists.snappy.parquetis a validparquet-testingfixture, butcatandscanfail through the Avro-backed reader. - Projection/type mismatch: UUID and INT96 Parquet columns can fail when Avro projection rewrites the requested physical type.
- Lost Parquet structure: shredded Variant and other newer logical types can have valid Parquet physical structures that Avro cannot represent without losing information.
Avro is still part of the CLI API for conversion workflows. The goal is not to remove Avro; it is to stop requiring Avro for Parquet inspection.
Proposal
Use Avro only when the command or input/output format requires it. Use Parquet-native readers and metadata APIs for Parquet inspection and physical rewrites.
| Command | Avro needed? | Proposed internal path |
|---|---|---|
help, version |
No | CLI metadata only |
meta, pages, dictionary, check-stats, column-index, column-size, footer, bloom-filter, size-stats, geospatial-stats |
No | ParquetFileReader and Parquet metadata/page/stat APIs |
prune, trans-compression, masking, rewrite |
No | Parquet rewrite utilities |
cat, head |
Only for non-Parquet inputs | Parquet -> GroupReadSupport; Avro/JSON -> Avro path |
scan |
Only for non-Parquet inputs | Parquet -> GroupReadSupport; Avro/JSON -> Avro path |
schema |
Yes by default | Keep Avro schema output; keep physical Parquet path for --parquet |
csv-schema |
Yes | Avro schema inference |
convert-csv |
Yes | CSV -> Avro records/schema -> Parquet |
convert |
Yes | Avro-backed conversion path |
to-avro |
Yes | Avro writer/schema path |
Related issues
- https://github.com/apache/parquet-java/issues/2836 / https://github.com/apache/parquet-java/pull/3332:
catfailed because Avro rejected a Parquet field name. The merged fix added a Parquet group-reader fallback. - https://github.com/apache/parquet-java/issues/2835:
headreported the same class of invalid Avro field-name failure. - https://github.com/apache/parquet-java/issues/2708:
catfailed on parquet-protobuf files with modern LIST encoding viaAvroRecordConverter. - https://github.com/apache/parquet-java/issues/1641: UUID values failed because Avro projection changed the requested physical type; skipping projection let the file read.
- https://github.com/apache/parquet-java/issues/3345: INT96 data failed through Avro requested-schema conversion.
- https://github.com/apache/parquet-java/issues/3477: Avro schema conversion dropped
typed_valuefrom shredded Variant schemas. - https://github.com/apache/parquet-java/issues/2339:
convert-csvhit Avro naming rules. This should stay in the Avro-backed conversion area, not drive Parquet inspection behavior.
Tangential: https://github.com/apache/parquet-java/issues/2657 and https://github.com/apache/parquet-java/issues/2630 show additional CLI coupling to Avro internals, but are mostly binary/API mismatch issues.
Summary
Keep Avro for Avro-facing workflows: schema default output, to-avro, convert, CSV/JSON conversion, and Avro input handling.
Use Parquet-native readers for Parquet inspection and physical rewrites. This preserves the Avro API where intentional while making parquet-cli more robust for valid Parquet files that Avro cannot model.
Appendix
Repro examples
Using parquet-mr version 1.17.1 and fixtures from apache/parquet-testing:
git clone https://github.com/apache/parquet-testing.git
cd parquet-testing
These Parquet inspection commands currently fail:
parquet cat -n 1 data/nested_lists.snappy.parquet
parquet scan data/nested_lists.snappy.parquet
parquet cat -n 1 shredded_variant/case-001.parquet
parquet scan shredded_variant/case-001.parquet
parquet cat -n 1 data/int96_from_spark.parquet
parquet scan data/int96_from_spark.parquet
Observed failure classes:
data/nested_lists.snappy.parquet: Avro schema conversion succeeds, butcatandscanfail during Avro-backed record reading withParquetDecodingException, followed byGroupColumnIO.getFirstindex failure.shredded_variant/case-001.parquet: Avro schema conversion succeeds, butcatandscanfail during Avro-backed record reading withParquetDecodingException, followed byGroupColumnIO.getLastindex failure.data/int96_from_spark.parquet: Avro schema conversion fails before reading records withArgument error: INT96 is deprecated..., blocking Parquet row inspection.
- Lenguaje dominante
- Java
- Estrellas
- 3.1k
- Forks
- 1.6k
- Merge medio
- 4 d 5 h
- PR fusionados (30 d)
- 30
Preparar el entorno
- Sin Dockerfile ni archivo de Docker Compose
- Tiene una plantilla de pull request
- Sin guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de apache/parquet-java
-
Row-group copying collides for distinct column paths with the same dot stringPosiblemente ocupada @costas-db la tomó hace 10 días. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 74/100
apache/parquet-java#3829 ·
Los mantenedores suelen responder en 2 días
-
Binary statistics truncation test ignores its configured truncation lengthPosiblemente ocupada @dhruv-15-03 la tomó hace 12 días. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
apache/parquet-java#3820 ·
Los mantenedores suelen responder en 2 días
-
Make PageReader AutoCloseableAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
apache/parquet-java#3767 ·
Los mantenedores suelen responder en 2 días
-
Remove duplicate LICENSE and NOTICE files from benchmark JARsPosiblemente ocupada @efegokdemir la tomó hace 15 días. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
apache/parquet-java#3695 · 1 comentario ·
Los mantenedores suelen responder en 2 días
-
Close input readers when ParquetRewriter setup failsPosiblemente ocupada @anxkhn la tomó hace 86 días. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
apache/parquet-java#3667 ·
Los mantenedores suelen responder en 2 días
Todos los issues de apache/parquet-java
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
NationalSecurityAgency/ghidra#9748 ·
Los mantenedores suelen responder en 1 día
-
enhancement
Dificultad 2/5 1-3 horas Aptitud para principiantes 85/100
Los mantenedores suelen responder en 1 día
-
spring-mcp-tools
Dificultad 2/5 1-3 horas Aptitud para principiantes 85/100
explyt/spring-plugin#591 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
jenkinsci/build-monitor-plugin#1367 ·
Los mantenedores suelen responder en 1 día
-
waiting-for-triage
Dificultad 1/5 Menos de una hora Aptitud para principiantes 72/100
spring-cloud/spring-cloud-openfeign#1443 ·
Los mantenedores suelen responder en 1 día