Add support for Parquet Input Stream optimisations.
Los mantenedores suelen responder en 2 días
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 35/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Necesita aclaración
- Estado de actividad
- Tranquilo
- Stack tecnológico
- java
- Área
- data-engineering, performance
Línea de trabajo
Empieza leyendo el documento «Parquet Java Input Stream Optimisations» y el documento «Analytics Accelerator for S3» enlazados en el issue. Después, define el alcance del módulo parquet-io propuesto en torno a las lecturas vectorizadas, las lecturas del final y de archivos pequeños, el acceso al índice de páginas y el prefetching secuencial. Se considerará completado cuando exista un plan de implementación acordado y se proporcione soporte para las optimizaciones enumeradas.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
This issue tracks adding of a new module [parquet-io] with the goal of adding IO optimisations to the parquet-java repository.
The goal is to have a single place where the following optimisations can be implemented:
- Vectored Reads
- Reading the tail of a file in one request rather than multiple small requests (Avoid the parquet footer dance, multiple requests for the pageIndex)
- Small Parquet files are read in a single request
- Sequential prefetching
Parquet Java Input Stream Optimisations: Doc explains the features this will implement.
Analytics Accelerator for S3: Doc explains IO optimisations made in the analytics accelerator library.
- Lenguaje dominante
- Java
- Estrellas
- 3.1k
- Forks
- 1.6k
- Merge medio
- 4 d 5 h
- PR fusionados (30 d)
- 30
Preparar el entorno
- Sin Dockerfile ni archivo de Docker Compose
- Tiene una plantilla de pull request
- Sin guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de apache/parquet-java
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 74/100
apache/parquet-java#3829 ·
Los mantenedores suelen responder en 2 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
apache/parquet-java#3820 ·
Los mantenedores suelen responder en 2 días
-
Make PageReader AutoCloseableAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
apache/parquet-java#3767 ·
Los mantenedores suelen responder en 2 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
apache/parquet-java#3695 · 1 comentario ·
Los mantenedores suelen responder en 2 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
apache/parquet-java#3667 ·
Los mantenedores suelen responder en 2 días
Todos los issues de apache/parquet-java
Issues similares
-
Update license yearAbierto0 - Backlog 1 - Ready documentation good first issue help wanted
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
-
cbor
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
FasterXML/jackson-dataformats-binary#844 ·
Los mantenedores suelen responder en 1 día
-
improvement
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
apache/iceberg#18351 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
bug good first issue
Dificultad 2/5 1-3 horas Aptitud para principiantes 90/100
repowise-dev/repowise#2945 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
Interpolating settings.xml can lead to malformed XML when variable value contains double-hyphenAbiertobug
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
apache/maven#13321 · 1 comentario ·
Los mantenedores suelen responder en 1 día