[Feature] Speed up range-based reading of DataSplit data in AI training scenarios

Abierto
#9,668 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
4/5
Tiempo estimado
3-5 días
Aptitud para principiantes
48/100
Tipo de issue
Nueva funcionalidad
Claridad
Bastante claro
Estado de actividad
Activo
Stack tecnológico
java

Línea de trabajo

Empieza localizando la interfaz TableRead y su implementación existente de createReader; después, sigue Split, RecordReader y el comportamiento de omisión de filas para datos append y DE. Revisa cómo se accede a la información del footer de Parquet y cómo las tablas con clave primaria leen rangos. Se considera terminado cuando la nueva RowRange API acelera los formatos compatibles y conserva el fallback original basado en números de fila cuando no es compatible.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

enhancement
Search before asking
  • I searched in the issues and found nothing similar.
Motivation

For AI training scenarios, it is necessary to read all data from a sample table in either append or DE format for training. The training process reads data sequentially in batches according to the training layer's batch size. If an original Parquet file contains many rows, each batch only reads a specific range of rows within it. Under the current interface, users can only skip unwanted rows one by one, which is a significant waste.

Solution

We can utilize the Parquet footer information to directly filter out unnecessary page data. Therefore, we propose adding a new method to the TableRead interface:
RecordReader<InternalRow> createReader(Split split, RowRange rowRange) throws IOException;

Here, RowRange describes the row range for this split, e.g., [300, 500], allowing Paimon to accelerate the read process based on the underlying data format. If the underlying storage cannot support this optimization (e.g., primary key tables), it should fall back to the original naive implementation that skips rows based on row numbers.

Anything else?

No response

Are you willing to submit a PR?
  • I'm willing to submit a PR!
Lenguaje dominante
Java
Estrellas
3.4k
Forks
1.4k
Merge medio
1 d 14 h
PR fusionados (30 d)
468

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de apache/paimon

Todos los issues de apache/paimon

Issues similares

Más issues de Java

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.