Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Add support for bucket expression to table scans

Abierto
#3,839 1 comentario 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
4/5
Tiempo estimado
3-5 días
Aptitud para principiantes
55/100
Tipo de issue
Nueva funcionalidad
Claridad
Bastante claro
Estado de actividad
Activo
Stack tecnológico
python
Área
databases

Línea de trabajo

Comienza por los puntos de entrada table.scan y scan.to_arrow descritos en el issue y, a continuación, sigue el procesamiento existente de expresiones de rangos temporales utilizado para la poda de particiones de Arrow. Comprueba cómo se aplican las especificaciones de partición y los filtros de filas; el trabajo estará terminado cuando las expresiones de bucket, como bucket16, puedan podar archivos cuando sea posible y recurran al filtrado de filas cuando no lo sea.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

Feature Request / Improvement

For time partitioning, we can express time range expressions and they lead to partition pruning when planning an Arrow scan:

 scan = table.scan(
      row_filter=And(
          GreaterThanOrEqual("event_ts", start),
          LessThan("event_ts", end),
      )
  )

  arrow_table = scan.to_arrow()

It would be useful to be able to filter by other hidden partitioning transforms, such as buckets -- e.g. filtering on bucket[16](user_id) in {0, 1, 2, 3}, and getting partition pruning whenever possible based on the underlying table partitioning specs (falling back to filtering rows when files cannot be pruned).

Lenguaje dominante
Python
Estrellas
1.1k
Forks
589
Merge medio
2 d 2 h
PR fusionados (30 d)
70

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de apache/iceberg-python

Todos los issues de apache/iceberg-python

Issues similares

Más issues de Python

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.