Hacktoberfest 2026 : les issues que les mainteneurs ont marquées pour octobre, ouvertes et accessibles aux débutants. Parcourir les issues Hacktoberfest

Add support for bucket expression to table scans

Ouverte
#3,839 1 commentaire 0 réactions 0 personnes assignées Voir sur GitHub

Les mainteneurs répondent en général sous 1 jour

@dgvj-work y travaille déjà.

Depuis le 28/8/2026.

Évaluation

Difficulté
4/5
Temps estimé
3-5 jours
Accessibilité débutants
55/100
Type d'issue
Fonctionnalité
Clarté
Plutôt claire
Activité
Active
Stack technique
python
Domaine
databases

Piste de recherche

Commencez par les points d’entrée table.scan et scan.to_arrow décrits dans l’issue, puis suivez la gestion existante des expressions de plages temporelles utilisée pour l’élagage des partitions Arrow. Vérifiez comment les spécifications de partition et les filtres de lignes sont appliqués ; le travail est terminé lorsque les expressions de bucket telles que bucket16 peuvent élaguer les fichiers lorsque c’est possible et revenir au filtrage des lignes lorsque ce ne l’est pas.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Description

Feature Request / Improvement

For time partitioning, we can express time range expressions and they lead to partition pruning when planning an Arrow scan:

 scan = table.scan(
      row_filter=And(
          GreaterThanOrEqual("event_ts", start),
          LessThan("event_ts", end),
      )
  )

  arrow_table = scan.to_arrow()

It would be useful to be able to filter by other hidden partitioning transforms, such as buckets -- e.g. filtering on bucket[16](user_id) in {0, 1, 2, 3}, and getting partition pruning whenever possible based on the underlying table partitioning specs (falling back to filtering rows when files cannot be pruned).

Langage dominant
Python
Étoiles
1.1k
Forks
606
Merge moyen
1 j 11 h
PR mergées (30 j)
76

Préparer son environnement

  • Aucun Dockerfile ni fichier Docker Compose
  • Propose un modèle de pull request
  • Aucun guide de contribution

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Autres issues de apache/iceberg-python

Toutes les issues de apache/iceberg-python

Issues similaires

Plus d'issues Python

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.