Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Upsert gets slow on tables with many columns

Abierto
#3,860 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
3/5
Tiempo estimado
1-2 días
Aptitud para principiantes
68/100
Tipo de issue
Nueva funcionalidad
Claridad
Bastante claro
Estado de actividad
Activo
Stack tecnológico
python

Línea de trabajo

Comienza con pyiceberg.table.upsert_util.get_rows_to_update y ejecuta la reproducción proporcionada de PyArrow con 20,000 filas y 200 columnas. Compara el comportamiento actual en tablas sin cambios y rastrea dónde se comparan las filas coincidentes; se considera terminado cuando la comparación de un upsert sin cambios evita la ralentización dependiente del número de columnas notificada y conserva las filas esperadas para actualizar.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

Feature Request / Improvement

upsert compares the matched rows one cell at a time, so it gets slower with every extra column, not just with every extra row.

On a table with 200 columns, comparing 20k matched rows takes around 20 seconds on my machine, before anything is written.

To reproduce:

import time
import pyarrow as pa
from pyiceberg.table.upsert_util import get_rows_to_update

rows, cols = 20_000, 200
table = pa.table({"pk": pa.array(range(rows)), **{f"c{i}": pa.array([float(i)] * rows) for i in range(cols)}})

start = time.monotonic()
get_rows_to_update(table, table, ["pk"])  # nothing has changed
print(time.monotonic() - start)
Lenguaje dominante
Python
Estrellas
1.1k
Forks
589
Merge medio
1 d 20 h
PR fusionados (30 d)
68

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de apache/iceberg-python

Todos los issues de apache/iceberg-python

Issues similares

Más issues de Python

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.