scalability of geometry encoding
Ya se ha fusionado un pull request relacionado.
- #535 de @dcherian — fusionado
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 35/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- python
- Área
- data, performance
Línea de trabajo
Start by reproducing the benchmark around xvec.encode_cf with the provided GeoPandas and xarray setup, comparing encoding and decoding times as dataset size grows. Investigate the geometry encoding path and the suggested WKB/GeoParquet alternative; done means documenting or demonstrating a measurable scalability improvement for the full dataset.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
I've been playing with encoding larger datasets using the cf-xarray geometry approach. Here's some code
import geopandas as gp
import xvec
import xarray as xr
url = (
"s3://overturemaps-us-west-2/release/2024-08-20.0/theme=buildings/type=building/"
"part-00000-2ad9544f-1d68-4a5a-805c-7a5d020d084d-c000.zstd.parquet"
)
# ~ 30s
df = gp.read_parquet(url, columns=['id', 'geometry', 'level'])
# 11447790 rows
# all very fast
ds = xr.Dataset(df).set_coords("geometry").swap_dims({"dim_0": "geometry"}).drop_vars("dim_0")
ds = ds.xvec.set_geom_indexes('geometry', crs=df.crs)
# encode only 100_000 rows
%time ds_enc = ds.isel(geometry=slice(0, 100_000)).xvec.encode_cf()
# -> Wall time: 4.25 s
I confirmed that the scaling is roughly linear. At this rate, it will take > 500 seconds to encode the whole dataset. Decoding is about 20x faster.
I'm wondering if there are some low-hanging fruit that can be found to optimize this.
Alternatively, we could explore storing geometries as WKB, as geoparquet does.
- Lenguaje dominante
- Python
- Estrellas
- 181
- Forks
- 51
- Merge medio
- 6 h 39 min
- PR fusionados (30 d)
- 1
Preparar el entorno
Este proyecto no incluye contenedor de desarrollo, Dockerfile ni guía de contribución, así que la configuración corre por tu cuenta: empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de xarray-contrib/cf-xarray
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
xarray-contrib/cf-xarray#623 ·
-
Consider adding opt-in support for circular axes when calling `bounds_to_vertices` (related to #594)Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 38/100
xarray-contrib/cf-xarray#596 · 1 comentario ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 25/100
xarray-contrib/cf-xarray#570 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 15/100
xarray-contrib/cf-xarray#568 ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 35/100
xarray-contrib/cf-xarray#566 · 2 comentarios ·
Todos los issues de xarray-contrib/cf-xarray
Issues similares
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
awslabs/visual-asset-management-system#414 ·
Los mantenedores suelen responder en 1 día
-
bug v1 v2
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
modelcontextprotocol/python-sdk#3670 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
aicell-lab/bioengine#232 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 74/100
modelscope/evalscope#1836 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 62/100