Provide an efficient way to decompress a sequence of chunks compressed with ZstdCompressionChunker
Los mantenedores suelen responder en 2 días
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 35/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Bastante claro
- Estado de actividad
- Estancado
- Área
- api, performance
Línea de trabajo
Comienza revisando ZstdCompressionChunker, ZstdDecompressor.read_to_iter y el reproductor reducido de memoryview incluido en el issue. Determina si una API compatible existente puede procesar chunks comprimidos de forma incremental; de lo contrario, define un enfoque eficiente de chunk a chunk que evite concatenar la entrada o la salida y que no provoque un segfault, y añade cobertura para el comportamiento informado.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
My program wants to compress some large cached strings and decompress them later. I have no particular requirements on the form of the compressed data, so I used ZstdCompressionChunker to do the compression to avoid repeated reallocation of the output buffer. I would like to process the decompressed data in chunks to reduce peak memory usage. However there is no obvious efficient way to decompress chunks to chunks:
-
The ZstdCompressionChunker round-trip tests all concatenate the chunks with
bytes.joinfor one-shot decompression. (Fine, they're tests.) -
I tried
chain.from_iterable(dctx.read_to_iter(c) for c in chunks). This doesn't work because eachread_to_iteriterator expects to process a full stream. (I expected it to hold state in the ZstdDecompressor it was obtained from.) -
ZstdCompressionObj's documentation says it isn't efficient:
Because calls to decompress() may need to perform multiple memory (re)allocations, this streaming decompression API isn’t as efficient as other APIs.
-
read_to_iter's documentation saysread_to_iter() accepts an object with a read(size) method that will return compressed bytes or an object conforming to the buffer protocol.
so I wrote a class with a read method that returns memoryviews over the chunks (to avoid copying slices). The documentation is grammatically ambiguous; it turns out that
read_to_itersegfaults (!) when given an object with a read method that returns an object conforming to the buffer protocol that is not exactlybytes(reduced test case below).
My feature request is to provide an efficient way to decompress a sequence of chunks compressed with ZstdCompressionChunker (or to document an existing method as the efficient way, if there is one).
import zstandard as zstd
b = b'AB' * 1000
d = zstd.compress(b)
assert zstd.decompress(memoryview(d)) == b # passes
class Whatever:
def __init__(self, data):
self.data = data
def read(self, size):
assert len(data) <= size
return memoryview(self.data)
dctx = zstd.ZstdDecompressor()
assert b''.join(dctx.read_to_iter(Whatever(d))) == b # segfault
Segfaults using Arch Linux's python 3.13.2-1 and python-zstandard 0.23.0-2.
- Lenguaje dominante
- C
- Estrellas
- 641
- Forks
- 117
- Merge medio
- 1 d 14 h
- PR fusionados (30 d)
- 5
Preparar el entorno
- Sin Dockerfile ni archivo de Docker Compose
- Sin plantilla de pull request
- Leer la guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de indygreg/python-zstandard
-
`multi_decompress_to_buffer([])` terminates the process with SIGFPEPosiblemente ocupada @mikamikasuki la tomó hace 6 días. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
indygreg/python-zstandard#335 ·
Los mantenedores suelen responder en 2 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
indygreg/python-zstandard#295 ·
Los mantenedores suelen responder en 2 días
-
Dificultad 3/5 1-2 días Aptitud para principiantes 64/100
indygreg/python-zstandard#345 ·
Los mantenedores suelen responder en 2 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 55/100
indygreg/python-zstandard#334 ·
Los mantenedores suelen responder en 2 días
-
Dificultad 3/5 1-2 días Aptitud para principiantes 54/100
indygreg/python-zstandard#333 ·
Los mantenedores suelen responder en 2 días
Todos los issues de indygreg/python-zstandard
Issues similares
-
rc_runtime_activate_richpresence leaves a half-initialised entry when the buffer allocation failsAbierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 88/100
RetroAchievements/rcheevos#558 ·
-
good first issue priority:low type:docs
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
crazy-goat/php-fpm-ng#920 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 74/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
libsdl-org/SDL#16464 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100