Community: 2.9x faster consumer-GPU inference (sub-realtime on RTX 4090) + two model-card findings
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 45/100
- Tipo de issue
- Documentación
- Claridad
- Bastante claro
- Estado de actividad
- Tranquilo
- Stack tecnológico
- python, pytorch
Línea de trabajo
Revisa las indicaciones de low-VRAM de la model card y la frecuencia de muestreo indicada de 32kHz comparándolas con las mediciones notificadas de la diffusers pipeline. Lee el README del repositorio para consultar los resultados de optimización documentados y los hallazgos negativos. La tarea estará terminada cuando la model card refleje correctamente las indicaciones de offload compatibles y la frecuencia de salida notificada por la pipeline, y el contexto de rendimiento esté documentado cuando corresponda.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Hi MiniMax team — first, thank you for open-weighting Music 3; it is a
remarkable model. We spent a focused engineering session getting it to run as
fast as possible on a single consumer GPU (RTX 4090, Windows, the diffusers
modular pipeline) and open-sourced the result as a local Suno-style studio:
https://github.com/TheDutchRuler/minimax-music3-studio
Measured results (20s songs, warm, seed-fixed, bf16 reference precision):
| Configuration | Per song |
|---|---|
| Reference diffusers pipeline | 50.5s (2.52x realtime) |
| Compiled AR decode (StaticCache + CUDA graphs) + batched-CFG DiT + sliced lm_head + Gumbel-max fused sampling | ~31s |
| Batched "ensemble" generation, 3 variations in one lockstep pass | 17.7s (0.88x realtime) |
The ensemble idea may interest you most: the AR stage is memory-bandwidth
bound (~23GB of weight reads per frame), so K same-prompt variations decoded
in one batch-2K pass amortize the read — the third song is nearly free. All
math stays row-independent and distribution-identical to the reference
sampler (Gumbel-max equivalence unit-tested).
Two findings you may want to reflect in the model card:
-
The low-VRAM snippet is counter-productive for the AR stage. The card
suggestsapply_group_offloading(pipe.language_model, ..., use_stream=True)
for small cards. Because the Global LLM decodes autoregressively at 25
forwards/second, per-layer offload re-streams the full 16.4GB across PCIe
every frame — we measured 10% GPU utilization and effectively no progress.
Additionally,use_stream=Truepins host memory and roughly doubled
process RSS (31-38GB) on a 61GB machine. Whole-component offload
(ComponentsManager.enable_auto_cpu_offload()alone) works well. -
Sample-rate mismatch: the card says 32kHz output, but the diffusers
pipeline reports and produces 44.1kHz (pipe.sampling_rate == 44100).
Also documented in the repo README: negative results (FP8 weight-only via
torchao measured 2.1x slower on Windows/torch 2.11; per-layer offload above)
so others don't repeat them.
This work was engineered end-to-end with Claude (Fable 5 Max) by Anthropic.
Happy to provide more detail on any measurement.
- Lenguaje dominante
- Sin datos de lenguaje
- Estrellas
- 917
- Forks
- 85
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Preparar el entorno
Este proyecto no incluye contenedor de desarrollo, Dockerfile ni guía de contribución, así que la configuración corre por tu cuenta: empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de MiniMax-AI/MiniMax-Music3
-
Instrumental ExamplesAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
MiniMax-AI/MiniMax-Music3#4 · 1 reacción ·
-
Music Caption from existing songAbierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Long-form instrumental collapse into radio/station-surfing montage + hallucinated lyrics (~10–20s)Abierto
Dificultad 4/5 3-5 días Aptitud para principiantes 45/100
MiniMax-AI/MiniMax-Music3#7 · 1 comentario · 1 reacción ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
Todos los issues de MiniMax-AI/MiniMax-Music3
Issues similares
-
Provide a docinit functionaliyAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
-
documentation
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
inu-appcenter/memorIN-frontend#106 ·
Los mantenedores suelen responder en 1 día
-
workflow: a tick's dispatch counts as 'only this step', and no review self-grants a round unattendedAbiertoworkflow
Dificultad 2/5 1-3 horas Aptitud para principiantes 85/100
kristofdegrave/homeassistant-smart-charging#1505 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
openfoodfacts/score-my-recipe#80 ·
Los mantenedores suelen responder en 2 días
-
documentation
Dificultad 1/5 Menos de una hora Aptitud para principiantes 92/100
githubnext/gh-aw-workshop#3968 ·
Los mantenedores suelen responder en 1 día