Request: release the audio tokenizer encoder (audio → RVQ tokens) to enable fine-tuning
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Necesita aclaración
- Estado de actividad
- Activo
- Área
- machine-learning
Línea de trabajo
Comienza revisando los artefactos de release y la documentación del repositorio, incluido dav.pth, y verifica qué componentes del tokenizer RVQ están presentes. Se consideraría completado si se dispone del encoder del tokenizer de audio de 8 capas con el código de preprocesamiento, o de la configuración de entrenamiento del tokenizer necesaria para una reimplementación fiel.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Thank you for the open-weights release — the quality and the architecture write-up are both impressive.
The release currently ships only the decode-side components: the Global/Local LLMs, RVQ depth decoder, flow-matching module, Flow-VAE/vocoder (and dav.pth, which does include its codec encoder). However, the 8-layer RVQ music tokenizer's encoder — the component that maps a waveform to the semantic (layer-1) and acoustic (layers 2–8) token sequences — does not appear to be included.
Without it, fine-tuning the Global LLM is not possible, because there is no way to produce target semantic-token sequences from one's own audio data. Our use case is research on melody/harmony-conditioned generation: fine-tuning the Global LLM on paired symbolic+audio data while keeping the entire synthesis stack frozen.
Questions:
- Are there plans to release the tokenizer encoder weights (and preprocessing code), similar to how other open music/speech releases have shipped their codecs?
- If not, could you share the tokenizer's training configuration so the community can attempt a faithful reimplementation?
Thanks again for pushing open music generation forward.
- Lenguaje dominante
- Sin datos de lenguaje
- Estrellas
- 896
- Forks
- 84
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Preparar el entorno
Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de MiniMax-AI/MiniMax-Music3
-
Instrumental ExamplesAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
MiniMax-AI/MiniMax-Music3#4 · 1 reacción ·
-
Music Caption from existing songAbierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Long-form instrumental collapse into radio/station-surfing montage + hallucinated lyrics (~10–20s)Abierto
Dificultad 4/5 3-5 días Aptitud para principiantes 45/100
MiniMax-AI/MiniMax-Music3#7 · 1 comentario · 1 reacción ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
Todos los issues de MiniMax-AI/MiniMax-Music3
Issues similares
-
Dificultad 2/5 Medio día Aptitud para principiantes 88/100
deepset-ai/haystack#12978 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
openvinotoolkit/openvino_notebooks#3663 ·
Los mantenedores suelen responder en 1 día
-
Bug in GaussianTailProbabilityCalibrator: running_statistics=False still uses a windowed varianceAbiertobug good first issue
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
selimfirat/pysad#107 ·
Los mantenedores suelen responder en 1 día
-
bug ci-failure high priority
Dificultad 1/5 Menos de una hora Aptitud para principiantes 88/100
vllm-project/vllm-omni#8194 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
sktime/sktime#11310 · 1 comentario ·
Los mantenedores suelen responder en 1 día