Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Request: release the audio tokenizer encoder (audio → RVQ tokens) to enable fine-tuning

Abierto
#3 1 comentario 8 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
5/5
Tiempo estimado
Más de una semana
Aptitud para principiantes
25/100
Tipo de issue
Nueva funcionalidad
Claridad
Necesita aclaración
Estado de actividad
Activo

Línea de trabajo

Comienza revisando los artefactos de release y la documentación del repositorio, incluido dav.pth, y verifica qué componentes del tokenizer RVQ están presentes. Se consideraría completado si se dispone del encoder del tokenizer de audio de 8 capas con el código de preprocesamiento, o de la configuración de entrenamiento del tokenizer necesaria para una reimplementación fiel.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

Thank you for the open-weights release — the quality and the architecture write-up are both impressive.

The release currently ships only the decode-side components: the Global/Local LLMs, RVQ depth decoder, flow-matching module, Flow-VAE/vocoder (and dav.pth, which does include its codec encoder). However, the 8-layer RVQ music tokenizer's encoder — the component that maps a waveform to the semantic (layer-1) and acoustic (layers 2–8) token sequences — does not appear to be included.

Without it, fine-tuning the Global LLM is not possible, because there is no way to produce target semantic-token sequences from one's own audio data. Our use case is research on melody/harmony-conditioned generation: fine-tuning the Global LLM on paired symbolic+audio data while keeping the entire synthesis stack frozen.

Questions:

  1. Are there plans to release the tokenizer encoder weights (and preprocessing code), similar to how other open music/speech releases have shipped their codecs?
  2. If not, could you share the tokenizer's training configuration so the community can attempt a faithful reimplementation?

Thanks again for pushing open music generation forward.

Lenguaje dominante
Sin datos de lenguaje
Estrellas
896
Forks
84
Métricas de merge de PR
Sin PR fusionados en 30 d

Preparar el entorno

Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de MiniMax-AI/MiniMax-Music3

Todos los issues de MiniMax-AI/MiniMax-Music3

Issues similares

Más issues de Machine Learning

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.