Hacktoberfest 2026: le issue che i maintainer hanno segnato per ottobre, aperte e adatte ai principianti. Sfoglia le issue Hacktoberfest

Request: release the audio tokenizer encoder (audio → RVQ tokens) to enable fine-tuning

Aperta
#3 1 commento 8 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

Valutazione

Difficoltà
5/5
Tempo stimato
Più di una settimana
Idoneità per principianti
25/100
Tipo di issue
Funzionalità
Chiarezza
Da chiarire
Stato di attività
Attiva

Direzione di ricerca

Inizia esaminando gli artefatti di release e la documentazione del repository, incluso dav.pth, e verifica quali componenti del tokenizer RVQ sono presenti. Il lavoro sarebbe completato con l'encoder del tokenizer audio a 8 livelli insieme al codice di preprocessing, oppure con la configurazione di training del tokenizer necessaria per una reimplementazione fedele.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Descrizione

Thank you for the open-weights release — the quality and the architecture write-up are both impressive.

The release currently ships only the decode-side components: the Global/Local LLMs, RVQ depth decoder, flow-matching module, Flow-VAE/vocoder (and dav.pth, which does include its codec encoder). However, the 8-layer RVQ music tokenizer's encoder — the component that maps a waveform to the semantic (layer-1) and acoustic (layers 2–8) token sequences — does not appear to be included.

Without it, fine-tuning the Global LLM is not possible, because there is no way to produce target semantic-token sequences from one's own audio data. Our use case is research on melody/harmony-conditioned generation: fine-tuning the Global LLM on paired symbolic+audio data while keeping the entire synthesis stack frozen.

Questions:

  1. Are there plans to release the tokenizer encoder weights (and preprocessing code), similar to how other open music/speech releases have shipped their codecs?
  2. If not, could you share the tokenizer's training configuration so the community can attempt a faithful reimplementation?

Thanks again for pushing open music generation forward.

Lingua principale
Nessun dato sulla lingua
Stelle
896
Fork
84
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Preparare l'ambiente

Non abbiamo ancora controllato i file di configurazione di questo progetto. Parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Altre issue di MiniMax-AI/MiniMax-Music3

Tutte le issue di MiniMax-AI/MiniMax-Music3

Issue simili

Altre issue su Machine Learning

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.