Request: release the audio tokenizer encoder (audio → RVQ tokens) to enable fine-tuning
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 25/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Attiva
- Ambito
- machine-learning
Direzione di ricerca
Inizia esaminando gli artefatti di release e la documentazione del repository, incluso dav.pth, e verifica quali componenti del tokenizer RVQ sono presenti. Il lavoro sarebbe completato con l'encoder del tokenizer audio a 8 livelli insieme al codice di preprocessing, oppure con la configurazione di training del tokenizer necessaria per una reimplementazione fedele.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Thank you for the open-weights release — the quality and the architecture write-up are both impressive.
The release currently ships only the decode-side components: the Global/Local LLMs, RVQ depth decoder, flow-matching module, Flow-VAE/vocoder (and dav.pth, which does include its codec encoder). However, the 8-layer RVQ music tokenizer's encoder — the component that maps a waveform to the semantic (layer-1) and acoustic (layers 2–8) token sequences — does not appear to be included.
Without it, fine-tuning the Global LLM is not possible, because there is no way to produce target semantic-token sequences from one's own audio data. Our use case is research on melody/harmony-conditioned generation: fine-tuning the Global LLM on paired symbolic+audio data while keeping the entire synthesis stack frozen.
Questions:
- Are there plans to release the tokenizer encoder weights (and preprocessing code), similar to how other open music/speech releases have shipped their codecs?
- If not, could you share the tokenizer's training configuration so the community can attempt a faithful reimplementation?
Thanks again for pushing open music generation forward.
- Lingua principale
- Nessun dato sulla lingua
- Stelle
- 896
- Fork
- 84
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Preparare l'ambiente
Non abbiamo ancora controllato i file di configurazione di questo progetto. Parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di MiniMax-AI/MiniMax-Music3
-
Instrumental ExamplesAperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 68/100
MiniMax-AI/MiniMax-Music3#4 · 1 reazione ·
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
-
Long-form instrumental collapse into radio/station-surfing montage + hallucinated lyrics (~10–20s)Aperta
Difficoltà 4/5 3-5 giorni Idoneità per principianti 45/100
MiniMax-AI/MiniMax-Music3#7 · 1 commento · 1 reazione ·
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
Tutte le issue di MiniMax-AI/MiniMax-Music3
Issue simili
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
vllm-project/vllm-metal#822 ·
I maintainer di solito rispondono entro 1 giorno
-
CPU `∇maxpool` sends the gradient to a non-maximal element when another is within `≈` of the maxAperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 85/100
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 84/100
stanfordnlp/dspy#10503 ·
I maintainer di solito rispondono entro 1 giorno
-
bug_feature_triaged
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 76/100