[Tracking] Complete audio task coverage across CPU, GPU, and NPU backends
I maintainer di solito rispondono entro 1 giorno
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 20/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Attiva
- Stack tecnologico
- python
- Ambito
- embedded-iot, machine-learning
Direzione di ricerca
Review the existing audio examples and issue #23131 first, then use the MLX-Audio references to choose one task from the priority list. Validate the selected model across CPU, GPU, and NPU backends, comparing quality and performance. Done means the task is covered with backend gaps and measured results recorded.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Make ExecuTorch the go-to place for common audio tasks across CPU, GPU, and NPU backends. Prioritize task coverage, current model quality, MLX-Audio support, and Hugging Face adoption.
Implementation priority below. Evaluation candidates are conditional on a measured benefit over the selected model or existing examples.
- Qwen3-ASR 0.6B — multilingual transcription; evaluate 1.7B.
- Qwen3-ForcedAligner 0.6B — word-level alignment and timestamps.
- Qwen3-TTS — CustomVoice 0.6B, Base voice cloning, then 1.7B VoiceDesign.
- Nemotron 3.5 ASR streaming 0.6B — live transcription.
- Smart Turn v3 — conversational end-of-turn detection.
- Nemotron 3 Diarization — speaker diarization; extend backend coverage (#23131).
- Parakeet / Whisper — transcription and translation; extend existing examples.
- Silero VAD — speech activity detection; extend backend coverage.
- Supertonic 3 — lightweight TTS; extend backend coverage.
- Voxtral / Voxtral Realtime / Voxtral TTS — audio understanding, live ASR, and TTS; extend existing examples.
- LFM2.5-Audio 1.5B — speech-to-speech interaction.
- DeepFilterNet3 — speech enhancement and denoising.
- SAM-Audio — prompted sound extraction.
- DialogueSidon — overlapping speaker separation.
- Mel-Band-RoFormer — vocal/instrumental separation.
- MOSS-Music — music understanding and lyrics transcription.
- MiniMax Music 3 — music and song generation.
- VoxCPM2 — evaluate additional voice-cloning/design quality and control.
- Granite Speech 5.0 470M TurboCTC — evaluate compact English ASR.
- Canary v2 — evaluate uncovered speech-translation needs.
- VibeVoice-ASR Streaming — evaluate joint transcription/diarization beyond composed pipelines.
- MossFormer2 SE — evaluate enhancement quality beyond DeepFilterNet3.
Use available MLX-Audio references for initial comparisons, then validate across CPU, GPU, and NPU backends and track quality, performance, and backend gaps.
cc @iseeyuan @lucylq @helunwencser @tarun292 @kimishpatel @jackzhxng @metascroy
- Lingua principale
- Python
- Stelle
- 5k
- Fork
- 1.2k
- Merge medio
- 2g 9h
- PR unite (30g)
- 555
Preparare l'ambiente
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di pytorch/executorch
-
enhancement triaged
Difficoltà 2/5 Mezza giornata Idoneità per principianti 68/100
pytorch/executorch#21640 ·
I maintainer di solito rispondono entro 1 giorno
-
Qualcomm: 8-bit per-channel weight scales are floored at the 16-bit eps, and the HTP miscomputes near-zero channelsForse già presa @psiddh l’ha presa 1 giorno fa. Apertamodule: qnn partner: qualcomm
pytorch/executorch#23160 · 1 commento · 1 assegnatario ·
I maintainer di solito rispondono entro 1 giorno
-
[cpu kernels] native_layer_norm: layer_norm_scalar returns NaN on large-mean rows; Half/BF16 at N>=256 slow after #23153Forse già presa @JakeStevens l’ha presa 1 giorno fa. Apertamodule: kernels
pytorch/executorch#23159 · 2 commenti · 1 assegnatario ·
I maintainer di solito rispondono entro 1 giorno
-
module: vulkan
Difficoltà 3/5 1-2 giorni Idoneità per principianti 66/100
pytorch/executorch#23158 ·
I maintainer di solito rispondono entro 1 giorno
-
[Vulkan] Missing/partial op support blocks full delegation of a dynamic-shape transformer encoderApertamodule: vulkan
Difficoltà 5/5 Più di una settimana Idoneità per principianti 35/100
pytorch/executorch#23156 ·
I maintainer di solito rispondono entro 1 giorno
Tutte le issue di pytorch/executorch
Issue simili
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
solana-foundation/pay-kit#341 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
nasa/python_cmr#123 ·
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 92/100
EleutherAI/lm-evaluation-harness#4243 ·
I maintainer di solito rispondono entro 1 giorno
-
area: dashboard bug perceived difficulty: 3
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
Nitjsefnie-Harness-Commons/daedalus#1179 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
cusp-ai-oss/tojax#17 ·