[New Model] PrismAudio (Video-to-Audio Generation)
#2.140 aberto em 24 de mar. de 2026
Métricas do repositório
- Stars
- (4.990 stars)
- Métricas de merge de PR
- (Métricas PR pendentes)
Description
Model
PrismAudio — a video-to-audio generation framework from FunAudioLLM. Generates environment sounds and sound effects synchronized with video content (e.g. footsteps, rain, metal impacts). 518M parameters, generates 9s audio in 0.63s. Published at ICLR 2026.
Architecture
Diffusion-based model with decomposed chain-of-thought reasoning. Uses four reward models (semantic, temporal, aesthetic, spatial) for multi-objective optimization via reinforcement learning (Fast-GRPO).
Key components:
- Diffusion backbone for audio generation
- Chain-of-thought decomposition for multi-dimensional planning (semantic, temporal, aesthetic, spatial)
- Multi-reward RL training with Fast-GRPO for efficient optimization
Fit with vllm-omni
Single-stage diffusion pipeline, similar to Stable Audio and AudioX. Could reuse the existing diffusion infrastructure (DiffusionAttention, pipeline base classes).
References
- Project page: https://prismaudio-project.github.io/
- Paper: arXiv:2511.18833
- HuggingFace: https://huggingface.co/FunAudioLLM/PrismAudio
- ModelScope: https://www.modelscope.cn/models/iic/PrismAudio
- Demo: https://huggingface.co/spaces/FunAudioLLM/PrismAudio