vllm-project/vllm-omni

[New Model] PrismAudio (Video-to-Audio Generation)

Open

#2.140 aberto em 24 de mar. de 2026

Ver no GitHub
 (4 comments) (0 reactions) (1 assignee)Python (1.067 forks)github user discovery
good first issuehelp wantednew model

Métricas do repositório

Stars
 (4.990 stars)
Métricas de merge de PR
 (Métricas PR pendentes)

Description

Model

PrismAudio — a video-to-audio generation framework from FunAudioLLM. Generates environment sounds and sound effects synchronized with video content (e.g. footsteps, rain, metal impacts). 518M parameters, generates 9s audio in 0.63s. Published at ICLR 2026.

Architecture

Diffusion-based model with decomposed chain-of-thought reasoning. Uses four reward models (semantic, temporal, aesthetic, spatial) for multi-objective optimization via reinforcement learning (Fast-GRPO).

Key components:

  • Diffusion backbone for audio generation
  • Chain-of-thought decomposition for multi-dimensional planning (semantic, temporal, aesthetic, spatial)
  • Multi-reward RL training with Fast-GRPO for efficient optimization

Fit with vllm-omni

Single-stage diffusion pipeline, similar to Stable Audio and AudioX. Could reuse the existing diffusion infrastructure (DiffusionAttention, pipeline base classes).

References

Guia do colaborador