[Proposal] 探讨对 Diffusion Language Model 的支持
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 35/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Bastante claro
- Estado de actividad
- Activo
- Stack tecnológico
- python
- Área
- machine-learning
Línea de trabajo
No se nombran archivos ni pruebas específicos. Primero revisa las abstracciones existentes de pipeline y scheduler; después, investiga LLaDA como el modelo representativo propuesto y confirma el alcance y la arquitectura con los maintainers; se considera terminado cuando exista un plan de integración o un prototipo aceptado, solo para inferencia, con un ejemplo mínimo y documentación.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
背景
DiffSynth-Studio 目前已经支持图像、视频和音频等多种 Diffusion 模型。近年来也出现了一类基于离散 token 去噪或 masked diffusion 的语言模型(Diffusion Language Model / Diffusion LLM),其生成过程与现有连续 latent diffusion 有一定共性,但也需要独立的 token corruption、noise schedule 和迭代解码逻辑。
我在仓库现有 Issue 和 PR 中暂未找到相同方向的讨论,因此想先确认该方向是否符合 DiffSynth-Studio 的长期定位,再考虑实现。
建议的最小范围
建议第一阶段只选择一个权重和推理代码公开的代表模型,例如 LLaDA 系列,并且仅支持推理:
- 增加独立的 TextDiffusionPipeline,或采用维护者建议的其他抽象
- 支持 tokenizer、mask/noise schedule 和迭代去噪解码
- 尽可能复用现有的模型加载、dtype、量化、CPU offload 和显存管理能力
- 提供一个最小推理示例和对应文档
第一阶段暂不包含:
- 训练或微调
- 多机多卡训练
- 同时适配多个 Diffusion LLM
- 对不同离散扩散算法建立完整统一抽象
希望确认的问题
- 文本离散扩散模型是否属于 DiffSynth-Studio 希望探索和支持的范围?
- 如果方向可行,维护者是否接受新增独立的 TextDiffusionPipeline 和文本 scheduler?
- 是否有更适合作为首个原型的模型或代码组织建议?
- 第一阶段仅提供 inference-only 的最小集成是否可以接受?
如果该方向得到认可,我可以先调研一个代表模型,并尝试提交最小推理原型 PR。
- Lenguaje dominante
- Python
- Estrellas
- 13.1k
- Forks
- 1.3k
- Merge medio
- 12 h 53 min
- PR fusionados (30 d)
- 42
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de modelscope/DiffSynth-Studio
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
modelscope/DiffSynth-Studio#1707 · 1 comentario ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 90/100
modelscope/DiffSynth-Studio#1702 ·
-
Dificultad 1/5 1-3 horas Aptitud para principiantes 78/100
modelscope/DiffSynth-Studio#1668 ·
-
bfloat16训练时段错误: 数组越界的一种方案 Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
modelscope/DiffSynth-Studio#1499 · 1 comentario ·
-
Latest update broke Wan2.2 S2V Abierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 78/100
modelscope/DiffSynth-Studio#1373 · 5 comentarios · 1 reacción ·
Todos los issues de modelscope/DiffSynth-Studio
Issues similares
-
agent-ready documentation needs-triage
Dificultad 1/5 1-3 horas Aptitud para principiantes 88/100
-
documentation
Dificultad 1/5 Menos de una hora Aptitud para principiantes 91/100
-
workflow-status page template still says reusable workflows are "triggered only by workflow_call:" Abierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 92/100
-
Add https://search.jeremyh.xyz/ Abiertoinstance instance add
Dificultad 1/5 Menos de una hora Aptitud para principiantes 72/100
searxng/searx-instances#939 · 1 comentario ·
-
area-deployment area-integrations triage:bot-seen
Dificultad 2/5 Medio día Aptitud para principiantes 86/100