[Proposal] 探讨对 Diffusion Language Model 的支持
Maintainer thường phản hồi trong vòng 2 ngày
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 5/5
- Thời gian dự kiến
- Hơn một tuần
- Mức phù hợp với người mới
- 35/100
- Loại issue
- Tính năng
- Độ rõ ràng
- Khá rõ ràng
- Mức độ hoạt động
- Sôi nổi
- Công nghệ
- python
- Lĩnh vực
- machine-learning
Hướng nghiên cứu
Không có tệp hoặc bài kiểm thử cụ thể nào được nêu. Trước tiên, hãy xem xét các abstraction hiện có của pipeline và scheduler, sau đó tìm hiểu LLaDA với vai trò là mô hình đại diện được đề xuất và xác nhận phạm vi cũng như kiến trúc với các maintainer; công việc được xem là hoàn thành khi có một kế hoạch tích hợp hoặc prototype chỉ dành cho inference được chấp nhận, kèm theo một ví dụ tối thiểu và tài liệu.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
背景
DiffSynth-Studio 目前已经支持图像、视频和音频等多种 Diffusion 模型。近年来也出现了一类基于离散 token 去噪或 masked diffusion 的语言模型(Diffusion Language Model / Diffusion LLM),其生成过程与现有连续 latent diffusion 有一定共性,但也需要独立的 token corruption、noise schedule 和迭代解码逻辑。
我在仓库现有 Issue 和 PR 中暂未找到相同方向的讨论,因此想先确认该方向是否符合 DiffSynth-Studio 的长期定位,再考虑实现。
建议的最小范围
建议第一阶段只选择一个权重和推理代码公开的代表模型,例如 LLaDA 系列,并且仅支持推理:
- 增加独立的 TextDiffusionPipeline,或采用维护者建议的其他抽象
- 支持 tokenizer、mask/noise schedule 和迭代去噪解码
- 尽可能复用现有的模型加载、dtype、量化、CPU offload 和显存管理能力
- 提供一个最小推理示例和对应文档
第一阶段暂不包含:
- 训练或微调
- 多机多卡训练
- 同时适配多个 Diffusion LLM
- 对不同离散扩散算法建立完整统一抽象
希望确认的问题
- 文本离散扩散模型是否属于 DiffSynth-Studio 希望探索和支持的范围?
- 如果方向可行,维护者是否接受新增独立的 TextDiffusionPipeline 和文本 scheduler?
- 是否有更适合作为首个原型的模型或代码组织建议?
- 第一阶段仅提供 inference-only 的最小集成是否可以接受?
如果该方向得到认可,我可以先调研一个代表模型,并尝试提交最小推理原型 PR。
- Ngôn ngữ chính
- Python
- Star
- 13.1k
- Fork
- 1.3k
- Merge trung bình
- 12 giờ 53 phút
- Pull request đã merge (30 ngày)
- 42
Chuẩn bị môi trường
Chúng tôi chưa kiểm tra các tệp thiết lập môi trường của dự án này. Hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của modelscope/DiffSynth-Studio
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 75/100
modelscope/DiffSynth-Studio#1707 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 2 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 90/100
modelscope/DiffSynth-Studio#1702 ·
Maintainer thường phản hồi trong vòng 2 ngày
-
Độ khó 1/5 1-3 giờ Mức phù hợp với người mới 78/100
modelscope/DiffSynth-Studio#1668 ·
Maintainer thường phản hồi trong vòng 2 ngày
-
bfloat16训练时段错误: 数组越界的一种方案Đang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100
modelscope/DiffSynth-Studio#1499 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 2 ngày
-
Latest update broke Wan2.2 S2VĐang mở
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 78/100
modelscope/DiffSynth-Studio#1373 · 5 bình luận · 1 reaction ·
Maintainer thường phản hồi trong vòng 2 ngày
Tất cả issue của modelscope/DiffSynth-Studio
Issue tương tự
-
correction metadata
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 68/100
acl-org/acl-anthology#10104 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
bug status/needs-triage
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 86/100
prowler-cloud/prowler#12885 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Bug in GaussianTailProbabilityCalibrator: running_statistics=False still uses a windowed varianceĐang mởbug good first issue
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 88/100
selimfirat/pysad#107 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
bug ci-failure high priority
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 88/100
vllm-project/vllm-omni#8194 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 88/100
Maintainer thường phản hồi trong vòng 1 ngày