MiniMax-H3 CFG 蒸馏模型 SFT 后发糊,可能是什么原因?
Maintainer thường phản hồi trong vòng 1 ngày
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 5/5
- Thời gian dự kiến
- Hơn một tuần
- Mức phù hợp với người mới
- 8/100
- Loại issue
- Lỗi
- Độ rõ ràng
- Cần làm rõ
- Mức độ hoạt động
- Sôi nổi
- Công nghệ
- python
- Lĩnh vực
- ai, machine-learning
Hướng nghiên cứu
The payload names no files or tests, so start from the issue's three training configurations (direct SFT, DeCFG scaffold, DeCFG with training_cfg_scale=4) and the six-comment thread for any answers already given. This is a diagnosis of why fine-tuned output is blurry, and the open question is whether de-distillation is needed, which is a design decision for maintainers. A useful contribution would be a reproduced comparison of these settings or a maintainer-confirmed direction, not a patch.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
开源权重是 CFG 蒸馏模型。下面三次训练的数据相同:约 几千 条 480p 真人视频,10000 步。
- 直接 SFT
推理时cfg=1 时(就是没有negative embedding)画面崩掉。改成 CFG 推理后能出画面,但清晰度仍然下降。
- 只加 DeCFG 脚手架
训练时加载 DeCFG,推理去掉,cfg=1。能学到一些内容,脸也不再那么油。训到后面视频仍然变糊,音频生成也出问题。
- DeCFG + training_cfg_scale=4
同样 10000 步,推理仍是 cfg=1、一次前向。学习效果比前两种好,但画面上像蒙了一层白雾,原因不清楚。
三次之后,清晰度都比底模下降,这一项目前最影响使用。
下一步打算做去蒸馏,把模型训回推理时走真 CFG(正、负两次前向)。想确认有没有人在 H3 上跑通,以及 training_cfg_scale 的 scale、无条件分支是否还要丢掉参考图和参考视频。
如果有训得比较清楚、音频也正常的配置,希望交流一下数据分辨率、步数、rank、学习率和推理设置。
- Ngôn ngữ chính
- Python
- Star
- 13.2k
- Fork
- 1.3k
- Merge trung bình
- 12 giờ 52 phút
- Pull request đã merge (30 ngày)
- 20
Chuẩn bị môi trường
Dự án này không cung cấp dev container, Dockerfile hay hướng dẫn đóng góp, nên bạn cần tự thiết lập môi trường: hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của modelscope/DiffSynth-Studio
-
WanToDance: hardcoded `device='cuda'` in music encoder construction crashes model loading on Ascend NPUCó thể đã có người làm @li-lizhe đã nhận 17 ngày trước. Đang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 75/100
modelscope/DiffSynth-Studio#1707 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Partial download surfaces as "Cannot detect the model type" rather than a download errorCó thể đã có người làm @MohammadHijjawi97 đã nhận 15 ngày trước. Đang mở
Độ khó 1/5 1-3 giờ Mức phù hợp với người mới 78/100
modelscope/DiffSynth-Studio#1668 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
bfloat16训练时段错误: 数组越界的一种方案Có thể làm lại được Pull request cho issue này đã bị đóng mà không được merge. Đang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100
modelscope/DiffSynth-Studio#1499 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Latest update broke Wan2.2 S2VĐang mở
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 78/100
modelscope/DiffSynth-Studio#1373 · 5 bình luận · 1 reaction ·
Maintainer thường phản hồi trong vòng 1 ngày
-
[Reproducibility] Training script / config for MiniMax-H3-TrainingAdapter (DeCFG adapter) itselfĐang mở
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 35/100
modelscope/DiffSynth-Studio#1713 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
Tất cả issue của modelscope/DiffSynth-Studio
Issue tương tự
-
enhancement good first issue
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
hatchet-dev/hatchet#5179 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Update Python support to 3.15Đang mởpython-version
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 88/100
-
bug
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 62/100
Maintainer thường phản hồi trong vòng 1 ngày
-
bug javascript P2-medium python release:v3.1
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 68/100
adrirubio/claude-deck#546 ·
Maintainer thường phản hồi trong vòng 1 ngày