Silently slower attention kernel when training MiniMax-H3 LoRA on B200
Maintainer thường phản hồi trong vòng 1 ngày
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 3/5
- Thời gian dự kiến
- 1-2 ngày
- Mức phù hợp với người mới
- 55/100
- Loại issue
- Lỗi
- Độ rõ ràng
- Khá rõ ràng
- Mức độ hoạt động
- Sôi nổi
- Công nghệ
- python
- Lĩnh vực
- machine-learning, performance
Hướng nghiên cứu
Bắt đầu với examples/minimax_h3/model_training/lora/MiniMax-H3-FL2VA.sh ở stage 2, README cài đặt và thử nghiệm được ghi lại trong #1680. Tái hiện lựa chọn triển khai attention bằng DIFFSYNTH_ATTENTION_IMPLEMENTATION=torch và kiểm tra đường dẫn logging hoặc lựa chọn hiện có. Công việc được xem là hoàn tất khi triển khai được chọn hiển thị cho người dùng hoặc hướng dẫn cài đặt ngăn chặn rõ ràng việc chậm đi một cách âm thầm.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
I ran the repo's MiniMax-H3 LoRA training example (examples/minimax_h3/model_training/lora/MiniMax-H3-FL2VA.sh, stage 2) on 8x B200, following the installation README, and got 6.32 s per training step. A profile showed attention running on the FA2 kernel, which is an sm80-era design and much slower on this GPU than torch SDPA's cuDNN backend. With the kernel switched, the same step took 3.80 s. Nothing in the logs said which implementation had been picked, so I only found it by profiling.
Setting DIFFSYNTH_ATTENTION_IMPLEMENTATION=torch avoids this, as @mi804 noted in #1680. A line in the install docs, or a one-line log of the chosen implementation at import, would have saved me the profile.
I opened #1680 to record my experiment: setup, measurements, traces and some potential fixes. A different fix may also well suit the codebase.
- Ngôn ngữ chính
- Python
- Star
- 13.2k
- Fork
- 1.3k
- Merge trung bình
- 22 giờ 15 phút
- Pull request đã merge (30 ngày)
- 31
Chuẩn bị môi trường
Dự án này không cung cấp dev container, Dockerfile hay hướng dẫn đóng góp, nên bạn cần tự thiết lập môi trường: hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của modelscope/DiffSynth-Studio
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 75/100
modelscope/DiffSynth-Studio#1707 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 1/5 1-3 giờ Mức phù hợp với người mới 78/100
modelscope/DiffSynth-Studio#1668 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
bfloat16训练时段错误: 数组越界的一种方案Đang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100
modelscope/DiffSynth-Studio#1499 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Latest update broke Wan2.2 S2VĐang mở
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 78/100
modelscope/DiffSynth-Studio#1373 · 5 bình luận · 1 reaction ·
Maintainer thường phản hồi trong vòng 1 ngày
-
[Reproducibility] Training script / config for MiniMax-H3-TrainingAdapter (DeCFG adapter) itselfĐang mở
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 35/100
modelscope/DiffSynth-Studio#1713 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
Tất cả issue của modelscope/DiffSynth-Studio
Issue tương tự
-
Claiming namespace `apoint`Đang mởnamespace operations
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 82/100
EclipseFdn/open-vsx.org#13573 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100
collective/icalendar#1854 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100
rancher/rancher-ai-agent#412 ·
Maintainer thường phản hồi trong vòng 6 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 84/100
TUDelftGeodesy/DePSI#134 ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 88/100
HenriquesLab/rxiv-maker#335 ·