Silently slower attention kernel when training MiniMax-H3 LoRA on B200
Los mantenedores suelen responder en 1 día
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 3/5
- Tiempo estimado
- 1-2 días
- Aptitud para principiantes
- 55/100
- Tipo de issue
- Error
- Claridad
- Bastante claro
- Estado de actividad
- Activo
- Stack tecnológico
- python
- Área
- machine-learning, performance
Línea de trabajo
Comienza con examples/minimax_h3/model_training/lora/MiniMax-H3-FL2VA.sh en la etapa 2, el README de instalación y el experimento documentado en #1680. Reproduce la elección de la implementación de attention con DIFFSYNTH_ATTENTION_IMPLEMENTATION=torch e inspecciona la ruta existente de logging o selección. Se considera terminado cuando la implementación seleccionada sea visible para los usuarios o las instrucciones de instalación impidan claramente la ralentización silenciosa.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
I ran the repo's MiniMax-H3 LoRA training example (examples/minimax_h3/model_training/lora/MiniMax-H3-FL2VA.sh, stage 2) on 8x B200, following the installation README, and got 6.32 s per training step. A profile showed attention running on the FA2 kernel, which is an sm80-era design and much slower on this GPU than torch SDPA's cuDNN backend. With the kernel switched, the same step took 3.80 s. Nothing in the logs said which implementation had been picked, so I only found it by profiling.
Setting DIFFSYNTH_ATTENTION_IMPLEMENTATION=torch avoids this, as @mi804 noted in #1680. A line in the install docs, or a one-line log of the chosen implementation at import, would have saved me the profile.
I opened #1680 to record my experiment: setup, measurements, traces and some potential fixes. A different fix may also well suit the codebase.
- Lenguaje dominante
- Python
- Estrellas
- 13.2k
- Forks
- 1.3k
- Merge medio
- 22 h 13 min
- PR fusionados (30 d)
- 29
Preparar el entorno
Este proyecto no incluye contenedor de desarrollo, Dockerfile ni guía de contribución, así que la configuración corre por tu cuenta: empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de modelscope/DiffSynth-Studio
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
modelscope/DiffSynth-Studio#1707 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
Dificultad 1/5 1-3 horas Aptitud para principiantes 78/100
modelscope/DiffSynth-Studio#1668 ·
Los mantenedores suelen responder en 1 día
-
bfloat16训练时段错误: 数组越界的一种方案Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
modelscope/DiffSynth-Studio#1499 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
Latest update broke Wan2.2 S2VAbierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 78/100
modelscope/DiffSynth-Studio#1373 · 5 comentarios · 1 reacción ·
Los mantenedores suelen responder en 1 día
-
Dificultad 4/5 3-5 días Aptitud para principiantes 30/100
modelscope/DiffSynth-Studio#1709 · 1 comentario ·
Los mantenedores suelen responder en 1 día
Todos los issues de modelscope/DiffSynth-Studio
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 86/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-2 días Aptitud para principiantes 70/100
-
FingerprintSplitter raises ZeroDivisionError when int(frac_train * len(dataset)) floors to zeroAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
Los mantenedores suelen responder en 7 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
lmstudio-ai/mlx-engine#376 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
pyiron/bagofholding#166 ·