Hacktoberfest 2026 : les issues que les mainteneurs ont marquées pour octobre, ouvertes et accessibles aux débutants. Parcourir les issues Hacktoberfest

Silently slower attention kernel when training MiniMax-H3 LoRA on B200

Ouverte
#1,687 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub

Les mainteneurs répondent en général sous 1 jour

@fusheng-ji y travaille déjà.

Depuis le 30/9/2026.

  • #1715 par @fusheng-ji — ouverte

Évaluation

Difficulté
3/5
Temps estimé
1-2 jours
Accessibilité débutants
55/100
Type d'issue
Bug
Clarté
Plutôt claire
Activité
Active
Stack technique
python

Piste de recherche

Commencez par examples/minimax_h3/model_training/lora/MiniMax-H3-FL2VA.sh à l'étape 2, le README d'installation et l'expérience documentée dans #1680. Reproduisez le choix d'implémentation de l'attention avec DIFFSYNTH_ATTENTION_IMPLEMENTATION=torch et inspectez le chemin existant de journalisation ou de sélection. C'est terminé lorsque l'implémentation sélectionnée est visible pour les utilisateurs ou que les instructions d'installation empêchent clairement le ralentissement silencieux.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Description

I ran the repo's MiniMax-H3 LoRA training example (examples/minimax_h3/model_training/lora/MiniMax-H3-FL2VA.sh, stage 2) on 8x B200, following the installation README, and got 6.32 s per training step. A profile showed attention running on the FA2 kernel, which is an sm80-era design and much slower on this GPU than torch SDPA's cuDNN backend. With the kernel switched, the same step took 3.80 s. Nothing in the logs said which implementation had been picked, so I only found it by profiling.

Setting DIFFSYNTH_ATTENTION_IMPLEMENTATION=torch avoids this, as @mi804 noted in #1680. A line in the install docs, or a one-line log of the chosen implementation at import, would have saved me the profile.

I opened #1680 to record my experiment: setup, measurements, traces and some potential fixes. A different fix may also well suit the codebase.

Langage dominant
Python
Étoiles
13.2k
Forks
1.3k
Merge moyen
12 h 52 min
PR mergées (30 j)
20

Préparer son environnement

Ce projet ne fournit ni conteneur de développement, ni Dockerfile, ni guide de contribution : l'installation est à votre charge. Commencez par son README, et consultez notre guide de la première contribution pour les étapes générales.

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Autres issues de modelscope/DiffSynth-Studio

Toutes les issues de modelscope/DiffSynth-Studio

Issues similaires

Plus d'issues Python

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.