Reduce CPU overheads in te Sequential GroupedLinear Op
Les mainteneurs répondent en général sous 2 jours
Personne n'a encore pris cette issue.
Évaluation
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Accessibilité débutants
- 38/100
- Type d'issue
- Bug
- Clarté
- À clarifier
- Activité
- Active
- Stack technique
- python
- Domaine
- machine-learning, performance
Piste de recherche
Commencez par lire la PR #2923 et par suivre le chemin graph-safe de la Sequential GroupedLinear Op. Profilez-la pour identifier les goulots d’étranglement du CPU, puis vérifiez que la surcharge est réduite sans régression du comportement existant de l’opération.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Description
Recently graph safe support has been added to te Sequential GroupedLinear Op https://github.com/NVIDIA/TransformerEngine/pull/2923.
But it suffers from CPU overheads. Nail the bottlenecks and fix them
- Langage dominant
- Python
- Étoiles
- 3.6k
- Forks
- 851
- Merge moyen
- 5 j 1 h
- PR mergées (30 j)
- 52
Préparer son environnement
- Aucun Dockerfile ni fichier Docker Compose
- Propose un modèle de pull request
- Lire le guide de contribution
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Autres issues de NVIDIA/TransformerEngine
-
[Bug] group_quantize_fp8_blockwise: mbarrier invalidated before other threads finish waiting on itOuverte
Difficulté 2/5 1-3 heures Accessibilité débutants 82/100
NVIDIA/TransformerEngine#3647 ·
Les mainteneurs répondent en général sous 2 jours
-
[PyTorch] fp8_cs_quantize fake implementation returns a vector inverse scale instead of a scalarPeut-être pris @sanjana658 l’a pris il y a 1 jour. Ouverte
Difficulté 2/5 1-3 heures Accessibilité débutants 82/100
NVIDIA/TransformerEngine#3636 · 2 commentaires ·
Les mainteneurs répondent en général sous 2 jours
-
[Bug] Backend selection picks FA3 for training with head_dim_qk=192 / v_head_dim=128, but FA3 backward cannot run itPeut-être pris @yuweih205 l’a pris il y a 32 jours. Ouverteattention
Difficulté 2/5 1-3 heures Accessibilité débutants 85/100
NVIDIA/TransformerEngine#3481 · 4 commentaires ·
Les mainteneurs répondent en général sous 2 jours
-
Increase MAX_TENSOR_NUMOuvertebug
Difficulté 2/5 1-3 heures Accessibilité débutants 68/100
NVIDIA/TransformerEngine#2189 · 7 commentaires · 5 réactions ·
Les mainteneurs répondent en général sous 2 jours
-
[PyTorch] CUDA graph RNG registration floods training logs on automatic-registration buildsPeut-être pris @ksivaman l’a pris aujourd’hui. Ouverte
Difficulté 4/5 3-5 jours Accessibilité débutants 50/100
NVIDIA/TransformerEngine#3645 · 1 commentaire · 1 personne assignée ·
Les mainteneurs répondent en général sous 2 jours
Toutes les issues de NVIDIA/TransformerEngine
Issues similaires
-
Difficulté 1/5 Moins d'une heure Accessibilité débutants 85/100
MystenLabs/MemWal#1163 · 2 commentaires ·
Les mainteneurs répondent en général sous 1 jour
-
infertopics leaves new nodes without a topic when untopiced neighbours outnumber topiced onesPeut-être pris @moneebullah25 l’a pris aujourd’hui. Ouverte
Difficulté 2/5 1-3 heures Accessibilité débutants 72/100
Les mainteneurs répondent en général sous 1 jour
-
Difficulté 2/5 1-3 heures Accessibilité débutants 70/100
FinanceFlash/unvibecode#218 ·
Les mainteneurs répondent en général sous 1 jour
-
Difficulté 2/5 1-3 heures Accessibilité débutants 75/100
Les mainteneurs répondent en général sous 1 jour
-
Difficulté 2/5 1-3 heures Accessibilité débutants 70/100
NVIDIA/earth2studio#1241 ·
Les mainteneurs répondent en général sous 3 jours