Reduce CPU overheads in te Sequential GroupedLinear Op
Maintainer antworten meist innerhalb von 2 Tagen
Dieses Issue hat noch niemand übernommen.
Bewertung
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Anfängerfreundlichkeit
- 38/100
- Issue-Typ
- Bug
- Klarheit
- Muss geklärt werden
- Aktivitätsstatus
- Aktiv
- Tech-Stack
- python
- Bereich
- machine-learning, performance
Rechercherichtung
Beginne mit dem Lesen von PR #2923 und verfolge den graph-sicheren Pfad der Sequential GroupedLinear Op. Profiliere ihn, um die CPU-Engpässe zu identifizieren, und überprüfe anschließend, dass der Overhead reduziert wird, ohne Regressionen im bestehenden Verhalten der Operation.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Beschreibung
Recently graph safe support has been added to te Sequential GroupedLinear Op https://github.com/NVIDIA/TransformerEngine/pull/2923.
But it suffers from CPU overheads. Nail the bottlenecks and fix them
- Vorherrschende Sprache
- Python
- Sterne
- 3.6k
- Forks
- 851
- Ø Merge
- 5 T. 1 Std.
- Gemergte PRs (30 T.)
- 52
Entwicklungsumgebung
- Kein Dockerfile und keine Docker-Compose-Datei
- Hat eine Pull-Request-Vorlage
- Beitragsleitfaden lesen
Erste Schritte
- Lesen Sie das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreiben Sie ins Issue, dass Sie es übernehmen — das erspart doppelte Arbeit.
- Forken Sie das Repository und arbeiten Sie in einem Branch.
- Öffnen Sie einen Pull Request, der die Issue-Nummer nennt.
Mehr aus NVIDIA/TransformerEngine
-
[Bug] group_quantize_fp8_blockwise: mbarrier invalidated before other threads finish waiting on itOffen
Schwierigkeit 2/5 1-3 Stunden Anfängerfreundlichkeit 82/100
NVIDIA/TransformerEngine#3647 ·
Maintainer antworten meist innerhalb von 2 Tagen
-
[PyTorch] fp8_cs_quantize fake implementation returns a vector inverse scale instead of a scalarEvtl. vergeben @sanjana658 hat das heute übernommen. Offen
Schwierigkeit 2/5 1-3 Stunden Anfängerfreundlichkeit 82/100
NVIDIA/TransformerEngine#3636 · 2 Kommentare ·
Maintainer antworten meist innerhalb von 2 Tagen
-
[Bug] Backend selection picks FA3 for training with head_dim_qk=192 / v_head_dim=128, but FA3 backward cannot run itEvtl. vergeben @yuweih205 hat das vor 32 Tagen übernommen. Offenattention
Schwierigkeit 2/5 1-3 Stunden Anfängerfreundlichkeit 85/100
NVIDIA/TransformerEngine#3481 · 4 Kommentare ·
Maintainer antworten meist innerhalb von 2 Tagen
-
Increase MAX_TENSOR_NUMOffenbug
Schwierigkeit 2/5 1-3 Stunden Anfängerfreundlichkeit 68/100
NVIDIA/TransformerEngine#2189 · 7 Kommentare · 5 Reaktionen ·
Maintainer antworten meist innerhalb von 2 Tagen
-
[PyTorch] CUDA graph RNG registration floods training logs on automatic-registration buildsEvtl. vergeben @ksivaman hat das heute übernommen. Offen
Schwierigkeit 4/5 3-5 Tage Anfängerfreundlichkeit 50/100
NVIDIA/TransformerEngine#3645 · 1 Kommentar · 1 zugewiesene Person ·
Maintainer antworten meist innerhalb von 2 Tagen
Alle Issues in NVIDIA/TransformerEngine
Ähnliche Issues
-
bug
Schwierigkeit 2/5 1-3 Stunden Anfängerfreundlichkeit 85/100
Deepak3699/Ai_Mentor#244 ·
Maintainer antworten meist innerhalb von 1 Tag
-
Schwierigkeit 2/5 1-3 Stunden Anfängerfreundlichkeit 82/100
btclib-org/btclib-node#1880 ·
Maintainer antworten meist innerhalb von 1 Tag
-
CONTRIBUTING.md: say how ticketless bug fixes and feature PRs are handledEvtl. vergeben @khuisman hat das heute übernommen. Offenv0.9.2
Schwierigkeit 1/5 Unter einer Stunde Anfängerfreundlichkeit 84/100
khuisman/mcp-gee-sweet#941 ·
Maintainer antworten meist innerhalb von 1 Tag
-
Schwierigkeit 2/5 1-3 Stunden Anfängerfreundlichkeit 68/100
pyjanitor-devs/pyjanitor#1758 ·
Maintainer antworten meist innerhalb von 1 Tag
-
bug ready for review
Schwierigkeit 2/5 1-3 Stunden Anfängerfreundlichkeit 86/100
odysseus-dev/odysseus#6641 ·
Maintainer antworten meist innerhalb von 1 Tag