[JAX] Move quantization to before AG in MoEBlock
I maintainer di solito rispondono entro 2 giorni
@jberchtold-nvidia ci sta già lavorando.
Dal 13/7/2026.
Valutazione
Questa issue non è ancora stata valutata.
Descrizione
Current MoEBlock initial impl follows the same A2Av flow in maxtext where for FSDP, weights are AG then quantized before groupedGEMM happens. This is wasteful as the quantization kernel has to work with fsdp times the amount of data needed, which makes it about fsdp times slower. Need to move it to happen before AG.
- Lingua principale
- Python
- Stelle
- 3.6k
- Fork
- 844
- Merge medio
- 4g 55m
- PR unite (30g)
- 51
Preparare l'ambiente
- Nessun Dockerfile né file Docker Compose
- Ha un modello di pull request
- Leggi la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di NVIDIA/TransformerEngine
-
[PyTorch] fp8_cs_quantize fake implementation returns a vector inverse scale instead of a scalarAperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100
NVIDIA/TransformerEngine#3636 ·
I maintainer di solito rispondono entro 2 giorni
-
[Bug] Backend selection picks FA3 for training with head_dim_qk=192 / v_head_dim=128, but FA3 backward cannot run itForse già presa @yuweih205 l’ha presa 30 giorni fa. Apertaattention
Difficoltà 2/5 1-3 ore Idoneità per principianti 85/100
NVIDIA/TransformerEngine#3481 · 4 commenti ·
I maintainer di solito rispondono entro 2 giorni
-
Increase MAX_TENSOR_NUMApertabug
Difficoltà 2/5 1-3 ore Idoneità per principianti 68/100
NVIDIA/TransformerEngine#2189 · 7 commenti · 5 reazioni ·
I maintainer di solito rispondono entro 2 giorni
-
bug
Difficoltà 4/5 3-5 giorni Idoneità per principianti 54/100
NVIDIA/TransformerEngine#3640 · 5 commenti ·
I maintainer di solito rispondono entro 2 giorni
-
[BUG] Grouped MXFP8 quantization is not concurrency safe with multiple streamsForse già presa @kainzhong l’ha presa 1 giorno fa. Apertabug
Difficoltà 4/5 3-5 giorni Idoneità per principianti 25/100
NVIDIA/TransformerEngine#3630 ·
I maintainer di solito rispondono entro 2 giorni
Tutte le issue di NVIDIA/TransformerEngine
Issue simili
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 85/100
Vector35/community-plugins#376 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 68/100
py-econometrics/pyfixest#1883 ·
I maintainer di solito rispondono entro 1 giorno
-
bad links in rfc5890.htmlAperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 65/100
ietf-tools/rfc2html#81 ·
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 88/100
mysql/mysql-operator#60 ·
-
Python: Bug: split_plaintext_paragraph / split_markdown_paragraph can return a chunk larger than max_tokensForse già presa @xThreeh l’ha presa oggi. Apertapython triage
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
microsoft/semantic-kernel#14566 ·
I maintainer di solito rispondono entro 4 giorni