Increase MAX_TENSOR_NUM
I maintainer di solito rispondono entro 2 giorni
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 2/5
- Tempo stimato
- 1-3 ore
- Idoneità per principianti
- 68/100
- Tipo di issue
- Bug
- Chiarezza
- Abbastanza chiara
- Stato di attività
- Attiva
- Stack tecnologico
- cpp
- Ambito
- machine-learning
Direzione di ricerca
Inizia da transformer_engine/common/transformer_engine.cpp e ispeziona la costante MAX_TENSOR_NUM e il percorso Allocate che segnala il limite. Riproduci o valida rispetto al carico di lavoro di fine-tuning LoRA riportato per Qwen3-Next, quindi conferma che il nuovo limite eviti l’errore relativo al numero massimo di tensori senza introdurre un nuovo errore di allocazione.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
The original setting in transformer_engine/common/transformer_engine.cpp is:
const size_t MAX_TENSOR_NUM = 20 * 1024 * 1024 / sizeof(Tensor);
When I used TransformerEngine for LoRA fine-tuning Qwen3-Next, which has many experts (512+1), I encountered this error:
transformer_engine.cpp:249 in function Allocate: Cannot allocate a new NVTETensor. Maximum number of tensors reached: 81920. There is probably a memory leak in your application.
We may need to increase this hard-coded limit.
- Lingua principale
- Python
- Stelle
- 3.6k
- Fork
- 844
- Merge medio
- 4g 42m
- PR unite (30g)
- 49
Preparare l'ambiente
- Nessun Dockerfile né file Docker Compose
- Ha un modello di pull request
- Leggi la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di NVIDIA/TransformerEngine
-
[Bug] Backend selection picks FA3 for training with head_dim_qk=192 / v_head_dim=128, but FA3 backward cannot run itForse già presa @yuweih205 l’ha presa 29 giorni fa. Apertaattention
Difficoltà 2/5 1-3 ore Idoneità per principianti 85/100
NVIDIA/TransformerEngine#3481 · 4 commenti ·
I maintainer di solito rispondono entro 2 giorni
-
[BUG] Grouped MXFP8 quantization is not concurrency safe with multiple streamsForse già presa @kainzhong l’ha presa oggi. Apertabug
Difficoltà 4/5 3-5 giorni Idoneità per principianti 25/100
NVIDIA/TransformerEngine#3630 ·
I maintainer di solito rispondono entro 2 giorni
-
[bug] NVFP4 + `torch.compile`: errors with 3D inputForse già presa @pggPL l’ha presa 1 giorno fa. Apertabug
Difficoltà 2/5 1-3 ore Idoneità per principianti 25/100
NVIDIA/TransformerEngine#3626 ·
I maintainer di solito rispondono entro 2 giorni
-
Multi-tensor swizzle kernels fail with "too many resources requested for launch" (missing __launch_bounds__)Forse già presa @ravimajeti l’ha presa 2 giorni fa. Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 25/100
NVIDIA/TransformerEngine#3621 ·
I maintainer di solito rispondono entro 2 giorni
-
[PyTorch] Avoid selecting FA4 for deterministic training on SM120Forse già presa Una pull request collegata a questa issue è aperta o già unita. Apertabug
Difficoltà 3/5 1-2 giorni Idoneità per principianti 35/100
NVIDIA/TransformerEngine#3594 ·
I maintainer di solito rispondono entro 2 giorni
Tutte le issue di NVIDIA/TransformerEngine
Issue simili
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 85/100
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 75/100
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 85/100
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 85/100
data-umbrella/du-event-board#225 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100