NVIDIA/TransformerEngine
A library for accelerating Transformer models on NVIDIA GPUs, including using 8-bit and 4-bit floating point (FP8 and FP4) precision on Hopper, Ada and Blackwell GPUs, to provide better performance with lower memory utilization in both training and inference.
NVIDIA/TransformerEngine é bom para iniciantes?
Nos últimos 30 dias, NVIDIA/TransformerEngine fez merge de 13 de 62 pull requests de contribuidores externos, e os mantenedores costumam responder em até 2 dias. Agora há 2 issues para iniciantes abertas.
- Estrelas
- 3.6k
- Forks
- 844
- Issues abertas para iniciantes
- 2
- Issues indexadas
- 174
- Merge médio
- 4d 55min
- PRs com merge (30d)
- 51
- Linguagem predominante
- Python
- Licença
- Apache-2.0
- Último push no GitHub
- 1/10/2026
- Última indexação
- 19/9/2026
- Guia de contribuição
- Guia de contribuição
- Código de conduta
- Sem código de conduta
- Labels para iniciantes
- Nenhum label para iniciantes indexado
Como contribuir com NVIDIA/TransformerEngine
- Leia primeiro o guia de contribuição: ele explica como os mantenedores querem que as mudanças sejam propostas, testadas e revisadas.
- Suas contribuições serão publicadas sob a licença Apache-2.0 do projeto.
- Escolha uma das 2 issues abertas para iniciantes abaixo e comente que quer trabalhar nela antes de começar.
Issues em que talvez alguém já esteja trabalhando aparecem no fim. Ordenar tudo por data
-
bug
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 54/100
NVIDIA/TransformerEngine#3640 · 5 comentários ·
Mantenedores costumam responder em até 2 dias
-
[PyTorch] fp8_cs_quantize fake implementation returns a vector inverse scale instead of a scalarAberta
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 82/100
NVIDIA/TransformerEngine#3636 ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 45/100
NVIDIA/TransformerEngine#3564 · 2 comentários ·
Mantenedores costumam responder em até 2 dias
-
[PyTorch][Attention] THD P2P context-parallel regression when padded cu_seqlens are value-equal but not object-identicalTalvez livre de novo Um pull request para esta issue foi fechado sem ser mesclado. Abertaattention
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 38/100
NVIDIA/TransformerEngine#3487 ·
Mantenedores costumam responder em até 2 dias
-
NCCL EP hard link makes `import transformer_engine` require `libcuda.so.1`Talvez livre de novo @phu0ngng assumiu há 53 dias e não há nenhum pull request aberto. Aberta
NVIDIA/TransformerEngine#3381 · 3 comentários · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
[Bug] CUDA graph backward replay illegal memory access after validation with mixed NVFP4/MXFP8 MambaAberta
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 35/100
NVIDIA/TransformerEngine#3316 ·
Mantenedores costumam responder em até 2 dias
-
bug
Dificuldade 3/5 1-2 dias Facilidade para iniciantes 68/100
NVIDIA/TransformerEngine#3294 · 4 comentários ·
Mantenedores costumam responder em até 2 dias
-
FP8 DPA future token leakageAbertaattention bug
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 38/100
NVIDIA/TransformerEngine#3248 · 1 comentário ·
Mantenedores costumam responder em até 2 dias
-
cuDNN to accept actual seqlens in addition to cumulative seqlensTalvez livre de novo @KshitijLakhani assumiu há 83 dias e não há nenhum pull request aberto. Abertaattention
NVIDIA/TransformerEngine#3218 · 1 comentário · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 50/100
NVIDIA/TransformerEngine#3217 · 2 comentários ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 68/100
NVIDIA/TransformerEngine#3202 ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 35/100
NVIDIA/TransformerEngine#3191 · 2 comentários ·
Mantenedores costumam responder em até 2 dias
-
attention bug
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 35/100
NVIDIA/TransformerEngine#3188 ·
Mantenedores costumam responder em até 2 dias
-
Hybrid quantization follow-upsTalvez livre de novo @negvet assumiu há 99 dias e não há nenhum pull request aberto. Abertabug
NVIDIA/TransformerEngine#3158 · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
Track recipe config changes for quantizer rebuildsTalvez livre de novo @negvet assumiu há 99 dias e não há nenhum pull request aberto. Abertabug
NVIDIA/TransformerEngine#3157 · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
Vendor-neutral reference: NVFP4 vs OCP MXFP4 block-structure parameters (request for confirmation)Abertaquestion
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 25/100
NVIDIA/TransformerEngine#3105 ·
Mantenedores costumam responder em até 2 dias
-
bug
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 48/100
NVIDIA/TransformerEngine#3097 ·
Mantenedores costumam responder em até 2 dias
-
enhancement
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 32/100
NVIDIA/TransformerEngine#3087 · 1 comentário ·
Mantenedores costumam responder em até 2 dias
-
Fused attention should distinguish bias input from dBias requestTalvez livre de novo @cyanguwa assumiu há 125 dias e não há nenhum pull request aberto. Abertaattention
NVIDIA/TransformerEngine#3082 · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
bug
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 48/100
NVIDIA/TransformerEngine#3062 · 1 reação ·
Mantenedores costumam responder em até 2 dias
-
installation
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 45/100
NVIDIA/TransformerEngine#3054 · 1 comentário ·
Mantenedores costumam responder em até 2 dias
-
[JAX] score_mod attention to support "enforce_precompiled" flag in cuDNN graph deserializationTalvez livre de novo @vcherepanov-nv assumiu há 134 dias e não há nenhum pull request aberto. Abertaattention jax
NVIDIA/TransformerEngine#3046 · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
[PyTorch] Integrate cuDNN GQA + DSA backend into DotProductAttentionTalvez livre de novo @cyanguwa assumiu há 134 dias e não há nenhum pull request aberto. Abertaattention
NVIDIA/TransformerEngine#3028 · 1 reação · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 25/100
NVIDIA/TransformerEngine#3026 ·
Mantenedores costumam responder em até 2 dias
-
[JAX] Dispatch/Combine for BF16 TensorTalvez livre de novo @phu0ngng assumiu há 138 dias e não há nenhum pull request aberto. Aberta
NVIDIA/TransformerEngine#3025 · 1 comentário · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
[PyTorch] Dispatch/Combine for BF16 tensor + Zero-CopyTalvez livre de novo @phu0ngng assumiu há 138 dias e não há nenhum pull request aberto. Aberta
NVIDIA/TransformerEngine#3024 · 1 comentário · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
[Common] Initial NCCL EP integration + Distributed CPP unit testsTalvez livre de novo @phu0ngng assumiu há 138 dias e não há nenhum pull request aberto. Aberta
NVIDIA/TransformerEngine#3023 · 1 comentário · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
[Common] Infrastructure for symmetric windowTalvez livre de novo @phu0ngng assumiu há 139 dias e não há nenhum pull request aberto. Aberta
NVIDIA/TransformerEngine#3022 · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
TE EP comm backend with NCCL EPTalvez livre de novo @phu0ngng assumiu há 139 dias e não há nenhum pull request aberto. Aberta
NVIDIA/TransformerEngine#3021 · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
bug megatron
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 42/100
NVIDIA/TransformerEngine#3006 · 1 comentário ·
Mantenedores costumam responder em até 2 dias
-
[JAX] Move quantization to before AG in MoEBlockTalvez livre de novo @jberchtold-nvidia assumiu há 86 dias e não há nenhum pull request aberto. Aberta
NVIDIA/TransformerEngine#2998 · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 38/100
NVIDIA/TransformerEngine#2995 · 2 comentários ·
Mantenedores costumam responder em até 2 dias
-
question
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 30/100
NVIDIA/TransformerEngine#2903 ·
Mantenedores costumam responder em até 2 dias
-
bug
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 52/100
NVIDIA/TransformerEngine#2899 · 2 comentários ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 45/100
NVIDIA/TransformerEngine#2892 · 2 comentários ·
Mantenedores costumam responder em até 2 dias
-
[Bug]trtexec build engine succeeded on the H100 GPU but failed on the 5090 GPUTalvez livre de novo @ptrendx assumiu há 174 dias e não há nenhum pull request aberto. Abertabug
NVIDIA/TransformerEngine#2891 · 4 comentários · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 25/100
NVIDIA/TransformerEngine#2884 ·
Mantenedores costumam responder em até 2 dias
-
[Bug] Context parallel crashes with asymmetric K/V head dims (GQA + enable_mla path)Talvez livre de novo Um pull request para esta issue foi fechado sem ser mesclado. Abertabug
Dificuldade 3/5 1-2 dias Facilidade para iniciantes 68/100
NVIDIA/TransformerEngine#2868 · 3 comentários ·
Mantenedores costumam responder em até 2 dias
-
FP8 weight caching shows no speedup (sometimes slowdown) and causes training curve differences under Float8BlockScalingTalvez livre de novo @ptrendx assumiu há 181 dias e não há nenhum pull request aberto. Aberta
NVIDIA/TransformerEngine#2852 · 2 comentários · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
field-request
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 35/100
NVIDIA/TransformerEngine#2846 ·
Mantenedores costumam responder em até 2 dias
-
question
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 35/100
NVIDIA/TransformerEngine#2828 ·
Mantenedores costumam responder em até 2 dias
-
Adaptive CompressionAbertaquestion
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 30/100
NVIDIA/TransformerEngine#2807 · 4 comentários · 2 reações ·
Mantenedores costumam responder em até 2 dias
-
Request for additional features from TE Debug modules for low precision training.Talvez livre de novo @pggPL assumiu há 191 dias e não há nenhum pull request aberto. Abertaenhancement
NVIDIA/TransformerEngine#2801 · 2 comentários · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
[Question] Expected behavior for blockwise FP8? Hybrid E4M3/E5M2 format & eval metrics outperforming BF16Talvez livre de novo @ptrendx assumiu há 204 dias e não há nenhum pull request aberto. Abertaquestion
NVIDIA/TransformerEngine#2754 · 2 comentários · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 35/100
NVIDIA/TransformerEngine#2710 ·
Mantenedores costumam responder em até 2 dias
-
Performance bottleneck in TransformerLayer and Attention when using attention maskTalvez livre de novo @cyanguwa assumiu há 219 dias e não há nenhum pull request aberto. Abertabug
NVIDIA/TransformerEngine#2703 · 1 comentário · 1 responsável ·
Mantenedores costumam responder em até 2 dias
-
jax Priority = P1
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 25/100
NVIDIA/TransformerEngine#2687 · 2 comentários ·
Mantenedores costumam responder em até 2 dias
-
bug MoE
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 5/100
NVIDIA/TransformerEngine#2660 ·
Mantenedores costumam responder em até 2 dias
-
field-request fp4 FP8 jax
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 35/100
NVIDIA/TransformerEngine#2658 · 1 comentário ·
Mantenedores costumam responder em até 2 dias
-
Heuristic Fallback in cuDNN: Why THD Format Reverts to SM80 on Hopper GPUsTalvez livre de novo @cyanguwa assumiu há 246 dias e não há nenhum pull request aberto. Abertaquestion
NVIDIA/TransformerEngine#2616 · 2 comentários · 1 responsável ·
Mantenedores costumam responder em até 2 dias
Mostrando os 100 mais recentes
Esta página lista apenas o que foi indexado mais recentemente. O filtro avançado tem o inventário completo, refinado por linguagem, dificuldade e duração.