NVIDIA/TensorRT-LLM
Ver en GitHubTensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C++ runtimes that orchestrate the inference execution in a performant way.
- Estrellas
- 14.7k
- Forks
- 2.8k
- Issues abiertos para principiantes
- 25
- Issues indexados
- 607
- Merge medio
- 3 d 3 h
- PR fusionados (30 d)
- 493
- Lenguaje dominante
- Python
- Licencia
- Sin datos de licencia
- Último push a GitHub
- 20/9/2026
- Última indexación
- 19/9/2026
- Guía de contribución
- Guía de contribución
- Código de conducta
- Código de conducta
- Etiquetas para principiantes
- Sin etiquetas para principiantes indexadas
-
bug Customized kernels KV-Cache Management Pytorch
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#19515 ·
-
bug KV-Cache Management Pytorch
Dificultad 3/5 1-2 días Aptitud para principiantes 72/100
NVIDIA/TensorRT-LLM#19514 ·
-
feature request Pytorch
NVIDIA/TensorRT-LLM#19510 · 1 asignado ·
-
RFC
NVIDIA/TensorRT-LLM#19501 · 1 asignado ·
-
bug VisualGen
Dificultad 3/5 1-2 días Aptitud para principiantes 76/100
NVIDIA/TensorRT-LLM#19495 ·
-
AutoDeploy bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
NVIDIA/TensorRT-LLM#19491 · 2 comentarios ·
-
bug Speculative Decoding
Dificultad 4/5 3-5 días Aptitud para principiantes 52/100
NVIDIA/TensorRT-LLM#19487 · 1 comentario ·
-
bug
Dificultad 3/5 1-2 días Aptitud para principiantes 76/100
NVIDIA/TensorRT-LLM#19485 ·
-
new model
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
NVIDIA/TensorRT-LLM#19481 ·
-
feature request
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
NVIDIA/TensorRT-LLM#19463 ·
-
Multimodal
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
NVIDIA/TensorRT-LLM#19460 ·
-
[Bug] Attention-DP fill-gate fail-fast can skip the model-parallel status gather on a post-fill rank AbiertoDisaggregated serving
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#19435 ·
-
bug Customized kernels
NVIDIA/TensorRT-LLM#19364 · 1 asignado ·
-
bug Customized kernels
NVIDIA/TensorRT-LLM#19362 · 1 comentario · 1 asignado ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 68/100
NVIDIA/TensorRT-LLM#19337 · 2 comentarios ·
-
Scaffolding
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
NVIDIA/TensorRT-LLM#19329 ·
-
Scaffolding
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
NVIDIA/TensorRT-LLM#19319 · 1 comentario ·
-
RFC
NVIDIA/TensorRT-LLM#19301 · 3 asignados ·
-
KV-Cache Management
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
NVIDIA/TensorRT-LLM#19281 ·
-
[New Model]: Add Xing4.0 support Abiertonew model
Dificultad 5/5 Más de una semana Aptitud para principiantes 30/100
NVIDIA/TensorRT-LLM#19278 ·
-
KV-Cache Management
Dificultad 4/5 3-5 días Aptitud para principiantes 45/100
NVIDIA/TensorRT-LLM#19242 ·
-
Customized kernels
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
NVIDIA/TensorRT-LLM#19240 ·
-
Disaggregated serving Frontend Investigating LLM API RFC triaged
NVIDIA/TensorRT-LLM#19232 · 1 comentario · 1 reacción · 4 asignados ·
-
LLM API
Dificultad 2/5 1-3 horas Aptitud para principiantes 52/100
NVIDIA/TensorRT-LLM#19229 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 35/100
NVIDIA/TensorRT-LLM#19227 ·
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 62/100
NVIDIA/TensorRT-LLM#19225 ·
-
[Bug]: standalone Responses API input, streaming, and tool continuation failures with Agentic API AbiertoLLM API
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
NVIDIA/TensorRT-LLM#19223 ·
-
Pytorch
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#19193 ·
-
Infra
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#19173 ·
-
bug Inference runtime Triton backend
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
NVIDIA/TensorRT-LLM#19172 ·
-
Infra
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
NVIDIA/TensorRT-LLM#19067 ·
-
Customized kernels
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#19063 · 3 comentarios ·
-
Pytorch
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
NVIDIA/TensorRT-LLM#19059 · 3 comentarios ·
-
feature request Infra
NVIDIA/TensorRT-LLM#19033 · 1 asignado ·
-
[Bug]: Multimodal metadata failures terminate the PyTorch executor instead of failing the request AbiertoMultimodal Pytorch
Dificultad 3/5 1-2 días Aptitud para principiantes 72/100
NVIDIA/TensorRT-LLM#18971 · 1 comentario ·
-
Speculative Decoding
Dificultad 4/5 3-5 días Aptitud para principiantes 66/100
NVIDIA/TensorRT-LLM#18892 · 1 comentario ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 45/100
NVIDIA/TensorRT-LLM#18891 · 1 comentario ·
-
Inference runtime
Dificultad 3/5 1-2 días Aptitud para principiantes 78/100
NVIDIA/TensorRT-LLM#18848 · 1 comentario ·
-
[Bug] Worker CPU affinity is applied process-wide in shared-process deployments and never restored AbiertoInference runtime
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
NVIDIA/TensorRT-LLM#18847 ·
-
Inference runtime
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
NVIDIA/TensorRT-LLM#18816 ·
-
Doc
Dificultad 3/5 1-2 días Aptitud para principiantes 68/100
NVIDIA/TensorRT-LLM#18777 ·
-
Disaggregated serving Pytorch
Dificultad 1/5 Menos de una hora Aptitud para principiantes 90/100
NVIDIA/TensorRT-LLM#18776 ·
-
bug Customized kernels Windows
Dificultad 3/5 1-2 días Aptitud para principiantes 75/100
NVIDIA/TensorRT-LLM#18775 · 1 comentario ·
-
Inference runtime
Dificultad 3/5 1-2 días Aptitud para principiantes 78/100
NVIDIA/TensorRT-LLM#18759 ·
-
bug VisualGen
Dificultad 4/5 3-5 días Aptitud para principiantes 45/100
NVIDIA/TensorRT-LLM#18687 ·
-
Low Precision
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#18664 ·
-
Inference runtime Pytorch
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#18663 · 2 comentarios ·
-
Speculative Decoding
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#18662 ·
-
KV-Cache Management Pytorch
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
NVIDIA/TensorRT-LLM#18661 · 1 comentario ·
-
KV-Cache Management
NVIDIA/TensorRT-LLM#18660 · 1 asignado ·