Issues du dépôt

microsoft/MInference

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] To speed up Long-context LLMs' inference, approximate and dynamic sparse calculate the attention, which reduces inference latency by up to 10x for pre-filling on an A100 while maintaining accuracy.

Voir sur GitHub
Stars
 (1 226 étoiles)
Forks
 (80 forks)
Issues indexées
 (0 issue indexée)
issues débutant ouvertes
 (0 issue débutant ouverte)
Dernière indexation
23 août 2026
Dernier push GitHub
9 mars 2026
Guide de contribution
Aucun guide de contribution
Code de conduite
Code de conduite
Langage principal
Python
Métriques de merge PR
 (Aucune PR mergée en 30 j)
Labels débutant
Aucun label débutant indexé

Issues

0 issue indexée ouverte

Aucune issue indexée ouverte trouvée pour ce dépôt.