Issue del repository

microsoft/MInference

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] To speed up Long-context LLMs' inference, approximate and dynamic sparse calculate the attention, which reduces inference latency by up to 10x for pre-filling on an A100 while maintaining accuracy.

Vedi su GitHub
Star
 (1226 stelle)
Fork
 (80 fork)
Issue indicizzate
 (0 issue indicizzate)
issue per principianti aperte
 (0 issue per principianti aperte)
Ultima indicizzazione
23 ago 2026
Ultimo push GitHub
9 mar 2026
Guida contributori
Nessuna guida contributori
Codice di condotta
Codice di condotta
Linguaggio principale
Python
Metriche merge PR
 (Nessuna PR mergiata in 30 g)
Label per principianti
Nessuna label per principianti indicizzata

Issue

0 issue indicizzate aperte

Nessuna issue indicizzata aperta trovata per questo repository.