Issues do repositório

microsoft/MInference

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] To speed up Long-context LLMs' inference, approximate and dynamic sparse calculate the attention, which reduces inference latency by up to 10x for pre-filling on an A100 while maintaining accuracy.

Ver no GitHub
Stars
 (1.226 estrelas)
Forks
 (80 forks)
Issues indexadas
 (0 issue indexada)
issues iniciantes abertas
 (0 issue iniciante aberta)
Última indexação
23 de ago. de 2026
Último push no GitHub
9 de mar. de 2026
Licença
MIT License
Guia de contribuição
Nenhum guia de contribuição
Código de conduta
Código de conduta
Linguagem principal
Python
Métricas de merge de PR
 (Nenhuma PRs mesclada em 30d)
Labels para iniciantes
Nenhuma label para iniciantes indexada

Issues

0 issue indexada aberta

Nenhum issues indexado aberto encontrado para este repositório.