Repository Issues

microsoft/MInference

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] To speed up Long-context LLMs' inference, approximate and dynamic sparse calculate the attention, which reduces inference latency by up to 10x for pre-filling on an A100 while maintaining accuracy.

GitHub で見る
Stars
 (1,226 個のスター)
Forks
 (80 件のフォーク)
Indexed issues
 (0 件の索引済み Issue)
open beginner issues
 (0 件のオープンな初心者向け Issue)
最終索引
2026/08/23
最終 GitHub push
2026/03/09
ライセンス
MIT License
コントリビューションガイド
コントリビューションガイドはありません
行動規範
行動規範
主要言語
Python
PR merge metrics
 (30d に merged PR はありません)
初心者向けラベル
索引済み初心者向けラベルはありません

Issue

0 件のオープンな索引 Issue

このリポジトリには open の索引済み Issue がありません。