lmdeploy教程疑问 - KV Cache量化和W4A16量化怎么叠加?
还没有人认领这个 Issue。
评估
- 难度
- 4/5
- 预计耗时
- 3-5 天
- 新手友好度
- 25/100
- Issue 类型
- 文档
- 描述清晰度
- 需要澄清
- 活跃度
- 停滞
- 技术栈
- huggingface
调研方向
从链接的 lmdeploy.md 量化部分开始,重点查看 lmdeploy lite calibrate 和 lmdeploy lite auto_awq 这两个入口。确认 KV Cache 与 W4A16 量化如何交互,以及是否记录了从 Turbomind 到 Hugging Face 的转换路径。当教程清晰解释受支持的工作流和模型共享转换步骤时,即视为完成。
由索引模型根据 Issue 内容生成。
描述
lmdeploy教程量化部分 分别介绍了如何做KV Cache量化和W4A16量化,两者结果都得到turbomind格式的模型。
但怎么把这两者结合起来?比如在KV Cache量化的结果上做W4A16量化。
lmdeploy lite calibrate和lmdeploy lite auto_awq都𣎴接受turbomind格式的模型,该如何去叠加?
另外,如果想把量化后的模型和别人共享,怎么把turbomind格式的转换成hugging face格式的?
- 主要语言
- Python
- 星标
- 2k
- 派生
- 1.5k
- PR 合并指标
- 30 天内没有已合并 PR
贡献指南
这个仓库没有索引到贡献指南
从这里开始
- 先读完整个 Issue,再读项目的贡献指南。
- 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
- Fork 仓库,在一个分支上完成修改。
- 提交 Pull Request,并在描述里引用这个 Issue 编号。
InternLM/Tutorial 的其他 Issue
-
难度 1/5 1 小时以内 新手友好度 85/100
-
难度 1/5 1 小时以内 新手友好度 65/100
-
使用100%A100运行报错 未关闭
难度 4/5 3-5 天 新手友好度 30/100
-
test 未关闭
难度 5/5 一周以上 新手友好度 1/100
-
难度 5/5 一周以上 新手友好度 20/100
查看 InternLM/Tutorial 的全部 Issue
相似的 Issue
-
难度 2/5 1-3 小时 新手友好度 75/100
anthropics/skills#1811 · 1 条评论 ·
-
难度 2/5 1-3 小时 新手友好度 75/100
speaches-ai/speaches#678 ·
-
bug
难度 2/5 1-3 小时 新手友好度 75/100
datalayer/mcp-compose#42 ·
-
难度 2/5 1-3 小时 新手友好度 75/100
conda-forge/spacy-feedstock#177 ·
-
难度 2/5 1-3 小时 新手友好度 70/100
UKGovernmentBEIS/inspect_evals#2523 ·