lmdeploy教程疑问 - KV Cache量化和W4A16量化怎么叠加?

Đang mở
#376 2 bình luận 0 reaction 0 người được giao Xem trên GitHub

Chưa có ai nhận issue này.

Đánh giá

Độ khó
4/5
Thời gian dự kiến
3-5 ngày
Mức phù hợp với người mới
25/100
Loại issue
Tài liệu
Độ rõ ràng
Cần làm rõ
Mức độ hoạt động
Đình trệ
Công nghệ
huggingface

Hướng nghiên cứu

Bắt đầu với phần lượng tử hóa trong lmdeploy.md được liên kết, đặc biệt là các entry point lmdeploy lite calibratelmdeploy lite auto_awq. Xác minh cách KV Cache và lượng tử hóa W4A16 tương tác với nhau, cũng như liệu có tài liệu mô tả đường dẫn chuyển đổi từ Turbomind sang Hugging Face hay không. Công việc được xem là hoàn tất khi tutorial giải thích rõ workflow được hỗ trợ và các bước chuyển đổi để chia sẻ model.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Mô tả

lmdeploy教程量化部分 分别介绍了如何做KV Cache量化和W4A16量化,两者结果都得到turbomind格式的模型。
但怎么把这两者结合起来?比如在KV Cache量化的结果上做W4A16量化。
lmdeploy lite calibratelmdeploy lite auto_awq都𣎴接受turbomind格式的模型,该如何去叠加?

另外,如果想把量化后的模型和别人共享,怎么把turbomind格式的转换成hugging face格式的?

Ngôn ngữ chính
Python
Star
2k
Fork
1.5k
Chỉ số merge pull request
Không có pull request nào được merge trong 30 ngày

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Bắt đầu từ đâu

  1. Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
  2. Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
  3. Fork repository và làm thay đổi trên một nhánh.
  4. Mở pull request có tham chiếu số hiệu của issue.

Issue khác của InternLM/Tutorial

Tất cả issue của InternLM/Tutorial

Issue tương tự

Thêm issue về Python

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.