Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

lmdeploy教程疑问 - KV Cache量化和W4A16量化怎么叠加?

Abierto
#376 2 comentarios 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
4/5
Tiempo estimado
3-5 días
Aptitud para principiantes
25/100
Tipo de issue
Documentación
Claridad
Necesita aclaración
Estado de actividad
Estancado
Stack tecnológico
huggingface

Línea de trabajo

Comienza con la sección de cuantización de lmdeploy.md enlazada, especialmente con los puntos de entrada lmdeploy lite calibrate y lmdeploy lite auto_awq. Verifica cómo interactúan KV Cache y la cuantización W4A16, y si está documentada una ruta de conversión de Turbomind a Hugging Face. Se considera terminado cuando el tutorial explica claramente el flujo de trabajo compatible y los pasos de conversión para compartir modelos.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

lmdeploy教程量化部分 分别介绍了如何做KV Cache量化和W4A16量化,两者结果都得到turbomind格式的模型。
但怎么把这两者结合起来?比如在KV Cache量化的结果上做W4A16量化。
lmdeploy lite calibratelmdeploy lite auto_awq都𣎴接受turbomind格式的模型,该如何去叠加?

另外,如果想把量化后的模型和别人共享,怎么把turbomind格式的转换成hugging face格式的?

Lenguaje dominante
Python
Estrellas
2k
Forks
1.5k
Métricas de merge de PR
Sin PR fusionados en 30 d

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de InternLM/Tutorial

Todos los issues de InternLM/Tutorial

Issues similares

Más issues de Python

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.