7 comentários (7 comentários)2 reações (2 reações)0 responsável (0 responsável)Python4.736 forks (4.736 forks)batch import
enhancementgood first issue
Métricas do repositório
- Stars
- 38.959 estrelas (38.959 estrelas)
- Métricas de merge de PR
- Métricas PR pendentes (Métricas PR pendentes)
Description
Loading a vicuna13B using 4bit quantization from the transformers library is possible load_in_4bit. How difficult could be for Fastach to support it?
Guia do colaborador
- Direção de pesquisa
- Investigue como o FastChat atualmente carrega modelos (por exemplo, em model worker.py) e replique o parâmetro load in 4bit da biblioteca transformers. Revise a documentação de quantização do transformers vinculada na issue para entender a API. Verifique os comentários existentes para quaisquer insights ou bloqueios. Implemente o parâmetro no pipeline de carregamento do modelo, garantindo compatibilidade com a infraestrutura de serviço de modelo existente.
- Pilha de tecnologia
- pythonpytorch
- Domain
- backend
- Tipo Issue
- Funcionalidade
- Prerequisites
- PythonPyTorchTransformers