7 commenti (7 commenti)2 reazioni (2 reazioni)0 assegnatari (0 assegnatari)Python4736 fork (4736 fork)batch import
enhancementgood first issue
Metriche repository
- Star
- 38.959 stelle (38.959 stelle)
- Metriche merge PR
- Metriche PR in attesa (Metriche PR in attesa)
Descrizione
Loading a vicuna13B using 4bit quantization from the transformers library is possible load_in_4bit. How difficult could be for Fastach to support it?
Guida contributor
- Direzione di ricerca
- Indaga su come FastChat carica attualmente i modelli (ad esempio in model worker.py) e replica il parametro load in 4bit dalla libreria transformers. Rivedi la documentazione sulla quantizzazione di transformers linkata nell'issue per comprendere l'API. Controlla i commenti esistenti per eventuali spunti o blocchi. Implementa il parametro nella pipeline di caricamento del modello, garantendo la compatibilità con l'infrastruttura di servizio del modello esistente.
- Tech stack
- pythonpytorch
- Dominio
- backend
- Tipo issue
- Funzionalità
- Prerequisiti
- PythonPyTorchTransformers