7 commentaires (7 commentaires)2 réactions (2 réactions)0 personne assignée (0 personne assignée)Python4 736 forks (4 736 forks)batch import
enhancementgood first issue
Métriques du dépôt
- Stars
- 38 959 étoiles (38 959 étoiles)
- Métriques de merge PR
- Métriques PR en attente (Métriques PR en attente)
Description
Loading a vicuna13B using 4bit quantization from the transformers library is possible load_in_4bit. How difficult could be for Fastach to support it?
Guide contributeur
- Direction de recherche
- Étudiez comment FastChat charge actuellement les modèles (par exemple dans model worker.py) et reproduisez le paramètre load in 4bit de la bibliothèque transformers. Consultez la documentation de quantification de transformers liée dans l'issue pour comprendre l'API. Vérifiez les commentaires existants pour toute information ou blocage. Implémentez le paramètre dans le pipeline de chargement du modèle, en assurant la compatibilité avec l'infrastructure de service de modèle existante.
- Stack technique
- pythonpytorch
- Domaine
- backend
- Type d'issue
- Fonctionnalité
- Prérequis
- PythonPyTorchTransformers