7 Kommentare (7 Kommentare)2 Reaktionen (2 Reaktionen)0 zugewiesene Personen (0 zugewiesene Personen)Python4.736 Forks (4.736 Forks)batch import
enhancementgood first issue
Repository-Metriken
- Stars
- 38.959 Sterne (38.959 Sterne)
- PR-Merge-Metriken
- PR-Metriken ausstehend (PR-Metriken ausstehend)
Beschreibung
Loading a vicuna13B using 4bit quantization from the transformers library is possible load_in_4bit. How difficult could be for Fastach to support it?
Contributor Guide
- Research-Richtung
- Untersuche, wie FastChat derzeit Modelle lädt (z. B. in model worker.py), und repliziere den load in 4bit Parameter aus der transformers Bibliothek. Überprüfe die in der Issue verlinkte transformers Quantisierungsdokumentation, um die API zu verstehen. Prüfe vorhandene Kommentare auf Erkenntnisse oder Hindernisse. Implementiere den Parameter in der Modellladepipeline und stelle die Kompatibilität mit der bestehenden Modellserving Infrastruktur sicher.
- Tech Stack
- pythonpytorch
- Domain
- backend
- Issue Type
- Funktion
- Voraussetzungen
- PythonPyTorchTransformers