Confusion about Deepspeed Inference
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 20/100
- Tipo de issue
- Documentación
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- python
- Área
- ai, machine-learning
Línea de trabajo
El issue menciona deepspeed.initialize, deepspeed.init_inference, MII, Zero-3, CPU offload y 70B LLaMA inference. Empieza comparando las rutas de inferencia documentadas y su comportamiento en cuanto a memoria y paralelismo de modelos; se considerará terminado cuando haya una respuesta documentada que cubra las tres preguntas y las prácticas recomendadas actuales.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Hi, I read the deepspeed docs and have the following confusion:
(1) What's the difference between these methods when in inferencing LLMs?
a. deepspeed.initialize and then write code to generate text
b. deepspeed.init_inference then write code to generate
c. use mii to inference
(2) Which of them are friendly for memory? For example, I want to inference 70b models, which of them support model parallelism that separates model parameters across gpus?
(3) For inference, what's the best practice now for inferencing 70b llama?
a. zero3 + cpu offload (1*a100)
b. zero3 (2*a100)
...
Thank you!
- Lenguaje dominante
- Python
- Estrellas
- 6.8k
- Forks
- 1.1k
- Merge medio
- 3 d 20 h
- PR fusionados (30 d)
- 5
Preparar el entorno
Este proyecto no incluye contenedor de desarrollo, Dockerfile ni guía de contribución, así que la configuración corre por tu cuenta: empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de deepspeedai/DeepSpeedExamples
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 52/100
deepspeedai/DeepSpeedExamples#996 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
deepspeedai/DeepSpeedExamples#995 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 52/100
deepspeedai/DeepSpeedExamples#989 ·
-
moe example 404Abierto
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
deepspeedai/DeepSpeedExamples#984 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 42/100
deepspeedai/DeepSpeedExamples#979 · 6 comentarios ·
Todos los issues de deepspeedai/DeepSpeedExamples
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
Los mantenedores suelen responder en 3 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
modelcontextprotocol/python-sdk#3648 ·
Los mantenedores suelen responder en 1 día
-
docs good first issue
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
VenetoStato/giorgio#6 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 74/100
Los mantenedores suelen responder en 1 día
-
Claiming namespace ddalusAbierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 70/100
EclipseFdn/open-vsx.org#13831 ·
Los mantenedores suelen responder en 1 día