How to use deepspeed for multi-node and multi-card task in slurm cluster
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Idoneità per principianti
- 25/100
- Tipo di issue
- Bug
- Chiarezza
- Da chiarire
- Stato di attività
- Ferma
- Ambito
- devops, distributed-systems, machine-learning
Direzione di ricerca
Inizia con i due blocchi di comandi Slurm e gli entry point indicati, pre_train_ft_7b_ds.py e pre_ft_7b_ds.py. Riproduci il problema di avvio multi-nodo segnalato e analizza il comportamento di avvio di DeepSpeed e torch.distributed, inclusa la configurazione delle connessioni tra i nodi. Il lavoro è concluso quando il problema è stato identificato con una diagnosi riproducibile o con una configurazione di avvio funzionante verificata.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
slurm command as following :
#!/bin/bash
#SBATCH --job-name=pretrain_7 # name
#SBATCH --nodes=2 # nodes
#SBATCH -w server-gpu-[10,15]
#SBATCH --ntasks-per-node=1 # crucial - only 1 task per dist per node!
#SBATCH --cpus-per-task=80 # number of cores per tasks
#SBATCH --gres=gpu:8 # number of gpus
#SBATCH --gpus-per-task=8
srun --jobid $SLURM_JOBID bash -c '
deepspeed --master_port 28727 \
--num_gpus 16 \
--num_nodes 2 \
--hostfile hostfile \
pre_train_ft_7b_ds.py \
--model_path="/demo/Llama2-7b-Instruct-hf/" \
--dataset_name="/demo/train.json" \
--seq_length 8192 \
--num_train_epochs 1 \
or
#!/bin/bash
#SBATCH --job-name=pretrain_7 # name
#SBATCH --nodes=2 # nodes
#SBATCH -w server-gpu-[10,15]
#SBATCH --ntasks-per-node=1 # crucial - only 1 task per dist per node!
#SBATCH --cpus-per-task=80 # number of cores per tasks
#SBATCH --gres=gpu:8 # number of gpus
#SBATCH --gpus-per-task=8
srun --jobid $SLURM_JOBID bash -c '
python -m torch.distributed.run \
--nnodes 2 \
--nproc_per_node 8 \
--master_addr $MASTER_ADDR \
--master_port 9001 \
pre_ft_7b_ds.py \
--model_path="/demo/Llama2-7b-Instruct-hf/" \
--dataset_name="/demo/train.json" \
--seq_length 8192 \
--num_train_epochs 1 \
the two above all has problems , maybe because node server need socket connection or ssh connect with each other
- Lingua principale
- Python
- Stelle
- 6.8k
- Fork
- 1.1k
- Merge medio
- 2g 16h
- PR unite (30g)
- 1
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di deepspeedai/DeepSpeedExamples
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 52/100
deepspeedai/DeepSpeedExamples#996 ·
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 25/100
deepspeedai/DeepSpeedExamples#995 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 52/100
deepspeedai/DeepSpeedExamples#989 ·
-
moe example 404 Aperta
Difficoltà 4/5 3-5 giorni Idoneità per principianti 25/100
deepspeedai/DeepSpeedExamples#984 ·
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 42/100
deepspeedai/DeepSpeedExamples#979 · 6 commenti ·
Tutte le issue di deepspeedai/DeepSpeedExamples
Issue simili
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
anthropics/skills#1811 · 1 commento ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
speaches-ai/speaches#678 ·
-
bug
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
datalayer/mcp-compose#42 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
conda-forge/spacy-feedstock#177 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 70/100
UKGovernmentBEIS/inspect_evals#2523 ·