Hacktoberfest 2026: le issue che i maintainer hanno segnato per ottobre, aperte e adatte ai principianti. Sfoglia le issue Hacktoberfest

How to use deepspeed for multi-node and multi-card task in slurm cluster

Aperta
#893 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

Valutazione

Difficoltà
4/5
Tempo stimato
3-5 giorni
Idoneità per principianti
25/100
Tipo di issue
Bug
Chiarezza
Da chiarire
Stato di attività
Ferma
Stack tecnologico
python, shell

Direzione di ricerca

Inizia con i due blocchi di comandi Slurm e gli entry point indicati, pre_train_ft_7b_ds.py e pre_ft_7b_ds.py. Riproduci il problema di avvio multi-nodo segnalato e analizza il comportamento di avvio di DeepSpeed e torch.distributed, inclusa la configurazione delle connessioni tra i nodi. Il lavoro è concluso quando il problema è stato identificato con una diagnosi riproducibile o con una configurazione di avvio funzionante verificata.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Descrizione

slurm command as following :

#!/bin/bash

#SBATCH --job-name=pretrain_7                     # name
#SBATCH --nodes=2                                     # nodes
#SBATCH -w server-gpu-[10,15] 
#SBATCH --ntasks-per-node=1                            # crucial - only 1 task per dist per node!
#SBATCH --cpus-per-task=80                              # number of cores per tasks
#SBATCH --gres=gpu:8                                   # number of gpus
#SBATCH --gpus-per-task=8  

srun --jobid $SLURM_JOBID bash -c '
    deepspeed --master_port 28727  \
    --num_gpus 16 \
    --num_nodes  2 \
    --hostfile hostfile \
    pre_train_ft_7b_ds.py \
    --model_path="/demo/Llama2-7b-Instruct-hf/" \
    --dataset_name="/demo/train.json" \
    --seq_length 8192 \
    --num_train_epochs 1 \

or

#!/bin/bash

#SBATCH --job-name=pretrain_7                     # name
#SBATCH --nodes=2                                     # nodes
#SBATCH -w server-gpu-[10,15] 
#SBATCH --ntasks-per-node=1                            # crucial - only 1 task per dist per node!
#SBATCH --cpus-per-task=80                              # number of cores per tasks
#SBATCH --gres=gpu:8                                   # number of gpus
#SBATCH --gpus-per-task=8  
srun --jobid $SLURM_JOBID bash -c '
    python -m torch.distributed.run \
    --nnodes 2 \
    --nproc_per_node 8 \
    --master_addr $MASTER_ADDR \
    --master_port 9001 \
    pre_ft_7b_ds.py \
    --model_path="/demo/Llama2-7b-Instruct-hf/" \
    --dataset_name="/demo/train.json" \
    --seq_length 8192 \
    --num_train_epochs 1 \

the two above all has problems , maybe because node server need socket connection or ssh connect with each other

Lingua principale
Python
Stelle
6.8k
Fork
1.1k
Merge medio
2g 16h
PR unite (30g)
1

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Altre issue di deepspeedai/DeepSpeedExamples

Tutte le issue di deepspeedai/DeepSpeedExamples

Issue simili

Altre issue su Python

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.