Train_loss = 0 and Eval_loss = NaN in stage2_sft
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Idoneità per principianti
- 32/100
- Tipo di issue
- Bug
- Chiarezza
- Abbastanza chiara
- Stato di attività
- Ferma
- Stack tecnologico
- python
- Ambito
- machine-learning
Direzione di ricerca
Inizia da stage2_sft.sh e anygpt/src/train/stage2_sft.py, quindi segui i percorsi di training e valutazione che usano esclusivamente speech_conv_datasets. Riproduci il comando con le versioni dell’ambiente elencate e ispeziona i batch del dataset, le label e il logging della loss; il lavoro è concluso quando per questa configurazione vengono riportate loss di training e valutazione finite e diverse da zero.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Hello!
Thank you for your work at MLLM.
I had a fine-tuning bug that I couldn't fix: when I ran the stage2_sft.sh script and trained with speech_conv_datasets only, the logger showed that the train loss was 0 all the time and eval loss was NaN, as shown in the figure.
Command in stage2_sft.sh as follows:
torchrun
--nproc_per_node 2 \
anygpt/src/train/stage2_sft.py \
--model_name_or_path "${METAROOT}" \
--run_name "mm_sft" \
--cache_dir ${CACHEROOT} \
--report_to "wandb" \
--speech_conv_datasets "$speech_conv_datasets" \
--speech_datasets "$speech_datasets"\
--preprocessing_num_workers 100 \
--bf16 True \
--do_train \
--do_eval \
--output_dir "${OUTROOT}" \
--model_max_length 4096 \
--save_strategy "steps" \
--save_steps 5 \
--evaluation_strategy "steps" \
--eval_steps 5 \
--max_steps 5 \
--concatenating False \
--per_device_train_batch_size 1 \
--per_device_eval_batch_size 4 \
--gradient_accumulation_steps 1 \
--val_set_size 10 \
--num_train_epochs 3\
--learning_rate 2e-5 \
--weight_decay 0. \
--warmup_ratio 0.03 \
--lr_scheduler_type "cosine" \
--log_level debug \
--logging_steps 1 \
--overwrite_output_dir False\
--fsdp "full_shard auto_wrap" \
--fsdp_transformer_layer_cls_to_wrap 'LlamaDecoderLayer' \
--use_flash_attn True \
--ddp_timeout 7200 \
--save_total_limit 10
I'm using the following python environment:
transformers 4.34.1
huggingface-hub 0.24.0
tokenizers 0.14.1
torch 2.1.0
torchaudio 2.1.0
torchvision 0.16.0
flash-attn 2.5.9.post1
- Lingua principale
- Python
- Stelle
- 883
- Fork
- 76
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Preparare l'ambiente
Questo progetto non fornisce container di sviluppo, Dockerfile né guida per i contributori, quindi l'ambiente è a tuo carico: parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di OpenMOSS/AnyGPT
-
可以启动,但是输入prompts就会这样。Aperta
Difficoltà 4/5 3-5 giorni Idoneità per principianti 28/100
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 35/100
-
About pretrain datasetAperta
Difficoltà 5/5 Più di una settimana Idoneità per principianti 20/100
-
Difficoltà 3/5 1-2 giorni Idoneità per principianti 25/100
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 20/100
Tutte le issue di OpenMOSS/AnyGPT
Issue simili
-
repo-audit
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
scverse/repo-health#20 ·
I maintainer di solito rispondono entro 1 giorno
-
/context/prime scope override double-prefixes an entity-ref project and drops its scoped memoriesAperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 85/100
phasespace-labs/palinode#232 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100
collective/icalendar#1858 · 1 commento ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 68/100
I maintainer di solito rispondono entro 1 giorno
-
lfx-mcp cannot supply global variables: LangflowClient drops X-LANGFLOW-GLOBAL-VAR-* from envApertabug
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
langflow-ai/langflow#15496 ·
I maintainer di solito rispondono entro 1 giorno