倉庫議題
Lightning-AI/pytorch-lightning
Pretrain, finetune and deploy AI models on multiple GPUs, TPUs with zero code changes.
議題
開放
NCCL timeout while doing multi gpu training
bugdistributedhelp wantedrepro neededver: 2.4.x
尚無負責人帶有初學者友善標籤提供貢獻指南
4 則留言0 個反應0 位負責人
開放
Make logging_mode (`on_step` or `on_epoch`) available to loggers
featurehelp wanted
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
5 則留言0 個反應0 位負責人
開放
Confusing recommendation to use sync_dist=True even with TorchMetrics
bughelp wantedloggingver: 2.2.x
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
17 則留言0 個反應0 位負責人
開放
training time increase epoch by epoch
bughelp wantedperformancerepro neededver: 2.2.x
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
2 則留言0 個反應0 位負責人
開放
enable loading `universal checkpointing` checkpoint in `DeepSpeedStrategy`
featurehelp wantedstrategy: deepspeed
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
1 則留言0 個反應0 位負責人
開放
trainer.test() with given checkpoint logs last epoch instead of checkpoint epoch
bughelp wantedrepro needed
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
1 則留言1 個反應0 位負責人
開放
ModelCheckpoint could not find key in returned metrics
bugcallback: model checkpointhelp wantedver: 2.1.x
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
4 則留言3 個反應0 位負責人
開放
[Fabric Lightning] Named barriers
distributedfeaturehelp wanted
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
1 則留言2 個反應0 位負責人
開放
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
1 則留言0 個反應0 位負責人
開放
Returning num_replicas=world_size when using distributed sampler in ddp
distributedduplicatefeaturehelp wantedstrategy: ddp
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
3 則留言1 個反應0 位負責人
開放
neptune.ai logger produces lots of errors when logging "training/epoch"
bughelp wantedlogger: neptune
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
4 則留言3 個反應0 位負責人
開放
`configure_model` is incompatible with the `BaseFinetuning` behavior when fitting
bugcallback: finetuninghelp wantedver: 2.1.x
為什麼推薦尚無負責人 · 尚無留言
尚無負責人尚無留言帶有初學者友善標籤提供貢獻指南
0 則留言3 個反應0 位負責人
開放
Validation runs only for one iteration when restarting from checkpoint mid-epoch, wrongly reporting validation loss
bughelp wantedloops
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
3 則留言0 個反應0 位負責人
開放
`batch_sampler.batch_size` is None with deepspeed and `DataLoader(batch_size=None)`
bughelp wantedstrategy: deepspeed
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
4 則留言0 個反應0 位負責人
開放
Potential off by 1 error when resuming training of mid-epoch checkpoint
bughelp wantedloopsver: 2.1.x
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
1 則留言0 個反應0 位負責人
開放
Support skipping the first iteration time in process bar
featurehelp wantedprogress bar: tqdmtorch.compile
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
1 則留言1 個反應0 位負責人
開放
Support `DDP(static_graph=True)` and gradient accumulation
help wantedstrategy: ddp
為什麼推薦帶有初學者友善標籤 · 提供貢獻指南
帶有初學者友善標籤提供貢獻指南
3 則留言3 個反應1 位負責人
開放
ignore_modules in Quantization via Bitsandbytes
featurehelp wantedprecision: bnb
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
4 則留言0 個反應0 位負責人
開放
Loggers fails to create metrics.csv file when running on multiple TPU cores
bughelp wantedstrategy: xlaver: 2.2.x
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
3 則留言0 個反應0 位負責人
開放
Downloading artifacts with wandblogger in DDP case failing on non-zero rank processes
bughelp wantedlogger: wandbver: 2.1.x
為什麼推薦尚無負責人 · 帶有初學者友善標籤
尚無負責人帶有初學者友善標籤提供貢獻指南
3 則留言1 個反應0 位負責人