Hacktoberfest 2026:维护者为十月标记出来的 issue,仍然开放、适合新手。 浏览 Hacktoberfest issue

why in linux loss blow up?

未关闭
#9 1 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看

还没有人认领这个 Issue。

评估

难度
4/5
预计耗时
3-5 天
新手友好度
25/100
Issue 类型
缺陷
描述清晰度
需要澄清
活跃度
停滞
技术栈
python

调研方向

在安装了 CUDA 的 Ubuntu 20.04 上使用 MegEngine 1.3.0 和 torch 1.9.1 复现训练运行,然后将其与无 CUDA 的运行进行比较。检查记录的 loss 变为 NaN 的步骤,并验证已完成的运行始终保持 loss 为有限值且正常下降。

由索引模型根据 Issue 内容生成。

描述

It is a strange issue that the loss will blow up to Nan in linux ubuntu 20.04 after I install the cuda, without cuda the loss decrease normally.

environment:
megengine == 1.3.0
torch == 1.9.1

more strange is the loss will fall back :

Epoch 0 Step 0, Speed=1.7 mb/s, dp_cost=0.0098, Loss=4.02e-02, lr=2.00e-04
Epoch 0 Step 10, Speed=14 mb/s, dp_cost=0.25, Loss=1.56e+00, lr=2.00e-04
Epoch 0 Step 20, Speed=19 mb/s, dp_cost=0.034, Loss= nan, lr=2.00e-04
Epoch 0 Step 30, Speed=17 mb/s, dp_cost=0.054, Loss=3.62e-02, lr=2.00e-04
Epoch 0 Step 40, Speed=20 mb/s, dp_cost=0.037, Loss=2.22e-01, lr=2.00e-04
Epoch 0 Step 50, Speed=15 mb/s, dp_cost=0.16, Loss= nan, lr=2.00e-04
Epoch 0 Step 60, Speed=16 mb/s, dp_cost=0.21, Loss= nan, lr=2.00e-04
Epoch 0 Step 70, Speed=18 mb/s, dp_cost=0.033, Loss= nan, lr=2.00e-04
Epoch 0 Step 80, Speed=18 mb/s, dp_cost=0.11, Loss= nan, lr=2.00e-04
Epoch 0 Step 90, Speed=15 mb/s, dp_cost=0.2, Loss= nan, lr=2.00e-04
Epoch 0 Step 100, Speed=12 mb/s, dp_cost=0.037, Loss= nan, lr=2.00e-04
Epoch 0 Step 110, Speed=15 mb/s, dp_cost=0.22, Loss= nan, lr=2.00e-04
Epoch 0 Step 120, Speed=17 mb/s, dp_cost=0.035, Loss= nan, lr=2.00e-04
Epoch 0 Step 130, Speed=17 mb/s, dp_cost=0.028, Loss= nan, lr=2.00e-04
Epoch 0 Step 140, Speed=13 mb/s, dp_cost=0.1, Loss= nan, lr=2.00e-04
Epoch 0 Step 150, Speed=17 mb/s, dp_cost=0.24, Loss= nan, lr=2.00e-04
Epoch 0 Step 160, Speed=15 mb/s, dp_cost=0.23, Loss= nan, lr=2.00e-04
Epoch 0 Step 170, Speed=8.5 mb/s, dp_cost=0.18, Loss= nan, lr=2.00e-04
Epoch 0 Step 180, Speed=16 mb/s, dp_cost=0.078, Loss= nan, lr=2.00e-04
Epoch 0 Step 190, Speed=15 mb/s, dp_cost=0.21, Loss= nan, lr=2.00e-04
Epoch 0 Step 200, Speed=15 mb/s, dp_cost=0.06, Loss= nan, lr=2.00e-04
Epoch 0 Step 210, Speed=19 mb/s, dp_cost=0.034, Loss=6.01e-02, lr=2.00e-04
Epoch 0 Step 220, Speed=16 mb/s, dp_cost=0.058, Loss= nan, lr=2.00e-04
Epoch 0 Step 230, Speed=19 mb/s, dp_cost=0.037, Loss= nan, lr=2.00e-04
Epoch 0 Step 240, Speed=17 mb/s, dp_cost=0.11, Loss= nan, lr=2.00e-04
Epoch 0 Step 250, Speed=10 mb/s, dp_cost=0.016, Loss= nan, lr=2.00e-04
Epoch 0 Step 260, Speed=16 mb/s, dp_cost=0.028, Loss= nan, lr=2.00e-04
Epoch 0 Step 270, Speed=16 mb/s, dp_cost=0.031, Loss= nan, lr=2.00e-04
Epoch 0 Step 280, Speed=10 mb/s, dp_cost=0.14, Loss= nan, lr=2.00e-04
Epoch 0 Step 290, Speed=17 mb/s, dp_cost=0.034, Loss= nan, lr=2.00e-04
Epoch 0 Step 300, Speed=15 mb/s, dp_cost=0.029, Loss= nan, lr=2.00e-04
Epoch 0 Step 310, Speed=19 mb/s, dp_cost=0.032, Loss=2.82e-01, lr=2.00e-04
Epoch 0 Step 320, Speed=17 mb/s, dp_cost=0.036, Loss=6.47e-02, lr=2.00e-04
Epoch 0 Step 330, Speed=15 mb/s, dp_cost=0.031, Loss= nan, lr=2.00e-04
Epoch 0 Step 340, Speed=13 mb/s, dp_cost=0.082, Loss= nan, lr=2.00e-04
Epoch 0 Step 350, Speed=13 mb/s, dp_cost=0.021, Loss=3.08e-01, lr=2.00e-04
Epoch 0 Step 360, Speed=14 mb/s, dp_cost=0.022, Loss= nan, lr=2.00e-04
Epoch 0 Step 370, Speed=16 mb/s, dp_cost=0.051, Loss= nan, lr=2.00e-04
Epoch 0 Step 380, Speed=11 mb/s, dp_cost=0.19, Loss= nan, lr=2.00e-04
Epoch 0 Step 390, Speed=15 mb/s, dp_cost=0.069, Loss= nan, lr=2.00e-04
Epoch 0 Step 400, Speed=16 mb/s, dp_cost=0.037, Loss= nan, lr=2.00e-04
Epoch 0 Step 410, Speed=17 mb/s, dp_cost=0.032, Loss= nan, lr=2.00e-04
Epoch 0 Step 420, Speed=19 mb/s, dp_cost=0.038, Loss= nan, lr=2.00e-04
Epoch 0 Step 430, Speed=17 mb/s, dp_cost=0.035, Loss= nan, lr=2.00e-04
Epoch 0 Step 440, Speed=11 mb/s, dp_cost=0.021, Loss=9.56e-02, lr=2.00e-04
Epoch 0 Step 450, Speed=16 mb/s, dp_cost=0.057, Loss= nan, lr=2.00e-04
Epoch 0 Step 460, Speed=15 mb/s, dp_cost=0.22, Loss= nan, lr=2.00e-04

主要语言
Python
星标
156
派生
22
PR 合并指标
30 天内没有已合并 PR

贡献指南

这个仓库没有索引到贡献指南

从这里开始

  1. 先读完整个 Issue,再读项目的贡献指南。
  2. 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
  3. Fork 仓库,在一个分支上完成修改。
  4. 提交 Pull Request,并在描述里引用这个 Issue 编号。

MegEngine/NBNet 的其他 Issue

查看 MegEngine/NBNet 的全部 Issue

相似的 Issue

更多 Python Issue

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。