Running out of memory with version v0.5.17
维护者通常 1 天内回复
还没有人认领这个 Issue。
评估
- 难度
- 4/5
- 预计耗时
- 3-5 天
- 新手友好度
- 25/100
- Issue 类型
- 缺陷
- 描述清晰度
- 需要澄清
- 活跃度
- 停滞
- 技术栈
- python
调研方向
在 A100 上使用 v0.5.17 复现该报告,先加载 Qwen2.5-7B,然后将相同设置与 v0.5.6 进行比较。调查模型加载过程中的内存差异以及更新的 unsloth 依赖。确定导致回归的原因或恢复之前内存使用量所需的缺失配置后,即视为完成。
由索引模型根据 Issue 内容生成。
描述
I used v0.5.6 but upgraded to version v0.5.17 since it uses the newer version of unsloth, which is supposed to be much more memory efficient, especially for MOE models and RL. But with the newer version, I get an out-of-memory error for the same model and the same setup with which v0.5.6 worked fine. I'm training Qwen2.5-14B on A100 GPU. Now, even if I try to run Qwen2.5-7B I get out of memory while loading the model, not even when training starts.
- 主要语言
- Python
- 星标
- 10.8k
- 派生
- 1k
- 平均合并
- 15 小时 31 分钟
- 30 天内合并 PR
- 166
环境准备
- 没有 Dockerfile 或 Docker Compose 文件
- 没有 Pull Request 模板
- 阅读贡献指南
从这里开始
- 先读完整个 Issue,再读项目的贡献指南。
- 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
- Fork 仓库,在一个分支上完成修改。
- 提交 Pull Request,并在描述里引用这个 Issue 编号。
OpenPipe/ART 的其他 Issue
-
Distributed group_mean casts group ids to float32, losing precision vs non-distributed path可能已有人在做 @OnePunchMonk 于 6 天前认领。 未关闭
难度 2/5 1-3 小时 新手友好度 82/100
维护者通常 1 天内回复
-
Add from_entity parameter to _experimental_fork_checkpoint可能重新可做 关联的 PR 已关闭且未合并。 未关闭
难度 2/5 1-3 小时 新手友好度 72/100
维护者通常 1 天内回复
-
Nonfused column LoRA misses input-gradient SUM when TP>1 and sequence parallelism is disabled可能已有人在做 @bradhilton 于 6 天前认领。 未关闭
难度 5/5 一周以上 新手友好度 25/100
维护者通常 1 天内回复
-
难度 4/5 3-5 天 新手友好度 54/100
维护者通常 1 天内回复
-
难度 5/5 一周以上 新手友好度 25/100
维护者通常 1 天内回复
相似的 Issue
-
enhancement good first issue Stellar Wave trivial
难度 2/5 1-3 小时 新手友好度 75/100
StellarCanary/ProtocolCanary-Fixtures#258 ·
维护者通常 1 天内回复
-
github_actions
难度 2/5 1-3 小时 新手友好度 65/100
Hochfrequenz/aibap.mcp#578 ·
维护者通常 1 天内回复
-
bug
难度 2/5 1-3 小时 新手友好度 75/100
mishraprafful/multihull#150 ·
维护者通常 1 天内回复
-
难度 2/5 1-3 小时 新手友好度 72/100
维护者通常 2 天内回复
-
难度 2/5 1-3 小时 新手友好度 66/100
python-caldav/caldav#735 ·
维护者通常 1 天内回复