Increase MAX_TENSOR_NUM
メンテナーはふだん 2 日以内に返信
まだ誰も着手していません。
評価
- 難易度
- 2/5
- 見積もり時間
- 1〜3時間
- 初心者へのやさしさ
- 68/100
- issue の種類
- バグ
- 明瞭さ
- おおむね明確
- 活発さ
- 活発
- 技術スタック
- cpp
調査の方向性
transformer_engine/common/transformer_engine.cpp から始め、MAX_TENSOR_NUM 定数と、制限を報告する Allocate パスを調査します。報告されている Qwen3-Next の LoRA fine-tuning ワークロードを再現または照合して検証し、新しい制限によって最大テンソル数エラーが発生しなくなることを、新たな割り当て失敗を引き起こさずに確認します。
索引モデルが issue の本文から書いたものです。
説明
The original setting in transformer_engine/common/transformer_engine.cpp is:
const size_t MAX_TENSOR_NUM = 20 * 1024 * 1024 / sizeof(Tensor);
When I used TransformerEngine for LoRA fine-tuning Qwen3-Next, which has many experts (512+1), I encountered this error:
transformer_engine.cpp:249 in function Allocate: Cannot allocate a new NVTETensor. Maximum number of tensors reached: 81920. There is probably a memory leak in your application.
We may need to increase this hard-coded limit.
- 主要言語
- Python
- スター
- 3.6k
- フォーク
- 844
- 平均マージ
- 4日 55分
- マージ済み PR(30日)
- 51
環境構築
- Dockerfile・Docker Compose ファイルなし
- プルリクエストのテンプレートあり
- コントリビューションガイドを読む
はじめの一歩
- issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
- 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
- リポジトリをフォークし、ブランチを切って変更します。
- issue 番号を参照したプルリクエストを送ります。
NVIDIA/TransformerEngine のほかの issue
-
[PyTorch] fp8_cs_quantize fake implementation returns a vector inverse scale instead of a scalarオープン
難易度 2/5 1〜3時間 初心者へのやさしさ 82/100
NVIDIA/TransformerEngine#3636 ·
メンテナーはふだん 2 日以内に返信
-
[Bug] Backend selection picks FA3 for training with head_dim_qk=192 / v_head_dim=128, but FA3 backward cannot run it対応中かも @yuweih205 が 30 日前に担当しました。 オープンattention
難易度 2/5 1〜3時間 初心者へのやさしさ 85/100
NVIDIA/TransformerEngine#3481 · コメント 4 件 ·
メンテナーはふだん 2 日以内に返信
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 54/100
NVIDIA/TransformerEngine#3640 · コメント 5 件 ·
メンテナーはふだん 2 日以内に返信
-
[BUG] Grouped MXFP8 quantization is not concurrency safe with multiple streams対応中かも @kainzhong が 1 日前に担当しました。 オープンbug
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
NVIDIA/TransformerEngine#3630 ·
メンテナーはふだん 2 日以内に返信
-
[bug] NVFP4 + `torch.compile`: errors with 3D input対応中かも @pggPL が 2 日前に担当しました。 オープンbug
難易度 2/5 1〜3時間 初心者へのやさしさ 25/100
NVIDIA/TransformerEngine#3626 ·
メンテナーはふだん 2 日以内に返信
NVIDIA/TransformerEngine の issue をすべて見る
似ている issue
-
難易度 1/5 1時間未満 初心者へのやさしさ 92/100
-
Harmony OPeNDAP SubSetter (HOSS) Geographic LARC_CLOUD PREFIRE_SAT2_AUX-SAT R01 production
難易度 2/5 1〜3時間 初心者へのやさしさ 68/100
nasa/harmony-autotester#245 ·
-
enhancement
難易度 2/5 1〜3時間 初心者へのやさしさ 68/100
Deltares/imod-python#1928 ·
-
難易度 1/5 1時間未満 初心者へのやさしさ 88/100
メンテナーはふだん 1 日以内に返信
-
feature
難易度 2/5 1〜3時間 初心者へのやさしさ 66/100