OpenPipe/ART
GitHub で見るAgent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!
- スター
- 10.8k
- フォーク
- 989
- オープンの初心者向け issue
- 1
- 索引済み issue
- 72
- 平均マージ
- 6時間 29分
- マージ済み PR(30日)
- 85
- 主要言語
- Python
- ライセンス
- Apache-2.0
- 最終 GitHub push
- 2026年9月19日
- 最新の索引
- 2026年9月20日
- コントリビューションガイド
- コントリビューションガイド
- 行動規範
- 行動規範がありません
- 初心者向けラベル
- 初心者向けラベルは索引されていません
-
enhancement
難易度 4/5 3〜5日 初心者へのやさしさ 48/100
-
難易度 5/5 1週間以上 初心者へのやさしさ 35/100
-
難易度 5/5 1週間以上 初心者へのやさしさ 35/100
-
Investigate output and gradient variability between matched same-source Qwen TrainerRank actors オープン
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
難易度 5/5 1週間以上 初心者へのやさしさ 20/100
-
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
難易度 5/5 1週間以上 初心者へのやさしさ 30/100
-
Determine whether a large dynamics RL batch refusal is necessary or avoidable by execution layout オープン
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
難易度 4/5 3〜5日 初心者へのやさしさ 48/100
-
難易度 5/5 1週間以上 初心者へのやさしさ 20/100
-
難易度 4/5 3〜5日 初心者へのやさしさ 50/100
-
bug
難易度 5/5 1週間以上 初心者へのやさしさ 35/100
-
難易度 3/5 1〜2日 初心者へのやさしさ 62/100
-
難易度 4/5 3〜5日 初心者へのやさしさ 55/100
-
難易度 2/5 1〜3時間 初心者へのやさしさ 72/100
-
auto_rl example uses オープン
難易度 3/5 1〜2日 初心者へのやさしさ 56/100
-
難易度 4/5 3〜5日 初心者へのやさしさ 48/100
-
難易度 3/5 1〜2日 初心者へのやさしさ 52/100
-
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
question
難易度 3/5 1〜2日 初心者へのやさしさ 42/100
-
discussion
難易度 5/5 1週間以上 初心者へのやさしさ 30/100
-
W&B offline オープンquestion
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
bug
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
bug
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 35/100
-
bug
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 35/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 35/100
-
question
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
Cuda out of Memory オープンquestion
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
question
難易度 5/5 1週間以上 初心者へのやさしさ 20/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 35/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
Minio Support オープンenhancement
難易度 3/5 1〜2日 初心者へのやさしさ 45/100
-
Why Do Results from MCP-Trained Models Differ Greatly Between generate_benchmarks.py and train.py オープンquestion
難易度 4/5 3〜5日 初心者へのやさしさ 32/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
bug
難易度 3/5 1〜2日 初心者へのやさしさ 35/100
-
enhancement
難易度 3/5 1〜2日 初心者へのやさしさ 45/100
-
bug
難易度 5/5 1週間以上 初心者へのやさしさ 25/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
enhancement
難易度 4/5 3〜5日 初心者へのやさしさ 35/100
-
About appropriate groups_per_step parameter setting given training and validation dataset volume オープンquestion
難易度 5/5 1週間以上 初心者へのやさしさ 20/100
-
enhancement
難易度 4/5 3〜5日 初心者へのやさしさ 42/100
-
question
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
bug
難易度 4/5 3〜5日 初心者へのやさしさ 25/100
-
enhancement
難易度 4/5 3〜5日 初心者へのやさしさ 35/100
-
enhancement
難易度 2/5 1〜3時間 初心者へのやさしさ 52/100
-
enhancement
難易度 5/5 1週間以上 初心者へのやさしさ 25/100