Hacktoberfest 2026:メンテナが10月に向けて印を付けた、オープンで初心者向けの issue。 Hacktoberfest の issue を見る

[Feature] GRPO-based Agent Evolution

オープン
#9 コメント 0 件 リアクション 0 件 担当者 0 名 GitHub で見る

まだ誰も着手していません。

評価

難易度
5/5
見積もり時間
1週間以上
初心者へのやさしさ
25/100
issue の種類
機能追加
明瞭さ
説明が足りない
活発さ
静か
技術スタック
python

調査の方向性

まず、既存のSFTベースのLoRA進化パイプラインとプロジェクトのロードマップを読みます。軌跡の収集とトレーニングの各段階がどこで定義されているかを確認し、その後、GRPOの範囲、報酬シグナル、評価基準をメンテナーと明確にします。このissueでは、具体的な実装も完了テストもまだ定義されていません。

索引モデルが issue の本文から書いたものです。

説明

Currently Ultron seems to rely on SFT-based LoRA training for evolution.

Have you considered introducing a GRPO stage after SFT?

A possible pipeline could be:

Trajectory Collection
→ SFT LoRA
→ GRPO Optimization

Reward signals could come from:

  • Task success
  • Tool execution success
  • Planning efficiency
  • Skill reuse quality

I think reinforcement learning may be a natural next step for Agent Evolution because it optimizes trajectories instead of only imitating them.

In addition, compared with pure SFT, reinforcement learning may help preserve previously acquired capabilities while optimizing new behaviors, potentially reducing catastrophic forgetting during continuous evolution.

Curious whether this has already been discussed in the roadmap.

主要言語
Python
スター
180
フォーク
24
PR マージ指標
30日以内にマージされた PR はありません

環境構築

このプロジェクトの環境構築ファイルはまだ確認していません。まず README を読み、一般的な手順ははじめてのコントリビューションガイドを参照してください。

はじめの一歩

  1. issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
  2. 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
  3. リポジトリをフォークし、ブランチを切って変更します。
  4. issue 番号を参照したプルリクエストを送ります。

modelscope/ultron のほかの issue

modelscope/ultron の issue をすべて見る

似ている issue

Python の issue をもっと見る

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。