[Feature] GRPO-based Agent Evolution
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 25/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Tranquilla
- Stack tecnologico
- python
- Ambito
- ai, machine-learning
Direzione di ricerca
Inizia leggendo la pipeline esistente di evoluzione di LoRA basata su SFT e la roadmap del progetto. Determina dove sono definite le fasi di raccolta delle traiettorie e di addestramento, quindi chiarisci con i maintainer l’ambito di GRPO, i segnali di ricompensa e i criteri di valutazione; l’issue non definisce ancora un’implementazione concreta né un test di completamento.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Currently Ultron seems to rely on SFT-based LoRA training for evolution.
Have you considered introducing a GRPO stage after SFT?
A possible pipeline could be:
Trajectory Collection
→ SFT LoRA
→ GRPO Optimization
Reward signals could come from:
- Task success
- Tool execution success
- Planning efficiency
- Skill reuse quality
I think reinforcement learning may be a natural next step for Agent Evolution because it optimizes trajectories instead of only imitating them.
In addition, compared with pure SFT, reinforcement learning may help preserve previously acquired capabilities while optimizing new behaviors, potentially reducing catastrophic forgetting during continuous evolution.
Curious whether this has already been discussed in the roadmap.
- Lingua principale
- Python
- Stelle
- 180
- Fork
- 24
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di modelscope/ultron
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 20/100
modelscope/ultron#10 ·
-
[Feature] Agent evolution Aperta
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
modelscope/ultron#6 ·
-
[Feature] Skill evolution Aperta
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
modelscope/ultron#5 ·
Tutte le issue di modelscope/ultron
Issue simili
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 75/100
-
hcocena Apertapolicies-accepted pre-review precheck-passed
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 88/100
Bioconductor/BiocContributions#214 · 5 commenti ·
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 92/100
TencentCloud/Octop#1169 · 1 commento ·
-
[开源推荐] 在老板拷问你之前,先让 AI 灵魂拷问你 Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 70/100
521xueweihan/HelloGitHub#3778 ·
-
The version checker's trailing attribute region has no control for a less-than inside a quoted value Apertaarea: dashboard area: tests bug perceived difficulty: 2 python
Difficoltà 2/5 1-3 ore Idoneità per principianti 84/100
Nitjsefnie-Harness-Commons/daedalus#1105 · 1 commento ·