OpenPipe/ART
Ver en GitHubAgent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!
- Estrellas
- 10.8k
- Forks
- 989
- Issues abiertos para principiantes
- 1
- Issues indexados
- 72
- Merge medio
- 6 h 29 min
- PR fusionados (30 d)
- 85
- Lenguaje dominante
- Python
- Licencia
- Apache-2.0
- Último push a GitHub
- 19/9/2026
- Última indexación
- 20/9/2026
- Guía de contribución
- Guía de contribución
- Código de conducta
- Sin código de conducta
- Etiquetas para principiantes
- Sin etiquetas para principiantes indexadas
-
enhancement
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
-
Investigate output and gradient variability between matched same-source Qwen TrainerRank actors Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 30/100
-
Determine whether a large dynamics RL batch refusal is necessary or avoidable by execution layout Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100
-
Dificultad 4/5 3-5 días Aptitud para principiantes 50/100
-
bug
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
-
Dificultad 3/5 1-2 días Aptitud para principiantes 62/100
-
Dificultad 4/5 3-5 días Aptitud para principiantes 55/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
-
auto_rl example uses Abierto
Dificultad 3/5 1-2 días Aptitud para principiantes 56/100
-
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
-
Dificultad 3/5 1-2 días Aptitud para principiantes 52/100
-
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
question
Dificultad 3/5 1-2 días Aptitud para principiantes 42/100
-
discussion
Dificultad 5/5 Más de una semana Aptitud para principiantes 30/100
-
W&B offline Abiertoquestion
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
bug
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
bug
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
-
bug
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Context window incorrectly capped at 8192 tokens when using Ollama (token count exceeded 8192) Abiertobug
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
-
question
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Training hangs after a few steps Abiertobug
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
Cuda out of Memory Abiertoquestion
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
question
Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
-
Cuda error in RULER notebook Abiertobug
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
Minio Support Abiertoenhancement
Dificultad 3/5 1-2 días Aptitud para principiantes 45/100
-
Why Do Results from MCP-Trained Models Differ Greatly Between generate_benchmarks.py and train.py Abiertoquestion
Dificultad 4/5 3-5 días Aptitud para principiantes 32/100
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
bug
Dificultad 3/5 1-2 días Aptitud para principiantes 35/100
-
enhancement
Dificultad 3/5 1-2 días Aptitud para principiantes 45/100
-
bug
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
-
Always Block when train Abiertobug
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
enhancement
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
-
About appropriate groups_per_step parameter setting given training and validation dataset volume Abiertoquestion
Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100
-
enhancement
Dificultad 4/5 3-5 días Aptitud para principiantes 42/100
-
[Question] About 2048 scoring Abiertoquestion
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
Training crashes after sometime Abiertobug
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
-
Feature: Dr. GRPO Support Abiertoenhancement
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
-
enhancement
Dificultad 2/5 1-3 horas Aptitud para principiantes 52/100
-
enhancement
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100