[Guiding Goal]
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 25/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Tranquilla
- Stack tecnologico
- python
- Ambito
- ai, machine-learning
Direzione di ricerca
Inizia con l’implementazione minimale collegata in minimal/agent_func_complete.py, quindi esamina le issue #1 e #5 per i modelli e i benchmark disponibili. La fase è completata quando le tabelle della valutazione di Pure e dell’addestramento RL contengono i risultati relativi a modello, benchmark e prestazioni nell’ambito dei vincoli indicati di rollout, verification e simple-RL.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
The goal of this phase of the project is to fill in the two tables below. Note the goal doesn't include building a central framework for evals or training, performance tuning, scaling beyond a reasonable amount.
Pure evaluation:
| Model | Benchmark | Performance |
| ... | ... | ... |
| ... | ... | ... |
RL training:
| Model | Benchmark | Performance |
| ... | ... | ... |
| ... | ... | ... |
where choices are listed (and can be appended to) here:
Some other constraints for the first phase:
- Multi-step, single-submission rollouts. See implementation.
- Verification hierarchy fixed: AST syntax checking -> Linter -> Type Checker -> Benchmark provided tests
- Simple RL algorithm e.g. GRPO.
In the second stage, we'll discuss the results from this phase and explore at least three branches. For now, hold off on these.
- RL approaches e.g. DAgger like approaches, RLIF, PPO vs GRPO, potentially custom developments.
- Performance tuning: container startup times (and the splitting of verifiers across containers), scaling bottlenecks, custom GPU kernels or handwritten-optimized backward passes (unsloth).
- Richer static analysis (control flow, data flow), dynamic tracing etc. to augment context.
- Lingua principale
- Python
- Stelle
- 1
- Fork
- 4
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Preparare l'ambiente
Non abbiamo ancora controllato i file di configurazione di questo progetto. Parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di redhat-et/code-agent
-
Add Multi-Pass Implementation for SWE-Bench EvalForse di nuovo libera @ilya-kolchinsky l’ha presa 130 giorni fa e non c’è nessuna pull request aperta. Aperta
redhat-et/code-agent#25 · 1 assegnatario ·
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 35/100
redhat-et/code-agent#22 ·
-
Create baseline evaluation pipeline using the HumanEval benchmarkForse di nuovo libera @lmzuccarelli l’ha presa 162 giorni fa e non c’è nessuna pull request aperta. Apertawip
redhat-et/code-agent#15 · 1 assegnatario ·
-
Create baseline evaluation pipeline of the ODEX dataset on Devstral Small 2Forse di nuovo libera @ilya-kolchinsky l’ha presa 163 giorni fa e non c’è nessuna pull request aperta. Aperta
redhat-et/code-agent#13 · 1 assegnatario ·
-
SkyPilotForse di nuovo libera @MichaelClifford l’ha presa 130 giorni fa e non c’è nessuna pull request aperta. Aperta
redhat-et/code-agent#11 · 1 assegnatario ·
Tutte le issue di redhat-et/code-agent
Issue simili
-
good first issue
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
vllm-project/vllm-metal#822 ·
I maintainer di solito rispondono entro 1 giorno
-
vector-store
Difficoltà 1/5 1-3 ore Idoneità per principianti 90/100
mem0ai/mem0#7461 · 1 commento ·
I maintainer di solito rispondono entro 1 giorno
-
[Bug]: chunk_span_bounds and _validated_chunk_spans reject Pydantic models ChunkSpan and AudioFileAperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
BasedHardware/omi#19047 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
I maintainer di solito rispondono entro 1 giorno