Validate the judge reward signal with human calibration and domain-specific evaluators
I maintainer di solito rispondono entro 4 giorni
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 38/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Abbastanza chiara
- Stato di attività
- Tranquilla
- Stack tecnologico
- python
- Ambito
- ai, machine-learning
Direzione di ricerca
Inizia individuando il design attuale delle ricompense dell’SDK, i giudici predefiniti e le interfacce del learning-core, quindi leggi le sezioni del whitepaper che descrivono intento, aderenza, completamento e ripesatura. Il lavoro è completato quando sono supportati un workflow di calibrazione documentato, valutatori collegabili, valori grezzi per metrica di ogni episodio e un report di esempio sulla correlazione con le valutazioni umane, senza modificare il learning core.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
The analysis notes that the SDK’s reward model is conceptually clear but still evidence-light: the paper specifies intent, adherence, and completion judges, but does not show that those judges actually correlate with human judgment or domain success. That is a direct risk to the learning loop because reward misspecification can cause the learner to optimize the wrong behavior.
This ticket should turn the current reward design from a plausible architecture into a validated measurement layer.
Suggested scope
Add a reward validation study that measures judge-to-human agreement.
Add support for custom evaluators so teams can plug in domain-specific checks.
Document how to evaluate whether the default judge weights are appropriate for a given workload.
Persist raw per-metric values and make it easy to reweight historical episodes without re-running judges, which the whitepaper already points to as an advantage.
Acceptance criteria
A documented calibration workflow exists for the default judges.
The SDK supports pluggable evaluators without changing the learning core.
A sample report shows how judge scores correlate with human review or task-success outcomes.
- Lingua principale
- Python
- Stelle
- 11
- Fork
- 11
- Merge medio
- 2g 5h
- PR unite (30g)
- 10
Preparare l'ambiente
Questo progetto non fornisce container di sviluppo, Dockerfile né guida per i contributori, quindi l'ambiente è a tuo carico: parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di microsoft/agent-learning
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 30/100
microsoft/agent-learning#28 ·
I maintainer di solito rispondono entro 4 giorni
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 35/100
microsoft/agent-learning#27 ·
I maintainer di solito rispondono entro 4 giorni
-
Investigate Native Integration with Microsoft Agent FrameworkForse già presa @jkafrouni l’ha presa 21 giorni fa. Aperta
microsoft/agent-learning#26 · 2 commenti · 1 assegnatario ·
I maintainer di solito rispondono entro 4 giorni
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 35/100
microsoft/agent-learning#25 ·
I maintainer di solito rispondono entro 4 giorni
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
microsoft/agent-learning#24 ·
I maintainer di solito rispondono entro 4 giorni
Tutte le issue di microsoft/agent-learning
Issue simili
-
defect from-review v0.9.2
Difficoltà 2/5 1-3 ore Idoneità per principianti 86/100
khuisman/mcp-gee-sweet#926 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 Meno di un'ora Idoneità per principianti 84/100
EtanHey/brainlayer#1164 ·
I maintainer di solito rispondono entro 1 giorno
-
bug security
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 88/100
yunaremaia/vibeguard#141 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 76/100
PrismorSec/prismor#599 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 72/100
iii-hq/iii#2278 · 1 commento ·
I maintainer di solito rispondono entro 1 giorno