Feature request: add an option to summarize and analyze agent trace with LLM after each run
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 25/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Ferma
- Stack tecnologico
- python
- Ambito
- ai, observability, testing
Direzione di ricerca
Inizia esaminando la pipeline di eval e gli script referenziati nell’issue, quindi determina dove un’analisi post-esecuzione opzionale potrebbe ricevere le tracce degli agenti e il contesto di valutazione. Il lavoro sarà completato quando la pipeline potrà produrre opzionalmente un riepilogo e un’analisi LLM che aiutino a interpretare il comportamento degli agenti e i risultati di benchmark o fault-injection.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
https://github.com/microsoft/AIOpsLab/issues/101
I have developed some scripts to do this, but it may be valuable to integrate this into the eval pipeline.
Currently, we lack observability in agent behaviors:
- Traces are long, and nobody bothers to read them
- Traces alone are not enough. We also need the evaluation and fault-injection logic to understand the run better.
- Many times, the agent did the right thing, but there are bugs in the benchmark itself.
For summary and analysis, we can feed the context to the most advanced LLM with a better reasoning capability and a larger context length at a low cost(because it is one-step).
- Lingua principale
- Python
- Stelle
- 989
- Fork
- 176
- Merge medio
- 7g 15h
- PR unite (30g)
- 3
Guida per i contributori
Apri la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di microsoft/AIOpsLab
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 72/100
-
Regarding to the case #162 Aperta
Difficoltà 3/5 1-2 giorni Idoneità per principianti 35/100
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 35/100
Tutte le issue di microsoft/AIOpsLab
Issue simili
-
area: harness bug status: needs-triage
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
Human-Agent-Society/reef#625 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 70/100
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 80/100
learningequality/kolibri#15351 · 2 commenti ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
-
Name consistency Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
eellak/triplestore#65 · 1 commento ·