RULER scoring + training tightly coupled to Litellm/OpenAI, cannot cleanly use ChatOllama/ChatNVIDIA as judge/inference models
I maintainer di solito rispondono entro 1 giorno
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 25/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Ferma
- Stack tecnologico
- ollama, python
- Ambito
- ai, machine-learning
Direzione di ricerca
Inizia con ruler_score_group e i relativi helper, quindi esamina init_chat_model e la issue separata a cui fa riferimento. Traccia i punti in cui le assunzioni relative a LiteLLM e OpenAI entrano in RULER e nell’addestramento; il lavoro è completato quando il progetto supporta provider LangChain BaseChatModel come ChatOllama e ChatNVIDIA oppure documenta un percorso di integrazione per una judge_fn arbitraria.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Description
In my setup, I want to:
-
Use a local Ollama server (and potentially NVIDIA’s API in the future) as:
- The main agent model (for rollouts).
- The judge model (for RULER scoring).
However, the current ART stack makes this very difficult because:
- RULER scoring (
ruler_score_groupand related helpers) rely on Litellm in a way that expects OpenAI-style models. init_chat_modelalso wraps everything in aChatOpenAIinstance (see separate issue).- This means I cannot simply pass
ChatOllamaorChatNVIDIA(LangChain chat models) as the inference/judge model for training.
Practically:
-
If I try to step away from OpenAI and use:
- Local Ollama for inference
- Non-OpenAI providers as judges
-
I run into incompatibilities where:
- RULER expects Litellm’s OpenAI-style model identifiers and behavior.
- ART’s helpers are “too bound” to OpenAI semantics.
What I’d like
-
A more provider-agnostic design for:
- RULER scoring
- Training
init_chat_model
-
The ability to cleanly use:
ChatOllama(LangChain)ChatNVIDIA- or other LangChain
BaseChatModelimplementations
-
Without having to hack around Litellm / OpenAI assumptions.
Why this matters
-
ART is otherwise a great framework for agent RL.
-
Many users want to move to:
- Local models (Ollama)
- Different clouds (NVIDIA, etc.)
-
Tight coupling to OpenAI via Litellm in the RULER path makes this significantly harder.
Request
-
Please consider:
- Abstracting RULER to accept any LangChain-compatible
ChatModelfor structured scoring. - Or providing a documented way to plug in non-OpenAI judgment models (e.g. a “judge_fn” that uses arbitrary models).
- Abstracting RULER to accept any LangChain-compatible
- Lingua principale
- Python
- Stelle
- 10.8k
- Fork
- 997
- Merge medio
- 10h 1m
- PR unite (30g)
- 117
Preparare l'ambiente
- Nessun Dockerfile né file Docker Compose
- Nessun modello di pull request
- Leggi la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di OpenPipe/ART
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 72/100
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 54/100
OpenPipe/ART#961 · 3 commenti ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
OpenPipe/ART#949 · 5 commenti ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 10/100
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 42/100
I maintainer di solito rispondono entro 1 giorno
Tutte le issue di OpenPipe/ART
Issue simili
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 72/100
letsencrypt/cp-cps#353 ·
-
Marble Madness II is missingAperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 68/100
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 84/100
PedestrianDynamics/pyFDS-Evac#394 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
DOI-USGS/pywatershed#421 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
python-pillow/Pillow#10087 · 1 commento ·
I maintainer di solito rispondono entro 1 giorno