Context window incorrectly capped at 8192 tokens when using Ollama (token count exceeded 8192)
I maintainer di solito rispondono entro 3 giorni
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Idoneità per principianti
- 35/100
Direzione di ricerca
Inizia riproducendo l’errore token count exceeded 8192 attraverso il percorso di rollout LangGraph init_chat_model e il percorso di scoring RULER, quindi traccia come ciascun percorso ottiene o applica il limite di contesto di Ollama. Il lavoro è completato quando sia le chiamate dell’agente sia quelle del giudice rispettano una finestra di contesto configurata o derivata dal modello superiore a 8192 e il comportamento è documentato o configurabile.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Description
I’m using ART with a local Ollama server as the inference backend (for both the agent model and judge models). I’ve configured my Ollama model with a context window well above 8192 tokens (e.g. ctx: 16384) and adjusted num_predict accordingly.
However, in many runs I still get errors like:
token count exceeded 8192
This happens even though:
-
The Ollama model is configured with
ctx > 8192(for example 16384). -
I’m explicitly passing the correct base URL pointing to my local Ollama server for:
- The agent model (used by
init_chat_model) - The judge model (RULER)
- Any other inference calls
- The agent model (used by
This suggests there is a hardcoded or implicit max token limit of 8192 somewhere in ART/RULER, or in how token counts are computed, independent of the actual model’s context window.
What I expect
-
ART should respect the context window of the underlying model or the configured
ctxwhen running through Ollama. -
If a hard limit exists (e.g. 8192), it should be:
- Documented and configurable; or
- Derived from the model’s metadata, not hard-coded.
What actually happens
-
Even with a model and server configured to support > 8k context, I regularly get
token count exceeded 8192errors. -
This happens when:
- Running rollouts with a LangGraph agent via
init_chat_model - Running RULER scoring with the same Ollama backend
- Running rollouts with a LangGraph agent via
Environment
- Backend: Local Ollama server
- Model: Qwen / other Ollama-hosted model (with
ctx> 8192) - ART: latest version (as of date of issue)
- Using ART’s LangGraph integration (
init_chat_model) and RULER scoring
Questions / Requests
- Is there an internal default limit of 8192 tokens that’s applied regardless of the model’s context?
- Can you expose this limit via configuration, or derive it from the model / backend rather than hardcoding?
- Any guidance on how to set ART/RULER up so that it fully respects Ollama’s larger
ctx?
- Lingua principale
- Python
- Stelle
- 10.8k
- Fork
- 989
- Merge medio
- 11h 38m
- PR unite (30g)
- 104
Preparare l'ambiente
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di OpenPipe/ART
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 72/100
I maintainer di solito rispondono entro 3 giorni
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 54/100
OpenPipe/ART#961 · 3 commenti ·
I maintainer di solito rispondono entro 3 giorni
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
OpenPipe/ART#949 · 5 commenti ·
I maintainer di solito rispondono entro 3 giorni
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 10/100
I maintainer di solito rispondono entro 3 giorni
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 42/100
I maintainer di solito rispondono entro 3 giorni
Tutte le issue di OpenPipe/ART
Issue simili
-
needs triage
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
I maintainer di solito rispondono entro 2 giorni
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100
openvinotoolkit/openvino_notebooks#3665 ·
I maintainer di solito rispondono entro 1 giorno
-
bug
Difficoltà 2/5 1-3 ore Idoneità per principianti 86/100
I maintainer di solito rispondono entro 1 giorno
-
docs
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
I maintainer di solito rispondono entro 1 giorno
-
benchmark-gap
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
I maintainer di solito rispondono entro 1 giorno