`pinned: true` model is freed after every request — idle-unload exclusion (#9305) ineffective on v4.7.1
Los mantenedores suelen responder en 1 día
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 52/100
Línea de trabajo
Comienza en pkg/model/process.go, en la ruta de eliminación y Free() mostrada en los logs, y luego sigue cómo las configuraciones pinned y max_active_backends llegan a la limpieza del backend. Reproduce el comportamiento con las configuraciones de runtime de v4.7.1 indicadas y dos requests; se considera terminado cuando el proceso del backend de un modelo pinned permanece residente entre requests sin un timeout de inactividad.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Follow-up to #9305 / #9309 (exclude models from idle unloading via pinned: true). On v4.7.1 a pinned: true model is not kept resident — its backend process is torn down after every request, so each call pays a full cold reload.
Environment
- LocalAI
v4.7.1, imagelocalai/localai:v4.7.1-gpu-nvidia-cuda-13, single NVIDIA 16 GB GPU,llama-cpp(cuda13) backend. - Model YAML:
backend: llama-cpp,pinned: true,context_size: 24576. - Runtime settings:
watchdog_enabled: false,single_backend: false,max_active_backends: 0(docs: "0 = unlimited"),memory_reclaimer_enabled: false,size_aware_eviction: false,force_eviction_when_busy: false.
Expected
Per the docs ("a pinned model is never evicted") and #9305: with no watchdog, no LRU limit, and pinned: true, the model should stay loaded across requests.
Actual
The backend is freed immediately after each response completes (not after any idle timeout):
INFO ... Predict request completed successfully
DEBUG Deleting process model="qwen3.5-9b" (pkg/model/process.go:49)
DEBUG Calling Free() to release GPU resources model="qwen3.5-9b"
INFO Backend process stopped id="qwen3.5-9b" exitCode="0"
This repeats for every single request across the log; the next request cold-loads (~10 s). Confirmed via nvidia-smi: the backend process disappears seconds after each response and reloads on the next call.
Repro
- Load a
pinned: truellama-cpp model on v4.7.1 with the runtime settings above. - Send two chat completions about a minute apart.
- Observe (via
nvidia-smi) the backend process disappear after the first completes and reload for the second.
Question
Is pinned: true expected to keep a model resident, or only to exempt it from eviction while some other path still frees it? If max_active_backends: 0 (documented as "unlimited") is implicated, the "0 = unlimited" behaviour and the #9305 exclusion don't appear to hold. Net effect: pinned currently provides no persistence benefit — every request pays a full cold model load.
- Lenguaje dominante
- Go
- Estrellas
- 49.2k
- Forks
- 4.5k
- Merge medio
- 1 d 7 h
- PR fusionados (30 d)
- 362
Preparar el entorno
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de mudler/LocalAI
-
bug unconfirmed
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
mudler/LocalAI#12337 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
mudler/LocalAI#11995 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
mudler/LocalAI#11991 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
fish-speech: make compile:true usable on Blackwell sm_121 by honouring the CUDA toolkit's ptxasAbiertoenhancement
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
mudler/LocalAI#11348 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
barholeurAbiertobug unconfirmed
Dificultad 5/5 Más de una semana Aptitud para principiantes 10/100
Los mantenedores suelen responder en 1 día
Todos los issues de mudler/LocalAI
Issues similares
-
[Docs] - Document minimum Terraform/OpenTofu version (>= 1.11) required by write-only argumentsAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 92/100
MagaluCloud/terraform-provider-mgc#323 ·
Los mantenedores suelen responder en 11 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
rossoctl/context-guru#366 ·
Los mantenedores suelen responder en 1 día
-
stage-fail
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
siyuan-note/bazaar#2293 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
piraeusdatastore/piraeus-operator#1070 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
Los mantenedores suelen responder en 1 día