Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Feature request: CPU offload / HETERO:GPU,CPU support for models exceeding VRAM in continuous batching

Abierto
#4,263 4 comentarios 0 reacciones 0 asignados Ver en GitHub

Los mantenedores suelen responder en 1 día

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
5/5
Tiempo estimado
Más de una semana
Aptitud para principiantes
35/100
Tipo de issue
Nueva funcionalidad
Claridad
Bastante claro
Estado de actividad
Tranquilo
Stack tecnológico
cpp

Línea de trabajo

Comienza en pipeline_impl.cpp:169 y rastrea la validación de continuous batching que rechaza HETERO:GPU,CPU. Determina cómo se representan los dispositivos de ejecución y dónde se aplica la selección de dispositivos; el trabajo estará terminado cuando una configuración GPU-primary pueda recurrir a CPU para modelos demasiado grandes sin deshabilitar continuous batching.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

I'm running an Intel Arc Pro B50 (16 GB GDDR6) and want to serve OpenVINO/Qwen3.6-35B-A3B-int4-ov (23.1 GB) with OVMS. The model is too large to fit entirely in VRAM, so I tried --target_device HETERO:GPU,CPU to spill the overflow into system RAM (96 GB available).

OVMS rejects this at startup:

Check 'all_gpu_device || execution_devices.size() == 1' failed at pipeline_impl.cpp:169:
Continuous batching: execution device is expected to be single CPU / single GPU / multi GPUs

I understand the continuous batching pipeline currently only accepts a single device or an all-GPU HETERO config. The only workaround is --target_device CPU, which forgoes GPU acceleration entirely.

Request: Support HETERO:GPU,CPU (or an equivalent GPU-primary-with-CPU-overflow mode) so models that slightly exceed VRAM can still benefit from GPU acceleration. For context, llama.cpp's SYCL backend already handles this on the same hardware Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf runs at ~32 tok/s generation on this GPU by offloading as many layers as fit into VRAM and spilling the rest to system RAM. Having comparable functionality in OVMS would make it practical to serve mid-to-large OpenVINO models on consumer/prosumer Intel Arc GPUs without needing an exact VRAM fit.

Hardware: Intel Arc Pro B50, 16 GB GDDR6, 96 GB system RAM, LXC container on Proxmox, openvino/model_server:latest-gpu (OVMS 2026.2.0 / OpenVINO GenAI 2026.2.0.0).

Lenguaje dominante
C++
Estrellas
932
Forks
278
Merge medio
3 d 5 h
PR fusionados (30 d)
70

Preparar el entorno

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de openvinotoolkit/model_server

Todos los issues de openvinotoolkit/model_server

Issues similares

Más issues de C++

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.