Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Failure to load HETERO models across multi GPU setup.

Abierto
#3,812 1 comentario 0 reacciones 0 asignados Ver en GitHub

Los mantenedores suelen responder en 1 día

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
5/5
Tiempo estimado
Más de una semana
Aptitud para principiantes
25/100
Tipo de issue
Error
Claridad
Necesita aclaración
Estado de actividad
Estancado
Stack tecnológico
cpp, python
Área
ai, backend

Línea de trabajo

Comienza reproduciendo la conversión de Qwen3-32B con el comando export_model.py proporcionado y cargándolo con la configuración de OVMS mostrada. Después, inspecciona las rutas de OpenVINO registradas, especialmente src/plugins/hetero/src/compiled_model.cpp y src/plugins/intel_gpu/src/plugin/program_builder.cpp, mientras comparas una versión de OVMS anterior a agosto. El trabajo estará terminado cuando la configuración exacta HETERO:GPU.0,GPU.1 se cargue sin CL_INVALID_KERNEL_ARGS.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

bug

Describe the bug
When loading a larger model (Qwen3-32B) using a HETERO:GPU.0,GPU.1 config, the error Invalid Kernel Args appears.

To Reproduce
Steps to reproduce the behavior:

  1. Download the Qwen3-32B model and convert using the latest export_model.py script. Command to convert as follows:

python export_model.py text_generation --source_model Qwen/Qwen3-32B --config_file_path /media/models/config.json --weight-format int4 --overwrite_models --target_device HETERO:GPU.0,GPU.1 --extra_quantization_params "--awq --group-size 128" --kv_cache_precision u8 --cache_size 6 --model_repository_path /media/models --reasoning_parser qwen3

  1. Compile OVMS from source for Ubuntu24 and run using:

export LD_LIBRARY_PATH=/devtools/openvino/ovms/lib
export PATH=$PATH:
/devtools/openvino/ovms/bin
export PYTHONPATH=~/devtools/openvino/ovms/lib/python
ovms --config_path /media/models/config.json --rest_port 9033 --log_level DEBUG

  1. Kernel load error as seen below.

Expected behavior
As with previous versions (as well as previous drivers for the GPU), the model correctly loads and works. To be clear, this exact model with exact config DID PREVIOUSLY load on older versions of OVMS but no longer works.

Logs
[2025-11-24 07:07:08.665][33451][serving][error][servable_initializer.cpp:214] Error during llm node initialization for models_path: /media/models/Qwen/Qwen3-32B/./ exception: Exception from src/inference/src/cpp/core.cpp:114:
Exception from src/inference/src/dev/plugin.cpp:53:
Exception from src/plugins/hetero/src/compiled_model.cpp:36:
Standard exception from compilation library: Exception from src/inference/src/dev/plugin.cpp:53:
Check 'false' failed at src/plugins/intel_gpu/src/plugin/program_builder.cpp:163:
[GPU] ProgramBuilder build failed!
Exception from src/plugins/intel_gpu/src/runtime/ocl/ocl_common.hpp:40:
[GPU] clEnqueueNDRangeKernel, error code: -52 CL_INVALID_KERNEL_ARGS

[2025-11-24 07:07:08.665][33451][modelmanager][error][servable_initializer.cpp:437] Error during LLM node resources initialization: The LLM Node resource initialization failed

Configuration

  1. OVMS version: built from source.
  2. OVMS config.json file:

{
"model_config_list": [
{
"config": {
"name": "Qwen/Qwen3-32B",
"base_path": "Qwen/Qwen3-32B"
}
}
]
}

  1. CPU, accelerator's versions if applicable: 11600KF, 3 x Intel Arc A770's with latest drivers as installed by the Client GPU guide on Intel's official documentation, linked from the Openvino documentation.
  2. /media/models/Qwen/Qwen3-32B/
  3. Qwen3-32B fails when converted.

Additional context
I have tried smaller cache sizes but this doesn't do anything. The model used to load perfectly on versions of OVMS pre August, however this no longer seems to be the case. I have done a completely fresh install of Ubuntu Server 24.04.3 LTS with the latest drivers for the GPUs from Intel.

Lenguaje dominante
C++
Estrellas
932
Forks
278
Merge medio
2 d 23 h
PR fusionados (30 d)
68

Preparar el entorno

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de openvinotoolkit/model_server

Todos los issues de openvinotoolkit/model_server

Issues similares

Más issues de C++

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.