Qwen3.5-35B-A3B-int4-ov gibberish output during high memory pressure
Los mantenedores suelen responder en 1 día
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 52/100
- Tipo de issue
- Error
- Claridad
- Bastante claro
- Estado de actividad
- Activo
- Stack tecnológico
- python
- Área
- ai, backend-api-design
Línea de trabajo
Reproduce el problema con pycurl.py usando la configuración de OVMS 2026.2.0, el modelo Qwen3.5-35B-A3B-int4-ov y la configuración graph.pbtxt. Empieza ejecutando los comandos documentados de configuración y del cliente con la entrada de 16,389 tokens y la salida de 512 tokens; después, inspecciona los logs y la configuración indicados. Se considera terminado cuando la misma solicitud devuelve una respuesta correcta en lugar de texto ininteligible bajo la presión de memoria especificada.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Describe the bug
When inferencing the model with an input token count of 16389 and an output token count of 512, the returned response is gibberish (All Exclamation Marks).
To Reproduce
Steps to reproduce the behavior:
- Download ovms_windows_2026.2.0_python_off.zip
- Download models from HuggingFace
- CD into downloaded ovms folder, run
setupvars.bat - OVMS launch command: .\ovms --rest_port 8180 --config_path "C:\models\Qwen3.5-35B-A3B-int4-ov\model_config.json"
- Client command: python pycurl.py
Expected behavior
A proper response regarding the question.
Logs
Configuration
- OVMS version:
2026.2.0 - OVMS config.json file
{
"mediapipe_config_list": [
{
"name": "Qwen3.5-35B-A3B-int4-ov",
"base_path": "C:\\models\\Qwen3.5-35B-A3B-int4-ov"
}
],
"model_config_list": []
}
- CPU, accelerator's versions if applicable
Intel(R) Core(TM) Ultra X7 358H, 1900 Mhz, 16 Core(s), 16 Logical Processor(s)
Intel(R) Arc(TM) B390 GPU
32 GB 8533Mt/s
Driver version `32.0.101.8801`
- Model repository directory structure
C:.
| .gitattributes
| chat_template.jinja
| config.json
| generation_config.json
| graph.pbtxt
| model_config.json
| openvino_config.json
| openvino_detokenizer.bin
| openvino_detokenizer.xml
| openvino_language_model.bin
| openvino_language_model.xml
| openvino_text_embeddings_model.bin
| openvino_text_embeddings_model.xml
| openvino_tokenizer.bin
| openvino_tokenizer.xml
| openvino_vision_embeddings_merger_model.bin
| openvino_vision_embeddings_merger_model.xml
| openvino_vision_embeddings_model.bin
| openvino_vision_embeddings_model.xml
| openvino_vision_embeddings_pos_model.bin
| openvino_vision_embeddings_pos_model.xml
| preprocessor_config.json
| processor_config.json
| README.md
| tokenizer.json
| tokenizer_config.json
|
\---.cache
\---huggingface
| .gitignore
|
\---download
.gitattributes.metadata
chat_template.jinja.metadata
config.json.metadata
generation_config.json.metadata
openvino_config.json.metadata
openvino_detokenizer.bin.metadata
openvino_detokenizer.xml.metadata
openvino_language_model.bin.metadata
openvino_language_model.xml.metadata
openvino_text_embeddings_model.bin.metadata
openvino_text_embeddings_model.xml.metadata
openvino_tokenizer.bin.metadata
openvino_tokenizer.xml.metadata
openvino_vision_embeddings_merger_model.bin.metadata
openvino_vision_embeddings_merger_model.xml.metadata
openvino_vision_embeddings_model.bin.metadata
openvino_vision_embeddings_model.xml.metadata
openvino_vision_embeddings_pos_model.bin.metadata
openvino_vision_embeddings_pos_model.xml.metadata
preprocessor_config.json.metadata
processor_config.json.metadata
README.md.metadata
tokenizer.json.metadata
tokenizer_config.json.metadata
- Model or publicly available similar model that reproduces the issue
OpenVINO/Qwen3.5-35B-A3B-int4-ov
Additional context
graph.pbtxt:
input_stream: "HTTP_REQUEST_PAYLOAD:input"
output_stream: "HTTP_RESPONSE_PAYLOAD:output"
node: {
name: "LLMExecutor"
calculator: "HttpLLMCalculator"
input_stream: "LOOPBACK:loopback"
input_stream: "HTTP_REQUEST_PAYLOAD:input"
input_side_packet: "LLM_NODE_RESOURCES:llm"
output_stream: "LOOPBACK:loopback"
output_stream: "HTTP_RESPONSE_PAYLOAD:output"
input_stream_info: {
tag_index: 'LOOPBACK:0'
back_edge: true
}
node_options: {
[type.googleapis.com/mediapipe.LLMCalculatorOptions]: {
models_path: "./"
plugin_config: '{}'
enable_prefix_caching: true
dynamic_split_fuse: false
max_num_seqs: 15
max_num_batched_tokens: 131072
device: "GPU"
}
}
input_stream_handler {
input_stream_handler: "SyncSetInputStreamHandler"
options {
[mediapipe.SyncSetInputStreamHandlerOptions.ext] {
sync_set {
tag_index: "LOOPBACK:0"
}
}
}
}
}
pycurl.py
import json
import requests
# 1. Configure the API endpoint and model parameters
url = "http://127.0.0.1:8180/v3/chat/completions"
model_name = "Qwen3.5-35B-A3B-int4-ov"
base_sentence = "What is OpenVINO? Please explain with examples. " # This has 11 tokens
num_repetitions = 1489
prompt_content = base_sentence * num_repetitions
# 3. Construct the payload
payload = {
"model": model_name,
"messages": [
{
"role": "user",
"content": prompt_content
}
],
"max_tokens": 512,
"temperature": 0
}
headers = {
"Content-Type": "application/json"
}
# 4. Send the request
try:
response = requests.post(url, headers=headers, json=payload)
if response.status_code == 200:
print("Success! Response from server:")
print(json.dumps(response.json(), indent=2))
else:
print(f"Failed with status code: {response.status_code}")
print(response.text)
except requests.exceptions.RequestException as e:
print(f"An error occurred while connecting to the server: {e}")
- Lenguaje dominante
- C++
- Estrellas
- 932
- Forks
- 278
- Merge medio
- 3 d 5 h
- PR fusionados (30 d)
- 70
Preparar el entorno
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de openvinotoolkit/model_server
-
Dificultad 3/5 1-2 días Aptitud para principiantes 58/100
openvinotoolkit/model_server#4613 · 1 asignado ·
Los mantenedores suelen responder en 1 día
-
enhancement
Dificultad 3/5 1-2 días Aptitud para principiantes 68/100
openvinotoolkit/model_server#4609 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
`/v3/models` lists every model twice when `group_name` and `--idle_unload_timeout_seconds` are combinedPosiblemente ocupada @atobiszei la tomó hace 5 días. Abierto
openvinotoolkit/model_server#4604 · 1 reacción · 1 asignado ·
Los mantenedores suelen responder en 1 día
-
Idle unload never happens again if the client disconnects while a sleeping graph is waking upPosiblemente ocupada @atobiszei la tomó hace 5 días. Abierto
openvinotoolkit/model_server#4603 · 1 asignado ·
Los mantenedores suelen responder en 1 día
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 45/100
openvinotoolkit/model_server#4599 · 4 comentarios ·
Los mantenedores suelen responder en 1 día
Todos los issues de openvinotoolkit/model_server
Issues similares
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 92/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
cp-algorithms/cp-algorithms#1715 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
Icinga/icinga2#11058 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
status:needs-triage
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
PX4/PX4-Autopilot#28924 ·
Los mantenedores suelen responder en 1 día
-
component: split-view platform: windows
Dificultad 2/5 1-3 horas Aptitud para principiantes 74/100
zen-browser/desktop#15616 · 1 reacción ·
Los mantenedores suelen responder en 1 día