Qwen3.5-35B-A3B-int4-ov gibberish output during high memory pressure
Maintainer thường phản hồi trong vòng 2 ngày
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức phù hợp với người mới
- 52/100
- Loại issue
- Lỗi
- Độ rõ ràng
- Khá rõ ràng
- Mức độ hoạt động
- Sôi nổi
- Công nghệ
- python
- Lĩnh vực
- ai, backend-api-design
Hướng nghiên cứu
Tái hiện vấn đề với pycurl.py trên thiết lập OVMS 2026.2.0, sử dụng model Qwen3.5-35B-A3B-int4-ov và cấu hình graph.pbtxt. Trước tiên, chạy các lệnh setup và client được ghi lại với đầu vào 16,389 token và đầu ra 512 token, sau đó kiểm tra các log và cấu hình được báo cáo. Hoàn thành khi cùng một request trả về phản hồi phù hợp thay vì nội dung vô nghĩa trong điều kiện áp lực bộ nhớ đã nêu.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
Describe the bug
When inferencing the model with an input token count of 16389 and an output token count of 512, the returned response is gibberish (All Exclamation Marks).
To Reproduce
Steps to reproduce the behavior:
- Download ovms_windows_2026.2.0_python_off.zip
- Download models from HuggingFace
- CD into downloaded ovms folder, run
setupvars.bat - OVMS launch command: .\ovms --rest_port 8180 --config_path "C:\models\Qwen3.5-35B-A3B-int4-ov\model_config.json"
- Client command: python pycurl.py
Expected behavior
A proper response regarding the question.
Logs
Configuration
- OVMS version:
2026.2.0 - OVMS config.json file
{
"mediapipe_config_list": [
{
"name": "Qwen3.5-35B-A3B-int4-ov",
"base_path": "C:\\models\\Qwen3.5-35B-A3B-int4-ov"
}
],
"model_config_list": []
}
- CPU, accelerator's versions if applicable
Intel(R) Core(TM) Ultra X7 358H, 1900 Mhz, 16 Core(s), 16 Logical Processor(s)
Intel(R) Arc(TM) B390 GPU
32 GB 8533Mt/s
Driver version `32.0.101.8801`
- Model repository directory structure
C:.
| .gitattributes
| chat_template.jinja
| config.json
| generation_config.json
| graph.pbtxt
| model_config.json
| openvino_config.json
| openvino_detokenizer.bin
| openvino_detokenizer.xml
| openvino_language_model.bin
| openvino_language_model.xml
| openvino_text_embeddings_model.bin
| openvino_text_embeddings_model.xml
| openvino_tokenizer.bin
| openvino_tokenizer.xml
| openvino_vision_embeddings_merger_model.bin
| openvino_vision_embeddings_merger_model.xml
| openvino_vision_embeddings_model.bin
| openvino_vision_embeddings_model.xml
| openvino_vision_embeddings_pos_model.bin
| openvino_vision_embeddings_pos_model.xml
| preprocessor_config.json
| processor_config.json
| README.md
| tokenizer.json
| tokenizer_config.json
|
\---.cache
\---huggingface
| .gitignore
|
\---download
.gitattributes.metadata
chat_template.jinja.metadata
config.json.metadata
generation_config.json.metadata
openvino_config.json.metadata
openvino_detokenizer.bin.metadata
openvino_detokenizer.xml.metadata
openvino_language_model.bin.metadata
openvino_language_model.xml.metadata
openvino_text_embeddings_model.bin.metadata
openvino_text_embeddings_model.xml.metadata
openvino_tokenizer.bin.metadata
openvino_tokenizer.xml.metadata
openvino_vision_embeddings_merger_model.bin.metadata
openvino_vision_embeddings_merger_model.xml.metadata
openvino_vision_embeddings_model.bin.metadata
openvino_vision_embeddings_model.xml.metadata
openvino_vision_embeddings_pos_model.bin.metadata
openvino_vision_embeddings_pos_model.xml.metadata
preprocessor_config.json.metadata
processor_config.json.metadata
README.md.metadata
tokenizer.json.metadata
tokenizer_config.json.metadata
- Model or publicly available similar model that reproduces the issue
OpenVINO/Qwen3.5-35B-A3B-int4-ov
Additional context
graph.pbtxt:
input_stream: "HTTP_REQUEST_PAYLOAD:input"
output_stream: "HTTP_RESPONSE_PAYLOAD:output"
node: {
name: "LLMExecutor"
calculator: "HttpLLMCalculator"
input_stream: "LOOPBACK:loopback"
input_stream: "HTTP_REQUEST_PAYLOAD:input"
input_side_packet: "LLM_NODE_RESOURCES:llm"
output_stream: "LOOPBACK:loopback"
output_stream: "HTTP_RESPONSE_PAYLOAD:output"
input_stream_info: {
tag_index: 'LOOPBACK:0'
back_edge: true
}
node_options: {
[type.googleapis.com/mediapipe.LLMCalculatorOptions]: {
models_path: "./"
plugin_config: '{}'
enable_prefix_caching: true
dynamic_split_fuse: false
max_num_seqs: 15
max_num_batched_tokens: 131072
device: "GPU"
}
}
input_stream_handler {
input_stream_handler: "SyncSetInputStreamHandler"
options {
[mediapipe.SyncSetInputStreamHandlerOptions.ext] {
sync_set {
tag_index: "LOOPBACK:0"
}
}
}
}
}
pycurl.py
import json
import requests
# 1. Configure the API endpoint and model parameters
url = "http://127.0.0.1:8180/v3/chat/completions"
model_name = "Qwen3.5-35B-A3B-int4-ov"
base_sentence = "What is OpenVINO? Please explain with examples. " # This has 11 tokens
num_repetitions = 1489
prompt_content = base_sentence * num_repetitions
# 3. Construct the payload
payload = {
"model": model_name,
"messages": [
{
"role": "user",
"content": prompt_content
}
],
"max_tokens": 512,
"temperature": 0
}
headers = {
"Content-Type": "application/json"
}
# 4. Send the request
try:
response = requests.post(url, headers=headers, json=payload)
if response.status_code == 200:
print("Success! Response from server:")
print(json.dumps(response.json(), indent=2))
else:
print(f"Failed with status code: {response.status_code}")
print(response.text)
except requests.exceptions.RequestException as e:
print(f"An error occurred while connecting to the server: {e}")
- Ngôn ngữ chính
- C++
- Star
- 932
- Fork
- 278
- Merge trung bình
- 2 ngày 15 giờ
- Pull request đã merge (30 ngày)
- 60
Chuẩn bị môi trường
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của openvinotoolkit/model_server
-
bug
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 68/100
openvinotoolkit/model_server#4609 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 2 ngày
-
`/v3/models` lists every model twice when `group_name` and `--idle_unload_timeout_seconds` are combinedCó thể đã có người làm @atobiszei đã nhận 3 ngày trước. Đang mở
openvinotoolkit/model_server#4604 · 1 người được giao ·
Maintainer thường phản hồi trong vòng 2 ngày
-
Idle unload never happens again if the client disconnects while a sleeping graph is waking upCó thể đã có người làm @atobiszei đã nhận 3 ngày trước. Đang mở
openvinotoolkit/model_server#4603 · 1 người được giao ·
Maintainer thường phản hồi trong vòng 2 ngày
-
bug
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 45/100
openvinotoolkit/model_server#4599 · 4 bình luận ·
Maintainer thường phản hồi trong vòng 2 ngày
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 55/100
openvinotoolkit/model_server#4586 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 2 ngày
Tất cả issue của openvinotoolkit/model_server
Issue tương tự
-
area/actorsystem bug tsan
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 74/100
ydb-platform/ydb#54282 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
bug needs triage
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 90/100
project-chip/connectedhomeip#74434 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 88/100
tenstorrent/tt-metal#58057 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 84/100
maplibre/maplibre-native#4690 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
comp-query-execution
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 84/100
ClickHouse/ClickHouse#122569 ·
Maintainer thường phản hồi trong vòng 1 ngày