Hacktoberfest 2026: le issue che i maintainer hanno segnato per ottobre, aperte e adatte ai principianti. Sfoglia le issue Hacktoberfest

Qwen3.5-35B-A3B-int4-ov gibberish output during high memory pressure

Aperta
#4,345 4 commenti 0 reazioni 0 assegnatari Vedi su GitHub

I maintainer di solito rispondono entro 2 giorni

Nessuno ha ancora preso questa issue.

Valutazione

Difficoltà
4/5
Tempo stimato
3-5 giorni
Idoneità per principianti
52/100
Tipo di issue
Bug
Chiarezza
Abbastanza chiara
Stato di attività
Attiva
Stack tecnologico
python

Direzione di ricerca

Riprodurre il problema con pycurl.py usando il setup OVMS 2026.2.0, il modello Qwen3.5-35B-A3B-int4-ov e la configurazione graph.pbtxt. Iniziare eseguendo i comandi documentati di setup e del client con un input di 16,389 token e un output di 512 token, quindi esaminare i log e la configurazione riportati. Il lavoro è completato quando la stessa richiesta restituisce una risposta corretta invece di testo senza senso nelle condizioni di pressione della memoria indicate.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Descrizione

bug

Describe the bug
When inferencing the model with an input token count of 16389 and an output token count of 512, the returned response is gibberish (All Exclamation Marks).

To Reproduce
Steps to reproduce the behavior:

  1. Download ovms_windows_2026.2.0_python_off.zip
  2. Download models from HuggingFace
  3. CD into downloaded ovms folder, run setupvars.bat
  4. OVMS launch command: .\ovms --rest_port 8180 --config_path "C:\models\Qwen3.5-35B-A3B-int4-ov\model_config.json"
  5. Client command: python pycurl.py

Expected behavior
A proper response regarding the question.

Logs

Image Image Image

Configuration

  1. OVMS version: 2026.2.0
  2. OVMS config.json file
{
  "mediapipe_config_list": [
    {
      "name": "Qwen3.5-35B-A3B-int4-ov",
      "base_path": "C:\\models\\Qwen3.5-35B-A3B-int4-ov"
    }
  ],
  "model_config_list": []
}
  1. CPU, accelerator's versions if applicable
Intel(R) Core(TM) Ultra X7 358H, 1900 Mhz, 16 Core(s), 16 Logical Processor(s)
Intel(R) Arc(TM) B390 GPU
32 GB 8533Mt/s
Driver version `32.0.101.8801`
  1. Model repository directory structure
C:.
|   .gitattributes
|   chat_template.jinja
|   config.json
|   generation_config.json
|   graph.pbtxt
|   model_config.json
|   openvino_config.json
|   openvino_detokenizer.bin
|   openvino_detokenizer.xml
|   openvino_language_model.bin
|   openvino_language_model.xml
|   openvino_text_embeddings_model.bin
|   openvino_text_embeddings_model.xml
|   openvino_tokenizer.bin
|   openvino_tokenizer.xml
|   openvino_vision_embeddings_merger_model.bin
|   openvino_vision_embeddings_merger_model.xml
|   openvino_vision_embeddings_model.bin
|   openvino_vision_embeddings_model.xml
|   openvino_vision_embeddings_pos_model.bin
|   openvino_vision_embeddings_pos_model.xml
|   preprocessor_config.json
|   processor_config.json
|   README.md
|   tokenizer.json
|   tokenizer_config.json
|   
\---.cache
    \---huggingface
        |   .gitignore
        |   
        \---download
                .gitattributes.metadata
                chat_template.jinja.metadata
                config.json.metadata
                generation_config.json.metadata
                openvino_config.json.metadata
                openvino_detokenizer.bin.metadata
                openvino_detokenizer.xml.metadata
                openvino_language_model.bin.metadata
                openvino_language_model.xml.metadata
                openvino_text_embeddings_model.bin.metadata
                openvino_text_embeddings_model.xml.metadata
                openvino_tokenizer.bin.metadata
                openvino_tokenizer.xml.metadata
                openvino_vision_embeddings_merger_model.bin.metadata
                openvino_vision_embeddings_merger_model.xml.metadata
                openvino_vision_embeddings_model.bin.metadata
                openvino_vision_embeddings_model.xml.metadata
                openvino_vision_embeddings_pos_model.bin.metadata
                openvino_vision_embeddings_pos_model.xml.metadata
                preprocessor_config.json.metadata
                processor_config.json.metadata
                README.md.metadata
                tokenizer.json.metadata
                tokenizer_config.json.metadata
  1. Model or publicly available similar model that reproduces the issue
OpenVINO/Qwen3.5-35B-A3B-int4-ov

Additional context
graph.pbtxt:

input_stream: "HTTP_REQUEST_PAYLOAD:input"
output_stream: "HTTP_RESPONSE_PAYLOAD:output"

node: {
  name: "LLMExecutor"
  calculator: "HttpLLMCalculator"
  input_stream: "LOOPBACK:loopback"
  input_stream: "HTTP_REQUEST_PAYLOAD:input"
  input_side_packet: "LLM_NODE_RESOURCES:llm"
  output_stream: "LOOPBACK:loopback"
  output_stream: "HTTP_RESPONSE_PAYLOAD:output"
  input_stream_info: {
    tag_index: 'LOOPBACK:0'
    back_edge: true
  }
  node_options: {
    [type.googleapis.com/mediapipe.LLMCalculatorOptions]: {
      models_path: "./"
      plugin_config: '{}'
      enable_prefix_caching: true
      dynamic_split_fuse: false
      max_num_seqs: 15
      max_num_batched_tokens: 131072
      device: "GPU"
    }
  }
  input_stream_handler {
    input_stream_handler: "SyncSetInputStreamHandler"
    options {
      [mediapipe.SyncSetInputStreamHandlerOptions.ext] {
        sync_set {
          tag_index: "LOOPBACK:0"
        }
      }
    }
  }
}

pycurl.py

import json
import requests
 
# 1. Configure the API endpoint and model parameters
url = "http://127.0.0.1:8180/v3/chat/completions"
model_name = "Qwen3.5-35B-A3B-int4-ov"
base_sentence = "What is OpenVINO? Please explain with examples. " # This has 11 tokens
 

num_repetitions = 1489
prompt_content = base_sentence * num_repetitions
 
 
 
# 3. Construct the payload
payload = {
    "model": model_name,
    "messages": [
        {
            "role": "user",
            "content": prompt_content
        }
    ],
    "max_tokens": 512,
    "temperature": 0
}
 
headers = {
    "Content-Type": "application/json"
}
 
# 4. Send the request
try:
    response = requests.post(url, headers=headers, json=payload)
    if response.status_code == 200:
        print("Success! Response from server:")
        print(json.dumps(response.json(), indent=2))
    else:
        print(f"Failed with status code: {response.status_code}")
        print(response.text)
except requests.exceptions.RequestException as e:
    print(f"An error occurred while connecting to the server: {e}")
Lingua principale
C++
Stelle
932
Fork
278
Merge medio
2g 15h
PR unite (30g)
60

Preparare l'ambiente

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Altre issue di openvinotoolkit/model_server

Tutte le issue di openvinotoolkit/model_server

Issue simili

Altre issue su C++

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.