Hacktoberfest 2026: le issue che i maintainer hanno segnato per ottobre, aperte e adatte ai principianti. Sfoglia le issue Hacktoberfest

high latency

Aperta
#2,721 10 commenti 0 reazioni 0 assegnatari Vedi su GitHub

I maintainer di solito rispondono entro 1 giorno

Nessuno ha ancora preso questa issue.

Valutazione

Difficoltà
4/5
Tempo stimato
3-5 giorni
Idoneità per principianti
38/100
Tipo di issue
Bug
Chiarezza
Abbastanza chiara
Stato di attività
Tranquilla
Stack tecnologico
cpp, docker, grpc, kubernetes, pytorch

Direzione di ricerca

Inizia con il comando di avvio Docker fornito e il client gRPC, quindi confronta i relativi tempi con il deployment Kubernetes e la sua configurazione di rete o di runtime. Riproduci il divario tra l’inferenza standalone sotto 0,01 secondi e le predizioni nel cluster di 1,5 secondi; il lavoro è completato quando la causa è stata identificata e una latenza comparabile è stata ripristinata oppure la limitazione è stata documentata.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Descrizione

bug

Latency in OpenVINO Model Server Inside Kubernetes Cluster

To Reproduce

Steps to reproduce the behavior:

  1. Prepare Models Repository: Followed standard procedures to set up the models repository.
  2. OVMS Launch Command:
    docker run -d --rm \
      -v /home/raa/model:/models \
      -p 900:9000 \
      -p 800:8000 \
      openvino/model_server:latest \
      --model_path /models/model1/1 \
      --model_name model1 \
      --port 9000 \
      --rest_port 8000 \
      --log_level DEBUG
    
  3. **Client command ** :
     server address = 192.168.1.10:900
     client = make_grpc_client(server_address)
     pred = client.predict(inputs=inputs, model_name=model1)
    

Environment

I am using OpenVINO server for model deployment on edge devices with an Intel i7-13th Gen processor. My PyTorch model is trained with an image size of 640.

  • Standalone Inference: The prediction time for PyTorch weights is consistently <0.01 seconds per image.
  • IR Converted Weights: Similar inference time in standalone mode.
  • In Kubernetes Cluster: When deployed, the OpenVINO server takes approximately 1.5 seconds per prediction using gRPC calls.
  • Observation: Running the OpenVINO server outside the cluster in a container yields <0.01 seconds inference time for IR converted weights, while the same server inside the cluster significantly increases latency.

Expected Behavior

I expected the inference time for the OpenVINO Model Server inside the Kubernetes cluster to be comparable to that observed outside the cluster (i.e., <0.01 seconds).

model directory format

model/
├── model1/
│   └── 1/
│       ├── model.bin
│       ├── model.mapping
│       └── model.xml

Lingua principale
C++
Stelle
940
Fork
278
Merge medio
3g 4h
PR unite (30g)
68

Preparare l'ambiente

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Altre issue di openvinotoolkit/model_server

Tutte le issue di openvinotoolkit/model_server

Issue simili

Altre issue su C++

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.