Hacktoberfest 2026: le issue che i maintainer hanno segnato per ottobre, aperte e adatte ai principianti. Sfoglia le issue Hacktoberfest

Feature Request: GPU Support

Aperta
#833 35 commenti 16 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

Valutazione

Difficoltà
5/5
Tempo stimato
Più di una settimana
Idoneità per principianti
42/100
Tipo di issue
Funzionalità
Chiarezza
Abbastanza chiara
Stato di attività
Tranquilla
Stack tecnologico
docker, go

Direzione di ricerca

Inizia valutando il plugin gpu_monitor proposto rispetto a nvidia-smi, NVML e DCGM, incluso il modo in cui viene rilevato un comando nvidia-smi bloccato. Il lavoro si considera completato quando sono stati aggiunti il plugin, il Dockerfile abilitato per GPU e le dipendenze necessarie, con il rilevamento degli errori del dispositivo e delle GPU bloccate; il monitoraggio dei crash a runtime e degli OOM rimane TBD.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Descrizione

kind/feature lifecycle/frozen

This feature request aims to enhance the Node Problem Detector with the ability to monitor GPUs on nodes and detect issues.

Currently NPD does not have direct visibility into GPUs. However, many workloads are GPU accelerated which makes GPU health an important part of node health. e.g. GPUs are widely used in machine learning training and inference. Especially for LLM training which may using tens of thousands of GPU cards. The entire training cluster should be restarted from previous checkpoint if any one of the GPUs in the cluster is gone bad.

This feature request adds the following capabilities:

  • GPU device monitoring: NPD will collect GPU device info periodically and look for crashes or errors via nvidia-smi/nvml/dcgm tools.

  • GPU device monitoring: NPD will check GPU device info periodically to detect if a GPU is "stuck" (e.g. nvidia-smi command hangs).

  • TBD: GPU runtime monitoring: NPD will check for crashes or OOM issues reported in nvidia logs.

Specifically, this feature request includes:

  • Code for the gpu_monitor plugin
  • A Dockerfile to build an NPD image with GPU support
  • Other dependencies

Looking forward to your feedback!

Lingua principale
Go
Stelle
3.5k
Fork
704
Merge medio
12h 21m
PR unite (30g)
3

Preparare l'ambiente

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Altre issue di kubernetes/node-problem-detector

Tutte le issue di kubernetes/node-problem-detector

Issue simili

Altre issue su Go

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.