Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Feature Request: GPU Support

Abierto
#833 35 comentarios 16 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
5/5
Tiempo estimado
Más de una semana
Aptitud para principiantes
42/100
Tipo de issue
Nueva funcionalidad
Claridad
Bastante claro
Estado de actividad
Tranquilo
Stack tecnológico
docker, go

Línea de trabajo

Empieza evaluando el plugin gpu_monitor propuesto frente a nvidia-smi, NVML y DCGM, incluida la forma de detectar un comando nvidia-smi bloqueado. Se considera terminado cuando se hayan añadido el plugin, el Dockerfile habilitado para GPU y las dependencias necesarias, y se detecten errores de dispositivo y GPUs bloqueadas; la monitorización de crashes de ejecución y OOM queda TBD.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

kind/feature lifecycle/frozen

This feature request aims to enhance the Node Problem Detector with the ability to monitor GPUs on nodes and detect issues.

Currently NPD does not have direct visibility into GPUs. However, many workloads are GPU accelerated which makes GPU health an important part of node health. e.g. GPUs are widely used in machine learning training and inference. Especially for LLM training which may using tens of thousands of GPU cards. The entire training cluster should be restarted from previous checkpoint if any one of the GPUs in the cluster is gone bad.

This feature request adds the following capabilities:

  • GPU device monitoring: NPD will collect GPU device info periodically and look for crashes or errors via nvidia-smi/nvml/dcgm tools.

  • GPU device monitoring: NPD will check GPU device info periodically to detect if a GPU is "stuck" (e.g. nvidia-smi command hangs).

  • TBD: GPU runtime monitoring: NPD will check for crashes or OOM issues reported in nvidia logs.

Specifically, this feature request includes:

  • Code for the gpu_monitor plugin
  • A Dockerfile to build an NPD image with GPU support
  • Other dependencies

Looking forward to your feedback!

Lenguaje dominante
Go
Estrellas
3.5k
Forks
704
Merge medio
12 h 21 min
PR fusionados (30 d)
3

Preparar el entorno

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de kubernetes/node-problem-detector

Todos los issues de kubernetes/node-problem-detector

Issues similares

Más issues de Go

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.