CUDA issue on the Compute Instance
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Error
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- python, pytorch
- Área
- cloud, infrastructure, machine-learning
Línea de trabajo
Empieza reproduciendo python -c "import torch; print(torch.cuda.is_available())" en la Compute Instance y compáralo con las Computer Cluster VMs que funcionan. Comprueba la salida reportada de nvidia-smi, nvcc --version y el error de inicialización de CUDA; después, verifica que PyTorch detecta las GPU A100 y que la prueba de NCCL se compila y se ejecuta.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
PyTorch cannot detect GPUs on the Compute Instance with NVIDIA A100 GPUs. nvidia-smi and nvcc --version can return the installed CUDA version and CUDA toolkit versions. But PyTorch returns the following:
# python -c "import torch; print(torch.cuda.is_available())"
/opt/conda/lib/python3.8/site-packages/torch/cuda/__init__.py:80: UserWarning: CUDA initialization: Unexpected error from cudaGetDeviceCount(). Did you run some cuda functions before calling NumCudaDevices() that might have already set an error? Error 802: system not yet initialized (Triggered internally at /opt/pytorch/pytorch/c10/cuda/CUDAFunctions.cpp:112.)
return torch._C._cuda_getDeviceCount() > 0
False
I tried to pull PyTorch container from Nvidia NGC, AML base images, or compile PyTorch using pip/conda with GPU support. All have the same CUDA issue. I also cannot compile NCCL test on the Compute Instance with GPUs.
However, everything works fine on the Computer Cluster VMs. NCCL compiles/runs file and PyTorch has no issue with CUDA. I suspect CUDA is installed but not configured correctly on the Compute Instance VMs.
- Lenguaje dominante
- Jupyter Notebook
- Estrellas
- 4.4k
- Forks
- 2.6k
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de Azure/MachineLearningNotebooks
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
Azure/MachineLearningNotebooks#1975 · 1 comentario ·
-
duplicates Abierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 68/100
Azure/MachineLearningNotebooks#1960 ·
-
machine Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 10/100
Azure/MachineLearningNotebooks#1987 ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
Azure/MachineLearningNotebooks#1985 · 1 comentario ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 35/100
Azure/MachineLearningNotebooks#1981 · 1 reacción ·
Todos los issues de Azure/MachineLearningNotebooks
Issues similares
-
enhancement
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
palladius/rails8-app-on-gcp#141 · 1 comentario ·
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 75/100
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 85/100
-
enhancement
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
aws-samples/sample-multi-agent-orchestration-chat-on-agentcore#123 ·
-
documentation improve or update documentation priority/low triage
Dificultad 2/5 Medio día Aptitud para principiantes 86/100
warpdotdev/docs#782 · 1 comentario ·