More graceful job cancellation
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 35/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Bastante claro
- Estado de actividad
- Estancado
- Stack tecnológico
- python
- Área
- distributed-systems
Línea de trabajo
Empieza revisando la definición de SLURMJob y cancel_command en dask_jobqueue/slurm.py. Investiga cómo afecta SIGTERM al apagado ordenado de los workers y al estado del trabajo de Slurm, incluidos los casos en los que la cancelación deba mantenerse diferenciada. Para darlo por terminado, se requiere una política de cancelación acordada y pruebas que cubran el estado resultante del trabajo.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Hey all,
This is just a thought for the SLURMCluster for now (since that's what I'm familiar with) but similar options may be available in other clusters too. Currently, the cancel_command in the SLURMJob class is a bare "scancel".
This means that, even when workers are shutdown completely gracefully, the Slurm job is marked as CANCELLED. Instead, if the command were scancel --signal=SIGTERM the job would be marked as COMPLETED. Its possible there could be cases where we would want a job to cancelled, which complicates this somewhat.
In the simple case, however, I think this could be implmented with a simple change of cancel_command to:
class SLURMJob(Job):
# Override class variables
submit_command = "sbatch"
cancel_command = "scancel --signal=SIGTERM"
config_name = "slurm"
It'd be great to get some more thoughts on the implications for this.
- Lenguaje dominante
- Python
- Estrellas
- 256
- Forks
- 149
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Preparar el entorno
- Sin Dockerfile ni archivo de Docker Compose
- Sin plantilla de pull request
- Leer la guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de dask/dask-jobqueue
-
bug LSF
Dificultad 3/5 1-2 días Aptitud para principiantes 65/100
dask/dask-jobqueue#703 · 1 comentario ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
dask/dask-jobqueue#701 ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 45/100
dask/dask-jobqueue#699 · 2 comentarios ·
-
bug
Dificultad 3/5 1-2 días Aptitud para principiantes 38/100
dask/dask-jobqueue#692 · 1 comentario ·
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
dask/dask-jobqueue#691 · 7 comentarios ·
Todos los issues de dask/dask-jobqueue
Issues similares
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 85/100
Los mantenedores suelen responder en 1 día
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 90/100
Los mantenedores suelen responder en 1 día
-
https://search.utilibre.orgAbiertoinstance instance add
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
searxng/searx-instances#941 · 1 comentario ·
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 92/100
FluidNumerics/fluid-walk-blocker#89 ·
Los mantenedores suelen responder en 1 día
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
Los mantenedores suelen responder en 1 día