Control idle time on SLURMCluster.adapt() to control when workers are released.
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Idoneità per principianti
- 35/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Abbastanza chiara
- Stato di attività
- Ferma
- Stack tecnologico
- python
- Ambito
- distributed-systems, hpc
Direzione di ricerca
La issue nomina SLURMCluster.adapt(), ma non indica file né test. Inizia individuando quel punto di ingresso e leggendo come vengono rilasciati i worker adattivi dopo il completamento dei task. Done dovrebbe fornire un meccanismo documentato per mantenere i worker acquisiti durante una sequenza di calcoli ritardati senza un requeuing non necessario di SLURM.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
The documentation gives the following example for using adapt and managing the lifetime of the workers:
`cluster = Cluster(
walltime="01:00:00",
cores=4,
memory="16gb",
worker_extra_args=["--lifetime", "55m", "--lifetime-stagger", "4m"],
)
cluster.adapt(minimum=0, maximum=200)
`
However, when using this on a SLURM HPC the behavior seems to be to release all the workers once the current task is done. Subsequent tasks will then requeue SLURM, which seems to lead to constant queuing and releasing of workers in my workflow.
I am hoping to accomplish something like the following:
`complex xarray computation 1
complex xarray computation 2
complex xarray computation 3
...
complex xarray computation N
`
but without releasing all the workers between serial executions. Is there currently a mechanism to complete a sequence of dask delayed tasks without releasing the workers gained from adapt()?
- Lingua principale
- Python
- Stelle
- 256
- Fork
- 149
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Preparare l'ambiente
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di dask/dask-jobqueue
-
bug LSF
Difficoltà 3/5 1-2 giorni Idoneità per principianti 65/100
dask/dask-jobqueue#703 · 1 commento ·
-
Difficoltà 3/5 1-2 giorni Idoneità per principianti 45/100
dask/dask-jobqueue#699 · 2 commenti ·
-
bug
Difficoltà 3/5 1-2 giorni Idoneità per principianti 38/100
dask/dask-jobqueue#692 · 1 commento ·
-
bug
Difficoltà 4/5 3-5 giorni Idoneità per principianti 35/100
dask/dask-jobqueue#691 · 7 commenti ·
-
Difficoltà 2/5 Mezza giornata Idoneità per principianti 45/100
dask/dask-jobqueue#686 · 3 commenti ·
Tutte le issue di dask/dask-jobqueue
Issue simili
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 84/100
PedestrianDynamics/pyFDS-Evac#343 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
theskumar/python-dotenv#708 ·
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 88/100
I maintainer di solito rispondono entro 2 giorni
-
Docs Timedelta
Difficoltà 2/5 1-3 ore Idoneità per principianti 72/100
pandas-dev/pandas#69919 ·
I maintainer di solito rispondono entro 1 giorno
-
API documentation
Difficoltà 2/5 1-3 ore Idoneità per principianti 72/100
zephyrproject-rtos/west#1009 · 2 commenti ·
I maintainer di solito rispondono entro 3 giorni