Control idle time on SLURMCluster.adapt() to control when workers are released.
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức phù hợp với người mới
- 35/100
- Loại issue
- Tính năng
- Độ rõ ràng
- Khá rõ ràng
- Mức độ hoạt động
- Đình trệ
- Công nghệ
- python
- Lĩnh vực
- distributed-systems, hpc
Hướng nghiên cứu
Issue đề cập đến SLURMCluster.adapt(), nhưng không có tệp hoặc test nào. Hãy bắt đầu bằng cách xác định entry point đó và đọc cách các worker thích ứng được giải phóng sau khi các task hoàn tất. Done cần cung cấp một cơ chế được tài liệu hóa để giữ lại các worker đã được acquire trong suốt một chuỗi các phép tính bị trì hoãn mà không cần requeue SLURM không cần thiết.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
The documentation gives the following example for using adapt and managing the lifetime of the workers:
`cluster = Cluster(
walltime="01:00:00",
cores=4,
memory="16gb",
worker_extra_args=["--lifetime", "55m", "--lifetime-stagger", "4m"],
)
cluster.adapt(minimum=0, maximum=200)
`
However, when using this on a SLURM HPC the behavior seems to be to release all the workers once the current task is done. Subsequent tasks will then requeue SLURM, which seems to lead to constant queuing and releasing of workers in my workflow.
I am hoping to accomplish something like the following:
`complex xarray computation 1
complex xarray computation 2
complex xarray computation 3
...
complex xarray computation N
`
but without releasing all the workers between serial executions. Is there currently a mechanism to complete a sequence of dask delayed tasks without releasing the workers gained from adapt()?
- Ngôn ngữ chính
- Python
- Star
- 256
- Fork
- 149
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Chuẩn bị môi trường
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của dask/dask-jobqueue
-
bug LSF
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 65/100
dask/dask-jobqueue#703 · 1 bình luận ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 45/100
dask/dask-jobqueue#699 · 2 bình luận ·
-
bug
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 38/100
dask/dask-jobqueue#692 · 1 bình luận ·
-
bug
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 35/100
dask/dask-jobqueue#691 · 7 bình luận ·
-
Độ khó 2/5 Nửa ngày Mức phù hợp với người mới 45/100
dask/dask-jobqueue#686 · 3 bình luận ·
Tất cả issue của dask/dask-jobqueue
Issue tương tự
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 76/100
PedestrianDynamics/pyFDS-Evac#199 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 65/100
521xueweihan/HelloGitHub#3790 ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
sandialabs/atlas-ui-3#978 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
area: tests perceived difficulty: 2
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100
Nitjsefnie-Harness-Commons/daedalus#1255 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
hf-audiolm-qwen: `generate_until` hardcodes `.to("cuda")` and aborts on non-CUDA acceleratorsĐang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 86/100
EleutherAI/lm-evaluation-harness#4256 ·
Maintainer thường phản hồi trong vòng 1 ngày