Hacktoberfest 2026: le issue che i maintainer hanno segnato per ottobre, aperte e adatte ai principianti. Sfoglia le issue Hacktoberfest

Apply Dask to parallelise acs_regional_stats

Aperta
#34 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

Valutazione

Difficoltà
4/5
Tempo stimato
3-5 giorni
Idoneità per principianti
35/100
Tipo di issue
Funzionalità
Chiarezza
Abbastanza chiara
Stato di attività
Ferma
Stack tecnologico
jupyter-notebook
Ambito
data, performance

Direzione di ricerca

Inizia con example_notebooks/FAQ_example_timeseries_stats.ipynb e l’entry point acs_regional_stats, quindi esegui l’attuale calcolo giornaliero su più anni per determinarne l’uso della memoria e il tempo di esecuzione. Sviluppa l’esempio basato su Dask richiesto, che calcola le medie areali per file, e verifica che produca serie temporali regionali riducendo al contempo l’attuale carico di lavoro, che richiede diversi minuti e molta memoria.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Descrizione

acs_regional_stats can be very memory intensive to run, particularly over many regions and many timesteps.
We should develop an example of running acs_regional_stats for many years of daily data to produce area averaged timeseries for regions. Currently, this is possible, but will take several minutes to calculate.
Dask is likely to be able to achieve this by calculating area averages per file.
Previous development has focused on reducing memory usage through other clever means, such as implementing chunks to reduce the number of timesteps loaded into the memory to calculate stats over each time. This could be parallelised, but it is not currently.

Lingua principale
Jupyter Notebook
Stelle
8
Fork
1
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Preparare l'ambiente

Questo progetto non fornisce container di sviluppo, Dockerfile né guida per i contributori, quindi l'ambiente è a tuo carico: parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Altre issue di AusClimateService/plotting_maps

Tutte le issue di AusClimateService/plotting_maps

Issue simili

Altre issue su Data Engineering

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.