map_sync with pandas operation function does not finish.
Ninguém assumiu esta issue ainda.
Avaliação
- Dificuldade
- 4/5
- Tempo estimado
- 3-5 dias
- Facilidade para iniciantes
- 25/100
- Tipo de issue
- Bug
- Clareza
- Precisa de esclarecimento
- Status de atividade
- Estagnada
- Stack de tecnologia
- jupyter, numpy, pandas, python
- Domínio
- data, distributed-systems
Direção de pesquisa
Comece com a reprodução fornecida no Windows usando o map_sync do ipyparallel, 40 sub-dataframes e a operação groupby/apply do pandas; inspecione a saída do cliente e do worker quando o processamento parar após aproximadamente 10 dataframes de destino. A issue estará concluída quando a causa do map_sync incompleto for identificada e uma correção reproduzível ou uma limitação confirmada for documentada.
Escrita pelo modelo de indexação a partir do texto da issue.
Descrição
Map_sync with pandas operation function does not finish.
I have very long dataframe. So I split the dataframe into 40 sub-dataframes, and apply pandas operation to 40 sub-dataframes parallelly by using map_sync. The pandas operation is just about groupby and apply.
My code is like this:
PEN = 40
dfs = np.array_split(target_df, PEN)
c = ipp.Cluster(n=PEN)
with c as rc:
e_all = rc[:]
results = e_all.map_sync(FUCTION, dfs)
results
I have 30 target_dfs. For the first 10 target dfs map_sync worked fine. But after that map_sync didn't complete.
I have found that without parallelism, the pandas job applied to target_df completes in under 2 hours.
I use window os and Ipyparallel version is the lastest.
- Linguagem predominante
- Jupyter Notebook
- Estrelas
- 2.6k
- Forks
- 1k
- Métricas de merge de PRs
- Nenhum PR com merge em 30d
Guia de contribuição
Primeiros passos
- Leia a issue inteira e depois o guia de contribuição do projeto.
- Comente na issue dizendo que vai assumir — evita que duas pessoas façam o mesmo trabalho.
- Faça um fork do repositório e trabalhe em uma branch.
- Abra um pull request que referencie o número da issue.
Mais de ipython/ipyparallel
-
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 48/100
ipython/ipyparallel#1029 · 9 comentários ·
-
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 35/100
ipython/ipyparallel#984 ·
-
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 35/100
ipython/ipyparallel#937 · 4 comentários ·
-
Packages and definitions loaded in the regular kernel are not known by engines and vice versa Abertaquestion
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 25/100
ipython/ipyparallel#897 · 12 comentários ·
-
bug
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 35/100
ipython/ipyparallel#882 ·
Todas as issues de ipython/ipyparallel
Issues semelhantes
-
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 70/100
TauricResearch/TradingAgents#1397 ·
-
bug
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 75/100
-
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 75/100
TencentCloud/Octop#1085 · 1 comentário ·
-
Sandy macrofaunal assemblages adjacent to rocky reefs on São Miguel Island (Azores, NE Atlantic) Abertadataset
Dificuldade 1/5 Menos de uma hora Facilidade para iniciantes 80/100
iobis/obis-network-datasets#909 ·
-
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 75/100
OHDSI/CohortConstructor#774 ·