Hacktoberfest 2026: as issues que os mantenedores marcaram para outubro, abertas e boas para iniciantes. Ver issues do Hacktoberfest

Chapter 8: Shuffling the DataFrame in newer versions of pandas

Aberta
#74 1 comentário 2 reações 0 responsáveis Ver no GitHub

Ninguém assumiu esta issue ainda.

Avaliação

Dificuldade
2/5
Tempo estimado
1-3 horas
Facilidade para iniciantes
55/100
Tipo de issue
Bug
Clareza
Razoavelmente clara
Status de atividade
Estagnada
Stack de tecnologia
pandas, python
Domínio
machine-learning

Direção de pesquisa

Comece pelo código de shuffle do DataFrame na página 235 e verifique como ele se comporta com pandas 0.23.4 antes de o conjunto de dados ser exportado para CSV. Verifique se o CSV resultante está realmente embaralhado e se o exemplo de sentiment-analysis nas páginas 246-246 não relata mais uma acurácia enganosa causada por dados ordenados.

Escrita pelo modelo de indexação a partir do texto da issue.

Descrição

Just a note in case it's helpful to anyone else - I seemed to be getting 100% accuracy with the on-line sentiment analysis classifier (pages 246-246), but it turned out to be because the code used to shuffle the dataset before exporting it to CSV on page 235 hadn't worked.

In the version of pandas I'm using (0.23.4), it looks like df.index.values is needed in order to get the indexes of a DataFrame as a list. So, this:

df = df.reindex(np.random.permutation(df.index))

now needs to be this:

df = df.reindex(np.random.permutation(df.index.values))

Hope that helps someone!

Linguagem predominante
Jupyter Notebook
Estrelas
12.7k
Forks
4.4k
Métricas de merge de PRs
Nenhum PR com merge em 30d

Preparar o ambiente

Este projeto não oferece contêiner de desenvolvimento, Dockerfile nem guia de contribuição, então a configuração fica por sua conta: comece pelo README e veja nosso guia da primeira contribuição para os passos gerais.

Primeiros passos

  1. Leia a issue inteira e depois o guia de contribuição do projeto.
  2. Comente na issue dizendo que vai assumir — evita que duas pessoas façam o mesmo trabalho.
  3. Faça um fork do repositório e trabalhe em uma branch.
  4. Abra um pull request que referencie o número da issue.

Mais de rasbt/python-machine-learning-book

Todas as issues de rasbt/python-machine-learning-book

Issues semelhantes

Mais issues de Machine Learning

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.