Add a scraper check utility
Ninguém assumiu esta issue ainda.
Avaliação
- Dificuldade
- 5/5
- Tempo estimado
- Mais de uma semana
- Facilidade para iniciantes
- 25/100
Direção de pesquisa
Nenhum arquivo, teste ou ponto de entrada é nomeado. Comece mapeando os objetos de scraperlib que criam ZIMs, recodificam assets e usam o cache de otimização; em seguida, revise como os arquivos temporários são tratados. O trabalho estará concluído quando um mecanismo de verificação de sanidade automatizado ou explicitamente invocado estiver definido, juntamente com o comportamento em caso de falha.
Escrita pelo modelo de indexação a partir do texto da issue.
Descrição
Currently, we rely on various objects in scraperlib to:
- create the ZIM
- re-encode videos and images
- cache these assets on the optimization cache
We might consider to have a mechanism to perform sanity checks on scraper behavior:
- did we cached all re-encoded images / videos when a cache is present?
- did we removed temporary files from the filesystem as they are added to the ZIM? (we know that while we prefer in-memory/streaming approaches, there are still many scrapers which are using the temporary file approach, and even some situation which have to rely on it)
What I do not yet know:
- should we make the scraper fails if these checks fails?
- is there any chance we automate these checks? (i.e. no need to modify the scrapers, or as little as possible - at least not make a call to "check_i_m_ok" mandatory, because the scraper developers might forget about it as well ; I doubt about this because there are many kind of situations)
- can we do these checks early? (so that we fail the scraper asap instead of wasting time and resources)
- Linguagem predominante
- Python
- Estrelas
- 31
- Forks
- 27
- Merge médio
- 3d 7h
- PRs com merge (30d)
- 2
Guia de contribuição
Nenhum guia de contribuição indexado para este repositório
Primeiros passos
- Leia a issue inteira e depois o guia de contribuição do projeto.
- Comente na issue dizendo que vai assumir — evita que duas pessoas façam o mesmo trabalho.
- Faça um fork do repositório e trabalhe em uma branch.
- Abra um pull request que referencie o número da issue.
Mais de openzim/python-scraperlib
-
bug
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 72/100
openzim/python-scraperlib#339 ·
-
enhancement
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 68/100
openzim/python-scraperlib#292 ·
-
bug
Dificuldade 4/5 3-5 dias Facilidade para iniciantes 35/100
openzim/python-scraperlib#341 ·
-
bug
Dificuldade 3/5 1-2 dias Facilidade para iniciantes 45/100
openzim/python-scraperlib#340 ·
-
bug
openzim/python-scraperlib#334 · 1 responsável ·
Todas as issues de openzim/python-scraperlib
Issues semelhantes
-
bug confirmed issue
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 75/100
open-webui/open-webui#30750 · 1 comentário ·
-
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 75/100
-
enhancement
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 75/100
OpenwaterHealth/openmotion-bloodflow-app#604 · 1 comentário ·
-
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 70/100
-
good first issue
Dificuldade 1/5 Menos de uma hora Facilidade para iniciantes 90/100