Add dataset: chronicling_america
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 42/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Bastante claro
- Estado de actividad
- Estancado
- Área
- data-engineering
Línea de trabajo
Comienza localizando los scripts de carga de datasets y, después, inspecciona la API de periódicos de Chronicling America en https://chroniclingamerica.loc.gov/newspapers.json y sus endpoints vinculados de títulos, números, OCR e imágenes. Revisa la fecha y los demás filtros necesarios para la carga; se considera terminado cuando el dataset se puede añadir mediante la API abierta y sus detalles de acceso y licencia están registrados.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
A URL for this dataset
https://chroniclingamerica.loc.gov/about/api/#bulk-data
Dataset description
Chronicling America is a Library of Congress project to digitise historic newspapers. The collection contains mostly English but also contains other languages. Breakdown by language: https://public.tableau.com/app/profile/chronicling.america#!/vizhome/ChroniclingAmericaLanguageCoverageBubble/All_Lang
Various ways of accessing this data include bulk downloads and an API. The API may be the most helpful way of accessing this dataset (via dataset loading script) because this dataset is not static (more titles are digitised and added on a rolling basis).
The 'newspapers' API (https://chroniclingamerica.loc.gov/newspapers.json) is probably the best starting point. This starts instead from a list of Newspaper titles for which digital content is held. A title, i.e. https://chroniclingamerica.loc.gov/lccn/sn86072192.json, contains a bunch of metadata.
.
This API also contains all the issues for that title. For each issue, you get a set of pages. Each page contains the plain text generated from the OCR for that page, e.g. https://chroniclingamerica.loc.gov/lccn/sn82014726/1888-04-07/ed-1/seq-1/ocr.txt and a link to the image of that page, e.g. https://chroniclingamerica.loc.gov/lccn/sn82014726/1888-04-07/ed-1/seq-1.jp2.
My suggested approach to loading this dataset would be to call https://chroniclingamerica.loc.gov/newspapers.json at the start of the script and, depending on some filters defined in the loading script, i.e. start/end date of interest, build up a list of relevant URLs for the text/images for each page.
If you want to work on this dataset, please cc @davanstrien and @albertvillanova!
Dataset modality
Mixed
Dataset licence
Other license
Other licence
https://chroniclingamerica.loc.gov/about/#rights
How can you access this data
Via an open API
size of dataset
10GB
Confirm the dataset has an open licence
- To the best of my knowledge, this dataset is accessible via an open licence
Contact details for data custodian
No response
- Lenguaje dominante
- Sin datos de lenguaje
- Estrellas
- 91
- Forks
- 8
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Preparar el entorno
Este proyecto no incluye contenedor de desarrollo, Dockerfile ni guía de contribución, así que la configuración corre por tu cuenta: empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de bigscience-workshop/lam
-
dataset good first issue
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
bigscience-workshop/lam#86 · 1 comentario ·
-
dataset
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
bigscience-workshop/lam#65 · 1 comentario ·
-
candidate-dataset
Dificultad 2/5 1-3 horas Aptitud para principiantes 35/100
bigscience-workshop/lam#92 · 1 comentario ·
-
dataset
Dificultad 2/5 1-3 horas Aptitud para principiantes 35/100
bigscience-workshop/lam#87 ·
-
Add dataset: TexBiGAbiertodataset
Dificultad 3/5 1-2 días Aptitud para principiantes 35/100
bigscience-workshop/lam#84 ·
Todos los issues de bigscience-workshop/lam
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
NaturalIntelligence/fast-xml-parser#888 · 1 comentario ·
Los mantenedores suelen responder en 2 días
-
infertopics leaves new nodes without a topic when untopiced neighbours outnumber topiced onesPosiblemente ocupada @moneebullah25 la tomó hoy. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
NVIDIA/earth2studio#1241 ·
Los mantenedores suelen responder en 3 días
-
Remove: Fox Deportes SDAbiertocheck:passed feeds:remove
Dificultad 1/5 Menos de una hora Aptitud para principiantes 65/100
iptv-org/database#37176 · 1 comentario · 1 reacción ·
Los mantenedores suelen responder en 9 días
-
Report: alsharqiya https issuesAbiertoapproved check:passed streams:remove
Dificultad 1/5 Menos de una hora Aptitud para principiantes 60/100
Los mantenedores suelen responder en 1 día