Hacktoberfest 2026: le issue che i maintainer hanno segnato per ottobre, aperte e adatte ai principianti. Sfoglia le issue Hacktoberfest

Create Dataset with metadata

Aperta
#124 0 commenti 3 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

Valutazione

Difficoltà
4/5
Tempo stimato
3-5 giorni
Idoneità per principianti
25/100
Tipo di issue
Funzionalità
Chiarezza
Da chiarire
Stato di attività
Ferma
Stack tecnologico
python

Direzione di ricerca

Non vengono indicati file o test. Inizia esaminando i passaggi di estrazione completati e l'output attuale del dataset, quindi procedi con gli elementi rimanenti della checklist: ripulisci le righe vuote e le colonne degli errori secondo necessità, raccogli i metadati se richiesto e invia il dataset completato all'Hub.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Descrizione

#dataset Epic

Steps:

  • pseudo crawl ~10% of C4 web page from Common Crawl @tianjianjiang
  • import pseudo crawled dataset on JZ @SaulLu
  • run 1st step of extraction:
    1. Extract text, HTML head sections, HTML footer sections, HTML Titles section and HTML metadata @SaulLu
    2. Change format of URL @SaulLu
    3. Extract Timestamp @cccntu @SaulLu
    4. Extract Generation Length Sentence @chkla @SaulLu
    5. Extract Generation Length Text @chkla @SaulLu
    6. Extract Data source @chkla @SaulLu
  • run 2nd step of extraction:
    1. Extract Website descriptions @shanyas10 @SaulLu
  • run 3rd step of extraction:
    1. Extract Entities @manandey @SaulLu
    2. (option) Extract Entities descriptions @manandey @SaulLu
  • run 4th step of extraction:
    1. Extract Paragraph @tianjianjiang @SaulLu
      • #114
      • #125
      • annotator (preprocessor) of the metadata
    2. Modify entities metadata with paragraph information @manandey @SaulLu
    3. Modify generation length with paragraph information @chkla @SaulLu
  • (optional) clean final dataset:
    1. Remove empty lines @SaulLu
    2. Remove "errors" columns @SaulLu
    3. (optional) Gather all metadata into same column @cccntu @timoschick @SaulLu
  • push dataset to Hub @SaulLu
Lingua principale
Python
Stelle
29
Fork
11
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Preparare l'ambiente

Questo progetto non fornisce container di sviluppo, Dockerfile né guida per i contributori, quindi l'ambiente è a tuo carico: parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Altre issue di bigscience-workshop/metadata

Tutte le issue di bigscience-workshop/metadata

Issue simili

Altre issue su Python

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.