Add `study_type` closed facet at Study level (primary vs secondary literature)*
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Idoneità per principianti
- 45/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Abbastanza chiara
- Stato di attività
- Tranquilla
- Ambito
- data
Direzione di ricerca
Non sono indicati file o test. Inizia individuando la definizione del nodo Study e le convenzioni esistenti per facet e confidence; confrontale con la distinzione data_origin a livello di analisi di Issue #7. Il lavoro è completato quando a livello di Study esiste un enum study_type chiuso, il relativo confidence viene valutato separatamente e primary è il valore ammesso dal corpus, mentre gli altri tipi elencati vengono messi in quarantena.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Add a closed study_type enum at the Study node (e.g. primary, meta_analysis, systematic_review, narrative_review, case_report, methods_development, simulation, commentary). This is the corpus-admission gate: keep primary, quarantine the rest.
Why this is an explicit gate, not a deferred-map facet
A meta-analysis or review paper's text is full of primary-study coordinates, contrasts, and tasks quoted from included studies. An open extractor will faithfully pull these as analyses — nothing about the extraction marks them as second-hand. If document type is left to emerge from a lower-level field (e.g. design_type), the failure mode is phantom training pairs: other studies' coordinates entering the corpus as if this paper produced them — the contamination class a contrastive objective learns as signal.
study_type belongs to the "decides whether the extraction should exist at all" class, so unlike descriptive facets it must be defined closed now and scored on its own with confidence, not deferred to second-pass mapping. Bonus: "classify this document's type" is a more natural, higher-accuracy LLM task than "should I exclude this."
Keep it distinct from two orthogonal axes it will be confused with: Study.design (observational/interventional, cross-sectional/longitudinal) and ONVOC's Study Design → Study Types (case-control, cohort, RCT). Both are the epidemiological-design axis; neither captures primary-vs-secondary literature type, which is a new axis we define ourselves.
See also Issue #7 (analysis-level data_origin) for the mixed-paper case this study-level gate does not cover.
- Lingua principale
- Nessun dato sulla lingua
- Stelle
- 0
- Fork
- 1
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Preparare l'ambiente
Questo progetto non fornisce container di sviluppo, Dockerfile né guida per i contributori, quindi l'ambiente è a tuo carico: parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Issue simili
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
sportsdataverse/sportsdataverse-py#641 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 74/100
I maintainer di solito rispondono entro 4 giorni
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 85/100
I maintainer di solito rispondono entro 1 giorno
-
bug
Difficoltà 2/5 1-3 ore Idoneità per principianti 84/100
apache/datafusion#25913 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
DOI-USGS/pywatershed#421 ·