Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Add `study_type` closed facet at Study level (primary vs secondary literature)*

Abierto
#2 2 comentarios 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
4/5
Tiempo estimado
3-5 días
Aptitud para principiantes
45/100
Tipo de issue
Nueva funcionalidad
Claridad
Bastante claro
Estado de actividad
Tranquilo
Área
data

Línea de trabajo

No se nombran archivos ni pruebas. Empieza por localizar la definición del nodo Study y las convenciones existentes para facet y confidence; compáralas con la distinción data_origin en el nivel de análisis de Issue #7. Se considera terminado cuando existe un enum cerrado study_type en el nivel Study, su confidence se puntúa por separado y primary es el valor admitido por el corpus, mientras que los demás tipos enumerados quedan en cuarentena.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

Add a closed study_type enum at the Study node (e.g. primary, meta_analysis, systematic_review, narrative_review, case_report, methods_development, simulation, commentary). This is the corpus-admission gate: keep primary, quarantine the rest.

Why this is an explicit gate, not a deferred-map facet

A meta-analysis or review paper's text is full of primary-study coordinates, contrasts, and tasks quoted from included studies. An open extractor will faithfully pull these as analyses — nothing about the extraction marks them as second-hand. If document type is left to emerge from a lower-level field (e.g. design_type), the failure mode is phantom training pairs: other studies' coordinates entering the corpus as if this paper produced them — the contamination class a contrastive objective learns as signal.

study_type belongs to the "decides whether the extraction should exist at all" class, so unlike descriptive facets it must be defined closed now and scored on its own with confidence, not deferred to second-pass mapping. Bonus: "classify this document's type" is a more natural, higher-accuracy LLM task than "should I exclude this."

Keep it distinct from two orthogonal axes it will be confused with: Study.design (observational/interventional, cross-sectional/longitudinal) and ONVOC's Study Design → Study Types (case-control, cohort, RCT). Both are the epidemiological-design axis; neither captures primary-vs-secondary literature type, which is a new axis we define ourselves.

See also Issue #7 (analysis-level data_origin) for the mixed-paper case this study-level gate does not cover.

Lenguaje dominante
Sin datos de lenguaje
Estrellas
0
Forks
1
Métricas de merge de PR
Sin PR fusionados en 30 d

Preparar el entorno

Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Issues similares

Más issues de Data Engineering

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.