Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

docs: required_columns description is incomplete for LLM and multimodal columns

Abierto Apto para principiantes
#1,002 2 comentarios 0 reacciones 0 asignados Ver en GitHub

Los mantenedores suelen responder en 1 día

@nightcityblade ya está trabajando en esto.

Desde el 9/10/2026.

Evaluación

Dificultad
2/5
Tiempo estimado
1-3 horas
Aptitud para principiantes
65/100
Tipo de issue
Documentación
Claridad
Bien especificado
Estado de actividad
Activo
Stack tecnológico
python

Línea de trabajo

Empieza con la lista de viñetas required_columns en fern/versions/latest/pages/concepts/columns.mdx (alrededor de las líneas 222-230) y luego lee las propiedades required_columns en packages/data-designer-config/src/data_designer/config/column_configs.py para LLMTextColumnConfig, ImageColumnConfig y EmbeddingColumnConfig. Está terminado cuando la documentación enumera cada fuente: las variables Jinja2 de prompt y system_prompt, los nombres de columna de multi_modal_context y target_column para embeddings. Confirma el comportamiento previsto con un mantenedor antes de editar, ya que el issue está esperando triaje.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

bug
Priority Level

Low (Cosmetic / Minor)

Describe the bug

The concept documentation for required_columns in fern/versions/latest/pages/concepts/columns.mdx states that for LLM/Expression columns, dependencies are derived solely from Jinja2 {{ variables }}:

  • For LLM/Expression columns: extracted from Jinja2 template {{ variables }}

However, in packages/data-designer-config/src/data_designer/config/column_configs.py, LLMTextColumnConfig (and inheriting classes) also derives dependencies from:

  1. Jinja2 variables inside system_prompt (when provided)
  2. Column names referenced in multi_modal_context (ctx.column_name)

Additionally, ImageColumnConfig derives dependencies from multi_modal_context, and EmbeddingColumnConfig depends on target_column.

The current documentation wording is incomplete regarding how DAG column dependencies are assembled. Updating this section will help users properly understand DAG generation ordering when using multimodal context and system prompts.

Steps/Code to reproduce bug
import data_designer.config as dd

col = dd.LLMTextColumnConfig(
    name="summary",
    model_alias="test-model",
    prompt="Summarize this text",
    system_prompt="Context: {{ user_persona }}",
    multi_modal_context=[dd.ImageContext(column_name="image_input")]
)

# Inspect computed required_columns
print(col.required_columns)
# Output: ['user_persona', 'image_input']
# The docs state required_columns only extracts from Jinja2 template prompt,
# missing system_prompt and multi_modal_context dependencies.
Expected behavior

The required_columns section in columns.mdx should accurately list all sources of dependencies for LLM and multimodal columns:

  • Variables in prompt and system_prompt Jinja2 templates ({{ variables }})
  • Column names referenced in multi_modal_context
  • target_column for embedding columns
Agent Diagnostic / Prior Investigation

Investigated the documentation and source codebase:

  • Checked fern/versions/latest/pages/concepts/columns.mdx (lines 222–230).
  • Inspected implementation in packages/data-designer-config/src/data_designer/config/column_configs.py:
    • LLMTextColumnConfig.required_columns (lines 197–209): extracts from self.prompt, self.system_prompt, and self.multi_modal_context.
    • ImageColumnConfig.required_columns (lines 637–648): extracts from self.prompt and self.multi_modal_context.
    • EmbeddingColumnConfig.required_columns (lines 589–591): returns [self.target_column].
  • Confirmed that dataset builders rely on these exact dependencies for topological sorting in the DAG execution plan.
Additional context

I would be happy to contribute a fix after this issue is triaged and the intended behavior is confirmed.

Checklist
  • I reproduced this issue or provided a minimal example
  • I searched the docs/issues myself, or had my agent do so
  • If I used an agent, I included its diagnostics above
Lenguaje dominante
Python
Estrellas
2.3k
Forks
219
Merge medio
1 d 21 h
PR fusionados (30 d)
38

Preparar el entorno

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de NVIDIA-NeMo/DataDesigner

Todos los issues de NVIDIA-NeMo/DataDesigner

Issues similares

Más issues de Python

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.