docs: required_columns description is incomplete for LLM and multimodal columns
Los mantenedores suelen responder en 1 día
@nightcityblade ya está trabajando en esto.
Desde el 9/10/2026.
Evaluación
- Dificultad
- 2/5
- Tiempo estimado
- 1-3 horas
- Aptitud para principiantes
- 65/100
- Tipo de issue
- Documentación
- Claridad
- Bien especificado
- Estado de actividad
- Activo
- Stack tecnológico
- python
- Área
- documentation
Línea de trabajo
Empieza con la lista de viñetas required_columns en fern/versions/latest/pages/concepts/columns.mdx (alrededor de las líneas 222-230) y luego lee las propiedades required_columns en packages/data-designer-config/src/data_designer/config/column_configs.py para LLMTextColumnConfig, ImageColumnConfig y EmbeddingColumnConfig. Está terminado cuando la documentación enumera cada fuente: las variables Jinja2 de prompt y system_prompt, los nombres de columna de multi_modal_context y target_column para embeddings. Confirma el comportamiento previsto con un mantenedor antes de editar, ya que el issue está esperando triaje.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Priority Level
Low (Cosmetic / Minor)
Describe the bug
The concept documentation for required_columns in fern/versions/latest/pages/concepts/columns.mdx states that for LLM/Expression columns, dependencies are derived solely from Jinja2 {{ variables }}:
- For LLM/Expression columns: extracted from Jinja2 template
{{ variables }}
However, in packages/data-designer-config/src/data_designer/config/column_configs.py, LLMTextColumnConfig (and inheriting classes) also derives dependencies from:
- Jinja2 variables inside
system_prompt(when provided) - Column names referenced in
multi_modal_context(ctx.column_name)
Additionally, ImageColumnConfig derives dependencies from multi_modal_context, and EmbeddingColumnConfig depends on target_column.
The current documentation wording is incomplete regarding how DAG column dependencies are assembled. Updating this section will help users properly understand DAG generation ordering when using multimodal context and system prompts.
Steps/Code to reproduce bug
import data_designer.config as dd
col = dd.LLMTextColumnConfig(
name="summary",
model_alias="test-model",
prompt="Summarize this text",
system_prompt="Context: {{ user_persona }}",
multi_modal_context=[dd.ImageContext(column_name="image_input")]
)
# Inspect computed required_columns
print(col.required_columns)
# Output: ['user_persona', 'image_input']
# The docs state required_columns only extracts from Jinja2 template prompt,
# missing system_prompt and multi_modal_context dependencies.
Expected behavior
The required_columns section in columns.mdx should accurately list all sources of dependencies for LLM and multimodal columns:
- Variables in
promptandsystem_promptJinja2 templates ({{ variables }}) - Column names referenced in
multi_modal_context target_columnfor embedding columns
Agent Diagnostic / Prior Investigation
Investigated the documentation and source codebase:
- Checked
fern/versions/latest/pages/concepts/columns.mdx(lines 222–230). - Inspected implementation in
packages/data-designer-config/src/data_designer/config/column_configs.py:LLMTextColumnConfig.required_columns(lines 197–209): extracts fromself.prompt,self.system_prompt, andself.multi_modal_context.ImageColumnConfig.required_columns(lines 637–648): extracts fromself.promptandself.multi_modal_context.EmbeddingColumnConfig.required_columns(lines 589–591): returns[self.target_column].
- Confirmed that dataset builders rely on these exact dependencies for topological sorting in the DAG execution plan.
Additional context
I would be happy to contribute a fix after this issue is triaged and the intended behavior is confirmed.
Checklist
- I reproduced this issue or provided a minimal example
- I searched the docs/issues myself, or had my agent do so
- If I used an agent, I included its diagnostics above
- Lenguaje dominante
- Python
- Estrellas
- 2.3k
- Forks
- 219
- Merge medio
- 1 d 21 h
- PR fusionados (30 d)
- 38
Preparar el entorno
- Sin Dockerfile ni archivo de Docker Compose
- Tiene una plantilla de pull request
- Leer la guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de NVIDIA-NeMo/DataDesigner
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
NVIDIA-NeMo/DataDesigner#995 ·
Los mantenedores suelen responder en 1 día
-
enforce \from future import annotations` via ruff FA102 rule`Posiblemente ocupada @chethanuk la tomó hace 28 días. Abiertotask
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
NVIDIA-NeMo/DataDesigner#760 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 4/5 3-5 días Aptitud para principiantes 63/100
NVIDIA-NeMo/DataDesigner#1001 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 4/5 3-5 días Aptitud para principiantes 53/100
NVIDIA-NeMo/DataDesigner#996 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 36/100
NVIDIA-NeMo/DataDesigner#994 ·
Los mantenedores suelen responder en 1 día
Todos los issues de NVIDIA-NeMo/DataDesigner
Issues similares
-
docs(types): update the collection binding note now that typed collections shipped in pycubrid 1.9.0Abiertodocumentation priority: low size: S
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
cubrid-lab/sqlalchemy-cubrid#768 ·
Los mantenedores suelen responder en 1 día
-
--csv-bom was never wired up: PR #850 added an unused helper parameter, so #846 is not fixedAbiertobug help wanted
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
Los mantenedores suelen responder en 1 día
-
Broken link in index.rstAbiertodocumentation
Dificultad 1/5 Menos de una hora Aptitud para principiantes 65/100
ansys/pydpf-core#3547 ·
Los mantenedores suelen responder en 1 día
-
core
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
vectorize-io/hindsight#5457 ·
Los mantenedores suelen responder en 1 día
-
[Bug]: LangChain drops OpenAI Responses text blocks from session recordingPosiblemente ocupada @ktz03 la tomó hoy. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
volcengine/OpenViking#5806 ·
Los mantenedores suelen responder en 1 día