Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Code benchmarks

Abierto
#5 2 comentarios 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
5/5
Tiempo estimado
Más de una semana
Aptitud para principiantes
25/100
Tipo de issue
Nueva funcionalidad
Claridad
Necesita aclaración
Estado de actividad
Tranquilo
Stack tecnológico
python

Línea de trabajo

El issue no menciona archivos del repositorio, pruebas ni puntos de entrada. Empieza revisando las descripciones de los benchmarks enlazados y la configuración existente de benchmarks, si la hay; para darlo por terminado harían falta un alcance de benchmark definido y un plan concreto para la evaluación y la gestión del entorno.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

While we are starting with SWE-bench Verified, we should explore other python benchmarks. In increasing order of difficulty:

  • HumanEval: ~160 hand-crafted python functions. Difficulty - Easy
  • ODEX: Open-domain execution-based python. Library API use. Difficulty - Easy-Medium
  • BigCodeBench: ~1700 tasks using composition of the standard library + third-party libraries. Difficulty - Medium
  • LiveCodeBench: Competitive programming. Contamination resistant. Difficulty: Medium-Very Hard
  • SWE-bench Verified: 500 human-validated GitHub issues from real python repos. Difficulty: Hard

Warning: See paper for issues with memorization.

Agentic coverage:

  • SWT-Bench: Test generation for a given codebase. Includes categories like Test Generation, Test Repair, Coverage Improvement.
  • Terminal-Bench 2.0: Tasks in a terminal/shell environment.
  • FeatureBench: Feature request implementation and not just bug fixes.

Python DS code:

  • DS-1000: ~1000 data science problems in numpy, pandas, matplotlib, sklearn, pytorch, scipy.
  • MLE-bench: Kaggle competitions benchmark

Contamination resistance:

  • EvoEval: Semantic perturbations of HumanEval problems.

Possible curriculum for RL:

  1. Easy HumanEval -> EvoEval -> ODEX
  2. Medium BigCodeBench -> DS-1000 -> LiveCodeBench (easy/medium)
  3. Hard SWE-bench Verified -> SWT-Bench -> Terminal Bench 2.0
  4. Very Hard MLE-Bench -> LiveCodeBench (hard) -> FeatureBench

Important point about environment

Most of these benchmarks have examples that fit in the context window. For practical use, once codebases get large enough, retrieval plays an important role. Might need custom harness to reproduce this e.g. cap the number of files that can be read for any instance. Don't worry about this now!

Lenguaje dominante
Python
Estrellas
1
Forks
4
Métricas de merge de PR
Sin PR fusionados en 30 d

Preparar el entorno

Este proyecto no incluye contenedor de desarrollo, Dockerfile ni guía de contribución, así que la configuración corre por tu cuenta: empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de redhat-et/code-agent

Todos los issues de redhat-et/code-agent

Issues similares

Más issues de Python

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.