Code benchmarks
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Necesita aclaración
- Estado de actividad
- Tranquilo
- Stack tecnológico
- python
- Área
- machine-learning
Línea de trabajo
El issue no menciona archivos del repositorio, pruebas ni puntos de entrada. Empieza revisando las descripciones de los benchmarks enlazados y la configuración existente de benchmarks, si la hay; para darlo por terminado harían falta un alcance de benchmark definido y un plan concreto para la evaluación y la gestión del entorno.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
While we are starting with SWE-bench Verified, we should explore other python benchmarks. In increasing order of difficulty:
- HumanEval: ~160 hand-crafted python functions. Difficulty - Easy
- ODEX: Open-domain execution-based python. Library API use. Difficulty - Easy-Medium
- BigCodeBench: ~1700 tasks using composition of the standard library + third-party libraries. Difficulty - Medium
- LiveCodeBench: Competitive programming. Contamination resistant. Difficulty: Medium-Very Hard
- SWE-bench Verified: 500 human-validated GitHub issues from real python repos. Difficulty: Hard
Warning: See paper for issues with memorization.
Agentic coverage:
- SWT-Bench: Test generation for a given codebase. Includes categories like Test Generation, Test Repair, Coverage Improvement.
- Terminal-Bench 2.0: Tasks in a terminal/shell environment.
- FeatureBench: Feature request implementation and not just bug fixes.
Python DS code:
- DS-1000: ~1000 data science problems in numpy, pandas, matplotlib, sklearn, pytorch, scipy.
- MLE-bench: Kaggle competitions benchmark
Contamination resistance:
- EvoEval: Semantic perturbations of HumanEval problems.
Possible curriculum for RL:
- Easy HumanEval -> EvoEval -> ODEX
- Medium BigCodeBench -> DS-1000 -> LiveCodeBench (easy/medium)
- Hard SWE-bench Verified -> SWT-Bench -> Terminal Bench 2.0
- Very Hard MLE-Bench -> LiveCodeBench (hard) -> FeatureBench
Important point about environment
Most of these benchmarks have examples that fit in the context window. For practical use, once codebases get large enough, retrieval plays an important role. Might need custom harness to reproduce this e.g. cap the number of files that can be read for any instance. Don't worry about this now!
- Lenguaje dominante
- Python
- Estrellas
- 1
- Forks
- 4
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Preparar el entorno
Este proyecto no incluye contenedor de desarrollo, Dockerfile ni guía de contribución, así que la configuración corre por tu cuenta: empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de redhat-et/code-agent
-
Add Multi-Pass Implementation for SWE-Bench EvalQuizá libre de nuevo @ilya-kolchinsky la tomó hace 136 días y no hay ningún pull request abierto. Abierto
redhat-et/code-agent#25 · 1 asignado ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
redhat-et/code-agent#22 ·
-
Create baseline evaluation pipeline using the HumanEval benchmarkQuizá libre de nuevo @lmzuccarelli la tomó hace 167 días y no hay ningún pull request abierto. Abiertowip
redhat-et/code-agent#15 · 1 asignado ·
-
Create baseline evaluation pipeline of the ODEX dataset on Devstral Small 2Quizá libre de nuevo @ilya-kolchinsky la tomó hace 169 días y no hay ningún pull request abierto. Abierto
redhat-et/code-agent#13 · 1 asignado ·
-
SkyPilotQuizá libre de nuevo @MichaelClifford la tomó hace 136 días y no hay ningún pull request abierto. Abierto
redhat-et/code-agent#11 · 1 asignado ·
Todos los issues de redhat-et/code-agent
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
conda-forge/conda-build-feedstock#289 · 1 comentario · 1 reacción ·
-
`pulptest` no longer works in 4.0.0: `ImportError: Start directory is not importable: 'pulp/tests'`Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
-
remove reddit feedsAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
TomCasavant/ohio-sites#224 ·