Request official evaluation scripts/configs for reproducing MiniCPM5-2B benchmark results
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Necesita aclaración
- Estado de actividad
- Activo
- Área
- machine-learning
Línea de trabajo
En el issue no se mencionan archivos, tests ni puntos de entrada. Empieza por localizar cualquier material existente relacionado con la evaluación o los benchmarks en el repositorio y, a continuación, determina si se pueden añadir los scripts, las configuraciones, el preprocesamiento y los comandos de grading solicitados para MATH-500, MMLU/MMLU-Pro, AIME y HMMT; se considerará terminado cuando el flujo de trabajo oficial de reproducción esté disponible y documentado.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Hello MiniCPM Team,
I am trying to reproduce the benchmark results of MiniCPM5-2B for academic research.
I have successfully deployed the released MiniCPM5-2B model following the official instructions. However, I could not find the complete evaluation pipeline used to obtain the benchmark results reported in the model card.
Could you please share the official evaluation scripts and configurations, including:
- Benchmark evaluation scripts (MATH-500, MMLU/MMLU-Pro, AIME, HMMT, etc.);
- Inference settings:
- prompt/chat template;
- whether
enable_thinking=Trueis used; - generation parameters (
max_new_tokens, temperature, top_p, do_sample, stop criteria, etc.);
- Answer extraction and grading scripts;
- Dataset preprocessing and evaluation commands.
I especially want to reproduce the reported MATH-500 score (94.6), and I would like to confirm whether the official evaluation uses any reasoning budget, length control, or special stopping strategy for the thinking mode.
Any scripts or configuration files would be greatly appreciated.
Thank you very much.
- Lenguaje dominante
- Jupyter Notebook
- Estrellas
- 11.1k
- Forks
- 766
- Merge medio
- 5 h 3 min
- PR fusionados (30 d)
- 6
Preparar el entorno
Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de OpenBMB/MiniCPM
-
Verify evals on Papers with CodeAbierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 78/100
-
Permission request: non-commercial research mirror of tokenized UltraData sets (SHADOW-125M)Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 15/100
-
Dificultad 3/5 1-2 días Aptitud para principiantes 55/100
-
feature
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
-
Dificultad 3/5 1-2 días Aptitud para principiantes 62/100
Todos los issues de OpenBMB/MiniCPM
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
huggingface/diffusers#14888 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
pytorch/rl#4489 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
bug bug_feature_triaged max
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
Los mantenedores suelen responder en 1 día
-
bug documentation good first issue
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
Farama-Foundation/PettingZoo#1467 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 85/100