Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Lighteval is your all-in-one toolkit for evaluating LLMs across multiple backends

¿Es huggingface/lighteval apto para principiantes?

En los últimos 30 días, huggingface/lighteval fusionó 1 de 25 pull requests de colaboradores externos, y sus mantenedores suelen responder en 1 día. Ahora mismo hay 18 issues aptos para principiantes abiertos.

Estrellas
2.5k
Forks
562
Issues abiertos para principiantes
18
Issues indexados
239
Merge medio
1 d 1 h
PR fusionados (30 d)
7
Lenguaje dominante
Python
Licencia
MIT
Último push a GitHub
28/9/2026
Última indexación
17/9/2026
Guía de contribución
Sin guía de contribución
Código de conducta
Sin código de conducta
Etiquetas para principiantes
good first issue help wanted

Cómo contribuir a huggingface/lighteval

  1. No hay guía de contribución, así que empieza por el README y por algunos pull requests fusionados hace poco para ver cómo se proponen los cambios.
  2. Tus contribuciones se publicarán bajo la licencia MIT del proyecto.
  3. Elige uno de los 18 issues abiertos aptos para principiantes de abajo y comenta que quieres trabajar en él antes de empezar.

Las issues en las que quizá ya trabaja alguien aparecen al final. Ordenar todo por fecha

  • [FT] Add a format-neutral post-run export hook
    Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 45/100

    huggingface/lighteval#1397 ·

    Los mantenedores suelen responder en 1 día

  • [Proposal] OpenEval Import/Export Support
    Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 45/100

    huggingface/lighteval#1318 · 3 comentarios ·

    Los mantenedores suelen responder en 1 día

  • Lighteval TriviaQA evaluation not giving results as per smolLM-360M reported numbers
    Abierto
    bug

    Dificultad 4/5 3-5 días Aptitud para principiantes 35/100

    huggingface/lighteval#1316 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Task : `wikitext:103:document_level` does not work
    Abierto
    bug

    Dificultad 4/5 3-5 días Aptitud para principiantes 42/100

    huggingface/lighteval#1299 · 3 comentarios ·

    Los mantenedores suelen responder en 1 día

  • [FT] IRT-based scoring as alternative ranking method for fairer model comparison
    Abierto

    Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100

    huggingface/lighteval#1240 ·

    Los mantenedores suelen responder en 1 día

  • Custom task: RAIL Score responsible AI evaluation (8-dimension scoring)
    Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 45/100

    huggingface/lighteval#1202 ·

    Los mantenedores suelen responder en 1 día

  • [META] Is this repo still maintained? Community PRs going unreviewed for months
    Abierto

    Dificultad 5/5 Más de una semana Aptitud para principiantes 15/100

    huggingface/lighteval#1200 · 4 reacciones ·

    Los mantenedores suelen responder en 1 día

  • [BUG]
    Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 45/100

    huggingface/lighteval#1198 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [FT] add a long horizon "tension crash test" dimension based on a TXT S-class question pack
    Abierto

    Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100

    huggingface/lighteval#1164 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [FT] Support setting the multiple random seeds and decoupling it from model deployment?
    Abierto

    Dificultad 5/5 Más de una semana Aptitud para principiantes 30/100

    huggingface/lighteval#1110 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] return _winapi.DuplicateHandle
    Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 35/100

    huggingface/lighteval#1108 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] concurrent_requests in litellm backend limited to 100
    Quizá libre de nuevo Un pull request para esta issue se cerró sin fusionarse. Abierto
    bug

    Dificultad 4/5 3-5 días Aptitud para principiantes 30/100

    huggingface/lighteval#1100 · 2 comentarios ·

    Los mantenedores suelen responder en 1 día

  • [FT] I am unable to use microsoft/Phi-4-multimodal-instruct
    Abierto

    Dificultad 3/5 1-2 días Aptitud para principiantes 25/100

    huggingface/lighteval#1096 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [FT] Log-likelihood metrics support for API-based evaluation (LiteLLM / completions endpoint)
    Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 35/100

    huggingface/lighteval#1093 · 2 comentarios · 2 reacciones ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Breaking change for Hellaswag/Piqa
    Abierto
    bug

    Dificultad 4/5 3-5 días Aptitud para principiantes 35/100

    huggingface/lighteval#1090 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Cannot run math_500/mmlu_pro on models without chat template
    Abierto
    bug

    Dificultad 2/5 1-3 horas Aptitud para principiantes 50/100

    huggingface/lighteval#1089 · 3 comentarios ·

    Los mantenedores suelen responder en 1 día

  • Improving input token throughput?
    Abierto

    Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100

    huggingface/lighteval#1063 · 4 comentarios ·

    Los mantenedores suelen responder en 1 día

  • [EVAL] Long Horizon Execution
    Quizá libre de nuevo @akshathmangudi la tomó hace 320 días y no hay ningún pull request abierto. Abierto
    good first issue help wanted new-task

    huggingface/lighteval#1056 · 7 comentarios · 1 asignado ·

    Los mantenedores suelen responder en 1 día

  • [FT] Prompt Level Caching
    Quizá libre de nuevo @f14-bertolotti la tomó hace 320 días y no hay ningún pull request abierto. Abierto

    huggingface/lighteval#1053 · 2 comentarios · 1 reacción · 1 asignado ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Got Zero em on MMLU using Deepseek distilled Qwen models
    Abierto
    bug

    Dificultad 4/5 3-5 días Aptitud para principiantes 38/100

    huggingface/lighteval#1047 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [EVAL] Add kyrgyzLLM benchmark
    Quizá libre de nuevo @golden-ratio la tomó hace 320 días y no hay ningún pull request abierto. Abierto
    good first issue new-task

    huggingface/lighteval#1036 · 1 comentario · 1 asignado ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Python API doesn't seem to work with lighteval|gsm8k|<few-shot-number>
    Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 45/100

    huggingface/lighteval#1029 · 1 comentario · 2 reacciones ·

    Los mantenedores suelen responder en 1 día

  • How to evaluate MMLU-Pro
    Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 35/100

    huggingface/lighteval#1028 · 2 comentarios ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Cache management failed for tasks using sample_params to update function attrs
    Quizá libre de nuevo Un pull request para esta issue se cerró sin fusionarse. Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 45/100

    huggingface/lighteval#1026 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] LightevalTaskConfig doesn't support comparison, but Cache management uses sorted on it
    Quizá libre de nuevo Un pull request para esta issue se cerró sin fusionarse. Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 45/100

    huggingface/lighteval#1024 · 2 comentarios ·

    Los mantenedores suelen responder en 1 día

  • Vision Language Model Support?
    Abierto

    Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100

    huggingface/lighteval#1020 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [FT] Upgrade the VLLM dependency to 0.10.2+
    Abierto

    Dificultad 3/5 1-2 días Aptitud para principiantes 58/100

    huggingface/lighteval#1002 · 5 comentarios ·

    Los mantenedores suelen responder en 1 día

  • RULER benchmark not found
    Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 25/100

    huggingface/lighteval#1001 · 1 comentario · 1 reacción ·

    Los mantenedores suelen responder en 1 día

  • Evaluation of encoder and decoder models on SuperGLUE
    Abierto

    Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100

    huggingface/lighteval#1000 · 3 comentarios ·

    Los mantenedores suelen responder en 1 día

  • How to print all pass@k scores when generating 16 samples?
    Abierto

    Dificultad 3/5 1-2 días Aptitud para principiantes 30/100

    huggingface/lighteval#999 · 10 comentarios ·

    Los mantenedores suelen responder en 1 día

  • [BUG] FileNotFoundError with newest lighteval 0.11.0
    Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 35/100

    huggingface/lighteval#988 · 2 comentarios · 2 reacciones ·

    Los mantenedores suelen responder en 1 día

  • [EVAL] Add SLR-Bench
    Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 30/100

    huggingface/lighteval#982 ·

    Los mantenedores suelen responder en 1 día

  • [EVAL] Add MathVista
    Quizá libre de nuevo @omkar-334 la tomó hace 319 días y no hay ningún pull request abierto. Abierto

    Dificultad 3/5 1-2 días Aptitud para principiantes 35/100

    huggingface/lighteval#975 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • Can't reproduce the Chinese FineTasks results.
    Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 25/100

    huggingface/lighteval#974 ·

    Los mantenedores suelen responder en 1 día

  • [FT] Additional LiteLLM model config options and better context length estimate
    Abierto

    Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100

    huggingface/lighteval#966 ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Cuda OOM with gpt-oss-20b
    Abierto
    bug

    Dificultad 4/5 3-5 días Aptitud para principiantes 30/100

    huggingface/lighteval#959 · 10 comentarios ·

    Los mantenedores suelen responder en 1 día

  • [BUG] bug prevents mixing batched and non-batched metrics
    Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 55/100

    huggingface/lighteval#957 · 1 reacción ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Evaluation tracker won't save task which relies on using metrics of 2 different types
    Quizá libre de nuevo @chiruu12 la tomó hace 68 días y no hay ningún pull request abierto. Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 48/100

    huggingface/lighteval#950 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] PreTrainedTokenizerFast._batch_encode_plus() got multiple values for keyword argument 'truncation_strategy
    Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 43/100

    huggingface/lighteval#949 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [FT] Support confidence reporting and sampling
    Quizá libre de nuevo @clefourrier la tomó hace 404 días y no hay ningún pull request abierto. Abierto
    science-team

    huggingface/lighteval#940 · 1 asignado ·

    Los mantenedores suelen responder en 1 día

  • [BUG] VLLM Code Generate hangs
    Abierto
    bug

    Dificultad 4/5 3-5 días Aptitud para principiantes 38/100

    huggingface/lighteval#933 · 2 reacciones ·

    Los mantenedores suelen responder en 1 día

  • [FT] Pass reasoning effort to `litellm` endpoint.
    Abierto

    Dificultad 3/5 1-2 días Aptitud para principiantes 55/100

    huggingface/lighteval#918 · 2 comentarios ·

    Los mantenedores suelen responder en 1 día

  • [BUG] TransformersModel.from_model provides an incompletely initialized object compared to __init__
    Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 45/100

    huggingface/lighteval#897 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Automatic batch size detection causes distributed deadlock in model parallel mode
    Abierto
    bug

    Dificultad 4/5 3-5 días Aptitud para principiantes 35/100

    huggingface/lighteval#896 ·

    Los mantenedores suelen responder en 1 día

  • [BUG] Model Parallelism is incorrectly disabled on single multi-GPU machines
    Abierto
    bug

    Dificultad 3/5 1-2 días Aptitud para principiantes 45/100

    huggingface/lighteval#895 ·

    Los mantenedores suelen responder en 1 día

  • Importing swiss_legal metrics sets float32 matmul precision to "medium" process-wide, breaking long transformers generations
    Posiblemente ocupada @jayzuccarelli la tomó hace 4 días. Abierto

    Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100

    huggingface/lighteval#1414 ·

    Los mantenedores suelen responder en 1 día

  • PassAtK returns 1.0 for all-wrong samples when k > n
    Posiblemente ocupada @woodforestsen la tomó hace 5 días. Abierto

    Dificultad 2/5 1-3 horas Aptitud para principiantes 86/100

    huggingface/lighteval#1410 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] 187 multilingual/QA tasks can't load on datasets>=4 (script-based datasets); ifeval-fr/gpqa-fr/bac-fr repos are gone
    Posiblemente ocupada @irvallensar la tomó hace 5 días. Abierto

    Dificultad 4/5 3-5 días Aptitud para principiantes 50/100

    huggingface/lighteval#1406 · 1 comentario ·

    Los mantenedores suelen responder en 1 día

  • [BUG] LiveCodeBench scores every generation as -2 when multiprocessing uses spawn or forkserver
    Posiblemente ocupada Un pull request vinculado a esta issue está abierto o ya se fusionó. Abierto

    Dificultad 3/5 1-2 días Aptitud para principiantes 78/100

    huggingface/lighteval#1400 ·

    Los mantenedores suelen responder en 1 día

  • Metrics.drop aggregates em/f1 across documents with max, so one correct sample reports 1.0
    Posiblemente ocupada @AloysJehwin la tomó hace 13 días. Abierto

    Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100

    huggingface/lighteval#1395 ·

    Los mantenedores suelen responder en 1 día

Mostrando los 100 más recientes

Esta página solo lista lo indexado más recientemente. El filtro avanzado tiene el inventario completo, acotado por lenguaje, dificultad y duración.

Abrir el filtro avanzado

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.