huggingface/lighteval

[EVAL] Big-Bench Extra Hard (BBEH)

Aberta

#600 aberto em 3 de mar. de 2025

 (3 comentários) (0 reação) (0 responsável)Python (514 forks)auto 404
good first issuehelp wantednew-taskscience-team

Métricas do repositório

Stars
 (2.496 estrelas)
Métricas de merge de PR
 (Métricas PR pendentes)

Description

Evaluation short description

Google has releases BBEH as a way to compensate for the saturation of BBH in the latest generation of LLMs. Overall looks like a good benchmark to probe reasoning capabilities.

Evaluation metadata

Provide all available

Guia do colaborador