huggingface/lighteval

[EVAL] Big-Bench Extra Hard (BBEH)

Ouverte

#600 ouverte le 3 mars 2025

 (3 commentaires) (0 réaction) (0 personne assignée)Python (514 forks)auto 404
good first issuehelp wantednew-taskscience-team

Métriques du dépôt

Stars
 (2 496 étoiles)
Métriques de merge PR
 (Métriques PR en attente)

Description

Evaluation short description

Google has releases BBEH as a way to compensate for the saturation of BBH in the latest generation of LLMs. Overall looks like a good benchmark to probe reasoning capabilities.

Evaluation metadata

Provide all available

Guide contributeur