confident-ai/deepeval

Support popular benchmarks

Ouverte

#508 ouverte le 22 févr. 2024

 (11 commentaires) (0 réaction) (0 personne assignée)Python (1 677 forks)auto 404
enhancementhelp wanted

Métriques du dépôt

Stars
 (16 939 étoiles)
Métriques de merge PR
 (Merge moyen 4j 16h) (26 PRs mergées en 30 j)

Description

Currently, users of deepeval can only create their own evaluation dataset/test cases. To support more users fine-tuning their model, deepeval should be able to import standard benchmarks such as MMLU, hellaswag, TruthfulQA, Big Bench, etc.

Comment or DM on discord to discuss more: https://discord.com/invite/a3K9c8GRGt

Guide contributeur