2 commentaires (2 commentaires)0 réaction (0 réaction)0 personne assignée (0 personne assignée)Python514 forks (514 forks)auto 404
help wantednew-task
Métriques du dépôt
- Stars
- 2 496 étoiles (2 496 étoiles)
- Métriques de merge PR
- Métriques PR en attente (Métriques PR en attente)
Description
Evaluation short description
Evaluation metadata
Provide all available
Guide contributeur
- Direction de recherche
- Étudiez le benchmark HELMET pour l'évaluation des longs contextes, comprenez son format de données et ses métriques, et implémentez une nouvelle tâche dans lighteval pour charger et évaluer les échantillons de long contexte HELMET.
- Stack technique
- python
- Domaine
- machine learningai
- Type d'issue
- Fonctionnalité
- Prérequis
- PythonGit