huggingface/lighteval

[BUG] Optimize tokenization

Ouverte

#732 ouverte le 15 mai 2025

 (1 commentaire) (0 réaction) (1 personne assignée)Python (514 forks)auto 404
buggood first issuehelp wantedscience-team

Métriques du dépôt

Stars
 (2 496 étoiles)
Métriques de merge PR
 (Métriques PR en attente)

Description

Describe the bug

For now tokenization is bing made in a for loop, making the whole process very expensive for large benchmarks.

To Reproduce

run any big benchmarks

Expected behavior

Use batch tokenize to speed it up.

Version info

Please provide your operating system, lighteval version or commit if you installed from main, and pip/conda environment if your problem concerns dependencies.

Guide contributeur