Repository Issues
huggingface/lighteval
Lighteval is your all-in-one toolkit for evaluating LLMs across multiple backends
Issues
Offen
[EVAL] Long Horizon Execution
good first issuehelp wantednew-task
Einsteigerfreundliches Label vorhanden
7 Kommentare0 Reaktionen1 zugewiesene Person
Offen
[EVAL] Add kyrgyzLLM benchmark
good first issuenew-task
Warum empfohlenEinsteigerfreundliches Label vorhanden
Einsteigerfreundliches Label vorhanden
1 Kommentar0 Reaktionen1 zugewiesene Person
Offen
[FT] showing count in Markdown summary table
featuregood first issue
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
5 Kommentare1 Reaktion0 zugewiesene Personen
Offen
[FT] Add tests for nanotron
featuregood first issuehelp wantedignore-for-release
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
3 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[BUG] custom model docs don't run: missing imports
bugdocumentationgood first issue
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
5 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[FT] Manage script and language in the Language enum
featuregood first issue
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
2 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[EVAL] TauBench:
help wantednew-task
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
1 Kommentar0 Reaktionen0 zugewiesene Personen
Offen
[EVAL] SciCode: reasearch coding benchmark
help wantednew-task
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
2 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[BUG] Optimize tokenization
buggood first issuehelp wantedscience-team
Warum empfohlenEinsteigerfreundliches Label vorhanden
Einsteigerfreundliches Label vorhanden
1 Kommentar0 Reaktionen1 zugewiesene Person
Offen
[EVAL] HELMET: long context evals
help wantednew-task
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
2 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[EVAL] SWEBENCH multilingual
help wantednew-task
Warum empfohlenNoch niemand zugewiesen · Noch keine Kommentare
Noch niemand zugewiesenNoch keine KommentareEinsteigerfreundliches Label vorhanden
0 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[FT] Add tests for `VLLMModel` base methods
featuregood first issue
Warum empfohlenNoch keine Kommentare · Einsteigerfreundliches Label vorhanden
Noch keine KommentareEinsteigerfreundliches Label vorhanden
0 Kommentare1 Reaktion1 zugewiesene Person
Offen
Call for contributions: Translate lighteval's doc into Chinese
good first issuehelp wantednew-task
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
2 Kommentare1 Reaktion0 zugewiesene Personen
Offen
[BUG] Installing lighteval breaks hydra-core
bughelp wanted
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
1 Kommentar1 Reaktion0 zugewiesene Personen
Offen
[EVAL] Adding PHARE
good first issuehelp wantednew-task
Warum empfohlenEinsteigerfreundliches Label vorhanden
Einsteigerfreundliches Label vorhanden
9 Kommentare0 Reaktionen1 zugewiesene Person
Offen
[FT] Improve Documentation and Examples
documentationfeaturegood first issuehelp wanted
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
6 Kommentare1 Reaktion0 zugewiesene Personen
Offen
[FT] Log progress bar on main process
featurehelp wantedscience-team
Warum empfohlenNoch niemand zugewiesen · Noch keine Kommentare
Noch niemand zugewiesenNoch keine KommentareEinsteigerfreundliches Label vorhanden
0 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[FT] Build in a way to specify specific IDs/Lines in Dataset to use as few-shot examples in the same split
featuregood first issuehelp wanted
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
3 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[EVAL] Big-Bench Extra Hard (BBEH)
good first issuehelp wantednew-taskscience-team
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
3 Kommentare0 Reaktionen0 zugewiesene Personen
Offen
[EVAL] Add TUMLU benchmark
good first issuehelp wantednew-task
Warum empfohlenNoch niemand zugewiesen · Einsteigerfreundliches Label vorhanden
Noch niemand zugewiesenEinsteigerfreundliches Label vorhanden
10 Kommentare0 Reaktionen0 zugewiesene Personen