EvalScope integration: one-command evaluation support for PerceptionBench
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 1/5
- Tempo stimato
- 1-3 ore
- Idoneità per principianti
- 68/100
- Tipo di issue
- Documentazione
- Chiarezza
- Abbastanza chiara
- Stato di attività
- Tranquilla
- Stack tecnologico
- python
- Ambito
- documentation
Direzione di ricerca
Inizia controllando il README e la documentazione esistente per trovare la posizione appropriata per un link al workflow di valutazione. Aggiungi una sezione concisa su EvalScope con il comando fornito e l’URL della guida, quindi verifica che l’esempio e le note di configurazione specifiche del benchmark siano corrette.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Hi MoonshotAI/PerceptionBench maintainers,
EvalScope now supports PerceptionBench. This gives users another way to run the benchmark when they want a standardized evaluation workflow around OpenAI-compatible model endpoints, saved predictions, scoring, and report generation.
This may be useful for users who find this repository while setting up PerceptionBench and want a quick path to evaluate a hosted or locally served model.
Example:
evalscope eval \
--model YOUR_MODEL \
--api-url OPENAI_API_COMPAT_URL \
--api-key EMPTY_TOKEN \
--datasets perception_bench \
--limit 10
Docs: https://evalscope.readthedocs.io/en/latest/benchmarks/perception_bench.html
EvalScope repo: https://github.com/modelscope/evalscope
Some benchmarks may require additional assets, media files, or judge-model configuration for a full run; the EvalScope guide above includes the benchmark-specific setup notes.
If this is useful for your community, we can follow up with a small README/Docs PR linking to the EvalScope usage guide.
- Lingua principale
- Python
- Stelle
- 212
- Fork
- 12
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Preparare l'ambiente
Questo progetto non fornisce container di sviluppo, Dockerfile né guida per i contributori, quindi l'ambiente è a tuo carico: parti dal suo README e consulta la nostra guida al primo contributo per i passaggi generali.
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di MoonshotAI/PerceptionBench
-
Test setAperta
Difficoltà 5/5 Più di una settimana Idoneità per principianti 35/100
MoonshotAI/PerceptionBench#2 · 1 reazione ·
-
PBench & VisResAperta
Difficoltà 4/5 3-5 giorni Idoneità per principianti 35/100
Tutte le issue di MoonshotAI/PerceptionBench
Issue simili
-
request-theme
Difficoltà 2/5 Meno di un'ora Idoneità per principianti 70/100
LizardByte/ThemerrDB#8877 · 1 commento ·
I maintainer di solito rispondono entro 1 giorno
-
area/install-update comp/gateway P0 sweeper:risk-compatibility type/bug
Difficoltà 2/5 Meno di un'ora Idoneità per principianti 72/100
NousResearch/hermes-agent#135997 · 3 commenti ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
deepset-ai/haystack#13199 ·
I maintainer di solito rispondono entro 1 giorno
-
[BUG] JSONLoader rejects valid UTF-8 BOM filesForse già presa @zouyonghe l’ha presa oggi. Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
anthropics/knowledge-work-plugins#1298 ·
I maintainer di solito rispondono entro 1 giorno