Propriétaire
open-compass
5 dépôts indexés · Voir sur GitHub
-
opencompass
OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, ...
Python · 7458 étoiles
-
VLMEvalKit
Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks
Python · 4401 étoiles
-
GTA
[NeurIPS 2024 D&B] GTA: A Benchmark for General Tool Agents & [arXiv 2026] GTA-2
Python · 152 étoiles
-
AgentCompass
[EMNLP 2026] AgentCompass is an extensible open-source evaluation infrastructure for systematically assessing LLM/VLM agent capabilities.
Python · 138 étoiles
-
GenEditEvalKit
The first unified, efficient, and extensible evaluation toolkit for evaluating image generation and editing models across multiple benchm...
Jupyter Notebook · 50 étoiles
-
Difficulté 1/5 Moins d'une heure Accessibilité débutants 90/100
open-compass/VLMEvalKit#1698 ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 78/100
open-compass/VLMEvalKit#1697 ·
-
Difficulté 1/5 Moins d'une heure Accessibilité débutants 92/100
open-compass/VLMEvalKit#1695 ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 84/100
open-compass/opencompass#2647 · 2 commentaires ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 78/100
open-compass/VLMEvalKit#1690 · 3 commentaires ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 75/100
open-compass/opencompass#2635 ·
-
open-compass/opencompass#2631 · 1 personne assignée ·
-
open-compass/opencompass#2627 · 1 personne assignée ·
-
Structured extra_records output is discarded for the entire dataset if any single sample fails Ouverte
Difficulté 3/5 1-2 jours Accessibilité débutants 78/100
open-compass/VLMEvalKit#1665 · 1 commentaire ·
-
Difficulté 5/5 Plus d'une semaine Accessibilité débutants 38/100
open-compass/AgentCompass#288 · 2 commentaires ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 45/100
open-compass/VLMEvalKit#1661 · 2 commentaires ·
-
open-compass/opencompass#2615 · 1 personne assignée ·
-
Difficulté 4/5 3-5 jours Accessibilité débutants 45/100
-
Difficulté 4/5 3-5 jours Accessibilité débutants 48/100
open-compass/VLMEvalKit#1652 ·
-
Feature request: EvalPort import/export for CustomDataset (adapter already built and tested) Ouverte
open-compass/opencompass#2604 · 1 personne assignée ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 78/100
open-compass/AgentCompass#276 ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 72/100
open-compass/AgentCompass#273 · 1 commentaire ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 64/100
open-compass/VLMEvalKit#1632 ·
-
Qwen-Image-Bench support Ouverte
Difficulté 5/5 Plus d'une semaine Accessibilité débutants 35/100
-
CVTG-2K support Ouverte
Difficulté 4/5 3-5 jours Accessibilité débutants 35/100
-
Difficulté 3/5 1-2 jours Accessibilité débutants 48/100
open-compass/VLMEvalKit#1621 ·
-
MMMU Open-ended问题无法正确评测 Ouverte
Difficulté 4/5 3-5 jours Accessibilité débutants 48/100
open-compass/VLMEvalKit#1617 ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 55/100
open-compass/VLMEvalKit#1615 · 1 commentaire ·
-
open-compass/opencompass#2574 · 1 commentaire · 1 personne assignée ·
-
open-compass/opencompass#2573 · 1 personne assignée ·
-
有些基准没有放数据url Ouverte
Difficulté 3/5 1-2 jours Accessibilité débutants 48/100
open-compass/VLMEvalKit#1614 ·
-
LiveMMBench空链接 Ouverte
Difficulté 3/5 1-2 jours Accessibilité débutants 38/100
open-compass/VLMEvalKit#1600 ·
-
Difficulté 5/5 Plus d'une semaine Accessibilité débutants 25/100
open-compass/opencompass#2516 · 2 commentaires ·
-
请问flyai-vl模型的评测什么时候可以支持? Ouverte
Difficulté 4/5 3-5 jours Accessibilité débutants 25/100
open-compass/VLMEvalKit#1598 ·
-
open-compass/opencompass#2508 · 1 commentaire · 1 personne assignée ·
-
Difficulté 1/5 Moins d'une heure Accessibilité débutants 78/100
open-compass/VLMEvalKit#1589 · 1 commentaire ·
-
Difficulté 4/5 3-5 jours Accessibilité débutants 58/100
open-compass/VLMEvalKit#1590 · 1 commentaire ·
-
Adding [BenchCAD]: would you accept execution-based image→CadQuery-code tasks (heavier deps)? Ouverte
Difficulté 5/5 Plus d'une semaine Accessibilité débutants 35/100
open-compass/VLMEvalKit#1582 ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 78/100
open-compass/VLMEvalKit#1580 ·
-
open-compass/opencompass#2475 · 1 personne assignée ·
-
Qwen 3.5支持 Ouverte
Difficulté 5/5 Plus d'une semaine Accessibilité débutants 25/100
open-compass/VLMEvalKit#1562 · 3 réactions ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 64/100
open-compass/VLMEvalKit#1559 ·
-
Ovis2.6-80B-A3B 评测模型预计什么时候可以支持? Ouverte
Difficulté 4/5 3-5 jours Accessibilité débutants 35/100
open-compass/VLMEvalKit#1553 ·
-
是否能发布pypi源 Ouverte
Difficulté 3/5 1-2 jours Accessibilité débutants 55/100
open-compass/VLMEvalKit#1537 ·
-
model:llava-1.5-7b,data:mmebench Ouverte
Difficulté 4/5 3-5 jours Accessibilité débutants 35/100
open-compass/VLMEvalKit#1529 ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 68/100
open-compass/VLMEvalKit#1528 ·
-
Difficulté 4/5 3-5 jours Accessibilité débutants 45/100
open-compass/GTA#8 · 1 réaction ·
-
About MMBench Evaluation Ouverte
Difficulté 4/5 3-5 jours Accessibilité débutants 30/100
open-compass/VLMEvalKit#1516 · 3 commentaires · 3 réactions ·
-
[Feature] TruthfulQA mcq模式评测支持 Ouverte
open-compass/opencompass#2427 · 1 commentaire · 1 personne assignée ·
-
open-compass/opencompass#2424 · 1 commentaire · 1 personne assignée ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 45/100
open-compass/VLMEvalKit#1500 ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 32/100
open-compass/VLMEvalKit#1498 ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 55/100
open-compass/VLMEvalKit#1485 ·
-
open-compass/opencompass#2413 · 1 personne assignée ·
-
评测MMBench数据集发现部分问题判别错误 Ouverte
Difficulté 4/5 3-5 jours Accessibilité débutants 25/100
open-compass/VLMEvalKit#1480 · 2 commentaires ·
Affichage des 100 plus récents
Cette page ne liste que les entrées les plus récentes. Le filtre avancé contient l'inventaire complet, affiné par langage, difficulté et durée.