Chủ sở hữu
open-compass
Đã lập chỉ mục 5 kho mã nguồn · Xem trên GitHub
-
opencompass
OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, ...
Python · 7458 star
-
VLMEvalKit
Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks
Python · 4401 star
-
GTA
[NeurIPS 2024 D&B] GTA: A Benchmark for General Tool Agents & [arXiv 2026] GTA-2
Python · 152 star
-
AgentCompass
[EMNLP 2026] AgentCompass is an extensible open-source evaluation infrastructure for systematically assessing LLM/VLM agent capabilities.
Python · 138 star
-
GenEditEvalKit
The first unified, efficient, and extensible evaluation toolkit for evaluating image generation and editing models across multiple benchm...
Jupyter Notebook · 50 star
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 90/100
open-compass/VLMEvalKit#1698 ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
open-compass/VLMEvalKit#1697 ·
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 92/100
open-compass/VLMEvalKit#1695 ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 84/100
open-compass/opencompass#2647 · 2 bình luận ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
open-compass/VLMEvalKit#1690 · 3 bình luận ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 75/100
open-compass/opencompass#2635 ·
-
open-compass/opencompass#2631 · 1 người được giao ·
-
open-compass/opencompass#2627 · 1 người được giao ·
-
Structured extra_records output is discarded for the entire dataset if any single sample fails Đang mở
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 78/100
open-compass/VLMEvalKit#1665 · 1 bình luận ·
-
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 38/100
open-compass/AgentCompass#288 · 2 bình luận ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 45/100
open-compass/VLMEvalKit#1661 · 2 bình luận ·
-
open-compass/opencompass#2615 · 1 người được giao ·
-
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 45/100
-
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 48/100
open-compass/VLMEvalKit#1652 ·
-
Feature request: EvalPort import/export for CustomDataset (adapter already built and tested) Đang mở
open-compass/opencompass#2604 · 1 người được giao ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
open-compass/AgentCompass#276 ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 72/100
open-compass/AgentCompass#273 · 1 bình luận ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 64/100
open-compass/VLMEvalKit#1632 ·
-
Qwen-Image-Bench support Đang mở
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 35/100
-
CVTG-2K support Đang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 35/100
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 48/100
open-compass/VLMEvalKit#1621 ·
-
MMMU Open-ended问题无法正确评测 Đang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 48/100
open-compass/VLMEvalKit#1617 ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 55/100
open-compass/VLMEvalKit#1615 · 1 bình luận ·
-
open-compass/opencompass#2574 · 1 bình luận · 1 người được giao ·
-
open-compass/opencompass#2573 · 1 người được giao ·
-
有些基准没有放数据url Đang mở
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 48/100
open-compass/VLMEvalKit#1614 ·
-
LiveMMBench空链接 Đang mở
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 38/100
open-compass/VLMEvalKit#1600 ·
-
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 25/100
open-compass/opencompass#2516 · 2 bình luận ·
-
请问flyai-vl模型的评测什么时候可以支持? Đang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 25/100
open-compass/VLMEvalKit#1598 ·
-
open-compass/opencompass#2508 · 1 bình luận · 1 người được giao ·
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 78/100
open-compass/VLMEvalKit#1589 · 1 bình luận ·
-
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 58/100
open-compass/VLMEvalKit#1590 · 1 bình luận ·
-
Adding [BenchCAD]: would you accept execution-based image→CadQuery-code tasks (heavier deps)? Đang mở
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 35/100
open-compass/VLMEvalKit#1582 ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
open-compass/VLMEvalKit#1580 ·
-
open-compass/opencompass#2475 · 1 người được giao ·
-
Qwen 3.5支持 Đang mở
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 25/100
open-compass/VLMEvalKit#1562 · 3 reaction ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 64/100
open-compass/VLMEvalKit#1559 ·
-
Ovis2.6-80B-A3B 评测模型预计什么时候可以支持? Đang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 35/100
open-compass/VLMEvalKit#1553 ·
-
是否能发布pypi源 Đang mở
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 55/100
open-compass/VLMEvalKit#1537 ·
-
model:llava-1.5-7b,data:mmebench Đang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 35/100
open-compass/VLMEvalKit#1529 ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 68/100
open-compass/VLMEvalKit#1528 ·
-
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 45/100
open-compass/GTA#8 · 1 reaction ·
-
About MMBench Evaluation Đang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 30/100
open-compass/VLMEvalKit#1516 · 3 bình luận · 3 reaction ·
-
[Feature] TruthfulQA mcq模式评测支持 Đang mở
open-compass/opencompass#2427 · 1 bình luận · 1 người được giao ·
-
open-compass/opencompass#2424 · 1 bình luận · 1 người được giao ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 45/100
open-compass/VLMEvalKit#1500 ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 32/100
open-compass/VLMEvalKit#1498 ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 55/100
open-compass/VLMEvalKit#1485 ·
-
open-compass/opencompass#2413 · 1 người được giao ·
-
评测MMBench数据集发现部分问题判别错误 Đang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 25/100
open-compass/VLMEvalKit#1480 · 2 bình luận ·
Đang hiển thị 100 mục mới nhất
Trang này chỉ liệt kê những gì được lập chỉ mục gần đây. Bộ lọc nâng cao có toàn bộ kho, thu hẹp theo ngôn ngữ, độ khó và thời lượng.