Rubric judge未获得被评 agent 的执行轨迹——与论文不一致,且「是否使用了某文件」类 rubric 恒被判通过
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 3/5
- Thời gian dự kiến
- 1-2 ngày
- Mức phù hợp với người mới
- 65/100
- Loại issue
- Lỗi
- Độ rõ ràng
- Khá rõ ràng
- Mức độ hoạt động
- Ít trao đổi
- Công nghệ
- python
- Lĩnh vực
- ai, testing-qa
Hướng nghiên cứu
Bắt đầu trong evaluation/src/agent_as_a_judge.py, đặc biệt là _build_judge_prompt và _prepare_judge_view, rồi so sánh payload của bộ chấm với cách xử lý execution trace trong dep_graph_recognition._trace_summary. Theo dõi cách dữ liệu thực thi được cung cấp và đảm bảo việc chấm rubric nhận được các tệp đầu ra, các tệp đầu vào, các rubric và execution trace, để các rubric dựa trên quy trình không được thông qua chỉ vì các đầu vào đang hiển thị.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
您好,感谢发布 Workspace-Bench。
我们最近在使用 Workspace-Bench 评测多个 Agent 系统。整体上非常认可这个 benchmark 的方向,尤其是大规模 noisy workspace、cross-file dependency reasoning 和 workspace-level grounding。这些设计比传统“小文件包 QA benchmark”更接近真实 Agent 场景。
但是我发现论文明确 Agent-as-a-Judge 评 rubric 时会把被评 agent 的执行轨迹一并给裁判;当前代码(evaluation/src/agent_as_a_judge.py)没给,裁判只能看原始输入 + 候选输出。后果:(1) rubric 通过率无法与论文对标;(2)「agent 是否使用/整合/追溯了某输入文件」这类过程型 rubric 被恒判通过(因为input本质上是模型应该用到哪些文件的gt),抬高分数。
论文规定 — 裁判应拿到 4 样:输出文件 + 输入文件 + rubrics + 执行轨迹。
代码现状 — _build_judge_prompt 的 payload = task/steps/rubrics/data/judgeView{cwd, inputsPath, originalTaskMetadataPath, candidateOutputPath};_prepare_judge_view 只暴露 inputs/ + candidate_output/。无 executionTrace。 max_trace_items 对 rubric 评分是无效参数(轨迹只在 dep_graph_recognition._trace_summary 依赖图那步用)。
影响 — (1) 与论文口径不一致;(2) 只有 inputs/ 可见、目标文件本就在其中 → 「是否用了 X」几乎恒判通过。
- Ngôn ngữ chính
- Python
- Star
- 72
- Fork
- 7
- Merge trung bình
- 7 phút
- Pull request đã merge (30 ngày)
- 6
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của OpenDataBox/Workspace-Bench
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
OpenDataBox/Workspace-Bench#24 · 1 bình luận · 1 reaction ·
-
Possible untranslated Chinese DOCX content in the English split (Task 102 as a reproducible example) Đang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 48/100
-
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 35/100
OpenDataBox/Workspace-Bench#23 · 1 bình luận · 1 reaction ·
-
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 68/100
OpenDataBox/Workspace-Bench#22 · 1 bình luận · 1 reaction ·
-
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 35/100
OpenDataBox/Workspace-Bench#11 · 1 bình luận ·
Tất cả issue của OpenDataBox/Workspace-Bench
Issue tương tự
-
bug confirmed issue
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 75/100
open-webui/open-webui#30750 · 1 bình luận ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 75/100
-
enhancement
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 75/100
OpenwaterHealth/openmotion-bloodflow-app#604 · 1 bình luận ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 70/100
-
good first issue
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 90/100