关于Table1中UI-to-Code分数聚合方式的疑问
まだ誰も着手していません。
評価
- 難易度
- 4/5
- 見積もり時間
- 3〜5日
- 初心者へのやさしさ
- 35/100
- issue の種類
- ドキュメント
- 明瞭さ
- 説明が足りない
- 活発さ
- 静か
- 技術スタック
- python
調査の方向性
Read evaluation/scripts/rate_statistics_ui2code.py and compare its score-bin output with the UI-to-Code values reported in Table 1. Determine whether the repository or paper defines the aggregation formula; done means documenting the exact aggregation method or identifying the missing source needed to answer the question.
索引モデルが issue の本文から書いたものです。
説明
你好,感谢你们的工作和开源的评测代码!
我想请教一下论文 Table 1 里 UI-to-Code 任务的最终分数是怎么聚合的。我看了evaluation/scripts/rate_statistics_ui2code.py,这个脚本会从每个样本的 \boxed{N} 里提取 0-100 的整数分,然后输出 5 个区间(0-60、60-70、70-80、80-90、90-100)的分布百分比,但并没有输出一个能对应到 Table 1 数值(比如 76.3、84.5)的单一聚合指标。
想确认一下每个样本的得分最终是怎么聚合成 benchmark 分数的:
- 是所有样本得分的算术平均吗?
- 还是某个高分区间(比如 ≥80)的占比?
- 或者其他聚合方式?
谢谢!
- 主要言語
- Python
- スター
- 86
- フォーク
- 13
- PR マージ指標
- 30日以内にマージされた PR はありません
コントリビューションガイド
このリポジトリのコントリビューションガイドは索引されていません
はじめの一歩
- issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
- 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
- リポジトリをフォークし、ブランチを切って変更します。
- issue 番号を参照したプルリクエストを送ります。
zai-org/UI2Code_N のほかの issue
-
難易度 5/5 1週間以上 初心者へのやさしさ 20/100
-
難易度 4/5 3〜5日 初心者へのやさしさ 35/100
-
train code オープン
難易度 5/5 1週間以上 初心者へのやさしさ 15/100
-
難易度 4/5 3〜5日 初心者へのやさしさ 35/100
-
PR オープン
難易度 5/5 1週間以上 初心者へのやさしさ 10/100
zai-org/UI2Code_N の issue をすべて見る
似ている issue
-
area: harness bug status: needs-triage
難易度 2/5 1〜3時間 初心者へのやさしさ 75/100
Human-Agent-Society/reef#625 ·
-
難易度 2/5 1〜3時間 初心者へのやさしさ 70/100
-
難易度 1/5 1時間未満 初心者へのやさしさ 80/100
learningequality/kolibri#15351 · コメント 2 件 ·
-
難易度 2/5 1〜3時間 初心者へのやさしさ 75/100
-
Name consistency オープン
難易度 2/5 1〜3時間 初心者へのやさしさ 75/100
eellak/triplestore#65 · コメント 1 件 ·