krippendorff_alpha reports 1.0 instead of NaN for single-rater identical ratings
Maintainer thường phản hồi trong vòng 1 ngày
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 2/5
- Thời gian dự kiến
- 1-3 giờ
- Mức phù hợp với người mới
- 86/100
Hướng nghiên cứu
Bắt đầu tại pyrit/score/scorer_evaluation/krippendorff.py và kiểm tra krippendorff_alpha, đặc biệt là lệnh trả về sớm khi đếm số danh mục và cách xử lý hiện có đối với các đánh giá không thể ghép cặp. Trước tiên, hãy chạy hai ví dụ NumPy từ issue. Được xem là hoàn tất khi mọi dataset không có đánh giá nào có thể ghép cặp đều trả về NaN, bao gồm cả các đánh giá giống hệt nhau của một người đánh giá, trong khi hành vi hiện có đối với các đánh giá khác nhau của một người đánh giá vẫn chính xác.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
what happens
krippendorff_alpha returns 1.0 (perfect agreement) when every item is rated by a single rater and all those ratings happen to be identical. with no pairable ratings the statistic is undefined, so this should be NaN like it already is for single-rater data whose ratings differ.
the cause is ordering: the num_categories == 1 early return fires before the check that no item has two usable ratings, so identical-but-unpairable data takes the perfect-agreement exit.
repro
import numpy as np
from pyrit.score.scorer_evaluation.krippendorff import krippendorff_alpha
krippendorff_alpha(np.array([[1.0, 1.0]])) # 1.0 — undefined statistic reported as perfect
krippendorff_alpha(np.array([[1.0, 2.0]])) # nan — correct
same unpairable structure, opposite answers depending on whether the values coincide.
why it matters
this feeds the reliability metrics in scorer evaluation, and single-vote gold labels are a common input (cf #2628). reporting perfect agreement from one rater's identical votes overstates reliability.
expected
NaN for any dataset with no pairable ratings, per the docstring's own undefined-statistic rule.
env: main 5503ecb
- Ngôn ngữ chính
- Python
- Star
- 4.5k
- Fork
- 896
- Merge trung bình
- 3 ngày 2 giờ
- Pull request đã merge (30 ngày)
- 210
Chuẩn bị môi trường
Chúng tôi chưa kiểm tra các tệp thiết lập môi trường của dự án này. Hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của microsoft/PyRIT
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 91/100
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 84/100
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 84/100
Maintainer thường phản hồi trong vòng 1 ngày
-
Bug: triage GUI help wanted
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 86/100
microsoft/PyRIT#2868 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 82/100
Maintainer thường phản hồi trong vòng 1 ngày
Tất cả issue của microsoft/PyRIT
Issue tương tự
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 76/100
PedestrianDynamics/pyFDS-Evac#199 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 65/100
521xueweihan/HelloGitHub#3790 ·
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
sandialabs/atlas-ui-3#978 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
area: tests perceived difficulty: 2
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100
Nitjsefnie-Harness-Commons/daedalus#1255 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
hf-audiolm-qwen: `generate_until` hardcodes `.to("cuda")` and aborts on non-CUDA acceleratorsĐang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 86/100
EleutherAI/lm-evaluation-harness#4256 ·
Maintainer thường phản hồi trong vòng 1 ngày