Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

krippendorff_alpha reports 1.0 instead of NaN for single-rater identical ratings

Cerrado Apto para principiantes
#2,843 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Los mantenedores suelen responder en 1 día

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
2/5
Tiempo estimado
1-3 horas
Aptitud para principiantes
86/100
Tipo de issue
Error
Claridad
Bien especificado
Estado de actividad
Activo
Stack tecnológico
python
Área
analytics

Línea de trabajo

Comienza en pyrit/score/scorer_evaluation/krippendorff.py e inspecciona krippendorff_alpha, especialmente el retorno anticipado del recuento de categorías y el manejo existente de las valoraciones sin valoraciones emparejables. Ejecuta primero los dos ejemplos de NumPy del issue. Se considera terminado cuando todo conjunto de datos sin valoraciones emparejables devuelve NaN, incluidas las valoraciones idénticas de un solo evaluador, mientras que el comportamiento existente para valoraciones diferentes de un solo evaluador sigue siendo correcto.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

what happens

krippendorff_alpha returns 1.0 (perfect agreement) when every item is rated by a single rater and all those ratings happen to be identical. with no pairable ratings the statistic is undefined, so this should be NaN like it already is for single-rater data whose ratings differ.

the cause is ordering: the num_categories == 1 early return fires before the check that no item has two usable ratings, so identical-but-unpairable data takes the perfect-agreement exit.

repro

import numpy as np
from pyrit.score.scorer_evaluation.krippendorff import krippendorff_alpha

krippendorff_alpha(np.array([[1.0, 1.0]]))  # 1.0 — undefined statistic reported as perfect
krippendorff_alpha(np.array([[1.0, 2.0]]))  # nan — correct

same unpairable structure, opposite answers depending on whether the values coincide.

why it matters

this feeds the reliability metrics in scorer evaluation, and single-vote gold labels are a common input (cf #2628). reporting perfect agreement from one rater's identical votes overstates reliability.

expected

NaN for any dataset with no pairable ratings, per the docstring's own undefined-statistic rule.

env: main 5503ecb

Lenguaje dominante
Python
Estrellas
4.5k
Forks
896
Merge medio
3 d 2 h
PR fusionados (30 d)
210

Preparar el entorno

Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de microsoft/PyRIT

Todos los issues de microsoft/PyRIT

Issues similares

Más issues de Python

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.