Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Shared sparse one-hot (indicator) helper for squidpy and scanpy

Abierto
#224 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Los mantenedores suelen responder en 1 día

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
3/5
Tiempo estimado
1-2 días
Aptitud para principiantes
72/100
Tipo de issue
Refactorización
Claridad
Bien especificado
Estado de actividad
Activo
Stack tecnológico
numpy, python
Área
tooling

Línea de trabajo

Start with scanpy/get/_aggregated.py and squidpy/gr/_nhood.py, then review the proposed fast_array_utils.conv entry point and its sparse extra. Confirm the shared helper preserves missing labels, unused categories, mask handling, float64 output, and the stated matrix layouts; done means both callers use it without changing their current behavior.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

prettified with ai, basically saying we have two different functions we can unify here. low prio but good to document.

scanpy (sparse_indicator in scanpy/get/_aggregated.py) and squidpy (_onehot in squidpy/gr/_nhood.py) each keep a private helper that turns category codes into a sparse float64 indicator matrix, with a missing label (-1) giving no entry. They differ only in interface: scanpy takes a pd.Categorical and returns (n_categories, n_obs) as a coo_array with an optional mask, while squidpy takes a pd.Series and returns a (n_obs, n_categories) csr_matrix.

Proposal for fast_array_utils.conv (needs the sparse extra; takes codes since fast-array-utils doesn't depend on pandas):

def sparse_indicator(
    codes: NDArray[np.integer], n_categories: int, *, mask: NDArray[np.bool] | None = None
) -> coo_array:
    keep = codes >= 0 if mask is None else (codes >= 0) & mask
    obs = np.flatnonzero(keep)
    return coo_array((np.ones(obs.size), (obs, codes[keep])), shape=(codes.size, n_categories))
  • (n_obs, n_categories), the usual one-hot layout; scanpy takes .T (about 3 ms at 5M observations).
  • float64, as both callers use today.
  • Same cost as both copies today: squidpy converts the result to CSR, as it does now.

checked with missing labels, unused categories and mask.

as discussed in squidpy/#1285

Lenguaje dominante
Python
Estrellas
15
Forks
5
Merge medio
14 h 52 min
PR fusionados (30 d)
13

Preparar el entorno

Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de scverse/fast-array-utils

Todos los issues de scverse/fast-array-utils

Issues similares

Más issues de Python

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.