Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Require distinct Q and K projections in native HRX Qwen fusion

Abierto
#3,089 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Los mantenedores suelen responder en 1 día

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
3/5
Tiempo estimado
1-2 días
Aptitud para principiantes
72/100
Tipo de issue
Error
Claridad
Bien especificado
Estado de actividad
Activo
Stack tecnológico
cpp

Línea de trabajo

Empieza en ggml/src/ggml-hrx/dispatch_registration/qwen/dispatch-qwen-attention-postprocess.cpp, en match_qwen_attention_postprocess, alrededor de la línea 623; después revisa las pruebas del key-first scheduler en build-hrx-prefill-repair/evidence/key-first-scheduler-red.{json,log}. Verifica que el matcher requiera nodos de proyección de query y key distintos, manteniendo los defaults existentes y la fusión completa; luego vuelve a ejecutar la regresión de CPU con BF16 Q16/KV8 y un recuento de tokens de 1 para confirmar que no queda ningún RMSNorm genérico.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

Row: BACKEND-ROCM

The pinned AMD llama.cpp Qwen attention matcher accepts a K projection as both the query and key chain. When a complete graph visits K before Q, it emits one partial Qwen postprocess and leaves the real query to generic RMSNorm and RoPE. match_qwen_attention_postprocess in ggml/src/ggml-hrx/dispatch_registration/qwen/dispatch-qwen-attention-postprocess.cpp:623 does not require distinct query and key projection nodes.

The #3083 implementer owns the in-flow scheduling correction. The reservation helper already rejects this ambiguity, but the actual matcher must enforce the same complete-region invariant. Preserve the original matching and traversal defaults, numerical tolerances, and the complete Qwen fusion.

The CPU regression enters the public dispatch scheduler with BF16 Q16/KV8, token count1, and K-before-Q graph order. It fails at the assertion that a complete Qwen postprocess leaves no generic RMSNorm: exit -6, test ELF 1fe0b0bbf1a22a84fb652816ad943e678e415d167da8bfb9383c3db9afb613a8, unchanged backend fb2301563318df2253bc681272247a2a5587a42921a9b376b89fa103de70b2a9. Evidence: build-hrx-prefill-repair/evidence/key-first-scheduler-red.{json,log} in the #3083 worktree.

The #3083 spec will record this narrow matcher obligation before its implementation. A separate sequential GPU regression currently rejects NaN in the first decode K cache. This issue does not yet attribute that numerical failure to this matcher ambiguity; the operator will rerun it after the scoped correction.

Lenguaje dominante
C++
Estrellas
423
Forks
53
Merge medio
1 d 7 h
PR fusionados (30 d)
380

Preparar el entorno

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de mudler/vllm.cpp

Todos los issues de mudler/vllm.cpp

Issues similares

Más issues de C++

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.