Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

Qualify native HRX Qwen prefill graph scheduling

Abierto
#3,083 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Los mantenedores suelen responder en 1 día

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
4/5
Tiempo estimado
3-5 días
Aptitud para principiantes
35/100
Tipo de issue
Error
Claridad
Bastante claro
Estado de actividad
Activo
Stack tecnológico
cpp

Línea de trabajo

Comienza con ggml/src/ggml-hrx/dispatch_registration/qwen/dispatch-qwen-attention-postprocess.cpp en append_postprocess_node alrededor de la línea 693, usando la configuración conservada context4096, batch512, microbatch512 y el value reshape failure informado. Compara la ruta predeterminada con las probes microbatch16 y disabled-dispatch, y después añade una regresión upstream-native y una reparación mínima. Se considera completado cuando el prefill nativo de HRX predeterminado cumple los requisitos sin deshabilitar la fusión ni reducir el contexto.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

Row: BACKEND-ROCM

The #3080 native HRX evaluation reaches Qwen3-0.6B generation after the separately tracked Loom repair (#3081), but longer prefill fails in the Qwen attention postprocess matcher.

Inputs: AMD-Ecosystem/llama.cpp 6319038132ed12f968ea68f37753f705da830ea8, HRX 6bcd5a4ff111fa5bf160ab9f4592ca8e7cc810b1 plus explicitly retained #3081 compiler patch, RX7900XTX gfx1100. Converted Qwen3-0.6B BF16 GGUF SHA256 2c7612c9a1d4f6d1f67fbee75ec88c089d1425696ac8361e9f73ca71023ea223. All 311 source tensors were checked against HF c1899de289a04d12100db370d81485cdf75e47ca.

Sixteen short prompts complete and match conventional HIP for all 256 output tokens. The retained 256-token prompt with context4096, batch512, microbatch512, F16 KV and flash attention enabled fails before generation: cannot cover value reshape node9, output f32[128,8,256,1]. The rejection originates in ggml/src/ggml-hrx/dispatch_registration/qwen/dispatch-qwen-attention-postprocess.cpp:693 through append_postprocess_node.

An explicit microbatch16 compatibility probe fails at the same value reshape, now f32[128,8,16,1]. Existing GGML_HRX_DISABLE_QWEN_DISPATCH=1 avoids that matcher but fails on unsupported per-head RMS_NORM f32[128,16,256,1]. These probes do not establish a hardware limitation or justify rejecting HRX. Standard HIP and its repaired HRX HIP-layer arm complete the same 256/2048-token requests and match all 512 generated tokens across the four qualification requests.

BACKEND-ROCM and the #3080 operator own diagnosis, a committed scoped spec before code, an upstream-native regression and minimal repair, fresh review and GPU qualification. Preserve the failed default configuration; do not silently replace it with disabled fusion or reduced context. The evaluation spec rocm-hrx-evaluation.md owns model/coverage qualification and will retain this issue under Owed in its final evidence update. Native broad prefill and model performance acceptance remain pending.

Lenguaje dominante
C++
Estrellas
440
Forks
55
Merge medio
1 d 4 h
PR fusionados (30 d)
366

Preparar el entorno

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de mudler/vllm.cpp

Todos los issues de mudler/vllm.cpp

Issues similares

Más issues de C++

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.