[BUG]: FFT sample launches `Batch` blocks that each process the full batch
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 3/5
- Tiempo estimado
- 1-2 días
- Aptitud para principiantes
- 68/100
- Tipo de issue
- Error
- Claridad
- Bien especificado
- Estado de actividad
- Activo
- Stack tecnológico
- python
- Área
- performance
Línea de trabajo
Empieza en samples/FFT.py, en cutile_fft(), alrededor de la asignación de BS en la línea 274 y del lanzamiento de grid en la línea 315; después, lee fft_kernel para seguir cómo bid selecciona su tile. Ejecuta el ejemplo de FFT con la configuración indicada N=512 y batch=64, y verifica que la salida siga siendo numéricamente correcta mientras el trabajo del kernel y el tiempo de ejecución escalan linealmente con batch.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Version
1.5.0
Version
13.3
Describe the bug.
In samples/FFT.py, cutile_fft() sets the kernel constant BS to the full batch size (BS = x.shape[0], line 274) and also launches grid = (BS, 1, 1) (line 315). Inside fft_kernel every block loads a (BS, N*2//D, D) tile at index (bid, 0, 0) — i.e. every block loads and transforms the entire batch, then writes it out. The result is numerically correct, but the work is O(Batch²) instead of O(Batch), and the kernel spills registers / shared memory at modest batch sizes.
Expected: one block per batch item (or per fixed-size minibatch), with the grid sized Batch // BS, so cost scales linearly with batch.
Measured on a DGX Spark, N=512, batch=64, factors=(8,8,8), twiddles precomputed: kernel time 2376 µs -> 12 µs (~200x) after fixing the grid/BS relationship.
Contributing Guidelines
- I agree to follow cuTile Python's contributing guidelines
- I have searched the open bugs and have found no duplicates for this bug report
- Lenguaje dominante
- Python
- Estrellas
- 2.2k
- Forks
- 155
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de NVIDIA/cutile-python
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
NVIDIA/cutile-python#105 · 2 comentarios ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 68/100
NVIDIA/cutile-python#101 ·
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 45/100
NVIDIA/cutile-python#97 · 1 comentario ·
-
bug
Dificultad 4/5 3-5 días Aptitud para principiantes 52/100
NVIDIA/cutile-python#96 · 1 comentario ·
-
bug
NVIDIA/cutile-python#95 · 1 comentario · 1 asignado ·
Todos los issues de NVIDIA/cutile-python
Issues similares
-
essnmx good first issue
Dificultad 1/5 Menos de una hora Aptitud para principiantes 95/100
-
[Feature] 奇物选择添加优先级 Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
syfoud/Simulated_Scepter#174 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
Giskard-AI/giskard-oss#2840 · 1 comentario ·
-
A claim comment carrying the issue number is silently declined while the workflow reports success Abiertoarea: repo bug perceived difficulty: 2
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
yeti-platform/yeti#1380 ·