Support for AI4Bharat IndicConformer Models
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 55/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Bastante claro
- Estado de actividad
- Tranquilo
- Stack tecnológico
- cpp
- Área
- machine-learning
Línea de trabajo
Comienza en Subsampling::build_graph() e inspecciona la ruta depthwise existente de FastConformer; después, compárala con las operaciones ggml_conv_2d() que necesita el grafo de IndicConformer. Usa parakeet-cli transcribe con un modelo GGUF de AI4Bharat para verificar que la carga y la inferencia se completan mientras el comportamiento existente de FastConformer permanece sin cambios.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Feature Description
Please add support for AI4Bharat IndicConformer models.
Currently loading the GGUF model crashes during the feature downsampling/subsampling block.
Error
GGML_ASSERT(a->ne[2] == 1) failed
Stack:
ggml_conv_2d_dw_direct()
Subsampling::build_graph()
Root Cause
The current implementation assumes FastConformer subsampling:
conv.2 depthwise
conv.3 pointwise
conv.5 depthwise
conv.6 pointwise
However AI4Bharat IndicConformer uses:
conv.0 Conv2d
ReLU
conv.2 Conv2d
ReLU
ONNX inspection:
conv.0.weight
[512,1,3,3]
group=1
conv.2.weight
[512,512,3,3]
group=1
GGUF:
encoder.pre_encode.conv.2.weight
[3,3,512,512]
This is a different computation graph, not only a tensor layout issue.
Proposed implementation
-
Detect subsampling architecture during loading.
-
Preserve existing FastConformer depthwise path.
-
Add IndicConformer path:
Conv2d(conv.0)
→ ReLU
→ Conv2d(conv.2)
→ ReLU
using ggml_conv_2d().
- Reuse existing encoder blocks after subsampling.
Additional observation
The GGUF file itself is valid:
parakeet-cli infoworks correctly.parakeet-cli quantizeworks correctly.
The failure only occurs during parakeet-cli transcribe, when the inference graph is constructed and the subsampling layer is executed.
Use Case
Standalone C++ Speech-to-Text inference for Indian languages.
- Lenguaje dominante
- C++
- Estrellas
- 786
- Forks
- 93
- Merge medio
- 9 d 19 h
- PR fusionados (30 d)
- 4
Preparar el entorno
Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de mudler/parakeet.cpp
-
Dificultad 4/5 3-5 días Aptitud para principiantes 55/100
mudler/parakeet.cpp#68 ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 58/100
mudler/parakeet.cpp#62 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 58/100
mudler/parakeet.cpp#61 ·
-
Real streaming from a micAbierto
Dificultad 3/5 1-2 días Aptitud para principiantes 48/100
mudler/parakeet.cpp#60 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 48/100
mudler/parakeet.cpp#59 · 3 comentarios ·
Todos los issues de mudler/parakeet.cpp
Issues similares
-
`enzymexla.linalg.lu` lowering fails for a tall matrix: the permutation is built with the pivot typeAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
EnzymeAD/Enzyme-JAX#3286 ·
Los mantenedores suelen responder en 1 día
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
apache/iceberg-cpp#973 ·
Los mantenedores suelen responder en 1 día
-
Add c++23 mapping to nvccAbiertofeature request
Dificultad 1/5 Menos de una hora Aptitud para principiantes 86/100
Los mantenedores suelen responder en 2 días
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
Los mantenedores suelen responder en 1 día