关于时间戳音频转录质量
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 35/100
- Tipo de issue
- Error
- Claridad
- Necesita aclaración
- Estado de actividad
- Tranquilo
- Área
- audio-video-rtc
Línea de trabajo
Reproduzca el comportamiento de ASR con marcas de tiempo utilizando el prompt proporcionado y compare su segmentación de oraciones con el modelo de transcripción MOSS de referencia. Determine si un parámetro compatible o una configuración del prompt puede producir el formato solicitado y documente la configuración o limitación verificada.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
你好,我测试带时间戳asr,prompt为"请将音频逐句转写,每个句子单独一行。每一行需以起始时间戳(精确到0.01秒)、说话人编号([S01]、[S02]…)和内容类型([广告口播]/[背景音乐]/[背景歌声]/[人声对话]/[静音]/[其他])开头," "正文为该句语音内容,行末标注结束时间戳。每句话一个时间戳,不要合并多个句子。\n\n" "输出格式:[起始时间][说话人编号][内容类型]该句内容[结束时间]\n\n" 发现出现多次多个句子划分为同一段输出的情况,但您这边moss的转录模型输出就能正确划分语句,请问moss audio这个模型需要怎么调整参数或者配置prompt效果能对齐到专用的转录模型
- Lenguaje dominante
- Python
- Estrellas
- 667
- Forks
- 45
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Preparar el entorno
Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de OpenMOSS/MOSS-Audio
-
Add the LICENSE file — pyproject references one that doesn't exist (inference code has no licence)Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
OpenMOSS/MOSS-Audio#24 ·
-
promptAbierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
OpenMOSS/MOSS-Audio#33 ·
-
自建的speech caption的数据开源吗Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
OpenMOSS/MOSS-Audio#32 ·
-
Common Voice 15 EN EvaluationAbierto
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
OpenMOSS/MOSS-Audio#27 · 1 comentario ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
OpenMOSS/MOSS-Audio#26 ·
Todos los issues de OpenMOSS/MOSS-Audio
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
spec-kitty/spec-kitty#5319 ·
Los mantenedores suelen responder en 1 día
-
backend::vllm diffusion multimodal
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
openai/openai-agents-python#5229 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
Los mantenedores suelen responder en 1 día