音频caption支持输出带时间戳的吗
还没有人认领这个 Issue。
评估
- 难度
- 5/5
- 预计耗时
- 一周以上
- 新手友好度
- 42/100
- Issue 类型
- 功能
- 描述清晰度
- 基本清楚
- 活跃度
- 冷清
- 技术栈
- python
调研方向
该 issue 没有指出任何文件、测试或入口点。首先定位 audio-captioning 的推理入口点及其当前的 caption 输出,然后确定自动音频分段和带时间戳的结果应如何适配所请求的 start/end/caption 结构;完成的标准是生成该结构化输出。
由索引模型根据 Issue 内容生成。
描述
比如
[
{"start":0.0,"end":3.1,"caption":"dog barking"},
{"start":2.8,"end":7.0,"caption":"woman speaking"},
{"start":6.9,"end":12.0,"caption":"car engine starts"}
]
这样的,自动切割音频并分段caption
- 主要语言
- Python
- 星标
- 667
- 派生
- 45
- PR 合并指标
- 30 天内没有已合并 PR
环境准备
我们还没有检查这个项目的环境配置文件。先看它的 README,通用步骤见我们的新手贡献指南。
从这里开始
- 先读完整个 Issue,再读项目的贡献指南。
- 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
- Fork 仓库,在一个分支上完成修改。
- 提交 Pull Request,并在描述里引用这个 Issue 编号。
OpenMOSS/MOSS-Audio 的其他 Issue
-
Add the LICENSE file — pyproject references one that doesn't exist (inference code has no licence)未关闭
难度 2/5 1-3 小时 新手友好度 68/100
OpenMOSS/MOSS-Audio#24 ·
-
prompt未关闭
难度 5/5 一周以上 新手友好度 25/100
OpenMOSS/MOSS-Audio#33 ·
-
难度 5/5 一周以上 新手友好度 25/100
OpenMOSS/MOSS-Audio#32 ·
-
关于时间戳音频转录质量未关闭
难度 4/5 3-5 天 新手友好度 35/100
OpenMOSS/MOSS-Audio#30 ·
-
难度 4/5 3-5 天 新手友好度 35/100
OpenMOSS/MOSS-Audio#27 · 1 条评论 ·
查看 OpenMOSS/MOSS-Audio 的全部 Issue
相似的 Issue
-
难度 2/5 1-3 小时 新手友好度 84/100
PedestrianDynamics/pyFDS-Evac#343 ·
维护者通常 1 天内回复
-
难度 2/5 1-3 小时 新手友好度 88/100
theskumar/python-dotenv#708 ·
-
难度 1/5 1 小时以内 新手友好度 88/100
维护者通常 2 天内回复
-
Docs Timedelta
难度 2/5 1-3 小时 新手友好度 72/100
pandas-dev/pandas#69919 ·
维护者通常 1 天内回复
-
API documentation
难度 2/5 1-3 小时 新手友好度 72/100
zephyrproject-rtos/west#1009 · 2 条评论 ·
维护者通常 3 天内回复