强制对齐

文字你已经有了,时间轴交给我们

把音频和对应的文本交给 EdgeSpeak,它会找出每个词在什么时候被说出。

直接答案

强制对齐是在音频里定位已知文本,而不是识别未知语音。EdgeSpeak 在你的电脑上返回词和段落的时间戳。

适合稿件、歌词和有声书

文字已经有了,对齐比重新转录更直接:词不变,时间正确。

应用、命令行、API 都能用

使用对齐页,运行命令,或调用本地网关。

edgespeak-cli align meeting.m4a --text-file transcript.txt -o aligned.json

语言处理

知道语言时请直接传语言代码:比如用汉字写的粤语,如果靠推断,可能被当成普通话。混合语言文本用 und,会逐词匹配。

结果直接用于字幕

对齐后的输出可以驱动 SRT、VTT 和卡拉 OK ASS 导出。

常见问题

它和转录有什么区别?

转录识别说了什么;对齐是拿你给的文本,找出每个词出现的位置。

文本归一化会改我的写法吗?

默认开启。关掉它就能完全保留原始写法。

有 API 吗?

有:本地网关的 POST /v1/audio/alignments,传入 file 和 text。

证据链接