说话人

在本机分清谁在什么时候说话

转录时打开说话人识别,能归属的段落会标上说话人。

直接答案

EdgeSpeak 在本机按段标注说话人,可重命名、保存说话人档案,并在不同录音间认出同一个声音。

给说话人命名

可以重命名说话人标签并保存档案。声纹加密后只存在你的电脑上。

脚本和 Agent 也能用

CLI 用 transcribe --diarize,本地网关返回 diarized_json,/v1/speaker/diarizations 返回说话人时间轴,MCP 提供 edgespeak_diarize_file 工具。

edgespeak-cli transcribe input.m4a --diarize -o out.json

导出保留说话人

JSON 导出保留每段的说话人标签,未归属时为空;卡拉 OK 字幕可以在每句前加说话人名。

常见问题

说话人标签是真实身份吗?

不是。命名之前,它们只是本录音里的声音分组。

需要额外下载吗?

需要。说话人模型为可选下载,约 206 MB,只做转录可以不下,保持轻量。

可以指定说话人数吗?

可以。API 与 MCP 接受可选的 num_speakers(1–32),用来提示声音分组。

证据链接