更新记录
有什么更新。
0.5.1 是仅面向 macOS 的修复更新:修复部分 Apple M5 系列芯片上转录结果异常的问题。
0.5.0 新增文稿「对齐」:支持导出字幕或卡拉 OK 字幕。录音支持实时转录,播报新增两款顶级模型。
- 新增「对齐」工作区:拖入音视频和已经写好的文稿,对齐算出每个词的时间戳,支持导出卡拉 OK 字幕。
- 新增两款播报模型:IndexTTS-2.5 用参考音频克隆更有表现力的音色,FireRedTTS3-Instruct 可以用一句自然语言指令设计音色。
- 录音改为边录边出文字,修复录音说话人识别会跳过的问题。
- 转录导出新增:SRT、ASS 与卡拉 OK 字幕。
- 新增「文本归一化」(POST /v1/text/normalizations)与健康检查。
- CLI 本地服务在模型、对话、播报、鉴权与文件转录五个面统一到与桌面 App 相同的错误格式和状态码。
- CUDA CLI 版:A100、H100/H20 与数据中心 Blackwell 改用原生 cubin,不再依赖 PTX JIT。
0.4.4 正式带来 Windows 支持:安装包大幅瘦身、显卡加速按需下载,播报新增内置官方音色与风格指令模型。
- Windows 桌面版以 Preview 形式上线:本机转录、播报、听写与本地 API 一应俱全,一个安装包同时覆盖 NVIDIA 显卡加速与 CPU 回退。
- Windows 主安装包体积下降约七成,从约 730 MB 降到约 200 MB:显卡加速运行库改为在设置页按需下载。
- 播报新增三款模型:更大的克隆模型让音色更稳,另外两款各自内置 9 个官方音色,其中一款支持「特别愤怒」「极慢语速」这类风格指令。
- 模型页支持导入 Hugging Face 或 ModelScope 的 GGUF 模型仓库:选择量化版本、查看下载体积,私有仓库密钥保存在系统凭据保险库。
- 本地 API 的模型列表会说明每个播报模型支持的能力——具名音色、声音克隆、风格指令、流式合成,接入方不必再靠模型名猜。
- 通过本地 API 调用语言模型时,流式回复真正逐块返回。
- macOS 首次加载转录引擎从约 12 秒缩短到约 2.5 秒。
- Windows 命令行一条 PowerShell 命令即可安装,Linux 命令行同步更新。
0.4.1 让实时语音对话从「能连上」做到「能连着说」:首音更快,打断更准,节奏由你定。
- 菜单栏录音来源新增麦克风、系统音频与两者同时录制三档。
- 语音对话 demo 停顿容忍、打断阈值与间隙容忍在通话中随时可调。
- 实时语音对话支持角色扮演人设,界面支持七种语言,并新增接入文档。
- 修复播报页面声音克隆、音色设计页面使用 bug。
0.4.0 上线说话人识别,优化账户激活,并新增本机语言模型与 Realtime API。
- 本机转录支持按句标注多人说话,可重命名并关联说话人档案。
- 支持 Qwen 3.5 和 Gemma 4 本机模型。
- 新增 Preview 阶段的 Realtime API:通过 WebSocket /v1/realtime 接入实时转录与语音工作流,后续将持续迭代。
- 购买授权与已有账户激活分开呈现,下一步更清晰。
- 已开始为 Windows 发布做准备。
EdgeSpeak 开口说话:本次更新带来全新「播报」能力——完全本地的文字转语音,支持声音克隆与声音设计。
- 全新播报工作台:输入文字即可在本机合成语音,支持流式试听与多种格式导出,文本不出设备。
- 三个本地模型可选:默认 OmniVoice,以及支持声音克隆与声音设计的 Qwen3-TTS,首次使用时在应用内下载。
- 用一小段录音克隆自己的声音,或用一句文字描述设计全新声音;声音可随时重命名或删除。
- 播报能力全面开放:本地 API 的 OpenAI 兼容 /v1/audio/speech 端点、命令行与 MCP 均可调用。
- 长文本自动分段合成,每段完成即可试听,无需等待整篇生成。
- 买断授权支持完全离线模式:联网激活一次,之后无网络也能转录、对齐与播报。
- Linux 命令行安装会按 NVIDIA 显卡自动选择匹配的 GPU 加速包,无可用显卡时安全回退 CPU。
桌面端体验更新:支持批量文件转录,模型加载更快,进度反馈更稳定。
- 支持一次导入多个音频或视频文件,并按选择顺序转录;批量过大时会给出清晰提示。
- 本地模型加载更快,开始转录前的等待更短。
- 长任务的进度显示更稳定,结果回传也更及时。
- 麦克风权限状态判断更可靠,新建录音时不会沿用上一次批量导入的选中状态。
- 侧边栏支持按需收窄或展开,窄窗口里更整洁。
稳定性更新:改进本地转录、权限提示和本地网关体验。
- 本地文件转录结束后,会更及时释放后处理资源。
- 麦克风权限提示只会在明确录音或授权操作后出现。
- 本地网关、CLI 和 MCP runtime 在启动和绑定本地端口时更稳定。
小版本更新:让本地模型准备和应用更新体验更顺。
- 缺少本地模型时,准备和重试提示更清楚。
- macOS 自动更新下载后的安装和重启更稳定。
- 侧边栏更新按钮更简洁,避免遮挡应用名称和当前版本。
面向工具链的版本:本地引擎开放 CLI、MCP 与更完整的本地 API,语义分段全面可调。
- 内置 edgespeak-cli,在终端完成转录、强制对齐与文本分句。
- 内置 MCP 服务,让 AI 助手直接调用本机转录、对齐与分句能力。
- 本地 API 新增强制对齐与文本分句端点,转录支持词级时间戳。
- 设置页新增「语义分段」:段落长度与边界留白可调,并作为 App、API 与 CLI 共享的默认。
- 新增更轻快的 EdgeSpeak Lite 本地模型并设为默认,转录后处理进度实时可见。
词典版本:用热词、纠错规则和加密多设备同步,让 EdgeSpeak 更懂你的用词。
- 词典支持人名与专业术语,让转录第一次就识别对。
- 支持纠错规则,自动把易听错的词改写为正确写法。
- 词典可在多台设备间加密同步。
- 更新弹窗可直接查看版本说明,并新增软件字体大小设置。
这次更新聚焦转录工作台的编辑、播放精度和 macOS 兼容性。
- 支持清空工作台,从初始状态重新开始。
- 支持编辑转录文本,并以毫秒精度调整片段开始和结束时间。
- 点击片段时间时,按精确开始和结束时间播放对应音频。
- 已确认 Apple Silicon 设备在 macOS 14.0 或更新版本可用。
桌面端更新聚焦授权激活、购买升级引导和更新链路稳定性。
桌面端改进了 macOS 交互质感、本地转录状态和片段播放体验,并加强安装包与更新链路验证。
早期版本上线本地音视频转录、桌面授权激活和本机语音网关。