设备端语音引擎

把语音 AI 大模型放进你的电脑

自由转录音视频,在本机得到可校对、带准确时间轴的文稿。

  • 本机音视频转录已可用
  • 本地网关和 CLI 已可用
  • 后续模型和语音能力更新
转录预览
转录预览local-transcribe.mov

开发者 · CLI & Skills

安装 EdgeSpeak CLI

CLI 自带本机语音运行时,无需启动桌面 App;安装后即可转录音视频,也能接入脚本、MCP 与 Agent。

macOS / Linux 使用 Terminal 安装,Windows 使用 PowerShell。CPU 默认可用;Linux 会自动探测支持的 NVIDIA 显卡,Windows 可按需启用 CUDA。

macOS · Apple SiliconWindows x64 · CPU / CUDALinux x86_64 · CPU / CUDA
查看 CLI 文档

macOS / Linux · Terminal

curl -fsSL https://edgespeak.com/install.sh | sh

Windows · PowerShell

irm https://edgespeak.com/install.ps1 | iex
edgespeak-cli login
edgespeak-cli transcribe media.mp4 -o media.srt
edgespeak-cli generate "Summarize this transcript" --model Qwen/Qwen3.5-4B

Agent Skills,同一个引擎

EdgeSpeak Skills 让 Claude Code、Cursor 等支持 Skills 的 agent 学会用本地 CLI 转录,音频不出本机。GitHub 开源。

npx skills add lattifai/EdgeSpeak

端侧极速转录

导入音视频,在本地完成高精度转录

把音频或视频拖进来,EdgeSpeak 在这台电脑上完成转录、时间轴对齐和文稿生成;需要继续处理时,下游工具可从本地网关读取结果。

  1. Lattice-2 就在本机

    Lattice-2 面向桌面端侧优化,日常转录用 Flash,要求更高准确率时再切到 Pro。

  2. 边听边改

    播放、时间线、文稿和导出放在同一个工作台里,校对不再靠播放器和文本编辑器来回搬。

  3. 结果继续流转

    导出文本和字幕,或让 CLI、Agent 和自动化流程直接接入同一颗本地语音引擎。

专属端侧大模型

Lattice-2,为桌面端而生

Lattice-2 经过压缩与端侧推理优化,让普通电脑也能高效转录音频和视频。

端侧压缩与推理适配

把语音 AI 大模型调成适合桌面端运行的形态,减少等待,本地转录不依赖外部服务。

Flash / Pro 双模型协同

Flash 面向日常音视频转录,响应更快;Pro 面向更难音频、更复杂口音和更高准确率需求,会多占一点本机资源。

融入开发者工作流

支持 40 多种语言、多种英语口音和汉语方言;同一颗本地引擎也能通过网关交给 CLI、Agent 和自动化流程。

LOCAL LM + VLM · 0.6B — 27B

语言与视觉,也进入同一个 EdgeSpeak 本机运行时。

现已提供从 0.6B 到 27B 的 Qwen 与 Gemma 模型。每次最多加载一个模型,空闲后自动休眠。

使用本机模型生成
Qwen/Qwen3-0.6B0.6B0.4 GB
Qwen/Qwen3.5-0.8B0.8B0.5 GB
Qwen/Qwen3.5-2B2B1.3 GB
google/gemma-4-E2B-it2B3.1 GB
Qwen/Qwen3.5-4B默认4B2.7 GB
google/gemma-4-E4B-it4B5.0 GB
Qwen/Qwen3.5-9B9B5.7 GB
google/gemma-4-12B-it12B7.1 GB
Qwen/Qwen3.6-27B27B16.8 GB

文本 + 图片 · OpenAI 兼容 · 本地优先

真实桌面端

EdgeSpeak,就在你的电脑上

导入音视频,选择本地模型并导出结果;需要自动化时,通过本地网关交给 CLI 或 Agent。

音频、视频和文稿在一个工作台里播放、时间线、文稿、导出、最近文件和当前本地模型都在一起。少切一次工具,少丢一次上下文。
EdgeSpeak 桌面端转录主界面,展示主转录工作台、本地模型状态、文稿内容、播放控制和最近文件。
在 EdgeSpeak 里按任务选择模型EdgeSpeak 的本地模型支持 40 多种语言、多种英语口音和汉语方言。Flash 速度快、效果好;Pro 更准,也会多占一点本机资源。
EdgeSpeak 桌面端模型页面,展示本地 EdgeSpeak Flash 和 EdgeSpeak Pro 选项。
让别的工具也用 EdgeSpeak命令行、Agent 和自动化流程都可以把音频交给 EdgeSpeak,再从本地拿回转好的文稿。
EdgeSpeak 桌面端网关页面,展示同一台电脑上的其他工具如何使用本机语音引擎。

隐私

本地优先的语音处理。

EdgeSpeak 的设计目标是让导入媒体和生成转录稿留在你的设备上,除非你主动导出、上传或分享。

端侧压缩与推理适配

把语音 AI 大模型调成适合桌面端运行的形态,减少等待,本地转录不依赖外部服务。

结果继续流转

导出文本和字幕,或让 CLI、Agent 和自动化流程直接接入同一颗本地语音引擎。

本地语音网关

让 Agent 直接调用 EdgeSpeak

EdgeSpeak 提供本地 OpenAI 兼容语音 API,让 CLI、Agent 和自动化工具在同一台电脑上完成转录。不是另一朵云,而是你电脑里的语音网关。

本地 OpenAI 兼容接口CLI / Agent / 自动化EdgeSpeak Flash 和 Pro
POST /v1/audio/transcriptionslocalhost:1117
curl http://127.0.0.1:1117/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-edgespeak-..." \
  -F file=@meeting.m4a \
  -F model="lattice-2-flash"

按工作流选择

本地软件、云端 API,还是自己维护模型

关键不是谁的口号更响,而是素材能去哪里、现成工作流要做到什么程度,以及语音栈由谁维护。

按工作流选择EdgeSpeak云端转录自行维护本地模型
源素材留在这台设备上上传到远程服务留在你配置的机器上
校对工作流桌面播放、文稿与导出已经连在一起取决于服务商需要自己搭建校对界面
工具与 Agent本地 CLI 与 OpenAI 兼容网关托管 API需要自己接入并长期维护
日常维护安装应用和本地模型管理账户、API Key 与网络访问维护运行时、模型和依赖
查看完整对比

早鸟

$49 早鸟价,终身使用 EdgeSpeak

当前版本已支持本机音视频转录、本地网关和 CLI。一次购买,持续获得后续模型与语音能力更新。

下载

下载 EdgeSpeak。

下载当前 macOS 版,或前往 Windows Beta 页面获取 x64 安装包和经过验证的安装指引。

当前 macOS 版

现在可下载的桌面端版本,可导入音频、视频或新建录音,并在本机完成转录。

Windows 版

下载 Windows x64 Beta,核对 SHA-256 后按页面指引安装。当前 Beta 采用手动更新。

授权与设备

用购买时的邮箱登录后,可以在账户页查看 license key,并管理已激活设备。

FAQ

常见问题

本地处理、支持平台、模型和终身授权,购买之前就说清楚。

查看全部问题
01EdgeSpeak 会上传源素材吗?

导入的音视频和生成的文稿留在你的设备上,除非你主动导出、上传或分享。

02当前支持哪些桌面平台?

EdgeSpeak 支持 Apple Silicon 与 macOS 14.0 或更高版本,也已提供 Windows 10/11 x64 Beta 手动安装包;Windows 应用内更新暂未开放。

03终身授权包含什么?

早鸟终身授权一次购买后永久使用,包含后续模型与语音能力更新,最多可激活 4 台设备。

04Flash 和 Pro 有什么区别?

Flash 面向日常转录,响应更快;Pro 面向更难音频和更高准确率需求,会使用更多本机资源。

05CLI 和 AI Agent 可以使用 EdgeSpeak 吗?

可以。随附 CLI 与本地 OpenAI 兼容网关,让同一台电脑上的可信工具调用本地语音引擎。

社区反馈

用真实场景改进 EdgeSpeak

在 Discord 分享实际工作流、Agent 接入需求与产品建议。

  • 实际工作流
  • Agent / API
  • 产品建议

设备端语音引擎

把语音 AI 大模型放进你的电脑

在本机完成转录,按准确时间轴校对,再导出结果或交给本地工具继续处理。

下载 macOS 版