Lattice-2 就在本机
Lattice-2 面向桌面端侧优化,日常转录用 Flash,要求更高准确率时再切到 Pro。
开发者 · CLI & Skills
CLI 自带本机语音运行时,无需启动桌面 App;安装后即可转录音视频,也能接入脚本、MCP 与 Agent。
macOS / Linux 使用 Terminal 安装,Windows 使用 PowerShell。CPU 默认可用;Linux 会自动探测支持的 NVIDIA 显卡,Windows 可按需启用 CUDA。
macOS / Linux · Terminal
curl -fsSL https://edgespeak.com/install.sh | sh
Windows · PowerShell
irm https://edgespeak.com/install.ps1 | iex
EdgeSpeak Skills 让 Claude Code、Cursor 等支持 Skills 的 agent 学会用本地 CLI 转录,音频不出本机。GitHub 开源。
npx skills add lattifai/EdgeSpeak
端侧极速转录
把音频或视频拖进来,EdgeSpeak 在这台电脑上完成转录、时间轴对齐和文稿生成;需要继续处理时,下游工具可从本地网关读取结果。
Lattice-2 面向桌面端侧优化,日常转录用 Flash,要求更高准确率时再切到 Pro。
播放、时间线、文稿和导出放在同一个工作台里,校对不再靠播放器和文本编辑器来回搬。
导出文本和字幕,或让 CLI、Agent 和自动化流程直接接入同一颗本地语音引擎。
专属端侧大模型
Lattice-2 经过压缩与端侧推理优化,让普通电脑也能高效转录音频和视频。
把语音 AI 大模型调成适合桌面端运行的形态,减少等待,本地转录不依赖外部服务。
Flash 面向日常音视频转录,响应更快;Pro 面向更难音频、更复杂口音和更高准确率需求,会多占一点本机资源。
支持 40 多种语言、多种英语口音和汉语方言;同一颗本地引擎也能通过网关交给 CLI、Agent 和自动化流程。
LOCAL LM + VLM · 0.6B — 27B
现已提供从 0.6B 到 27B 的 Qwen 与 Gemma 模型。每次最多加载一个模型,空闲后自动休眠。
使用本机模型生成Qwen/Qwen3-0.6B0.6B0.4 GBQwen/Qwen3.5-0.8B0.8B0.5 GBQwen/Qwen3.5-2B2B1.3 GBgoogle/gemma-4-E2B-it2B3.1 GBQwen/Qwen3.5-4B默认4B2.7 GBgoogle/gemma-4-E4B-it4B5.0 GBQwen/Qwen3.5-9B9B5.7 GBgoogle/gemma-4-12B-it12B7.1 GBQwen/Qwen3.6-27B27B16.8 GB文本 + 图片 · OpenAI 兼容 · 本地优先
真实桌面端
导入音视频,选择本地模型并导出结果;需要自动化时,通过本地网关交给 CLI 或 Agent。



常见工作流
私密转录、桌面校对、Agent 调用,以及本地与云端方案比较。
隐私
EdgeSpeak 的设计目标是让导入媒体和生成转录稿留在你的设备上,除非你主动导出、上传或分享。
把语音 AI 大模型调成适合桌面端运行的形态,减少等待,本地转录不依赖外部服务。
导出文本和字幕,或让 CLI、Agent 和自动化流程直接接入同一颗本地语音引擎。
本地语音网关
EdgeSpeak 提供本地 OpenAI 兼容语音 API,让 CLI、Agent 和自动化工具在同一台电脑上完成转录。不是另一朵云,而是你电脑里的语音网关。
POST /v1/audio/transcriptionslocalhost:1117curl http://127.0.0.1:1117/v1/audio/transcriptions \ -H "Authorization: Bearer sk-edgespeak-..." \ -F file=@meeting.m4a \ -F model="lattice-2-flash"
按工作流选择
关键不是谁的口号更响,而是素材能去哪里、现成工作流要做到什么程度,以及语音栈由谁维护。
| 按工作流选择 | EdgeSpeak | 云端转录 | 自行维护本地模型 |
|---|---|---|---|
| 源素材 | 留在这台设备上 | 上传到远程服务 | 留在你配置的机器上 |
| 校对工作流 | 桌面播放、文稿与导出已经连在一起 | 取决于服务商 | 需要自己搭建校对界面 |
| 工具与 Agent | 本地 CLI 与 OpenAI 兼容网关 | 托管 API | 需要自己接入并长期维护 |
| 日常维护 | 安装应用和本地模型 | 管理账户、API Key 与网络访问 | 维护运行时、模型和依赖 |
早鸟
当前版本已支持本机音视频转录、本地网关和 CLI。一次购买,持续获得后续模型与语音能力更新。
当前 $49,正式价 $99。
如需更多设备或团队购买:sales@edgespeak.com
下载
下载当前 macOS 版,或前往 Windows Beta 页面获取 x64 安装包和经过验证的安装指引。
现在可下载的桌面端版本,可导入音频、视频或新建录音,并在本机完成转录。
下载 Windows x64 Beta,核对 SHA-256 后按页面指引安装。当前 Beta 采用手动更新。
用购买时的邮箱登录后,可以在账户页查看 license key,并管理已激活设备。
导入的音视频和生成的文稿留在你的设备上,除非你主动导出、上传或分享。
EdgeSpeak 支持 Apple Silicon 与 macOS 14.0 或更高版本,也已提供 Windows 10/11 x64 Beta 手动安装包;Windows 应用内更新暂未开放。
早鸟终身授权一次购买后永久使用,包含后续模型与语音能力更新,最多可激活 4 台设备。
Flash 面向日常转录,响应更快;Pro 面向更难音频和更高准确率需求,会使用更多本机资源。
可以。随附 CLI 与本地 OpenAI 兼容网关,让同一台电脑上的可信工具调用本地语音引擎。
社区反馈
在 Discord 分享实际工作流、Agent 接入需求与产品建议。
设备端语音引擎
在本机完成转录,按准确时间轴校对,再导出结果或交给本地工具继续处理。