MCP 设置

让 MCP 客户端使用本机语音、说话人与模型生成。

现提供 11 个本机 MCP 工具,包括使用已安装语言模型进行文本与图片生成。

接入

任何支持 stdio 服务器的 MCP 客户端都能接。先安装并激活 edgespeak-cli,然后注册 EdgeSpeak——以 Claude Code 为例:

claude mcp add edgespeak -- edgespeak-cli mcp

通道

推荐 stdio:App 开着就经本地网关复用已加载的模型,没开就自行拉起随附的本地引擎,并按需下载缺失模型。HTTP /mcp 是备选通道,桌面 App 和 Headless 服务都会提供,使用与该网关相同的 Bearer key。

edgespeak-cli mcp                   # stdio
POST http://127.0.0.1:1117/mcp      # HTTP(桌面 App 运行时)
POST http://127.0.0.1:1118/mcp      # HTTP(edgespeak-cli serve)

工具

共 11 个工具:8 个只读;声音创建、删除与播报只修改受管理的本机文件。产品能力称“播报”,工具标识继续使用开发者契约中的 speech。

edgespeak_transcribe_file    必填: path(绝对路径)
                             可选: model, timestamps (none|word|segment),
                                   min_chars, max_chars, start_margin, end_margin

edgespeak_transcribe         必填: audio_base64(解码后 ≤ 50MB)
                             可选: 同 transcribe_file

edgespeak_diarize_file       必填: path(绝对路径)
                             可选: num_speakers (1..32)

edgespeak_align              必填: text + path | audio_base64 二选一
                             可选: protected_terms

edgespeak_segment_sentences  必填: text 或 segments[]
                             可选: threshold (默认 0.35), min_chars, max_chars,
                                   start_margin, end_margin

edgespeak_list_models        无参数 → {models: [{id, owned_by, locality}]}

edgespeak_create_response    必填: model,以及 input 或 images
                             可选: max_output_tokens、temperature、reasoning
                             图片: 最多 4 张,解码后总计 ≤ 20MB

edgespeak_list_voices        无参数 → {voices: [...]}

edgespeak_add_voice          必填: audio_path(绝对路径)、ref_text、name、
                                   consent=true
                             可选: language、speaker_description

edgespeak_delete_voice       必填: voice_id(user:<uuid>)
                             不允许删除内置声音

edgespeak_create_speech      必填: model、input、voice
                             模型: omnivoice、qwen3-tts-base、qwen3-tts-1.7b-base、
                                   qwen3-tts-0.6b-custom-voice、
                                   qwen3-tts-1.7b-custom-voice、qwen3-tts-voice-design
                             可选: instructions、style_instruction、speed、language、seed、
                                   guidance_scale、inference_steps、retry_badcase
                             qwen3-tts-voice-design 必须传 instructions,
                             并使用 voice=builtin:auto
                             输出: 受管理的本机 WAV artifact

结果

文本结果在 2000 字符内直接内联;超长输出落盘为本地 artifact 并保留内联预览。播报始终返回受管理的本机 WAV artifact 路径与生成诊断。

≤ 2000 字符  →  { "metadata": …, "result": …, "truncated": false }
> 2000 字符  →  { "metadata": …, "preview": { "head": …, "tail": … },
                  "artifact_path": …, "artifact_json_path": …, "truncated": true }
播报           →  { "artifact_path": …, "format": "wav", "sample_rate": …,
                  "duration": …, "seed_used": …, "warnings": […] }

隐私

语音工作流和已安装的本机模型让源音频、声音、生成音频、转录稿、提示词与图片留在当前设备。选择已配置的远程模型时,只会把发给该模型的请求传给对应供应商。

使用本机模型生成

启动桌面 App,下载并加载模型后,可通过 Responses、Chat Completions、CLI 或 MCP 调用;已安装的本机模型让提示词和图片留在当前设备。

edgespeak_create_response
{
  "model": "Qwen/Qwen3.5-4B",
  "input": "Describe the attached image",
  "images": [{ "mime_type": "image/png", "data_base64": "<base64>" }]
}