提取说话人声纹

POST /v1/speaker/embeddings

为每个上传样本提取一条 256 维声纹。要传多个样本就重复 file 部件。每个样本最长 30 秒,且至少包含 4 秒有效的单说话人语音。

指南与示例转录与说话人全部接口

请求体

multipart/form-data必填

filefile[]必填每个样本重复一次这个部件。
modelstring声纹模型。默认 EdgeSpeak/Lattice-1。只有来自同一个模型的声纹才能互相比较。默认 "EdgeSpeak/Lattice-1"

响应

200按上传顺序,每个样本一条。示例里省略了完整的 256 维向量。
objectstringlist
modelstring
dataobject[]
indexinteger
embeddingnumber[]256 维向量。
effective_speech_secondsnumber
JSON
{
  "object": "list",
  "model": "EdgeSpeak/Lattice-1",
  "data": [
    {
      "index": 0,
      "embedding": [
        0.0123,
        -0.0456
      ],
      "effective_speech_seconds": 5.2
    },
    {
      "index": 1,
      "embedding": [
        0.0311,
        -0.0092
      ],
      "effective_speech_seconds": 6.1
    }
  ]
}
400请求不合法。先改请求再重试:error.code 用于程序判断,error.param 用于定位是哪个输入。
401API Key 缺失或无效。
403Host 或 Origin 不被允许,或 License 被拒。按 error.code 区分这两种情况。
413请求体超过 512 MiB。
503所需的本地模型仍在准备(model_downloading),或服务正忙(service_busy)。带 Retry-After 时按它退避。