提取说话人声纹
POST /v1/speaker/embeddings
为每个上传样本提取一条 256 维声纹。要传多个样本就重复 file 部件。每个样本最长 30 秒,且至少包含 4 秒有效的单说话人语音。
请求体
multipart/form-data必填
filefile[]必填每个样本重复一次这个部件。modelstring声纹模型。默认 EdgeSpeak/Lattice-1。只有来自同一个模型的声纹才能互相比较。响应
200按上传顺序,每个样本一条。示例里省略了完整的 256 维向量。objectstringmodelstringdataobject[]indexintegerembeddingnumber[]256 维向量。effective_speech_secondsnumber{
"object": "list",
"model": "EdgeSpeak/Lattice-1",
"data": [
{
"index": 0,
"embedding": [
0.0123,
-0.0456
],
"effective_speech_seconds": 5.2
},
{
"index": 1,
"embedding": [
0.0311,
-0.0092
],
"effective_speech_seconds": 6.1
}
]
}400请求不合法。先改请求再重试:error.code 用于程序判断,error.param 用于定位是哪个输入。401API Key 缺失或无效。403Host 或 Origin 不被允许,或 License 被拒。按 error.code 区分这两种情况。413请求体超过 512 MiB。503所需的本地模型仍在准备(model_downloading),或服务正忙(service_busy)。带 Retry-After 时按它退避。