切分句子
POST /v1/text/segmentations
基于 JSON 请求体做语义分句。传纯文本 text 或带时间的 segments[];桌面网关还接受 file,即服务器本地的 Transcript JSON 路径,Headless 服务只能传内联内容。设置 paragraph_threshold 切到段落模式,此时每个返回项是一个段落,顶层 text 用空行拼接段落。本接口一定会切分,不接受 semantic_sentence_enabled。
请求体
application/json必填
textstring纯文本输入。段落模式必须用这种形式。segmentsobject[]带时间的输入,可以保留时间戳和说话人。idinteger该段在结果中的序号。startnumber段落起点,单位秒。endnumber段落终点,单位秒。textstring段落文本。speakerstring | null说话人标签;没有判定说话人时为 null。wordsobject[]词级时间戳。只有请求了词级时间戳才会出现。filestring仅桌面网关:服务器上导出的 Transcript JSON 的绝对路径。Headless 服务会拒绝。thresholdnumber分句阈值。paragraph_thresholdnumber启用模型原生的段落边界,取值不得小于 threshold。分句模式下不要传。min_charsinteger默认长度 12。长度约束默认关闭,传任一长度字段即开启。max_charsinteger默认长度 42。start_marginnumber秒;默认余量 0.2。end_marginnumber秒;默认余量 0.2。optionsobjectparagraph_threshold 和长度、余量字段也可以放在这里;同名的顶层字段优先。响应
200切分后的文本。纯文本输入没有时间戳和说话人。taskstringtextstring段落模式下用空行拼接各段落。segmentsobject[]idinteger该段在结果中的序号。startnumber段落起点,单位秒。endnumber段落终点,单位秒。textstring段落文本。speakerstring | null说话人标签;没有判定说话人时为 null。wordsobject[]词级时间戳。只有请求了词级时间戳才会出现。{
"task": "segment",
"text": "Hello world. Let us begin.",
"segments": [
{
"text": "Hello world."
},
{
"text": "Let us begin."
}
]
}400请求不合法。先改请求再重试:error.code 用于程序判断,error.param 用于定位是哪个输入。401API Key 缺失或无效。403Host 或 Origin 不被允许,或 License 被拒。按 error.code 区分这两种情况。503所需的本地模型仍在准备(model_downloading),或服务正忙(service_busy)。带 Retry-After 时按它退避。