Skip to content

语音

语音合成与识别能力,超低时延、智能生动。通过语音类模型实现 TTS(文本转语音)及语音相关能力。

语音模型

模型名称介绍
Speech-HD精准还原真实语气细节,全面提升音色相似度
Speech-Turbo极速响应,语气表达生动自然

Base URL 与鉴权

请求地址 = 地址 + 接口路径。地址见概览 · Base URL(地址)。语音类开放接口路径前缀为 /v1/v3(ASR),鉴权为 Authorization: Bearer <API_KEY>

接口约定

语音类接口使用 API Key 作为 Bearer Token,请求 URL = Base URL + /v1 + 具体路径。响应格式与概览一致:顶层 resultCode(OK 表示成功)、resultMsg,业务数据与二者同级。

常见能力

  • TTS:文本转语音:传入文本与模型/音色参数,返回音频 URL 或流;若为异步任务则返回 task_id,通过 GET /v1/tasks/:id 查询
  • STT(流式):WebSocket 实时语音识别:Doubao 流式 ASRwss://…/v3/sauc/bigmodel
  • STT(文件极速版):HTTP 一次请求识别:POST /v3/auc/bigmodel/recognize/flash

请求头需包含 Authorization: Bearer <API_KEY>Content-Type: application/json(或 multipart/form-data 等,视接口而定)。

说明

流式 ASR 协议细节见 Doubao 流式 ASR 文档;TTS 等其它语音接口路径以官方文档为准。