语音
语音合成与识别能力,超低时延、智能生动。通过语音类模型实现 TTS(文本转语音)及语音相关能力。
语音模型
| 模型名称 | 介绍 |
|---|---|
| Speech-HD | 精准还原真实语气细节,全面提升音色相似度 |
| Speech-Turbo | 极速响应,语气表达生动自然 |
Base URL 与鉴权
请求地址 = 地址 + 接口路径。地址见概览 · Base URL(地址)。语音类开放接口路径前缀为 /v1 或 /v3(ASR),鉴权为 Authorization: Bearer <API_KEY>。
接口约定
语音类接口使用 API Key 作为 Bearer Token,请求 URL = Base URL + /v1 + 具体路径。响应格式与概览一致:顶层 resultCode(OK 表示成功)、resultMsg,业务数据与二者同级。
常见能力
- TTS:文本转语音:传入文本与模型/音色参数,返回音频 URL 或流;若为异步任务则返回
task_id,通过GET /v1/tasks/:id查询 - STT(流式):WebSocket 实时语音识别:Doubao 流式 ASR(
wss://…/v3/sauc/bigmodel) - STT(文件极速版):HTTP 一次请求识别:
POST /v3/auc/bigmodel/recognize/flash
请求头需包含 Authorization: Bearer <API_KEY>、Content-Type: application/json(或 multipart/form-data 等,视接口而定)。
说明
流式 ASR 协议细节见 Doubao 流式 ASR 文档;TTS 等其它语音接口路径以官方文档为准。