Skip to content

Doubao-流式语音识别(WebSocket)

双向流式 ASR:实时将音频流转写为文本。二进制协议与请求流程与火山官方一致,详见 官方 · 大模型流式语音识别 API

URLwss://<BASE>/v3/sauc/bigmodel

MethodGET(WebSocket 升级)

模型Doubao-ASR-Stream(可选 query ?model= 覆盖)

与官方直连的差异

  • 鉴权:握手时使用本平台颁发的 API Key,不要使用火山控制台 AppKey。
  • 上游凭证:网关会使用 Provider 配置中的火山 app_key / access_key 连接 openspeech。
  • 数据帧full client requestaudio only requestfull server response 等二进制帧 原样透传,无需修改 payload。

授权

以下任选其一(值为平台 API Key):

Authorization

  • 类型 string · 位置 header
  • 格式 Bearer <API_KEY>

X-Api-App-Key

  • 类型 string · 位置 header
  • 说明 与 openspeech 官方头同名,但此处填 平台 API Key

api_key

  • 类型 string · 位置 query
  • 说明 部分 WebSocket 客户端无法自定义 Header 时可用:wss://.../v3/sauc/bigmodel?api_key=<API_KEY>

协议与交互

  1. 客户端发起 WebSocket 握手(带 API Key)。
  2. 发送 full client request(gzip JSON 参数)。
  3. 多次发送 audio only request(gzip 音频分片);最后一包需按官方文档设置 message type specific flags。
  4. 服务端返回 full server response(识别结果 JSON,gzip);最后一包结果帧用于标识会话结束。

完整 header 位域、message type、压缩方式等见 官方文档 · WebSocket 二进制协议

计费

  • 模型Doubao-ASR-Streamtype=audio
  • 维度asr_duration_ms(识别音频时长,毫秒)
  • 单价:在控制台为该模型单独配置(与极速版 Doubao-ASR-Flash 独立)

示例(wscat)

bash
# 需先按官方文档构造 binary frame;此处仅演示握手鉴权
wscat -c "wss://amags.keplerjai.com/v3/sauc/bigmodel" \
  -H "Authorization: Bearer YOUR_PLATFORM_API_KEY"

参考