Doubao-流式语音识别(WebSocket)
双向流式 ASR:实时将音频流转写为文本。二进制协议与请求流程与火山官方一致,详见 官方 · 大模型流式语音识别 API。
URL:wss://<BASE>/v3/sauc/bigmodel
Method:GET(WebSocket 升级)
模型:Doubao-ASR-Stream(可选 query ?model= 覆盖)
与官方直连的差异
- 鉴权:握手时使用本平台颁发的 API Key,不要使用火山控制台 AppKey。
- 上游凭证:网关会使用 Provider 配置中的火山
app_key/access_key连接 openspeech。 - 数据帧:
full client request、audio only request、full server response等二进制帧 原样透传,无需修改 payload。
授权
以下任选其一(值为平台 API Key):
Authorization
- 类型
string· 位置header - 格式
Bearer <API_KEY>
X-Api-App-Key
- 类型
string· 位置header - 说明 与 openspeech 官方头同名,但此处填 平台 API Key。
api_key
- 类型
string· 位置query - 说明 部分 WebSocket 客户端无法自定义 Header 时可用:
wss://.../v3/sauc/bigmodel?api_key=<API_KEY>
协议与交互
- 客户端发起 WebSocket 握手(带 API Key)。
- 发送 full client request(gzip JSON 参数)。
- 多次发送 audio only request(gzip 音频分片);最后一包需按官方文档设置 message type specific flags。
- 服务端返回 full server response(识别结果 JSON,gzip);最后一包结果帧用于标识会话结束。
完整 header 位域、message type、压缩方式等见 官方文档 · WebSocket 二进制协议。
计费
- 模型:
Doubao-ASR-Stream(type=audio) - 维度:
asr_duration_ms(识别音频时长,毫秒) - 单价:在控制台为该模型单独配置(与极速版
Doubao-ASR-Flash独立)
示例(wscat)
bash
# 需先按官方文档构造 binary frame;此处仅演示握手鉴权
wscat -c "wss://amags.keplerjai.com/v3/sauc/bigmodel" \
-H "Authorization: Bearer YOUR_PLATFORM_API_KEY"参考
- 火山引擎 · 大模型流式语音识别 API
- 录音文件极速版(HTTP):站内
POST /v3/auc/bigmodel/recognize/flash