1. 全双工通信
MyVocal AI语音大模型API文档
  • 文字转语音大模型
    • 多语种语音合成
      • Voices
        • 创建声音
        • 获取声音列表
        • 删除声音
      • Text-to-Speech
        • 多线程全双工通道 (Mutiple-websocket)
        • 单线程全双工通信(WebSocket)
        • 流式文字转语音(Streaming TTS)
        • 非流式文字转语音
      • 查询接口
        • 查询主key用量
        • Request_id客户端查询
        • 发音人用量查询
      • 子密钥管理
        • 创建子 Key
        • 查询子 Key 列表
        • 获取单个子 Key 详情
        • 更新子 Key
        • 查询子 Key 用量
  • 金融行业定制TTS模型
    • 文字转语音 Skyblight
      • 创建声音
      • 获取声音列表
      • 流式文字转语音(Streaming)
      • 文字转语音(非流式返回)
      • 删除声音
      • 用量查询
    • 全双工通信
      • websocket接入说明
  • 语音转文字ASR
    • 语音转文字
      • 实时语音转文字(Realtime ASR)
      • 语音转文字ASR
      • 客户用量查询
  • 企业客户声音定制服务
    • 定制属于你的专属声音
  1. 全双工通信

websocket接入说明

wss://openapi.myvocal.ai/ai/speech/websocket
查看官方SDK
支持 Java | Python | Go 有中文说明

1
第一步:建立 WebSocket 连接
输入连接地址:
wss://openapi.myvocal.ai/ai/speech/websocket
确认与服务端建立成功的长连接
2
第二步:发送包含 API-Key 的配置消息
在连接建立后,第一条消息必须是配置消息,其中必须包含 API-Key 字段,否则会返回错误:
{
  "API-Key": "your_api_key_here",
  "voice": "your_voice_id",
  "priority": "dedicated_concurrency",
  "extra_info": true
}
必填参数:API-Key | voice | 仅限prority=dedicated_concurrnecy
💡
可选参数:音频输出格式 format | 采样率sample_rate| 输出语言 language | 附加信息 extra_info: true
3
第三步:发送合成请求内容
在初始化完成后,可以向服务器持续发送待合成的文本,格式为 JSON 对象:
{"text": "Hello, welcome to MyVocal TTS!"}
文本内容可以拆分成多个消息发送,服务端会自动拼接处理。例如以下两种写法等效:
方案一:
{"text": "This is a demonstration of real-time speech synthesis"}
方案二:拆分发送,更快获得首包音频返回
{"text": "This is a demonstration of "}
{"text": "real-time speech synthesis"}
服务端会以流式方式返回音频数据,直至合成结束。
4
第四步:触发即时合成 (Flush)
在正常情况下,WebSocket 会将你逐步发送的文本缓存起来,并在上下文完整时输出更自然的语音。如果你希望立即触发合成,可以发送如下请求:
{
  "flush": true
}
当服务端完成当前缓存文本的合成后,会返回一个包含 buffer_empty 字段的额外信息,表示缓存已清空。
⚠️ 注意:flush 建议在句子结束时使用。如果在句子中间强制触发,语音听起来可能会不够自然。
结束之后可以选择关闭 WebSocket 连接。
音频返回机制
在未使用 flush 参数时,模型会在接收到足够的文本后才开始返回音频。为了保证语音的自然度与上下文的连贯性,模型通常会等待大约 两句话的长度,再触发合成并输出音频。数据以二进制形式传输。
之所以如此设计,是因为在文本过短且缺乏上下文时,模型生成的语音可能会显得不够流畅或语气生硬。而随着模型对具体应用场景的适应和优化,所需等待的文本量会逐渐缩短,从而加快返回速度。
需要特别注意的是,这种“自适应学习能力”是 基于voice 单独学习的。也就是说,即便 Voice A 已具备用更短文本进行自然合成的能力,该特性也无法直接迁移或继承到 Voice B。

请求参数

无
上一页
全双工通信
下一页
语音转文字
Built with