1. 金融行业定制TTS模型
MyVocal AI语音大模型API文档
  • 文字转语音大模型
    • 多语种语音合成
      • Voices
        • 创建声音
        • 获取声音列表
        • 删除声音
      • Text-to-Speech
        • 多线程全双工通道 (Mutiple-websocket)
        • 单线程全双工通信(WebSocket)
        • 流式文字转语音(Streaming TTS)
        • 非流式文字转语音
      • 查询接口
        • 查询主key用量
        • Request_id客户端查询
        • 发音人用量查询
      • 子密钥管理
        • 创建子 Key
        • 查询子 Key 列表
        • 获取单个子 Key 详情
        • 更新子 Key
        • 查询子 Key 用量
  • 金融行业定制TTS模型
    • 文字转语音 Skyblight
      • 创建声音
      • 获取声音列表
      • 流式文字转语音(Streaming)
      • 文字转语音(非流式返回)
      • 删除声音
      • 用量查询
    • 全双工通信
      • websocket接入说明
  • 语音转文字ASR
    • 语音转文字
      • 实时语音转文字(Realtime ASR)
      • 语音转文字ASR
      • 客户用量查询
  • 企业客户声音定制服务
    • 定制属于你的专属声音
  1. 金融行业定制TTS模型

WebSocket全双工通信优势

低延迟,实时响应
相比传统的 HTTP 请求模式,WebSocket 支持双向长连接。TTS 请求发出后,语音数据可以以流式(chunk)的方式即时返回,用户能够边接收边播放。
👉 在对话式、客服场景中,能显著降低首包延迟,提升“即说即听”的体验。
流式传输,连续播报
通过 WebSocket,可以将音频数据分片发送给客户端,而不必等全部生成完毕。
👉 用户可以先听到前半段内容,同时后台继续生成后续音频,非常适合长文本播报、实时互动等场景。
全双工通信
WebSocket 提供了 全双工通道,允许客户端和服务端随时发送消息。
👉 客户端可以动态打断、切换文本或调整参数(如语速、音色),而无需等待上一个请求完成,大大增强了交互灵活性。
更好的开发体验
支持事件驱动式返回,便于前端直接播放流式音频。
可以在同一连接里进行多次 TTS 请求,减少连接管理成本。
与MyVocal语音识别(ASR)系统结合时,能形成完整的实时语音交互链路。
查看官方SDK
支持 Java | Python | Go 有中文说明
上一页
用量查询
下一页
websocket接入说明
Built with