1. 金融行业定制TTS模型
MyVocal AI语音大模型API文档
  • 文字转语音大模型
    • 多语种语音合成
      • Voices
        • 创建声音
        • 获取声音列表
        • 删除声音
      • Text-to-Speech
        • 多线程全双工通道 (Mutiple-websocket)
        • 单线程全双工通信(WebSocket)
        • 流式文字转语音(Streaming TTS)
        • 非流式文字转语音
      • 查询接口
        • 查询主key用量
        • Request_id客户端查询
        • 发音人用量查询
      • 子密钥管理
        • 创建子 Key
        • 查询子 Key 列表
        • 获取单个子 Key 详情
        • 更新子 Key
        • 查询子 Key 用量
  • 金融行业定制TTS模型
    • 文字转语音 Skyblight
      • 创建声音
      • 获取声音列表
      • 流式文字转语音(Streaming)
      • 文字转语音(非流式返回)
      • 删除声音
      • 用量查询
    • 全双工通信
      • websocket接入说明
  • 语音转文字ASR
    • 语音转文字
      • 实时语音转文字(Realtime ASR)
      • 语音转文字ASR
      • 客户用量查询
  • 企业客户声音定制服务
    • 定制属于你的专属声音
  1. 金融行业定制TTS模型

文字转语音 Text-toSpeech

金融行业定制 TTS 模型#

1. 产品概述#

MyVocal 提供面向金融行业的定制化文字转语音能力,支持声音克隆、流式文字转语音、非流式文字转语音、声音管理和用量查询。当前文档包含以下能力:创建声音、获取声音列表、流式文字转语音、非流式文字转语音、删除声音、用量查询。
其中,流式文字转语音适用于实时语音对话、电话客服(IVR)、语音导航等低延迟场景。在稳定网络条件下,基于 8kHz G.711 µ-law 编码的测试结果显示,首包返回时间(TTFB)约为 50ms–150ms;首包音频到达后即可开始播放,后续音频会持续以流的形式返回。

2. 认证方式#

所有接口均需在请求 Header 中传入 API Key:
创建声音接口使用 multipart/form-data;其余 TTS / 查询 / 删除类接口使用标准 HTTP 请求。

3. 快速接入流程#

建议开发者按以下顺序接入:
第一步:获取声音列表
先查询当前账号下可用的声音列表,确认可直接调用的公共音色或已创建的自定义音色。
第二步:调用 TTS 接口
按业务场景选择:
流式 TTS:适用于低延迟实时播放
非流式 TTS:适用于一次性生成完整音频文件、下载、归档、离线播放
第三步:如需专属声音,再创建声音
支持 IVC 和 PVC 两种克隆方式。
第四步:管理声音与查询用量
上线后可通过删除声音和用量查询接口管理资源与额度。

4. 模型说明#

当前 TTS 接口支持两种模型:
Skyblight 和 Skyblight-Turbo

5. 模型能力对比#

5.1 输出语言支持#

支持以下输出语言,使用 ISO 639-1 两位语言代码表示:
模型输出语言
Skyblight泰语 th 越南语 vi 印尼语 id 阿拉伯语 ar 乌尔都语 ur 日语 ja 韩语 ko 英语 en 西班牙语 es
Skyblight-Turbo新加坡英语 en 澳大利亚英语 en 印尼语 id 中文 cn

5.2 输出音频格式支持#

这个部分必须按 接口类型 × 模型类型 区分,不能混写。
A. 流式文字转语音 POST /v2/ai/speech/stream
当 model = Skyblight 时,支持:
mp3:96kbps MP3
raw:32 位浮点原始音频
ulaw:带 WAV 头的 8 位 G711 µ-law 音频,适用于电话 / 外呼 / SIP / 呼叫中心
webm:WebM 容器,使用 Opus 音频编码
pcm_s16le:采样率 8000,有符号 16 位小端序音频,适合实时流场景自行处理音频
pcm_f32le:采样率 8000,32 位浮点小端序音频,适合训练 / DSP / 高精度处理
当 model = Skyblight-Turbo 时,支持:
mp3 | pcm | wav
B. 非流式文字转语音 POST /v2/ai/speech/tts
当 model = Skyblight 时,支持:
mp3 raw ulaw webm aac wav pcm_s16le pcm_f32le
当 model = Skyblight-Turbo 时,支持:
mp3 pcm wav

5.3 采样率 sample_rate#

音频输出采样率的默认值为 24000,当输出格式为 ulaw 时,默认值为 8000。可选值为:
8000 16000 24000

5.4 稳定性 stability#

stability 用于控制语音生成的一致性与灵活性:
较低的数值(如 0.3)会生成更一致、更可靠的语音
较高的数值(如 0.9)会在发音方式上提供更多灵活性,但偶尔可能出现不寻常的语调或语音模式
取值范围0 <= x <= 1

5.5 相似度 similarity#

similarity 用于控制语音清晰度、与目标发音人的相似度,以及一定程度上的表现力:
较低的数值(如 0.3)会生成更中性、更一致的说话风格
较高的数值会增强表现力和清晰度,也更接近目标发音人
若设置过高,可能出现“伪影”现象,例如不自然的杂音
取值范围x >= 0

5.6 请求优先级 priority#

auto:系统默认配置。优先使用独享并发线路;当独享资源占满时自动切换至公共线路,最大可用并发为独享并发与共享并发之和;
dedicated_concurrency:仅使用独享并发线路,响应快、无排队等待,并全面支持 WebSocket 调用;
shared_concurrency:仅使用公共并发线路,请求可能因资源共享出现排队及不可避免的延时
上一页
查询子 Key 用量
下一页
创建声音
Built with