1. Text-to-Speech
MyVocal AI语音大模型API文档
  • 文字转语音大模型
    • 多语种语音合成
      • Voices
        • 创建声音
        • 获取声音列表
        • 删除声音
      • Text-to-Speech
        • 多线程全双工通道 (Mutiple-websocket)
        • 单线程全双工通信(WebSocket)
        • 流式文字转语音(Streaming TTS)
          POST
        • 非流式文字转语音
          POST
      • 查询接口
        • 查询主key用量
        • Request_id客户端查询
        • 发音人用量查询
      • 子密钥管理
        • 创建子 Key
        • 查询子 Key 列表
        • 获取单个子 Key 详情
        • 更新子 Key
        • 查询子 Key 用量
  • 金融行业定制TTS模型
    • 文字转语音 Skyblight
      • 创建声音
      • 获取声音列表
      • 流式文字转语音(Streaming)
      • 文字转语音(非流式返回)
      • 删除声音
      • 用量查询
    • 全双工通信
      • websocket接入说明
  • 语音转文字ASR
    • 语音转文字
      • 实时语音转文字(Realtime ASR)
      • 语音转文字ASR
      • 客户用量查询
  • 企业客户声音定制服务
    • 定制属于你的专属声音
  1. Text-to-Speech

流式文字转语音(Streaming TTS)

POST
https://api.voicelibrary.co/enterprise/v1/tts/{voice_id}/stream

流式返回#

生成的音频数据会分段(chunk)实时返回,而不是等整段语音完全合成后再一次性输出。
这样可以让应用在用户还没等到整段音频生成完成时,就能开始播放前半部分,大幅减少延迟。

重要参数#

特别说明
myvocal_v3模型的stability参数仅支持 0 | 0.5 | 1 三个数值
参数=0:情感更丰富、表现力更强,声音变化更多,但偶尔可能会出现不太符合预期的表达;
参数=0.5:最接近原始录音的声音效果,整体自然、平衡、不刻意,适合大多数常规场景;
参数=1:表现非常稳定、一致性最高,但对情绪或风格指令的响应较弱,适合对稳定性要求极高的场景。
stability(稳定性)
提高稳定性可以让每次生成的语音更加一致,但也可能让语调变得较为平淡、缺乏变化。对于较长文本,建议适当降低该数值,以提升自然度。
通俗理解:数值越低,语音越像人类说话——同一句话可能会有不同的韵律和语调;数值越高,语音输出越稳定但可能会有AI感。
similarity_boost(相似度增强)
调高此项可提升语音的清晰度和与目标发音人之间的相似度。但如果设置过高,可能会出现“伪影”现象,比如:不自然的杂音、回音或音质下降。因此建议逐步调节,找到清晰度与自然度之间的最佳平衡点。
⭐
重要参数:direct PCM格式专用参数,用于控制音频流的返回方式
不传 direct(默认)
返回 WAV 包含标准 44 字节 WAV 头,适合直接保存或播放。
direct=1
返回 纯 PCM 音频数据(raw PCM),不包含任何头部或协议封装,仅返回原始音频字节流。
Prority (请求优先级)
auto(自动识别):系统默认配置,优先使用独享并发线路,当独享资源占满时自动切换至公共线路,最大可用并发为独享并发与共享并发之和。
⭐dedicated_concurrency(独享并发):仅使用独享并发线路,响应速度快、无排队等待,并全面支持 WebSocket 调用。
shared_concurrency(共享并发):仅使用公共并发线路,请求可能因资源共享出现排队及不可避免的延时。

Endpoint#

节点 1:系统自动选择(推荐)#

系统将根据网络状况与负载自动选择最优节点
https://api.voicelibrary.co/enterprise/v1/tts/{voice_id}/stream

节点 2:美国(US)#

https://api.us.voicelibrary.co/enterprise/v1/tts/{voice_id}/stream

节点 3:爱尔兰(EU)#

https://api.eu.voicelibrary.co/enterprise/v1/tts/{voice_id}/stream

节点 4:日本(JP)#

https://api.jp.voicelibrary.co/enterprise/v1/tts/{voice_id}/stream

高级生成控制参数#

以下参数用于控制生成稳定性、表达风格和声线增强。所有参数均为可选;未传时使用系统默认配置。不同模型、音色和文本内容下实际效果可能存在差异,建议根据业务场景选择合适配置。
seed(一致性控制)
用于提升 TTS 生成结果的一致性。用户可自行传入 seed,或使用此前生成接口 Response 返回的 seed。在相同文本和配置下,seed 值相同时,模型会尽量生成相近的声音效果。不传时系统会自动生成新的 seed。
{
  "text": "This is a short enterprise TTS request.",
  "model_id": "multilingual_v2",
  "voice_settings": {
    "stability": 0.5,
    "similarity_boost": 0.75,
    "style": 0.3,
    "use_speaker_boost": true
  },
  "seed": 12345
}

请求参数

Path 参数

Query 参数

Header 参数

Body 参数application/json

示例

返回响应

🟢200成功
application/json
Bodyapplication/json

请求示例请求示例
Shell
JavaScript
Java
Swift
curl --location 'https://api.voicelibrary.co/enterprise/v1/tts//stream?format=mp3_44100_64&quality=0&direct=1&compress=false' \
--header 'api-key;' \
--header 'Content-Type: application/json' \
--data '{
    "text": "string",
    "voice_settings": {
        "stability": 0.7,
        "similarity_boost": 0.7,
        "speed": 0.7,
        "style": 0.3,
        "use_speaker_boost": true
    },
    "model_id": "multilingual_v2",
    "language_code": "en",
    "priority": "auto",
    "text_normalization": "on",
    "seed": 12345
}'
响应示例响应示例
{}
上一页
单线程全双工通信(WebSocket)
下一页
非流式文字转语音
Built with