1. Text-to-Speech
MyVocal AI语音大模型API文档
  • 文字转语音大模型
    • 多语种语音合成
      • Voices
        • 创建声音
        • 获取声音列表
        • 删除声音
      • Text-to-Speech
        • 多线程全双工通道 (Mutiple-websocket)
        • 单线程全双工通信(WebSocket)
        • 流式文字转语音(Streaming TTS)
          POST
        • 非流式文字转语音
          POST
      • 查询接口
        • 查询主key用量
        • Request_id客户端查询
        • 发音人用量查询
      • 子密钥管理
        • 创建子 Key
        • 查询子 Key 列表
        • 获取单个子 Key 详情
        • 更新子 Key
        • 查询子 Key 用量
  • 金融行业定制TTS模型
    • 文字转语音 Skyblight
      • 创建声音
      • 获取声音列表
      • 流式文字转语音(Streaming)
      • 文字转语音(非流式返回)
      • 删除声音
      • 用量查询
    • 全双工通信
      • websocket接入说明
  • 语音转文字ASR
    • 语音转文字
      • 实时语音转文字(Realtime ASR)
      • 语音转文字ASR
      • 客户用量查询
  • 企业客户声音定制服务
    • 定制属于你的专属声音
  1. Text-to-Speech

非流式文字转语音

POST
https://api.voicelibrary.co/enterprise/v1/tts/{voice_id}/

非流式合成#

当用户发送请求后,TTS 模型会在后台完整生成语音文件,直到合成结束才一次性返回给用户。用户必须等待全部音频生成完毕后,才能获得完整的音频文件。

重要参数说明#

stability(稳定性)
提高稳定性可以让每次生成的语音更加一致,但也可能让语调变得较为平淡、缺乏变化。对于较长文本,建议适当降低该数值,以提升自然度。
通俗理解:数值越低,语音越像人类说话——同一句话可能会有不同的韵律和语调;数值越高,语音输出越稳定但可能会有AI感。
特别说明
myvocal_v3模型的stability参数仅支持 0 | 0.5 | 1 三个数值
参数=0:情感更丰富、表现力更强,声音变化更多,但偶尔可能会出现不太符合预期的表达;
参数=0.5:最接近原始录音的声音效果,整体自然、平衡、不刻意,适合大多数常规场景;
参数=1:表现非常稳定、一致性最高,但对情绪或风格指令的响应较弱,适合对稳定性要求极高的场景。
similarity_boost(相似度增强)
调高此项可提升语音的清晰度和与目标发音人之间的相似度。但如果设置过高,可能会出现“伪影”现象,比如:不自然的杂音、回音或音质下降。因此建议逐步调节,找到清晰度与自然度之间的最佳平衡点。
Prority (请求优先级)
auto(自动识别):系统默认配置,优先使用独享并发线路,当独享资源占满时自动切换至公共线路,最大可用并发为独享并发与共享并发之和;
⭐dedicated_concurrency(独享并发):仅使用独享并发线路,响应速度快、无排队等待,并全面支持 WebSocket 调用;
shared_concurrency(共享并发):仅使用公共并发线路,请求可能因资源共享出现排队及不可避免的延时。

Endpoint#

节点 1:系统自动选择(推荐)#

系统将根据网络状况与负载自动选择最优节点
https://api.voicelibrary.co/enterprise/v1/tts/{voice_id}/

节点 2:美国(US)#

https://api.us.voicelibrary.co/enterprise/v1/tts/{voice_id}/

节点 3:爱尔兰(EU)#

https://api.eu.voicelibrary.co/enterprise/v1/tts/{voice_id}/

节点 4:日本(JP)#

https://api.jp.voicelibrary.co/enterprise/v1/tts/{voice_id}/

高级生成控制参数#

以下参数用于控制生成稳定性、表达风格和声线增强。所有参数均为可选;未传时使用系统默认配置。不同模型、音色和文本内容下实际效果可能存在差异,建议根据业务场景选择合适配置。
seed(一致性控制)
用于提升 TTS 生成结果的一致性。用户可自行传入 seed,或使用此前生成接口 Response 返回的 seed。在相同文本和配置下,seed 值相同时,模型会尽量生成相近的声音效果。不传时系统会自动生成新的 seed。
{
  "text": "This is a short enterprise TTS request.",
  "model_id": "multilingual_v2",
  "voice_settings": {
    "stability": 0.5,
    "similarity_boost": 0.75,
    "style": 0.3,
    "use_speaker_boost": true
  },
  "seed": 12345
}

请求参数

Path 参数

Query 参数

Header 参数

Body 参数application/json

示例

返回响应

🟢200成功
application/json
Bodyapplication/json

请求示例请求示例
Shell
JavaScript
Java
Swift
curl --location 'https://api.voicelibrary.co/enterprise/v1/tts//?format=mp3_44100_64&quality=0' \
--header 'api-key;' \
--header 'Content-Type: application/json' \
--data '{
  "text": "hi, this is a TTS Test",
  "model_id": "multilingual_v2",
  "language_code": "en",
  "voice_settings": {
    "stability": 0.7,
    "similarity_boost": 0.7,
    "speed": 1
  },
  "priority": "auto"
}'
响应示例响应示例
{}
上一页
流式文字转语音(Streaming TTS)
下一页
查询接口
Built with