1. 多语种语音合成
MyVocal AI语音大模型API文档
  • 文字转语音大模型
    • 多语种语音合成
      • Voices
        • 创建声音
        • 获取声音列表
        • 删除声音
      • Text-to-Speech
        • 多线程全双工通道 (Mutiple-websocket)
        • 单线程全双工通信(WebSocket)
        • 流式文字转语音(Streaming TTS)
        • 非流式文字转语音
      • 查询接口
        • 查询主key用量
        • Request_id客户端查询
        • 发音人用量查询
      • 子密钥管理
        • 创建子 Key
        • 查询子 Key 列表
        • 获取单个子 Key 详情
        • 更新子 Key
        • 查询子 Key 用量
  • 金融行业定制TTS模型
    • 文字转语音 Skyblight
      • 创建声音
      • 获取声音列表
      • 流式文字转语音(Streaming)
      • 文字转语音(非流式返回)
      • 删除声音
      • 用量查询
    • 全双工通信
      • websocket接入说明
  • 语音转文字ASR
    • 语音转文字
      • 实时语音转文字(Realtime ASR)
      • 语音转文字ASR
      • 客户用量查询
  • 企业客户声音定制服务
    • 定制属于你的专属声音
  1. 多语种语音合成

Text-to-Speech

模型说明#

下面列出的三种模型均支持流式与非流式输出
模型名称说明
multilingual_v2高保真度模型,具备出色的文本理解能力,可精准识别简写、缩写及数字含义,语音自然度高,但生成速度相对较慢
Tubro主打极速生成,速度约为 multilingual_v2 的 3-5 倍,更适合实时对话与高并发场景,但在文本语义理解上略有简化
myvocal_v3V3 模型在延续 V2 强大合成能力的基础上,进一步加入笑声、咳嗽、呼吸等自然人类音效及关键词驱动的情绪控制,为游戏、影视、虚拟角色等高要求场景提供更真实、更富感染力的声音表现力。该模型支持100种语言输出。
对于品牌名称、人名等容易出现不规则发音的场景,我们的模型可完美支持 IPA(国际音标) 标注,几乎能够适配全球所有语言,实现精准还原发音

音频格式#

ulaw最小的音频格式 | PCM=模型生成的原始格式,可以自己编辑,可以理解为无损 | MP3 有一定损失,但人类的耳朵很难辨别;
mp3_44100_64 | mp3_44100_96 | mp3_44100_128 | mp3_44100_192
pcm_8000 | pcm_16000 | pcm_22050 | pcm_24000 | pcm_44100
ulaw_8000

输出语言#

Language code 参数为可选项:若不指定,系统将根据输入文本自动识别语言;若指定,则按设定语言输出
myvocal_v3 模型支持100种语言输出,详情请访问该链接
multilingual_v2支持
英语(en)日语(ja)德语(de)印地语(hi)法语(fr)韩语(ko)
葡萄牙语(pt)意大利语(it)西班牙语(es)印度尼西亚语(id)荷兰语(nl)土耳其语(tr)
菲律宾语(fil)波兰语(pl)瑞典语(sv)保加利亚语(bg)罗马尼亚语(ro)阿拉伯语(ar)
捷克语(cs)希腊语(el)芬兰语(fi)克罗地亚语(hr)马来语(ms)斯洛伐克语(sk)
丹麦语(da)泰米尔语(ta)乌克兰语(uk)俄语(ru)
tubro支持
英语(en)日语(ja)德语(de)印地语(hi)法语(fr)韩语(ko)
葡萄牙语(pt)意大利语(it)西班牙语(es)印度尼西亚语(id)荷兰语(nl)土耳其语(tr)
菲律宾语(fil)波兰语(pl)瑞典语(sv)保加利亚语(bg)罗马尼亚语(ro)阿拉伯语(ar)
捷克语(cs)希腊语(el)芬兰语(fi)克罗地亚语(hr)马来语(ms)斯洛伐克语(sk)
丹麦语(da)泰米尔语(ta)乌克兰语(uk)俄语(ru)匈牙利语(hu)挪威语(no)
越南语(vi)

指定请求服务器#

MyVocal的文字转语音大模型在全球一共有三个机群,分别在美国中部,欧洲的爱尔兰以及亚洲的东京。系统默认会按照您当时请求情况自动判断当前最快的节点。您也可以通过下面的服务指定服务机群。
特别说明:选择指定区域的服务器功能仅针对独享并发生效 (priority = dedicated_concurrency)

非流式#

服务器所在区域API请求地址
美国https://api.us.voicelibrary.co/enterprise/v1/tts/{voice_id}/
爱尔兰https://api.eu.voicelibrary.co/enterprise/v1/tts/{voice_id}/
东京https://api.jp.voicelibrary.co/enterprise/v1/tts/{voice_id}/

流式#

服务器所在区域API请求地址
美国https://api.us.voicelibrary.co/enterprise/v1/tts/{voice_id}/stream
爱尔兰https://api.eu.voicelibrary.co/enterprise/v1/tts/{voice_id}/stream
东京https://api.jp.voicelibrary.co/enterprise/v1/tts/{voice_id}/stream

多线程WebSocket#

服务器所在区域API请求地址
美国wss://api.us.voicelibrary.co/enterprise/v1/tts/{voice_id}/websocket/multi
爱尔兰wss://api.eu.voicelibrary.co/enterprise/v1/tts/{voice_id}/websocket/multi
东京wss://api.jp.voicelibrary.co/enterprise/v1/tts/{voice_id}/websocket/multi

单线程WebSocket#

服务器所在区域API请求地址
美国wss://api.us.voicelibrary.co/enterprise/v1/tts/{voice_id}/websocket
爱尔兰wss://api.eu.voicelibrary.co/enterprise/v1/tts/{voice_id}/websocket
东京wss://api.jp.voicelibrary.co/enterprise/v1/tts/{voice_id}/websocket
上一页
删除声音
下一页
多线程全双工通道 (Mutiple-websocket)
Built with