1. 语音转文字
MyVocal AI语音大模型API文档
  • 文字转语音大模型
    • 多语种语音合成
      • Voices
        • 创建声音
        • 获取声音列表
        • 删除声音
      • Text-to-Speech
        • 多线程全双工通道 (Mutiple-websocket)
        • 单线程全双工通信(WebSocket)
        • 流式文字转语音(Streaming TTS)
        • 非流式文字转语音
      • 查询接口
        • 查询主key用量
        • Request_id客户端查询
        • 发音人用量查询
      • 子密钥管理
        • 创建子 Key
        • 查询子 Key 列表
        • 获取单个子 Key 详情
        • 更新子 Key
        • 查询子 Key 用量
  • 金融行业定制TTS模型
    • 文字转语音 Skyblight
      • 创建声音
      • 获取声音列表
      • 流式文字转语音(Streaming)
      • 文字转语音(非流式返回)
      • 删除声音
      • 用量查询
    • 全双工通信
      • websocket接入说明
  • 语音转文字ASR
    • 语音转文字
      • 实时语音转文字(Realtime ASR)
      • 语音转文字ASR
        POST
      • 客户用量查询
        GET
  • 企业客户声音定制服务
    • 定制属于你的专属声音
  1. 语音转文字

语音转文字ASR

POST
https://openapi.myvocal.ai/asr/v1/transcriptions

重点字段说明#

模型选择#

echo_v1(精准转写型)
特点:数字、专有名词、金额、时间等细粒度要素的还原更稳;更少主观补全,更接近原话(包括语气词)。
适合:字幕与合规留档、法务/医务记录、培训数据制作、质检取证等更关注“逐字精准度”的场景。
lexis_v1(语义鲁棒型)
特点:对嘈杂环境、断句不清、口语化表达更宽容,遇到缺词、含糊或被遮挡片段时,会结合上下文做合理补全与语义重组,让整段话读起来更通顺。
适合:坐席摘要、客服质检、会议纪要、舆情/语义检索、实时助理等更关注“听懂在说什么”的场景。
维度lexis_v1echo_v1
设计目标听懂要点、保证可读性逐字准确、还原创话
抗噪表现强:高噪声/远讲也能读顺中-强:音质越好越准
语义补全/改写适度补全、重组语序以提升可读性尽量不补全,更贴近原始表达
数字/专名/金额中-强(嘈杂时可能“意译”)强(更可靠的精确还原)
口语与语气词可能适度清理或规整忠实保留为主
适用典型场景摘要、检索、实时助理字幕、合规、取证、数据制作

Audio_Events#

功能开启以后会把音频中涉及的非人类自然语言标注出来

ASR识别语言对照表#

点击查看

Endpoint#

计费说明#

按上传音频的总时长计费,计费单位为秒。无论音频中是否包含静音片段,均按照音频文件的完整时长计算费用。

说话人角色识别#

detect_speaker_roles 用于在说话人分离基础上尝试输出更贴近业务场景的角色标签。建议与 diarize=true 配合使用;不建议与多声道独立转写同时使用。
model_id=echo_v1
file=@sample.wav
diarize=true
detect_speaker_roles=true

请求参数

Header 参数

Body 参数multipart/form-data

返回响应

🟢200成功
application/json
Bodyapplication/json

请求示例请求示例
Shell
JavaScript
Java
Swift
curl --location 'https://openapi.myvocal.ai/asr/v1/transcriptions' \
--header 'API-Key;' \
--form 'model_id="echo_v1"' \
--form 'file=@""' \
--form 'cloud_url="https://example.com/audio.mp3"' \
--form 'language="eng"' \
--form 'audio_events="false";type=false' \
--form 'speakers="1"' \
--form 'timestamps="word";type=word' \
--form 'speaker_diarization="true";type=true' \
--form 'speaker_diarization_threshold="0.1";type=0.1' \
--form 'trans_temp="0";type=0.0' \
--form 'trans_seed="12345"' \
--form 'separate_channel="false";type=false' \
--form 'webhook="false";type=false' \
--form 'webhook_id="callback123"' \
--form 'hotwords="technical issue"' \
--form 'content_detection="all"' \
--form 'clean_transcript="false"' \
--form 'Phare_list="hello world"' \
--form 'detect_speaker_roles="true"'
响应示例响应示例
{}
上一页
实时语音转文字(Realtime ASR)
下一页
客户用量查询
Built with