声音克隆配音

本页印出的枚举值是快照。机器可读的真相源是 枚举清单 —— 两边若有出入,以那份为准。

输入文本与音色(speaker),生成对应音色的配音音频(声音克隆)。无需上传文件,输入即文本。

创建任务

基本信息

项目值
请求方法POST
请求路径/task/audio_tts_clone
Content-Typeapplication/json
鉴权方式Authorization 请求头(直接传 API Key)

请求参数(Body)

参数名类型必填默认值说明
textstring是—待合成文本,非空,长度上限 5000 字
speakerstring是—音色代号(见下方「可用音色」)
text_langstring否该音色的语种目标语言(BCP-47,如 zh-CN)。通常不必传——音色本身已决定语种,不传即按音色的语种合成
output_formatstring否wav输出音频格式:wav 或 mp3
refreshboolean否false强制重新合成(跳过缓存),用于要一版新演绎;仅云引擎音色生效
speednumber否音色预设语速倍率(1.0 = 原速)。合法区间逐音色不同,以音色清单接口返回的 speed_range 为准;个别音色不支持调速(其 speed_range 的 min 与 max 同为 1.0)。越界会前置返回参数错误,不建任务、不计费
subtitle_formatstring否不生成字幕传 srt 时,除音频外额外产出一份 .srt 字幕文件(UTF-8、无 BOM、LF 换行)。时码取自本次合成的句级时码,与音频严格一致;过长的句子会按 canvas 画幅拆成多行,拆出的行在该句时段内按字数分配时码;不额外计费。不传即完全不生成,产物与出参和以前一样。取值目前仅 srt,传别的值会返回参数错误
strip_punctuationboolean否true字幕文本去标点开关,仅作用于 subtitle_format 附赠的 .srt 字幕文本:缺省去标点(标点在字幕里不好看)——中文 , 。 与英文 , . 替换为空格,词内形态豁免(小数 3.5、域名 example.com、千分位 1,000 不动),其余标点(引号、问号、感叹号、破折号等)一律保留;连续空格折一、行首尾裁净。时码、行数、音频与 segments 零变化。显式传 false 时完整保留标点
canvasinteger[]否[1080, 1920](竖屏)成片画布 [宽, 高],两个正整数,仅在传 subtitle_format 时可用(只传它会返回参数错误)。字幕按该画幅把过长的句子拆成多行——竖屏比横屏拆得更碎;不传即按缺省竖屏画幅拆,横屏成片请显式传 [1920, 1080]。只影响字幕分行,音频与 segments 零变化
text_split_methodstring否音色预设(通常 cut1)长文切分法,仅同合云自研(gpt_sovits)音色生效;云引擎音色目前会忽略此参数、观察期满后将改为报错(日期另行公告),请勿对云引擎音色传此参数——云引擎音色的句级时码本就按一句一段产出,想要句句分开无需该参数。它决定 segments 的断句粒度(字幕先按它断句,再按 canvas 把过长的句子拆成多行):cut1 = 凑 4 句为一段、cut2 = 约 50 字、cut3 = 按中文句号、cut4 = 按英文句号、cut5 = 按所有标点(句句分开)、cut0 = 不切。想让字幕在每个句末都断开,传 cut5
fragment_intervalnumber否音色预设句间停顿秒数,仅同合云自研(gpt_sovits)音色生效。合法区间 [0.05, 1.0] 秒(闭区间,两端点均合法),越界返回参数错误、不做静默钳位——不建任务、不计费。⚠️ 云引擎音色传了会明确报错,这与上一行 text_split_method「云引擎会忽略此参数」行为相反,别按那条的经验推断成「传了顶多没用」。不传即跟随该音色调好的预设,产物与本参数上线前逐字节一致

可用音色(speaker)

音色代号(speaker)来源(engine)性别语种单价试听音色描述
同合云自研(9 条)· 5 积分/千字符
讲述者narrator同合云自研男zh-CN5 积分/千字符音区在姊妹音色中显著偏低,语速也明显更缓,中性明暗与干净度配合中等起伏,留白偏少。听感沉稳不急促,适合需要营造庄重或叙事氛围的内容,如历史纪录片旁白、经典文学有声书等,能让听众沉浸于平缓且有分量的表达中。
授课主播lecturer同合云自研男zh-CN5 积分/千字符嗓音带有明显沙哑气声,是9个姊妹音色中干净度最低的,同时响度起伏显著高于多数姊妹,强弱变化丰富。适配需要展现真实松弛感的内容,如深夜情感播客、故事类有声书旁白,能传递出略带沧桑又富有情绪层次的表达。
弗兰教授professor_fran同合云自研男zh-CN5 积分/千字符这是9条姊妹音色中明暗度和高频空气感最低的男声,听感极暗且几乎无薄脆通亮的高频细节,区别于其他偏亮或有空气感的姊妹音色。它语速偏快、起伏偏平,适合传递沉稳直接的专业内容,不会因明亮或空气感分散听众对信息的注意力。
广东荣姐cantonese_accent同合云自研女zh-CN5 积分/千字符响度起伏极弱,语音强弱变化远小于姊妹音色,同时高频空气感突出,听感薄脆通亮。适合需要稳定输出、无明显情绪波动的场景,如标准化产品说明、基础知识科普等,传递清晰且平稳的信息。
电台女神radio_female同合云自研女zh-CN5 积分/千字符响度起伏极低、语速极慢,是9条姊妹音色中最平稳舒缓的存在——没有明显的强弱波动,每个字都均匀铺陈,节奏不疾不徐。明亮纯净的音色自带清晰质感,适配需要传递安宁氛围的内容,听众能在稳定的语调里沉浸接收信息。
暖心姐姐heartwarming_female同合云自研女zh-CN5 积分/千字符高频空气感最突出,薄脆通亮的听感远超其他姊妹音色,明亮度也位居前列。干净的音色搭配偏快语速,适合需要清晰通透质感的内容,如美妆产品细节讲解、轻科普知识传播等场景,能让信息传递更具穿透力。
亲切女声kind_female同合云自研女zh-CN5 积分/千字符响度起伏在姊妹音色中最突出,强弱变化明显,同时语速极快,是9条里语速最快的。偏亮的音色纯净无杂质,适配需要高效传递信息且有情感波动的场景,如快讯播报、剧情解说等,能快速抓住注意力又不失生动。
灵动女声(仅供内部成员使用)energetic_female同合云自研女zh-CN5 积分/千字符气口留白丰富自然,每处停顿都带着呼吸感,与姊妹音色相比更显松弛流畅;嗓音纯净无杂质,中性明暗度适配多种场景。适合需要自然呼吸感的内容,如情感电台独白、儿童故事伴读,让听众感受真实的语气节奏。
软萌少女(仅供内部成员使用)sweet_female同合云自研女zh-CN5 积分/千字符语调起伏很大,气口留白中等,是9条姊妹音色中抑扬最鲜明、呼吸感最足的女声。音区很高且明亮,干净度中性,语速偏快,适配需要情绪张力与自然呼吸感的内容,如儿童故事分角色演绎、情感类播客旁白,能让表达更生动有层次。
微软 Azure(12 条)· 13 积分/千字符
雲龍(实验性)azure_zh-HK-WanLungNeural微软 Azure男zh-HK13 积分/千字符极暗音色搭配音区偏低的粤语原生男声,语调起伏很平、语速中等,旁白时自带老港茶餐厅里沉稳讲古的质感,口条扎实不飘,适配港澳大湾区题材解说、港片经典场景复盘与粤式烧腊制作教学。
Andrew Multilingual(实验性)azure_en-US-AndrewMultilingualNeural微软 Azure男en-US13 积分/千字符拥有偏暗的音色与起伏很平的语调,是接近真人播客质感的英语男声。语流带轻微自然呼吸与连读,叙述沉稳克制,像深夜书房里分享观点的播客主,适合英文深度内容的长文旁白,连听不累。
云扬(实验性)azure_zh-CN-YunyangNeural微软 Azure男zh-CN13 积分/千字符明显沙哑气声的男嗓,音区偏低、语调起伏较大,语速偏快且留白中等。叙述时逻辑重音精准落在关键词上,像资深行业分析师拆解数据般利落,又能压下调子做轻松资讯分享,适配专业内容讲解与非官方资讯播报。
云健(实验性)azure_zh-CN-YunjianNeural微软 Azure男zh-CN13 积分/千字符音区偏低且带有明显沙哑气声的男声,语调起伏与停顿留白均为中等,语速适中,自带原生纪录片叙事质感,叙述时沉稳不抢戏,句尾自然下沉,连听长文本也不易疲劳,能适配片子从舒缓到高潮的不同节奏切换。
云希 四川(实验性)azure_zh-CN-sichuan-YunxiNeural微软 Azure男zh-CN · sichuan13 积分/千字符原生川渝方言男声,音区中等,音色明暗中性,嗓音干净度中性,语调起伏中等,停顿留白偏多,语速偏快。自带川渝街头茶馆的烟火气,像熟稔本地门路的老饕,讲起火锅辣度、茶馆评书时鲜活带感,适合快节奏的地域内容解说。
云希(实验性)azure_zh-CN-YunxiNeural微软 Azure男zh-CN13 积分/千字符留白很多的年轻男声,音区中等,音色明暗中性、嗓音干净度中性,语速偏快、语调起伏中等,像身边爱分享的朋友,讲起旅行见闻时节奏轻快又留足呼吸感,切换风格也能hold住轻科普的清晰表达
Aria(实验性)azure_en-US-AriaNeural微软 Azure女en-US13 积分/千字符语调起伏很平,音区中等,音色明暗中性、干净度中性。叙述时像严谨的学术研究员,讲跨国科技进展逻辑清晰,读企业新品英文白皮书专业精准,播轻松向国际文化资讯也稳而不板。长稿处理缩写数字不卡壳,适配多场景英语解说需求。
晓涵(实验性)azure_zh-CN-XiaohanNeural微软 Azure女zh-CN13 积分/千字符拥有纯净无杂质的明亮女声,音区中等,语调起伏与停顿留白均为中等,语速中等。叙述时如春日午后窗边轻语,温柔且沉稳,无刻意讨好感,适合传递人文类内容的温度,长文本聆听舒适不疲惫。
晓晓2 HD Flash(实验性)azure_zh-CN-Xiaoxiao2:DragonHDFlashLatestNeural微软 Azure女zh-CN13 积分/千字符语调起伏很大是这个女声最鲜明的特点,音区中等,音色明暗中性、嗓音干净度中性,语速中等且停顿留白偏少。叙述时像雀跃的林间信使,情绪张力拉满,能让平淡内容变得鲜活,适合需要快速抓住注意力的场景。
晓晓(实验性)azure_zh-CN-XiaoxiaoNeural微软 Azure女zh-CN13 积分/千字符这是音区偏高的女声,音色中性、嗓音干净,语调起伏中等、停顿留白中等、语速中等。叙述气质规整严谨,重音落位精准,句读清晰,像新闻直播间里端坐在镜头前的播报员,适合传递正式资讯与官方通稿,也能稳定应对各类通用解说场景。
晓甄(实验性)azure_zh-CN-XiaozhenNeural微软 Azure女zh-CN13 积分/千字符音区偏高、音色偏亮的女声,咬字颗粒清晰且底色扎实,语调起伏中等、留白与语速均为中等,叙述时带着利落的专业感,无多余甜腻腔调。适合讲解专业内容时保持稳定输出,读长句和专业名词不飘,能让知识传递更具可信度。
晓伊(实验性)azure_zh-CN-XiaoyiNeural微软 Azure女zh-CN13 积分/千字符音区很高且明亮度突出,语调起伏较大却不过度尖锐,是Azure中文女声里年轻感鲜明又不稚嫩的存在。叙述时像蹦跳着分享新鲜事的邻家女孩,既能欢快带起美食探店的轻松节奏,也能收住语调讲清生活小技巧的原理,适配多种轻量内容场景。
阿里云(14 条)· 21–42 积分/千字符
龙老伯ali_longlaobo_v3阿里云男zh-CN21 积分/千字符音区很低的男声音色,音色偏暗,干净度中性,语调起伏中等,停顿留白中等,语速偏慢。叙述时带着岁月沉淀的厚重感,像坐在老藤椅上缓缓讲述往事的长者,适合承载年代记忆类内容,声线自带的时间感能让叙事更具真实感。
龙修ali_longxiu_v3阿里云男zh-CN21 积分/千字符自带说书感的男声,音区偏低,音色中性,略带沙哑,语速偏快且留白很多,语调起伏中等,像茶馆里摇着折扇的讲书人,擅长用钩子节奏设悬念、抖包袱,适配影视解说、历史故事讲述等需要抓人的场景。
龙逸尘ali_longyichen_v3阿里云男zh-CN21 积分/千字符明显沙哑气声的年轻男声,音区中等、偏暗,语调起伏较大,留白与语速中等。叙述带着洒脱松弛感,像阳光晒过的旧皮夹克般随性,连读长文本不飘不累,适合需要年轻活力又能扛内容密度的解说场景。
龙安洋ali_longanyang阿里云男zh-CN21 积分/千字符支持指令控制的男声,音区中等,音色明暗中性,嗓音明显沙哑气声,语调起伏较大,停顿留白中等,语速中等。叙述带点随性松弛感,像围坐聊天时讲趣闻,适配可灵活调情绪的场景,能切换不同表达状态。
龙老铁ali_longlaotie_v3阿里云男zh-CN · dongbei21 积分/千字符自带东北原生方言味儿的男声,音区中等,音色明暗中性,嗓音干净度中性,语调起伏中等,停顿留白偏多,语速中等。像蹲在巷口唠嗑的老邻居,语气自带喜剧感,适合唠东北市井琐事、冰雪景点趣闻,吐槽时方言梗自然甩出来不生硬。
龙楠ali_longnan_v3阿里云男zh-CN21 积分/千字符留白偏多的中等语速男声,音区中等、音色偏亮、干净度中性,语调起伏中等。叙述时像坐在书桌前拆解复杂概念的青年学者,逻辑清晰又不沉闷,长段落推演也能让听众跟上节奏,适合把专业内容讲得通俗好懂。
龙媛ali_longyuan_v3阿里云女zh-CN21 积分/千字符留白偏多的叙述节奏里,偏亮的音色裹着岁月沉淀的温柔质感,音区中等、语速偏慢,起伏中等的语调像午后窗边轻语。适合讲人文故事里的细腻情感,或生活感悟类内容,长文本听感舒适不疲惫。
Bella3.0ali_loongbella_v3阿里云女zh-CN21 积分/千字符语调起伏较大,音区中等,音色明暗中性、嗓音干净度中性,语速与停顿留白均中等。叙述时咬字颗粒清晰不含糊,像职场里精准拆解方案的知性女性,适配高信息密度内容的专业解说。
龙安欢(V3 方言版)ali_longanhuan_v3阿里云女zh-CN21 积分/千字符支持9种方言切换的女声音色,音区偏高,音色明暗中性,嗓音干净度中性,语调起伏中等,停顿留白中等,语速偏快。叙述时带着地域语境的鲜活感,像邻里闲聊般自然贴切,适配多地域题材内容的解说与演绎。
龙妙ali_longmiao_v3阿里云女zh-CN21 积分/千字符语调起伏很大的女声,音区偏高、音色偏亮、干净度中性,语速偏慢且留白偏多。叙述时抑扬顿挫,像握着指挥棒的领读者,把复杂内容拆成有节奏的段落,适配需要抓耳节奏感的内容,降低机器念稿感。
龙安欢ali_longanhuan阿里云女zh-CN21 积分/千字符语调起伏很大的女声,音区偏高、音色偏亮、干净度中性,叙述时像蹦跳着分享新鲜事的元气少女,适配剧情解说、知识科普、比赛解说等场景,换指令就能覆盖多类题材,还可用于美食或生活方式旅拍解说。
龙嘉怡ali_longjiayi_v3阿里云女yue-HK21 积分/千字符极暗且纯净无杂质的粤语音色,搭配音区偏高、起伏很平的语调与偏慢语速,营造出知性可信的叙述感。如同深夜窗边的粤语知性分享者,适合沉稳传递文化内容与地域资讯。
龙婧ali_longjing_v2阿里云女zh-CN42 积分/千字符略带沙哑的中性音色,音区中等,语调起伏与语速均中等,停顿留白偏少。叙述时自带传统权威感,像端坐于演播厅的资深播报员,字正腔圆传递信息,适合需要稳重公信力的内容。
龙白芷ali_longbaizhi阿里云女zh-CN42 积分/千字符这是官方认证的旁白女声,音区偏高,音色明暗中性、嗓音干净,语调起伏中等、停顿留白中等、语速中等,叙述时带着从容的睿气,像在安静书房里拆解复杂知识,适合需要可信度的专业内容解说。
火山引擎(20 条)· 34–50 积分/千字符
深夜播客 2.0volc_zh_male_shenyeboke_uranus_bigtts火山引擎男zh-CN34 积分/千字符音区很低的男声,音色偏暗、干净度中性,语调起伏中等、停顿留白中等、语速中等。像深夜里轻靠在电台麦克风前的讲述者,带着松弛的磁性,适合人文随笔的细腻铺陈、城市夜景旅拍的氛围渲染,或是悬疑故事的氛围铺垫,传递出不刻意的亲近感。
擎苍 2.0volc_zh_male_qingcang_uranus_bigtts火山引擎男zh-CN34 积分/千字符音区很低、音色极暗的男声,略带沙哑的嗓音自带岁月沉淀感,语调起伏中等、语速偏慢且留白适中,叙述时像围炉夜话的老学者,讲王朝更迭时藏着历史的厚重感,长文本听感舒适不疲劳,适配需要深度沉浸感的内容。
东方浩然 2.0volc_zh_male_dongfanghaoran_uranus_bigtts火山引擎男zh-CN34 积分/千字符音区很低、音色极暗的男声,略带沙哑的质感里藏着沉稳力量,语调起伏中等、语速偏慢,留白适中。像站在大坝顶端讲述工程历程的工程师,语气昂扬却不煽动,适配需要正气开阔感的宏大叙事场景。
磁性解说男声 2.0volc_zh_male_cixingjieshuonan_uranus_bigtts火山引擎男zh-CN34 积分/千字符这是一个语调起伏很大的男声,音区偏低,音色偏暗,略带沙哑,语速偏慢且留白很多。叙述时像围炉夜话的故事讲述者,自带画面感,适合需要情绪张力和节奏呼吸感的内容,能让听众沉浸于情节或观点的铺陈中。
云舟 2.0volc_zh_male_m191_uranus_bigtts火山引擎男zh-CN34 积分/千字符支持8种方言切换的男声,音区偏低,音色中性,略带沙哑,语调起伏中等,语速中等,停顿留白偏少。叙述时像巷口茶馆里喝着茶讲地方掌故的本地人,适配跨省方言文化对比、地域美食溯源类内容,同一声音身份换口音的一致性让系列内容更有品牌感。
悬疑解说 2.0volc_zh_male_xuanyijieshuo_uranus_bigtts火山引擎男zh-CN34 积分/千字符音区偏低且音色偏暗的男声,语调起伏偏平,自带「接下来要出事」的悬念感。叙述时像暗处观察的猎手,重音精准落在关键情节,留白中等让紧张感自然发酵,适配悬疑影视解说,也能驾驭长文本有声阅读。
解说小明 2.0volc_zh_male_jieshuoxiaoming_uranus_bigtts火山引擎男zh-CN34 积分/千字符语速偏快且起伏很平,带着略带沙哑的中性嗓音,像身边同龄朋友分享新鲜事,松弛不端着。适合旅拍vlog里边走边说的随性叙述,数码新品开箱的快速种草,或是校园生活日常分享,给内容添上自然亲切的平视感。
译制片男 2.0volc_zh_male_yizhipiannan_uranus_bigtts火山引擎男zh-CN34 积分/千字符语调起伏较大是其最鲜明的特点,配合略带沙哑的嗓音与中性明暗的音色,形成独特的叙事腔调。叙述时像老译制片里的旁白,夸张句读与慢语速碰撞出复古感,既能还原上世纪老电影的年代氛围,也能靠一本正经的腔调讲日常琐事制造幽默反差。
Margaretvolc_en_female_authoritative-informative_uranus_bigtts火山引擎女en-US34 积分/千字符这是一位罕见的低音女声,音区中等,音色明暗中性、嗓音干净度中性,语调起伏偏平、停顿留白偏少。她的叙述沉稳可靠,像在静谧展馆里为你解析文物脉络,又似深夜电台中科普宇宙奥秘,自带权威感与信息量。
Kenvolc_ja_male_bv524_uranus_bigtts火山引擎男ja-JP34 积分/千字符语调起伏很平的日语男声,音区中等,音色明暗中性、嗓音干净度中性,留白中等。叙述时像沉稳的旅拍向导,语流平稳不跳脱,适合清晰传递信息。适配日本文化、旅拍类解说,也能驾驭动漫背景知识科普,给人可靠、不喧宾夺主的听感。
云舟 2.0(陕西话)volc_zh_male_m191_uranus_bigtts__shaanxi火山引擎男zh-CN · shaanxi34 积分/千字符覆盖8种方言且声音身份统一,音区中等、明暗中性、干净度中性,语调起伏中等、语速偏慢、留白偏少。叙述时像熟悉多地方言的本地向导,适配跨省旅拍解说,也适合方言文化科普,能让观众感受到同一解说员切换口音的自然感。
云舟 2.0(东北话)volc_zh_male_m191_uranus_bigtts__dongbei火山引擎男zh-CN · dongbei34 积分/千字符覆盖8种方言的单一声音身份,音区中等,音色偏暗且干净,语调起伏很平、停顿留白与语速均中等。叙述时像围炉夜话的沉稳长者,换方言却保持统一质感,适配跨省文化探索类内容,上海话为其独有的方言优势。
爽快思思 2.0volc_zh_female_shuangkuaisisi_uranus_bigtts火山引擎女zh-CN34 积分/千字符叙述利落不拖沓,音区中等,音色明暗中性,嗓音干净度中性,语调起伏中等,停顿留白中等,语速中等。像都市里步履轻快的女生分享日常,语气鲜活不黏腻,没有刻意端着的距离感,很适合给生活方式类内容做解说。
温柔小雅 2.0volc_zh_female_wenrouxiaoya_uranus_bigtts火山引擎女zh-CN34 积分/千字符该音色留白偏多,在叙述中留有呼吸般的间隙,音区中等,音色中性且干净,语调起伏中等,语速偏慢。气质如晨雾里的古镇石板路般温柔克制,适合缓缓铺陈人文场景,像清晨古镇苏醒、老巷旧物故事这类文本,能传递不疾不徐的陪伴感。
云舟 2.0(四川话)volc_zh_male_m191_uranus_bigtts__sichuan火山引擎男zh-CN · sichuan34 积分/千字符覆盖8种方言的统一声线,音区中等,音色明暗中性、嗓音干净度中性,语调起伏偏平、停顿留白中等、语速中等。叙述时像熟悉多地方言的本地向导,语气平稳不张扬,适配跨地域内容解说,让不同方言区观众都有亲切感。
知性女声 2.0volc_zh_female_zhixingnv_uranus_bigtts火山引擎女zh-CN34 积分/千字符留白很少的叙述节奏是其鲜明特点,音区中等、音色明暗中性、嗓音干净度中性,语调起伏中等、语速偏慢,咬字清晰无多余情绪,像安静陈列知识的展柜,让信息本身成为焦点,适合传递客观内容时避免声音干扰。
Vivi(陕西话)volc_zh_female_vv_uranus_bigtts__shaanxi火山引擎女zh-CN · shaanxi34 积分/千字符音区很高的女声,音色明暗中性、嗓音干净度中性,语调起伏较大,语速偏慢且留白很少。像巷口摆着竹椅讲故事的陕西阿姨,语气鲜活带劲儿,把老城墙下的旧事说得有滋有味,适合讲带地域味儿的生活故事。
Vivi(东北话)volc_zh_female_vv_uranus_bigtts__dongbei火山引擎女zh-CN · dongbei34 积分/千字符嗓音纯净无杂质,搭配音区很高的女声,语调起伏中等、留白与语速均适中,叙述时像东北小院里晒着太阳唠家常的姑娘,既纯净无杂质又带着方言特有的热乎劲儿,适合讲贴近生活的内容,也能驾驭需要清晰表达的场景。
Vivi(四川话)volc_zh_female_vv_uranus_bigtts__sichuan火山引擎女zh-CN · sichuan34 积分/千字符留白很少的川渝女声,音区很高,音色中性干净,语调起伏偏平、语速偏慢。像巷口老茶馆里慢声摆龙门阵的本地姑娘,叙事稳当不拖沓,适合把方言里的生活味揉进内容里。
京腔侃爷 / Harmonyvolc_zh_male_jingqiangkanye_moon_bigtts火山引擎男zh-CN50 积分/千字符音区中等、音色偏暗的男声,语调起伏很平,带着胡同里侃大山的松弛感,像老北京哥们儿凑一块儿唠嗑,贫嘴中藏着对事儿的偏暗看法,适合拆解社会现象、扒消费陷阱时用「唠明白」的口吻拉近距离。

本表由服务端音色清单接口实时生成,不再手工维护。完整字段(人设、标签、适合题材、语速区间等)见音色清单与检索。「来源」列对应音色清单接口的 engine 字段(同合云自研 = gpt_sovits、阿里云 = aliyun、火山引擎 = volcengine、微软 Azure = azure),可直接用作该接口的 engine 过滤值;不同来源单价不同,与价格页「声音克隆配音」的计费分档一一对应。表按来源分组,组间按最低单价、组内按单价升序排列。「试听」为各音色 demo 示例,全部音色念同一句标语,可直接横向比较。标注「仅供内部成员使用」的音色仅面向同合云内部成员开放,其他账号请求时会返回参数错误并明示原因。

计费说明

按输入文本的字符数计费,计量单位是千字符。

  • 计费单位数 = text 字符数 ÷ 1000(保留小数)
  • 计费只看你提交的文本,与合成出来的音频时长无关——调慢语速会让音频变长,但不影响扣费
  • 最终扣费向上取整到整积分,任何非空文本至少 1 积分

单价按音色所属的引擎与档位不同(5 ~ 50 积分 / 千字符),见音色清单接口返回的 credits_per_kchar 字段,与价格页「声音克隆配音」的分档一一对应。

字符怎么数

规则说明
计数口径按 Unicode 码点计,一个中日韩字符算 1 个字符,英文按字母、数字按位
首尾空白不计(text 在校验前已做首尾裁剪)
中间的空格、换行、标点各计 1

例如 1000 字符 = 1 千字符;用一个 5 积分/千字符的音色合成,扣 5 积分。

⚠️ 计费口径已于 2026-08 由「分钟」改为「千字符」。此前文档写的「按合成时长计费、计费分钟按 240 字/分钟折算」已作废——那层折算是伪单位,现已收掉:按字符计费的能力,其对外单位就是字符。

音色清单接口在过渡期同时返回 credits_per_kchar(现行)与 credits_per_minute(已废弃,仅因旧文档教用户读它而暂留),公告期结束后 credits_per_minute 会被移除。新接入请只读 credits_per_kchar。

请求示例

curl -X POST https://api.ai-mcn.tv:10000/task/audio_tts_clone \
  -H "Authorization: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "你好,欢迎收听本期节目。",
    "speaker": "narrator",
    "output_format": "wav",
    "speed": 1.0
  }'

成功响应示例

{
  "code": 200,
  "msg": "success",
  "data": {
    "task_id": "537489015178247",
    "task_type": "audio_tts_clone",
    "status": "queued"
  }
}

查询任务结果

基本信息

项目值
请求方法GET
请求路径/task/audio_tts_clone/{task_id}
鉴权方式Authorization 请求头(直接传 API Key)

响应参数(output_result)

参数名类型说明
file_idstring合成音频文件 ID
download_urlstring音频下载路径
speakerstring使用的音色代号
voice_idstring同 speaker(与音色清单接口的字段名对齐)
enginestring合成引擎
sample_rateinteger音频采样率(Hz)
duration_msinteger音频实际时长(毫秒)。与计费无关——计费只看输入文本的字符数
billed_charsinteger上游引擎回传的字符计数,仅云引擎音色有(自研 gpt_sovits 音色不返回该字段)。⚠️ 它是上游用量留痕,不是你的扣费依据:各家引擎的计数口径不同(如火山取上游 usage.text_words),而你的扣费恒按本页「字符怎么数」那一节的口径算
segmentsarray句级时码 [{index, text, start_ms, end_ms}]:每句在音频里的起止毫秒,可直接用于字幕对齐与画面切换点。end_ms 含该句尾部的自然停顿,时间轴首尾相接无缝隙。云引擎音色恒返回;自训音色的分段粒度跟随请求参数 text_split_method(见上方请求参数表,缺省 cut1 会把最多 4 句合为一段),要句句分开传 cut5
subtitle_file_idstring字幕文件(.srt)ID。仅当请求传了 subtitle_format 时出现;生成失败时为空串,原因见 errors.subtitle
subtitle_file_download_urlstring字幕文件下载路径
errorsobject仅在附赠产物降级时出现。字幕生成失败记在 errors.subtitle,任务仍是 completed、音频产物不受影响
cache_hitboolean仅命中合成缓存时出现且为 true(此时音频复用上一次的产物)

成功响应示例

{
  "code": 200,
  "msg": "success",
  "data": {
    "task_id": "537489015178247",
    "status": "completed",
    "progress": 100,
    "output_result": {
      "file_id": "537489015178248",
      "download_url": "/download/a1/output_tts.wav",
      "speaker": "narrator",
      "voice_id": "narrator",
      "engine": "gpt_sovits",
      "sample_rate": 32000,
      "duration_ms": 5240,
      "billed_chars": 16,
      "segments": [
        { "index": 0, "text": "第一句话在这里。", "start_ms": 0, "end_ms": 2600 },
        { "index": 1, "text": "第二句话在这里。", "start_ms": 2600, "end_ms": 5240 }
      ]
    },
    "create_time": "2026-06-21T08:00:00Z",
    "update_time": "2026-06-21T08:00:12Z"
  }
}

错误码

错误码HTTP 状态码说明解决方案
6013400必填参数缺失(text / speaker)补齐参数
6016400业务参数非法(speaker 不可用、text 为空或超长、speed 越界、subtitle_format 非法、canvas 非法或未传 subtitle_format 却传了 canvas、fragment_interval 越界、云引擎音色传了 fragment_interval 等)按参数说明修正
6502401鉴权失败检查 Authorization 请求头
6201402额度不足前往仪表盘充值
6202402余额不足前往仪表盘充值

使用限制

⚠️ 行为变更公告(2026-09-13):自 2026-09-13 起,传 subtitle_format 的请求,字幕会按 canvas 画幅把过长的句子拆成多行;未传 canvas 时按缺省竖屏画幅 [1080, 1920] 拆,字幕行会比升级前的「一句一条」更短。音频、segments 与整句的起止时码零变化。横屏成片请显式传 canvas: [1920, 1080]。

⚠️ 行为变更公告(2026-08-22):自 2026-08-22 起,subtitle_format 附赠的 .srt 字幕默认去除文本中的中英逗号句号(strip_punctuation 缺省 true),相同请求产出的字幕文本会与升级前不同;时码、行数、音频与 segments 等其余出参零变化。需要升级前的旧行为,请显式传 strip_punctuation: false。

  • 单次合成文本上限 5000 字。长文由服务端按句切分后逐句合成再拼接,无需自行分段;但越长耗时越久——最慢的引擎约 0.11 秒/字,5000 字要 9 分钟左右。
  • 长文本由服务端按句切分后逐句合成再拼接,无需自行分段;云引擎音色按句并行合成,长稿耗时约为串行的三分之一(阿里音色暂为串行)。
  • 相同参数(文本、音色、语速、格式)重复提交会命中合成缓存,直接返回上一次的音频(同一个 file_id),任务几乎即时完成、计费照常。想要一版新的演绎(合成有随机性,每次重合成都是新版本),传 "refresh": true 强制重新合成。
  • 字幕(subtitle_format)不额外计费:它由本次合成已有的句级时码直接生成,时码与音频严格一致(毫秒级,不做取整)。字幕先按 segments 断句(自研音色想在每个句末都断开,请一并传 text_split_method: "cut5";云引擎音色固定一句一段),再按 canvas 画幅把过长的句子拆成多行。
  • 字幕是附赠产物:万一生成失败(例如个别自研音色的句级时码本次不可用),任务仍会正常完成、音频照常返回,subtitle_file_id 为空串并在 errors.subtitle 里说明原因。
  • 句间停顿可调(fragment_interval):自研音色可按需收紧句与句之间的停顿。实测参考:一条 203 秒的解说里,约四分之一的时长是句间静音;把停顿调到 0.2 秒后,同一段稿子的成片缩到 171 秒。不传时跟随该音色调好的预设,产物与本参数上线前逐字节一致。
  • 云引擎音色不支持调节句间停顿:传了 fragment_interval 会直接返回参数错误(不建任务、不计费),而不是静默忽略——你不会拿到一条"看起来没变"的音频去反复猜。需要更紧的节奏,请改用同合云自研音色。
  • 仅可使用已授权且质检通过的音色(见「可用音色」)。
  • 标注「仅供内部成员使用」的音色需同合云内部成员身份,其他账号请求会返回参数错误(不会静默替换为其他音色)。

🤝 加入同和新媒体矩阵,解锁内部成员权益:矩阵成员(internal)可使用 custom 域全库素材检索(视频 / 图片 / 音频,含概念素材与非商用素材,支持仅可商用过滤)与内部专属音色。前往 创作者网络 申请加入,审核通过后管理员将为你开通内部权限。