阿里两款千问语音新模子齐发:生物也能“原声”说人话了,
2025-12-24 17:31:40
12月24日消息,阿里今日升级语音模型家族Qwen3-TTS,发布音色创造Qwen3-TTS-VD和音色克隆Qwen3-TTS-VC两款全新模型。
在生成效果上,全新模型的表现显著超越GPT-4o。
Qwen3-TTS新模型可实现DIY声音设计和像素级音色模仿,甚至让动物“原生”开口说人话。
其音色自然、效果稳定、生成高效,可大大加速语音大模型在有声小说、AI漫剧、影视配音等多专业领域落地。
其中,音色创造模型支持通过自然语言描述生成定制化的音色形象,具有极强的可控生成能力。
在指令遵循评测InstructTTS-Eval中,Qwen3-TTS综合表现显著优于GPT-4o-mini-tts、Mimo-audio-7b-instruct等同类模型。
在强调表达一致性与沉浸感的角色扮演测试中,模型整体效果超过Gemini-2.5-pro-preview-tts。

音色克隆模型则专注于“音色模仿”,仅需3秒的语音样本,即可精准复刻原始声线。
在MiniMax TTS Multilingual Test Set测试集中,Qwen3-TTS-VC显示出其在多语言语音准确性与稳定性方面的优势。
它的平均词错误率(WER)指标上表现突出,整体结果全面优于 MiniMax、ElevenLabs 以及 GPT-4o-Audio-Preview。

此外,Qwen3-TTS-VC 还可自动生成英文、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语等9种语音。
值得注意的是,它连动物音色也能复刻,只需录入家中宠物的原始声音,就能用模型让它“开口说人话”。
目前,两款模型均在阿里云百炼平台上架Flash版本API,响应速度极快,可完全满足工业级语音合成需求。
千问语音生成模型系列Qwen3-TTS仍在不断升级,目前可支持50种音色,10大主流语言和闽南语、吴语、粤语、四川话、北京话、南京话、天津话、陕西话等8大方言,可真实还原地方口音特色与语言神韵。

相关阅读
-
AIBase厦门GEO优化:让AI成为你的首席推荐官深度解读 2026-06-22 15:12:32
-
“女大先生凭‘笨笨的心爱’画作火爆,萌青蛙销量突破20万”深度解读 2026-06-22 15:06:46
-
电视家怎么开启活动优惠?电视家开启活动优惠方法资讯百科 2026-06-22 14:59:33
-
深入解析BYTV跳转接口点击进入网页的直播视频软件应用深度解读 2026-06-22 14:52:23
-
国产湾流公务机正式运营:首架自研机型尚未获得欧美适航证金融科技前沿 2026-06-22 14:48:21
-
全新抱负L8家用SUV:李想揭示温馨与操控的完美结合金融科技前沿 2026-06-22 14:42:27
-
优酷怎么注销账号?优酷注销账号方法资讯百科 2026-06-22 14:42:13
-
姜超回应红魔游戏平板5 Pro延期原因:水冷与屏幕技术难题分析金融科技前沿 2026-06-22 14:36:06
-
天玑9600 Pro单价突破216美元,安卓旗舰手机即将涨价金融科技前沿 2026-06-22 14:30:35
-
探索国产最好的高清播放机品牌:提升你的视听体验深度解读 2026-06-22 14:25:15