语音克隆、指令驱动语音合成、语音编辑、语音增强、语音分离...如果你最近关注过语音模型,这些能力大概率分散在多个不同的模型里。
而腾讯混元最新开源的 AuK,把生成和编辑这一整条能力链,塞进了一个统一框架,并通过少步蒸馏得到了推理加速版本 AuK-Flash。AuK 不只是"能做多件事",而是在多个不同任务的公开 benchmark 上,把此前各自领域的最优成绩一并刷新了。

图1:Auk(图中深蓝色)与Auk-Flash(图中浅蓝色) 在公开评测集上与先前最强任务专用模型的性能对比。
(b) 图中柱高表示编辑准确率,(c) 图中 DNSMOS-OVRL(较暗,左)和UTMOS(较亮,右)表示感知质量。
- 在生成能力方面,对于零样本语音克隆,Seed-TTS-Eval 三项子集取平均,AuK 的 WER 干到 2.65%,SIM 拉到 0.795,力压 Seed-TTS、Qwen3-TTS、VoxCPM2 多个先前最强的语音合成模型;对于指令驱动语音合成,在描述性风格指令的指令遵循准确率上达到了 82.49%,超过 MOSS-VoiceGenerator、Qwen3-TTS-VoiceDesign 等模型。这证明 AuK 能生成更高质量、更生动拟人的语音。
- 在编辑能力方面,AuK 与 AuK-Flash 在先前最困难的音频编辑评测集 MMAE 的语音子集上刷新了精确匹配正确率 (Exact Match Rate, EMR) 的记录,分别达到了 12.44% 和 13.85%,而先前的模型 Ming-UniAudio 与 Step-Audio-EditX 分别只能做到 7.04% 与 4.69%;在 SpeechEditBench 和 Ming-Freeform-Audio-Edit 上,AuK 的准确率也稳定优于已有模型。
- 而对于语音增强、语音分离任务,AuK 和 AuK-Flash 则获得了更高的 UTMOS 与 DNSMOS-OVRL 评分,这说明它们增强后或分离后的音频更为纯净,实打实超过了此前各条赛道上的最优系统。
当然,数字再好看,也不如亲耳听一段下面的 Demo 看看能力。
💡统一能力从哪来?数据、架构与训练链路
一个模型同时干生成和编辑等多种任务,听起来像把几条不相干的 pipeline 硬缝在一起。AuK 的解法不是"缝",而是从数据和架构的底层重新设计,让生成和编辑天然共享同一套逻辑。
数据侧:用一句指令统一所有任务
AuK 的数据格式很简单——一句自然语言指令、一段可选的输入音频、一段目标波形。所有任务,不管是生成新语音、编辑已有语音、降噪还是分离,都用同一套三元组来表达。最终构成了约 30.3 亿条指令与目标的配对样本。
架构:语义理解 + 声学生成,两路分工
数据统一了,架构怎么接?AuK 分了两路走:

图2:AuK 的架构概览
语义侧,是一个基于多模态大模型,同时读取文字指令和输入音频。它的任务只有一个:理解"改哪里、怎么改"。不管是"把西兰花改成生菜"还是"用更开心的语气再说一遍",语义侧都能根据将不同任务的自然语言指令转为语义信息丰富的隐状态,服务于声学侧进行后续的生成与编辑。
声学侧,由 MMDiT 与 DiT 结构组成,基于语义侧的信息,在统一的音频 VAE 空间里生成波形。关键点在于"统一"——生成和编辑不是两个不同的解码器,而是同一个声学空间里的不同操作。
后训练:编辑靠人耳对齐,生成靠自动打分
预训练之后,AuK 还做了两轮后训练,但生成和编辑走了不同的路。
编辑侧更依赖主观判断——一段语音编辑得好不好,人耳一听就知道。所以这里用了人工标注的偏好数据做对齐,让模型的输出更符合人的听觉直觉。
生成侧则更在意客观指标——内容对不对、音色像不像、风格一不一致。AuK 用了一套自动打分体系:ASR 验内容、声纹验证验音色、自研的风格一致性模型验整体听感。两轮强化学习下来,编辑的准确性和生成的逼真度同时往上提。
AuK-Flash:4.5 倍加速,能力不掉线
完整版模型推理成本不低。团队通过两阶段少步蒸馏,得到了 AuK-Flash——推理速度提升 4.5 倍,同时保持了接近原模型的能力,甚至在语音增强、语音分离、语音超分的评测集上的 DNSMOS-OVRL 和 UTMOS 超越了原模型。对于需要快速响应的场景,Flash 版本是个更务实的选择。
一个贴心的设计:指令改写
AuK 在推理前加了一个指令改写模块:由大语言模型先判定用户的口语请求对应哪种任务类型,再把指令修饰成模型更熟悉的形式。相当于给模型配了一个"翻译",帮它把用户的大白话翻译成内部工作语言,实打实地解放模型的能力上限。
📎相关地址
- 演示页面:https://auk-project.github.io/
- HF Space:https://huggingface.co/spaces/tencent/AuK
- ModelScope Studio:https://modelscope.cn/studios/Tencent-Hunyuan/AuK
- 技术报告:https://arxiv.org/abs/2609.08936
- GitHub:https://github.com/Tencent-Hunyuan/AuK
- Hugging Face:
- ModelScope:
