标题:All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR

地址:https://arxiv.org/pdf/2512.11543

作者单位:日本NTT公司

发表日期:2025年12月12日

说明:Accepted to ASRU 2025

这篇是日本NTT团队的研究,核心诉求特别实在——现在做自动语音识别(ASR),要面对CTC、AED、Transducer三种主流模型,每种还得做“离线版”(比如录好的语音转文字)和“流式版”(比如实时会议字幕),开发、部署成本直接翻倍。他们就想搞个“万能模型”叫 All-in-One ASR ,把这些模型和模式全揉进一个里,参数省了还不丢性能,甚至更准。

01、背景:为啥非要搞“All-in-One”?

先说说现有ASR的“麻烦事”,端到端ASR有三类核心模型,各有擅长但也各有短板:
  • CTC:好训练,但语音和文本的对齐能力一般;
  • AED(注意力编码器-解码器):短语音识别超准,可长语音容易崩(依赖交叉注意力,上下文太长扛不住);
  • Transducer(论文里用的HAT模型,一种改进版):长语音稳得很,短语音却不如AED灵活。
更糟的是,要是想同时支持“离线”和“流式”,每种模型还得单独做两个版本——参数、开发、维护成本全翻倍,尤其在手机这种资源有限的设备上,根本扛不住。
之前也有解决方案:比如“双模式ASR”能把离线和流式揉成一个模型,但没解决“多模型范式”的问题;还有联合训练的方法,虽能共享部分模块,可每个模型的解码器还是要加额外参数,算起来又慢又费内存。
所以这篇论文要啃的“硬骨头”是: 不用单独做解码器,把CTC、AED、Transducer三种模型+离线/流式两种模式,全统一到一个模型里,参数要少、性能还得顶 。

02、基础准备:先搞懂“All-in-One”的“地基”

论文的核心地基是HAT(Hybrid Autoregressive Transducer),这是Transducer的改进版,主要由三部分组成(对应下图的整体架构),后面的 “All-in-One”全是在这基础上改的:
1. 核心三组件

  • 编码器(Encoder):把输入的语音特征(比如80维log Mel,窗口25ms、步长10ms)转成声学编码(Henc)。离线模式用全量上下文(比如Conformer用全自注意力,ConMamba用双向BiMamba);流式模式切成“块(chunk)”处理——Conformer用注意力掩码限制上下文,ConMamba改成“LC-BiMamba”(类似LSTM的块处理逻辑),保证实时性。
  • 预测器(Predictor):把文本token(论文用word-piece,TLv2词汇量500,LibriSpeech 1000)转成语言编码(Hpred),试了LSTM和Mamba两种,最后发现Mamba效果更好,还加了RMSNorm归一化。
  • 连接器(Joiner):把编码器的声学特征和预测器的语言特征“拼一起”,输出每个时间步的识别概率(比如“空白”概率和token概率)——这就是后面改造成“多模式”的关键。
2. 双模式ASR的思路
之前的“双模式”能把离线和流式参数统一,核心是训练时用“离线损失+流式损失”一起优化——切换模式只看编码器:离线用全上下文,流式用块处理,省一半参数。论文把这思路融进去,还解决了“多模型”的问题。

03、核心创新:多模式连接器(Multi-mode Joiner)

这是整篇论文最牛的地方!原来的HAT只有Transducer模式的Joiner,他们改成“多模式Joiner”(下图是它的内部结构),只要切换模式,就能模拟 HAT(Transducer)、AED、CTC、LM(语言模型)四种功能 ,还能变身Transformer解码器,所有模式共享参数,不用额外加太多参数。下面重点讲每种模式的实现:

(一)先细拆上图:每个模块都有明确分工
看着复杂,其实是“输入→可切换注意力→固定加工→输出”的逻辑,每个部分都对应ASR的核心需求:
1. 两个固定输入:语音和文本的“原材料”
  • 左边输入:Encoder Output(编码器输出) 这是语音的“声学特征”(比如Henc),在注意力里扮演“被查询的素材”——想预测“苹果”这个token,得从这些特征里找“哪个时间段对应‘苹果’的发音”,所以它会拆成 key(索引)和 value(具体特征),供后续匹配用。
  • 右边输入:Predictor Output(预测器输出)这是文本的“语言特征”(比如Hpred),扮演“主动找匹配的目标”——当前要预测第3个token,它就变成 query(查询词),去左边的语音特征里“问”:“哪个key和我最像?”
2. 核心可切换模块:两种注意力,对应两种模式
这是“多模式”的关键——靠换注意力计算方式,直接切换HAT和AED模式,不用改其他结构:
  • Multi-Head Sigmoid Attention(多头Sigmoid注意力)→对应HAT模式
    • 为啥用Sigmoid?因为HAT要支持“流式识别”(实时字幕),得逐帧算结果,不能等整段语音。Sigmoid注意力输出0-1的单值,每个“语音帧-token”对独立计算(比如第5帧和第2个token的权重,不管第6帧),算得快、能实时,实验里流式HAT的WER比单模式低(7.8% vs 8.5%),全靠它。
  • Multi-Head Softmax Attention(多头Softmax注意力)→对应AED模式
    • 为啥用Softmax?AED擅长“离线短语音”,需要精准对齐。Softmax会把所有语音帧的权重“归一化”(总和为1),能全局找最匹配的帧(比如“你好”对应第10-15帧,权重集中在这几帧),实验里离线AED的短语音WER比HAT好(9.9% vs 10.6%),就是它的功劳。
3. 固定“加工模块”:所有模式都离不开的“后处理”
不管哪种模式,注意力输出后都要走这两步,相当于“给特征抛光”:
  • Feed-Forward Module(前馈网络):对融合后的特征做非线性变换,提取更复杂的关联(比如区分“苹果”和“苹裹”);
  • LayerNorm(层归一化):稳定训练,避免特征值波动太大;
  • 输出层:用Linear(线性层)+ Sigmoid/Softmax输出概率——HAT的空白概率用Sigmoid(0-1),AED的token概率用Softmax(所有token概率和为1)。
4. 关键虚线块:能“变身”的核心替换点
图里有个虚线框,框住“Predictor(预测器)+ tanh(·)”——这是“变身Transformer解码器”的关键!原设计里,这个块的作用很简单:把预测器的语言特征用tanh(·)激活,再和注意力输出融合。但只要把它换成“掩码自注意力(Masked Self-Attention)+ LayerNorm”,整个连接器就直接变成“单层Transformer解码器”——因为:
  • 新换的“掩码自注意力”:处理文本内部依赖(比如预测“吃”时,看不到“苹果”,用掩码挡未来信息),对应Transformer解码器的“掩码自注意力”;
  • 原来的“Softmax注意力”:处理文本-语音对齐,对应Transformer解码器的“编码器-解码器交叉注意力”;
  • 后面的“前馈+归一化”:和Transformer解码器的前馈模块完全一样。 三件事凑齐,就和单层Transformer解码器一模一样了!不用单独搭AED的解码器,省大劲了。
(二)多模式连接器怎么实现其他模式?
除了HAT和AED,CTC、LM、TwA模式也靠这个连接器实现,逻辑超简单:
  • CTC模式:把预测器输出(H^pred)置零,Sigmoid注意力权重固定成0.5,相当于只靠编码器的声学特征预测,用CTC损失优化;
  • LM模式:把编码器的key/value置零,只靠预测器的语言特征预测,相当于内置轻量LM,用交叉熵损失优化;
  • TwA模式(Transducer with Attention):把HAT和AED的特征混在一起(tanh里加编码器特征),帮HAT和AED学好对齐,提升它们的性能,但自己识别效果一般,实验没重点测。
(三)流式 AED 的 “视线限制图”—— 不让它偷看未来语音
就干一件事:解决 “流式 AED 咋不看还没输入的语音帧”。

核心逻辑特简单:
  • 先拿 HAT 的对齐结果 :HAT 本来就擅长流式对齐,训练时能实时算出 “每个 token 对应哪几帧”(比如 “_he” 对应帧 2、“llo” 对应帧 3),不用额外训;
  • 把对齐结果变成 “掩码” :比如 “_he” 对应帧 2,那 AED 算它的注意力时,就只让看 “帧 1-2”(标色的能看),帧 3 及以后全挡住(不让偷看);“llo” 对应帧 3,就允许看 “帧 1-3”,后面继续挡。
这设计超实用:之前流式 AED 要靠 “触发词” 或 “标边界”,又麻烦又容易错,现在直接用HAT的对齐结果做掩码,又快又准——实验里流式AED的WER从 9.1%降到7.6%,这图的设计功不可没。
(三)注意力权重 “实拍图”—— 证明两种注意力真的适配场景

分离线 a、流式 b两部分,就看三个东西的对比:
  • HAT 的非空白概率:值越高,说明HAT觉得 “当前帧不是空白,对应某个 token”;
  • HAT 的 sigmoid 注意力权重:HAT 模式用的,看它跟非空白概率配不配;
  • AED 的 softmax 注意力权重:AED 模式用的,看它咋抓语音帧。
1)离线模式(图 a):
  • HAT 的 sigmoid 权重和非空白概率几乎重合,没冗余 —— 说明它抓帧很准;
  • AED 的 softmax 权重能全局找匹配帧(比如某个 token 对应好几帧,权重都集中在那)—— 符合离线看全量语音的需求。
2)流式模式(图 b):
  • HAT 的 sigmoid 权重有点小波动(毕竟上下文少),但还是能抓住关键帧;
  • AED 的 softmax 权重范围变窄(因为按 chunk 处理),只看当前块里的帧 —— 符合流式实时性;
  • 还能看到:语音快结束时,HAT 的权重会上升 —— 它能捕捉 “句末 token”,知道该停了,特别聪明。
这图直接证明:上图设计的两种注意力,真的能适配离线/流式场景,不是纸上谈兵。

04、训练和解码:怎么让多模式“协同工作”?

1. 联合训练:不偏不倚,所有模式“平起平坐”
之前的联合训练会指定“主解码器”,给它更高权重,但这篇论文不一样—— 所有模式都当“主模式” ,损失权重平等。只有LM特殊,损失乘0.1(实验发现LM权重太高会拉低ASR性能)。
总损失公式简化了说就是:L=Loffline(HAT+AED+CTC+TwA)+Lstreaming+ 0.1×LLM,而且是单阶段训练,不用分阶段调参,省了不少事。
2. 联合解码:取长补短,让识别更准
一个模型能输出多种模式的概率,解码时就“强强联合”。用“浅层融合(shallow fusion)”,把HAT、AED、外部LM的概率用“哈达玛积”(逐元素相乘)结合,再用超参数μ(权重,总和为1)和ρ(LM修正系数)调比例。实验发现加CTC的概率没帮助,所以最后只融了HAT、AED和外部LM。

05、实验:真的能省参数还提性能吗?

实验做得很扎实,用了TLv2(TED演讲)和LibriSpeech(有声书)两个数据集,看WER(词错误率,越低越好),重点测“参数规模”和“性能”的平衡。
1. 实验配置:关键细节不能漏
  • 输入和预处理:80维log Mel特征,用SpecAugment做数据增强;分词用word-piece,TLv2词汇量500,LibriSpeech 1000。
  • 模型结构 :
    • 编码器:17层Conformer(带自注意力)或12层ConMamba(无注意力,用Mamba模块),参数都控制在110M左右;
    • 预测器:2层512维LSTM或Mamba(Mamba加RMSNorm);
    • 流式配置:块大小20(对应400ms延迟,满足实时),Conformer缓存20帧历史数据。
  • 训练参数:Adam优化器,热身25k步,峰值学习率1.5e-3;TLv2训100轮,LibriSpeech训200轮;解码用beam size=8。
  • 外部LM:12层ConMamba encoder,把ASR编码器的卷积下采样换成embedding层,BiMamba换成单向Mamba,兼容流式解码。
2. 实验结果:关键表格和图表分析
(1)表1:单模式vs All-in-One(TLv2)——参数省了80%,性能还升了
单模式模型(每种模式一个,分离线/流式)参数快600M;带双模式的All-in-One(ConMamba版)只有 117.9M (不到1/5),但WER更好:

  • 离线HAT:All-in-One 6.8% vs 单模式6.9%;
  • 流式HAT:All-in-One 7.8% vs 单模式8.5%; AED、CTC也差不多,甚至略优——直接证明“省参数还保性能”不是吹的。
(2)表2:注意力头数对性能的影响(TLv2)——4头是“及格线”
图2的注意力是“多头”的,实验测了1、4、8、16个头:

  • 1个头:HAT模式崩了(离线WER 9.6%,流式10.8%)——单头Sigmoid抓不住复杂对齐,权重容易变0;
  • 4头及以上:WER稳定(8头和16头离线HAT都是6.8%)——所以最后选8头,平衡效果和计算量。
(3)表3:编码器/预测器类型+联合解码(TLv2)——ConMamba+Mamba是“黄金组合”

  • 编码器:ConMamba比Conformer好(ConMamba+Mamba离线HAT 6.8% vs Conformer+LSTM 6.9%)——Mamba能兼容多模式训练,Conformer甚至没收敛;
  • 预测器:Mamba比LSTM略好(ConMamba+Mamba离线AED 6.8% vs ConMamba+LSTM 7.0%);
  • 联合解码:融HAT和AED后,离线HAT从6.8%降到6.5%;加外部LM,直接降到5.9%,效果明显。
(4)表4:不同语音长度的WER(TLv2离线)——多模式互补的价值

  • HAT擅长长语音:20秒以上WER 6.2%,AED是8.4%;
  • AED擅长短语音:4秒以下WER 9.9%,HAT是10.6%;
  • 联合解码后:所有长度都降了(4秒以下到7.0%,20秒以上到5.9%)——完美补短板。
(5)表5:LibriSpeech测试集——结果和TLv2一致
LibriSpeech更通用,结果也验证了All-in-One的优势:

  • 单模式Mamba参数576.4M,流式HAT WER 3.2%/7.7%(干净/嘈杂);
  • All-in-One(ConMamba+Mamba)参数118.4M,流式HAT降到2.8%/6.7%,还更准;
  • 加联合解码和外部LM,离线HAT到2.0%/4.7%,行业高水平。

06、结论和未来计划

1. 核心贡献
  • 搞出All-in-One ASR框架,用“多模式Joiner”统一了CTC、AED、Transducer+离线/流式,不用额外加参数;
  • 实验证明:参数比单模式小80%,WER还更高,联合解码能补短板;
  • 验证了ConMamba和Mamba预测器特别适合“多模式统一”,比Conformer+LSTM效果好。
2. 未来计划
团队想把这个框架扩展到多说话人ASR、语音翻译、语音合成,从“ASR万能模型”变成“语音任务万能模型”。
简单说,这篇论文相当于给ASR做了个“压缩包”——以前要带好几个模型,现在一个就够了,还更轻、更准,对手机、嵌入式设备这种资源有限的场景特别友好,落地价值很高。