在最新发表在Nature上的一项研究中,特温特大学(University of Twente)与 IBM Research Europe、丰田汽车欧洲公司(Toyota Motor Europe)合作,提出了一种新型“物理计算”语音识别方法。这项工作由 Wilfred van der Wiel 教授及其同事主导,展示了如何通过材料本身的物理特性来实现语音处理,而无需依赖高功耗处理器或复杂的软件堆栈。


随着物联网、自动驾驶和个性化医疗等应用的发展,边缘设备(edge devices)对低功耗、低延迟的本地信号处理需求不断增加。然而,传统的语音识别系统依赖数字处理链:声音信号需要经历模数转换、傅里叶变换及复杂的特征提取,再交由大型神经网络分类。这一过程受制于冯·诺依曼瓶颈以及多重域转换,难以在低功耗条件下于边缘端高效运行。

方法与架构

研究团队提出的解决方案是结合两类新兴的物理计算硬件:

1.可重构非线性处理单元(Reconfigurable Nonlinear Processing Unit, RNPU)


RNPU 室温下的可调非线性与短时记忆表征图。图片来源:Adapted from Zolfagharinejad, M., et al. (2025). Analogue speech recognition based on physical computing. Nature.https://doi.org/10.1038/s41586-025-09501-1. Fig.2

  • 灵感来源于人耳耳蜗,能够在模拟电路中直接对时域信号进行非线性分解与压缩。

  • 通过掺杂硅结构形成的复杂能量景观和电荷传输机制,使其表现出频率选择性、压缩非线性与短时记忆特性。

  • 在毫秒尺度上可实现类似耳蜗毛细胞的动态响应,将原始音频信号转化为低维度但信息丰富的特征表示。

  • 每次推理仅消耗约300 nJ,远低于数字滤波器或神经网络前端处理所需的能量

2.模拟存内计算(Analogue In-Memory Computing, AIMC)芯片

AIMC 芯片与 CNN 映射架构图。图片来源:Adapted from Zolfagharinejad, M., et al. (2025). Analogue speech recognition based on physical computing. Nature.https://doi.org/10.1038/s41586-025-09501-1. Fig.4
  • 基于 IBM “HERMES” 项目的相变存储器(PCM)交叉阵列,能够在存储阵列中直接执行矩阵–向量乘法,从而避免传统处理器频繁的存取开销。

  • 在实验中被用于实现卷积神经网络(CNN)分类器,承担语音识别中的后端分类任务。

  • 单次推理的能耗约78 µJ,延迟小于0.35 毫秒,未来优化后有望降至 10 µJ 的级别。

接近软件的识别精度
研究团队将 RNPU 与 AIMC 结合,构建了端到端的硬件语音识别流水线,并在两个数据集上进行了验证:
  • TI-46-Word 数据集(口语数字识别):全硬件系统达到96.2%的准确率,仅比软件 CNN 模型低约 2 个百分点。

  • Google Speech Commands(关键词识别):实现89.3%的准确率,接近全软件系统的92.4%水平,若采用带 Swish 激活函数的 6 层 CNN,RNPU 预处理后准确率可提升至 93.1%,且计算量减少一半以上。


RNPU 预处理前后的 t-SNE 可视化对比图。图片来源:Adapted from Zolfagharinejad, M., et al. (2025). Analogue speech recognition based on physical computing. Nature.https://doi.org/10.1038/s41586-025-09501-1. Fig.3
更值得注意的是,RNPU 预处理不仅降低了分类复杂度,还能通过非线性失真和短时记忆特性,使同类语音样本在特征空间中形成更加紧密的聚类,从而简化后续分类。这种机制与对比学习(contrastive learning)中的特征分布重组颇为相似,但其实现方式是基于材料本身的物理动力学,而非软件优化。
能效与集成优势

在系统级别的评估中,RNPU 与 AIMC 结合的架构在能效上大幅优于当前主流数字方案:

  • 能效:RNPU单通道静态功耗仅 1.9 nW,64 通道并行也仅需 320 nW;单次特征提取推理能耗约 300 nJ,远低于数字滤波器或神经网络前端处理所需能量。

  • 面积:每个 RNPU 通道仅占约 1 µm² 硅面积,远小于传统 CMOS 滤波电路。

  • 延迟:RNPU 实时运行,不引入额外延迟,AIMC 分类器延迟不足 0.5 毫秒。

  • 系统指标:整体能量–延迟乘积比现有 22 nm 工艺的语音识别专用芯片高效约 8.5 倍。


RNPU 功率测量电路与数据图。图片来源:Adapted from Zolfagharinejad, M., et al. (2025). Analogue speech recognition based on physical computing. Nature.https://doi.org/10.1038/s41586-025-09501-1.Extended Data Fig. 7
由于 RNPU 和 AIMC 均能在室温下工作,且基于硅工艺制造,其工艺具备与现有半导体制造兼容的潜力。

研究人员指出,这一方法不仅适用于语音识别,还可推广至其他时序信号处理任务,包括视频流分析、心电与脑电信号分类以及环境传感器数据处理等。目前 RNPU 与 AIMC 仍处于分立器件阶段,未来可通过异质集成实现更高程度的硬件整合。

总 结

该研究展示了一种基于物理计算的新型语音识别架构,结合了模拟特征提取与存内分类。在保持较高识别准确率的同时,显著降低了功耗与延迟,为边缘设备的高效时序信号处理提供了一条新的途径。

论文信息:Wilfred G. van der Wiel, Analogue speech recognition based on physical computing,Nature(2025).DOI: 10.1038/s41586-025-09501-1.www.nature.com/articles/s41586-025-09501-1