刚刚,小米正式开源首个原生端到端语音模型Xiaomi-MiMo-Audio,该模型参数规模70亿,预训练数据达到超1亿小时,且在开源模型中的语音智能和音频理解基准测试中都实现了SOTA,在多项测试超越同参数量开源模型、谷歌Gemini-2.5-Flash、OpenAI GPT-4o-Audio-Preview。

这一模型不仅可以做到和用户聊人生理想、谈物理知识等都对话流畅自然,被打断也能快速反应,还具有全面的音频字幕、音频推理、长时间音频理解等多种能力。
MiMo-Audio说天津方言十分自然,直接写了一段快板词开始夸自己,说完快板还会为自己找补“虽然没有主板声音,但节奏感很到位”。
与此同时,研究人员还提到,该模型首次在语音领域实现基于ICL(上下文学习)的少样本泛化,并在预训练观察到明显的“涌现”行为。例如其训练数据中缺失的语音转换、风格迁移、语音编辑等任务,MiMo-Audio都能应对。这也是目前开源领域首个有语音续写能力的语音模型。
小米将MiMo-Audio的发布称作“语音闭源届的GPT-3时刻”、“语音开源届的Llama时刻”。
目前,小米已经开源了预训练模型MiMo-Audio-7B-Base、指令微调模型 MiMo-Audio-7B-Instruct、MiMo-Audio Tokenizer模型、技术报告、评估框架。
其中,MiMo-Audio-7B-Instruct可通过提示词切换非思考、思考两种模式,可以作为研究语音强化学习和Agentic训练的全新基座模型。

Xiaomi-MiMo-Audio 主要贡献如下:

  • 首次证明把语音无损压缩预训练 Scaling 至 1 亿小时可以“涌现”出跨任务的泛化性,表现为 Few-Shot Learning 能力,见证语音领域的 “GPT-3 时刻”


  • 首个明确语音生成式预训练的目标和定义,并开源一套完整的语音预训练方案,包括无损压缩的 Tokenizer、全新模型结构、训练方法和评测体系,开启语音领域的“LLaMA 时刻”


  • 首个把 Thinking 同时引入语音理解和语音生成过程中的开源模型,支持混合思考

技术、模型、评估均开源

模型

  • 预训练模型MiMo-Audio-7B-Base:是目前开源领域第一个有语音续写能力的语音模型

https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Base

  • 指令微调模型MiMo-Audio-7B-Instruct:经过轻量级的 SFT,7B 参数规模最强语音理解和生成模型

https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Instruct

MiMo-Audio-7B-Instruct 可通过 prompt 切换 non-thinking、thinking 两种模式,强化学习(RL)起点高、潜力足,可以作为研究语音 RL 和 Agentic 训练的全新基座模型。

Tokenizer

开源了 MiMo-Audio 的 Tokenizer 模型:

  • 1.2B 参数量,Transformer 架构,兼顾效率与性能

  • 从头开始训练,覆盖超过千万小时语音数据

  • 同时支持音频重建任务和音频转文本(A2T)任务

Tokenizer 高效实现的推理代码如下:

https://github.com/XiaomiMiMo/MiMo-Audio-Tokenizer

技术报告

MiMo-Audio 技术报告已公开,全面展示了模型和训练细节:

https://github.com/XiaomiMiMo/MiMo-Audio/blob/main/MiMo-Audio-Technical-Report.pdf

评估框架

提供了一套完整的语音模型预训练 ICL 测评、后训练评估框架,支持 10+ 测评任务,已开源至 GitHub。

https://github.com/XiaomiMiMo/MiMo-Audio-Eval