免费POC, 零成本试错
AI知识库

53AI知识库

学习大模型的前沿技术与行业应用场景


小米开源首个原生端到端语音大模型 MiMo-Audio

发布日期:2025-09-23 06:43:39 浏览次数: 1558
作者:开放智能AI

微信搜一搜,关注“开放智能AI”

推荐语

小米开源语音大模型MiMo-Audio,在多项基准测试中超越谷歌和OpenAI的闭源模型,展现强大性能。

核心内容:
1. 模型采用创新预训练架构,基于上亿小时数据训练
2. 首次实现语音领域少样本泛化能力,展现"涌现"行为
3. 在多个基准测试中超越同规模开源模型及闭源商业模型

杨芳贤
53AI创始人/腾讯云(TVP)最具价值专家
  • 模型名称
    Xiaomi-MiMo-Audio,是小米新开源的第一个原生端到端语音大模型。 

  • 训练数据规模与预训练架构

    • 用“上亿小时训练数据”进行预训练。 

    • 基于“创新预训练架构”。 

  • 少样本泛化 (Few-Shot / ICL) 与“涌现”行为

    • 在语音领域首次实现了基于 ICL(in-context learning)的少样本泛化能力。 

    • 在预训练过程中观察到明显的“涌现”(emergent)行为。 

    • 后训练阶段还提升了智商、情商、表现力与安全性等跨模态对齐能力,以及语音对话的自然度、情感表达、交互适配性。 

  • 性能比较 / 基准测评

    在多个标准评测中,MiMo-Audio 的表现如下:

    基准 / 测试集
    比较对象
    结果
    通用语音理解及对话多个任务 / 开源模型
    同参数量开源模型
    MiMo-Audio 大幅超越,取得 (约) 7B 参数模型的最佳性能。 
    音频理解基准 “MMAU” 标准测试集
    Google 闭源语音模型 Gemini-2.5-Flash
    MiMo-Audio 超过该模型。 
    音频复杂推理任务 “Big Bench Audio S2T”
    OpenAI 闭源语音模型 GPT-4o-Audio-Preview
    MiMo-Audio 也超越。 
  • 开源情况与构成

    • MiMo-Audio 是开源模型。 

    • 开源内容包括:无损压缩的 Tokenizer,全新模型结构,训练方法和评测体系。 

    • 支持混合思考(“Thinking”)方式同时应用于语音理解和语音生成过程。 

  • 7B 参数量

    • 在同参数量级(7B)中,MiMo-Audio 是最优表现者。



53AI,企业落地大模型首选服务商

产品:场景落地咨询+大模型应用平台+行业解决方案

承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业

联系我们

售前咨询
186 6662 7370
预约演示
185 8882 0121

微信扫码

添加专属顾问

回到顶部

加载中...

扫码咨询