微信扫码
添加专属顾问
我要投稿
小米开源语音大模型MiMo-Audio,在多项基准测试中超越谷歌和OpenAI的闭源模型,展现强大性能。 核心内容: 1. 模型采用创新预训练架构,基于上亿小时数据训练 2. 首次实现语音领域少样本泛化能力,展现"涌现"行为 3. 在多个基准测试中超越同规模开源模型及闭源商业模型
模型名称
Xiaomi-MiMo-Audio,是小米新开源的第一个原生端到端语音大模型。
训练数据规模与预训练架构
用“上亿小时训练数据”进行预训练。
基于“创新预训练架构”。
少样本泛化 (Few-Shot / ICL) 与“涌现”行为
在语音领域首次实现了基于 ICL(in-context learning)的少样本泛化能力。
在预训练过程中观察到明显的“涌现”(emergent)行为。
后训练阶段还提升了智商、情商、表现力与安全性等跨模态对齐能力,以及语音对话的自然度、情感表达、交互适配性。
性能比较 / 基准测评
在多个标准评测中,MiMo-Audio 的表现如下:
开源情况与构成
MiMo-Audio 是开源模型。
开源内容包括:无损压缩的 Tokenizer,全新模型结构,训练方法和评测体系。
支持混合思考(“Thinking”)方式同时应用于语音理解和语音生成过程。
7B 参数量
在同参数量级(7B)中,MiMo-Audio 是最优表现者。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-11-08
GitHub 53k Stars!百度开源的OCR神器,支持80+语言,准确率碾压商业方案!
2025-11-08
别只盯着 DeepSeek,重复输入提示词啦!Kimi 王炸发布 K2 推理模型,能力强大,还支持常用语
2025-11-07
短短几天斩获 17k Star,这个基于 AI 的舆情分析开源项目火了!
2025-11-07
Dify你不知道的秘密:解锁AI应用开发的四大核心技术
2025-11-07
最强开源0.9B级OCR模型!PaddleOCR-VL本地一键部署,私密性拉满【喂饭级教程】
2025-11-07
阿里开源SmartResume,简历解析无需手工
2025-11-06
把任何文档变成Claude的新技能,这个开源工具火了。
2025-11-06
首个AI商业广告工作流开源,我做出了可口可乐最有创意的广告
2025-08-20
2025-09-07
2025-08-20
2025-08-26
2025-08-22
2025-09-06
2025-10-20
2025-08-22
2025-09-08
2025-10-27
2025-11-03
2025-10-29
2025-10-28
2025-10-13
2025-09-29
2025-09-17
2025-09-09
2025-09-08