
MiMo仅用7B的参数规模,超越了OpenAI o1-mini和QwQ-32B-Preview。
国内外AI竞争日趋白热化,本周阿里前脚发布Qwen 3,马斯克后脚就官宣Grok 3.5。今天,小米开源首个为推理(Reasoning)而生的大模型Xiaomi MiMo,联动预训练到后训练,全面提升推理能力。在数学推理(AIME 24-25)和 代码竞赛(LiveCodeBench v5)公开测评集上,MiMo 仅用 7B 的参数规模,超越了 OpenAI 的闭源推理模型 o1-mini 和阿里 Qwen 更大规模的开源推理模型 QwQ-32B-Preview。
据小米介绍,Xiaomi MiMo诞生之初探索的核心问题就是激发模型推理潜能,下面是技术报告中的一些技术点。
预训练阶段:
数据预处理优化:改进文本提取工具包,应用多维数据过滤以增加预训练数据中的推理模式密度。
合成推理数据生成:利用高级推理模型生成多样化的合成推理数据。
三段式数据混合策略:将预训练数据分为三个阶段,逐步增加数学和编程相关数据的比例,最终达到约25万亿个令牌。
多令牌预测(MTP):作为额外的训练目标,增强模型性能并加速推理。
后训练阶段:
监督微调(SFT):使用开源和专有蒸馏数据,经过三重预处理管道,最终得到约50万个样本。
RL数据收集:收集13万个可验证的数学和编程问题,进行细致的清理和难度评估。
测试难度驱动的奖励函数:根据测试用例的难度分配不同的分数,使策略能够通过密集的奖励信号更有效地优化。
易数据重采样策略:在RL训练的后期阶段,通过从易数据池中采样数据来提高采样效率并稳定策略更新。
RL训练框架:
无缝展开引擎:通过连续展开、异步奖励计算和提前终止来加速RL训练和验证,分别实现了2.29倍的训练速度和1.96倍的验证速度。
基于vLLM的推理引擎:支持MTP并增强推理引擎的鲁棒性。
而据此前报道,小米正在建设万卡GPU集群,规模较其大模型团队成立时的约6500张GPU大幅增加。之后更是传出,小米创始人雷军以千万年薪招揽DeepSeek开源大模型DeepSeek-V2的关键开发者之一罗福莉,领导小米AI大模型团队。
公开资料显示,罗福莉本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言学专业。2019年,还在北大读硕士的她在人工智能领域顶级国际会议ACL上发表8篇论文(其中2篇一作),登上了知乎热搜。
这显示出小米对大模型领域的全面投入。在AI团队建设方面,小米自2016年组建AI团队以来,经过多次扩展,相关领域人员规模已达3000多人。
而在今年两会期间,全国人大代表,小米集团创始人、董事长兼CEO雷军围绕人工智能产业的高质量发展,带来了《关于加快推进人工智能终端产业高质量发展的建议》《关于加强“AI换脸拟声”违法侵权重灾区治理的建议》等建议。
3月18日,小米发布2024年财报,宣布全年研发投入达241亿元,同比增长25.9%。而更引人瞩目的是,小米集团CEO雷军与总裁卢伟冰密集表态:2025年小米研发投入将突破300亿元,其中四分之一(约75亿元)直接投向AI领域,未来五年(2022-2026年)总研发投入更将超过1000亿元。这一战略标志着小米正以“技术立业”为核,加速构建从智能手机、智能汽车到全屋智能的AI全生态版图。
自2021年提出“五年千亿研发计划”以来,小米的研发投入持续攀升。财报数据显示,2024年小米研发投入占比已提升至总营收的6.8%,远超行业平均水平。据雷军在2025年2月的小米15 Ultra发布会上透露,未来五年1050亿元的研发预算中,AI算法、芯片及终端应用成为重点方向。卢伟冰进一步解释称,小米的AI战略聚焦“轻量化与本地化部署”,旨在将大模型能力融入手机、汽车等终端,提升用户体验。
分析人士指出,小米的“百亿级AI投入”不仅为技术突破提供弹药,更可能带动国产AI产业链的协同发展。
可以预见,随着AI技术向制造业、服务业渗透,小米的“人车家全生态”或将成为中国AI落地的重要试验场。而在这场全球科技竞逐中,小米能否以“技术立业”实现从跟随者到引领者的蜕变,仍需时间检验。
*声明:本文系原作者创作。文章内容系其个人观点,我方转载仅为分享与讨论,不代表我方赞成或认同,如有异议,请联系后台。
想要获取半导体产业的前沿洞见、技术速递、趋势解析,关注我们!