时代财经APP
时代财经APP

立即扫码下载

随时获取最新资讯

时代财经微信

立即扫码关注

随时获取最新资讯

时代财经APP

企业第一财经读本

时代财经APP

“天才少女”罗福莉带队登顶开源榜,小米18 Pro系列率先搭载,为什么小米非要重金“砸出”自己的大模型?

作者:赵姝婵 庞宇 2026-09-23 21:27

347万美元、6天训练,换来了全球开源第一的入场券。但入场券也只是开始,从“评测第一”走到“用户觉得好用”,从“开源领先”走到“商业闭环”的路还有很长。

9月23日晚,小米18 Pro系列正式发布。最受关注的AI能力,来自由Xiaomi MiMo大模型驱动的超级小爱2.0:它通过了首个全生态系统级智能体认证,支持一键记忆、自主思考、复杂执行,还能跨设备互通,在平板、PC上直接处理手机数据。

而支撑这款智能体的底座大模型MiMo,刚在前一天发布了最新版本。

图源:小米官方

9月22日,小米正式发布大模型MiMo-V2.6。据测评平台Artificial Analysis综合智能指数榜单显示,XiaomiMiMo-V2.6-Pro以46分的成绩登顶全球开源大模型第一、国产模型第一,得分超越Kimi-K3、Qwen3.8-Max。

MiMo大模型团队负责人罗福莉在社交平台上开启近12小时超长直播,全程展示模型强化学习和训练过程。

这款被官方称为“全球开源领域唯一全模态Pro模型”的背后,是一个加入小米不足一年的95后“天才科学家”和一场600亿的AI投入。通过采访多位行业专家、接近小米系企业的业内人士,结合罗福莉公开发言,时代财经试图回答一个问题:小米为什么非要重金砸出自研大模型?

低成本、全模态、全面开源

要理解这次登顶的意义,首先需要看懂 MiMo‑V2.6‑Pro 本身的产品、技术特性。

据小米官方资料,MiMo-V2.6 Pro是全球开源领域唯一的全模态Pro模型——能够同时处理文本、图片、视频和音频四种模态。在多个权威评测榜单中,Pro版在多项任务上达到或超越OpenAI、Google和Anthropic的同代模型水平。

更关键的是参数效率。训练报告显示,MiMo-V2.6在参数量与前代不变的前提下,实现了智能水平的代际跃升。也就是说,同样的“体量”,能力翻倍。

背后的原因是训练方法的改变。报告中Pro版的强化学习(RL)后训练仅用时6天,使用约75万条真实任务轨迹,总训练成本为347万美元,其中Flash版本为85万美元,Pro版本为262万美元,每天烧掉约400万元人民币。而同等性能水平的海外前沿模型通常需要20至60倍的成本投入。

同济大学电子与信息工程学院副教授李王明卉向时代财经表示,这个数字真正值得说的,不是“便宜”,而是它把大模型的强化学习后训练变成了“可计量的服务能力”。她指出,这个价格“能否持续”的答案不在预算,而在环境成本能不能被摊薄,“如果环境搭建、工具执行、结果验证的边际成本继续非线性上升,347万美元就只是一次漂亮的标杆;如果这些异构环境能被工程化、标准化、复用化,它就会变成一种新的服务定价范式。”

李王明卉所讨论的训练范式能否落地,很大程度取决于团队的工程与科研能力。而小米这套RL(强化学习)训练范式的主导者,正是加盟小米不足一年的罗福莉。

罗福莉的技术路线和半年答卷

近日,MiMo大模型团队负责人罗福莉在社交平台开启近12小时直播,完整对外展示模型强化学习的全过程,这也是她加入小米后,首次公开回应外界对MiMo大模型的技术关注。直播中她直言:“沉默近半年,我们一直在用这段时间研究一个问题:强化学习(RL)到底可以走多远。”

公开资料显示,1995年出生的罗福莉,本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言研究所计算语言学专业,后任职阿里巴巴达摩院算法专家、DeepSeek核心研究员。2025年11月正式加盟小米,全面负责MiMo大模型业务。外界将她称为“天才少女”,对于这个称呼,罗福莉曾在朋友圈坦言:“我不是天才少女,被捧得多高,摔得多重。”

强化学习路线正在被验证为有效路径。据公开信息,OpenAI在今年也大幅提升了RL在模型训练中的权重,这与罗福莉团队押注的技术方向一致。

罗福莉的公开帖文中提到,在开源模型阵营中,如果以计算量衡量,MiMo‑V2.6是规模最大的单次强化学习模型。在算力资源紧缺的现状下,几十人团队长期聚焦于强化学习方向,既需要科研信念,更离不开攻坚克难的勇气。该模型在训练中期挖掘潜力,再通过强化学习释放能力,最终登顶开源模型榜单。在她看来,MiMo‑V2.6背后的研究创新与工程难度,甚至超过自己曾参与部分工作的DeepSeek R1。

针对行业关注的MixRL(混合强化学习)与MOPD(多教师在线策略蒸馏)的技术路线之争,罗福莉解释二者并非对立。团队在代码、智能体等中等难度可验证任务上使用MixRL,收获了优异的泛化效果;而在长周期、高难度、难以核验的任务上,则单独训练后,再通过MOPD整合能力,避免拉低推演效率、产生过拟合。

她半开玩笑地提到,小米团队架构扁平,没有厚重的组织壁垒,落地MixRL的阻力很小,跨领域成员紧密协作,直面各类强化学习瓶颈,密集的每日研讨会议见证了模型能力的实时涌现。

生态越大,自研越贵,不做的代价更大

依靠这套强化学习的工程与科研能力,MiMo拿到了开源榜单的头部位置。但技术跑分之外,更值得讨论的问题是:对以硬件为根基的小米而言,为什么必须自研基础大模型,而不是直接采购第三方成熟模型?

核心答案或许藏在小米的全场景硬件生态与技术战略布局中。

到2026年,小米的业务版图已经覆盖手机、汽车、智能家居三大消费硬件生态。AI能力正在渗透到每一条产品线——从手机端的智能助手,到汽车端的智能座舱,再到智能家居的场景联动。如果这些产品的AI能力全部依赖外部模型,意味着小米把最关键的技术层交给了别人。

据公开数据,小米未来三年计划在AI相关业务投入不低于600亿元,这笔资金将投向AI全链条。今年7月,小米对AI相关业务完成一轮内部组织架构调整:AI技术链路被拆分为基座模型层、云端工程层、端侧能力层;其中基座模型层由MiMo团队负责,端侧能力下沉到手机、汽车等各终端业务线。调整的核心逻辑,是将基础模型打造为集团统一AI底座,向全集团各产品线输出AI能力。

一位接近小米生态链企业的人士向时代财经透露,在MiMo-V2.6发布之前,金山云、金山办公等雷军相关企业已在密切关注小米模型的进展。“这些企业本身就有大量的AI调用需求,现在采取多模型模式,但MiMo模型一旦成熟,token消耗量自然是能起来的。”随着小米自有大模型逐步走向商用,“生态内优先适配MiMo,是大概率的事”。

同济大学电子与信息工程学院副教授李王明卉告诉时代财经, MiMo-V2.6开源的核心价值,不在于公开模型权重,而是对外释放了一套完整的硬件适配运行体系。

“小米把手机、车机、家居设备在算力、时延、连接质量、传感器噪声上的巨大差异,一并暴露给了训练系统。”在她看来,小米庞大的终端生态是一座天然的异构RL环境生成器,让模型跳出理想实验室环境的最优解,学会在存在网络抖动、设备断连等突发状况的真实场景中稳定完成任务,这也是MiMo模型实用性突出的原因。

不过,优秀的数据并不等同于终局。深耕大模型领域的从业者刘文松(化名)告诉时代财经,在亮眼的开源成绩之下,小米大模型的发展仍面临不容忽视的行业风险与挑战。

首先,榜单跑分第一不等同于实际体验最优,评测数据与真实用户场景体验存在明显差距。多位业内人士坦言,在超长链路逻辑推理、复杂专业运算等高阶任务中,GPT-5、Claude4.5等闭源顶级模型依旧保持绝对领先优势,MiMo的综合能力仍有追赶空间。

其次,行业技术竞争日趋白热化,国内MiniMax、智谱、月之暗面等头部AI企业均在加码强化学习技术,纷纷对标前沿RL赛道,小米当前的差异化技术优势窗口期正在不断缩短,能否持续维持技术领先性仍未可知。

李王明卉也表示,从分布式调度的角度看,中国AI公司在算力利用率上的提升空间,在于让分散、异构、跨域的算力在调度器眼里不再被当成同质资源。她指出,当前很多调度器的隐含假设是“GPU小时等价”,但同样一块GPU在不同场景下的有效产出可能差出数倍,调度目标应从“最小化完成时间”转向“最大化有效算力价值”。

罗福莉说,她想知道“强化学习到底可以走多远”。刘文松认为,这个问题,或许现在是小米自己的问题。347万美元、6天训练,换来了全球开源第一的入场券。但入场券也只是开始,从“评测第一”走到“用户觉得好用”,从“开源领先”走到“商业闭环”的路还有很长。

文章来源:时代财经 编辑:时代财经