2026年7月16日,小米技术正式发布 Xiaomi-Robotics-1,一个基于10万小时真实世界操作数据预训练的具身基座模型(Embodied Foundation Model)。这并非一款可以购买的人形机器人硬件,而是一个「开箱即用」的机器人策略模型——它能让不同形态的机器人看懂环境、理解自然语言指令,并直接执行移动操作任务。
这项发布的意义在于:小米首次用大规模实验验证了机器人领域的Scaling Law——随着预训练数据和模型参数量的增长,机器人的真实操作成功率稳步提升,且尚未出现饱和迹象。如果这一趋势持续,它可能改写消费级机器人「数据稀缺→能力封顶」的长期瓶颈。

技术拆解:两阶段训练范式
Xiaomi-Robotics-1 的训练架构直接借鉴了大语言模型(LLM)的范式——预训练(Pre-training)加后训练(Post-training)。这套设计在语言模型领域已被证明有效,但将其迁移到机器人策略模型,需要解决数据采集、标注和适配三方面的问题。
预训练:10万小时无本体数据
预训练阶段使用了 10万小时 的真实世界操作轨迹,这些数据通过 Universal Manipulation Interface(UMI)设备采集,覆盖 1700+ 场景,包括家庭、商业空间、工业场所、办公室和户外环境。
数据规模是机器人领域此前公开数据集的数十倍。作为对比,Google Open X-Embodiment 数据集约为数千小时量级,而小米的预训练数据量达到10万小时。这么大的数据量无法依靠人工标注——团队构建了一套可规模化自动标注流程:将长轨迹切分为固定长度片段,使用视觉语言模型(VLM)对夹爪状态变化和交互物体状态变化进行自动描述。这套流程能在 约2周内 完成全量10万小时数据的高质量标注。
工程判断:自动标注是本题最关键的基础设施。没有这套VLM驱动的流水线,10万小时数据的人工标注成本和时间将使得Scaling Law实验在工程上不可行。小米在此处做出的是「降本式数据基础设施」的创新,而非算法创新。
后训练:本体适配与指令适配
后训练阶段需要解决两个核心适配问题:
本体适配(Embodiment Alignment):将预训练阶段从UMI数据获得的通用动作生成能力,迁移到真实机器人本体上。UMI是一个手持式数据采集设备,与机器人实体之间存在运动学和动力学差异,模型需要学会用真实机器人的手臂和夹爪执行同样的动作。
指令适配(Instruction Alignment):将预训练阶段「根据状态变化描述生成动作」的能力,转化为「根据人类自然语言指令执行任务」的能力。这本质上是把模型从「场景状态翻译器」升级为「任务执行者」。
后训练数据集约 1万小时,其中包含 7200+小时 自采的真实机器人数据(涵盖移动操作机器人和双臂机器人)、1000+小时人工标注UMI数据,以及Bridge V2、RT-1、DROID等公开数据集。

性能基准:五个子任务榜单的SOTA
Xiaomi-Robotics-1 在五项主流机器人操作基准测试中均取得了当前最优(State-of-the-Art)结果。这些基准测试评估的是仿真环境中的操作能力,而非真实物理世界——但仿真结果与真实世界成功率之间存在可预测的正相关关系。
| 基准测试 | Xiaomi-Robotics-1 | 此前最优 | 提升幅度 |
|---|---|---|---|
| RoboCasa365 | 57.4% 成功率 | 46.6%(此前最优方法) | +10.8pp |
| RoboDojo | 20.07分 / 13.93%成功率 | 13.07分 / 8.80% | +53.6% / +58.3% |
| VLABench | 59.1%成功率 / 70.3%进度分 | 未披露基准线 | N/A |
| RoboCasa | 74.5%成功率 | RLDX-1 / Cosmos Policy / GR00T N1.6等 | 全面超越 |
| Efficient Adaptation | <10小时演示→75%成功率 | π0.5 约40% | 近2倍 |
工程判断:RoboDojo上的突破幅度(成功率从8.80%提升到13.93%)尤其值得关注。这个基准测试被设计为高泛化要求——模型需要在未见过的环境和未见过的物体实例上完成任务。8.80%到13.93%的绝对数值虽然看起来不高,但在高泛化仿真测试中,这个跨越幅度意味着模型学到了可迁移的操作语义,而非场景记忆。

Scaling Law:机器人领域第一次被系统性验证
Scaling Law 是支撑大语言模型持续扩展的核心经验规律:模型性能随数据量、参数和计算量的增长而可预测地提升。语言模型领域已反复验证这一规律,但机器人策略模型此前一直缺乏同等规模的实验证明。
小米团队的核心贡献之一是:他们系统性地展示了预训练阶段和真实机器人阶段之间存在可传递的Scaling Behavior。随着预训练数据量和模型尺寸增长,验证集上的动作误差(Action Error)稳定下降;这种下降趋势在真实机器人成功率上得到了直接体现——更强的预训练模型经过后训练后,真实世界的任务成功率也更高。


工程判断:图中曲线尚未出现饱和拐点——这意味着增加数据和模型参数仍有持续收益。结合小米同时发布的Xiaomi-Robotics-0(基于4.7B参数的实时VLA模型)和Xiaomi-Robotics-1(提供2B/5B/10B版本),可以看到一条清晰的产品路线:先用小模型做实时部署,再用大模型做训练质量标杆,最后通过蒸馏或量化将能力下放到边缘设备。
这对整个消费级机器人行业的影响是:「数据不足—能力不足—市场需求不足」的死循环可能被打破。如果开源的基础模型能提供足够高的通用能力底线,新入场者就不需要从零收集百万小时数据,而只需针对特定场景做少量微调。Xiaomi-Robotics-1的实验数据显示,平均不到10小时的演示数据,就能将模型在新任务上的成功率推到75%。
市场定位:从手机厂商到具身智能平台
要理解Xiaomi-Robotics-1的战略位置,需要回溯小米在机器人领域的布局历程:
- 2021年:发布四足机器人 CyberDog(铁蛋),同年成立独立运营的机器人事业部
- 2022年8月:发布人形机器人 CyberOne(身高177cm,体重52kg,21个自由度)
- 2024-2025年:在自有电动汽车工厂测试人形机器人,完成90%指定工序
- 2026年2月:发布开源VLA模型 Xiaomi-Robotics-0(4.7B参数,实时执行)
- 2026年7月:发布具身基座模型 Xiaomi-Robotics-1(验证Scaling Law,开源)
这一序列显示小米的机器人策略正在从「硬件展示」转向「平台能力」——将机器人的智能大脑作为核心产品,而非机器人的物理形态。这与其手机业务策略如出一辙:MIUI/澎湃OS作为软件平台支撑硬件生态,如今 Xiaomi-Robotics-1 作为具身基座模型驱动不同形态的机器人。
竞争格局
当前具身基础模型赛道竞争激烈:
NVIDIA GR00T:英伟达的人形机器人基础模型,依托GPU生态和仿真平台Isaac Sim。GR00T N1.6在RoboCasa中的表现被Xiaomi-Robotics-1超越(74.5% vs N1.6未公布具体数值但排在后面)。英伟达的优势在于仿真-训练一体化平台,劣势是缺乏自有机器人硬件来做真实场景数据采集。
Google DeepMind:RT-2和Gemini Robotics代表Google的VLA路线。Gemini Robotics借助Gemini多模态模型的视觉理解能力,但数据规模和产品化进度不及小米。
Figure AI:获OpenAI、微软、英伟达投资的人形机器人创业公司。Figure 02机器人已进入宝马工厂测试。Figure的核心竞争力在于硬件-模型协同优化,但未开源模型。
Tesla Optimus Gen 3:2026年第三季度进入生产线,出厂价目标在2万-2.5万美元。Optimus的定位是规模化制造和工厂部署,而非开放平台。Tesla的优势是自研芯片(AI5)、制造能力和工厂试炼场。
小米与其他竞争者的核心区别在于:Xiaomi-Robotics-1是开源且硬件无关的。英伟达的GR00T虽然也是基础模型,但深度绑定其GPU生态;Google的RT-2不开源;Figure和Tesla是垂直整合。小米选择了一条「造大脑,不局限于造身体」的路线——模型可以适配任何搭载夹爪和摄像头的机器人硬件。
对消费级机器人的影响
小米切入具身基础模型赛道,对消费机器人的指向性有以下几点:
1. 降低机器人技能开发的边际成本
目前消费机器人的主要瓶颈是技能开发的边际成本。每一台扫地机器人只能扫地,每一台割草机器人只能割草,是因为它们搭载的是高度定制的专用模型。硬件成本正在下降,但技能开发的固定成本没有变化。Xiaomi-Robotics-1展示的「通用基座+少量微调」模式,理论上可以让同一台通用操作机器人在周一收衣服、周二装箱子、周三整理书柜。如果这项能力成熟,消费机器人将从「功能设备」进化为「通用劳动力」。
2. 开源策略的市场挤压效应
Xiaomi-Robotics-1采用开源策略(代码、模型权重已上传GitHub)。这与小米的手机策略一致:用开源/低毛利降低用户获取壁垒,通过生态设备和云服务变现。对于其他具身智能创业公司,这意味着基础模型层已经出现了免费选项——除非他们在特定场景的垂直精度上形成压倒性优势,否则很难在通用能力层面与小米竞争。
3. 数据回传机制启动
10万小时预训练数据中包含了大量家庭场景数据。如果未来小米将其机器人产品部署到真实用户家中,每执行一次操作都会产生新的轨迹数据。考虑到小米在消费电子领域的用户基数和渠道能力,一旦数据回传机制运转起来,其积累速度将非常显著。这正是Google RT-2和NVIDIA GR00T难以复制的优势——它们缺乏真实的硬件部署网络。
4. 与CyberOne硬件的关系
目前Xiaomi-Robotics-1是模型而非硬件产品。但模型训练数据中包含了移动操作机器人的数据(7200+小时),而CyberOne是小米唯一公开的人形机器人平台。模型的后训练数据集很可能来自CyberOne或其衍生型号。模型成熟后,CyberOne或后续型号作为硬件载体获得智能,将成为自然的产品演化路径。
局限与挑战
Xiaomi-Robotics-1仍处于技术展示阶段。几个关键问题尚未解决:
真实世界可靠性的验证缺失。论文和发布材料中展示的成功率数据主要来自仿真基准(RoboCasa365、RoboDojo、VLABench)。虽然团队展示了真实机器人成功率随预训练数据增长的Scaling曲线,但这与大规模、多场景的实际部署之间仍有很大差距。
任务复杂度的上限待检验。展示的操作任务涉及收衣服、摆鞋子、装箱子等日常事务,但复杂度远低于人类在日常环境中遇到的随机性挑战。突然掉落的物品、变形物体的操作、多步长因果推理——这些场景尚未被系统性测试。
对实时推理的工程要求。5B/10B参数的VLA模型在边缘设备上的实时推理延迟是一个已知的工程挑战。小米已发布Xiaomi-Robotics-0(4.7B,面向实时执行),但大规模模型在低成本机器人上的部署方案尚未公开。
安全问题未充分讨论。如果一个开源模型被部署到物理机器人上,错误操作可能导致物理损坏或人身伤害。在10万小时数据中,负样本和失败轨迹的处理方式、模型输出的安全约束——这些关键细节在发布材料中提及甚少。
小结
Xiaomi-Robotics-1是机器人基础模型领域的一次大规模实证。它用10万小时真实数据验证了Scaling Law在机器人策略模型中的适用性,在五个基准测试上刷新了SOTA,并以开源形式向社区开放。对于消费机器人行业,它提供了一个信号:通用操作能力的成本正在下降,数据飞轮的起点已经出现。
具身智能的「ChatGPT时刻」是否已经到来尚存争议,但可以确认的是——2026年7月这个时间节点,中国消费电子巨头第一次进入了具身基础模型的第一梯队竞争。
参考链接
- Xiaomi Robotics 官方项目页:Xiaomi-Robotics-1
- GitHub 代码仓库:XiaomiRobotics/Xiaomi-Robotics-1
- arXiv 论文:Xiaomi-Robotics-1: Scaling Vision-Language-Action Models
- Xiaomi-Robotics-0 开源 VLA 模型项目页
- IT之家:小米推出「开箱即用」机器人基座模型 Xiaomi-Robotics-1
- Hacker News 讨论:Xiaomi-Robotics-1 (241 points)
- CNBC:Xiaomi trials humanoid robots in its EV factory
- Tesla Optimus Gen 3 量产进展(2026年Q3)
- Figure AI F.03 直播自主分拣演示
- NVIDIA GR00T 人形机器人基础模型概览
本文发布于 daily.steinslab.io/events/,遵循 SPtuan 探索者模式——客观中立的工程视角分析,不含个人主观判断。