写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读Xiaomi-Robotics-1下文简称XR-1关注的不是为某一种机器人任务专门设计动作策略而是一个更工程化的问题机器人数据难以按语言模型和视觉模型的方式扩张时VLA 的规模化应从哪里开始小米机器人团队给出的路线是两阶段训练。第一阶段使用超过100K 小时的 UMIembodiment-free真实操作轨迹预训练这些轨迹由手持设备采集不绑定特定机器人本体。自动标注流水线把长视频切成固定时长的片段并用视觉语言模型描述夹爪和交互物体的状态转变。第二阶段再混合真实机器人、筛选后的开源数据和高质量 UMI 数据将模型对齐到具体本体并从“根据状态变化描述生成动作”转为直接执行自然语言指令。论文的实证主线也很清楚预训练数据量与模型尺寸增大时验证动作误差持续下降这种趋势在后训练后仍转移到陌生环境的真实机器人成功率。作者进一步报告模型能用每个任务不足 10 小时的演示适应高难移动操作并在 RoboCasa、RoboCasa365、VLABench、RoboDojo 四个仿真基准上取得领先结果。猫先生认为XR-1 最重要的启发是把“具身数据不够”转化成不受机器人本体绑定的真实交互数据可以先规模化。不过规模曲线能否跨任务、跨机构和跨硬件复现仍取决于数据采样、自动标注质量与后训练配比这些尚未完全公开的变量。论文标题Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories论文地址https://arxiv.org/abs/2607.15330项目主页https://robotics.xiaomi.com/xiaomi-robotics-1.htmlGitHubhttps://github.com/XiaomiRobotics/Xiaomi-Robotics-1HuggingFacehttps://huggingface.co/XiaomiRobotics原文脉络文章先把机器人策略的瓶颈定位为真实交互数据不足再说明 UMI 轨迹、自动状态转变标注与两阶段训练如何构成可扩张的预训练—后训练配方。之后论文依次给出预训练与真实机器人后训练的 scaling 证据再用少样本下游适配和仿真基准测试模型的泛化能力。官方项目页与论文摘要共享这一论证顺序。1-2. 具身模型为何需要一条不同于互联网数据的扩张路径语言模型可以从网页文本中吸收大规模分布式知识视觉模型可以从海量图文中学习表征机器人策略却必须面对动作、接触、相机视角和物体状态变化。高质量机器人演示的采集成本高且数据往往和某个机械臂、夹爪或传感器配置紧密耦合。只把多套机器人数据拼在一起未必能形成稳定的 scaling 曲线。XR-1 选用了 UMI 轨迹作为预训练入口。UMI 记录的是人通过手持采集装置完成的真实操作因此保留了手—物体交互、相机运动、场景变化和连续控制轨迹却不要求先固定到某一种机器人形态。作者称预训练数据覆盖超过 1,700 个场景包括家庭、商业场所、工业场地和户外环境。这并不意味着 UMI 数据天然就能训练 VLA。原始长视频缺少与动作片段精确对应的语言条件而“把杯子放到桌上”这类任务名又过于粗糙无法说明片段中发生了哪种状态变化。为此团队让 VLM 对切分后的片段标注夹爪与交互物体的变化例如抓取、移动、放置或打开构造“视觉状态—语言状态转变—动作”配对。图 1官方项目页展示的预训练数据概览。UMI 轨迹覆盖不同场景和任务长视频先切成片段再以语言标注物体与夹爪的状态变化。这种标注选择有一个重要取舍状态转变比主观任务名称更贴近一段动作的局部因果结果因此适合大规模自动生成但它也可能丢失长程目标、失败恢复和人类偏好。XR-1 的预训练首先学习的是把场景推向某种可描述变化的动作生成能力不是直接获得所有口语指令的执行能力。后训练数据则转向真实机器人可执行的监督信号内部机器人演示、筛选后的开源机器人数据以及带人工指令标注的 UMI 轨迹共同覆盖移动操作与双臂机器人。这种数据组织为后续的本体与指令对齐提供了接口。图 2后训练数据混合了内部机器人、开源机器人与带指令标注的 UMI 轨迹并覆盖移动操作与双臂机器人。3. 两阶段训练先获得通用动作生成再对齐真实机器人与指令3.1 预训练用状态转变把大规模真实轨迹变成条件动作学习预训练阶段的条件是视觉观察和自动生成的状态转变描述目标是学习产生能促成该变化的动作。论文将这一步定位为“广度”场景、物体、交互方式和操作过程尽量多样动作生成能力也就不必从少量特定机器人任务开始。官方页面显示随着预训练数据比例提高、模型规模增大验证集的 action error 都稳定下降。这种曲线只证明模型对其预训练分布的动作预测更好却是后面真实机器人迁移结论必要的第一环。图 3预训练阶段的 scaling 结果。官方报告称数据规模和模型尺寸增加时验证动作误差持续降低。这里的关键不是把 UMI 当作“机器人数据的廉价替代品”而是借它建立一个足够大的、与本体弱耦合的动作先验。模型会见到更多物体、抓取方式和操作过程真正的机器人控制约束则留给下一阶段校正。3.2 后训练两条对齐轴把通用先验落到机器人上后训练包含两条轴。本体对齐embodiment alignment使用跨本体的高质量真实机器人数据将预训练学到的通用动作生成能力映射到实际机器人指令对齐instruction alignment则将条件从“描述已经发生或将发生的状态转变”改成用户会自然说出的命令。官方披露的后训练数据由三部分组成内部真实机器人数据、筛选后的开源机器人数据、带人工时间片段和指令标注的高质量 UMI 数据。内部数据超过 7,200 小时来自真实家庭环境覆盖整理沙发、整理鞋柜、收纳厨房用品等任务。图中的移动操作平台与双臂平台也说明作者希望这一步吸收多种实际本体而非只服务一台机械臂。后训练并没有抹掉预训练的 scaling 效应。官方在陌生环境、陌生物体实例上的真实机器人测试中分别增大预训练数据比例和模型尺寸成功率整体上升。换言之预训练动作误差更低的模型经由相同方向的后训练后也更容易在真实机器人上成功。图 4后训练后的真实机器人测试。左图扩大预训练数据比例右图增大预训练模型尺寸两种设置下多项移动操作任务的成功率总体提高。猫先生认为两阶段分工比“直接拿海量视频训练机器人”更务实预训练解决动作与状态变化的广度后训练解决本体运动学、执行器误差和人类命令的可用性。它的风险也集中在接口处——若状态转变标注与真实指令分布差异过大后训练仍可能成为决定泛化上限的瓶颈。3.3 论文没有公开的部分不能用想象补齐截至 2026 年 7 月 21 日GitHub 仓库仍标记为代码与权重“即将发布”。官方页面没有完整披露视觉—语言骨干、动作表征方式、损失函数、训练 token/step、各数据源配比、自动标注模型及过滤规则。因此XR-1 的方法贡献可以稳妥概括为数据与训练范式不宜把它描述成已经完整可复现的模型架构。4. 实验规模增益是否能转成真实能力与快速适配4.1 陌生环境中的 out-of-the-box 真实机器人表现后训练 scaling 图验证的是一个比预训练误差更难的问题模型没有为测试环境单独收集数据时增大预训练是否还会提升真实成功率。图 4 的数据比例组和 2B、5B、10B 模型组都指向同一趋势但曲线并非每个任务、每个规模都严格单调。例如官方图中“沙发整理”在 5B 时高于 10B说明具体任务仍会受数据组成、随机性和评测样本量影响。应把它理解为总体 scaling 信号而不是每一个点都服从平滑定律。4.2 新任务适配少量演示是否足以改变技能边界在手机装箱、打印机补料、洗衣装载和箱体打包四个复杂真实任务上官方项目页给出的平均结果为每个任务不足 10 小时演示时XR-1 成功率为75%对比 π0.5 的40%预算提高到每任务不足 40 小时时XR-1 为85%π0.5 为53%。其中“箱体打包”在较高数据预算下两者都达到 100%这提示模型差异主要出现在其他更难、或者演示更不足的任务上。这组实验测量的不是零样本通用性而是基础策略吸收新技能的样本效率。它支持“大规模预训练提供更好初始化”的判断但项目页没有给出每项任务的演示分布、失败类型、随机种子或训练成本因而无法仅靠百分比判断差异来自视觉泛化、动作控制还是后训练工程细节。4.3 仿真基准强结果与版本数字需要分开阅读arXiv 摘要报告 XR-1 在 RoboCasa365 上达到57.6%高于此前的 46.6%RoboDojo 平均分为20.07高于 13.07。官方项目页当前表格则列出 RoboCasa36557.4%、RoboDojo13.93%并给出 RoboCasa 74.5%、VLABench 59.1%。同一官方工作在两个公开入口的数值不完全一致可能来自评测版本、统计口径或页面更新在代码与完整评测配置发布前引用时应明确采用哪一份来源而不应把它们混成同一张排行榜。猫先生认为这篇工作提供了很强的规模化信号但评测可复现性仍是它必须补上的一环。特别是超大规模 UMI 数据、自动标注和跨本体后训练彼此耦合公开权重与配置后才能分辨增益究竟主要来自数据、模型大小还是数据清洗与对齐配方。总结把“规模”落在可迁移的动作经验上XR-1 的价值可以收在三点。数据入口换了位置。通过 100K 小时弱本体绑定的 UMI 真实轨迹VLA 预训练不必先受限于某一种机器人硬件的数据量。训练目标分两步对齐。预训练用状态转变语言连接视觉与动作后训练再分别处理本体与人类自然指令这让广度和可执行性不必在一个阶段里硬凑。规模证据跨过了预训练验证集。论文不仅展示 action error 的下降还把数据和模型规模的增益带到陌生场景中的真实机器人以及后续任务适配与仿真基准。如果后续发布能补全模型结构、动作空间、数据过滤、自动标注质量控制与统一评测配置XR-1 将成为检验“真实世界操作轨迹是否也能形成可靠 scaling law”的重要开放基线。眼下更稳妥的结论是它展示了大规模真实操作数据可以成为 VLA 基础策略的有效预训练原料而不是已经解决了跨本体通用机器人的全部问题。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列