家庭视频变现机器人数据新玩法如今在家里叠衣服、洗碗、拖地的视频竟能卖钱这并非夸张之辞。四个月前美国机器人公司Figure悄悄上线一款APP进行测试8月26日该APP正式更名为Index在Google Play和App Store全球上线这是一个让普通人通过录制家务视频来赚钱的平台。创作者上传自己干活的第一视角视频Figure会按数据质量付费。在四个月的测试期内平台已覆盖108个国家和地区积累了1600万段视频Figure向创作者支付了1500万美元并承诺未来12个月在数据和算力上投入超过10亿美元。数据机器人行业的瓶颈与燃料这一模式的根本在于机器人行业一个被严重低估的瓶颈——数据。大模型能力的爆发依赖于互联网上动辄数万亿Token的文本数据仅GPT - 4的训练数据量就超过13万亿Token。但具身机器人面临的情况却完全相反它没有互联网。在潮涌AI的报道中光轮智能总裁杨海波算过一笔账具身智能的数据需求至少是大语言模型的1000倍。全球81亿人每天清醒时间超过12小时理论上每天会产生约1000亿小时的物理交互数据但其中绝大部分从未被记录过。Figure想做的就是用“众包 经济激励”的方式把这1000亿小时里的一小部分“捕获”回来变成机器人的训练燃料。机器人行业的叙事正在换挡硬件的热度渐弱真实的人类行为数据正成为新的“石油”。对估值390亿美元的Figure来说Index不是副业项目而是核心战略它想建立一个全球化的“数据采集经济体”。Index解决机器人“数据饥渴”Index的本质是用“众包”解决机器人的“数据饥渴”。Figure的Helix模型是一套端到端的VLA视觉 - 语言 - 动作系统70亿参数的视觉语言模型负责理解任务8000万参数的视觉运动网络负责实时控制。这种模型对数据的需求是海量的、多样的、高质量的供应商无法满足Figure便决定自己搭建。Index的运营方式很直接用户在APP上注册录制自己做家务或工作的第一视角视频上传后通过审核就能获得报酬也可以雇佣零工上门干活并录制操作画面Figure按数据质量和数量付费。Index App目前每1000小时数据平均包含373种独特任务、1146种被操作对象、116个独特环境平台每秒能处理30分钟的视频上传背后是一套7×24小时运转的数据基础设施。这并非“众包标注”的简单升级Figure要的不是人工打标签而是人类在真实环境里干活的原生视频。像叠衣服时手指的捏法、拖地时手腕的转动、洗碗时判断碗是否洗净的细微动作逻辑仿真数据生成不了实验室也采集不到只能从真实场景中“购买”。中国企业数据采集的艰难长征国内机器人企业并非没意识到数据的重要性实际上几乎所有头部玩家都在重金投入数据采集。但和Figure的“众包平台”模式相比中国企业的数据获取方式普遍更“重”、更“贵”、更难规模化。智元机器人按Omdia的通用人形机器人口径含轮式双臂2025年出货5168台占全球39%份额位列第一不过这个“第一”存在统计口径之争。其AgiBot World项目自建2000平方米真实采集场覆盖217个任务、3000余种物品数据规模850TB2026年4月智元又开源了AGIBOT WORLD 2026数据集与此同时英伟达GR00T N1模型80%以上的真机训练数据来自智元开源数据集。但采集场属于重资产扩建一座就要重新投入资金、搭建场地、购买设备。宇树科技2025年人形机器人出货超5500台按纯双足人形口径自称全球第一。2026年3月开源UnifoLM - WBT全身遥操作真机数据集包含340小时、189万条动作轨迹覆盖衣物收纳、家电操作等场景。宇树走的是“硬件 数据流水线 模型训练 开源社区”一体化路线开源数据的增长速度受限于社区活跃度做不到Figure那种“全球几万人同时上传”的规模。优必选2025年全年订单近14亿元其牵头的国地共建创新中心发布RoboMIND数据集涵盖279个任务、单臂/双臂/人形等多种机器人形态优必选自身也在多地建集中化数据采集中心路线偏“内部闭环”数据围绕自身本体和任务统一设计集中度高但开放性弱采集成本全部由自己承担。自变量机器人2026年4月发布全球首个世界统一模型WALL - BWUM架构坚持100%真实场景数据采集同时提出“牛奶数据”概念即真实家庭里自然光变化、物品随意摆放、人宠随机互动的“嘈杂”数据与实验室“糖水数据”对立。自研主从遥操、外骨骼等数采设备建了大量数据工厂。2026年7月推出QUANXTA Zero无本体数采方案宣称可将模型完成简单任务的数据成本整体降低约60%。即便如此创始人王潜自己也坦言“机器人其实硬件到位了但是大脑没有跟上。”星海图开放GOD真机数据集覆盖住宅、商超等复杂场景让机器人在更接近现实的环境中积累数据。银河通用走“合成数据打底真实数据校准”路线用仿真提速、用真机校准。傅利叶智能产品与服务已覆盖全球40多个国家和地区、约2000家机构与医院在医疗康复场景中通过真实部署与仿真平台持续积累数据。千寻智能、穹彻智能与第三方数据服务商37度数据合作外包部分采集标注工作。国内具身企业的数据采集要么自建工厂重资产要么依赖开源社区速度慢要么外包给第三方质量难控每一条路都有天花板没有人能像Figure那样用“众包 经济激励”的方式让全球几万人同时为自己“生产”数据。复制Figure模式能但有难度中国企业能否复制Figure模式答案是能但有难度。而且如果不尽快行动数据差距可能越拉越大。Figure的核心优势不是技术而是“网络效应”。108个国家、1600万段视频、1500万美元创作者报酬这构成了一个飞轮越多人上传数据越多样模型越强机器人越能干平台越值钱越多人愿意上传。这种飞轮一旦转动起来后来者很难追赶。国内企业要走这条路面临三层现实障碍。第一隐私和合规问题。在中国上门拍摄家庭内部视频涉及隐私权、肖像权、数据安全等多重监管Figure在欧美可以靠“用户授权 匿名化处理”推进而中国的合规门槛更高。第二成本结构方面。中国的人力成本确实更低但“低成本”也意味着“低激励”。Figure在美国支付的报酬能让创作者觉得“值得做”中国的定价要打动普通人平台补贴规模不能小而自变量即便把数采成本降低了60%依然是重资产投入。第三数据多样性问题。中国家庭环境的物理差异极大从一线城市的精装公寓到三四线城市的自建房从南方的潮湿气候到北方的干燥暖气。Figure覆盖108个国家天然获得跨文化、跨气候、跨建筑类型的多样性中国企业如果只做国内市场数据多样性天然受限如果拓展海外市场又要面对文化差异和运营成本。不过机会同样明显。中国有14亿人、全球最完整的制造业供应链、和Figure相比低得多的运营成本。如果能解决合规和激励机制问题一个“中国版Index”的潜力可能更大。数据战终局数据转化为能力瑞银证券中国工业行业分析师王斐丽今年4月受访时判断人形机器人行业的“电动车时刻尚未到来”当前大量出货仍流向科研机构和数据采集中心真正进入工厂持续复购的商业化拐点仍未出现。今天的数据竞赛本质上是在为“拐点”积累筹码。Figure投入10亿美元建Index不是为了现在变现而是为了在机器人真正走进千家万户的那一刻拥有别人无法复制的数据壁垒。对中国企业来说跟进Figure的“采集经济体”模式不是简单的“我们也建一个APP”。真正需要回答的问题是你的模型需要什么样的数据你能用什么样的成本获取这些数据你的数据能不能持续产生、持续更新、持续反哺模型迭代智元用“开源生态 数据工厂”回答宇树用“全栈一体化 社区共创”回答优必选用“集中采集 内部闭环”回答自变量用“真实场景 无本体采集”回答Figure用“众包平台 全球化 经济激励”回答。五条路线没有绝对的对错但都有一个共同前提数据必须真实、多样、持续。潮涌AI观点数据竞争与标准问题Figure的Index发布揭开了机器人行业竞争的底牌拼完本体、拼完模型最终要拼的是数据。1600万段视频、1500万美元创作者报酬、10亿美元未来投入这些数字背后是Figure对“数据即壁垒”的深刻认知。中国企业在数据上并非落后智元的AGIBOT WORLD、宇树的UnifoLM - WBT、优必选的RoboMIND、自变量的QUANXTA Zero都在各自路线上有扎实积累。但相比Figure的全球化众包网络中国企业的数据获取方式仍偏“重”如自建采集场、自有遥操设备、内部闭环质量可控但规模天花板明显。更值得警惕的是标准问题。如今每一家企业都在用自己的采集格式、自己的标注规范、自己的场景定义闭门造车攒下的数据彼此无法互通。规模再大也是一个个互不相通的池塘而不是一片海。对中国机器人产业来说比“再造一个更大的数据集”更紧迫的是让各家数据能对话、能流通、能协同训练的通用规则。这件事谁先做成谁拿到的就不只是数据而是整个行业的“接口定义权”。机器人时代的“石油”是人类每天重复的、琐碎的、真实的物理行为。谁能以最低成本、最大规模、最高质量地获取这些行为谁就能训练出最“像人”的机器人。中国机器人企业会不会跟进Figure的“采集经济体”模式短期看自建采集场和开源数据集仍是主流长期看当数据规模成为决定模型能力的关键变量众包、零工、平台化的数据采集必然会进入中国的机器人产业。问题不是“跟不跟”而是“什么时候跟”、“以什么方式跟”、“由谁来牵头”。