ChatGPT之所以强大,是因为互联网上有海量文本可供学习。但机器人需要学习的是物理操作——怎么抓杯子、怎么开门、怎么在厨房里移动。这些数据不在互联网上。

机器人训练数据的稀缺性,正在成为整个行业最大的瓶颈,也是最大的机会。

智能追随数据

回看AI的发展脉络,有一条反复验证的规律:智能首先取决于数据。

GPT-1有1.17亿参数,GPT-2有15亿,GPT-3有1750亿。每一次参数跃升,目的都是剔除过去被认为必不可少的训练环节。GPT-1证明了预训练语言能力可以迁移到下游任务;GPT-2检验了微调是否真的必要——把参数扩大十倍,在更多样化的文本上训练,八个基准中的七个不需要微调就能达到最优;GPT-3继续押注,以3000亿Token训练1750亿参数,只需要提示中放几个示例就能执行新任务。

图注:GPT系列每次参数扩大一个数量级,都在去掉一个"必须"的训练步骤

到ChatGPT出现时,这套"数据+算法+算力"的配方已经充分验证。五天内100万用户,两个月内1亿月活,成为有记录以来采用速度最快的消费应用。

关键认知是:模型不是被教导如何做某件事,而是看了足够多真实示例后自己学会了。语言模型没有被教写句子,它处理了足够多句子后自行学会了。没有被教翻译,看了足够多翻译文本后自行掌握了。

同样的机制即将在机器人身上重演。但有一个根本区别。

物理数据不能从网上下载

语言模型的训练数据可以从互联网上大规模获取——Common Crawl、维基百科、书籍语料库、代码仓库,都是现成的。文本是数字世界的原生产物。

机器人的训练数据则完全不同。它需要记录的是物理操作过程:手的姿态、关节角度、力度反馈、空间轨迹。这些数据必须由人类实际执行任务并录制下来。开发者找不到一个可供抓取的"机器人版Common Crawl"。

目前主流的采集方式有四种:遥操作(人类远程控制机器人执行任务,同步记录动作数据)、动作捕捉(穿戴传感器记录人类运动,再映射到机器人关节)、第一视角视频(头戴相机记录操作过程,再用视觉算法重建动作)、合成数据(在仿真环境中生成,但面临仿真到现实的迁移问题)。

每一种方式都有明显的瓶颈。遥操作需要大量人力和真实机器人设备;动作捕捉的精度和映射质量受硬件限制;第一视角视频的动作重建精度有限;合成数据在复杂操作场景中与真实世界的差距仍然显著。

数据供应商的机会窗口

这个瓶颈创造了一个结构性的商业机会。

语言模型时代,数据标注公司(如Scale AI)通过众包标注获得了可观的市场份额。机器人数据时代的机会更大,因为数据本身更稀缺、采集更困难、质量要求更高。

图注:机器人训练数据的采集需要物理设备、操作人员和标注团队的协同,供应链远比文本标注复杂

什么样的企业能抓住这个机会?根据Shoal Research的分析,最有优势的是垂直整合型公司——同时拥有机器人硬件、运营团队和实际部署场景的企业。它们在日常运营中自然产生数据,数据成本被分摊到业务运营中,而不是作为独立成本存在。

纯数据供应商面临一个鸡生蛋的问题:没有机器人设备就没法采集数据,但没有收入就没法购买设备。分布式劳动力模式(类似众包,让分散的操作者用自己的设备采集数据)是一个可能的解法,但质量控制和标准化的难度很高。

还有一个容易被忽视的变量:数据格式和标准尚未统一。不同机器人平台的关节配置、传感器布局、通信协议各不相同,在一个平台上采集的数据很难直接用于训练另一个平台的模型。这意味着数据供应商需要与特定机器人厂商深度绑定,而不是做通用数据市场。

源势AI观点

机器人训练数据的稀缺不是一个技术问题,而是一个基础设施问题。文本数据有互联网作为天然的采集渠道,图像数据有数十亿部智能手机持续产出,但物理操作数据没有现成的产出管道。

这意味着谁先建起高效的数据采集流水线,谁就掌握了机器人AI的"石油"。参照语言模型的发展史——OpenAI的核心优势之一就是比别人更早建立了大规模数据引擎——机器人领域的竞争格局很可能在未来两三年内被数据积累速度决定。

对企业来说,如果你的业务涉及物理操作(仓储、制造、餐饮、护理),你日常产生的操作数据就是一笔被低估的资产。现在不采集,就是在浪费未来的训练资源。

---

*来源:*

1. *Shoal Research《物理AI与机器人技术的数据层》(登链造物, 2026-08-20)*

2. *OpenAI GPT系列技术报告 (GPT-1/2/3, 2018-2020)*

3. *弗若斯特沙利文《2025年全球具身智能与商用服务机器人独立市场研究报告》*