独家|有机器人公司进居民楼采数据,“采到老太太都要报警了!”
“采集12个小时,清洗出来能用的,超过1.5个小时就谢天谢地了,这已经是行业最高水平。”
“得大脑者得天下,得数据者得大脑”,智能机器人行业训练机器人大脑正在经历“数据饥渴期”。
财闻近期了解到,北京某头部具身智能企业为了获得家庭场景数据,在和居民协商一致后,带着录像设备,进入北京居民家中采集数据。
据采集人士称,刚开始居民觉得新鲜,很配合,但数据采集效率极低,需要不断重复,后边居民开始“烦了”。
“我们带着团队去北京老旧小区敲门,采到老太太都要报警了。”该人士称,“为了训练机器人在不同环境里干活,得找不同户型、不同楼层、不同年代的房子,80年的、90年的,还有新房子,都得采一遍。”
该人士告诉财闻,数据采集远不是“拍个视频”那么简单。机器人需要多模态数据,摄像头拍的画面、关节转动角度、手指施加的力,必须同步记录。任何一秒的偏差,整段数据作废。
采集只是起点,十万小时的原始视频,经过清洗、标注、重建,真正能用来训练的,可能只剩几千小时。“采集12个小时,清洗出来能用的,超过1.5个小时就谢天谢地了,这已经是行业最高水平。”
而训练一个好的机器人“大脑”,至少需要百万小时级的真实交互数据。目前行业能用的,只有十万小时级,数据缺口超过500万个小时。
缺口之下,行业开始出现数据交易。有人戴着头戴设备在真实环境里采集“异构数据”,7块钱一个小时卖给机器人公司。但不同品牌的硬件构型不同,采集的数据格式也不统一,“数据孤岛”现象严重。
稍早前的8月19—23日,世界机器人大会的论坛上,宇树科技创始人王兴兴判断目前机器人大脑能力时称,“泛化能力不够是最大瓶颈”。此外,银河通用创始人王鹤判断,当前具身基础模型能力大约相当于GPT-2阶段,2028年前后才可能迎来关键突破。
上述人士从实践的经验判断,如果机器人大脑成熟度满分是10分,目前0.5分还不到。他说,要训练出一个好大脑,“没有10亿美金是卷不出来的”,算力、人工、本体,三样都在烧钱,算力尤其棘手。
就家庭场景的机器人而言,拧瓶盖、叠衣服、刷马桶、分拣包裹。机器人要做好任何一个动作,背后都需要海量的“视觉+力觉+触觉”数据去喂养。
当前,整个行业正处在“先建基础设施”的阶段。各家公司在搭建完本体硬件后,几乎都把资源押在了“大脑”训练上,不仅要训练大语言模型那样的认知能力,更要构建物理模型和空间模型,让机器人理解重力、摩擦力、材质软硬、空间方位,
学会在真实物理世界里行动。
行业内,谷歌DeepMind的RT-2系列尝试用互联网规模的视觉语言数据进行“预训练”;
斯坦福大学ALOHA团队靠人手远程操控采集数据,将炒菜、叠衣的每个关节角度和力矩都记录下来。
国内公司也在搭建自己的“数据工厂”,有的自研数据采集手套,有的建仿真环境做“合成数据”,但目前真实数据依然无法被替代。
各家头部公司的路线各有不同。智元机器人在上海自建了数据采集工厂,部署约200台机器人同时作业,2024年底开源了全球首个基于真实场景的百万真机数据集AGIBOT World,其合伙人姚卯青透露今年要产出数百万小时的高质量数据。
宇树科技则走开源路线,今年3月将人形机器人全身遥操作数据集UnifoLM-WBT-Dataset放上Hugging Face,包含340小时、189万条动作轨迹,此前已开源世界模型框架和VLA大模型。
星海图坚持“整机+智能”战略,今年6月发布了VLA基础模型G0.5和双足人形机器人Kengo,完成闭环,是国内最早、最坚定押注真实数据的公司之一。
银河通用走的是“仿真合成数据预训练+真实数据对齐”的路子。智平方押注类脑VLA架构,自研NeuroVLA构建“皮层-小脑-脊髓”三层体系,目前已在惠科等7个以上行业拿下了规模化订单。

