开启具身数据采集蓝海,行业对采什么、怎么用看法不一
数贸会论坛上,高校与企业嘉宾围绕具身智能数据的质量标准和采集路径展开讨论。业内人士表示,数据采集仍是蓝海,走向成熟需要一万小时的高质量数据。
“具身智能数据采集目前是一个巨大的蓝海市场。”在第五届全球数字贸易博览会现场,杭州高新科创集团有限公司董事长田树军对财闻表示。
9月27日,在数贸会中国数谷展区的一场论坛上,财闻听到了来自高校和企业嘉宾对具身智能数据的不同看法。
有业内人士主张用机器人完成任务的成功率检验数据质量,也有一些认为,比采集设备更稀缺的是专业场景中的人类作业数据。真机遥操作数据能带来多大提升,采集方与模型开发方如何合作,数据又该如何定价,也是现场讨论的议题。
好数据的标准是什么?

北京灵御智能科技有限公司首席数据官陈晓锵提出,可以把数据用于模型训练,再看机器人完成任务的成功率有没有提高。北京航空航天大学人工智能学院博士后汤宗衡也认为,能够帮助模型做好下游任务的数据,才是高质量数据。
其他嘉宾从数据本身提出要求。青瞳视觉创始人兼CEO张海威认为,数据应尽可能完整地反映物理世界的运行规律,包括不同模态的信息。景联文科技副总经理林旭峰则提出,具身智能数据还应做到时空对齐,带有物理反馈,并且能够复现和评测。
专业场景里的高质量数据尤为重要
如果未来两三年只能优先补齐一类数据,嘉宾们给出了不同选择。
汤宗衡更关注机器人做错之后发生了什么。他认为,失败后的纠错与恢复过程,是后训练中值得补充的数据。机器人可以先在便利店等具体场景中把任务做好,再随着应用产生更多数据。
浙江大学CAD实验室百人计划研究员陈昊认为,数据需求需要按模型训练阶段区分。当前应先做好后训练,下一步还要解决更复杂的灵巧操作问题。他提到装配和柔性物体操作等任务,认为机器人要完成这类工作,还需要进一步提升对物理过程的理解和操作能力。
陈晓锵选择真机遥操作数据,也就是由人直接操控机器人完成任务时产生的数据。他提出,如果不同路线的数据在数量、质量和成本上处于相近水平,真机遥操作数据更有价值,因为它记录了机器人本体与物理世界的实际交互。
林旭峰的答案是专业场景中的人类作业数据。他认为,采集设备未必是最稀缺的,电力、煤炭、化工等行业的场景具有较高专业门槛。如果只能选一种,他希望优先采集这些场景中人如何作业、如何与环境交互。张海威表示,人的操作、机器人遥操作和仿真生成,都可以成为数据来源。机器人本体不同,所需的数据和模型也可能不同。
数据如何定价?
采回数据后,还要决定下一批数据采什么。陈昊认为,场景方清楚希望机器人解决什么问题,模型开发方则更清楚训练需要什么数据。数据采集、筛选与模型使用需要紧密衔接,双方应保持高频反馈。
北京德塔源创智能科技有限公司商业化负责人曾洪森将这一过程描述为持续迭代。模型用场景数据完成训练,再回到场景中应用,并在使用过程中产生新的数据。
一位现场观众提出,一批数据用于训练后,怎样评测它对模型能力的提升,并据此确定价格?陈晓锵回应称,目前交易价格会受到场景复杂度、采集成本和供需关系影响,定价体系仍在形成。他说,寻找交易对象目前还较依赖供需双方直接联系,期待未来有更公开的交易渠道,让已经采集的数据得到更多次使用。
汤宗衡则认为,各行业所需的机器人技能、本体和数据差别很大,数据的采集和使用可能更多地嵌入具体应用场景。
会后,杭州高新科创集团有限公司董事长田树军在接受财闻采访时表示,具身智能数据采集目前是一个巨大的蓝海市场。谈及具身智能数据走向成熟的标准,他认为需要达到一万小时的数据规模,而且这些数据必须是高质量的。

