机器人背后的人:数据采集员是怎么工作的?

发布日期: 2026-09-01
来源网站:www.163.com
作者:21世纪经济报道
主题分类:
内容类型:深度报道或非虚构写作
关键词:数据, 机器人, 动作, 小时, 场景
涉及行业:制造业
涉及职业:
地点:

相关议题:工作时间

  • 在觅蜂科技的数采工厂里,数据采集员需要佩戴传感器头盔和腕部相机,按要求完成拼积木等动作任务。
  • 采集员每天工作约10至12小时,最终形成约4至5小时的数据采集成果。
  • 采集过程中要求严格,动作要放慢,不能有多余动作,还要避免光线过暗和镜头遮挡。
  • 同一套采集动作一天可能重复一百多次,完成后还要将积木推倒再重新开始。
  • 除工厂采集外,外部采集会把设备发给C端用户,让他们在做家务或本职工作时同步采集真实场景数据。

以上摘要由系统自动生成,仅供参考,若要使用需对照原文确认。

21世纪经济报道记者 董静怡

在觅蜂科技的数采工厂里,一名数据采集员头戴传感器头盔,佩戴腕部相机,把桌子上的积木拼成指示图所示的样子。

任务不难,但他必须以正常速度的一半完成,不能有任何多余动作。拼好后按下结束键,一次任务完成,再把积木推倒,如此重复多次。

数据是AI时代的石油,训练机器人的“原油”就是这样被开采的。

无本体采集是近两年增长最快的数采方案。21世纪经济报道记者在现场了解到,一名采集员每天要工作大约10至12小时,最终完成4至5小时的数据采集。采集过程中必须遵循严格的标准操作程序——动作不能太快,光线不能太暗,镜头不能被遮挡。

“这一套动作一天要重复一百多次吧。”一名数据采集员向记者表示。

目前工厂内的数据采集,更多是让采集员在受控环境中执行标准动作——背景单一、光线可控、动作规范。这种模式能保证数据的“干净”和完整。

而外部采集则是把设备发放给C端用户,让他们在做家务、干本职工作的同时“顺便”采集数据。这种分布式采集模式的好处显而易见:数据带着现实世界的“噪音”,恰恰是机器人形成泛化能力亟需的“养分”。

8月31日,觅蜂宣布累计产出超过100万小时高质量无本体数据,全部来自开放环境中的真实采集,其数采设备已陆续进入家庭、办公、零售、生产、餐饮等真实场景。

觅蜂科技的一位负责人向记者打了个比方:人类不是只在驾校里学会开车的,而是在长期置身于各种真实场景中才具备了应对不同路况的能力。机器人也一样,真正的泛化能力要靠外部采集来支撑。

目前,数据仍然是具身智能发展的核心瓶颈。统计显示,国内真实物理交互场景合规数据仅50万小时,而机器人商业化落地需要数千万小时数据,缺口超过99%。

上述负责人向记者表示,具身智能比大语言模型更难,不仅需要推理和语言能力,还涉及动作和现实世界的物理交互。这需要的不仅仅是更多数据,更是更多样、更真实的数据。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

网友评论仅供其表达个人看法,并不表明网易立场。

目前没有热门跟贴

目前没有跟贴,欢迎你发表观点

编辑 删除 返回