真任务、真场景、真动作,觅蜂构建百万小时无本体数据集与全链路技术体系

2026-09-20 22:38 来源: 盖世汽车齐鲁经济网   阅读量:17040   

2026年9月15日,在2026具身感知融合与多模态大模型创新研讨会上,上海觅蜂具身智能科技有限公司技术副总裁刘力介绍了觅蜂发布的首个百万小时无本体数据集及全链路技术体系。该数据集覆盖家居、零售、工业、物流等500余种任务类型,场景超万种、物体超五万种,依托裸手、腕部及物理采集三类范式,构建了从人类意图理解到机器精准复刻的数据闭环。

刘力表示,觅蜂通过长程动态切分、高精度位姿重建及“不过滤、只分级”的质检体系,实现原始数据到模型可用数据的标准化处理,并搭建数据飞轮与REMORA 任务进度价值模型,推动具身模型持续迭代。其手部姿态重建算法在复杂遮挡场景下精度误差小于5毫米,可支撑跨本体动作映射与泛化落地。

刘力|上海觅蜂具身智能科技有限公司技术副总裁

以下为演讲内容整理:

上个月月底,觅蜂发布了行业首个百万小时无本体数据集,我们首次将具身数据规模从万级、十万小时提升至百万小时,并完成发布。今天我将进一步介绍百万小时无本体数据集背后的数据能力体系建设。

百万小时无本体数据集:场景架构与采集体系全景

首先看几组数据:我们的数据集规模现已达到百万小时;任务覆盖超过500种细分类型,涵盖家居、零售、工业、物流等场景;真实场景覆盖度超一万种;物体多样性超过五万种。

觅蜂的一代产品包含裸手腕部相机、头戴式手部相机以及Gripper物理采集设备。设备采集记录的信息除RGB图像外,还包含触觉、力觉、音频等动态信号,这些数据共同汇总形成百万小时数据集。该数据集的特点可总结为“三真”:在真任务、真场景、真动作条件下,实现异构外部场景的数据采集。

百万场景的数据分布依托觅峰正向研发成果,同时整合海内外头部客户提出的场景图谱搭建而成。百万数据集的构成共有八大核心场景,其中居住类场景数据为17万小时,办公类场景为14万小时,零售与生产两类场景各13万小时。除此之外,仓储、餐饮、文娱、交通等场景共同构成总量的82%。另外,依托贴近日常生活的头部场景,搭配14类长尾场景,共同夯实AI模型训练的数据范式,全方位赋能各行业智能化升级。

下面介绍百万数据集对应的采集范式,该范式与国内外头部客户所需的数据类型相契合。第一类是常见的裸手采集,对应数据量占比50%,共计50万小时。该场景借助头戴凝视相机捕捉自然手部操作以及对应的意图表达,结合内部引擎体系完成信息加工,可用于机器操作与意图建模。

第二类数据集为腕部采集数据,数据规模约30万小时。相较于裸手采集方案,该方案配备腕部相机,采集人员除佩戴头戴式目视相机外,双手腕部均搭载设备,可更稳定地追踪手部与腕部关节姿态以及连续运动轨迹。腕部采集的数据占比约35%,能够更好地支撑物体追踪与姿态分析。

第三类为物理采集数据,当前规模约15万小时。此类数据通过将Gripper设备部署至采集与工作环境,直接对齐末端视角与真实执行动作,适用于跨本体映射。依托这三类采集范式,我们打通了从人类意图理解到机器精准复刻的全流程。

全链路标准化技术栈:实现原始数据到模型可用数据闭环

接下来介绍从原始采集数据到经过完整处理的数据集所对应的整套技术体系,这也是觅蜂多次对外分享的技术栈。该体系的核心是对异构外部真实场景采集的数据实现标准化处理,主要包含几个环节。一是数据预处理。在素材室或实验室环境下采集的数据较容易标准化,可预先规定采集动作与时长。我们计划于9月23日启动觅蜂派全球首发众包活动,将采集设备开放给大众,任何具备操作能力的人员均可通过我们的APP完成数据采集。在该模式下,采集得到的数据往往是时长超过两至三小时的长程任务数据。我们依托预处理、空间感知、数据标注以及质量评估这四项标准化流程,可一键完成数据清洗、标注与格式标准化,实现从数据采集、上传直至部署的完整闭环,大幅缩短项目周期。

下面说明三项核心工作。第一项是长程动态切分。该技术将时长一小时、两小时的人类连续工作任务,切分为算法与模型可识别的标准化数据及标准化语言。整个流程大致分为四个阶段。第一阶段是多模态接入,融合视觉与IMU信息,更好地理解真实场景中人类工作的开放信息。完成信息融合后,借助大模型进行解析,输出原子示例。识别完成后,模型除对数据做预校验外,还可完成动作对齐,实现动作时序的毫秒级匹配。最终通过原子化技能标注与拆分,能够实现对长时序任务原始数据进行处理,赋能场景的灵活迁移。

在完成采集动作的意图解构之后,是更为关键的部分:如何使模型理解动作精度,能否完成如右下角示例中抓取水杯这类精细化操作,这就涉及目前无本体数据领域广受关注的高精度位姿重建,以此支撑动作映射。

在该方向,觅蜂已实现相关能力。有两组真实作业场景,分别是缝纫机作业场景和使用头戴五目相机开展农活的场景,关节点误差可控制在5毫米以内。我们即将推出的二代五目设备,相关技术已提前落地,可实现全身关节点重建。除手部精细操作信息外,还可输出全身运动信息。针对倒水动作,将MEgo数据迁移至机器人本体,可以实现一比一精细同步,末端轨迹误差小于10毫米。由此,无本体数据可作为增强流数据用于模型SFT训练。

觅蜂提出了“不过滤,只分级”的理念。我们认为每一条数据均具备价值。除传感器故障、相机缺失、IMU丢帧这类问题数据予以剔除外,其余全部数据均可供给模型使用。基于该原则与目标,我们依托首个模块——多维度质检体系对数据进行打分。评估维度包含数据类型、任务类型、传感器质量、语义质量以及动作质量。完成五个维度打分后,部分数据得分较高,动作质量优异;部分数据则具备较高的场景丰富度。我们依据评分结果对数据分级复用:高精度数据用于动作模仿;丰富度高的数据用于预训练与视觉表征;对于动作不规范的数据,在本方案中不会直接舍弃,而是收集起来用于进度与错误感知;各类极端案例与边界数据,则用于泛化测试增强。通过质检结合分级的方式,最大限度挖掘异构场景采集数据的利用价值。

高精度手部姿态重建:突破复杂真实场景数据重建壁垒

接下来介绍基于软硬件协同设计、适配五目产品的手部姿态重建算法。该算法具备五大特点:第一,五目全景感知。该设备头部中间为三目针孔相机,搭配两枚鱼眼相机,两侧另设两枚鱼眼相机,依托五目全景感知方案,可大幅拓宽视觉视场角。第二,端到端手部追踪算法,能够适配各类手部画面场景。在自我手部、他人手部、双手交互以及重度物体遮挡场景下,算法均可稳定完成关键点检测,当前精度误差小于5毫米。

美甲作业场景中,难点在于操作者自身手部与客户手部存在交互,多数算法难以区分自身手部与他人手部。奶茶制作场景中,难点是手部与杯具之间存在大面积遮挡,可见区域占比不足30%。即便在该条件下,我们的算法依旧可以实现稳健重建。这两类场景,无论是数据采集阶段,还是后续具身智能走向复杂真实落地场景的过程中,都是需要面对并解决的问题。

还有宠物清洗的高速交互场景,手部被洗洁精污染时,算法仍可完成高质量重建。另外是佩戴手套的场景,这是工业数据采集的常见情形。采集时并非裸手作业,操作人员会佩戴各类白手套或橡胶手套,手部形态与裸手存在明显差异,本算法可实现跨模态识别。上述两类场景均为真实异构环境中会遇到的情形,从日常生活到工业场景,我们在这类极端条件下实现零失败重建,提升模型跨域泛化能力。

除场景与算法本身外,我们不仅提供适配一体化方案的算法能力,还搭建更为可靠的评估体系,持续指导算法迭代优化。我们搭建基于光学动捕的真值采集设备,通过预处理对齐与双模块评估,分别对头姿、手部姿态开展测评,并在评估后完成误差溯源与分析。依托亚毫米级真值基准,持续推动算法迭代。我们向客户承诺:我们不仅拥有适配真实落地场景的顶尖重建算法,同时具备一套可信可靠的评估体系。

数据飞轮赋能体系:驱动具身模型迭代与落地升级

完成数据生产环节,我们对数据应用进行了分类。数据可通过三个模块为具身智能赋予能力。第一,具身大脑,提供语义空间理解与任务规划能力;第二,VLA模型,实现跨模态迁移能力;第三,借助3D标签并补充推理、思维链信息,为模型提供未来预测与规划能力。

在该领域,觅蜂不仅打造数据产品、数据管线与数据引擎,也在数据赋能层面开展实践。依托执行、回流、挖掘、更新四个模块构建数据飞轮,实现能力的持续迭代与演进。

下面简要介绍REMORA 任务进度价值模型。该模型的特点为:正向采集阶段主要收集人类操作模仿数据。当模型习得相关能力并落地部署后,还需要解决数据持续采集的问题。对此我们提出三个维度的方案:第一,进度度量,实现数据效果横向对比;第二,错误识别,设计mistake模块,收集推理错误的数据;第三,在后续动作执行时复用失败样本,让数据价值在闭环流转中持续放大。

最后,觅蜂的愿景是让全世界的数据为AI所用,加速智能体时代的到来。

郑重声明:此文内容为本网站转载企业宣传资讯,目的在于传播更多信息,与本站立场无关。仅供读者参考,并请自行核实相关内容。

责任编辑:宋元明清