眼动追踪如何补齐具身智能训练中的"视觉注意"信息

2026-09-16 11:14:10 来源:MBACHINA
        【每日科技网】

  机器人领域,最羡慕AI大语言模型领域的什么?答案是:数据。对于大语言模型而言,互联网本身就是一座巨大的“数据宝库”。文本、图片、视频等内容大量存在于网络之中,可以持续为模型训练提供素材。但机器人面对的世界完全不同。机器人要学习的不是一句话、一张图片,而是如何在真实物理世界中完成一件事情:看到桌上的杯子,判断它的位置;找到需要整理的物品,决定先拿什么、放在哪里;面对不同的环境和物体,调整自己的行为。这些发生在真实世界中的交互数据,并不会天然存在于互联网中。这正是具身智能发展过程中正在面对的数据缺口。

  数据,正在成为具身智能发展的重要基础

  从当前行业的数据积累来看,高质量机器人训练数据的获取,需要投入大量的设备、时间、人员和真实场景。公开数据显示,即便是行业领先的机器人团队,获取高质量训练数据也并不容易。Google DeepMind 在相关机器人研究中,曾使用13台机器人持续采集17个月,获得超过13万条机器人操作数据。为了进一步扩大真实机器人数据规模,谷歌随后,相关研究团队整合60个已有数据集、覆盖22种机器人形态,并汇集34个机器人研究实验室的数据,形成超过100万条机器人操作数据。即便如此,与机器人未来需要面对的大量任务和复杂场景相比,数据覆盖仍然存在较大空间。这背后的原因并不难理解。

  真正有价值的机器人数据,往往来自真实世界。

  机器人学习的不只是“怎么做”,还有“先看什么”

  人类完成任务时,动作只是最终呈现出来的一部分。拿取一个杯子之前,我们会先找到杯子;整理桌面时,会在不同物品之间不断切换注意力;制作饮品时,会根据任务进程关注不同的材料和工具;进行分拣或设备操作时,也会持续观察环境,并根据看到的信息调整下一步行为。也就是说,人的视觉注意,本身就参与了任务决策。但在传统的视频数据中,我们通常只能看到“人做了什么”,却很难直接知道“人当时在关注什么”。

  随着具身智能训练逐渐从单纯的动作学习走向更加复杂的任务理解,第一视角(Egocentric)和以人为中心(Human-Centric)的数据开始受到行业关注。第一视角数据能够更加贴近执行者实际看到的世界,而人类任务过程所包含的视觉关注与行为信息,也成为具身智能数据探索中的重要方向。这也让眼动追踪有了新的价值。

  从眼动追踪,到具身智能训练数据

  在真实任务中采集人类第一视角数据,并同步记录视觉注意过程,可以进一步呈现人在完成任务时的关注变化,为具身智能训练增加来自人类注意力与认知先验的数据维度。这不是把眼动数据简单“加进”机器人训练,而是从人的行为出发,尝试回答一个更基础的问题:

  机器人如果要学习人类如何完成任务,是否也需要知道人类是如何观察任务的?

  基于这一思路,七鑫易维正在将长期积累的眼动技术能力进一步延伸至具身智能领域,推出具身智能训练数据采集服务。依托千万级眼动数据库以及十余年眼动追踪技术积累,七鑫易维将真实场景中的眼动采集经验与具身智能训练需求连接起来,为相关企业、高校及科研机构提供训练数据采集服务。

  千万级眼动数据库,是长期积累,而非短期建立

  对于数据采集服务而言,真正的能力并不只是“拥有设备”。十余年的眼动追踪技术实践,让七鑫易维逐步形成了从设备到采集、从技术到项目经验的长期积累,并建立起千万级眼动数据库。在此基础上,七鑫易维具备多类型、大批量眼动设备,可支持规模化数据采集;同时,长期的全场景采集经验,也为不同任务和真实环境下的数据生产提供了基础。当然,具身智能数据需求越来越大,对数据服务的稳定性也提出了更高要求。十余年来,七鑫易维形成了四项核心能力:

  深耕十年·经验沉淀

  长期深耕眼动追踪领域,积累全场景数据采集经验。

  技术积累 · 持续优化

  基于多年眼动追踪技术实践,不断优化数据采集流程与项目执行效率。

  多模同步·灵活扩展

  支持人体运动、触觉、头部姿态等多模态数据同步采集,可根据不同场景灵活扩展。

  设备充足·稳定供给

  拥有多类型、大批量眼动数据采集设备,为规模化数据采集提供稳定基础。

  具身智能的下一步,需要更多“人的数据”

  今天,机器人数据领域正在探索多种路径。真机数据能够提供真实的物理交互,仿真数据能够扩大训练规模,动作捕捉能够记录人体运动,而互联网视频则提供了大量真实世界信息。不同类型的数据各有价值,也各有局限,行业仍在不断探索更加合适的数据组合。而眼动追踪提供的,是另一个维度:人类在真实任务中的视觉注意。对于七鑫易维而言,从千万级眼动数据库,到十余年技术积累,再到具身智能训练数据采集服务,是眼动技术能力向新应用场景的一次自然延伸。当机器人开始越来越多地进入家庭、餐饮、物流、工业等真实环境,数据将不仅决定机器人“能不能学”,也将影响机器人“能学到什么”。七鑫易维希望以眼动追踪为切入点,持续积累真实世界中的人类行为数据,为具身智能训练补充更多来自人的视角。机器人要学会在真实世界中行动,也许首先需要更多地了解人类是怎样在这个世界中观察、判断与行动的。

免责声明:本文仅代表作者个人观点,与每日科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
    本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

猜你喜欢

从一颗模组到一个平台,澜存科技如何让 AI 进入真实终端

近日,上海澜存科技有限公司宣布完成数千万元Pre-A轮股权融资,本轮投资方为锡创投,拓界资本担任独家财务顾问。继2026年4月完成由凡创资本领投、申冉基金跟投的天使轮融资后,澜存在三个月内连续完成两轮

2周前

余承东体验首款阔直板华为Pura X View:越用越爱用 爱不释手

华为常务董事、产品投资评审委员会主任、终端BG董事长余承东分享了他对首款阔直板华为PuraXView的使用体验。他表示,自己已经使用这款手机超过一个月,越用越爱,爱不释手。余承东回忆,刚拿到这部手机时

千匠网络实践:如何让大模型从“能用”走向“好用”

过去两年,几乎所有上规模的企业都接入了大模型。智能客服、知识问答、AI助手——这些应用已经算不上新鲜事。但在演示会议室与真实业务场景之间,一个显著落差正在浮现:能聊天,但不理解企业业务语境;能生成内容

千匠网络

1个月前

海能达发布全新专业防爆PDT对讲机CH690Ex

随着我国应急管理体系持续完善,消防救援任务正在从传统火灾处置,向化工园区事故、危险品泄漏、地下空间救援、大型综合灾害等多风险、多场景方向发展。在这些复杂环境中,救援现场往往面临爆炸性气体、可燃性粉尘、

2个月前

海能达CCW 2026载誉收官:AI与融合通信引领专用通信新未来

6月16日至18日,2026年全球关键通信展(CCW2026)在英国伦敦举行。展会期间,海能达集中展示了从终端到系统、从感知到决策的全链路创新版图,AI与融合通信产品及解决方案贯穿三天展期,持续获得高

2个月前

登陆欧洲 Intersolar!远景AI电力系统支撑全球 AI 算力发展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,远景科技集团发布面向AI数据中心的下一代电力基础设施——融合风光储一体化方案、固态变压器(SST)、800V直流供电、储能

2个月前