VLA、世界模型、多模态——Superfluid Lab到底在“炼”什么丹?

2026-07-31 17:50:09 来源:中国企业家日报
        【每日科技网】

  Superfluid Lab这个名字挺抽象,这是元戎启行打造的国内首个面向物理世界基础能力研究的 AI Lab,名字取自物理学里的“超流体”——一种摩擦力接近于零的物质状态。但它的技术方向其实很具体。

  核心就一件事:训练一个能够理解物理世界的通用基础模型。

  从“分科教学”到“整体理解”

  先说说以前的智驾系统是怎么做的。

  接近“分科教学”——识别车辆是一门课,预测轨迹是一门课,规划路线又是另一门课。工程师把这些能力分别训练出来,再拼成一套系统。

  这种方式的问题在于:每个模块都只负责自己那一亩三分地,缺乏对全局的理解。就像一个球队,前锋、中场、后卫各自练各自的,上了场才发现配合不起来。

  基座模型的思路不一样。它先教机器理解世界——通过海量数据学习物体、空间、运动和因果关系,再把这些理解迁移到不同任务中。

  遇到一个此前没专门训练过的场景,模型也有机会根据已有认知作出判断。

  这就是大模型和小模型的本质区别。小模型更像条件反射——见过的东西能处理,没见过的就抓瞎。大模型追求的是认知智能——理解规律,然后举一反三。

  元戎在GTC上展示的VLA基座模型有约400亿参数规模。但参数规模只是表象,真正的差异在于架构的统一——驾驶决策、场景理解、行为评估全部放在同一套模型里,而不是多个模块拼接。

  具体研究什么?

  Superfluid Lab聚焦三个技术方向:VLA模型、世界模型、多模态理解。

  VLA视觉-语言-动作模型把视觉感知、语言理解和动作执行揉在一起。以前的车只能“看”,VLA能让车既“看”又“理解”还能“行动”。

  举个具体的例子:看到一块“前方施工”的牌子,传统系统只做文字识别,VLA能理解“施工”意味着什么——前面可能有障碍物、车道可能变窄、可能需要减速变道。理解语义,然后转化为行动。

  世界模型解决的是“世界会怎么变化”的问题。

  传统自动驾驶的逻辑是“看见什么就应对什么”——看见一个人就刹车,看见一辆车就绕行。这是反应式的。

  世界模型追求的是预测式的——理解物理世界的因果规律,提前预判接下来会发生什么。

  一个塑料袋滚到路中央和一块石头滚到路中央,后果完全不同。塑料袋可以碾过去,石头得绕开。一个真正理解物理世界的模型,应该能区分这两种情况,而不是看见“有东西”就一律刹车。

  元戎在模型预训练阶段采用了视频预测任务来让模型理解世界——视频的每一个像素都能作为监督信号,数据利用率达到100%。这意味着模型不只是“看”视频,而是在学习“视频里的世界接下来会怎么变”。

  多模态则是把视觉、语言、传感器数据等各种信息融合起来,让模型对世界的理解更全面。

  一个更难定义的目标

  Superfluid Lab的定位文件里有一句话:不局限于单一应用场景,致力于打造支撑具身智能、机器人控制与真实环境交互的通用AI基座。

  翻译一下:这套模型不光给车用。

  车只是一个载体,一个验证场景。真正想做的,是一个能理解物理世界、能在物理世界里行动的通用智能。将来机器人、无人机、机械臂都能用同一套底层能力。

  这就是为什么元戎说自己的长期愿景是成为“物理世界的AI基础设施”——“就像通信、电力一样,成为支撑现实世界运行的基础能力”。

  通信和电力没人会天天念叨,但离了它们什么都不转。元戎想做的就是这个——让AI理解并作用于物理世界的能力,变成像水电一样随时可调用的东西。

  为什么元戎能做这件事?

  一个关键条件是数据。

  元戎已经有超过50万辆量产车在路上跑。研究人员的模型可以面对持续变化的真实交通环境,可以观察一个判断怎样变成车辆动作,也可以看到算法在真实世界中犯下的错误。

  对于研究物理AI的人来说,这是一套规模庞大的真实世界实验装置。其他AI实验室很难复制这个条件——他们没有这么多车在真实世界里跑。

  从开车到理解世界

  元戎的计划是:先让模型学会开车,完成之后再把模型从汽车迁移到更多机器和场景中。

  能够应对开放道路的模型,才有资格进入更多物理场景。智驾因而成为物理智能的试金石——负责验证能力,却不再限定能力的边界。

  Superfluid Lab因此不是传统意义上的智驾研发部门,也还不是一家独立的基础模型公司。它处在两者之间,借用商业化业务积累的资源,寻找超出业务边界的答案。

  一个塑料袋和一块石头有什么不同?这个问题看似简单,但让机器理解其中的物理差异,需要的是对世界本质的认知。

  Superfluid Lab就在做这件事。

免责声明:本文仅代表作者个人观点,与每日科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
    本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

VLA

猜你喜欢

千匠网络实践:如何让大模型从“能用”走向“好用”

过去两年,几乎所有上规模的企业都接入了大模型。智能客服、知识问答、AI助手——这些应用已经算不上新鲜事。但在演示会议室与真实业务场景之间,一个显著落差正在浮现:能聊天,但不理解企业业务语境;能生成内容

千匠网络

4天前

海能达发布全新专业防爆PDT对讲机CH690Ex

随着我国应急管理体系持续完善,消防救援任务正在从传统火灾处置,向化工园区事故、危险品泄漏、地下空间救援、大型综合灾害等多风险、多场景方向发展。在这些复杂环境中,救援现场往往面临爆炸性气体、可燃性粉尘、

3周前

海能达CCW 2026载誉收官:AI与融合通信引领专用通信新未来

6月16日至18日,2026年全球关键通信展(CCW2026)在英国伦敦举行。展会期间,海能达集中展示了从终端到系统、从感知到决策的全链路创新版图,AI与融合通信产品及解决方案贯穿三天展期,持续获得高

1个月前

登陆欧洲 Intersolar!远景AI电力系统支撑全球 AI 算力发展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,远景科技集团发布面向AI数据中心的下一代电力基础设施——融合风光储一体化方案、固态变压器(SST)、800V直流供电、储能

1个月前

海能达六度问鼎ICCAs,PDC650与西安机场方案摘得双奖

6月17日,2026年国际关键通信奖(InternationalCriticalCommunicationsAwards,ICCAs)在英国伦敦举行的全球关键通信展(CCW2026)期间正式揭晓。海能

1个月前

海能达即将亮相2026年CCW全球关键通信展: 携AI与融合通信解决方案登陆伦敦

6月16日至18日,2026年CCW全球关键通信展将在英国伦敦启幕。作为全球领先的专用通信解决方案提供商,海能达将以全场景关键通信产品矩阵亮相F25展位,集中展示面向公共安全、应急救援、城市治理等领域

1个月前