
2025年11月10日,斯坦福大学教授、AI领域泰斗李飞飞发表长篇博客《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》(从语言到世界:空间智能是AI的下一个前沿),为全球AI发展指明新方向。这位ImageNet数据集的缔造者、现代计算机视觉的奠基人,在深耕AI领域25年后明确提出:以大语言模型(LLM)为代表的现有AI技术已触及瓶颈,而“空间智能”将成为突破这一局限、重塑未来十年AI发展的核心引擎。
破题:现有AI的“致命短板”——脱离现实的“黑暗文匠”
李飞飞在文中对当前AI发展现状作出精准判读:生成式AI虽已渗透至数十亿人的生活,能生成连贯文本、逼真图像乃至短视频,但其本质仍是“黑暗中的文匠”——精通语言表达却缺乏对物理世界的真实感知,掌握海量知识却无法与现实场景深度互动。这一短板直接导致三大核心目标难以实现:自主机器人未能走进日常生活、AI加速科研的愿景尚未落地、赋能人类创造者的智能工具仍显稚嫩。
这种局限的根源,在于现有AI缺乏人类认知的核心脚手架——空间智能。李飞飞以日常场景举例:停车时判断车尾与路缘的距离、半睡半醒间精准倒咖啡、消防员在坍塌建筑中判断险境,这些看似本能的行为,背后是人类通过感知与行动构建的空间认知体系。而当前最先进的多模态模型,在距离估算、物理规律预测等基础任务上表现仅略高于随机水平,生成的视频数秒后便会失去逻辑连贯性,根本无法支撑复杂的现实交互。
核心定义:空间智能——连接感知、想象与行动的认知根基
在李飞飞的研究框架中,空间智能并非简单的“视觉识别+空间定位”,而是支撑人类与世界互动的底层认知能力,其核心价值体现在三个维度:
生存与交互的基础能力
从生物进化视角看,空间智能是智能演化的起点。早在语言出现前,原始生物通过感知光线、触感构建的空间认知,便搭建起生存与环境互动的桥梁。人类婴儿在学会说话前,正是通过触摸、爬行、玩耍等空间互动认识世界,这种“感知-行动”循环构成了智能发展的核心链路。
想象力与创造力的源泉
空间智能是人类创造活动的底层支撑。从史前洞穴壁画到现代电影、电子游戏,所有叙事性创作都依赖于脑海中构建的虚拟空间;工程师通过三维建模发明珍妮纺纱机,沃森和克里克借助物理模型发现DNA双螺旋结构,这些突破都源于对空间关系的精准把控与想象。
文明进步的关键驱动力
历史上重大科学突破往往离不开空间智能的赋能。古希腊学者埃拉托色尼通过测量不同地区的日影角度,仅用几何推理便计算出地球周长;工业革命时期的机械发明、当代的数字孪生技术,本质都是空间智能在不同时代的技术具象化。
破局路径:构建具备三大核心能力的“世界模型”
李飞飞指出,实现空间智能的关键,是构建超越现有LLM的“世界模型”——一种能理解、推理、生成并交互虚拟与现实世界的新型生成式模型。这种模型必须具备三大核心能力,才能真正模拟人类的空间认知逻辑。
生成性:创造逻辑自洽的世界
世界模型需能生成在感知、几何、物理层面保持一致的虚拟世界,无论是还原现实场景还是创造奇幻空间,都必须遵循内在的物理规律与动态逻辑。例如生成一段“杯子掉落”的视频,不仅要呈现视觉上的逼真效果,还需符合重力作用下的运动轨迹、碰撞后的破碎形态等物理规则。更重要的是,模型对当前世界状态的理解,必须与历史状态保持连贯,避免出现逻辑断层。
多模态性:融合全维度感知输入
与人类通过视觉、听觉、触觉等多渠道感知世界一致,世界模型需具备处理图像、视频、文本、手势、动作等多模态输入的能力。当输入信息不完整时(如仅提供文本描述“红色圆形物体”),模型应能补全缺失信息,生成符合语义与物理规则的完整世界状态。这种多模态交互能力,让AI能通过人类熟悉的方式理解指令,打破单一输入形式的局限。
交互性:实现“动作-状态”的动态反馈
世界模型的核心突破在于动态交互——当输入包含动作指令(如“推动桌子”)时,模型需能精准生成世界的下一状态(桌子移动的距离、姿态变化及可能的连锁反应)。进阶阶段,模型还需具备“目标导向”的推理能力,例如输入“将杯子放到书架上”,模型不仅要预测动作后的世界状态,还需规划出实现目标的具体步骤(伸手、抓取、移动、放置等)。
攻坚方向:三大技术壁垒与前沿探索
构建世界模型的难度远超现有AI技术,李飞飞结合其创立的World Labs研究实践,提出了当前亟需突破的三大技术方向:
通用训练任务函数研发
现有LLM以“下一token预测”为核心任务函数,简洁且高效,但世界模型需处理几何、物理等多维信息,亟需一种能反映空间规律的通用任务函数。例如通过“场景连贯性预测”任务,让模型学习不同物体间的空间关系与物理约束,为多模态信息融合提供统一目标。
复杂训练数据体系构建
世界模型需要的不仅是互联网上海量的图像视频数据,更关键的是从中提取深层空间信息的算法。例如从二维视频帧中还原三维空间结构、解析物体运动的物理参数。此外,高质量合成数据、深度信息、触觉数据等特殊模态数据,将在模型训练的关键阶段发挥重要作用。
新型模型架构创新
现有MLLM和视频扩散模型将数据离散为一维或二维序列,难以处理三维空间关系。李飞飞团队研发的实时生成帧模型(RTFM)已展现新方向——以空间锚定的帧作为记忆单元,在保证生成连贯性的同时实现实时交互。未来还需探索具备三维感知能力的分词机制、动态记忆模块,让模型能高效处理空间信息。
结语:空间智能开启AI的“现实联结”时代
李飞飞在文末重申,空间智能的价值远超技术突破本身——它将让AI从“语言世界”走进“物理现实”,实现从“辅助创作”到“深度交互”的跨越。当机器人能精准理解家居空间完成家务、AI能模拟分子结构加速新药研发、创作者能在虚拟空间中直观构建创意,AI才能真正成为赋能人类的伙伴。
正如ImageNet推动计算机视觉爆发一样,李飞飞相信,空间智能的突破将开启AI的下一个黄金十年。而这一切的起点,正是对“世界模型”的持续探索——让机器像人类一样,通过感知、想象与行动,真正理解我们所处的世界。
免责声明:本文仅代表作者个人观点,与每日科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

