
“您的AI游戏陪玩已上线”——11月20日,Google DeepMind正式发布第二代通用AI智能体SIMA 2(Scalable Instructable Multiworld Agent),这个能在虚拟3D世界自主游戏、逻辑推理并持续自我提升的智能体,被创始人哈萨比斯直接定义为“通往通用人工智能(AGI)的关键一步”。相较于去年推出的初代产品,SIMA 2通过集成Gemini模型的核心能力,完成了从“指令执行者”到“主动认知者”的质变,为具身AI的发展开辟了新路径。
从“听话”到“思考”:SIMA 2的认知革命
初代SIMA曾以跨越多种商业视频游戏的600余项语言遵循技能惊艳业界,它像人类一样通过“观察”屏幕、操控虚拟键鼠导航,无需调用游戏底层机制,但其本质仍是“被动模仿者”,缺乏深度规划与意图理解能力。而SIMA 2的核心突破,在于构建了“语言→意图→计划→行动”的完整认知链条。
这种认知升级源于Gemini模型的深度赋能。作为SIMA 2的核心推理引擎,Gemini让智能体具备了多步骤逻辑分析能力:面对“寻找篝火”这类指令,它不再是盲目尝试,而是会先解析目标意图,规划“定位地形→识别可燃物→搭建篝火”的行动路径,甚至能实时向用户解释“我需要先找到树木获取木材,再利用打火石点火”的执行逻辑。在MineDojo(《我的世界》研究版)和维京生存游戏ASKA等未训练过的全新环境中,SIMA 2的任务成功率较初代实现数倍提升,彻底摆脱了对特定场景训练数据的依赖。
认知链对比:SIMA 1 vs SIMA 2
SIMA 1:接收指令→直接执行(如“左转”“爬梯子”等单一动作),无主动规划
SIMA 2:接收指令→解析意图→制定计划→分步执行→实时反馈,形成完整闭环
三大核心优势:泛化、多模态、自进化
除了推理能力的质变,SIMA 2在泛化适配、多模态交互和自我提升三大维度实现了突破性进展,成为当前3D世界能力最强的AI智能体。
1. 跨场景泛化:从未见过的世界也能自适应
为测试泛化能力极限,DeepMind将SIMA 2与3D世界生成工具Genie 3联动——后者可通过单张图片或文本生成全新的实时虚拟环境。测试结果显示,即便面对完全陌生的生成世界,SIMA 2仍能快速定位自身位置、理解用户指令并采取有效行动。其关键在于“概念迁移学习”能力,例如能将《我的世界》中的“采矿”逻辑,无缝应用到其他游戏的“收获”场景中,这种能力已接近人类的认知泛化水平。
2. 多模态交互:看懂草图、读懂表情符号
SIMA 2打破了单一文本指令的限制,实现了多模态交互的全面升级。用户不仅能通过文本、语音下达指令,还可直接在屏幕绘制草图(如画一个宝箱示意寻找目标),甚至使用表情符号(如用🔥代表篝火),智能体都能精准解读并执行。这种跨模态理解能力,使其从“工具”向“伙伴”的定位转变,交互体验更接近人类协作。
3. 自我进化:无需人类数据也能持续变强
最具颠覆性的是SIMA 2的自我提升机制。在初始阶段通过人类演示视频学习后,它可切换至“自我导向学习”模式,通过试错实践+Gemini反馈的闭环,在全新游戏中自主积累技能,且无需额外人类标注数据。DeepMind测试显示,经过多代迭代后,SIMA 2能在ASKA等游戏中完成初代无法实现的复杂任务,这种“自我迭代的良性循环”,为开放式学习的通用智能体奠定了基础。
不止游戏:为物理世界AI铺路
尽管SIMA 2的测试场景集中在虚拟游戏世界,但其技术价值已延伸至现实领域。DeepMind强调,智能体在虚拟环境中掌握的导航、工具使用、协作执行等技能,正是未来物理世界AI助手的核心“认知构建模块”。例如,在3D游戏中训练的空间推理能力,可直接迁移至家庭服务机器人的路径规划;游戏中的多步骤任务执行逻辑,能为工业机器人的复杂操作提供算法支撑。
当然,作为一项前沿研究成果,SIMA 2仍存在明显局限:处理超长时程复杂任务时推理能力不足、交互记忆窗口有限、对3D场景的精细视觉理解仍需提升。但这些短板并未掩盖其里程碑意义——它首次证实,通过“多世界数据训练+强大推理引擎集成”,能够打造出具备通才能力的AI智能体,而非局限于单一任务的专用系统。
AGI离我们还有多远?
SIMA 2的发布,让“GTA 6先出还是AGI先实现”的玩笑式讨论,成为行业对通用人工智能进程的严肃思考。从技术演进来看,初代SIMA实现“语言到行动”的转化,SIMA 2完成“行动到认知”的升级,下一步将是“认知到自主决策”的突破。DeepMind的研究团队认为,虚拟3D世界是训练通用智能的理想试验场——这里既包含复杂的物理规则与交互逻辑,又能规避现实世界的安全风险。
随着SIMA系列的持续迭代,以及Gemini等大模型与具身智能的深度融合,AGI的实现路径正逐渐清晰。正如哈萨比斯所言,SIMA 2不是终点,而是“通往通用智能旅程中最坚实的一步”,它让人们看到,未来的AI不仅能听懂指令,更能独立思考、自主学习,最终成为物理世界中可靠的智能伙伴。
免责声明:本文仅代表作者个人观点,与每日科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

