银河通用实测GPT-6 Astra之后,中国具身智能应该看什么?

2026-09-18 18:07:45 来源:中电网
        【每日科技网】

  桌面上散落着一组数字木块,机器人需要理解数字大小,把它们从左到右排列成尽可能大的数字,并调整好每块木块的方向。

  这道题看起来不复杂,但对靠模仿轨迹训练的具身模型却很难。机器人不仅要复现动作,还要记住刚才的顺序,理解数字大小,最后才是伸手摆放——它得先想清楚,再把想法变成动作。

  OpenAI最新发布的GPT-6 Astra,在这类任务中展现出了明显不同的能力。一份由中国团队完成的第三方评测,把Astra放进机器人仿真环境,测试它能否理解任务、操控机械臂,以及在失败后自行恢复。

  报告很快在GitHub公开,而完成这项评测的团队中,就有银河通用的研究员。

  为什么是银河通用率先发现

  9月12日,技术报告《GPT-6 Astra as an Embodied Policy》开源。公开作者信息显示,银河通用研究员苏佳奕为共同第一作者之一,张直政和王鹤为通讯作者。

  从GPT-6 Astra发布到报告公开,前后不到两周。短时间内完成任务选择、实验对齐、轨迹评估和报告整理,靠的不只是反应速度——评测环境、控制工具和数据分析方法必须提前建好,新模型发布后才能迅速接入。

  这正是银河通用此次值得关注的地方。外界通常通过机器人本体和应用案例认识一家具身智能企业,仿真评测体系却不容易被看见。它像埋在水下的基础设施,平时负责训练、验证和寻找模型边界,等到新模型出现,才显示出价值。

  需要说明的是,这不是OpenAI官方评测。报告是在RoboDojo和RoboLab仿真环境中完成的第三方实验,结果反映的是特定任务、特定设置下的模型表现,不能直接外推到所有机器人和现实场景。

  报告把GPT-6 Astra放在两种模式里测试。一种是Direct模式,由Astra直接生成机械臂末端动作;另一种是混合模式,先由具身模型π₀.₅提出动作,再让GPT-6判断是否需要纠偏。

  在RoboDojo选取的10项双臂任务中,混合模式获得48%的成功率,GPT-6AstraDirect为26%。这组结果说明,通用大模型擅长理解目标和判断对错,具身模型则提供更接近物理交互的动作经验,两者配合比让GPT单独完成所有动作更稳定。

  更吸引眼球的是RoboLab补充实验。报告选取10项单臂Franka任务,每项测试5次。在这个特定的零样本任务子集里,GPT-6AstraDirect在50次测试中成功49次,混合模式成功46次,π₀.₅成功18次。

  49/50是一个很强的结果,但边界也要写清楚:它来自报告选定的RoboLab任务子集,任务以语义识别、抓取和放置为主,不等于GPT-6在所有陌生机器人任务上都达到98%的成功率。

  真正值得注意的,是它在语义理解和失败恢复上的表现。机器人能按语言区分目标物,记住排序要求,也能在发现任务未完成后回头检查。这说明通用大模型正在把数字世界里的推理、视觉理解和纠错能力带进物理任务。

  能完成任务,不等于能把活干好

  成绩亮眼,不代表机器人已经可以直接由超大模型接管。

  报告显示,涉及搭塔、杠牌等精细接触任务时,GPT-6 Astra Direct表现明显下降。理解“要做什么”和稳定完成动作是两回事:前者依赖语义和视觉判断,后者还涉及力控、接触稳定性、实时反馈和本体性能。

  仿真环境与真实世界还有一个关键差异。该评测按控制回合运行,模型返回动作之前,仿真环境无需像真实流水线一样持续推进;报告统计的物理执行时长也不包含模型响应延迟。但工厂里的流水线,不会停下来等云端回复。

  按照此次评测采用的云端调用方式,GPT-6 Astra尚未体现直接端侧部署能力,进入真实产线还要面对响应延迟、网络稳定性和推理成本等问题。

  因此,这次评测给出的结论更接近“强,但不完整”:GPT-6在任务理解和陌生场景泛化上显示出优势,动作质量、实时控制和端侧部署仍要依靠具身模型、本体系统和工程优化。

  据业内人士估算,OpenAI自2025年起通过数据采集渠道购买的具身数据可能达到千万小时量级,相关数据与算力投入可能达到百亿元人民币级别。这不是 OpenAI 官方披露的数据,但多个信源交叉印证了同一个方向:OpenAI 在2025年初于旧金山悄悄搭建了人形机器人实验室,最初雇用约100名数据采集员,通过远程操控机械臂执行叠衣服等任务;到2026年,实验室规模已扩大四倍多。9月3日,山姆・奥特曼公开确认OpenAI正在做人形机器人,招聘页面上同时开放了19个机器人相关岗位,其中至少4个聚焦执行器 —— 这是一家公司要做硬件、而不只是做模型的信号。

  资本的下注更加直接。Figure AI 在2025年9月完成超10亿美元C轮融资,估值从一年前的26亿美元飙升至390亿美元,成为全球估值最高的人形机器人公司。2026年9月,Figure AI又承诺投入35亿美元租用算力,与Nscale合作获取最多10万GPU。具身智能模型公司 Physical Intelligence 在 2025年11月完成6亿美元融资后估值达56亿美元,后续报道显示其估值已进一步冲到110亿美元。

  这些数字放在一起,勾勒出的是一种“用资本密度买时间”的竞争方式:美国公司在模型、数据、算力和本体上同时重兵投入,试图把大模型时代积累的能力,平移到物理世界。

  中国的胜负手,不只是更大的模型

  面对这样的投入规模,中国首先要补长期投入,但不能只学对方堆算力、买数据。

  具身智能同时涉及大脑模型、运动控制、本体硬件和真机数据,任何一环短缺都会影响最终表现。2026年的政府工作报告提出建立未来产业投入增长和风险分担机制,相关政策也在推动国有企业开放真实场景,让耐心资本承担更长周期的研发风险。

  更关键的是,要把中国的制造业场景真正用起来。

  在西门子数控(南京)有限公司电子工厂,银河通用重载机器人已经进入表面贴装生产线,承担主板搬运工作。据央视财经报道,该产线每月需要搬运的主板总重量约18万公斤。机器人可承载50公斤负载,并通过动态环境感知识别物料位置变化,在真实车间中连续作业。

  传统定制化AGV也能搬运物料,但往往需要增加控制逻辑、定位设施和硬件投入,适用任务相对固定。西门子南京工厂相关负责人认为,人形机器人无需大幅改造现有设备,同时保留扩展更多技能的可能性。

  这个案例把中国的场景优势说得很具体。机器人完成一次动作,只能证明技术可行;在既有产线中持续运行,才会形成关于光线变化、物料偏移、人员干扰和设备磨损的真实数据。这些数据再回流模型,才能推动下一轮迭代。

  银河通用与宁德时代的合作,又把这条路径向规模化推进了一步。2026年3月,GalbotS1通过宁德时代产线验收,随后在模组与电池包生产环节开展7×24小时常态化作业,并从试点逐步扩展到近百台部署。

  西门子检验的是机器人能否进入复杂的既有工厂,宁德时代检验的是同一套能力能否长期运行、批量复制。中国要对冲海外巨头的高投入,不能只比模型参数,更要把硬件、数据、模型和应用连成闭环。

  而这个闭环长什么样,银河通用恰好提供了一个观察样本。

  评测端,它能够较快完成GPT-6Astra的系统测试;模型和数据端,它持续建设具身大模型、仿真平台及数据基座;产业端,机器人已经进入西门子南京工厂和宁德时代产线,在真实作业中接受稳定性和规模化检验。

  这几项能力不能互相替代:评测让企业看清模型边界,工厂检验模型能否转化为生产力,持续运行又为下一轮训练提供数据。

  最近具身智能行业围绕出货量、收入和项目成色出现不少争议。讨论可以继续,但评价标准应尽快回到可核验的事实。新华财经在调研中提出,要把竞争拉回模型能力、数据沉淀和工程落地。西门子每月18万公斤的搬运需求、宁德时代7×24小时作业和近百台部署,正是比口号更有价值的指标。

  GPT-6 Astra让行业看到海外大模型向物理世界推进的速度。中国要做的,是集中资源补足模型和数据能力,同时把真实工厂变成持续运行的训练场。多干事、少争吵,力气最终要落在技术和产线上。

免责声明:本文仅代表作者个人观点,与每日科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
    本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

猜你喜欢

从一颗模组到一个平台,澜存科技如何让 AI 进入真实终端

近日,上海澜存科技有限公司宣布完成数千万元Pre-A轮股权融资,本轮投资方为锡创投,拓界资本担任独家财务顾问。继2026年4月完成由凡创资本领投、申冉基金跟投的天使轮融资后,澜存在三个月内连续完成两轮

2周前

余承东体验首款阔直板华为Pura X View:越用越爱用 爱不释手

华为常务董事、产品投资评审委员会主任、终端BG董事长余承东分享了他对首款阔直板华为PuraXView的使用体验。他表示,自己已经使用这款手机超过一个月,越用越爱,爱不释手。余承东回忆,刚拿到这部手机时

千匠网络实践:如何让大模型从“能用”走向“好用”

过去两年,几乎所有上规模的企业都接入了大模型。智能客服、知识问答、AI助手——这些应用已经算不上新鲜事。但在演示会议室与真实业务场景之间,一个显著落差正在浮现:能聊天,但不理解企业业务语境;能生成内容

千匠网络

1个月前

海能达发布全新专业防爆PDT对讲机CH690Ex

随着我国应急管理体系持续完善,消防救援任务正在从传统火灾处置,向化工园区事故、危险品泄漏、地下空间救援、大型综合灾害等多风险、多场景方向发展。在这些复杂环境中,救援现场往往面临爆炸性气体、可燃性粉尘、

2个月前

海能达CCW 2026载誉收官:AI与融合通信引领专用通信新未来

6月16日至18日,2026年全球关键通信展(CCW2026)在英国伦敦举行。展会期间,海能达集中展示了从终端到系统、从感知到决策的全链路创新版图,AI与融合通信产品及解决方案贯穿三天展期,持续获得高

2个月前

登陆欧洲 Intersolar!远景AI电力系统支撑全球 AI 算力发展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,远景科技集团发布面向AI数据中心的下一代电力基础设施——融合风光储一体化方案、固态变压器(SST)、800V直流供电、储能

2个月前