wns055
头条
首页 / 头条 / 正文

具身“大脑”之争,不是淘汰赛

来源:盖世汽车 2026-09-21 14:26:45    阅读量:10989   

当前,具身智能赛道正经历清晰的产业重心上移:早期行业竞争主要集中在本体硬件、运动性能层面,如今正加速进入具身“大脑”的技术与商业化较量阶段。

与之伴随的是,“大脑”技术公司密集获投、估值持续攀升,新创业主体持续涌入,技术路线的讨论也从“有没有”转向“谁更优”。

其中,世界模型凭借环境预判能力,以及被业界寄予厚望的因果推演潜力快速崛起,成为行业焦点,也让此前支撑绝大多数落地场景的VLA陷入定位争议,甚至出现了“VLA已死”的激进论调。

那么,世界模型的爆火,真的意味着VLA已经过时了吗?被寄予通用化厚望的世界模型,又是否真的是具身智能的终极答案?

带着这些问题,在近日盖世集团主办的“2026具身感知融合与多模态大模型创新研讨会”上,来自产业链上下游的多位嘉宾展开了讨论。大家给出的观点虽然不完全一致,却共同勾勒出了当下具身“大脑”真实的产业坐标。

从VLA到世界模型

具身“大脑”的技术路线,正从过去两年的VLA占据主导,走向多路线并行。

所谓VLA,即以摄像头图像等多模态观测和自然语言指令为输入,直接输出机器人可执行的动作,把“看懂场景—听懂指令—做出动作”端到端学进一个神经网络。

这一路线的本质是数据驱动的端到端策略,属于模仿学习:从大量演示里学“观测—动作”的映射。

换言之,VLA就像是一个“看到什么、听到什么,就条件反射般动手”的反应式操作员,学的是“这种情况下专家会怎么做”。

由于架构内部少了模块的拼接,VLA的优势很明显:链路短、响应快,对于端侧部署更友好。比如优必选Thinker-VLA,就是主打端侧运行,降低端侧推理成本。

“但VLA也有自己的问题:VLA生成的主要是动作序列,缺乏对物理约束的感知,以及对下一时刻的预测。”睿尔曼智能科技股份有限公司解决方案总监计海锋指出。

这意味着,VLA固然能回答“动作如何稳定执行”,却不擅长回答“动作之后环境如何演化”,特别是缺乏长程规划与因果推理能力,分布外泛化性弱。

而这,恰好是世界模型的先天优势:给定当前状态和一个候选动作,预测世界接下来会发生什么变化,回答“这么做之后会怎样”,并基于这一思考完成与物理世界的交互。

那么,“预测世界”和 “决定动作”具体如何实现?极佳视界给出的答案是:世界生成模型与世界行动模型。

“世界生成模型,是给定一个动作后,预测世界将会发生什么样的变化;世界行动模型的输入输出正好反过来,是给定当前观测,预测接下来应当采取什么样的动作。因此,生成模型和行动模型恰好可形成配对,二者共同构成一个完整闭环。”极佳科技合伙人amp;副总裁毛继明表示。

极佳视界是世界模型路线的坚定实践者。正是基于这一逻辑,目前极佳视界已经建立了“世界生成模型”与“世界动作模型”两大技术体系,其中“世界生成模型”包括面向具身智能的GigaWorld、面向自动驾驶的DriveDreamer以及面向内容创作的一粟YiSu;“世界动作模型”包括通用具身大脑GigaBrain和世界动作模型GigaWorld-Policy。

不过,尽管已经在世界模型领域取得了一系列成果,毛继明认为,当前这一技术路线仍处于发展初期。

此前,在2026世界机器人大会上,极佳视界首次提出通用世界模型L1-L5分级体系:

L1:根据各种输入生成视觉真实的通用视频世界,先让世界“看起来真实”;

L2:生成高效、合理的通用执行动作,实现从“看见未来”到“做出选择”;

L3:生成几何准确的通用空间世界,让世界从像素表面获得几何信息;

L4:生成物理精确的通用物理世界,从空间正确走向因果正确;

L5:生成可长程运营的通用无限世界,让一个世界长期存在、持续反馈。

“其中L1和L2,对应的是GPT-3时刻的状态;进入L3和L4后,我们认为世界模型会进化到第二阶段,此时的世界模型可以支撑智能体完成一系列高难度、长程、需要推理的任务,对应的是当下的Claude时刻,能够切实提供极为强大的生产力,完全进入规模商业化阶段。”毛继明指出。

而到L5时,其认为将是整个世界模型的集大成阶段。届时物理智能体可以实现自我设计、自我制造,甚至自主探索整个物理世界,发现其未知的内容,最终形成自进化状态。

“我们当前基本上还是围绕 L1 和 L2 这两层,来实现公司近期目标。”毛继明表示。

新范式涌现:是重构,不是颠覆

当行业还在为VLA与世界模型谁更接近终局争论不休时,另一批玩家却试图跳过这道选择题。

“我认为范式本身不应该是争论的核心,而应当围绕具身智能的真实开发需求,以及具身智能与信息智能之间的区别,找到真正适配的开发方案——我们该如何更好地认知世界、理解任务,最终让单个动作真正拥有通用性与泛化能力,这才是模型开发的最终目标。”光象实验室首席科学家吕尧表示。

至于模型训练完成后,它的形态更接近VLA还是更接近世界模型,这只是开发后的结果,“而不应该从开发初期就用某种范式来限制模型开发。”

这也是光象科技做物理原生智能时最核心的开发思想,也即是“以终为始”,从底层重构具身“大脑”的模型架构。

据吕尧介绍,光象科技的物理原生智能强调在整个模型开发中,面向智能体与环境交互的需求,在交互中让智能涌现,理解世界将如何变化,动作会产生什么后果,并在学习过程中遵循底层物理规律及安全约束。

“因为人类对物理世界的理解和行为能力仅约10%—20%来自视觉观察与模仿,绝大部分源自真实世界的感知交互与试错反馈。”光象科技创始人兼CEO张涛此前曾指出。

具体而言,光象科技的物理原生智能具备三大基本特征:状态解耦表征、时序因果驱动和物理定律约束,从而让模型更清晰地认知世界,更明确地理解问题,并使学习过程更加稳定。

不过值得注意的是,物理原生智能仍然是以世界模型为核心,并以数据驱动的端到端模型训练为基本架构,但是从世界模型、数据结构和训练算法三个维度,更加深入地考虑物理实体对智能的客观要求,包括物理世界的数据是稀缺的、功能安全性要求是更高的,模型训练是追求稳定性和长期性的。

目前,光象科技已经联合清华大学李升波教授课题组于近期正式发布了第一代物理原生世界模型,即Phi-WM 1.0 ActEffect。据悉,在三项国际机器人操作评测基准上,Phi-WM 1.0 ActEffect均取得了领先成绩。

在物理原生智能路线之外,类脑智能作为另一种技术范式,也开始受到业界关注。

所谓类脑智能,也即借鉴人脑的神经机制与认知架构来构建智能系统,让机器人按生物脑的方式分层感知、决策、反射与学习,代表玩家包括具脑磐石和智平方。

其中具脑磐石,已于近日正式发布了首代类脑认知世界模型Cog-WM 1.0。该模型的内核仍是世界模型,区别在于借鉴人脑认知神经机制、走类脑JEPA路线:不在像素层面生成未来画面,而是在抽象隐空间预测环境状态,并以时空记忆驱动统一架构。

按照具脑磐石的说法,这可以使机器人无需预建地图、无需海量数据,即可在陌生环境完成自主规划、语义导航与操作。

据悉,目前具脑磐石的Cog-WM 1.0已在轮式人形、四足机器人等多构型机器人本体上完成在无预建图条件下即可自主导航与路径规划、时空记忆检索和空间关系问答与寻物等核心能力,并在轮式人形机器人上验证了操作能力,但还未投入规模化商业应用。

而智平方的NeuroVLA,则是在VLA架构上引入人脑“皮层—小脑—脊髓”协同机制:皮层负责语义理解和任务规划,小脑负责高频运动协调与动态修正,脊髓负责毫秒级动作执行与安全反射。

8月底,智平方基于NeuroVLA的AlphaBot 2机器人,已入驻香港兰桂坊酒吧,为顾客提供打鸡尾酒与互动服务。

也就是说,即便是主打物理原生、类脑智能这些“新范式”的玩家,核心基础也仍是世界模型或VLA,而非取代它们。

值得关注的是,在盖世合伙人、研究院副总裁王显斌看来,当前OpenAI、Anthropic 以及国内通用大模型的快速演进,会给专门做具身“大脑”的企业带来很大压力。

“这一领域现在的估值泡沫是比较高的。”王显斌判断。

但他同时认为,这会利好一些专注于把“小脑”做到极致的执行端企业,特别是本体厂商,以及一些做视触觉等感知算法的企业。“因为通用模型企业不太可能在执行端做得特别深。”

融合成共识,落地才是“硬标尺”

尽管具身“大脑”的技术路线还远未收敛,多数头部玩家已经先一步做出选择:不急着选边,先做融合。

背后的原因并不复杂。

让一个模型既负责“想清楚”、又负责“反应快”,本就违背常识:理解一句话、规划一件事可以慢慢想,可接住一个突然滑落的零件、在打滑瞬间站稳,留给“思考”的时间只有几十毫秒。

正是这种对时延和算力的差异化需求,决定了单一模型架构难以通吃各类场景。

计海锋就指出,机器人要真正落地到家庭等各类场景应用,无法依靠单一模型解决问题,需要通过多脑融合,共同构成机器人的“超级大脑”。

“或许未来还会出现更新的技术范式,但我目前的观点是,这几个技术方向要走向融合。”计海锋表示。

不过在产业层面,融合虽然成为共识,模型内部具体“怎么融”,还没有标准答案,谁负责想、谁负责做、谁负责兜底,各家的思考并不一样。

一种做法是,给机器人装上“快慢两个脑子”,各司其职。

在本次论坛的圆桌讨论中,福莱新材AI算法总监廖永兴说得很具体:主大脑承担语义理解、空间认知、任务规划等高维工作,小脑负责运动轨迹拆解、与物理世界互动等快速反应,形成“慢理解”与“快反应”的分层结构。

另一种做法是,让世界模型当“教练”,在训练侧造数据、给预测、当裁判、做物理校验,把能力蒸馏给动作模型;VLA当“运动员”,真正部署上线。

比如极佳视界刚刚发布的GigaBrain-0.7,据毛继明介绍,深度融合了三层算法金字塔:System 1以VLA为基础,主要解决行动和控制问题;System 2以VLM为基础,负责任务理解与规划;System 3则基于世界模型能力,主要负责预测与评估,为机器人提供“预演未来”的能力,提升高难度、长程长尾任务的真机执行成功率和完成速度。

还有一种思路,则主张直接训练一个“既会预判、又会动手”的统一模型,把世界建模、语言推理和动作合成做进同一个网络。

宇树科技9月开源的UnifoLM-WLA-1.0即这一思路。该方案最大的亮点是,在同一多模态模型中融合具身推理、未来动态区域预测与离散动作学习,协同提升空间感知、交互预测与动作生成能力,为后续WLA训练提供统一多模态表征基础。

银河通用的“银河星脑”,也是同样的思考。不同于传统“感知—规划—控制”的三级分离架构,每一层由不同团队用不同技术路线完成,“银河星脑”正致力于把这三层打通为一条神经网络,将多模态感知理解、长程任务规划与实时动作执行深度融合于统一体系。

毕竟,多模块拼接难免会带来信息损耗,一个模型从头管到尾,理论上上限更高。

只是这条路训练最难、验证最少,目前仍处在早期。

更何况,要打造一个上限更高的具身“大脑”,挑战不仅仅在模型层面,还受制于硬件。

宇树工业场景负责人谢一鹏说得很直接:高算力芯片虽好,功耗却远远超过了机器人现有芯片和那块不大的电池所能承受的范围。

在智能汽车领域,过去两年不少车型已经开始搭载多达四块英伟达Orin芯片,甚至Thor芯片,实现高达千TOPS级的算力。但算力这么高的芯片,要装到人形机器人上就会遇到难题:1000TOPS的Thor芯片功耗会达到120W以上,而目前人形机器人所用算力芯片的功耗大多在5W—20W之间,且人形机器人自带的电池容量也十分有限,很难支撑功耗上百W的算力芯片。

由此牵扯出另外一个问题:具身机器人的“大脑”究竟应该放在云端还是端侧?

这个问题,目前同样没有标准答案。

但分工的雏形已然清晰:端云结合,高频动作控制留在端侧,大规模训练与长程推演留在云端。

如果未来功耗墙不突破,“ 重模型上云、轻策略上端” 的混合部署,大概率会是长期形态。

更长远来看,王显斌认为,未来真正的通用大模型领域,可能只有头部科技公司、一部分车企,以及那些具备资源和人才能力的本体厂商才能跑通,很多初创的、真正做通用大模型的企业压力会比较大。

“但在非常垂直的领域里深耕的企业,我们认为仍有很多胜出的机会。”王显斌表示。

声明:以上内容为本网站转自其它媒体,相关信息仅为传递更多企业信息之目的,不代表本网观点,亦不代表本网站赞同其观点或证实其内容的真实性。投资有风险,需谨慎。

493