机械降神:基于感知、决策和执行的具身智能技术与发展调研报告
引言 在《我们赖以生存的隐喻》一书中,作者指出语言和思维基于身体经验的隐喻。比如"急转直下"一词用于代表事情由较好的发展立刻转向不好的发展。它承载了一种暗示,即"下"作为一种具身体验是不好的,这可能与失重感、摔跤有关。具身理论认为,身体状态...
引言
在《我们赖以生存的隐喻》一书中,作者指出语言和思维基于身体经验的隐喻。比如”急转直下”一词用于代表事情由较好的发展立刻转向不好的发展。它承载了一种暗示,即”下”作为一种具身体验是不好的,这可能与失重感、摔跤有关。具身理论认为,身体状态对认知有着深远影响,符号系统的概念基于感知和动作的模拟。在人工智能领域,布鲁克斯提出具身智能概念,强调机器人需要通过身体与环境的互动实现智能。总而言之,智能并非源于孤立的逻辑运算,而是诞生于主体在物理世界中的定位、感知与交互过程。人类之所以具有智能,是因为能够清楚自己在世界中的位置,并通过具身体验做出有效的行为反馈[1]。
人工智能正在进行从”纯文本大脑”向”具身化实体”的根本性转变。如今,多模态大模型或基于多模态大模型的机器人被投入到智能驾驶、工厂生产甚至养老医疗等线下场景中。具身智能也被写入中国政府报告之中[2],被列为”十五五”规划六大未来产业之一。资本市场对具身智能机器人也充满信心:2025 年,中国具身智能市场规模预计达2.99 万亿元,2026 年将增长至3.52 万亿元,年复合增长率超过15%。全球范围内,具身智能市场规模预计从 2025 年的44.4 亿美元增长至 2030 年的230.6 亿美元,年复合增长率高达39%[3]。
具身智能所用的模型需要直接与复杂的环境交互、完成各种复杂的任务,因此也更加需要大模型能够对自己所处的世界进行建模、快速处理各种信息并且做出合理的反应。随着大量的目光投向了具身智能领域,研究人员逐渐形成并完善了”视觉-语言-行动(Vision-Language-Action Model,下文称为VLA模型)“的模型范式。为了理解这三个组块的作用与重要性,我将它们抽象为类似人类认知过程的”感知-推理-行动”框架。
感知,VLA模型不仅要像传统视觉大模型一样能够分辨猫狗、检测人脸,更需要建立其内在的世界模型。比如在智能驾驶的场景中,VLA模型不仅要能够看到眼前的行人和汽车,它该应该意识到转角可能会出现汽车,行人可能即将过马路,还有自己停下车后会怎么影响其他的汽车、离其他车多远不会被刮。这些都要求大模型不仅仅能够看清楚眼前的世界,它还应该理解眼前世界背后的运转逻辑,从而才能在这个世界中如鱼得水,在复杂场景中游刃有余。
推理,VLA模型应该有推理能力,能够处理复杂的问题,同时也意味着它不能产生严重的幻觉、也不想着在不合适的情况下找捷径。VLA模型用于制造、智能驾驶甚至航天航空领域,这些领域本身处理的就是包含复杂的计算与推理的问题,所以强大的推理能力是模型必不可少的。现实环境非常复杂且脆弱,这意味着传统模型常见的错误、甚至是小小的粗心都可能带来可怕的后果。
行动,一方面模型要能够做到知行合一,避免感知、推理与行动的不连贯。另一方面,模型需要配备强大且合适的硬件,且要能够合理地调用这些硬件。因为人类有自主神经系统,它使得我们不需要有意识地思考就能完成上下楼、奔跑、拿取等动作,所以我们往往忽略执行的难度。其实这些行为涉及大量的计算、调整与适应,你只需要去问一下那些因为意外神经受损而不得不做腿部复健的人就知道了。
具身智能是通用人工智能发展道路上充满挑战但是又具有重要意义的一个节点。本报告将聚焦于感知、推理、行动三个模块,分别讲述其目前的研究范式和业内常用的评价标准、较为优秀或者为SOTA的技术,以及其面临的困难与未来的研究方向。我将这三个环节拆开分别讲述,是因为它们各自本身就已经是人工智能领域重要且困难的研究课题;但是在实际中,三者的闭环才是验证具身智能模型能力的唯一途径,所以最后我也将用一个章节介绍,端到端的”感知-推理-行动”具身智能发展的现状和面临的一些挑战。
感知:构建世界模型
范式与评价标准
我们今天的模型已经能够轻松地识别各种物体、提取数据的特征,完成一些简单的感知任务。但是在具身智能领域,我们对VLA模型的感知能力要求更高。对我们人类来说,我们的感知是基于图式的,即我们通过建立对世界的各种模型来处理世界提供给我们的数据。当我们看向埃舍尔的经典作品《瀑布》这幅画时,如果抛弃了世界模型,那么它完全是成立的。它的笔触连贯,结构精巧,无论我正着看、反正看、眯着眼看、张大眼看,它都是没有问题的,但我们始终无法相信这幅画,有一种怀疑在我们心中消散不去,这就是因为我们的大脑已经通过进化以及常年的学习,内置了世界模型。我们对于反重力、反物理的的行为与表征自带警惕。对于一个没有内置世界模型的VLA模型来说,它可能会完全接受这幅画的内容,如果被问到”描述这个场景”或”水在往哪个方向流?“,它可能基于像素模式回答:”水从高处流下,形成瀑布,然后沿着水渠流动”,这就会在实际应用中造成严重的问题,它可能会将自己或者我们困在牛角尖里面。

世界模型在具身智能领域主要扮演两种角色:一种是VLA模型通过学习需要学会的目标,另一种是为了使模型更具竞争力而人工搭建的脚手架。
作为学习的目标,世界模型是否被模型学会,可以用基于人工设定的题目来判断。比如说我们人类已经对物理有了一定的研究,那我们就可以使用我们的领域知识来直接给模型设计物理题并打分。比如WoWBench[4]就是一个测试世界模型能否”想象”物理上合理且符合因果结构的未来事件的评价指标,它能够围绕VLA模型的感知理解(对物体、空间布局和可供性进行准确识别)、预测推理(物体的恒久性、碰撞动力学和轨迹合理性的模拟)等角度进行评价。
但是会做物理题,可能只是因为模型背诵下了公式,它可能并没有真正理解重力的意义,它可能依然缺乏一种世界模型直觉。那么到了月球上,或者重力被扭曲的地方,模型就无法处理这些问题了。这时候可以引入一种技术,叫做反事实生成技术。模型如果有反事实推理能力,它就不仅仅知道有重力的时候是什么样子,它还可以推测,没有重力的时候是什么样子。Inductive Bias Prob[5]就是一个评测模型的反事实推理能力的探针,它针对模型没有见过的情况进行设定、对模型的行为进行观察并且打分。
当世界模型是VLA模型的一个脚手架时,它的目的就是让模型直接接入人类的领域知识框架,从而在原本的任务上得到更好的效果。在这种情况下,可能模型面临的环境并没有那么复杂,或者可以被人类的抽象理论充分地描述。
下面我将介绍具身智能研究中,世界模型作为两种不同的角色,分别有哪些前沿的进展。
相关研究与技术介绍
在研究领域,已经有很多模型通过大量参数堆叠、精心设计的思维链训练和强化学习等技术,能够构建起简单的世界模型。比如OpenAI的Sora和NVIDIA的Cosmos代表了基于扩散变换器(DiT)的大规模视频预训练范式[6]。这些模型展示了通过海量视频数据学习,“涌现”出了所谓的物理直觉,它们生成的视频符合例如重力加速效果和液体流动的视觉真实性等物理规律。博世公司联合上海大学、上交和清华推出的用于智慧驾驶的IRL-VLA[7],以及中山大学和阿里高德公司合作发表的World-Env[8]则都使用了基于强化学习的大模型训练技术,在数据受限和模型规模受限的背景下也同样实现了较好的世界模型内化效果。
将简单的人工设计的世界模型直接引入模型,也能够有效地提升模型的能力。比如我们都知道,其实我们包括机器看到的都是”二维的”,只不过人类大脑是自带透视和3D建模的,而曾经的模型只能看到2D画面,同时也无法进行三维的想象;而中科院与字节开发的3D-VLA[9] 通过引入生成式三维世界模型,将三维点云处理单元与扩散模型结合,使在模型在执行具体的任务前能先想象出目标的几何形状,这就极大提升了空间操作的精度。
困难与未来发展方向
首先,世界模型本身是可以非常复杂的,特别是对真实世界的模拟。这要求模型拥有大量的参数、以及训练过程的进一步优化,相应地,评价指标也需要随之演进,不断地去质问模型到底是学懂了,还是通过巨大参数量记住了答案。不过也有很多的任务其实不需要VLA模型对世界的完整建模,比如Envisioning the Future, One Step at a Time[10]这篇论文将复杂的影像世界生成任务转化为先对动作建模,然后以此为基础进行扩散生成,这就大大降低了需要学习的世界模型的复杂度。这还是要求我们人类在未来的研究与开发中,先形成对特定任务的理解,然后使用一定的领域知识来简化问题。这种方式也可以被认为是前沿世界模型学习框架JEPA的一个变体。该框架放弃像素/Token级重建,专注于抽象表征空间的预测学习。VLA-JEPA[11]便是这一框架在VLA模型上的一次移植成果,它只需要通过少量高质量数据微调,就已经在泛化性和鲁棒性方面相较于现有方法实现了持续的提升。
其次,世界模型要求模型具有强大的记忆能力或者说上下文处理能力。最好大模型还可以通过行动(即完整框架的最后一环)持续学习并内化新的规则,这也将有利于其进行领域迁移。这些都是实现通用人工智能AGI不得不面对的难题。相关方面的研究,比如TrackVLA++[12]已经能够采用门控更新策略,以保留长视野目标记忆,确保时空一致性,并减少长时间遮挡时的目标丢失。但它的下游任务只是捕捉单一目标,这对于大多数实际应用场景需要的VLA模型来说还是远远不够的。
我将世界模型相关的研究粗糙地划分为学习目标和脚手架,这其实不太符合我们真实的体验。比如对人类来说,我们对世界的建模既有一部分来自内嵌于基因的知识,也有一部分来自于对外界的探索。所以未来的研究,也许也可以尝试通过一个简化的世界模型作为基底,鼓励模型学习更加复杂的世界知识。前面提到的World-Env,还有GigaBrain-0.5M*[13]等模型在进行强化学习时使用的打分模型其实就是一个基于人类领域知识的小型物理模型,这些研究取得的可观结果也给这种研究范式进一步的应用提供了背书。WoVR[14]甚至在此基础上更进一步,它通过世界模型-策略共进化保持策略-模拟器的对齐,并没有假设一个忠实的世界模型,而是明确调节了强化学习如何与不完美的想象动态互动,可以在一定程度规避人类领域知识缺陷污染大模型建模的现象。总而言之,世界模型的学习一定得同时依赖于研究者扎实的领域知识于与VLA模型基于参数涌现或创新训练框架的学习能力。
决策:推理与规划
范式与评价标准
决策是一个很复杂的过程,特别是在具身智能领域,因为现实中的很多问题可不能通过二分器来解决。比如我晚上饿了,我需要在点外卖和自己做饭之间决策,这又涉及到时间估计(回归)、在家能做什么(预测)、怎么权衡钱与时间还有人的心情与力量等因素(对比)。对于一个需要加油的智能汽车来说,它也得分多步、权衡多种因素来判断自己需要原地等待相关人员来送油或者拖车,还是可以开到加油站去。
今天的研究者常用的方法包括思维链(CoT)方法。通过思维链的引导,模型能够以符合人类标准或者至少比较清晰的思路去处理、解决问题。思维链可以是潜式的,也可以是显式的。思维链还有一点好处,就是它可以使得模型具有更强的可解释性,从而得到更多用户的信任。
潜式的思维链可能发生在训练阶段,常见的方法有推理迹的有监督训练 (SFT with Reasoning Traces)和过程奖励模型 (Process Reward Models, PRMs)。前者在训练微调阶段给出带有思维过程的高质量数据集,让大模型知道并模仿高质量的思考;后者作为强化学习的一个分支,其在打分阶段不仅仅对结果进行评价,也对模型的解题步骤打分(就像数学考试大题步骤分一样)。潜式的思维方法是人类无法真正查看的,因为我们要么看不到模型在测试的时候有没有输出,要么我们让它将思维输出到</think><think>标签中,但是已经有研究证明模型输出的所谓”思考”不能准确地描述其实际完成的推理过程,因为在这种背景下,模型真正推理的完成就是潜式的[15]。不过我们确实可以通过观看大模型参数的实时状态来得到一些信息,尽管它不是人类能够直接理解的。
显式思维链往往基于人类写定的规则,是比较僵化的。比如Claude Code,它要求大模型先理解任务,然后总结出需要与开发者确认的问题,得到答案后再继续行动。类似的多智能体决策系统通过人为设定的规则与架构,确保一次只完成一个任务,即思考链上的一环。今天Harness工程则讨论的是对于不同的任务,什么样才是最好的显式思维链。为了避免早期就把思维链写死,也有学者开发了自动化的Harness工程工具[16],这就是所谓的元编程。虽然有学者认为,如果底座模型不具有强大的思维能力,那么外设的思维链脚手架意义不大[17],但是通过外设显式思维链还是能够在一定程度上减少模型彻底偏离思维轨道的情况,对于那些强调稳定性与步骤性,而不那么看重创造性的任务来说依然是有价值的。
评价大模型的推理和规划能力,必须要求其能够正确地理解环境,理解自己并且给出合理的行动方案。放在具身智能的背景下,在某个环境中处理问题,就必须考虑其物理可行性。除了在封闭世界假设下解决规划任务外,模型还应该要可以处理信息不完整时的规划,例如通过探索场景、建议替代方案或提供部分计划来处理缺失对象的任务[18],同时保证一定的泛化能力,以应对多变的复杂的环境。目前相关的指标包括李飞飞团队的Embodied Agent Interface[19]的评价标准,它可以准确定位模型具体在目标解释、子目标分解、动作排序和转换建模四个推理决策方面缺失的能力及问题所在。
相关研究与技术介绍
简单的思维链可以限制模型的思考跨度,要求模型一步一步思考,一步一步行动,减少模型出现幻觉的可能性,避免其在不合适的情况下寻找捷径。比如NVIDIA的CoT-VLA[20]将显式视觉思维链(CoT)推理融入VLA模型,通过自回归生成技术,将预测未来图像帧作为目标,然后生成短动作序列以实现完整的长动作序列目标。还有ExpVLA[21]则将CoT引入作为可解释性增强模块,它同样要求模型先专注于短期的图像生成目标,同时采取融合注意力机制和动作分块策略,以提升短期图像生成目标之间的时间一致性和完整生成流程的执行效率。
更复杂的思维链作为模型的助推器,使得模型能够处理更加复杂的问题。DualCoT-VLA[22]作为一种具有并行推理机制的视觉语言CoT方法,为实现全面的多模态推理,它整合了用于低层空间理解的可视化CoT和用于高层次任务规划的语言CoT,同时它还引入了并行CoT机制,减少了将自回归推理转变为单步前瞻推理后的性能瓶颈。ManualVLA[23]配备了规划专家,生成包含图像、位置提示和文本指令的中间手册,其显式思维链推理过程为其输入行动专家,每个手动步骤都提供明确的控制条件。GraphCoT-VLA[24]引入了一个结构化的思维链推理模块,整合了高层次任务理解与规划、任务失败反馈以及对未来物体位置和机器人动作的低层次想象推理,它还具有一个可实时更新的三维姿态-物体图,捕捉机器人关节的空间配置及三维空间中物体间的拓扑关系,使模型能够更好地理解和操作它们的相互作用。
困难与未来发展方向
具身智能模型的推理能力研究必须关注其物理环境或者真实环境,这是它发展的核心关注点之一。一方面,真实的环境要求VLA模型的推理符合物理真实性。VLA模型要懂得使用世界模型,并且能够基于世界模型进行推理;我们的评价体系也需要对模型推理的物理真实性、现实合理性进行评价。这相比于传统的推理技术(特征处理、注意力机制)和评价指标的建立(简单的标签比对、打分)是很困难的。另一方面,因为很多VLA模型未来将直接与人类交互,所以安全性是至关重要的前提;模型的推理不仅要合理,还要安全,目前的模型已经暴露出了一些安全问题[25],比如忽略安全性而强制执行一些有危险后果的动作。因此安全性是非常紧迫的一个议题。从而也衍生出模型的伦理问题,比如一辆汽车如果遇到要么撞婴儿要么撞学生的问题,怎么办?在面临伦理困境时,我们未必能够给出合适的规则,但是我们至少要知道模型会怎么做。
该细分领域比较有趣的研究还包括VLA-OS[26],它的研究者回归到了大模型理论本身,不仅仅针对VLA模型的推理设计了支持多种任务规划范式的架构,还发现以视觉为基础的规划表示通常优于语言规划的表现。而在传统人工智能领域,有研究发现当前 VLMs 主要依赖文本空间的推理捷径,视觉输入不仅未能提供增益,反而常成为干扰,导致性能下降[27]。这些都说明为了增强模型的推理能力,特别是对于VLA这种几乎纯依赖视觉输入的模型,我们需要更强的视觉基础模型作为底座。
未来的发展方向包括环境与推理的进一步耦合,安全问题的关注以及基础模型的进一步完善等。这些关注点不仅仅是对技术的进一步锤炼,更是其进入真实生产应用环境前不可缺少的一步。
执行:仿真到现实
范式与评价标准
执行是直接与真实环境交互的一个过程,它需要有极高的控制能力与灵活性。对人类来说,手的神经末梢密度是全身最高的,这说明了与环境交互不是一个简单的、计算消耗小的问题。
同时作为人类,我们能够体会到的就是执行是一个和感知 - 也就是第一个模块 - 密不可分的部分。小婴儿必须要通过去触摸积木、物品才能去形成对世界真正的认知;社会心理学也认为我们在很多时候是先有行动,才有态度,这甚至与我们的VLA模型范式完全相反1。这些例子,主要是为了佐证,执行也是具身智能研究中重要的课题,尽管它看起来与软件的联系没有前面两个模块那么紧密。
因此,执行有两个任务。第一是将抽象的感知结果和推理结论,以一种合适的方式翻译为物理真实的行动;第二是为之后的感知提供更多的数据、实践的经验。相关的评价标准也应该聚焦这两个任务。2025年11月由中国电子技术标准化研究院基于编制中的国家标准《人工智能 具身智能大模型系统技术要求》[28]中提出了 “求索”具身智能测评基准EIBench,该标准可以有效评估人形机器人在真实场景中的操作泛化能力还有模型将”感知-决策-执行”模块整合的能力。
相关研究与技术介绍
为了模仿人类复杂的手部动作,增强VLA模型的执行能力,研究者有给出许多各异的方案。美国一家初创公司Physical Intelligence 推出模型[29],该模型采用常微分方程(ODE)驱动的流匹配技术,使得模型生成的动作轨迹极其连贯且无抖动,在折叠毛巾等涉及柔性物体形变的任务中表现特别优异。通过大规模迁移学习实现灵巧操作。NVIDIA EgoScale[30]技术通过将人类的指尖运动轨迹映射到22自由度或更低自由度的机器手上,在复杂的灵巧任务上实现新的突破。
模型接触真实环境后,需要实时更新自己的状态,也需要为之后的感知提供一手的信息。今年上了春晚的宇树机器人Unitree G1[31]通过融合视觉、力觉、惯性测量等多模态传感器数据,它能实时感知环境并调整姿态。RoboPlanner[32]则在简单的LLM规划-执行系统上增加了一个基于实时环境反馈动态调整子目标的模块Re-Plan,在数百个未被发现的日常任务甚至其他领域任务的任务规划合理性方面,超越了其他SOTA方法。
困难与未来发展方向
真实的环境面临的问题包括危险性、实时性、复杂性等,它也绝对不是推理模块面对的无菌环境,它也不会等待模型思考完才给出回应。我们人类在漫长的进化中形成了快速且具有高精度的感官与执行器官,并且我们的大脑内化了一些规则,使得我们可以在某些危机中快速地反映而不需要思考。我认为,今天的具身智能模型可以从两个方面去完善。
首先,技术层面上模型既要增加自己的行动能力、行动泛化力,又要增加自己的反馈能力。前者可以通过更加精细的仿生学、物理学、机械学实现,后者则要求模型能够处理传感器噪声与感知延迟。
还有,为了增强模型的反应能力,可以引入双决策系统。行为经济学家丹尼尔·卡尼曼将人类的行为分为两类,一类是不需要经过推理决策的快系统,另一类是需要感知+决策的慢系统。也许未来的研究者可以在执行模块增加一个快速的响应通路,使得模型能够立刻回应环境。毕竟,环境不会等人,刻舟不能求剑。
闭环:端到端模型的困难与发展
当重新以一个端到端的角度看待今天的VLA具身智能模型,我发现,今天的大多数研究都指出了三个问题 - 数据、泛化能力和”感知-推理-执行”的模块耦合。
巧妇难为无米之炊,高质量的数据对于基于深度学习或者LLM的具身智能模型来说至关重要。但是今天由于具身智能本身就是一个比较新的领域,可能在数据学习上遇到冷启动问题。比如我要一个机器臂学习一定的行为,但是可能我本身就缺乏相关机器的高质量动作视频。有研究者先使用人类运动的视频来预训练,再使用少量的高质量机器动作视频来进行微调,实现了比较好的效果。比如EgoVLA[33]通过基于人类视频训练并预测人类手腕和手部动作的VLA,进行逆运动学和重定向,将人类动作转换为机器人动作,然后再通过几个机器人操作演示对模型进行微调,以获得机器人策略。还有ViSA-Flow[34]框架通过预训练从大规模人机交互视频数据中自动提取的语义动作流,学习稳健的先验结构,之后通过对同一语义抽象流线处理的少量机器人演示进行微调,将该先验高效适应到目标机器人。
泛化同样是包括世界模型的泛化,决策模式的泛化和执行机械学的泛化。模型必须具备强大的语义联想能力。现实世界充满变数,光照变化、地板材质差异、突然出现的障碍物都可能干扰感知。模型可能学会了特定的空间布局,而非通用的物理规则。同时,模型也要能够处理不同单本质相同的物品,比如虽然各种”瓶子”形状各异,但开启它们的物理逻辑是相似的。
整体并非个体之和,将VLA模型的三个模块耦合在一起,也会遇到相应的困难。高层语义理解与低层物理控制之间存在时空尺度不匹配。具体来说,认知层面更关注宏观时间尺度的全局轨迹规划,信号特征是低频、确定性的分布;执行层面的物理交互则需要微观时间尺度的精确调制,信号特征是高频、随机性的分布。ResVLA[35]可以学习从意图到真实动作的残差映射,使得意图被执行系统更准确地理解,在保持生成模型精度的同时显著提升训练效率、推理速度和跨环境鲁棒性。Realtime-VLA V2[36]则加载各种模块来进行时间优化、空间优化还有GPU计算优化,减小真实世界与VLA复杂模块之间的时空缝隙,努力让机器人的动作像人一样丝滑。
在这篇报告中,我特别将企业与大学合作的研究都标注了团队来源,可以看到真的有很多的研究是企业与大学一起完成的。具身智能这个领域确实是一个非常烧钱的领域,它又要算力,又要真实的实验环境,风险与不确定性也大,因此它真的是一个精英的游戏,是资本的角斗场;但是这也揭示了具身智能与生产的紧密联系,它是新质生产力的一种,是国家战略的组成成分,因此其就算有泡沫(只要是社会关注并认可的前沿领域,几乎一定会有泡沫),泡沫稳健性也远比之前的元宇宙、房地产要强,所以真的也是一个非常值得有能力的研究者去深耕的领域。
接下来的五年,有学者认为,2026年会是物理智能爆发点。随着计算成本持续下降和高质量机器人数据的初步累积,AI将显著地步入物理世界。音频和多感官融合将成为机器人新的推理渠道,使其能根据声音判断物体的材质或状态。2027-2028年则会出现通用型作业能力的商业化。得益于预训练缩放定律在具身领域的验证,机器人将具备极强的少样本学习能力2029-2030年我们则能迈向物理AGI。机器人将具备深刻的因果推理能力,能够处理完全非结构化、高度动态的环境[37]。这当然是一个很乐观的估计,但是它确实也指出了具身智能大体的发展路径。五年走不完的道路我们可以用十年走,十年走不完的道路我们可以用二十年走。不过在我看来,今天的学界发展速度迅速,加上各国政府大力支持,明天也许并没有那么遥远。
结语
在写这篇技术报告的时候,我脑海里偶尔浮现电影《机械姬》(Ex Machina)的情节,还有”机械降神”(Deus ex Machina)这个概念。机械降神原指古希腊戏剧中通过起重机将饰演神灵的演员送上舞台,以超自然力量终结复杂的僵局。在人工智能的长久演进中,我们始终在玩一场类似的”降神”游戏:将敏锐的感知能力、强大的推理能力,还有尽可能精巧的行动能力注入硬件躯壳,试图以此驱动机器理解复杂的人类世界,解决我们无穷无尽的问题。我们要赋予模型强大的能力,并且真正实现感知-决策-执行的完美通路,任何的小小不吻合与脱耦合都可能是模型致命的弱点;我们要真正让模型适应我们的环境,而不是真空的实验室,任何的失误都可能带来严重的后果。我们最终请来的是神,还是弗兰肯斯坦的怪物,这是具身智能研究者不得不回答的问题。
参考文献2
知乎网. 理论介绍|具身理论(Embodied Theory)[EB/OL]. (2025-06-24). https://zhuanlan.zhihu.com/p/1920853960635450532
每日经济新闻. “具身智能”再次被写入政府工作报告 多家企业:距离真正大规模爆发仍然存在关键瓶颈[EB/OL]. (2026-03-11). https://news.qq.com/rain/a/20260311A06S2M00
知乎网. 2025具身智能机器人新品发布大盘点[EB/OL]. (2026-01-28). https://zhuanlan.zhihu.com/p/1999810289953166682
CHI X, JIA P, FAN C, et al. WoW: Towards a World omniscient World model Through Embodied Interaction[EB/OL]. (2025-10-16). https://arxiv.org/abs/2509.22642
VAFA K, CHANG P G, RAMBACHAN A, et al. What Has a Foundation Model Found? Using Inductive Bias to Probe for World Models[EB/OL]. (2025). https://arxiv.org/abs/2507.06952
BESSEMER VENTURE PARTNERS. Can world models unlock general purpose robotics?[EB/OL]. (2026-03-10). https://www.bvp.com/atlas/can-world-models-unlock-general-purpose-robotics
JIANG A, GAO Y, WANG Y, et al. IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model[EB/OL]. (2025-08-15). https://arxiv.org/abs/2508.06571
XIAO J, YANG Y, CHANG X, et al. World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training[EB/OL]. (2026-04-27). https://arxiv.org/abs/2509.24948
ZHEN H, QIU X, CHEN P, et al. 3D-VLA: A 3D Vision-Language-Action Generative World Model[EB/OL]. (2024-03-14). https://arxiv.org/abs/2403.09631
BAUMANN S A, WIESE J, MARTORELLA T, et al. Envisioning the Future, One Step at a Time[EB/OL]. (2026). https://arxiv.org/abs/2604.09527
SUN J, ZHANG W, QI Z, et al. VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model[EB/OL]. (2026-02-14). https://arxiv.org/abs/2602.10098
LIU J, QI Y, ZHANG J, et al. TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking[EB/OL]. (2025-10-08). https://arxiv.org/abs/2510.07134
GIGABRAIN TEAM, WANG B, LI B, et al. GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning[EB/OL]. (2026-02-26). https://arxiv.org/abs/2602.12099
JIANG Z, ZHOU S, JIANG Y, et al. WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL[EB/OL]. (2026-02-15). https://arxiv.org/abs/2602.13977
WANG W. LLM Reasoning Is Latent, Not the Chain of Thought[EB/OL]. (2026-04-17). https://arxiv.org/abs/2604.15726
LEE Y, NAIR R, ZHANG Q, et al. Meta-Harness: End-to-End Optimization of Model Harnesses[EB/OL]. (2026-03-30). https://arxiv.org/abs/2603.28052
RÍOS-GARCÍA M, ALAMPARA N, GUPTA C, et al. AI scientists produce results without reasoning scientifically[EB/OL]. (2026-04-20). https://arxiv.org/abs/2604.18805
BIRR T, POHL C, YOUNES A, et al. AutoGPT+P: Affordance-based Task Planning using Large Language Models[C/OL]// Robotics: Science and Systems XX. 2024. DOI: 10.15607/RSS.2024.XX.112. [PDF] AutoGPT+P: Affordance-based Task Planning with Large Language Models | Semantic Scholar
LI M, ZHAO S, WANG Q, et al. Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making[EB/OL]. (2025-01-19). https://arxiv.org/abs/2410.07166
ZHAO Q, LU Y, KIM M J, et al. CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2025: 1702-1713 CVPR 2025 Open Access Repository
WANG Z, WANG S. ExpVLA: Enhancing the Generality of VLA Model via Explainable CoT Reasoning[C/OL]// 2025 International Conference on Artificial Intelligence Security and Governance (ICAISG). 2025: 5-9. DOI: 10.1109/ICAISG68699.2025.11452140. ExpVLA: Enhancing the Generality of VLA Model via Explainable CoT Reasoning | IEEE Conference Publication | IEEE Xplore
ZHONG Z, LI J, HE J, et al. DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models[EB/OL]. (2026-03-23). https://arxiv.org/abs/2603.22280
GU C, LIU J, CHEN H, et al. ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation[EB/OL]. (2025-12-01). https://arxiv.org/abs/2512.02013
HUANG H, CEN M, TAN K, et al. GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions[EB/OL]. (2025-08-23). https://arxiv.org/abs/2508.07650
HUANG Z, ZHU W, QIU H, et al. TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches[EB/OL]. (2026-03-24). https://arxiv.org/abs/2603.23117
GAO C, LIU Z, CHI Z, et al. VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models[EB/OL]. (2025). https://arxiv.org/abs/2506.17561
XU Y, WANG Y, WU Z, et al. Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap[EB/OL]. (2026-04-17). https://arxiv.org/abs/2604.16256
方华. 具身智能首个评测基准发布 目标:更聪明 更好用[EB/OL]. (2025-11-21). https://www.financialnews.com.cn/2025-11/21/content_437866.html
DeepLearning.AI. π0, a machine learning system for household robotics[EB/OL]. (2024-11-27). https://www.deeplearning.ai/the-batch/p0-a-machine-learning-system-for-household-robotics/
MANUS. NVIDIA EgoScale Scaling Dexterous Robot Manipulation with MANUS Gloves[EB/OL]. (2026-03-04). https://www.manus-meta.com/use-cases/nvidia-egoscale-scaling-dexterous-robot-manipulation-with-manus-gloves
搜狐网. 未来已来!宇树智能机器人开启科技生活新篇章[EB/OL]. (2025-10-30). https://www.sohu.com/a/949308991_121239079.
CHEN Y, CUI W, CHEN Y, et al. RoboGPT: an LLM-based Embodied Long-term Decision Making agent for Instruction Following Tasks[EB/OL]. (2024-09-13). https://arxiv.org/html/2311.15649v3
YANG R, YU Q, WU Y, et al. EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos[EB/OL]. (2025-07-18). https://arxiv.org/abs/2507.12440
CHEN C, YANG Q, XU X, et al. ViSA-Flow: Accelerating Robot Skill Learning via Large-Scale Video Semantic Action Flow[EB/OL]. (2025-11-12). https://arxiv.org/abs/2505.01288
ZHONG Y, HE Y, YANG Z, et al. From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges[EB/OL]. (2026-04-29). https://arxiv.org/abs/2604.21391
YANG C, HU Y, MA Y, et al. Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate[EB/OL]. (2026). https://arxiv.org/abs/2603.26360
SYSWERDA G. Timeline to Artificial General Intelligence 2025 - 2030+[EB/OL]. (2025-10-30). https://doi.org/10.70777/si.v2i6.16375