物理AI:机器智能的具身化详解
人工智能的下一阶段,不会由某一种新型机器人来定义,而是由机器智能获得身体这件事本身来定义。这个转变,已经在发生了。 人工智能的下一阶段,不会由一种新型机器人来定义,而是由机器智能获得身体所定义 几十年来,我们一直把机器人理解为执行特定功能的机器:焊接一条焊缝、搬运一个包裹、检查一件产品、在仓库里导航
人工智能的下一阶段,不会由某一种新型机器人来定义,而是由机器智能获得身体这件事本身来定义。这个转变,已经在发生了。

人工智能的下一阶段,不会由一种新型机器人来定义,而是由机器智能获得身体所定义
几十年来,我们一直把机器人理解为执行特定功能的机器:焊接一条焊缝、搬运一个包裹、检查一件产品、在仓库里导航。但“Physical AI”(物理人工智能)这个新词,彻底碘伏了这个视角。它不再从机器人出发,问它需要多少智能才能完成任务。它反过来,从机器智能出发——也就是那种能感知条件、解释目标、选择行动、并做出调整的操作能力——然后追问:这种智能,如何才能获得一个物理形态?在这种视角下,机器人不再是整个系统,而成了具身化的载体:一个人工智能借以感知、行动、并承受其决策后果的身体。
生成式AI让机器成了数字内容的生产者。智能体AI(Agentic AI)让它们成了数字系统内的操作者。而Physical AI,则试图将这种智能,跨越计算与物质世界之间的边界。
Physical AI 碘伏了视角
说实话,Physical AI目前还不是一个标准的、得到公认的技术术语。研究人员们同时使用着具身AI(embodied AI)、具身推理(embodied reasoning)、物理智能(physical intelligence)、机器人基础模型(robot foundation models)、通用机器人策略(generalist robot policies)、视觉-语言-动作模型(vision-language-action models)……各种叫法。NVIDIA 在推动将Physical AI作为一个行业统称,而Google DeepMind 则越来越多地谈论物理智能体和具身推理。美国国家标准与技术研究院(NIST)在商业热潮之前,就已在制造机器人项目中使用这个说法。这种术语的多样性,恰恰揭示了这个词真正的作用:它不是去定义一个公认的技术,而是在引入一种组织该领域的新方式。
传统机器人,通常是从设备出发的。工程师先定义它的本体、执行器、传感器、控制器、工作空间、安全限制和分配的任务。结果可能是一个焊接臂、自动叉车、手术平台、配送机器人或移动检测系统。每台机器主要通过它执行的功能来被理解。即使它自主运行,其智能通常也被视为一个更大的、专门构建的设备中的一项能力。
而Physical AI,是从智能出发的。注意,这里的“智能”并不意味着意识、人类意义上的意图、或独立意志。它意味着一个系统能够:接收或推断目标、感知相关条件、在可能的行动中进行选择、通过工具或机器行动、观察结果、并修正自身行为。机器人提供了这个过程发生的物理装置。它的摄像头和触觉传感器,成了AI感知的手段;它的轮子、手臂、夹具和关节,成了决策获得物理后果的途径。
这使得Physical AI成为了智能的一个类别,而非硬件的一个类别。人形机器人可能体现它,但自动驾驶汽车、无人机、工业臂、仓储平台、实验室仪器或手术系统也同样可以。它们的形态和目的可能截然不同。连接它们的,是“机器智能通过物理身体运行”这个愿景。这个词的意义在于,它让原本分离的机器类别,看起来像是同一更大发展的不同具身化形式。
具身智能的更早根源
传统机器人的机械技术远未过时。2024年,全球企业安装了54.2万台工业机器人,有超过460万台在工厂中运行。这些机器代表了一个极其成功的工程范式:约束环境、明确任务、编程或教授动作、以速度和精度重复执行。它们的能力,往往恰恰来自于消除那些Physical AI现在被期望去管理的不确定性。
“智能通过物理交互涌现”这个观点,也并不是什么新鲜事。1991年,Rodney Brooks 就认为机器人研究人员过度强调了抽象的内部表征,而对感知与行动之间的直接循环关注不足。他基于行为的方法,强调机器与世界持续互动,而不是等待一个集中式系统构建完整模型并下发详细计划。智能,在这种观点中,与情境化行为密不可分。
Rolf Pfeifer 和 Josh Bongard 后来进一步论证,智能无法与产生它的身体截然分开。身体的形式、材料、传感器和运动可能性,共同决定了它能学到什么,以及它要解决的问题有多困难。一个柔性夹具可以贴合不规则物体,而无需计算其几何的每个细节。一条弹性腿可以利用动量,而不是通过软件控制每一个动作。系统智能的一部分,是通过其物理设计来表达的。
这一传统,产生了更具体的物理智能概念。2020年,Aslan Miriyev 和 Mirko Kovač 将“物理人工智能”描述为一种结合计算机科学、机械工程、材料科学、生物学和化学的多学科努力。2021年,Metin Sitti 认为,智能能力既可以编码在机器的控制器中,也可以编码在机器身体中。这段历史,让当前的叙事变得更加复杂。早期的研究者通常从身体出发,询问机械和材料如何贡献于智能。而今天的行业,往往从一个基础模型出发,询问它如何控制一个身体。最具影响力的Physical AI版本,将需要这两种视角的融合。
从生成式AI到机器智能
生成式AI为人工智能确立了一个新的公共角色。AI不再是幕后分类信息或做出预测,而是成了一个可见的“生产者”。单个模型可以根据开放式指令生成语言、图像、音频、视频和软件。它的输出范围可以非常广泛,但主要仍然是表征性的:对世界的描述、在其中行动的计划、或供人们和其他系统使用的数字产物。
智能体AI则将重点从“产生输出”转向了“追求目标”。一个智能体可以决定使用哪些工具、导航软件、检索信息、执行一系列操作、检查中间结果、并修正其方法。它的定义性能力,不仅仅是生成,而是随时间推移的目标导向行动。然而,大多数AI智能体仍在计算环境内运行,其行动以应用命令、消息、数据库查询、代码执行或数字文件变更的形式存在。
Physical AI 则给这种智能赋予了身体。智能体的观察,现在通过摄像头、麦克风、激光雷达、雷达、力传感器、触觉和本体感知到达。它的行动,可以移动物体、打开阀门、驾驶车辆、装载机器、进行实验、或改变工作场所的状态。它必须应对重量、动量、摩擦力、形变、有限的能量、传感器噪声、变化的光线、人类的运动,以及那些不如预期表现的对象。一个数字智能体可以重试一次失败的表单提交。而一个物理智能体,可能已经把容器打翻、损坏了组件、或将人置于风险之中。
从生成式AI到智能体AI再到Physical AI的演进,并不是一个正式的分类学,也不是技术时代的清晰更替。生成模型仍然存在于智能体内部,物理系统将继续将学习到的智能与传统控制、规划和自动化相结合。但这种演进,捕捉到了机器能力范围的扩展。生成式AI生产内容。智能体AI在数字环境中追求目标。Physical AI 则赋予这种目标导向能力以物理具身,使其能够参与物质世界。
赋予智能以身体的技术栈
第一个关键发展,是多模态基础模型。在语言、图像、视频和其他数据形式上训练的系统,可以识别物体、解释指令、推理关系、并利用传统机器人程序所不包含的广泛知识。Google DeepMind 的 RT-2 展示了如何将视觉-语言模型适配为输出机器人动作的令牌。其后的 Gemini Robotics 系统,则将具身推理、任务规划、工具使用和视觉-语言-动作控制相结合或分离。模型不再仅仅识别机器人面前是什么;它还可以帮助确定,具身智能体应该对此做什么。
第二个关键发展,是使物理知识可迁移的努力。Open X-Embodiment 合作项目汇集了来自22种机器人形态和34个机器人实验室的超过100万条轨迹,测试通过一台机器积累的经验,能否改善其他机器的性能。Physical Intelligence 开发了旨在控制多种机器人类型的通用策略,而 Skild AI 则明确将其目标描述为不受限于单一机器形态的“全身智能”。这些系统尚未构成一个通用的“机器人大脑”,但它们指向了一个不同的发展单元:一种智能,通过多个身体学习,而不是为了一台机器编写一个程序。
第三个关键发展,是仿真、合成数据、强化学习和世界模型的增长。语言模型可以在已经充满文本的互联网上进行训练。但不存在类似的公共档案,包含每一种有用的抓取、碰撞、插入、交接、驾驶交互或工厂异常情况。真实世界的机器人经验,收集起来既缓慢又昂贵。NVIDIA Omniverse、Isaac 和 Cosmos 等平台,旨在通过数字孪生、仿真物理、生成环境和合成传感器数据来补充这些经验。一个具身智能体,可以在虚拟环境中练习任务的变体,包括罕见或危险的场景,然后再在物理设备上尝试。
第四个关键发展,是身体本身。改进的摄像头、触觉传感器、力反馈、灵巧手、柔性执行器、高效计算和更安全的机械系统,扩展了机器智能能够感知和完成的内容。这些技术也说明了,为什么Physical AI不能简化为单一的模型架构。视觉-语言-动作模型、世界模型、强化学习、仿真、先进传感器和机器人硬件,是一个新兴技术栈的组成部分,而不是一份确定的蓝图。统一的概念不是规格说明,而是创造一种能够获得物理形态、并在与现实接触中存活的机器智能的努力。
一种智能,多种具身化
最深层的变革,将在于行业将智能定位在哪里。在传统机器人技术中,能力通常与个体机器、其控制器、其任务编程和围绕它构建的环境密不可分。而在Physical AI模型中,高层级知识可以驻留在一个理解目标、物体、关系和可能行动的更广泛系统中。低层级控制器,则将那些决策转化为适合特定身体的运动。
工业臂、移动操作器、自动驾驶汽车和人形机器人,不会使用相同的电机指令。它们没有相同的尺寸、关节、力量、传感器或物理能力。但它们可能能够共享关于“抓取、搬运、插入、分拣、打开、避让或导航意味着什么”的高层级知识。长期目标,不是一套通用的运动序列,而是一个可复用的物理理解层,可以适应不同的形态。
不同的组织,正在从不同层面追求这种可能性。Google DeepMind 正在将基础模型扩展到具身推理和机器人行动。NVIDIA 正在构建计算、仿真、世界模型和机器人开发基础设施。Physical Intelligence 和 Skild AI 专注于通用控制模型。丰田研究所开发了大型行为模型,并与波士顿动力合作Atlas。亚马逊和Waymo,则在物流和自动驾驶系统中构建垂直整合的智能。大学实验室,仍然是机器人学习、控制、操作、感知和具身化基础研究的核心。
如果机器智能变得更加可复用,机器人业务的格局也可能随之改变。模型提供商可以许可跨多种硬件运行的能力。机器人制造商可以暴露接口,供那些模型控制不同的身体。仿真公司可以提供训练环境,而大型车队运营商则从其机器收集的物理数据中获得优势。机器人仍将不可或缺,但它将越来越多地被理解为一个更大的模型、数据、计算、控制和积累经验系统中的一种具身化形式。
机器智能在何处获得物理形态
制造业提供了一个关于进展与局限的有用例证。宝马报告称,一台Figure 02人形机器人在其斯帕坦堡工厂为期十个月的项目中,工作了大约1250小时,搬运了超过9万个钣金部件,支持了超过3万辆宝马X3的生产。这台机器并没有作为万能工厂工人运行,而是在为任务准备好的生产环境中,执行一项定义明确的搬运操作。但宝马以Physical AI的语言描述了该项目,将特定的机器人具身化,置于更广泛的可适应机器智能策略之中。
亚马逊展示了另一种具身化形式。2025年,该公司表示已在超过300个设施中,部署了第100万台机器人。它还推出了DeepFleet,一个旨在协调整个车队运动的基础模型。亚马逊估计,这可以将机器人运输效率提升10%。DeepFleet 并没有把每个仓库机器变成通用智能体。其意义在于,将智能向上移动——从单个设备的行为,变为作用于庞大机器网络的一个模型。在这种情况下,舰队本身就成了具身化。
自动驾驶汽车,可能代表了Physical AI最成熟的形式,尽管它们通常被视为一个独立行业。自动驾驶系统感知不断变化的环境、预测他人的行动、规划、控制机器、并随着事件展开而适应。截至2025年10月,Waymo 报告在公共道路上完成了超过1亿英里全自动驾驶里程和超过1000万次付费乘车。这比大多数通用机器人演示,提供了更强有力的、机器智能在物理世界中持续运行的证据。这也显示了当前系统的界限:Waymo Driver 在驾驶领域越来越能干,但它并不是一个恰好占据了一辆汽车的通用智能。
科学实验室和医疗保健,揭示了机器智能可以采取的其他形式。利物浦大学的一个移动机器人化学家,在八天内完成了688次实验,寻找改进的光催化剂。伯克利的A-Lab,将计算预测、文献知识、机器学习、主动学习和机器人技术整合为材料合成的闭环,在17天运行中完成了353次实验。约翰霍普金斯大学的研究人员,展示了一个机器人系统,在最小人工干预下,规划、适应并在猪身上执行精细的肠道缝合手术。这些系统并非自主科学家或外科医生。人类定义了它们的目标、仪器、约束和操作边界。它们所展示的,更为精确:机器智能能够越来越多地在决策、行动、测量和再次决策之间,形成闭环。
范式即具身化
Physical AI 不需要作为一个单一的突破、一个通用的机器人模型、或一个公认的技术标准到来,才能产生影响。它的直接重要性,在于它引入的视角逆转。机器人技术,传统上是围绕机器及其功能来组织的:焊接机器人、配送机器人、手术机器人、自动驾驶汽车、实验室机器人。Physical AI 则围绕“智能”重新组织了这些类别。它要求我们将每台机器,理解为一个能够感知、决策和行动的更大智能的可能物理表达。
这并不使身体成为次要的或可互换的。一台机器仍然需要被工程化、供电、维护、集成并确保安全。它的形状和材料,影响它能感知、学习和完成什么。物理行动,仍然比数字行动更不容忍错误。许多任务,通过传统自动化执行,比通过通用AI系统更加有效。这个术语不应被用来模糊这些约束,或暗示每一台自主机器都已成为一个复杂的智能体。
这个词的真正力量,在于它将机器人技术置于人工智能更广泛的演进之中。生成式AI,使机器智能成为内容的生产者。智能体AI,使其成为能够通过数字工具追求目标的操作者。Physical AI,则将那种智能扩展到能够改变物质世界状态的机器人系统。输出不再只是文字、图像、计划或软件命令。它们变成了运动、操作、旅程、实验和物理后果。
这就是为什么“Physical AI”不仅仅是机器人学的一个时髦替代词。它改变了故事中心的对象。机器人不再仅仅被视为一个包含一定智能的独立功能设备。它变成了机器智能的机器人具身化——人工智能通过它与物理现实建立直接关系的身体。当今的系统,最终能否实现这一承诺,尚不确定。但概念转变已经开始:AI的下一个前沿,可能不再是另一种内容,而是智能获得形态,走向世界。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:物理AI:机器智能的具身化详解要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点Python中主流人工智能框架包括Scikit-learn、TensorFlow、PyTorch及SpaCy。通过鸢尾花分类、手写数字识别和文本分词词性标注等实例,展示了机器学习、深度学习与自然语言处理的具体应用。这些库为开发人员提供了强大工具,便于快速构建和部署AI应用。
京东利用大模型与运筹优化互补,推动供应链升级。自研时序大模型突破需求预测瓶颈,运筹大模型解决建模、求解、解释难题,目标构建自主协同的供应链数字人,实现高效智能决策。
AI大模型基于深度学习与大规模参数,擅长复杂任务和高精度生成,但成本高、可解释性差;传统AI依赖规则与简单结构,资源需求低、可解释性强,适合特定场景。两者优势互补,未来将长期共存。
思特威推出SC038MPC与SC020MPC两款超小尺寸全局快门图像传感器,专为笔记本电脑和平板电脑设计。搭载SmartGS™-2Plus技术平台,具备高感度、无畸变和超低功耗特性,支持人脸识别、人体存在检测等AI感知任务,有效像素分别为0 3MP和0 16MP。
- 日榜
- 周榜
- 月榜
热点快看
