物理AI:人工智能第三浪——全产业链投资图谱
从感知AI到生成式AI再到物理AI,人工智能正在从屏幕走向物理世界。VLA模型与世界模型的双引擎架构、三大核心载体、3800亿到3.26万亿美元的市场扩张——这是一次从"理解世界"到"改变世界"的跃迁。

核心结论

物理AI(Physical AI)正成为继感知AI和生成式AI之后,人工智能产业演进的关键第三波浪潮。相较于过去以图像识别、语音处理为核心的感知AI,以及以内容生成为代表的生成式AI,物理AI实现了一次从"理解世界"到"改变世界"的根本性跃迁——它是具备在真实物理环境中感知、理解、推理和执行能力的智能系统,最典型的载体包括人形机器人、自动驾驶平台和工业自动化设备。

一、AI的三波浪潮:从屏幕到物理世界

要理解物理AI的产业意义,需要先看清AI演进的三波浪潮:

第一波:感知AI(Perception AI)。以图像识别和语音处理为核心。在ChatGPT问世之前,人工智能主要的技术特征就停留在这一层面——人脸识别系统(如支付宝、智能手机的刷脸支付)、智能音箱的语音交互。这个阶段AI的核心能力是"识别"和"判别",但它不创造新内容,也不在物理世界中行动。

第二波:生成式AI(Generative AI)。以大模型和内容生成为代表。从ChatGPT的发布开始,DeepSeek、智谱等国产大模型陆续涌现,AIGC工具(如视频生成、图像生成)全面爆发。这一波浪潮的核心变化在于:AI的"知识维度"实现了指数级的提升——从聊天机器人到多模态模型,AI能够生成文本、图像、视频和语音。但本质上,这些能力仍然被锁定在屏幕和虚拟世界之中。

第三波:物理AI(Physical AI)。2026年起,AI开始在高知识的基础上加速迈向真实世界。这波浪潮的核心特征是:AI不再满足于数字对话或图像生成,而是真正具备在复杂的物理世界中进行操作、移动和应对不确定性的能力。这是一个万亿级应用空间的技术锚点。

二、物理AI的双引擎架构:VLA模型与世界模型

物理AI的技术路线由两条主线构成:VLA模型(视觉-语言-行动模型)世界模型(World Model)。未来物理AI的核心架构是这两者的深度闭环——VLA负责感知与执行,世界模型负责环境推演和规划验证,两者互补才能推动真正的落地。

VLA模型:从看和说到动手

VLA模型的技术突破在于:它超越了将视觉、语言和动作视为独立领域的局限。在视觉语言模型(VLM)的基础上,VLA引入了动作Token——将机器人的电机指令数字化或符号化编码,使得模型能够同时处理视觉信息、理解语言指令,并直接输出物理动作,实现端到端的统一

从产业演进来看:最早的AI形态是聊天机器人(纯语言指令)→ 多模态模型(引入视觉信息处理)→ VLA模型(进一步引入物理动作数据)。2023年以来,VLA模型的发展速度极其迅猛。到2026年,主流VLA模型在训练分布内的任务成功率已经普遍稳定,执行能力在迅速提升。

但VLA面临的最大挑战是泛化能力不足。在真实物理世界中,当遇到全新任务时,VLA模型的成功率降幅可能高达40%。例如,在一个家庭场景中训练好的模型,一旦放到工业制造环境中,往往直接执行失败。除此之外,VLA还面临实时推理速度慢、高维视觉特征与低维动作特征错位等硬件和安全性挑战。

世界模型:给AI装上"物理引擎"

纯反应式的VLA只能根据当前观测映射动作,缺乏对未来的推理能力——遇到长时程规划任务时容易翻车。世界模型正是为弥补这一缺陷而生的。

世界模型本质上是一种对环境动态的预测性表征。它为VLA注入"想象力",提供了一个内嵌的物理引擎,让AI能够提前模拟动作后果,验证计划的可行性。在世界模型架构中,它主要扮演四个关键角色:

  1. 世界规划器——预测未来状态,提供前瞻性指导。
  2. 世界动作模型——将环境动态内化到动作生成中,保证长时程任务的空间一致性。
  3. 世界合成器——作为数据引擎,合成大量观测-动作轨迹,克服真实机器人数据极其稀缺的瓶颈。
  4. 世界模拟器——提供安全的虚拟沙盒,让策略在内部进行"想象"和强化学习训练。

当前世界模型的技术路径尚未完全收敛。一派致力于内部世界理解——在抽象语义空间中预测;另一派追求外部世界模拟——高保真、可交互的像素级环境复现。这两条路线在因果性、实时性等方面各有取舍,目前尚无单一范式能够一统全局。

我们当前正处于从单纯VLA模型到"VLA+世界模型"双系统闭环迭代的技术窗口期。只有迈过这道技术门槛,物理AI才能真正解决泛化难题,从实验室演示走向商业使用。

三、产业发展时间线

物理AI并非刚刚诞生的概念,近年来的技术积累已经使行业初步具备了从实验室走向真实场景的能力。关键时间节点如下:

  • 2024年2月:OpenAI Sora首次将视频生成与世界模型概念挂钩。
  • 2024年8月:Figure 02和NEO Beta同步演示了家居场景应用——初步验证了VLA在真实家庭环境中完成多步骤家务任务的可行性。
  • 2024年10月:Physical Intelligence发布了通用VLA模型。
  • 2025年1月:英伟达推出Cosmos平台,专门为物理AI提供规模化、可控且高性价比的合成数据支持。
  • 2025年3月:英伟达GTC大会上发布GR00T N1——被定义为世界上第一个开源人形机器人基础模型。
  • 2025年:谷歌DeepMind连续发力,发布Genius 2(可交互3D世界生成)和Genius 3(高分辨率长时一致世界生成),并在10月推出Gemini Robotics 1.5——一款主打"先思考后行动"(Think Before Acting)的推理型VLA大模型。

在国内政策层面,2025年10月"十五五"规划建议中明确提出要"加强人工智能与产业发展深度融合"。2025年12月,有关部门出台《人工智能+制造专项行动意见》,直接点名了物理AI的核心载体——明确提出要推动具身智能产品创新、建设人形机器人中试基地和训练场、在典型制造场景中部署应用。此外,2025年3月的工作报告和5月的"数字中国建设2025年行动计划"也密集点名了智能网联新能源汽车、智能机器人等新一代智能终端。

四、市场空间与竞争格局

物理AI并非单一的细分赛道,而是一种全方位渗透物理世界的庞大生态。其应用领域涵盖:

  • 人形机器人和自主机器人
  • 自动驾驶车辆与自主化车联网运营
  • 工业自动化与智能制造
  • 可穿戴设备
  • AI驱动的医疗系统(手术机器人、康复治疗)
  • AI驱动的农业系统(自动驾驶拖拉机、智能灌溉)

根据Future Markets的测算数据,全球物理AI市场预计将从2026年的约3800亿美元以指数型增长至2040年的3.26万亿美元。这可能是历史上规模最大的单一技术市场扩张之一。

从全球格局来看:

  • 北美目前占据物理AI的主导地位,得益于高度的人工智能采用率和英伟达、特斯拉、波士顿动力、谷歌DeepMind等技术领导者的重金投入。
  • 亚太地区则是当前物理AI增长最快的市场之一。快速的工业化进程、制造能力的持续扩张使亚太地区在机器人量产和低成本硬件上已经占据领先地位。在本土制造生态和政策驱动下,未来十年亚太地区在物理AI领域的增长潜力极为显著。

具体落地场景包括:制造和仓储物流(实时监测、自动化质量检查、自主移动机器人的物料搬运和供应链优化);医疗保健(手术机器人、康复治疗);汽车出行和农业(自动驾驶车辆、自主化运营、AI驱动的农机系统)。几乎每一个行业的物理机械都将被赋予真正的智能。

五、投资逻辑与估值锚点

物理AI的投资框架可以从三个层面来构建:

第一层:基础设施和算力。物理AI对算力的需求不仅是训练端的推理能力,更是实时决策和端侧计算的综合要求。英伟达的Cosmos平台和GR00T N1模型已经为这个方向定下了基础设施的标杆。在算力芯片、数据合成平台和训练场建设三个方向上,产业链正在从0到1构建。

第二层:模型和算法。VLA模型和世界模型是物理AI的双引擎。国内在大模型领域已经积累了相当的技术基础(DeepSeek、智谱等),将这些能力向VLA方向迁移是自然的技术延伸路径。世界模型的技术路径尚未收敛,意味着有多种技术路线可以实现突破,格局未定,窗口期仍在。

第三层:本体和应用。人形机器人、自动驾驶、工业自动化是物理AI的三大核心载体。中国在硬件制造、机器人量产和成本控制上具有全球领先的优势。政策驱动("人工智能+制造"专项行动、十五五规划)叠加制造生态的规模优势,中国在物理AI的本体和应用层有很大概率形成全球竞争力。

物理AI处于一个独特的产业位置:它不是某一个细分行业的升级换代,而是一种通用性的技术范式变革——它将被嵌入到每一个需要与物理世界交互的产业中。投资物理AI,实质上是投资一个正在被重新定义的世界。


最后整理于 2026-06-27