AI 第三浪:物理 AI 如何从屏幕走向真实世界
物理 AI 是从感知式 AI、生成式 AI 之后的第三次跃迁。VLA 与世界模型构成技术闭环,机器人、自动驾驶和工业自动化则是最重要的落地场景。

AI 第三浪:物理 AI 如何从屏幕走向真实世界

AI 的前两轮浪潮,主要发生在屏幕之内。第一轮是感知式 AI,让机器能够识别图像、理解语音、完成基础的模式判断;第二轮是生成式 AI,让机器能够写文字、生成图片和视频、辅助代码与内容生产。但这两轮浪潮的核心,仍然是信息世界里的效率提升。

真正的第三浪,是物理 AI。它的目标不是让机器停留在对话框里,而是让智能进入真实环境,感知三维空间、理解任务目标、预测物理变化,并通过机器人、自动驾驶、工业设备和各类智能终端完成现实世界里的动作。

物理 AI 的关键变化在于:AI 不再只是“理解世界”,而是开始“改变世界”。它对应的不是单一产品,而是一整套跨越基础模型、世界模型、仿真训练、传感器、执行器、本体制造和场景交付的产业系统。

AI 的三次跃迁:从识别、生成到行动

第一波 AI 的核心是感知。人脸识别、语音交互、智能音箱、图像识别等应用,本质上都是让机器在某个维度上“看见”或“听见”。这类能力非常重要,但它解决的是信息输入和模式识别问题。

第二波 AI 的核心是生成。大模型、聊天机器人、AI 绘画、AI 视频、代码助手、办公自动化工具,让机器具备了更强的知识组织和内容生产能力。它让 AI 从“识别工具”升级为“生产工具”,但多数能力仍然锁在数字世界中。

第三波 AI 的核心是行动。物理 AI 要把感知、语言、推理、规划和控制统一起来,让智能系统能够在复杂物理环境中执行任务。人形机器人、自动驾驶平台、工业自动化设备,是这一阶段最典型的载体。

这也是理解产业空间的关键:数字 AI 提升的是信息生产力,物理 AI 对应的是制造、物流、交通、医疗、农业、能源、家政、巡检和现场服务等真实劳动市场。后者的规模远大于纯软件世界,也更难被少数应用垄断。

什么是物理 AI

物理 AI 是具备在真实物理环境中感知、理解、推理和执行能力的智能系统。它不仅要看懂图像、听懂指令,还要理解空间、重量、摩擦、碰撞、遮挡、材质、运动轨迹和安全边界。

一台传统工业机器人,只要环境固定、工位固定、动作固定,就能高效运行。但一旦任务改变、物体位置改变、场景发生扰动,它往往需要重新编程和调试。物理 AI 要解决的,就是让机器具备一定泛化能力,在真实环境里根据目标和反馈调整动作。

这类系统通常包含三类能力。第一是多模态感知,能够处理视觉、语言、触觉、力觉、位置和环境信息;第二是任务理解与规划,能够把自然语言目标拆成可执行步骤;第三是动作控制与反馈,能够把计划转化为机械臂、底盘、关节、电机和执行器的动作,并根据结果持续修正。

VLA:视觉、语言与动作的统一模型

物理 AI 当前最重要的技术路线之一,是 VLA,也就是视觉、语言、动作模型。它在视觉语言模型的基础上,把动作也当成一种模态来处理,让模型不仅能看懂场景、理解语言,还能直接输出动作指令。

过去的大语言模型处理文本 token,视觉语言模型处理图像和文本,VLA 则进一步引入动作 token,把机械臂、电机、夹爪、移动底盘等执行指令编码进统一模型中。这样,机器人就有机会从“先识别、再规则控制”的传统架构,走向端到端的动作生成。

VLA 的进展很快,训练分布内的任务成功率不断提升。但它的瓶颈也非常清楚:一旦换到新任务、新场景、新物体,成功率可能明显下降。家庭场景训练好的模型,放到工业制造环境中未必可用;仿真环境表现好,迁移到真实世界仍然可能失败。

原因在于,VLA 很容易学习图像、语言和动作之间的表面对应,却不一定真正理解物理后果。它可能知道杯子在哪里,却不知道装满水的杯子不能倾斜;它可能知道箱子可以推动,却不理解摩擦、重心和碰撞会怎样影响结果。

世界模型:给机器人注入“想象力”

为了解决 VLA 缺乏前瞻推理的问题,世界模型成为物理 AI 的核心补充。世界模型的本质,是让机器学习环境如何变化:如果执行某个动作,下一秒会发生什么;如果碰到某个物体,物体会滑动、倾斜、变形,还是翻倒。

VLA 更像反应式系统,根据当前观测直接输出动作;世界模型则像内置物理引擎,提前模拟动作后果,验证计划是否可行。一个成熟的物理 AI 架构,未来很可能不是单独依靠 VLA,而是 VLA 与世界模型形成闭环。

世界模型在架构中承担四个角色。第一是规划器,预测未来状态,帮助系统选择更可靠的路径。第二是动作模型,把环境动态纳入动作生成,避免动作只符合图像而不符合物理。第三是合成器,生成大量可训练、可评测的观测和动作轨迹。第四是安全沙盒,让策略在虚拟环境中试错,降低真实设备损耗和安全风险。

这意味着,物理 AI 的核心突破,不只是机器人本体更像人,也不是机械臂更灵活,而是智能系统开始具备对物理后果的预测能力。

训练场:仿真、合成数据与真实数据闭环

物理 AI 最大的约束之一是数据。文本、图片、代码可以从互联网规模化获取,但高质量机器人操作数据极其昂贵。真实机器人每一次试错都需要设备、场地、人力和时间,还可能造成损耗。

因此,仿真平台和合成数据会成为物理 AI 的训练场。机器人可以在虚拟环境中练习抓取、搬运、避障、装配和巡检,自动驾驶系统可以在仿真道路中面对极端天气、突发行人和复杂交通场景,工业设备可以在数字孪生工厂中测试不同工况。

仿真的价值不只是便宜,更在于可控、可重复、可评测。真实世界中的长尾危险场景很难大量收集,但仿真可以生成并反复测试。未来真正有壁垒的平台,很可能不是只提供一个炫目的 3D 世界,而是能够把真实数据、合成数据、评测体系和模型训练连接成闭环。

三大落地场景:机器人、自动驾驶与工业自动化

物理 AI 的应用生态非常庞大,但最清晰的方向主要有三类。

第一类是人形机器人和具身系统。它们需要多模态感知、运动控制、抓取操作、场景理解和任务规划。短期内,真正可落地的未必是全能家庭管家,而是工厂、仓库、园区、巡检、搬运、分拣、导览和特种作业等边界更清晰的场景。

第二类是自动驾驶和无人运载设备。自动驾驶本质上也是物理 AI:车辆要感知道路、预测轨迹、规划路径并控制车辆。它拥有真实数据回流、商业模式明确、政策逐步开放和场景相对标准化等优势,是物理 AI 中较早形成规模化验证的方向。

第三类是工业自动化与智能装备。制造、仓储、物流、质检、预测性维护、工业巡检、柔性装配等场景,付费意愿更强、ROI 更容易计算、环境更结构化,也更适合早期物理 AI 落地。

产业空间:从数字世界走向实体经济

物理 AI 的市场规模之所以被反复强调,是因为它面向的是现实世界中的劳动和资本开支。制造、物流、交通、医疗、农业、能源和基础设施运维,都不是单纯的软件市场,而是长期存在大量人力、设备、场地和安全成本的行业。

一旦 AI 能替代其中一部分现场操作、重复劳动和危险岗位,它带来的不是简单的效率优化,而是生产组织方式的变化。自动驾驶替代司机成本,工业机器人替代危险巡检,人形机器人参与搬运和分拣,医疗机器人辅助康复和手术,农业设备自动驾驶和自动喷灌,都会形成实际现金流。

北美目前在基础模型、芯片、仿真平台和头部企业上仍占主导;亚太地区则拥有制造能力、供应链、机器人量产和硬件降本优势。中国的机会不一定在单点模型全球第一,而在把模型、硬件、供应链、场景和工程交付结合起来。

投资图谱:不要只盯机器人外壳

物理 AI 的投资不能只看机器人本体。真正的产业链至少包含五层:基础模型与世界模型、数据与仿真平台、端侧芯片与传感器、机器人本体与执行器、场景运营与服务闭环。

基础模型决定大脑能力,世界模型决定物理理解和规划能力,仿真平台决定训练效率,端侧芯片决定实时响应,本体制造决定成本和可靠性,场景服务决定商业化收入。任何单一环节都不足以解释整个产业。

更稳妥的思路,是寻找能够跨场景服务大量应用的基础设施公司,以及能够在具体场景中跑出 ROI 的本体和服务公司。前者可能成为物理 AI 时代的开发平台,后者则通过真实订单验证需求。

风险:路线未收敛,商业化仍要算账

物理 AI 的长期空间很大,但早期风险同样明显。首先,技术路线仍未完全收敛。VLA、世界模型、端到端、分层控制、隐空间模型和仿真强化学习都在演进,过早押注单一路线,风险很高。

其次,仿真与现实存在差距。摩擦、材质、光照、遮挡、柔性物体、力反馈和设备误差,都可能让合成数据训练出的模型在真实场景中失效。物理 AI 也会有自己的“幻觉问题”,只是这种幻觉不再表现为说错话,而是表现为动作失败和安全事故。

最后,商业化节奏可能反复。机器人演示成功,不等于工厂可以连续运行;单次任务完成,不等于客户愿意付费;远期市场巨大,不等于短期估值合理。投资上必须同时看长期产业方向和短期交易节奏。

结论:第三浪的核心,是让智能进入物理世界

物理 AI 是 AI 从信息生产力走向物理生产力的关键跃迁。它不是某一个机器人概念,也不是某一次大会上的技术口号,而是一套重新组织真实世界劳动、设备、数据和场景的产业体系。

未来真正重要的公司,可能不是单纯做最酷外形的机器人,而是能够定义模型、数据、仿真、评测、芯片、本体和场景闭环的企业。谁能让机器在现实世界里稳定工作,谁就有机会掌握第三浪的核心价值。