AI 产业正在从数字世界进入物理世界。过去几年,生成式 AI、AI Coding、智能体和多模态模型改变了内容生产、软件开发和知识工作,但这些变化大多仍然发生在屏幕之内。接下来的核心问题是:当 AI 进入机器人、自动驾驶、无人设备、工业系统和智能终端,谁会成为物理 AI 时代的基础设施?
数字 AI 时代,英伟达通过 GPU 和 CUDA 生态成为算力基础设施的核心。物理 AI 时代,也会需要类似的底层平台:世界模型、仿真环境、合成数据、评测标准、动作模型、端侧芯片、开发框架和场景数据闭环。谁能定义这些基础设施,谁就可能拥有新的生态壁垒。
从数字 AI 到物理 AI
过去几年可以分成三个阶段。第一阶段是数字 AI 1.0,以对话框、文本生成、图片生成和知识问答为代表。它提升的是内容生产和信息处理效率。
第二阶段是数字 AI 2.0,以推理模型、AI Coding 和智能体为代表。AI 不再只是回答问题,而是开始拆解任务、调用工具、修改代码、运行测试、处理复杂流程。它开始接近软件世界中的自动执行者。
第三阶段是物理 AI。它要把 AI 的理解、推理和任务执行能力嵌入机器人、自动驾驶、无人车、无人机、工业设备、物流系统和各类智能终端。AI 从信息生产力走向物理生产力,这才是更大的市场。
数字 AI 替代或增强的是脑力劳动,尤其是白领、开发者、内容创作者和知识工作者;物理 AI 面向的是制造、物流、运输、建筑、能源、零售、农业、医疗护理、家庭服务和基础设施运维。这些行业承载了更大的 GDP、更重的人工成本和更明确的效率提升空间。
数字 AI 集中,物理 AI 分散
数字 AI 的应用层容易集中。一个聊天机器人、一个代码助手、一个办公工具,只要体验明显领先,就可以通过网页和 API 快速服务全球用户。用户在不同头部模型之间切换,最终份额往往集中在少数平台。
物理 AI 的应用层会更分散。汽车工厂、3C 产线、仓储物流、矿山巡检、医院护理、家庭厨房、农业采摘、低空无人机、自动驾驶卡车,它们对机器人形态、传感器、本体结构、动作能力、安全标准和交付方式的要求完全不同。
数字 AI 可以用一个网页服务全球,物理 AI 必须深入不同产业、不同国家、不同客户现场。工业机器人要懂工艺流程,仓储机器人要懂物流调度,医疗机器人要满足监管,自动驾驶要适应道路和法规。通用智能很重要,但现实世界首先是无数垂直场景。
因此,物理 AI 的基础设施层反而更重要。应用分散意味着上层难以被一两家公司完全垄断;但如果某家公司掌握了世界模型、仿真环境、合成数据、评测体系和开发框架,就可以服务大量分散应用。
下一个 CUDA 可能不是软件工具,而是数据与仿真标准
CUDA 的价值不只是一个编程接口,而是围绕 GPU 形成了开发者、模型公司、云厂商和应用生态。它让算力被高效调用,也让英伟达的硬件优势变成生态壁垒。
物理 AI 时代,同样需要一个底层生态:统一的数据生成体系、仿真环境、评测标准、动作模型、世界模型和部署框架。机器人公司、自动驾驶公司、无人设备公司和工厂智能化公司,都需要在这个体系上训练、测试和部署自己的模型。
如果某个平台能够持续提供高质量合成数据、真实场景还原、物理正确的仿真、动作对齐、模型评测和部署工具,它就不只是软件供应商,而可能成为物理 AI 的基础设施入口。
大模型价值公式:智能密度乘以 Token 吞吐量
理解物理 AI 之前,必须理解大模型竞争正在从“榜单排名”走向“生产效率”。过去市场容易看参数规模、排行榜和融资估值,但这些指标越来越不够用。更关键的是模型输出真实价值的能力,以及这种能力能否规模化提供。
一个更接近商业本质的公式是:大模型企业价值等于智能密度乘以 Token 吞吐量。智能密度指的是每单位输出能否完成高价值任务,比如写出可运行代码、完成法律条款分析、生成商业视频、执行金融研究或替代真实劳动。Token 吞吐量则代表模型服务用户、企业任务和 API 调用的规模。
这会引出两条路线。第一条是智能路线,重点在复杂推理、代码能力、工具调用、企业任务、法律金融分析、办公室自动化和行业智能体。它更接近生产力工具,企业付费意愿更强。
第二条是想象路线,重点在视频、声音、音乐、图片、角色陪伴、游戏资产、广告创意和娱乐消费。它更接近内容生产和体验消费,C 端传播更快。头部模型公司未来大概率不会只做一条线,而会同时覆盖企业生产力、内容消费和开发者生态。
AI 原生组织:人才密度比团队规模更重要
AI 公司之间的竞争,不只是模型和算力的竞争,也是组织结构的竞争。传统科技公司依赖大规模团队、分层管理和成熟流程,但 AI 行业的模型架构、推理架构、产品形态、用户需求和算力成本都在以月为单位变化。
真正高效的 AI 原生组织,通常更扁平、更年轻、更技术密集。核心研究员、工程负责人、产品负责人和 CEO 之间可以快速沟通,模型训练方向不对就立即调整,产品反馈不好就快速迭代,新技术路线出现就组织小团队验证。
大模型公司不是人越多越强。真正决定模型突破、架构创新和产品方向的,往往是少数顶尖人才。其他工程、数据、产品、评测和交付团队围绕关键任务形成高密度协作。人才密度、协作效率和目标一致性,往往比团队规模更重要。
具身智能需要大脑、小脑和端侧芯片
具身智能与传统机器人最大的不同,是它不是单纯执行预设程序,而是与环境持续交互,通过感知、理解、决策、操作和反馈不断学习。它既需要身体,也需要大脑;既需要传感器,也需要模型;既需要本体制造能力,也需要数据闭环和端侧推理能力。
首先是感知能力。机器人要识别物体位置、形状、材质、姿态和运动状态;无人车要理解道路、车辆、行人、交通灯和障碍物;无人机要感知高度、风向、地形和风险;工业机器人要理解零部件、夹具、产线节拍和缺陷特征。
其次是大脑和小脑。大脑负责理解任务、规划步骤、调用知识和做高层决策;小脑负责动作控制、运动协调、逆控反馈和实时调整。复杂推理可以在云端,避障、抓取、力反馈和安全判断必须在端侧完成。
最后是端侧芯片。物理世界要求毫秒级响应,机器人和无人设备不能把所有计算交给云端。感知芯片处理摄像头、雷达和触觉传感器,推理芯片运行视觉模型和动作模型,运控芯片控制电机、关节、底盘和执行器。
中国的机会:供应链、场景和产业组织能力
具身智能具有天然的国家战略属性。它不是一个孤立创业赛道,而是国家资本、产业资本、大厂生态、制造供应链和地方政府共同推动的战略产业。
中国的优势不一定是单点模型全球第一,而是完整制造供应链、大规模应用场景和强产业组织能力。电机、减速器、关节、传感器、摄像头、激光雷达、电池、电控、结构件、芯片模组、整机装配和测试能力,都可以从新能源汽车、消费电子、无人机、工业自动化和智能硬件体系中迁移。
物理 AI 需要大量真实场景验证,而中国拥有汽车、3C、光通信、物流、零售、农业、医疗和家庭服务等多样化场景。场景越多,数据越多,迭代越快。对物理 AI 来说,数据和场景往往比单纯算法更重要。
此外,地方政府、产业基金、国资平台、大厂生态和制造企业能够提供资金、试点场景和客户资源。这种产业组织能力,有助于新技术从概念验证进入规模化应用。
从 VLA 到世界模型 2.0
过去一到两年,VLA 是具身智能的重要路线。它把视觉、语言和动作结合起来,推动机器人从传统控制走向大模型驱动。但随着规模化落地临近,VLA 的瓶颈开始暴露。
第一,缺乏物理验证。视觉语言模型擅长识别和描述,却不一定理解因果和动力学。第二,动作学习效率不高。语言 token 是离散符号,动作是连续控制,细微偏差就可能导致抓取失败或安全事故。第三,数据需求巨大。高质量真机操作数据昂贵,难以像互联网文本那样规模化获取。
世界模型主导的具身智能 2.0,核心路径是物理世界预训练、动作对齐和强化学习。模型先通过视频、仿真、动作轨迹和物理交互数据学习物体如何移动、碰撞如何发生、重力如何作用;再把人类动作、机器人动作和任务目标对齐;最后通过试错、奖励和反馈学习长周期任务策略。
相比 VLA,世界模型最大的优势是数据效率和泛化能力。因为它先学到了大量物理规律,动作学习不再完全依赖昂贵真机数据。这可能是具身智能迎来真正拐点的关键。
世界模型的三条路线
世界模型大致有三类方向。第一类是物理正确派,追求 3D 一致性、物理一致性和动作准确性,强调仿真环境与真实世界高度一致。这类路线适合自动驾驶、机器人操作、工业仿真和安全评测。
第二类是隐空间派,不一定追求可视化效果,而是强调机器内部表征和预测效率。模型在低维隐空间中学习世界状态、动作后果和环境变化,更适合具身基础模型和强化学习。
第三类是 3D 世界派,更强调生成可交互的三维空间,服务游戏、影视、虚拟现实、内容创作和沉浸式环境。它与物理 AI 有交集,但目标不完全相同。
未来的平台可能融合三者:既要物理正确性,也要高效隐空间表征,还要能够生成可交互 3D 世界。谁能把这三类能力合并进统一平台,谁就更接近物理 AI 的基础设施入口。
数据金字塔:物理 AI 的新 CUDA
具身智能的数据需求远超自动驾驶。真实机器人不可能短期部署到足够规模,因此必须依赖数据金字塔。
最顶层是真实机器人数据,来自真实场景、真实动作和真实反馈,最宝贵但占比最小。中间层是仿真合成数据,通过仿真引擎、数字孪生、物理建模和生成式 AI 构建大量可交互场景。底层是互联网和人类视频数据,包含大量人类动作、工具使用、物体交互和生活场景。
这也是数据基础设施可能成为新 CUDA 的原因。CUDA 定义了 GPU 计算生态,而物理 AI 时代,谁能定义高质量数据生成、仿真训练、动作对齐、评测标准和物理世界建模工具,谁就有可能成为机器人训练、部署和评测的标准平台。
落地路径:先工业,再商业,最后家庭
具身智能不可能一开始就进入最复杂的家庭场景,也不会马上替代所有一线工人。更现实的路径,是从好算账、任务边界清晰、容错空间较大的场景开始。
工业场景是最好的起点之一。工厂、仓库、园区、数据中心和产线相对结构化,任务重复,客户付费意愿强,ROI 容易计算,安全边界也更容易设计。机器人可以先承担巡检、搬运、分拣、质检、装配辅助等任务。
商业场景也会先从导购、咨询、巡逻、配送等轻操作任务开始。家庭场景长期空间很大,但短期难度最高。每个家庭环境不同,物品摆放不标准,老人儿童安全要求高,隐私和责任边界复杂,因此更可能先从清洁、厨房、食品加工、简单整理等局部任务切入。
自动驾驶是物理 AI 最成熟的商业化样板
自动驾驶已经是物理 AI 中最大规模落地的市场之一。车辆感知道路、预测轨迹、规划路径、控制方向盘和刹车,本质上就是感知、决策和行动的物理 AI 系统。
世界模型在自动驾驶中已经体现价值。它可以从真实摄像头数据中重建道路、车辆、行人、障碍物和运动轨迹,再生成更多合成场景训练系统。相比传统图形仿真,数据驱动的世界模型更接近真实道路,也更容易形成闭环。
低速无人配送车同样提供了清晰样板。它运行在园区、校园、社区、商圈和物流站点等相对受控场景,速度低、路线固定、ROI 清晰。无人车最大的优势不是车本身便宜,而是节省司机成本,只要月度成本能显著低于有人车,客户就不需要被过度教育。
新能源重卡:电动化、智能化与无人化交汇
新能源重卡是容易被低估的方向。乘用车是消费品,用户关心品牌、外观、舒适性和残值;重卡是生产资料,客户最关心全生命周期成本。
重卡在交通碳排放和污染物排放中的占比远高于保有量占比。如果重卡不电动化,交通减排很难真正完成。新能源重卡绑定双碳战略、能源安全和物流降本,本质上是生产资料升级。
更大的想象空间是无人重卡。重卡司机工作强度高、安全风险高、人工成本高,且司机群体存在年龄结构问题。电动化先降低能源与维护成本,智能化和无人化再降低人工成本,最终有机会从卖车升级为低碳物流和无人运输平台。
投资框架:模型、制造、服务与供应链
物理 AI 产业链不能用传统机器人框架简单理解。它既有大模型属性,也有高端制造属性;既有硬件供应链,也有软件平台和运营服务;既需要技术突破,也需要场景落地。
第一层是链主层,包括大模型厂商、制造商和 AI 服务化公司。模型厂商提供具身大脑,制造商负责本体和供应链,服务公司把机器人、软件、数据、运维和持续收费结合起来。
第二层是应用层,未来会出现大量垂直领域公司。工业、商业、家庭、医疗、农业、物流、低空经济和自动驾驶的需求差异很大,因此应用层不会像数字 AI 那样赢家通吃。
第三层是供应链层,包括数据采集、仿真训练、端侧芯片、推理芯片、运控芯片、传感器、激光雷达、触觉传感器、关节模组、减速器、执行器、电机和控制器等。进入头部链主供应体系的高壁垒环节,可能获得长期订单。
真正该盯的五个方向
第一是具身大脑,也就是能够理解视觉、语言、动作、三维空间、物理规律和任务目标的基础模型。它包括世界模型、动作模型、小脑控制模型和多模态任务规划系统。
第二是数据基础设施,包括仿真合成数据、人类视频数据、数字孪生数据和评测平台。这是最容易被低估、也最可能形成平台壁垒的方向。
第三是世界模型公司。它们既可以服务自动驾驶,也可以服务机器人、无人车、无人机和工业仿真。如果能够同时拥有真实客户现金流、数据闭环和跨场景扩展能力,就具备双轮驱动。
第四是具身本体。关键不在外形酷不酷,而在能否进入真实场景跑出 ROI。轮式双臂、四足、机械臂、商用服务机器人和人形机器人,对应不同场景和成本结构。
第五是智能运载设备与端侧芯片。无人配送、Robotaxi、新能源重卡、无人机、无人车、机器人都共享感知、决策、控制、端侧计算和数据闭环能力。
风险:长期向上不等于短期直线
物理 AI 是未来 5 到 10 年的重要主线,但越是远期空间巨大的产业,早期越容易出现估值过热、路线摇摆和情绪波动。
技术路线尚未完全收敛,VLA、世界模型、混合架构、端到端、分层控制和隐空间模型都还在演化。数据获取也是核心风险,仿真和现实之间的差距,可能让模型在真实场景中失效。商业化同样不会一帆风顺,实验室成功不代表工厂连续运营,演示效果不等于客户复购。
此外,物理 AI 仍然离不开算力和高端芯片,地缘政治、出口管制、供应链合规和客户信任都会影响产业节奏。投资上应以长期产业逻辑选择方向,以短期交易纪律控制节奏。
结论:物理 AI 的核心资产是基础设施
物理 AI 不是单一机器人行情,而是从数字任务走向物理任务的产业迁移。应用会高度分散,但基础设施可能高度集中。
谁能定义世界模型、仿真数据、评测标准、端侧芯片、动作模型和开发框架,谁就可能成为物理 AI 时代的“新 CUDA”。谁能在真实场景中形成数据飞轮和商业闭环,谁就有机会成为下一代智能产业的核心公司。