全球具身智能产业链全景:从物理供应链到机器人智能系统

全球具身智能产业链全景:从物理供应链到机器人智能系统
全球具身智能产业链全景

研究时点:2026年8月9日
关键词:具身智能、人形机器人、VLA、世界模型、机器人数据、Sim-to-Real、Robot Agent Harness、Fleet、RaaS

当大模型开始从屏幕走向物理世界,产业界最容易犯的错误,是把“具身智能”直接等同于“人形机器人”。于是,讨论迅速收缩成减速器、丝杠、关节和整机出货量,仿佛只要把一台双足机器人的物料清单拼完整,具身智能产业就已经成立。

事实恰恰相反。

人形机器人只是一种身体形态;具身智能则是一套让机器在物理世界中感知、理解、决策、行动、反馈并持续学习的完整系统。它既包括工业机械臂、协作机器人和AMR,也包括轮式移动操作机器人、四足机器人、无人机、医疗机器人、农业机器人以及人形机器人。它横跨精密制造、实时控制、机器人数据、仿真训练、VLA模型、Agent运行时、云边协同、系统集成和持续运营。

因此,理解具身智能产业链,不能只画一张从“零部件—本体—应用”向下延伸的传统制造业链条。更准确的图景是:

一条物理供应链,加上一套实时控制栈、一条数据生产线、一套模型训练栈,以及一个部署运营飞轮。

全球具身智能产业链全景图

图:全球具身智能产业链全景。主链从物理供应链延伸至行业应用,底部是“部署—数据—训练—OTA—再部署”的复利飞轮。


一、先重新定义产业边界:具身智能、人形机器人和传统机器人不是同一个集合

机器人、具身智能和人形机器人分别描述三个不同维度:

  • 机器人描述的是可编程的物理设备。传统焊接机械臂即使完全按照预设轨迹工作,也属于机器人。
  • 具身智能描述的是智能体通过身体与环境交互,形成感知—行动—反馈闭环的能力。它不限定身体形态。
  • 人形机器人描述的是外形与运动结构。它可以搭载具身基础模型,也可以只是预编程设备。

这一区分看似概念性,实际决定了产业判断是否正确。

在固定工位完成高节拍焊接,工业机械臂往往比人形机器人更便宜、更快、更可靠;在平整仓库里搬运货物,AMR比双足机器人更节能;在医院跨房间运送物资并操作门、电梯和柜体,轮式双臂可能是更现实的折中;只有当楼梯、人类工具和既有设施兼容性非常重要时,双足人形的复杂性才可能获得经济回报。

所以,具身智能的第一条产业规律是:

任务定义身体,而不是身体寻找任务。

一个成熟项目首先要问“客户要完成什么任务、失败代价是什么、环境能否改造”,然后才决定使用固定臂、轮式、双足、四足还是专用设备。


二、第一条主链:物理供应链——让机器的身体轻、强、准、可靠且可量产

具身智能最终要作用于真实物体。再强的模型,也无法弥补关节过热、齿轮磨损、线束断裂、传感器漂移或电池续航不足。因此,上游不是模型时代的“低技术附属品”,而是智能能否被可靠释放的物理边界。

1. 材料与精密制造

机器人结构需要在强度、刚度、重量、成本和可维修性之间取舍,常见材料包括铝镁合金、钢、钛合金、碳纤维复合材料和工程塑料;电机又依赖高性能磁材、铜绕组和硅钢片;移动本体则受到电芯、BMS、连接器、散热和峰值放电能力约束。

这些材料必须经过精密铸锻、CNC、齿轮磨削、热处理、轴承加工、注塑、PCB/SMT、线束制作、密封、装配和整机标定,最终才能变成一台可连续工作的设备。

具身机器人对制造业提出的要求,不只是“做出一个高性能样件”,而是:

  • 一千个关节的性能分布能否保持一致;
  • 高频往复运动后的背隙、噪声和效率如何变化;
  • 温升和润滑能否支撑一个完整班次;
  • 发生故障后能否快速诊断、拆装和更换;
  • 供应链能否在价格下降时仍保持质量。

这解释了为什么“送样”“定点”和“量产”之间存在巨大鸿沟。真正的护城河往往是寿命数据库、良率、过程控制和与整机厂共同设计的能力,而不是实验室峰值参数。

2. 执行器与传动:机器人的肌肉和关节

执行器通常不是一颗单独的电机,而是电机、减速器或丝杠、编码器、驱动器、力矩与温度传感器、制动器和结构件组成的系统产品。

主要技术路线包括:

  • 无框力矩电机、伺服电机和灵巧手使用的空心杯电机;
  • 紧凑高减速比的谐波减速器;
  • 适合高刚度高载荷的RV或摆线方案;
  • 兼顾效率和成本的行星减速器;
  • 更有利于力控和反驱的低减速比、准直驱方案;
  • 用于直线执行的滚珠丝杠和高承载潜力的行星滚柱丝杠。

产业界常用“BOM价值量”寻找受益零件,但机器人架构还没有完全收敛。未来的关节可能在高减速比与准直驱之间分化,灵巧手也可能在五指、多指、二指夹爪和工具快换之间长期并存。押注单一技术路线的风险,远高于成熟汽车供应链。

3. 传感器:不仅要看见,还要知道接触发生了什么

机器人的感知系统可以分成三层:

  • 外感知:RGB、双目、深度相机、事件相机、激光雷达、毫米波雷达、超声和麦克风阵列;
  • 本体感知:编码器、IMU、关节扭矩、六维力/力矩、电流、温度和电压;
  • 接触感知:指尖和掌面触觉阵列、视触觉、电子皮肤以及滑移检测。

机器视觉解决“物体在哪里”,力觉与触觉则帮助机器人判断“有没有碰到、抓得是否太紧、物体是否滑动、插接是否到位”。在精细装配、柔性物体和安全人机协作中,后两者可能成为关键增量。

但传感器不是越多越好。每增加一种传感器,就增加同步、标定、遮挡、带宽、算力、漂移和维护成本。真正有价值的是能够提高任务成功率、故障诊断能力或安全冗余的多模态组合。

4. 计算、通信与能源

现代机器人通常采用分层计算架构:

  • GPU、NPU或高性能SoC负责视觉、VLM/VLA、地图和策略推理;
  • 工业PC或实时控制器负责运动规划和全身控制;
  • MCU、DSP或FPGA执行关节级电流、速度和位置环;
  • EtherCAT、CAN-FD、TSN等实时总线连接各执行与感知模块;
  • 云端承担大规模训练、数据治理、模型仓库和Fleet分析。

峰值TOPS不是唯一指标。实际系统经常受内存容量、摄像头吞吐、模型并发、热设计、功耗和实时任务隔离约束。以NVIDIA Jetson Thor为例,官方页面给出了最高约2,070 FP4 TFLOPS、128GB LPDDR5X和40—130W功耗范围,但FP4峰值不能直接等同于FP16/FP32能力,更不能等同于真实机器人应用吞吐。


三、第二条主链:本体与实时控制——AI决定做什么,控制系统保证做得到

具身智能最重要的工程事实,是物理世界具有连续性、惯性和危险性。语言模型可以延迟几百毫秒生成计划,关节控制却必须在毫秒甚至亚毫秒尺度稳定运行。

因此,可部署的机器人不会只靠一个端到端大模型,而会形成分层系统:

  1. 任务层,秒级:把自然语言、工单和环境状态转换成目标、约束和任务图;
  2. 运动规划层,10—100毫秒到秒级:完成路径、抓取、逆运动学、碰撞检查和轨迹优化;
  3. 全身控制或MPC,约1—10毫秒级:处理质心、接触、平衡和多任务约束;
  4. 关节伺服,亚毫秒到数毫秒级:闭环控制位置、速度、电流和力矩;
  5. 独立安全层:急停、安全PLC、限速限力、区域防护和看门狗。

VLA可以输出动作块、末端目标、技能名称或技能参数,但其输出必须经过世界状态校验、可达性分析、碰撞检查、动力学约束和安全策略过滤。大模型负责“认知和选择”,策略模型负责“技能和动作”,经典控制负责“确定性和实时性”,独立安全链负责“兜底”。

这不是保守,而是从演示系统走向生产系统的必要条件。


四、第三条主链:机器人数据——稀缺的不是视频,而是可学习、可追溯的动作轨迹

文本模型能够使用互联网上海量网页训练,但机器人需要的数据更加昂贵。一个有效训练样本不仅包括图像,还要包括机器人本体状态、动作、力或触觉、时间戳、任务目标以及执行结果。

可以把最基本的数据单位写成:

观察 Ot + 本体状态 St + 动作 At + 新观察 Ot+1 + 任务反馈 Rt

1. 数据从哪里来

目前主要有五类来源:

  • 人类通过主从臂、VR手柄、动作捕捉、手套或外骨骼进行真机示范;
  • 工程人员直接拖动机器人完成kinesthetic teaching;
  • 已部署机器人持续产生自主运行日志;
  • 人类视频经过姿态估计、对象与接触理解后重定向为机器人动作;
  • 仿真系统和生成模型生产合成视觉、状态和轨迹。

真机示范最接近实际,却昂贵、缓慢且会造成设备磨损;人类视频规模大,却缺少精确动作与力反馈;仿真数据便宜且可以覆盖危险长尾,但存在现实差距。成熟的数据策略不会押注单一来源,而是用真实数据定义分布,用仿真扩展覆盖,用现场失败不断补齐长尾。

2. 数据规模正在上升,但数字不能简单横比

公开项目已经展示出机器人数据集的快速扩张:

  • Open X-Embodiment聚合22种本体、21家机构和527项技能/160,266个任务条目;
  • DROID包含76,000条示范、约350小时、564个场景、52栋建筑和86项任务;
  • AgiBot World Colosseo披露超过100万条轨迹、约2,976小时、217项任务、87项技能和106个场景;
  • Mobile ALOHA展示了低成本双臂全身遥操作,并在特定任务中以每任务50条示范进行训练。

这些数字不能直接排名。不同项目对task、skill、episode和hour的定义不同,本体、控制频率、传感器和数据质量也不一致。1000小时高度重复的成功示范,可能不如100小时覆盖关键失败与恢复的数据有价值。

3. 数据工厂真正出售什么

机器人数据公司的核心产品不应只是“采集了多少小时”,而应包括:

  • 统一时钟和数据schema;
  • 相机、关节和坐标系标定;
  • 动作重定向和技能分段;
  • 失败类型识别和质量评分;
  • 隐私脱敏、授权和数据血缘;
  • 版本管理、回放、主动采样和训练采样器;
  • 跨本体动作空间映射。

有效数据价值可以粗略理解为:

覆盖度 × 质量 × 稀缺性 × 可迁移性 × 可追溯性 ÷ 获取与治理成本。

随着成功示范逐渐商品化,未来更稀缺的资产很可能是“机器人为什么失败、如何恢复、什么时候需要人类介入”的数据。


五、第四条主链:仿真与Sim-to-Real——它不是现实替代品,而是长尾覆盖器

真实机器人训练昂贵、速度慢,而且碰撞、跌倒和危险探索可能损坏设备。仿真因此成为具身智能基础设施的重要组成部分。

典型栈包括MuJoCo/MJX、Isaac Sim/Isaac Lab、Gazebo、SAPIEN/ManiSkill、PyBullet、Brax、Genesis、Habitat、AI2-THOR和CARLA等;上层还需要URDF、SDF、USD或CAD资产、材质、传感器模型、数字孪生和程序化场景生成。

Sim-to-Real通常依靠六类方法:

  1. 系统辨识,拟合质量、惯量、摩擦、柔顺、间隙、时延和噪声;
  2. 域随机化,改变纹理、光照、相机位置与动力学参数;
  3. 域适配,用少量真实数据校准视觉与状态分布;
  4. 残差学习,让解析模型负责主体,神经网络补偿未建模误差;
  5. 特权学习,让仿真teacher使用完整状态,再蒸馏给只能看到真实传感器的student;
  6. 安全迁移,依次经过SIL、HIL、shadow mode、小速限力和逐步放权。

需要警惕的是,不同平台宣传的“每秒仿真步数”往往不在同一口径。有的只计算物理,有的包含渲染、碰撞、传感器或策略推理,不能直接比较。

世界模型和生成式仿真可以预测未来状态、生成反事实场景并扩充训练数据,但在接触、摩擦、柔性物体和长时间预测上仍可能积累误差。它们适合作为候选生成器和风险覆盖工具,却不应成为安全验证的唯一依据。


六、第五条主链:VLA、世界模型和策略学习——从识别世界走向改变世界

传统机器人系统采用模块化链路:感知、定位、建图、任务规划、运动规划和控制。它可解释、可验证,缺点是接口由人定义,面对新任务时泛化成本较高。

VLA(Vision-Language-Action)试图把图像、语言和本体状态映射成动作token、连续动作块或技能参数。它继承了视觉语言模型的语义知识,又用机器人轨迹学习如何行动。Physical Intelligence的π0采用VLM骨干加flow matching动作专家;Google DeepMind的Gemini Robotics强调跨任务和灵巧操作;NVIDIA GR00T N1提出“慢思考VLM+快动作模型”的双系统;SmolVLA则探索约450M参数和消费级硬件的轻量路线。

这些进展说明机器人模型正在从单任务策略走向可迁移基础模型,但距离“一个模型控制所有机器人”仍很远,主要障碍包括:

  • 不同机器人关节数、控制频率、相机布局和坐标系不同;
  • 长程任务会产生乘法式误差累积;
  • 精确接触、柔性物体、透明反光物体和插拔操作仍难;
  • 训练数据偏向成功示范,模型不擅长判断自己已经偏离;
  • 云端推理延迟和网络波动不适合连续控制;
  • 各机构评测环境、容错标准和人工重置规则不同。

因此,近期更现实的架构不是纯端到端,而是分层策略:VLM或LLM负责任务理解和子目标,VLA或Diffusion/Flow Policy执行动作技能,运动控制器完成确定性闭环,安全系统独立监督。


七、最容易被低估的一层:Robot Agent Harness

基础模型提供的是能力分布,客户购买的却是稳定完成工作流的系统。两者之间需要一个运行时把模型、工具、技能、状态、权限和异常恢复组织起来。这就是Robot Agent Harness。

它至少应包含:

  • 任务解析、结构化计划、任务图和行为树;
  • 技能注册表、能力发现和参数校验;
  • 世界状态、语义地图、短期与长期记忆;
  • ROS 2 action、MoveIt、Nav2和设备SDK调用;
  • 权限Policy、地理围栏、资源锁和并发控制;
  • 失败检测、重试、替代技能、回退和远程接管;
  • 模型路由、推理缓存、延迟预算与算力成本控制;
  • 仿真回归、灰度发布、兼容矩阵和版本回滚;
  • 完整的审计日志与事故追溯。

它和软件世界中的AI Agent Harness高度同构,但机器人环境增加了四个硬约束:

  1. 状态连续变化,不能假设工具调用前后世界保持不变;
  2. 低层控制需要确定性实时响应;
  3. 多台设备会竞争空间、充电桩、门、电梯和工位;
  4. 错误不只是“回答错了”,还可能造成设备损坏和人员伤害。

因此,Robot Agent Harness不能只是把LLM接到ROS命令上,而必须成为模型与实时控制、安全系统、现场流程之间的“责任边界”。

云、边、端如何分工

  • 机载端运行安全、伺服、状态估计、基础感知和断网可执行技能;
  • 边缘站点处理多机地图、局部大模型、视频缓存和低时延调度;
  • 云端负责训练、数据湖、模型仓库、跨站点Fleet分析和全局优化。

网络中断时,机器人必须能够安全降级;原始视频应尽量本地筛选与脱敏;控制面、数据面和安全面需要隔离。机器人“上云”不意味着把实时控制放到公网,而是让训练和运营获得规模效应。


八、部署运营:集成商交付的不是机器人,而是持续产能

一台机器人进入客户现场,真正的工作才刚刚开始。典型交付包括:

场景勘察、任务与危害分解、ROI基线、硬件选型、夹具与流程改造、数据采集、仿真与离线评测、现场标定、小规模试运行、验收、运维和持续优化。

很多项目的复杂度来自机器人以外:

  • 如何与MES、WMS、ERP和工单系统连接;
  • 如何调用门禁、电梯、自动门和充电设施;
  • 人类员工和机器人如何共享空间;
  • 异常物料、设备故障和网络中断如何处理;
  • 谁对安全事故、模型更新和远程接管负责。

Fleet、OTA与远程接管

规模部署需要一套机器人运营平台,涵盖设备身份和证书、任务调度、交通管制、充电、健康监控、预测维护、遥测、视频片段、干预原因和SLA。

OTA不能只是“远程升级”,而要像关键基础设施发布一样具备签名、A/B分区、灰度、兼容矩阵、自动回滚和审计。远程接管也不是失败的耻辱,而是早期商业化的重要组成部分;问题不在于是否接管,而在于能否持续降低每百次任务的人工分钟,并让一名操作员监管越来越多机器人。

安全不是一个模块,而是一条独立闭环

安全链应与AI策略隔离,至少包括危害分析、速度/空间/力矩包络、异常检测、双通道急停、事件黑匣子、供应链SBOM、模型和数据签名、隐私最小化以及事故后的安全case更新。

ISO 10218-1:2025和ISO 10218-2:2025分别面向工业机器人制造商和机器人应用/单元集成,新版强化了功能安全、协作应用和网络安全。个人护理、医疗、道路和航空机器人还需要遵循各自垂直法规,不能用一个通用标准覆盖全部责任。


九、下游应用:工业和物流先行,家庭通用最后

具身智能是否商业成立,不取决于动作有多像人,而取决于单位有效作业成本是否低于替代方案。

1. 工业制造

机床上下料、料箱拣选、物料搬运、质检、装配、涂胶和打磨,是当前最适合规模验证的领域。任务频率高、价值明确、环境可改造,企业也有能力定义验收标准。

但“使用具身智能”不意味着所有岗位都换成人形。固定高节拍工位仍会由专机和工业臂承担;需要跨工位、SKU频繁变化或使用人类工具的环节,移动操作机器人和人形机器人更有机会。

2. 仓储物流

AMR、分拣、码垛、拆垛、卸车和订单拣选拥有清晰的劳动成本基线。IFR《World Robotics 2025 Service Robots》统计,2024年运输物流类专业服务机器人约102,900台,同比增长14%,物流RaaS数量增长42%。需要注意,该统计基于294家供应商样本,未外推整个行业,跨年度样本变化也会影响可比性。

3. 商业服务

清洁、配送、餐饮、酒店、零售盘点和安防巡检处在半结构化环境,RaaS能降低客户一次性资本支出,但公众交互、现场维护、设备利用率和人工接管成本决定最终毛利。

4. 医疗和养老

手术、介入、康复、实验室自动化、院内物流和护理辅助具有高价值,但同时受到临床责任、隐私和认证约束。IFR同口径数据显示,2024年医疗机器人销量约16,700台,同比增长91%;这一增长包含康复、手术和诊断实验室等不同类别,不能简单外推为通用护理机器人爆发。

5. 农业、能源与特种作业

采摘、除草、喷洒、挤奶、自动农机、电力巡检、矿山、石化、消防、核电和灾害救援,往往具有缺工、危险或减少化学品使用的明确价值。挑战是天气、地形、遮挡、季节性、长采购周期和双用途监管。

6. 家庭

家庭是想象空间最大、商业难度也最高的市场。通用家务需要面对拥挤空间、儿童宠物、隐私、噪声、长尾物体和极高安全要求。扫地、割草等单功能机器人已经规模化,并不意味着可以快速推出“什么都会做”的家庭通用机器人。

家庭通用具身智能大概率不是产业起点,而是可靠性、成本、数据和责任体系成熟后的结果。


十、商业模式:从卖设备,走向出售机器人劳动力

具身智能可能同时存在五类收入:

  1. 硬件一次性销售与维保;
  2. 仿真、Fleet、数据平台和模型推理的软件许可;
  3. 系统集成、流程改造和工程服务;
  4. 数据采集、许可、模型定制和远程接管;
  5. RaaS按月、按小时、按件或按结果收费。

RaaS降低客户采购门槛,却把设备残值、利用率、维修、融资和现场运维风险转移给供应商。因此,RaaS增长不等于高毛利。供应商必须计算机器人全生命周期贡献毛利、设备回收期和远程操作员杠杆率。

从产业价值池看:

  • 早期,部件、样机、GPU、开发工具和集成服务更容易产生收入;
  • 规模期,可靠整机、一体化关节、Fleet/OTA、场景渠道和数据闭环获得更多价值;
  • 平台期,跨本体模型、技能市场、机器人云和标准接口可能形成软件租值,但硬件异构和安全认证会抑制纯软件赢家通吃。

真正持久的护城河依次是:客户流程嵌入、独家失败与恢复数据、可靠性与成本曲线、跨本体技能迁移、安全认证和运维网络。单次Demo、漂亮外观或某一代模型参数通常不是持久壁垒。


十一、区域格局:中国、美国、欧洲和日本各自掌握什么

中国:供应链、场景与工程速度

中国的优势来自完整电子和机械供应链、丰富制造与物流场景、工程师密度、地方试点和成本迭代。IFR《World Robotics 2025 Industrial Robots》显示,2024年全球新增工业机器人542,076台,亚洲占74%,中国占全球新增量54%。这个数据描述的是工业机器人安装量,不等于具身智能或人形机器人市场,但它表明中国拥有极强的机器人应用与工程土壤。

政策层面,2023年工信部《人形机器人创新发展指导意见》提出到2025年初步建立创新体系、2027年综合实力达到世界先进水平;2025年政府工作报告首次提出培育具身智能等未来产业。

中国需要补的,不只是更大的模型,也包括高可靠精密部件、跨本体数据标准、工业软件、安全认证和全球化运维能力。

美国:基础模型、算力和仿真生态

美国在GPU、云、基础模型、前沿机器人学习和风险资本方面占据优势。NVIDIA、Google DeepMind、Physical Intelligence等推动VLA、仿真、世界模型与边缘计算,Amazon、Tesla等又拥有大规模真实业务场景,能够形成“研究—产品—数据”的闭环。

欧洲与日本:精密制造、工业生态和安全标准

欧洲在工业机器人、控制、安全标准和高可靠集成方面积累深厚;日本和韩国在减速器、伺服、电机、轴承、电子制造和工业机器人产业中具有长期优势。它们可能未必拥有最多的通用模型创业公司,却掌握机器人规模量产不可或缺的工程能力。

最终竞争的单位不是一家模型公司或一家整机厂,而是:

本体—数据—模型—场景—运维组成的生态效率。


十二、别被市场规模预测绑架:更好的方法是拆三张表

目前“具身智能市场”没有统一边界。有的报告纳入工业机器人、无人车和AI软件,有的只统计人形整机,有的又把基础模型、零部件和服务全部相加。由此产生的万亿级预测无法横向比较。

与其争论一个巨大的TAM,不如拆成三张可验证的表:

  1. 设备表:按工业机器人、专业服务机器人、消费机器人和医疗机器人统计安装与销量;
  2. 作业表:从客户总拥有成本、可替代人工工时、任务频率和失败代价自下而上计算;
  3. 价值池表:分别计算部件、本体、系统集成、软件订阅、运维、远程接管和数据模型收入。

这种方法虽然不够“性感”,却能避免把政策目标、行业预测、出货口径和真实收入混成一个数字。


十三、决定产业成败的六个指标

未来判断一个具身智能项目,不应只看演示视频和一次成功率,而要看:

1. 单位有效作业成本

(设备折旧 + 能源 + 维护 + 远程接管 + 停机损失)÷ 有效作业工时

它决定机器人是否真正低于人力或现有自动化方案。

2. 无人工干预时长(MTBI)

机器人连续工作多久才需要人处理一次,比孤立测试中的平均成功率更接近运营价值。

3. 每百任务人工接管分钟

“接管率”可能掩盖干预时长。一次10秒确认和一次30分钟远程操作,对商业模型完全不同。

4. 部署周期

从进场、建图、标定、流程改造到验收所需时间,决定系统集成能否规模复制。

5. 技能迁移成本

新增SKU、场地或机器人本体,需要多少数据小时、训练算力和工程人天。

6. 安全与可审计性

是否能够解释策略版本、数据来源、工具权限、事故前状态和恢复过程,决定它能否进入高价值生产环境。


十四、未来三阶段:从受控场景,到多技能平台,再到开放环境

2026—2028:受控场景规模验证

工厂、仓库、实验室和巡检先行,固定机械臂、AMR、轮式双臂与少量人形混合部署。VLA负责技能泛化,经典控制兜底,遥操作和远程接管普遍存在。行业从“能不能动”转向“一个班次能否稳定工作”。

2028—2031:多技能、多本体和RaaS扩张

统一动作表示、技能接口和数据治理逐步成熟,模型可迁移到更多本体,部署从单工位扩展到整线和整仓。Fleet、OTA、结果付费和远程运营平台成为关键基础设施,一名操作员能够监管更多设备。

2031年以后:开放环境与消费扩张,高度不确定

只有当硬件成本、能耗、可靠性、安全责任和隐私体系同时过关,家庭护理、通用家务和城市服务才可能放量。届时或许出现机器人技能商店和通用执行平台,但它不会简单复制手机App生态,因为物理技能受到本体差异、场景条件和安全认证约束。

阶段切换的门槛不是年份,而是:

每小时总成本低于替代方案,MTBI满足班次要求,远程干预可被摊薄,安全责任可以承保。


十五、软件工程与AI Agent从业者的真正机会

具身智能并不只属于机械、控制和机器人公司。对软件工程、云基础设施和AI Agent从业者而言,最值得进入的往往不是再造一台通用人形机器人,而是填补机器人从模型到规模运营之间的软件空白。

值得重点关注的方向包括:

  1. Robot Agent Runtime:连接LLM/VLA、行为树、状态机、ROS 2 action和安全策略;
  2. 技能编排与标准:技能schema、前置/后置条件、能力发现和跨本体映射;
  3. Robotics Observability:对齐时序日志、rosbag、视频和模型trace,完成失败聚类与根因分析;
  4. EvalOps与安全评测:场景生成、仿真回归、故障注入、红队、canary和安全case管理;
  5. 机器人数据引擎:轨迹schema、质量评分、主动采样、血缘、许可和版本管理;
  6. Fleet、OTA与远程接管:设备身份、调度、签名升级、回滚和运营控制台;
  7. 云边推理:模型量化、异步action chunking、NPU/GPU调度、断网降级与隐私过滤;
  8. 仿真资产流水线:CAD/USD处理、数字孪生、参数辨识、场景生成与真实日志重放;
  9. 垂直工作流集成:打通工单、机器人、人工例外和结果结算。

最稳妥的入场路径,是先掌握ROS 2、MoveIt/Nav2、坐标变换和实时控制基础,再构建“自然语言→计划→技能调用→失败恢复→日志”的Agent Harness,随后建立仿真回归与真机数据闭环,最后选择物流、实验室、机床上下料或巡检等微场景完成真实交付。

创业选题应优先满足:任务频次高、失败可恢复、环境可适度改造、人工贵或缺、数据能够回流、监管可控。要谨慎对待低频炫技、家庭全能、要求零错误却没有独立安全链,以及无法获得真实运行数据的项目。


结语:具身智能的终局不是“机器人更像人”,而是机器劳动形成复利

具身智能产业最重要的变化,不是机器人终于长出了两条腿,而是AI第一次开始拥有可以持续影响真实世界的行动闭环。

短期,价值主要来自可靠部件、边缘算力、数据工具、系统集成、Fleet/OTA和远程接管;中期,竞争转向跨本体技能、机器人Agent运行时和部署数据飞轮;长期,才可能出现能够在开放环境中持续工作的通用机器劳动力。

真正的产业飞轮是:

部署更多机器人 → 获得真实运行、失败和恢复数据 → 改进模型与技能 → 通过评测和灰度OTA重新部署 → 提高MTBI并降低单位作业成本 → 获得更多客户。

所以,具身智能产业链的中心从来不是某一个零件、某一种身体或某一个模型。中心是一个能够把物理制造、数据、模型、控制、安全和运营连接起来,并在真实任务中不断自我强化的系统。

谁能最早建立这个闭环,谁才最有可能掌握具身智能时代真正的产业平台。


主要参考来源

  1. International Federation of Robotics, World Robotics 2025 Industrial Robots, 2025-09. https://ifr.org/ifr-press-releases/news/global-robot-demand-in-factories-doubles-over-10-years
  2. International Federation of Robotics, World Robotics 2025 Service Robots, 2025-10-07. https://ifr.org/ifr-press-releases/news/service-robots-see-global-growth-boom
  3. Open X-Embodiment Collaboration, Open X-Embodiment: Robotic Learning Datasets and RT-X Models, arXiv:2310.08864. https://arxiv.org/html/2310.08864
  4. Google DeepMind et al., Gemini Robotics: Bringing AI into the Physical World, arXiv:2503.20020. https://arxiv.org/html/2503.20020v1
  5. Physical Intelligence, π0 / π0.5 / OpenPI official blog. https://www.pi.website/blog
  6. NVIDIA, Isaac GR00T N1 announcement, 2025-03-18. https://nvidianews.nvidia.com/news/nvidia-isaac-gr00t-n1-open-humanoid-robot-foundation-model-simulation-frameworks
  7. NVIDIA, *Jetson Thor Advanced AI for Physical Robotics*. https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-thor
  8. Khazatsky et al., DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset, RSS 2024. https://www.roboticsproceedings.org/rss20/p120.pdf
  9. AgiBot World / OpenDriveLab, AgiBot World Colosseo, 2025. https://opendrivelab.com/AgiBot-World
  10. Fu, Zhao, Finn, Mobile ALOHA, CoRL 2024. https://mobile-aloha.github.io
  11. Tao et al., ManiSkill3, arXiv:2410.00425. https://arxiv.org/html/2410.00425v1
  12. ISO Robotics sector: ISO 10218-1:2025, ISO 10218-2:2025, ISO 13482:2014. https://www.iso.org/sectors/engineering/robotics
  13. ROS 2 Documentation. https://docs.ros.org/en/rolling/
  14. MoveIt 2. https://github.com/moveit/moveit2
  15. Open-RMF. https://www.open-rmf.org/
  16. 工业和信息化部,《人形机器人创新发展指导意见》政策解读,2023-11-03. https://www.szzg.gov.cn/2023/szzg/gzdt/202311/t20231103_4758913.htm

数据口径说明:工业机器人、专业服务机器人、消费机器人和医疗机器人属于不同统计体系;服务机器人数据基于供应商样本且未外推。厂商成功率、数据集小时数、任务数及算力指标均只能在原始任务、精度和测试口径内理解,本文没有将其直接横向排名。

📖 相关阅读

上一篇
全球 AI+产业结合研究周报 · 第 5 期(2026-07-31 ~ 2026-08-06)
下一篇
全球 AI Agent 研究周报 · 第 10 期(2026-08-03 ~ 2026-08-09)