返回报告库
EXK-A-014·A 级报告·前沿科技与产业趋势

具身智能技术路线与商业化节奏研究

机器人与具身智能 · 机器人与具身智能。当前权限:免费试读 · 留资/加企微解锁全文

Access Policy
等级
A
阅读权限
免费试读 + 解锁
解锁方式
留资 / 加企微
AEX-K前沿科技与产业趋势机器人与具身智能引流跨界
Report Content

报告试读

具身智能技术路线与商业化节奏研究

报告编号:EXK-A-014 二级赛道:机器人与具身智能 出品单位:经纬智汇信息咨询有限公司(北京) 密级:内部参考 数据截至:2026 年 7 月

摘要

具身智能被英伟达、高盛、摩根士丹利等机构共同视为继大语言模型之后人工智能的"下一个浪潮",也是全球科技竞争与产业投资的战略新高地。本报告从技术导向与市场导向出发,兼顾政策与商业视角,沿"过去→现在→未来"全时间轴,系统剖析具身智能的定义边界、技术路线、竞争格局、商业化节奏、产业链、政策环境与市场预测,并给出面向投资方、技术决策者与采购方的分层行动建议。

核心判断:技术上,"大脑—小脑—本体"三层架构已成共识,VLA(视觉-语言-动作)大模型成为主导范式,但泛化、灵巧操作、长程规划三大瓶颈未解;商业化呈"倒金字塔"顺序,2025 年为全球规模化量产元年,但展示类场景仍占绝对多数;竞争格局是"中美双极"——美国领先于 AI 软件与基础模型,中国主导硬件制造、供应链与量产规模。 建议决策者以"软件/数据护城河 + 硬件国产替代确定性红利 + 场景 ROI 选型标尺"三条主线布局,警惕估值泡沫与同质化竞争。

本报告采用"结论后置"结构:先以九个部分铺陈现状、数据与分析,最后统一给出建议、结论与行动路径。报告约 1.3 万字,含 6 处图占位符与多张数据/对比表。

一、具身智能的定义、内涵与边界

1.1 概念的历史脉络(过去)

具身智能(Embodied AI / Embodied Intelligence)并非新概念。1950 年,图灵在其奠基性论文中已首次提出具身智能的设想;上世纪八九十年代,随着机器人学与认知科学的发展,"智能离不开身体"的思想逐渐成型,与传统"符号主义 AI"分道扬镳。真正将其推向产业前台的是 2023 年——英伟达 CEO 黄仁勋在 ITF World 半导体大会上提出,人工智能的下一个浪潮将是具身智能,即能够理解、推理并与物理世界互动的智能系统。自此,具身智能从学术概念跃升为资本与产业的核心叙事。

1.2 定义与本质

具身智能指一种基于物理身体进行感知和行动的智能系统:智能体通过身体与环境的实时互动来获取信息、理解问题、做出决策并执行行动,从而在交互中学习、进化,产生适应性的智能行为。其本质是"感知—认知—决策—行动"一体化闭环,强调"智能源于身体与环境的耦合",而非脱离物理世界的纯数字推理。

需要厘清的是:具身智能 ≠ 人形机器人。人形机器人是具身智能当前"最佳载体"与最受关注的形态,但具身智能也可承载于轮式、四足、机械臂等多种本体;反过来,一台人形机器人若不具备在交互中学习与泛化的能力,也只是传统机器人。

1.3 与相关概念的区别与联系

维度传统工业机器人AI 大模型(纯数字)具身智能 / 人形机器人
物理实体有(固定臂/固定环境)有(多形态,人形为代表)
工作环境结构化、确定数字空间非结构化、动态、开放
智能来源预编程、示教海量文本/多模态数据大模型 + 物理交互数据
泛化能力几乎无数字任务强泛化追求物理世界泛化(当前弱)
反馈闭环无环境理解无物理反馈感知-决策-行动实时闭环
数据壁垒低(公开数据可蒸馏)高(私有真机数据,数据飞轮)

一句话概括三者关系:具身智能 = AI 大模型(提供"脑")+ 机器人本体(提供"身")+ 物理交互数据(连接二者的血液)。它既不是工业机器人的简单升级,也不是大模型的物理外壳,而是二者深度融合催生的新物种。

1.4 "大脑—小脑—本体"框架

理解具身智能技术的核心框架,是被中国工信部相关指导意见与地方产业主管部门普遍采纳的"大脑—小脑—本体"三层路径:

  • 大脑:负责环境理解、智能交互、认知推理与任务规划,主要依托机器视觉与多模态大语言模型,是"智能"的来源。
  • 小脑:负责运动控制(平衡、姿态、步态、力控),在大脑策略指导下实现动作执行与实时反馈,是"协调"的来源。
  • 本体:物理硬件载体,包括躯干、四肢、灵巧手,以及视觉、触觉、力觉、惯性等各类传感器与执行器,是"身体"本身。

当前产业的一个关键特征是发展不均衡:"大脑"智力借助大模型快速提升,"小脑"的灵巧操作仍处初期,这一"脑快身慢"的落差,正是理解后文一切技术瓶颈与商业化节奏的钥匙。

图1 具身智能"大脑—小脑—本体"三层技术架构示意图

*图1:具身智能"大脑—小脑—本体"三层技术架构示意图*

二、技术路线深度剖析(核心之一)

具身智能的技术栈可沿"感知层 → 决策/认知层(大脑)→ 运动控制层(小脑)→ 本体形态 → 数据路线"逐层拆解。本章为报告技术纵深所在。

2.1 感知层:多模态感知与世界模型

感知层是本体与环境交互的入口,涵盖视觉、触觉、力觉、听觉与本体状态感知(IMU)。

  • 视觉 / 3D 感知:受益于扫地机器人、消费电子等规模化摊薄,工业级入门深度相机成本已降至千元级、较两年前下降约 70%;3D 视觉成为环境建模的关键环节,代表厂商如奥比中光。
  • 触觉 / 力觉:六维力传感器是感知层"皇冠上的明珠",用于手腕、脚踝、机械臂末端的精细力控;电子皮肤、多维触觉感知被深圳等地列为重点攻关方向。难点在于触觉信号的遮挡、噪声与多模态融合。
  • 世界模型(World Model):建立环境的内部表征并预测未来状态,使规划更可靠,尤其适合长时序、复杂的制造/仓储场景;代价是计算消耗大、训练数据要求高。2025 年出现"VLA + 世界模型"融合的探索,代表性工作如智平方联合北大推出的融合 4D 世界模型的 Video2Act 架构。世界模型被广泛视为具身智能大脑的下一个突破方向。

2.2 决策 / 认知层("大脑"):VLA 与路线之争

VLA(Vision-Language-Action)模型是当前技术主线,其核心是将视觉观测与语言指令直接映射为机器人的连续动作,打通"看—想—做"的端到端链路。代表性架构演进如下:

  • Google RT-2 / Gemini Robotics:开创动作 token 化路线。2025 年 9 月,Google DeepMind 发布 Gemini Robotics 1.5(VLA 执行)与 Gemini Robotics-ER 1.5(具身推理),构成"ER 负责高层规划、1.5 负责动作执行"的双模型"大脑-身体"架构,ER 1.5 已通过 Gemini API 向开发者开放,另提供可本地运行的 On-Device 版本。
  • Physical Intelligence π0 系列:结合视觉语言模型(VLM)与条件流匹配(flow matching),支持高精度连续动作。π0 于 2024 年 10 月发布、2025 年 2 月开源;后续迭代 π0-FAST(训练提速约 5 倍)、π0.5(开放世界泛化)、π0.6(引入 RECAP 强化学习,吞吐翻倍)。
  • Figure Helix:快慢双系统架构,兼顾实时控制(快系统)与语义推理(慢系统);Helix 02 进一步扩展到全身控制。
  • NVIDIA GR00T N1:世界首个开源人形机器人基础模型,2025 年 3 月发布,采用双系统设计(System 2 慢思考 VLM + System 1 快思考扩散 Transformer),公开版约 22 亿参数,约 5 万 H100 GPU 小时预训练,训练数据构成"网络视频 + 合成数据 + 真机数据"的数据金字塔。

两条路线之争是当前技术辩论的焦点:

  • 端到端大模型路线:从感知信号直接生成动作,泛化性强、学习效率高(如小鹏第二代 VLA 去除"语言转译"中间环节,从视觉信号直接生成动作指令);短板是长程规划弱、新场景易失效、可解释性差。
  • 分层控制路线:大脑负责规划与反馈,小脑/小模型精通单一任务,模块化、可靠性高、易调试;短板是泛化受限、跨任务迁移成本高。

趋势判断:机器人大小脑正从"分层解耦"走向"端到端融合",VLA 端到端成为核心范式;工程实践中出现折中方案——"大模型负责高层规划 + 若干 VLA 小模型精通单任务并封装为可复用 skill 模块",兼取泛化与可靠。

2.3 运动控制层("小脑"):模仿学习、强化学习与 Sim2Real

  • 模仿学习(Imitation Learning):通过遥操作示范采集数据,让机器人模仿人类动作,是操作类任务的主流方法。
  • 强化学习(RL):适应复杂、动态环境。人形机器人的复杂身体控制(行走、跳舞、空翻)几乎都在仿真器中通过 RL 习得。
  • Sim2Real 迁移:仿真与现实之间在接触动力学、摩擦、材料属性上的差异(Sim-to-Real Gap)是所有仿真路线的根本难题,也是当前最热的攻坚点。
  • 全身控制(Whole-body Control):双臂、双腿、腰腹核心的协同控制,是本体运动的关键,直接决定机器人能否稳定完成搬运、上下台阶等复合动作。

产业已形成的决策系统融合共识是:高层决策嵌入规则化常识(由大模型编码抽象知识),低层动作采用强化学习适应动态环境,即"规则保安全、学习促适应"的分层混合框架。

2.4 本体形态:人形之争与灵巧手

  • 人形 vs 非人形:人形因双足行走、双手协作,与"为人类设计的环境"互动的隐性成本最小,能最大化复用现有基础设施与人类行为数据体系,被视为通用载体;但在稳定性、成本、可靠性要求高的特定场景,轮式、四足、机械臂往往更优。行业正构建"人形 + 轮式 + 多足 + 机械臂"的复合作业体系,其中轮式人形因兼顾移动稳定与成本,被预测为增速最快的形态之一(2030 年前年复合增长率约 120%)。
  • 灵巧手:从操作复杂度看,"手比脚更难",灵巧手进展相对缓慢,却是人形机器人从"能走"迈向"能干活/工具化"的关键。特斯拉 Optimus 第三代灵巧手自由度已达 22;一旦成熟量产,将有较大降本空间。

2.5 数据路线与 Scaling Law 之争

数据是具身智能区别于大模型的最大特殊性,也是最深的护城河。

四条数据路线并存: - 真机数据——质量最高、成本最贵; - 仿真数据——可规模化生成,但有 Sim2Real gap; - 遥操作数据——模仿学习的基础; - 视频学习——利用海量网络人类视频,规模大但存在 embodiment gap(人体与机器人本体差异)。

主流范式为"仿真合成数据预训练 + 真实数据后训练"(以银河通用为代表);业界流传"95% 黄金比例",即约 5% 数据人工精标、95% 通过数据飞轮自动生成与筛选。

数据飞轮与壁垒:与大模型可被低成本蒸馏不同,机器人数据需私有采集、别人拿不走(最多拿走模型)。业内形象概括为"数据之于大模型是包袱,之于具身智能却是壁垒"。多家企业估算,具身智能真正可用至少需要千万小时级乃至更高量级的数据;头部企业已投建数千平方米的数据采集工厂,日均产出数万条高质量数据。

Scaling Law 之争:多家机构初步验证了 Scaling Law 在机器人方向的有效性,但"仿真能否替代真实数据""不同任务的规律是否一致"仍有分歧。主流观点认为,真实数据在复杂人类行为、动态场景与高可靠性需求中不可替代,仿真只能作为补充而非替代。

图2 全球主流 VLA / 具身大模型技术路线对比图

*图2:全球主流 VLA / 具身大模型技术路线对比图*

解锁本篇完整报告

报告编号 EXK-A-014

以上为免费试读。手机号注册即得 1 次免费阅读额度(用户名选填),可解锁本篇的深度剖析、情景推演与行动建议;加顾问企微再 +2 次。

注册 / 登录后免费解锁
注册即免费解锁本篇全文
具身智能技术路线与商业化节奏研究|经纬智汇能源研究|经纬智汇