直接回答

**具身智能(Embodied AI)**是指感知、决策与行动受到本体和环境约束的智能 Agent。在物理机器人中,传感器观察外部世界与机器人自身;模型、规划器或策略选择动作;控制器与执行器执行动作;变化后的状态成为下一次观测。这个闭合反馈循环意味着标定、动力学、实时控制、安全与恢复都是 AI 系统的一部分,而不是模型之外的实现细节。

这个术语也用于仿真 Agent 研究。仿真器可以提供虚拟本体和可交互环境,用于训练与评测,但仿真成功不能证明物理部署安全。

核心要点

  • 只有本体不代表机器人具备智能;系统还包括感知、状态、决策、控制、反馈、数据与安全。
  • 具身智能由闭合的感知-行动循环定义,不取决于人形外观或某一种模型架构。
  • VLA 只是一个选项;模块化规划器、经典控制器、学习策略和混合架构都仍然有效。
  • 物理动作可能延迟、不稳定、代价高或不可逆,因此尾延迟、标定、约束与恢复都很重要。
  • 应评测明确的任务、本体、环境和运行包络,不能从一段演示推导“通用智能”。

“具身”究竟是什么意思?

“具身”表示 Agent 的观测与可执行动作受到本体及所处环境的约束。相机位置决定它能看见什么,夹爪决定它能抓取什么,关节限位、质量、摩擦、电池和控制频率共同决定计划是否可行。

实践中常见两个范围:

范围 本体 典型研究问题
可交互仿真 Agent 仿真器或游戏中的虚拟身体 Agent 能否通过交互完成导航、操作、问答或学习?
物理具身智能 机器人、车辆、无人机或其他物理系统 完整系统能否在真实感知、动力学、接触和故障下可靠安全地行动?

ITU-T F.748.66 建议书 给出了物理具身智能框架,覆盖基础模型、计算平台、本体,以及感知、决策、执行、交互和学习。这是一种有用的系统拆分,并不证明每个系统都在一个模型中拥有全部能力。

机器人本体不是完整系统

机器人本体包含机械结构、传感器、计算、电源、执行器、通信与保护硬件。具身智能系统还需要:

  • 同步后的感知与状态估计;
  • 任务和环境表示;
  • 规划或策略推理;
  • 运动与底层控制;
  • 安全约束与人工接管;
  • 数据采集、评测、监控与更新。

固定工业机器人可以在没有学习型通用策略时执行编程轨迹。反过来,强大的模型也必须让输出匹配经过标定的机器人与控制器,才能产生有效动作。

感知-行动闭环

具身智能来自持续交互,而不是一次前向推理。

flowchart LR E["环境与任务"] --> S["传感器"] S --> P["感知与状态估计"] P --> D["决策、规划或策略"] D --> F["可行性与安全检查"] F --> C["控制器与执行器"] C --> E O["结果与运行监控"] --> P O --> D C --> O

感知与状态估计

感知把相机、深度、声音、力觉、触觉与本体感知信号转换为任务相关状态。物体类别对操作任务通常不够;系统还可能需要位姿、不确定性、运动、接触、遮挡与机器人关节状态。

状态估计依赖标定与时钟。若相机帧和关节位置来自不同时间,即使几何计算正确,执行时动作也可能错误。

决策、规划与策略

决策层可以是模块化或学习型:

  • 任务规划器把目标拆成技能;
  • 运动规划器搜索无碰撞轨迹;
  • 模仿学习或强化学习策略把观测映射为动作;
  • 视觉语言模型完成语言落地并提出子目标;
  • VLA 直接预测动作或动作块;
  • 混合架构组合以上组件。

无论采用哪种架构,都必须定义可用动作、前置条件、故障状态与停止行为。

控制与执行

控制器把目标位姿、速度或力转换为本体可执行命令。内部控制回路通常比模型推理有更严格的 Deadline,因此学习模型输出通常位于确定性控制、插值、运动学和碰撞检查之上或旁路。

反馈与恢复

动作结束后,系统必须判断实际发生了什么:夹爪是否抓住物体?物体是否滑落?是否有人进入工作区?恢复依赖可观测后置条件和机器可读状态,例如 completed、retryable_failure、protective_stop、human_required 与 unknown。

具身智能的主要架构层

合理架构会分离职责,使每种故障可以被检测和测试。

层级 职责 故障示例
本体与传感器 产生运动和观测 标定后相机被移动
时钟与标定 对齐帧、状态、几何和单位 当前图像搭配陈旧位姿
感知与状态 估计物体、机器人、人员、接触与不确定性 把被遮挡物体判断为不存在
任务/世界表示 跟踪目标、约束与相关状态 忘记已完成子任务
规划或策略 选择子目标、轨迹或动作 选择不可行抓取
控制 在动力学约束下稳定执行 命令抖动或跟踪误差
安全 强制执行物理与运行限制 未拦截危险模型输出
数据与运营 记录、评测、发布与恢复 把失败 Episode 错标为成功
flowchart TD G["任务契约"] --> H["高层规划器或策略"] H --> M["运动或动作策略"] M --> K["运动学与控制"] K --> B["本体"] B --> R["传感器反馈"] R --> H R --> M X["独立安全包络"] --> K X --> B

单体模型可以合并多个逻辑层,但运维系统仍需外部接口检查输入、约束输出、停止运动和归因故障。

具身智能不等于 VLA、世界模型或人形机器人

这些概念相互关联,但不是同义词。

概念 核心用途 与具身智能的关系
VLA 把视觉、语言以及通常包含的本体状态映射为动作 一类学习策略
世界模型 表示或预测状态如何变化 可支持规划、仿真或数据生成
机器人基础模型 在声明范围内可复用的模型或策略 可以是 VLA、规划器、表征或混合系统
人形机器人 具有类人形态的本体 一种本体,不是必要条件
数字 AI Agent 选择数字工具或 API 动作 共享规划思想,但没有相同物理动力学

PaLM-E 将连续传感器输入与语言模型表示结合,用于具身推理任务。RT-2 把视觉语言模型扩展到以 Token 表示的机器人动作。二者展示了不同模型角色,都不能代表完整运行中的机器人栈。

若要深入了解 VLA 数据、适配与部署评测,请阅读机器人基础模型工程:VLA 架构、数据、评测与安全。

为什么物理环境会改变工程方法?

具身系统面对文本或 API 工作流通常可以规避的约束。

部分可观测

传感器只提供世界的噪声、延迟投影。透明、反光、可变形或被遮挡物体都可能破坏感知假设。系统需要表达不确定性、主动感知或安全的“无能力”状态,而不是自信行动。

连续动力学与接触

运动连续变化,模型和控制器却以有限频率采样。接触会产生不连续、力峰值、滑动或形变。语义上正确的目标仍可能生成物理不稳定轨迹。

实时 Deadline

聊天机器人回答稍晚通常只是体验问题,陈旧机器人命令却可能不安全。必须测量完整 Sensor-to-Action 链路,包括同步、预处理、推理、网络、过滤和控制。

不可逆副作用

数字工具调用有时可以补偿,但物体掉落、碰撞或人员伤害不可回滚。高风险动作需要模型之外的授权、确定性限位、保护设备和人工停止路径。

数据与分布漂移

机器人数据昂贵且与本体绑定。光照、磨损、相机移动、负载、材料、操作员行为和固件都会造成分布漂移。应对所有相关依赖做版本化,并在发布后监控漂移。

具身系统如何学习?

具身智能可以组合多种数据与学习路线:

路线 优势 重要限制
编程或规划行为 已知条件下可解释、精确 状态或任务变化超出模型后容易失效
模仿学习 从示教学习动作 会复制覆盖缺口与操作员偏差
强化学习 通过奖励和交互优化行为 奖励设计、探索安全与 Sim-to-Real 仍然困难
仿真与合成数据 扩展可控变化与故障注入 物理、感知、接触和外观可能无法迁移
视觉语言预训练 提供语义与视觉先验 互联网知识不能直接提供机器人动作能力
在线或 Fleet 学习 捕获真实故障与漂移 更新执行前必须治理、验证并可回滚

仿真是开发与证据工具,不是通用解法。迁移必须在目标本体、任务、传感器、控制器与环境上测量。

先定义任务,再选择模型

具身智能项目应从任务契约开始:

yaml
task: 把传送带 A 上的密封纸箱放入料箱 B
body: mobile-manipulator-revision-4
environment: 封闭仓储工作单元
allowed_objects: carton-spec-v3
success: 在节拍期限内纸箱稳定放入料箱
partial_success: 已抓取但未完成放置
forbidden: 人员进入单元、纸箱损坏、越区运动
fallback: 受控停机并请求操作员

契约还应声明可用观测、运行包络、人员角色、延迟预算、可恢复与终止故障、安全要求,以及晋级所需证据。“处理仓库任务”不是可测试目标。

评测完整闭环

应在精确本体与 Runtime 上评测系统,而不是只看离线模型分数。

flowchart LR T["冻结任务套件"] --> S["仿真与回放"] S --> H["硬件在环"] H --> G["受保护真机试验"] G --> C["窄范围灰度"] C --> O["运行监控"] O --> R{"保留或回滚"}

需要记录:

  • 完整与部分任务结果;
  • 留出物体、布局、指令、操作员与机器人单机;
  • 重复试验与置信区间;
  • 感知、规划、控制和集成故障码;
  • 人工干预与恢复成功率;
  • Sensor-to-Action 尾延迟与 Deadline Miss;
  • 碰撞、险情、限位事件、保护停机与急停;
  • 可用率、节拍、维护、功耗与总运行成本。

模型基准成功与物理部署安全是不同声明。仿真器或实验室任务不能认证工业单元、公共服务机器人、车辆或医疗系统。

安全是系统属性

安全取决于本体、应用、环境、集成、流程与人员,而不是只取决于模型行为。

常见控制包括:

  • 关节、速度、力和工作空间的机械与软件限位;
  • 碰撞检测与隔离监控;
  • 命令时效检查与看门狗;
  • 经过验证的回退与安全停机状态;
  • 独立急停和保护设备;
  • 运行模式与高风险任务授权;
  • 事件日志、事故复盘与变更控制。

ISO 10218-1:2025 在明确范围内规定工业机器人安全要求,并区分机器人自身与应用集成。它不适用于所有具身系统,也不会认证学习模型。

常见误区

“具身智能就是 AI 加机器人身体”

这种说法遗漏反馈闭环、标定、状态估计、控制、数据和安全。物理本体是物理具身的必要条件,但不是智能系统的充分条件。

“VLA 会取代整个机器人技术栈”

VLA 可以组合感知、语言落地与动作预测,但部署仍需要控制器、时序、约束、监控与恢复。

“增加仿真就能自动解决数据不足”

仿真可以扩展受控经验,也可能固化错误的物理或感知假设。必须测量迁移效果,并用真实数据校准 Domain Gap。

“人形机器人是最佳本体”

类人形态可以复用人类基础设施,也会增加平衡、驱动、能耗、维护和安全复杂度。最合适的本体由任务与环境决定。

“一次成功演示证明了自主能力”

演示无法说明重置次数、人工协助、被排除失败、任务分布或运行时长。应要求协议和原始结果账本。

常见问题

具身智能一定要从物理交互中学习吗?

并非每个组件都要在线学习。系统可以组合预训练模型、示教、仿真、经典规划与固定控制器。关键是决策是否在目标交互闭环中得到落地与验证。

自动驾驶属于具身智能吗?

按宽泛物理具身智能定义,它属于感知、决策、行动和反馈受物理约束的系统。但它有专用架构、法规、安全论证与评测,不能从操作机器人直接类推。

什么是 Sim-to-Real?

Sim-to-Real 是把在仿真中开发的策略、表征或系统设置迁移到物理硬件。Domain Randomization、标定、系统辨识与真实数据适配可以帮助迁移,但必须实测,不能假定成功。

小团队应该从哪里开始?

选择一个受约束任务和可获得本体,定义成功与禁止结果,建立专用方案基线,记录每类故障,并使用仿真注入异常。不要从开放家庭环境或人形通用自主承诺开始。

具身智能与 AGI 有什么关系?

具身是让感知、语言和行动落地的一条研究路线,但尚未证明它是 AGI 的必要或充分条件。没有独立定义与证据时,不应把能力较强的机器人策略称为 AGI。

总结

具身智能研究和构建通过本体与环境闭合感知-行动循环的 Agent。它的架构从模型延伸到标定、状态、规划、控制、反馈、安全、数据与运营。应从狭窄任务契约出发,按证据选择模块化或学习组件,评测完整闭环,并确保物理安全始终可以在模型之外强制执行。

参考资料