直接回答
**具身智能(Embodied AI)**是指感知、决策与行动受到本体和环境约束的智能 Agent。在物理机器人中,传感器观察外部世界与机器人自身;模型、规划器或策略选择动作;控制器与执行器执行动作;变化后的状态成为下一次观测。这个闭合反馈循环意味着标定、动力学、实时控制、安全与恢复都是 AI 系统的一部分,而不是模型之外的实现细节。
这个术语也用于仿真 Agent 研究。仿真器可以提供虚拟本体和可交互环境,用于训练与评测,但仿真成功不能证明物理部署安全。
核心要点
- 只有本体不代表机器人具备智能;系统还包括感知、状态、决策、控制、反馈、数据与安全。
- 具身智能由闭合的感知-行动循环定义,不取决于人形外观或某一种模型架构。
- VLA 只是一个选项;模块化规划器、经典控制器、学习策略和混合架构都仍然有效。
- 物理动作可能延迟、不稳定、代价高或不可逆,因此尾延迟、标定、约束与恢复都很重要。
- 应评测明确的任务、本体、环境和运行包络,不能从一段演示推导“通用智能”。
“具身”究竟是什么意思?
“具身”表示 Agent 的观测与可执行动作受到本体及所处环境的约束。相机位置决定它能看见什么,夹爪决定它能抓取什么,关节限位、质量、摩擦、电池和控制频率共同决定计划是否可行。
实践中常见两个范围:
| 范围 | 本体 | 典型研究问题 |
|---|---|---|
| 可交互仿真 Agent | 仿真器或游戏中的虚拟身体 | Agent 能否通过交互完成导航、操作、问答或学习? |
| 物理具身智能 | 机器人、车辆、无人机或其他物理系统 | 完整系统能否在真实感知、动力学、接触和故障下可靠安全地行动? |
ITU-T F.748.66 建议书 给出了物理具身智能框架,覆盖基础模型、计算平台、本体,以及感知、决策、执行、交互和学习。这是一种有用的系统拆分,并不证明每个系统都在一个模型中拥有全部能力。
机器人本体不是完整系统
机器人本体包含机械结构、传感器、计算、电源、执行器、通信与保护硬件。具身智能系统还需要:
- 同步后的感知与状态估计;
- 任务和环境表示;
- 规划或策略推理;
- 运动与底层控制;
- 安全约束与人工接管;
- 数据采集、评测、监控与更新。
固定工业机器人可以在没有学习型通用策略时执行编程轨迹。反过来,强大的模型也必须让输出匹配经过标定的机器人与控制器,才能产生有效动作。
感知-行动闭环
具身智能来自持续交互,而不是一次前向推理。
感知与状态估计
感知把相机、深度、声音、力觉、触觉与本体感知信号转换为任务相关状态。物体类别对操作任务通常不够;系统还可能需要位姿、不确定性、运动、接触、遮挡与机器人关节状态。
状态估计依赖标定与时钟。若相机帧和关节位置来自不同时间,即使几何计算正确,执行时动作也可能错误。
决策、规划与策略
决策层可以是模块化或学习型:
- 任务规划器把目标拆成技能;
- 运动规划器搜索无碰撞轨迹;
- 模仿学习或强化学习策略把观测映射为动作;
- 视觉语言模型完成语言落地并提出子目标;
- VLA 直接预测动作或动作块;
- 混合架构组合以上组件。
无论采用哪种架构,都必须定义可用动作、前置条件、故障状态与停止行为。
控制与执行
控制器把目标位姿、速度或力转换为本体可执行命令。内部控制回路通常比模型推理有更严格的 Deadline,因此学习模型输出通常位于确定性控制、插值、运动学和碰撞检查之上或旁路。
反馈与恢复
动作结束后,系统必须判断实际发生了什么:夹爪是否抓住物体?物体是否滑落?是否有人进入工作区?恢复依赖可观测后置条件和机器可读状态,例如 completed、retryable_failure、protective_stop、human_required 与 unknown。
具身智能的主要架构层
合理架构会分离职责,使每种故障可以被检测和测试。
| 层级 | 职责 | 故障示例 |
|---|---|---|
| 本体与传感器 | 产生运动和观测 | 标定后相机被移动 |
| 时钟与标定 | 对齐帧、状态、几何和单位 | 当前图像搭配陈旧位姿 |
| 感知与状态 | 估计物体、机器人、人员、接触与不确定性 | 把被遮挡物体判断为不存在 |
| 任务/世界表示 | 跟踪目标、约束与相关状态 | 忘记已完成子任务 |
| 规划或策略 | 选择子目标、轨迹或动作 | 选择不可行抓取 |
| 控制 | 在动力学约束下稳定执行 | 命令抖动或跟踪误差 |
| 安全 | 强制执行物理与运行限制 | 未拦截危险模型输出 |
| 数据与运营 | 记录、评测、发布与恢复 | 把失败 Episode 错标为成功 |
单体模型可以合并多个逻辑层,但运维系统仍需外部接口检查输入、约束输出、停止运动和归因故障。
具身智能不等于 VLA、世界模型或人形机器人
这些概念相互关联,但不是同义词。
| 概念 | 核心用途 | 与具身智能的关系 |
|---|---|---|
| VLA | 把视觉、语言以及通常包含的本体状态映射为动作 | 一类学习策略 |
| 世界模型 | 表示或预测状态如何变化 | 可支持规划、仿真或数据生成 |
| 机器人基础模型 | 在声明范围内可复用的模型或策略 | 可以是 VLA、规划器、表征或混合系统 |
| 人形机器人 | 具有类人形态的本体 | 一种本体,不是必要条件 |
| 数字 AI Agent | 选择数字工具或 API 动作 | 共享规划思想,但没有相同物理动力学 |
PaLM-E 将连续传感器输入与语言模型表示结合,用于具身推理任务。RT-2 把视觉语言模型扩展到以 Token 表示的机器人动作。二者展示了不同模型角色,都不能代表完整运行中的机器人栈。
若要深入了解 VLA 数据、适配与部署评测,请阅读机器人基础模型工程:VLA 架构、数据、评测与安全。
为什么物理环境会改变工程方法?
具身系统面对文本或 API 工作流通常可以规避的约束。
部分可观测
传感器只提供世界的噪声、延迟投影。透明、反光、可变形或被遮挡物体都可能破坏感知假设。系统需要表达不确定性、主动感知或安全的“无能力”状态,而不是自信行动。
连续动力学与接触
运动连续变化,模型和控制器却以有限频率采样。接触会产生不连续、力峰值、滑动或形变。语义上正确的目标仍可能生成物理不稳定轨迹。
实时 Deadline
聊天机器人回答稍晚通常只是体验问题,陈旧机器人命令却可能不安全。必须测量完整 Sensor-to-Action 链路,包括同步、预处理、推理、网络、过滤和控制。
不可逆副作用
数字工具调用有时可以补偿,但物体掉落、碰撞或人员伤害不可回滚。高风险动作需要模型之外的授权、确定性限位、保护设备和人工停止路径。
数据与分布漂移
机器人数据昂贵且与本体绑定。光照、磨损、相机移动、负载、材料、操作员行为和固件都会造成分布漂移。应对所有相关依赖做版本化,并在发布后监控漂移。
具身系统如何学习?
具身智能可以组合多种数据与学习路线:
| 路线 | 优势 | 重要限制 |
|---|---|---|
| 编程或规划行为 | 已知条件下可解释、精确 | 状态或任务变化超出模型后容易失效 |
| 模仿学习 | 从示教学习动作 | 会复制覆盖缺口与操作员偏差 |
| 强化学习 | 通过奖励和交互优化行为 | 奖励设计、探索安全与 Sim-to-Real 仍然困难 |
| 仿真与合成数据 | 扩展可控变化与故障注入 | 物理、感知、接触和外观可能无法迁移 |
| 视觉语言预训练 | 提供语义与视觉先验 | 互联网知识不能直接提供机器人动作能力 |
| 在线或 Fleet 学习 | 捕获真实故障与漂移 | 更新执行前必须治理、验证并可回滚 |
仿真是开发与证据工具,不是通用解法。迁移必须在目标本体、任务、传感器、控制器与环境上测量。
先定义任务,再选择模型
具身智能项目应从任务契约开始:
task: 把传送带 A 上的密封纸箱放入料箱 B
body: mobile-manipulator-revision-4
environment: 封闭仓储工作单元
allowed_objects: carton-spec-v3
success: 在节拍期限内纸箱稳定放入料箱
partial_success: 已抓取但未完成放置
forbidden: 人员进入单元、纸箱损坏、越区运动
fallback: 受控停机并请求操作员
契约还应声明可用观测、运行包络、人员角色、延迟预算、可恢复与终止故障、安全要求,以及晋级所需证据。“处理仓库任务”不是可测试目标。
评测完整闭环
应在精确本体与 Runtime 上评测系统,而不是只看离线模型分数。
需要记录:
- 完整与部分任务结果;
- 留出物体、布局、指令、操作员与机器人单机;
- 重复试验与置信区间;
- 感知、规划、控制和集成故障码;
- 人工干预与恢复成功率;
- Sensor-to-Action 尾延迟与 Deadline Miss;
- 碰撞、险情、限位事件、保护停机与急停;
- 可用率、节拍、维护、功耗与总运行成本。
模型基准成功与物理部署安全是不同声明。仿真器或实验室任务不能认证工业单元、公共服务机器人、车辆或医疗系统。
安全是系统属性
安全取决于本体、应用、环境、集成、流程与人员,而不是只取决于模型行为。
常见控制包括:
- 关节、速度、力和工作空间的机械与软件限位;
- 碰撞检测与隔离监控;
- 命令时效检查与看门狗;
- 经过验证的回退与安全停机状态;
- 独立急停和保护设备;
- 运行模式与高风险任务授权;
- 事件日志、事故复盘与变更控制。
ISO 10218-1:2025 在明确范围内规定工业机器人安全要求,并区分机器人自身与应用集成。它不适用于所有具身系统,也不会认证学习模型。
常见误区
“具身智能就是 AI 加机器人身体”
这种说法遗漏反馈闭环、标定、状态估计、控制、数据和安全。物理本体是物理具身的必要条件,但不是智能系统的充分条件。
“VLA 会取代整个机器人技术栈”
VLA 可以组合感知、语言落地与动作预测,但部署仍需要控制器、时序、约束、监控与恢复。
“增加仿真就能自动解决数据不足”
仿真可以扩展受控经验,也可能固化错误的物理或感知假设。必须测量迁移效果,并用真实数据校准 Domain Gap。
“人形机器人是最佳本体”
类人形态可以复用人类基础设施,也会增加平衡、驱动、能耗、维护和安全复杂度。最合适的本体由任务与环境决定。
“一次成功演示证明了自主能力”
演示无法说明重置次数、人工协助、被排除失败、任务分布或运行时长。应要求协议和原始结果账本。
常见问题
具身智能一定要从物理交互中学习吗?
并非每个组件都要在线学习。系统可以组合预训练模型、示教、仿真、经典规划与固定控制器。关键是决策是否在目标交互闭环中得到落地与验证。
自动驾驶属于具身智能吗?
按宽泛物理具身智能定义,它属于感知、决策、行动和反馈受物理约束的系统。但它有专用架构、法规、安全论证与评测,不能从操作机器人直接类推。
什么是 Sim-to-Real?
Sim-to-Real 是把在仿真中开发的策略、表征或系统设置迁移到物理硬件。Domain Randomization、标定、系统辨识与真实数据适配可以帮助迁移,但必须实测,不能假定成功。
小团队应该从哪里开始?
选择一个受约束任务和可获得本体,定义成功与禁止结果,建立专用方案基线,记录每类故障,并使用仿真注入异常。不要从开放家庭环境或人形通用自主承诺开始。
具身智能与 AGI 有什么关系?
具身是让感知、语言和行动落地的一条研究路线,但尚未证明它是 AGI 的必要或充分条件。没有独立定义与证据时,不应把能力较强的机器人策略称为 AGI。
总结
具身智能研究和构建通过本体与环境闭合感知-行动循环的 Agent。它的架构从模型延伸到标定、状态、规划、控制、反馈、安全、数据与运营。应从狭窄任务契约出发,按证据选择模块化或学习组件,评测完整闭环,并确保物理安全始终可以在模型之外强制执行。