CH.01 / NOTES
01 // CHAPTER ROUTE

AI 的 “身体” 在哪里?

具身智能 · 第一章

从屏幕里的“聊天 AI”,走向能够感知、决策、行动并从物理交互中学习的“做事 AI”。

01

从“会说”到 真的会做

具身智能让 AI 获得感知与行动通道

02

为什么走路 比下棋更难?

规则世界适合计算

03

模块化: 逐站接力

模块化便于独立开发和排错,代价是接口复杂与误差累积。

04

机器人正在走进 哪些现场?

越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。

05

平台如何 拆掉数据瓶颈?

真机、仿真和自动标注协同

UNIT 01 / MEETING NOTES

小节一 · 从“会说”到 真的会做

AGENDA / 本节阅读顺序01从“会说”到 真的会做02感知、决策、执行 不是单行道03为什么走路 比下棋更难
暖灰纸机器人实验台上,移动机械臂在相机和深度传感器观察下抓取木块,控制盒通过线缆连接
图 1.1 感知—决策—执行闭环进入物理世界

先围绕“从“会说”到 真的会做”建立问题,再逐页核对本小节的机制与证据。

01 // FROM CHAT TO ACTION

从“会说”到
真的会做

CHAT AI知道怎么做写文章 · 翻译 · 写代码能够去做装上身体

具身智能让 AI 获得感知与行动通道,进入真实或仿真的物理世界。

02 // CLOSED LOOP

感知、决策、执行
不是单行道

感知相机 · 雷达 · 传感器决策大模型 / VLA · 策略执行电机 · 机械臂 · 底盘环境改变重新感知,再调整

机器人每执行一次,环境就可能变化,因此必须重新感知并持续修正。

03 // MORAVEC PARADOX

为什么走路
比下棋更难?

下棋规则明确 · 信息完整走路 / 抓杯子开放 · 不确定 · 充满意外反直觉感知运动更难

规则世界适合计算,真实世界却要求 AI 随时处理噪声、变化和意外。

UNIT 02 / MEETING NOTES

小节二 · 精确菜谱

AGENDA / 本节阅读顺序01精确菜谱,还是 见多识广02模块化: 逐站接力03VLA: 一个模型直达动作04两条路线, 同一块地基
小节二 · 精确菜谱的章节概念路线图
图 1.2 小节二 · 精确菜谱的观察入口

先围绕“精确菜谱,还是 见多识广”建立问题,再逐页核对本小节的机制与证据。

04 // TWO ROBOT ROUTES

精确菜谱,还是
见多识广?

传统机器人工程师精确编程固定环境 · 极高精度具身智能从大量演示数据学习环境变化 · 灵活适应不是替代而是扩边界

结构化高精度任务仍适合传统机器人;具身智能拓展的是变化更大的场景。

05 // MODULAR PIPELINE

模块化:逐站接力

感知识别物体CAMERA理解空间关系场景语义规划动作路径PLAN控制关节动作精确执行可定位问题模块,但接口多、误差会逐段累积

模块化便于独立开发和排错,代价是接口复杂与误差累积。

06 // VISION-LANGUAGE-ACTION

VLA:一个模型直达动作

相机图像红色杯子在桌上语言指令“放到托盘上”VLA端到端模型大规模数据共同优化机器人动作泛化强 · 黑盒 · 验证难

VLA 省掉人工模块拆分,但依赖海量轨迹、强算力与额外安全机制。

07 // TWO-LEGGED STRATEGY

两条路线,
同一块地基

模块化短期落地主力可解释 · 可调试 · 可加安全层端到端 VLA长期发展方向自然指令 · 端到端优化 · 泛化共同地基:高质量具身数据真机演示 · 仿真轨迹 · 标注与审核

路线可以并行,数据却是两者共同的训练燃料和评估依据。

UNIT 03 / MEETING NOTES

小节三 · 机器人正在走进 哪些…

AGENDA / 本节阅读顺序01机器人正在走进 哪些现场02为什么“身体数据” 最难获得03平台如何 拆掉数据瓶颈
小节三 · 机器人正在走进 哪些…的章节概念路线图
图 1.3 小节三 · 机器人正在走进 哪些…的观察入口

先围绕“机器人正在走进 哪些现场”建立问题,再逐页核对本小节的机制与证据。

08 // APPLICATION MAP

机器人正在走进
哪些现场?

环境结构化程度决定落地速度仓储物流分拣 · 搬运 · 上架电力巡检缺陷检测 · 变电站巡检家庭 / 医疗整理 · 康复 · 送药农业 / 施工采摘 · 除草 · 焊接

越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。

09 // DATA BOTTLENECK

为什么“身体数据”
最难获得?

文本互联网海量内容易获取图像公开数据集需标注机器人轨迹真机逐条采集成本最高 · 数量最少

机器人轨迹必须真实操作或高质量仿真采集,时间与硬件成本远高于文本。

10 // DATA FACTORY

平台如何
拆掉数据瓶颈?

真机遥操作采集真实动作REAL数字孪生扩展场景与变化VLM 标注自动预标注人工审核训练数据服务模块化服务 VLADATA

真机、仿真和自动标注协同,目标是降低高质量具身数据的采集成本。

RECAP // THREE MODELS

第一章,记住 三个判断框架

01

从“会说”到 真的会做

具身智能让 AI 获得感知与行动通道

02

为什么走路 比下棋更难?

规则世界适合计算

03

模块化: 逐站接力

模块化便于独立开发和排错,代价是接口复杂与误差累积。

04

机器人正在走进 哪些现场?

越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。

05

平台如何 拆掉数据瓶颈?

真机、仿真和自动标注协同

理解具身智能,要同时看身体闭环、技术路线与数据来源。

SOURCE QUIZ // 10 MCQ

单选题 · 10 题

得分 0/10

先依据闭环、路线或数据逻辑作答,再查看讲义解析。

SOURCE QUIZ // 5 TRUE-FALSE

判断题 · 5 题

判断题得分 0/5