CH.11 / NOTES
11 // CHAPTER ROUTE

机器人从模仿者 走向理解者

具身智能 · 第十一章

行为克隆复制专家,扩散策略生成多种动作,VLA 把视觉、语言与行动接成一个“大脑”。

01

给 AI 看人怎么做,让它 学着做

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

02

先模仿获得基线,再用奖励 继续优化

实用路线是先用模仿学习快速可用

03

两扇门都能走,不要输出 中间值

扩散策略能表达多种合理动作分布

04

看到画面,听懂指令,再 做出动作

VLA 在视觉与动作之间加入语言理解

05

RT-2 借知识,Octo 降门槛

RT-2 证明世界知识可迁移到控制

UNIT 01 / MEETING NOTES

小节一 · 给 AI 看人怎么做

AGENDA / 本节阅读顺序01给 AI 看人怎么做,让它 学着做02学到相关性,不等于理解 为什么03先模仿获得基线,再用奖励 继续优化
桌面机械臂从视觉语言与多组动作示范中学习不同物体放置策略
图 11.1 示范、生成策略与语义指令汇入动作决策

先围绕“给 AI 看人怎么做”建立问题,再逐页核对本小节的机制与证据。

01 // IMITATION LEARNING

给 AI 看人怎么做,让它学着做

01 / EXPERT人类专家示范观测与动作,一帧帧配对图像 · 深度图线速度目标位置角速度IMITATION LEARNING让输出尽可能接近专家动作03 / POLICY机器人策略看到状态 → 做出动作

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

02 // CAUSAL CONFUSION

学到相关性,不等于理解为什么

专家轨迹先减速再转弯MODEL SEES减速 → 转弯相关 ≠ 原因突发障碍等待“减速信号”可能来不及避让

行为克隆可能复制表面共现模式,却没有学会动作背后的因果条件。

03 // IL + RL

先模仿获得基线,再用奖励继续优化

IMITATION专家示范快速获得能用策略BASELINE FIRSTREINFORCEMENTR环境交互 · 奖励优化

实用路线是先用模仿学习快速可用,再用强化学习突破专家与数据边界。

UNIT 02 / MEETING NOTES

小节二 · 从动作噪声中

AGENDA / 本节阅读顺序01从动作噪声中,一步步 去噪成轨迹02两扇门都能走,不要输出 中间值03精细动作更强,但反应 更慢
小节二 · 从动作噪声中的章节概念路线图
图 11.2 小节二 · 从动作噪声中的观察入口

先围绕“从动作噪声中,一步步 去噪成轨迹”建立问题,再逐页核对本小节的机制与证据。

04 // DIFFUSION POLICY

从动作噪声中,一步步去噪成轨迹

随机动作噪声DENOISET → 0条件:视觉与任务清晰动作序列

扩散策略把动作序列当生成目标,从噪声中逐步恢复出连贯方案。

05 // MULTIMODAL ACTION

两扇门都能走,不要输出中间值

WALLBC 平均:正中间方案 A · 左门方案 B · 右门Diffusion:采样一个清晰方案

扩散策略能表达多种合理动作分布,避免把两个方案平均成危险动作。

06 // DIFFUSION LIMITS

精细动作更强,但反应更慢

适合慢速·精细操作装配 · 手术 · 灵巧操作LATENCY多步去噪MULTI-STEP不擅长快速·低延迟任务快速导航 · 低延迟避障

多步去噪带来表达力也带来延迟,扩散策略更适合慢速精细操作。

UNIT 03 / MEETING NOTES

小节三 · 看到画面

AGENDA / 本节阅读顺序01看到画面,听懂指令,再 做出动作02视觉 Token 与语言 Token03RT-2 借知识,Octo 降门槛
小节三 · 看到画面的章节概念路线图
图 11.3 小节三 · 看到画面的观察入口

先围绕“看到画面,听懂指令,再 做出动作”建立问题,再逐页核对本小节的机制与证据。

07 // VLA

看到画面,听懂指令,再做出动作

VISION摄像头画面LANGUAGE“把杯子放到桌上”VLA世界知识 + 当前任务ACTION动作 TOKEN机器人可执行指令

VLA 在视觉与动作之间加入语言理解,让机器人按自然语言完成任务。

08 // VLA ARCHITECTURE

视觉 Token 与语言 Token,在 LLM 中会合

IMAGEViT 编码视觉 TOKENTEXTTokenizer语言 TOKENLLMV1V2L1L2预训练世界知识联合推理ACTION TOKEN关节角度末端位姿

VLA 将视觉与语言编码为 Token,由 LLM 联合推理,再解码为可执行动作。

09 // MODELS & CHOICE

RT-2 借知识,Octo降门槛

RT-2LLM世界知识 → 机器人控制OCTOOPEN SOURCE93M · 消费级 GPU降低研究门槛共同局限:慢 · 算力高 · 幻觉风险

RT-2 证明世界知识可迁移到控制,Octo 用开源与小规模降低 VLA 研究门槛。

RECAP // CHAPTER 11

从模仿、生成,到 理解

01

给 AI 看人怎么做,让它 学着做

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

02

先模仿获得基线,再用奖励 继续优化

实用路线是先用模仿学习快速可用

03

两扇门都能走,不要输出 中间值

扩散策略能表达多种合理动作分布

04

看到画面,听懂指令,再 做出动作

VLA 在视觉与动作之间加入语言理解

05

RT-2 借知识,Octo 降门槛

RT-2 证明世界知识可迁移到控制

任务固定选 BC,多方案精细操作选扩散,需要语言与泛化时考虑 VLA。

SOURCE QUIZ // 8 MCQ

单选题 · 8题

第 1 / 8 题原讲义题库
得分 0 / 8
SOURCE SHORT 01

简答一 · 分布偏移

什么是行为克隆的"分布偏移"问题?请用生活化的例子说明。

YOUR RESPONSE先独立组织答案,再查看讲义解析

分布偏移(Distribution Shift)是行为克隆最核心的问题。简单来说:

训练时,模型只见过"专家完美操作"的状态。就像一个学车的新手,教练只教过他怎么在空旷的练习场开。一旦他上路,遇到一个练习场没见过的路口(偏离了"训练分布"),他就不知道该怎么办了——而且越错越远。

在机器人中,一旦模型在推理时输出一个稍微偏离专家轨迹的动作,机器人就会进入一个"训练数据中没见过的状态"。模型在这个新状态下继续预测,因为没见过,预测更不准,于是进入更陌生的状态——形成恶性循环,最终撞墙。

DAgger 算法通过收集模型"犯错"时的状态加入训练集,让模型学会"偏离后如何纠正",从而缓解此问题。

SOURCE SHORT 02

简答二 · VLA 三步流程

请简述 VLA 模型的三步工作流程。

YOUR RESPONSE先独立组织答案,再查看讲义解析

VLA 模型的工作流程分为三步:

第一步:视觉编码——用视觉编码器(如 ViT)把摄像头拍摄的图像转换成"视觉 Token",即模型能理解的数字表示。

第二步:语言编码——用文本分词器把人类指令(如"把杯子放在桌上")转换成"语言 Token"。

第三步:联合推理与动作输出——把视觉 Token 和语言 Token 一起输入大语言模型(LLM),LLM 利用其预训练的世界知识,理解"看到的是什么"和"要做什么",然后输出"动作 Token"。动作 Token 经过解码器,转换成机器人可执行的具体动作指令(如关节角度、末端位姿)。

整个流程的核心是:大语言模型充当"大脑",把视觉信息和语言指令融合,做出决策。

SOURCE SHORT 03

简答三 · 泛化能力对比

请对比行为克隆、扩散策略、VLA 模型在泛化能力上的差异,并说明原因。

YOUR RESPONSE先独立组织答案,再查看讲义解析

三者泛化能力从低到高排列:

行为克隆(泛化能力低):因为 BC 只是"逐帧模仿",没有理解任务的高层语义。一旦场景变化(光照不同、物体位置偏移),模型就不知道如何处理。它学到的是"特定场景下的特定动作",而不是"导航/操作的一般规律"。

扩散策略(泛化能力中):扩散策略通过"去噪过程"学习动作的分布,天然对噪声和变化有一定鲁棒性。它的多模态输出能力也让它在面对"多种合理方案"时不会崩溃。但扩散策略仍然没有理解"任务目标"——它只是学会了更鲁棒的"动作模式"。

VLA 模型(泛化能力高):VLA 模型的核心优势在于"理解"——它借用了大语言模型中的世界知识。比如,即使模型从未见过"蓝色杯子",只要它知道"杯子"是什么,就能根据语言指令找到它。这种"语义理解"能力让 VLA 在面对全新场景和新物体时,泛化能力远超 BC 和扩散策略。