CH.10 / NOTES
10 // CHAPTER ROUTE

教会机器人 安全到达

具身智能 · 第十章

输入视觉、深度与目标位置,输出线速度和角速度,让机器人绕过障碍到达终点。

01

从起点到终点,路径必须 零碰撞

给定观测、目标与障碍物

02

每个样本,都把观察连到 动作

训练样本用 RGB、深度和目标位置作为输入

03

翻转图像,也要翻转 转向标签

水平翻转后必须将角速度取反

04

三路特征融合,输出 两个速度

RGB、深度和目标特征先独立提取

05

既看评估报告,也加一道 安全刹车

用成功率、碰撞率和 SPL 评估策略

UNIT 01 / MEETING NOTES

小节一 · 从起点到终点

AGENDA / 本节阅读顺序01从起点到终点,路径必须 零碰撞02不是会走,而是 走得好03每个样本,都把观察连到 动作
仓库微缩测试场中移动机器人沿专家示范路线绕开木箱和立柱
图 10.1 行为克隆把专家轨迹转成导航策略

先围绕“从起点到终点,路径必须 零碰撞”建立问题,再逐页核对本小节的机制与证据。

01 // PROBLEM

从起点到终点,路径必须零碰撞

INPUTRGB 图像深度图目标位置NAVIGATIONPOLICYOUTPUT线速度角速度

给定观测、目标与障碍物,模型输出线速度和角速度,形成无碰撞路径。

02 // METRICS

不是会走,而是走得好

成功率 ↑碰撞率 ↓SPL → 1

成功率衡量能否到达,碰撞率衡量安全,SPL 衡量路径是否高效。

03 // TRAINING SAMPLE

每个样本,都把观察连到动作

RGB640 × 480DEPTH640 × 480目标位置dx, dy相对机器人EXPERT ACTION线速度 v角速度 ω

训练样本用 RGB、深度和目标位置作为输入,以专家速度指令作为标签。

UNIT 02 / MEETING NOTES

小节二 · 场景必须隔离

AGENDA / 本节阅读顺序01场景必须隔离,不能让模型 偷看答案02翻转图像,也要翻转 转向标签03把专家动作当作 标准答案
小节二 · 场景必须隔离的章节概念路线图
图 10.2 小节二 · 场景必须隔离的观察入口

先围绕“场景必须隔离”建立问题,再逐页核对本小节的机制与证据。

04 // DATA SPLIT

场景必须隔离,不能让模型偷看答案

TRAIN · 80%场景 01场景 02场景 03SCENE FIREWALLVAL · 10%场景 04TEST · 10%场景 05

训练、验证和测试必须按场景隔离,否则模型可能记住布局而非学会导航。

05 // AUGMENTATION

翻转图像,也要翻转转向标签

原图:左转ω = +0.4H-FLIPMIRROR翻转:右转ω = −0.4

水平翻转后必须将角速度取反,否则增强会制造互相矛盾的错误标签。

06 // BEHAVIOR CLONING

把专家动作当作标准答案

专家数据观测 → 动作模型预测v̂ · ω̂MSE预测 − 专家平方误差更新参数学会模仿专家

行为克隆用观测到专家动作的监督配对,通过动作误差训练模型模仿专家。

UNIT 03 / MEETING NOTES

小节三 · 三路特征融合

AGENDA / 本节阅读顺序01三路特征融合,输出 两个速度02偏一步,就进入 没见过的世界03既看评估报告,也加一道 安全刹车
小节三 · 三路特征融合的章节概念路线图
图 10.3 小节三 · 三路特征融合的观察入口

先围绕“三路特征融合,输出 两个速度”建立问题,再逐页核对本小节的机制与证据。

07 // MODEL

三路特征融合,输出两个速度

RGB → CNNDepth → CNNGoal → FCFEATURECONCATFULLY CONNECTED线速度 v[-1, 1] m/s角速度 ω[-1, 1] rad/s

RGB、深度和目标特征先独立提取,再融合回归线速度与角速度。

08 // DISTRIBUTION SHIFT

偏一步,就进入没见过的世界

未知状态错误继续累积纠错轨迹 / DAgger收集犯错状态再标注

行为克隆一旦偏离专家分布会错误累积,纠错轨迹与 DAgger 用犯错状态补课。

09 // EVALUATE & GUARD

既看评估报告,也加一道安全刹车

LOSS训练 / 验证曲线TEST REPORT成功率 ↑碰撞率 ↓SPL → 1SAFETY LAYER深度检测危险覆写:停止 / 转向

用成功率、碰撞率和 SPL 评估策略,再用安全层拦截可能碰撞的动作。

RECAP // CHAPTER 10

从训练样本,到 安全动作

01

从起点到终点,路径必须 零碰撞

给定观测、目标与障碍物

02

每个样本,都把观察连到 动作

训练样本用 RGB、深度和目标位置作为输入

03

翻转图像,也要翻转 转向标签

水平翻转后必须将角速度取反

04

三路特征融合,输出 两个速度

RGB、深度和目标特征先独立提取

05

既看评估报告,也加一道 安全刹车

用成功率、碰撞率和 SPL 评估策略

可靠导航来自按场景划分的数据、行为克隆训练、分布偏移纠错与安全过滤。

SOURCE QUIZ // 10 MCQ

单选题 · 10题

第 1 / 10 题原讲义题库
得分 0 / 10
SOURCE QUIZ // 5 TRUE-FALSE

判断题 · 5题

第 1 / 5 题原讲义题库
得分 0 / 5
SOURCE PRACTICE 01

实操 · 训练导航避障模型

训练并评估一个导航避障模型

任务要求

  • 使用实训平台模块 B 的渲染数据(至少 2 个场景,每个场景 500+ 帧)
  • 在模型训练模块中创建一个行为克隆训练任务
  • 配置训练参数:50 轮、批次大小 32、学习率 0.001
  • 启动训练,等待完成
  • 查看评估结果,记录成功率和碰撞率
  • 使用可视化测试功能,观察模型在 3 个不同场景中的表现

提交要求

  • 提交训练评估结果截图(包含成功率、碰撞率、SPL)
  • 提交一段模型导航的可视化录屏(至少 30 秒,展示 2 个场景)
  • 撰写一份训练报告(200-300 字),包含:
  • 训练数据描述(场景数量、总帧数)
  • 模型表现分析(成功率、碰撞率、哪些场景表现好/差)
  • 改进方向(至少提出 2 条具体改进措施)
评分标准:
  • 模型训练成功并完成评估(30%)
  • 成功率 ≥ 75%(30%)
  • 训练报告分析深入、改进建议具体(40%)