# 具身智能基础第10章《教会机器人 安全到达》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 5～6 分钟

建议课堂时长：约 10～16 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【教会机器人 安全到达】

【所属章节和小节】具身智能基础 第10章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“教会机器人 安全到达”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 从起点到终点】

【所属章节和小节】具身智能基础 第10章｜小节一 · 从起点到终点

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“小节一 · 从起点到终点”的议程页。左侧按顺序列出本节问题，右侧教学场景呈现专家轨迹；先观察机器人如何绕障，再进入行为克隆机制页面。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】从起点到终点，路径必须 零碰撞；不是会走，而是 走得好；每个样本，都把观察连到 动作。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-scene.png


## P3【从起点到终点，路径必须 零碰撞】

【所属章节和小节】具身智能基础 第10章｜小节一 · 从起点到终点

【本页目标】能够解释“从起点到终点，路径必须 零碰撞”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着闭环逐步追踪。本页聚焦“从起点到终点，路径必须 零碰撞”，图中的“INPUT、RGB 图像、深度图”标出关键证据。给定观测、目标与障碍物，模型输出线速度和角速度，形成无碰撞路径。再用底部结论检查自己的理解。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】INPUT；RGB 图像；深度图；目标位置。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-1（无伪造文件）+ HTML内联SVG


## P4【不是会走，而是 走得好】

【所属章节和小节】具身智能基础 第10章｜小节一 · 从起点到终点

【本页目标】能够解释“不是会走，而是 走得好”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“不是会走，而是 走得好”，图中的“成功率 ↑、碰撞率 ↓、SPL → 1”标出关键证据。成功率衡量能否到达，碰撞率衡量安全，SPL 衡量路径是否高效。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】成功率 ↑；碰撞率 ↓；SPL → 1。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【每个样本，都把观察连到 动作】

【所属章节和小节】具身智能基础 第10章｜小节一 · 从起点到终点

【本页目标】能够解释“每个样本，都把观察连到 动作”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“每个样本，都把观察连到 动作”，图中的“RGB、640 × 480、DEPTH”标出关键证据。训练样本用 RGB、深度和目标位置作为输入，以专家速度指令作为标签。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】RGB；640 × 480；DEPTH；目标位置。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【小节二 · 场景必须隔离】

【所属章节和小节】具身智能基础 第10章｜小节二 · 场景必须隔离

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

来到“小节二 · 场景必须隔离”。请先核对左侧议程中的先后关系，再用右侧概念图确认每一页承担的证据任务。同时指出这条关系依赖的条件，以及可能失效的边界。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】场景必须隔离，不能让模型 偷看答案；翻转图像，也要翻转 转向标签；把专家动作当作 标准答案。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-concept-map.svg


## P7【场景必须隔离，不能让模型 偷看答案】

【所属章节和小节】具身智能基础 第10章｜小节二 · 场景必须隔离

【本页目标】能够解释“场景必须隔离，不能让模型 偷看答案”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“场景必须隔离，不能让模型 偷看答案”，图中的“TRAIN、场景 01、场景 02”标出关键证据。训练、验证和测试必须按场景隔离，否则模型可能记住布局而非学会导航。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】TRAIN · 80%；场景 01；场景 02；场景 03。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【翻转图像，也要翻转 转向标签】

【所属章节和小节】具身智能基础 第10章｜小节二 · 场景必须隔离

【本页目标】能够解释“翻转图像，也要翻转 转向标签”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“翻转图像，也要翻转 转向标签”，图中的“原图：左转、ω = +0.4、H-FLIP”标出关键证据。水平翻转后必须将角速度取反，否则增强会制造互相矛盾的错误标签。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】原图：左转；ω = +0.4；H-FLIP；MIRROR。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-2（无伪造文件）+ HTML内联SVG


## P9【把专家动作当作 标准答案】

【所属章节和小节】具身智能基础 第10章｜小节二 · 场景必须隔离

【本页目标】能够解释“把专家动作当作 标准答案”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“把专家动作当作 标准答案”，图中的“专家数据、观测 → 动作、模型预测”标出关键证据。行为克隆用观测到专家动作的监督配对，通过动作误差训练模型模仿专家。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】专家数据；观测 → 动作；模型预测；v̂ · ω̂。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【小节三 · 三路特征融合】

【所属章节和小节】具身智能基础 第10章｜小节三 · 三路特征融合

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · 三路特征融合”负责把前面的认识转成判断。画面将问题排成路线，请依次读取，不把多个结论混在同一页。再用底部结论检查自己的理解。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】三路特征融合，输出 两个速度；偏一步，就进入 没见过的世界；既看评估报告，也加一道 安全刹车。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-concept-map.svg


## P11【三路特征融合，输出 两个速度】

【所属章节和小节】具身智能基础 第10章｜小节三 · 三路特征融合

【本页目标】能够解释“三路特征融合，输出 两个速度”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“三路特征融合，输出 两个速度”，图中的“RGB → CNN、Depth → …、Goal → FC”标出关键证据。RGB、深度和目标特征先独立提取，再融合回归线速度与角速度。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】RGB → CNN；Depth → CNN；Goal → FC；FEATURE。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【偏一步，就进入 没见过的世界】

【所属章节和小节】具身智能基础 第10章｜小节三 · 三路特征融合

【本页目标】能够解释“偏一步，就进入 没见过的世界”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“偏一步，就进入 没见过的世界”，图中的“未知状态、错误继续累积、纠错轨迹 / D…”标出关键证据。行为克隆一旦偏离专家分布会错误累积。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】未知状态；错误继续累积；纠错轨迹 / DAgger；收集犯错状态再标注。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【既看评估报告，也加一道 安全刹车】

【所属章节和小节】具身智能基础 第10章｜小节三 · 三路特征融合

【本页目标】能够解释“既看评估报告，也加一道 安全刹车”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“既看评估报告，也加一道 安全刹车”，图中的“LOSS、训练 / 验证曲线、TEST REP…”标出关键证据。用成功率、碰撞率和 SPL 评估策略，再用安全层拦截可能碰撞的动作。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】LOSS；训练 / 验证曲线；TEST REPORT；成功率 ↑。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-3（无伪造文件）+ HTML内联SVG


## P14【从训练样本，到 安全动作】

【所属章节和小节】具身智能基础 第10章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】从起点到终点，路径必须 零碰撞；每个样本，都把观察连到 动作；翻转图像，也要翻转 转向标签；三路特征融合，输出 两个速度。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P15【单选题 · 10题】

【所属章节和小节】具身智能基础 第10章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题 · 10题”页面。请先独立阅读题干与全部选项，再核对本章的证据后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【判断题 · 5题】

【所属章节和小节】具身智能基础 第10章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“判断题 · 5题”页面。请逐条判断陈述是否符合本章条件，并用画面中的机制说明理由；提交后再查看反馈，本段不播报答案。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【实操 · 训练导航避障模型】

【所属章节和小节】具身智能基础 第10章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

请在“实操 · 训练导航避障模型”页面把任务拆成可执行步骤，记录输入、过程和结果；先提交自己的判断，再打开评分要求检查遗漏。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

