# 具身智能基础第1章《AI 的 “身体” 在哪里？》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 5～6 分钟

建议课堂时长：约 10～16 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【AI 的 “身体” 在哪里？】

【所属章节和小节】具身智能基础 第1章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“AI 的 “身体” 在哪里”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 从“会说”到 真的会做】

【所属章节和小节】具身智能基础 第1章｜小节一 · 从“会说”到 真的会做

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

先看左侧议程，再看右侧机器人实验台：传感器取得环境信息，控制系统决定动作，机械臂改变木块位置，新的结果还要被再次观察。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】从“会说”到 真的会做；感知、决策、执行 不是单行道；为什么走路 比下棋更难。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-scene.png


## P3【从“会说”到 真的会做】

【所属章节和小节】具身智能基础 第1章｜小节一 · 从“会说”到 真的会做

【本页目标】能够解释“从“会说”到 真的会做”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“从“会说”到 真的会做”，图中的“CHAT AI、知道怎么做、写文章”标出关键证据。具身智能让 AI 获得感知与行动通道，进入真实或仿真的物理世界。再用底部结论检查自己的理解。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】CHAT AI；知道怎么做；写文章 · 翻译 · 写代码；能够去做。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-1（无伪造文件）+ HTML内联SVG


## P4【感知、决策、执行 不是单行道】

【所属章节和小节】具身智能基础 第1章｜小节一 · 从“会说”到 真的会做

【本页目标】能够解释“感知、决策、执行 不是单行道”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着闭环逐步追踪。本页聚焦“感知、决策、执行 不是单行道”，图中的“感知、相机 · 雷达 …、决策”标出关键证据。机器人每执行一次，环境就可能变化，因此必须重新感知并持续修正。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】感知；相机 · 雷达 · 传感器；决策；大模型 / VLA · 策略。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【为什么走路 比下棋更难？】

【所属章节和小节】具身智能基础 第1章｜小节一 · 从“会说”到 真的会做

【本页目标】能够解释“为什么走路 比下棋更难”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“为什么走路 比下棋更难”，图中的“下棋、规则明确、走路 / 抓杯子”标出关键证据。规则世界适合计算，真实世界却要求 AI 随时处理噪声、变化和意外。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】下棋；规则明确 · 信息完整；走路 / 抓杯子；开放 · 不确定 · 充满意外。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【小节二 · 精确菜谱】

【所属章节和小节】具身智能基础 第1章｜小节二 · 精确菜谱

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

来到“小节二 · 精确菜谱”。请先核对左侧议程中的先后关系，再用右侧概念图确认每一页承担的证据任务。再核对条件。请把节点间的连接作为判断依据。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】精确菜谱，还是 见多识广；模块化： 逐站接力；VLA： 一个模型直达动作；两条路线， 同一块地基。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-concept-map.svg


## P7【精确菜谱，还是 见多识广？】

【所属章节和小节】具身智能基础 第1章｜小节二 · 精确菜谱

【本页目标】能够解释“精确菜谱，还是 见多识广”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“精确菜谱，还是 见多识广”，图中的“传统机器人、工程师精确编程、固定环境”标出关键证据。结构化高精度任务仍适合传统机器人；具身智能拓展的是变化更大的场景。请复核。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】传统机器人；工程师精确编程；固定环境 · 极高精度；具身智能。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【模块化： 逐站接力】

【所属章节和小节】具身智能基础 第1章｜小节二 · 精确菜谱

【本页目标】能够解释“模块化： 逐站接力”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“模块化： 逐站接力”，图中的“感知、识别物体、CAMERA”标出关键证据。模块化便于独立开发和排错，代价是接口复杂与误差累积。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】感知；识别物体；CAMERA；理解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P9【VLA： 一个模型直达动作】

【所属章节和小节】具身智能基础 第1章｜小节二 · 精确菜谱

【本页目标】能够解释“VLA： 一个模型直达动作”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“VLA： 一个模型直达动作”，图中的“相机图像、红色杯子在桌上、语言指令”标出关键证据。VLA 省掉人工模块拆分，但依赖海量轨迹、强算力与额外安全机制。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】相机图像；红色杯子在桌上；语言指令；“放到托盘上”。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-2（无伪造文件）+ HTML内联SVG


## P10【两条路线， 同一块地基】

【所属章节和小节】具身智能基础 第1章｜小节二 · 精确菜谱

【本页目标】能够解释“两条路线， 同一块地基”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“两条路线， 同一块地基”，图中的“模块化、短期落地主力、可解释”标出关键证据。路线可以并行，数据却是两者共同的训练燃料和评估依据。再用底部结论检查自己的理解。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】模块化；短期落地主力；可解释 · 可调试 · 可加安全层；端到端 VLA。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P11【小节三 · 机器人正在走进 哪些…】

【所属章节和小节】具身智能基础 第1章｜小节三 · 机器人正在走进 哪些…

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · 机器人正在走进 哪些…”负责把前面的认识转成判断。画面将问题排成路线，请依次读取，不把多个结论混在同一页。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】机器人正在走进 哪些现场；为什么“身体数据” 最难获得；平台如何 拆掉数据瓶颈。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-concept-map.svg


## P12【机器人正在走进 哪些现场？】

【所属章节和小节】具身智能基础 第1章｜小节三 · 机器人正在走进 哪些…

【本页目标】能够解释“机器人正在走进 哪些现场”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“机器人正在走进 哪些现场”，图中的“环境结构化、程度决定落地速度、仓储物流”标出关键证据。越结构化的环境越容易落地，家庭与农业等开放场景仍更具挑战。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】环境结构化；程度决定落地速度；仓储物流；分拣 · 搬运 · 上架。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【为什么“身体数据” 最难获得？】

【所属章节和小节】具身智能基础 第1章｜小节三 · 机器人正在走进 哪些…

【本页目标】能够解释“为什么“身体数据” 最难获得”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“为什么“身体数据” 最难获得”，图中的“文本、互联网海量内容、易获取”标出关键证据。机器人轨迹必须真实操作或高质量仿真采集，时间与硬件成本远高于文本。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】文本；互联网海量内容；易获取；图像。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P14【平台如何 拆掉数据瓶颈？】

【所属章节和小节】具身智能基础 第1章｜小节三 · 机器人正在走进 哪些…

【本页目标】能够解释“平台如何 拆掉数据瓶颈”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“平台如何 拆掉数据瓶颈”，图中的“真机遥操作、采集真实动作、REAL”标出关键证据。真机、仿真和自动标注协同，目标是降低高质量具身数据的采集成本。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】真机遥操作；采集真实动作；REAL；数字孪生。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-3（无伪造文件）+ HTML内联SVG


## P15【第一章，记住 三个判断框架】

【所属章节和小节】具身智能基础 第1章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】从“会说”到 真的会做；为什么走路 比下棋更难；模块化： 逐站接力；机器人正在走进 哪些现场。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【单选题 · 10 题】

【所属章节和小节】具身智能基础 第1章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题 · 10 题”页面。请先独立阅读题干与全部选项，再核对本章的关系后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【判断题 · 5 题】

【所属章节和小节】具身智能基础 第1章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“判断题 · 5 题”页面。请逐条判断陈述是否符合本章条件，并用画面中的机制说明理由；提交后再查看反馈，本段不播报答案。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

