# 具身智能基础第9章《把虚拟世界变成 数据工厂》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 5～6 分钟

建议课堂时长：约 10～16 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【把虚拟世界变成 数据工厂】

【所属章节和小节】具身智能基础 第9章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“把虚拟世界变成 数据工厂”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 不看屏幕】

【所属章节和小节】具身智能基础 第9章｜小节一 · 不看屏幕

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“小节一 · 不看屏幕”的议程页。左侧按顺序列出本节问题，右侧教学场景呈现离屏数据工厂；先追踪场景如何变成图像批次，再进入后续机制页面。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】不看屏幕，也能 批量拍照；五个阶段，把 3D 变成 训练样本；离屏 ≠ 离线：这是 两个维度。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-scene.png


## P3【不看屏幕，也能 批量拍照】

【所属章节和小节】具身智能基础 第9章｜小节一 · 不看屏幕

【本页目标】能够解释“不看屏幕，也能 批量拍照”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“不看屏幕，也能 批量拍照”，图中的“普通渲染、取景 → 显示 …、GPU”标出关键证据。离屏渲染直接在 GPU 内存完成图像生成，并把结果写入内存或磁盘。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】普通渲染；取景 → 显示 → 观看；GPU；MEMORY。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-1（无伪造文件）+ HTML内联SVG


## P4【五个阶段，把 3D 变成 训练样本】

【所属章节和小节】具身智能基础 第9章｜小节一 · 不看屏幕

【本页目标】能够解释“五个阶段，把 3D 变成 训练样本”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“五个阶段，把 3D 变成 训练样本”，图中的“场景加载、USD、相机设置”标出关键证据。先准备场景与相机，再由 GPU 计算，最后把图像和元数据一起组装导出。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】场景加载；USD；相机设置；位置 · 角度。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【离屏 ≠ 离线：这是 两个维度】

【所属章节和小节】具身智能基础 第9章｜小节一 · 不看屏幕

【本页目标】能够解释“离屏 ≠ 离线：这是 两个维度”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“离屏 ≠ 离线：这是 两个维度”，图中的“AXIS A、图像送到哪里、ON-SCREEN”标出关键证据。离屏只说明图像不直接送显示器；是否实时、画质高低仍由任务时限和渲染…。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】AXIS A；图像送到哪里；ON-SCREEN；显示器 / 交互视口。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【小节二 · 关键帧定轨迹】

【所属章节和小节】具身智能基础 第9章｜小节二 · 关键帧定轨迹

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

来到“小节二 · 关键帧定轨迹”。请先核对左侧议程中的先后关系，再用右侧概念图确认每一页承担的证据任务。同时指出这条关系依赖的条件，以及可能失效的边界。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】关键帧定轨迹， 采样帧 才触发渲染；少做重复计算；训练数据不是散图，而是一棵 文件树。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-concept-map.svg


## P7【关键帧定轨迹， 采样帧 才触发渲染】

【所属章节和小节】具身智能基础 第9章｜小节二 · 关键帧定轨迹

【本页目标】能够解释“关键帧定轨迹， 采样帧 才触发渲染”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“关键帧定轨迹， 采样帧 才触发渲染”，图中的“KEYFRAMES、K0、K1”标出关键证据。关键帧定义轨迹形状与相机姿态；系统按采样间隔取得位姿。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】KEYFRAMES；K0；K1；K2。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【少做重复计算，把 GPU 用在 信息增量】

【所属章节和小节】具身智能基础 第9章｜小节二 · 关键帧定轨迹

【本页目标】能够解释“少做重复计算，把 GPU 用在 信息增量”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“少做重复计算，把 GPU 用在 信息增量”，图中的“帧间隔、视角变化 3–5°、多 GPU 并行”标出关键证据。用 3–5° 帧间隔减少近似帧，再用并行与增量渲染提升吞吐。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】帧间隔；视角变化 3–5°；多 GPU 并行；G1。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-2（无伪造文件）+ HTML内联SVG


## P9【训练数据不是散图，而是一棵 文件树】

【所属章节和小节】具身智能基础 第9章｜小节二 · 关键帧定轨迹

【本页目标】能够解释“训练数据不是散图，而是一棵 文件树”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“训练数据不是散图，而是一棵 文件树”，图中的“render_o…、rgb/、depth/”标出关键证据。完整样本同时保存图像、深度或分割结果，以及位姿、标注和渲染配置。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】render_output/；rgb/ · PNG；depth/ · 距离；segmentation/。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【小节三 · 一张图要可训练】

【所属章节和小节】具身智能基础 第9章｜小节三 · 一张图要可训练

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · 一张图要可训练”负责把前面的认识转成判断。画面将问题排成路线，请依次读取，不把多个结论混在同一页。请把节点间的连接作为判断依据。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】一张图要可训练，必须知道 从哪看见；九成求量，一成求 关键质量；同一条轨迹，生成十个 不同世界。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】assets/chapter-concept-map.svg


## P11【一张图要可训练，必须知道 从哪看见】

【所属章节和小节】具身智能基础 第9章｜小节三 · 一张图要可训练

【本页目标】能够解释“一张图要可训练，必须知道 从哪看见”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“一张图要可训练，必须知道 从哪看见”，图中的“RGB FRAM…、FRAME ID、POSE”标出关键证据。帧 ID 把 RGB、深度、相机位姿和对象标注绑定成一个可用训练样本。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】RGB FRAME 000；FRAME ID；POSE · x y z；roll pitch yaw。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【九成求量，一成求 关键质量】

【所属章节和小节】具身智能基础 第9章｜小节三 · 一张图要可训练

【本页目标】能够解释“九成求量，一成求 关键质量”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“九成求量，一成求 关键质量”，图中的“快速模式、初期训练、高质量模式”标出关键证据。混合策略用 90% 快速数据保数量，用 10% 关键帧精渲染保质量。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】快速模式；初期训练 · 大数据量；高质量模式；最终训练 · Sim-to-Real。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【同一条轨迹，生成十个 不同世界】

【所属章节和小节】具身智能基础 第9章｜小节三 · 一张图要可训练

【本页目标】能够解释“同一条轨迹，生成十个 不同世界”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“同一条轨迹，生成十个 不同世界”，图中的“固定核心、同一场景、同一轨迹”标出关键证据。域随机化改变光照、纹理与物体状态，让模型提前见过真实环境中的变化。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】固定核心；同一场景；同一轨迹；RANDOMIZE。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】待补视频 video-3（无伪造文件）+ HTML内联SVG


## P14【轨迹输入，数据包 输出】

【所属章节和小节】具身智能基础 第9章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】不看屏幕，也能 批量拍照；离屏 ≠ 离线：这是 两个维度；少做重复计算；一张图要可训练，必须知道 从哪看见。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P15【单选题 · 10题】

【所属章节和小节】具身智能基础 第9章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题 · 10题”页面。请先独立阅读题干与全部选项，再核对本章的证据后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【实操一 · 完整离屏渲染】

【所属章节和小节】具身智能基础 第9章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

面对“实操一 · 完整离屏渲染”，请先列出操作步骤和需要提交的证据，再独立作答；参考内容暂不展开，完成后才用于复核。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【实操二 · 域随机化实验】

【所属章节和小节】具身智能基础 第9章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

请在“实操二 · 域随机化实验”页面把任务拆成可执行步骤，记录输入、过程和结果；先提交自己的判断，再打开评分要求检查遗漏。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

