CH.05 / NOTES
05 // CHAPTER ROUTE

机器开始 看见 世界

AI基础 · 第五章

文字、图像、声音与行动不再各自为政。多模态 AI 让机器把多种信息线索放进同一次理解。

01

多模态 AI 让信息一起理解

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02

谁在处理 图文关系?

代表模型的侧重点不同

03

视频生成的 时间一致性

视频不仅要生成单帧

04

TTS 的四级台阶 从拼接到克隆

语音越来越自然

05

听起来“好” 不止像真人

评价 TTS 要同时看自然度、清晰度和情感表现力

UNIT 01 / MEETING NOTES

小节一 · 多模态 AI 让信息…

AGENDA / 本节阅读顺序01多模态 AI 让信息一起理解02VLM 的三段链路 看见 · 对齐 · 推理03谁在处理 图文关系
多模态AI教学场景:图像、声音与语言三路信号进入共享对齐装置并形成联合输出
图 5.1 让不同模态在共享空间对齐的教学场景

先围绕“多模态 AI 让信息一起理解”建立问题,再逐页核对本小节的机制与证据。

01 // DEFINITION

多模态 AI
让信息一起理解

文本:提出问题
图像:看见场景
多种信息
通道同时处理 / 理解
音频:听到线索
触觉:获得反馈

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02 // VLM

VLM 的三段链路
看见 · 对齐 · 推理

视觉编码器把图片切成 Patch,转成图像向量
图像向量
连接层把图像向量映射到文本语义空间
已对齐语义
大语言模型结合图片与问题,完成跨模态推理

VLM 先把图像编码,再完成语义对齐,最后才生成与画面有关的回答。

03 // MODEL MAP

谁在处理
图文关系?

GPT-4V / 4o图像、语音、视频交互
Gemini原生融合多种模态
通义千问-VL国内开源图文理解
GLM-4V中文场景多模态
InternVL2开源多模态模型

代表模型的侧重点不同,但共同任务都是把图像与文字放进同一条理解链。

UNIT 02 / MEETING NOTES

小节二 · 扩散模型

AGENDA / 本节阅读顺序01扩散模型: 从噪声回到画面02视频生成的 时间一致性03机器人如何 把理解变成行动04数字孪生: 先练再上场
小节二 · 扩散模型的章节概念路线图
图 5.2 小节二 · 扩散模型的观察入口

先围绕“扩散模型: 从噪声回到画面”建立问题,再逐页核对本小节的机制与证据。

04 // DIFFUSION

扩散模型:
从噪声回到画面

纯噪声
“粗糙大理石”
文字提示 = 设计图纸
训练:清晰图像逐步加噪
生成:纯噪声逐步去噪
多轮收敛成目标画面
清晰图像月球
柴犬

扩散模型不是一次画完,而是在文字约束下反复去噪,逐步形成图像。

05 // TEXT TO VIDEO

视频生成的
时间一致性

一张图
vs
连续画面

视频不仅要生成单帧,还要让动作、光影和物体在连续帧中保持连贯。

06 // ROBOT LOOP

机器人如何
把理解变成行动

1感知摄像头、麦克风、雷达与触觉传感器采集环境信息
2理解多模态模型融合分析,识别场景并规划任务
3行动路径规划、抓取策略与运动控制落实为动作
环境变化 / 下一轮感知

多模态 AI 把“感知—理解—行动”连成机器人进入真实环境的闭环。

07 // DIGITAL TWIN

数字孪生:
先练再上场

数字孪生
反复试错 × N
技能迁移
真实世界

在虚拟副本中反复试错,能降低训练成本与风险,再把技能迁移到真实任务。

UNIT 03 / MEETING NOTES

小节三 · TTS 的四级台阶 …

AGENDA / 本节阅读顺序01TTS 的四级台阶 从拼接到克隆02三种 TTS 工具 各有主场03听起来“好” 不止像真人
小节三 · TTS 的四级台阶 …的章节概念路线图
图 5.3 小节三 · TTS 的四级台阶 …的观察入口

先围绕“TTS 的四级台阶 从拼接到克隆”建立问题,再逐页核对本小节的机制与证据。

08 // TTS HISTORY

TTS 的四级台阶
从拼接到克隆

第一代:拼接预录音素拼接,声音较生硬
第二代:参数统计模型生成参数,仍有电子感
第三代:深度学习端到端生成语音波形,成为主流
最新:零样本克隆少量音频模仿音色,也带来伪造风险

语音越来越自然,同时也要求我们审慎对待语音克隆带来的深度伪造风险。

09 // TTS TOOLKIT

三种 TTS 工具
各有主场

先看使用场景按交付条件分流,而不是把工具串行执行
本地批量商业集成实时交互
Edge-TTS
免费开源,支持多种中文发音人,可由 Python 调用;适合本地开发与有声内容批量生成。
讯飞语音
自然度高,支持方言和情感合成;适合商业产品、智能硬件与呼叫中心。
火山引擎 TTS
支持流式合成、延迟低、声音库丰富;适合实时交互、直播与短视频配音。

工具选择取决于交付场景:批量、商业品质与实时延迟对应不同方案。

10 // TTS METRICS

听起来“好”
不止像真人

清晰度

字词是否听得清、断句是否准确

听得清

自然度

节奏、重音和停顿是否接近真人

像真人

情感表现力

语气和情绪是否匹配内容语境

合语境
TTS 质量 = 三个维度共同过关

评价 TTS 要同时看自然度、清晰度和情感表现力,不能只听“像不像真人”。

11 // RECAP

多模态如何 连通世界

01

多模态 AI 让信息一起理解

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02

谁在处理 图文关系?

代表模型的侧重点不同

03

视频生成的 时间一致性

视频不仅要生成单帧

04

TTS 的四级台阶 从拼接到克隆

语音越来越自然

05

听起来“好” 不止像真人

评价 TTS 要同时看自然度、清晰度和情感表现力

多模态 AI 把理解、生成、表达与行动连接起来,但每一步都仍需验证。

SOURCE QUIZ

单选题
8 题

3.1 单选题(每题 5 分,共 40 分)

得分 0/40 分 · 答对 0/8

先独立作答,再用讲义解析核对自己对机制和边界的理解。

SOURCE SHORT 01

简答题
VLM 原理

3.2 简答题(每题 20 分,共 60 分)

第 9 题:请用自己的话解释 VLM(视觉语言模型)的工作原理,并说明它和传统纯文本大语言模型(LLM)的核心区别是什么。

请先独立完成作答,再展开讲义参考答案进行核对。

SOURCE SHORT 02

简答题
机器人与孪生

3.2 简答题(每题 20 分,共 60 分)

第 10 题:结合"具身智能"的概念,分析多模态 AI 在机器人领域的重要价值,并举例说明"数字孪生"如何帮助机器人更好地学习技能。

请先独立完成作答,再展开讲义参考答案进行核对。

SOURCE SHORT 03

简答题
绘本朗读助手

3.2 简答题(每题 20 分,共 60 分)

第 11 题:某教育科技公司计划开发一款"AI 绘本朗读助手",要求能根据绘本图片自动生成配音。请结合本章所学知识,设计该产品的技术方案,并说明你将使用哪些国内工具来实现。

请先独立完成作答,再展开讲义参考答案进行核对。