CH.02 / NOTES
02 // CHAPTER ROUTE
大模型基础
AI基础 · 第二章
从 Token 到训练与部署
01LLM 本质: 词语接龙机器
大模型不是查答案
02上下文窗口: 短期记忆
上下文窗口是一次请求中模型能“看到”的最大 Token…
03预训练: 博览群书
预训练用 TB 级公开文本,让模型学语言规律和世界知识。
04三阶段训练: 顺序不能颠倒
现代大模型通常按“预训练 → SFT → RLHF”递…
05教学团队策略: 混合部署
工业应用常用“云端 + 本地”混合方案
UNIT 01 / MEETING NOTES
小节一 · LLM 本质
AGENDA / 本节阅读顺序
图 2.1 从语言单元到下一步预测的教学场景
01 // NEXT TOKEN
LLM 本质:词语接龙机器
02 // TOKEN
Token 是语言原子
03 // MEMORY
上下文窗口:短期记忆
UNIT 02 / MEETING NOTES
小节二 · 国产大模型
AGENDA / 本节阅读顺序
图 2.2 小节二 · 国产大模型的观察入口
04 // MODELS
国产大模型:各有看家本领
05 // PRETRAIN
预训练:博览群书
06 // SFT
监督微调:学会答题
07 // RLHF
RLHF:价值观对齐
UNIT 03 / MEETING NOTES
小节三 · 三阶段训练
AGENDA / 本节阅读顺序
图 2.3 小节三 · 三阶段训练的观察入口
08 // TRAINING PIPELINE
三阶段训练:顺序不能颠倒
09 // DEPLOYMENT
云端 vs 本地:效率与安全
10 // HYBRID
教学团队策略:混合部署
RECAP // CHAPTER 02
本章总结: 模型心脏
01LLM 本质: 词语接龙机器
大模型不是查答案
02上下文窗口: 短期记忆
上下文窗口是一次请求中模型能“看到”的最大 Token…
03预训练: 博览群书
预训练用 TB 级公开文本,让模型学语言规律和世界知识。
04三阶段训练: 顺序不能颠倒
现代大模型通常按“预训练 → SFT → RLHF”递…
05教学团队策略: 混合部署
工业应用常用“云端 + 本地”混合方案
SOURCE PRACTICE 01 // 模型体验
DeepSeek
Kimi
讲义实操:注册并体验 DeepSeek / Kimi
完成一次知识问答和一次代码挑战,并如实记录模型表现。
01 · 注册与首次问答
- 访问 chat.deepseek.com 或 kimi.moonshot.cn。
- 使用手机号或邮箱完成注册并登录。
- 输入下方讲义原始问题。
“请用 200 字介绍人工智能的发展历程”
02 · 核验与代码挑战
- 回答是否准确,有没有事实错误?
- 语言是否流畅自然?生成大概用了几秒?
- 再输入下方代码任务,检查代码是否正确、注释是否清晰。
“请帮我写一个 Python 函数,判断一个数字是否是质数,并添加注释解释每一步。”
SOURCE PRACTICE 02 // Prompt 对比
讲义实操:对比两个 Prompt
在 DeepSeek 或 Kimi 中分别输入以下 Prompt,对比结果差异,并记录你的发现:
1. "推荐三本好书"
2. "你是一名大学图书馆管理员,请为大一新生推荐三本必读好书,并说明推荐理由。"
注意观察:Prompt 写得越具体,回答质量越高。这就是下一章要讲的 Prompt 工程的精髓。
SOURCE SHORT ANSWER
SOURCE SHORT ANSWER // 简答题 3题
1. 请用你自己的话解释"Token"是什么,并举例说明为什么一段中文文本的 Token 数量不等于它的汉字数量。
参考答案:
Token 是大模型处理文本的最小单位,它不是字也不是词,而是模型内部"切分"出来的有意义的小片段。一段中文文本的 Token 数量不等于汉字数量,原因有二:
- 一些常见词会被合并成一个 Token。例如"人工智能"可能被切分为"人工"+"智能"(2 个 Token),而不是 4 个 Token。
- 标点符号、空格、换行符也可能单独计为 Token。
评分要点:能说清楚 Token 不是字也不是词(2 分),能举例说明中文分词后 Token 数与字数不一致(2 分),语言表达清晰(1 分)。
2. 简述大模型训练的三个阶段(预训练、SFT、RLHF)各自的目标和所用数据类型的区别。
参考答案:
| 阶段 | 目标 | 所用数据类型 |
|---|
| 预训练 | 让模型学习语言的基本规律和世界知识 | 海量互联网文本(TB 级,质量参差不齐) |
| SFT | 让模型学会"问答格式",按指令回答 | 高质量人工标注的问答对(万-十万条) |
| RLHF | 让模型对齐人类价值观,生成安全、有用的回答 | 人类偏好排序数据(对多个回答进行好坏排序) |
三者的关系是递进的:预训练给模型"知识",SFT 给模型"对话格式",RLHF 给模型"价值观"。
评分要点:三个阶段名称和顺序正确(1 分),每个阶段的目标和数据描述准确(各 1 分,共 3 分),能说明三者递进关系(1 分)。
3. 假设你是一家小公司的技术负责人,公司需要处理大量内部文档(含敏感信息),你会选择云端部署还是本地部署大模型?请说明理由。
参考答案:
我会选择本地部署。理由如下:
- 数据安全是首要考虑:内部文档包含敏感信息,上传到云端有泄露风险。本地部署确保数据不出公司内网,符合信息安全要求。
- 合规要求:很多行业(如金融、医疗、政府)有严格的数据本地化规定,本地部署是合规的前提。
- 成本可控:虽然前期需要投入 GPU 硬件(约 1-3 万元),但长期来看,大批量处理文档时本地部署比按 Token 付费的云端 API 更经济。
- 可定制性:本地部署的模型可以进行微调,更好地适配公司特定领域的文档处理需求。
补充说明:如果公司的文档处理量不大,且对实时性要求高,可以考虑"混合方案"——日常非敏感文档用云端 API 快速处理,涉密文档走本地模型。
评分要点:明确选择本地部署(1 分),至少列出 2 个合理理由(各 1 分,共 2 分),能讨论混合方案作为补充说明(1 分),逻辑清晰(1 分)。