CH.04 / NOTES
04 // CHAPTER ROUTE

机器如何 看懂世界?

AI基础 · 第四章

任务不同,模型回答世界的粒度也不同。

01

三种 视觉任务

任务不同,模型回答世界的粒度也不同。

02

图像的 数字语言

彩色图像的底层,是由 RGB 数值组成的像素矩阵。

03

训练就是 反复纠错

模型通过猜测、比较、调整和重复,逐渐学会正确识别。

04

视觉大模型 三件套

CLIP、SAM 与 Grounding DINO 分…

05

部署不是 终点

边缘端与云端协同,难例持续回流,模型才会越用越好。

UNIT 01 / MEETING NOTES

小节一 · 三种 视觉任务

AGENDA / 本节阅读顺序01三种 视觉任务02从整图到 像素03图像的 数字语言
计算机视觉教学场景:像素经过分层特征提取后进入分类、检测与分割任务
图 4.1 从像素特征到三种视觉任务的教学场景

先围绕“三种 视觉任务”建立问题,再逐页核对本小节的机制与证据。

MODULE 01 // THREE TASKS

三种视觉任务

分类街景 · 98% 检测人 + 车 + 坐标 分割每个像素有类别

任务不同,模型回答世界的粒度也不同。

MODULE 02 // OUTPUT GRANULARITY

从整图到像素

整张图1 标签 N 个框 像素级标签 粒度越来越细

分类、检测、分割构成从粗到细的视觉理解阶梯。

MODULE 03 // PIXEL MATRIX

图像的数字语言

一个像素R 216G 74B 1380 — 255

彩色图像的底层,是由 RGB 数值组成的像素矩阵。

UNIT 02 / MEETING NOTES

小节二 · CNN 逐层看懂

AGENDA / 本节阅读顺序01CNN 逐层看懂02训练就是 反复纠错
小节二 · CNN 逐层看懂的章节概念路线图
图 4.2 小节二 · CNN 逐层看懂的观察入口

先围绕“CNN 逐层看懂”建立问题,再逐页核对本小节的机制与证据。

MODULE 04 // CNN FEATURES

CNN 逐层看懂

浅层先找基本笔画边缘 · 线条 · 转角 组合 中间层把边缘拼成可识别的局部 眼睛 耳朵 毛发纹理 LOCAL FEATURES 再组合 深层形成完整概念整体语义

CNN 把简单边缘逐层组合成局部特征与整体语义。

MODULE 04 // TRAINING LOOP

训练就是反复纠错

1 · 标注样本图片 + 猫 / 狗2 · 模型预测猜:猫3 · 比较损失预测 ≠ 答案4 · 调整参数误差决定移动方向与幅度 w1 w2 w3REPEAT · 直到误差下降

模型通过猜测、比较、调整和重复,逐渐学会正确识别。

UNIT 03 / MEETING NOTES

小节三 · 视觉大模型 三件套

AGENDA / 本节阅读顺序01视觉大模型 三件套02巡检 数据流水线03部署不是 终点
小节三 · 视觉大模型 三件套的章节概念路线图
图 4.3 小节三 · 视觉大模型 三件套的观察入口

先围绕“视觉大模型 三件套”建立问题,再逐页核对本小节的机制与证据。

MODULE 06 // FOUNDATION MODELS

视觉大模型三件套

视觉大模型 CLIP图像 ↔ 文字零样本分类SAM点击 / 框选分割任意物体Grounding DINO“你说找什么,它就找什么”

CLIP、SAM 与 Grounding DINO 分别连接图文、分割万物和开放检测。

MODULE 07 // INDUSTRIAL INSPECTION

巡检数据流水线

采集无人机照片标注框出缺陷训练70 / 20 / 10部署云 / 边缘端实时推理决策缺陷预警

工业视觉从采集到决策,每个环节都决定最终可靠性。

MODULE 08 // DEPLOYMENT LOOP

部署不是终点

边缘端无人机 / 机器人快速初筛量化 · 剪枝 · 蒸馏云端GPU 精细分析人工复核收集误检 / 漏检端云协同持续更新

边缘端与云端协同,难例持续回流,模型才会越用越好。

MODULE 09 // CHAPTER RECAP

本章 总结

01

三种 视觉任务

任务不同,模型回答世界的粒度也不同。

02

图像的 数字语言

彩色图像的底层,是由 RGB 数值组成的像素矩阵。

03

训练就是 反复纠错

模型通过猜测、比较、调整和重复,逐渐学会正确识别。

04

视觉大模型 三件套

CLIP、SAM 与 Grounding DINO 分…

05

部署不是 终点

边缘端与云端协同,难例持续回流,模型才会越用越好。

计算机视觉的价值,是把像素转化为可持续优化的决策闭环。

KNOWLEDGE CHECK

单选题 · 10题 × 5分

答对 0/10 · 得分 0/50
TRUE OR FALSE

判断题 · 5题 × 4分

1图像分类任务可以同时在一张图中识别多个不同类别的物体并给出它们的位置。
2语义分割可以对图像中的每个像素进行分类,因此它能区分同一类物体的不同个体(如画面中"第一只猫"和"第二只猫")。
3SAM 模型可以在没有针对特定类别训练的情况下,直接分割它从未见过的物体。
4在 AI 数据闭环中,"模型部署"意味着项目结束,不需要再对模型进行任何更新。
5在输电线路巡检中,无人机拍摄的照片可以直接用于 AI 模型训练,不需要人工标注。
答对 0/5 · 得分 0/20
ASSESSMENT SUMMARY

测验分数统计

测验分数统计
部分题数每题分值满分
单选题10 题5 分50 分
判断题5 题4 分20 分
合计15 题-70 分
单选:答对 0/10 · 得分 0/50 判断:答对 0/5 · 得分 0/20 当前总分 0/70

合计 15 题,满分 70 分。