← 返回单元地图 单元 H1 · 10 年级 · 实现方法 · 基本概念 · 基础普及
机器学习系统——从数据到决策
一个会判断的 AI,是被"搭"出来的,也要被"评"出来。
核心问题:一个能做判断的 AI 系统,怎么从一堆数据被搭出来、又怎么知道它到底准不准、该不该上线?
01
怎么上:线上 × 线下协同
线上
课前 · 导学/建模
在数据与评估工具里建立"数据→评估"底座。
线下
课中 · 创新实践
小组端到端搭系统,记录项目日志与评估数据。
线上
课后 · 评估/决策
用评估指标复盘"为什么不准、该不该信、该不该上线"。
02
线上模块(本平台)
1
数据集构建与偏差审计
亲手做采样、标注、覆盖度检查——数据里的偏差,决定系统会在哪里出错、对谁不公平。
2
训练—验证—测试与评估指标
为什么"准确率"不够?看混淆矩阵、误报与漏报,学会用对的尺子衡量一个系统。
3
迭代调优
可视化地改一个特征 / 一个参数,看系统表现如何变——理解"调"是有依据的,不是碰运气。
👉 先看清这批训练数据,按组和标签数一数,预判它会在哪里翻车。
① 一个"可疑链接检测器"的训练数据
模型给每条消息打一个危险分(0-100)。下面 12 条是它的训练数据,分成 A 组(常见普通消息)和 B 组(方言/网络语消息)。先做一次偏差审计:每组、每类各有几条?
② 拖动判定阈值,看它到底准不准
分数 ≥ 阈值就判为"危险"。拖动阈值,下面的混淆矩阵和三个指标会当场重算。试试:把阈值调高,误报少了,但漏报呢?
💡 小高潮:阈值调高,误报(FP)变少,但漏报(FN)变多——"准确率"一个数掩盖了这一切。真正危险的事,要盯召回率(危险的有没有被抓住)。
③ 同一个阈值,对两组一样公平吗?
把刚才的阈值,分别只看 A 组和 B 组,各自算召回率(危险消息被抓住的比例)。拖动阈值看差距。
💡 小高潮:同一个阈值,B 组的危险消息被漏掉得多得多。模型没坏——是训练数据里 B 组的危险样本太少,分数被系统性低估了。偏差从数据来,落到具体的人身上。
通关任务:这个检测器,该不该上线?
用一段话给出你的决策与依据——要同时谈到评估指标、分组公平、和上线后的社会影响(≥ 40 字)。
0 / 40 字
✅ 已完成单元 H1。你已经能从数据、指标、公平三个角度评估一个 AI 系统该不该上线。
03
线下项目(学校组织)
端到端搭一个可评估的 AI 系统
小组选一个校园真实场景(如垃圾分类、出勤预测),完整走"采数据 → 标注 → 训练 → 评估 → 该不该上线",产出系统说明 + 评估报告 + 上线与否的论证。
- 数据采集是否覆盖多样情况、是否记录了已知偏差
- 是否用了恰当的评估指标(不止准确率),并解读了误报 / 漏报
- 能否说清系统在什么情况下不可靠
- "该不该上线"的论证是否有数据与社会影响依据
端到端分类 / 预测系统校园场景数据建模可评估的机器学习项目
04
带走的系统视角追问
对 AI 既能创造,也能评估与治理——动手前后都问一句
- 这个评估指标,掩盖了什么样的失败?
- 如果换一批人群的数据,这个系统还公平吗?
- "准确率高"和"可以上线"是一回事吗?