← 返回单元地图
单元 H1 · 10 年级 · 实现方法 · 基本概念 · 基础普及

机器学习系统——从数据到决策

一个会判断的 AI,是被"搭"出来的,也要被"评"出来。

核心问题:一个能做判断的 AI 系统,怎么从一堆数据被搭出来、又怎么知道它到底准不准、该不该上线?

01

怎么上:线上 × 线下协同

线上

课前 · 导学/建模

在数据与评估工具里建立"数据→评估"底座。

线下

课中 · 创新实践

小组端到端搭系统,记录项目日志与评估数据。

线上

课后 · 评估/决策

用评估指标复盘"为什么不准、该不该信、该不该上线"。

02

线上模块(本平台)

1

数据集构建与偏差审计

亲手做采样、标注、覆盖度检查——数据里的偏差,决定系统会在哪里出错、对谁不公平。

2

训练—验证—测试与评估指标

为什么"准确率"不够?看混淆矩阵、误报与漏报,学会用对的尺子衡量一个系统。

3

迭代调优

可视化地改一个特征 / 一个参数,看系统表现如何变——理解"调"是有依据的,不是碰运气。

👉 先看清这批训练数据,按组和标签数一数,预判它会在哪里翻车。

① 一个"可疑链接检测器"的训练数据

模型给每条消息打一个危险分(0-100)。下面 12 条是它的训练数据,分成 A 组(常见普通消息)和 B 组(方言/网络语消息)。先做一次偏差审计:每组、每类各有几条?

② 拖动判定阈值,看它到底准不准

分数 ≥ 阈值就判为"危险"。拖动阈值,下面的混淆矩阵和三个指标会当场重算。试试:把阈值调高,误报少了,但漏报呢?

③ 同一个阈值,对两组一样公平吗?

把刚才的阈值,分别只看 A 组和 B 组,各自算召回率(危险消息被抓住的比例)。拖动阈值看差距。

通关任务:这个检测器,该不该上线?

用一段话给出你的决策与依据——要同时谈到评估指标、分组公平、和上线后的社会影响(≥ 40 字)。

0 / 40 字
03

线下项目(学校组织)

端到端搭一个可评估的 AI 系统

小组选一个校园真实场景(如垃圾分类、出勤预测),完整走"采数据 → 标注 → 训练 → 评估 → 该不该上线",产出系统说明 + 评估报告 + 上线与否的论证。

  • 数据采集是否覆盖多样情况、是否记录了已知偏差
  • 是否用了恰当的评估指标(不止准确率),并解读了误报 / 漏报
  • 能否说清系统在什么情况下不可靠
  • "该不该上线"的论证是否有数据与社会影响依据
端到端分类 / 预测系统校园场景数据建模可评估的机器学习项目
04

带走的系统视角追问

对 AI 既能创造,也能评估与治理——动手前后都问一句

  • 这个评估指标,掩盖了什么样的失败?
  • 如果换一批人群的数据,这个系统还公平吗?
  • "准确率高"和"可以上线"是一回事吗?