数据与机器——AI 凭什么会?
没有数据,AI 什么都不会。
核心问题:AI 的本领从哪来?为什么"喂什么数据"决定它会什么、又会在哪里出错?
怎么上:线上 × 线下协同
课前 · 导学
完成 3 个线上模块,在"数据训练台"里亲手验证数据如何决定 AI 的对错。
课中 · 实践
小组采集真实数据、标注、训练并测试自己的分类器,记录项目日志。
课后 · 复盘
用本单元的"批判清单"诊断"我的模型为什么不准",提交一条数据缺陷分析。
线上模块(本平台)
数据的真面目
同一个任务,喂两批不同的数据,AI 表现天差地别——能力是数据"喂"出来的。
机器是怎么"学"的
不是背答案,是从例子里归纳规律;理解训练集 / 验证集 / 测试集为何必须分开。
特征:AI 眼里的世界
AI 不"看"整张图,它盯的是特征。选错特征,它就学歪。
线上仿真实验 · 数据训练实验室
教 AI 认水果:你喂什么,它学什么
- ① 数据的真面目
- ② 机器怎么学
- ③ 特征
小提示:先故意只把红苹果放进「苹果」,等会看看 AI 认不认青苹果。
这些是 AI 没见过的新水果。拖到「🤖 AI 判断台」,或点「⚡ 全部交给 AI」。
让 AI 判断
AI 对这些没见过的新水果的判断(✓ 对 / ✗ 错):
AI 不是背答案,是从例子里找规律。可"怎么考"很关键——点下面两个按钮,对比两种考法。
AI 不"看"整张图,它盯的是特征。把下面去掉一个勾,再训练分类,看它会不会分错。
AI 的判断:
实验任务(边玩边自动勾选)
- ① 把 ≥ 6 个水果分进两框,训练一次
- ① 让 AI 把新水果分完,得到准确率
- ① 只标红苹果,看青苹果被 AI 判错
- ② 对比"复习题"和"新题"的准确率
- ③ 关掉一个特征,看 AI 分错图片
放到现实里:数据出问题,谁会受影响?
训练照片浅肤色居多,深肤色识别错误率明显更高——谁被漏掉,谁就被歧视。
用过去录用数据训练,过去多录男性,AI 就给女性简历打低分——偏见被自动放大。
只推你爱看的,越推越窄——你以为的"全世界"是被喂出来的,信息茧房。
❓ 这三个,和你刚才"只标红苹果、漏掉一类数据",是不是同一个道理?
④ 通关任务
结合三段实验,举一个"因为数据有问题(缺失、偏向),AI 会出错或不公平"的真实生活例子,说清"哪种数据出了问题"和"会导致什么后果"。
提示:人脸识别、简历筛选、推荐内容、语音助手、自动翻译……谁被漏掉了?
走完 ①②③ 三段后再写 ≥ 20 字提交。
线下项目(学校组织)
训练一个迷你分类器
分小组选定一个真实分类任务(如校园垃圾分类、水果识别),亲历"采数据 → 标注 → 训练 → 测试"完整流程,并解释自己模型为什么准 / 为什么不准。
- 数据是否覆盖了足够多样的情况(不是只挑好拍的)
- 训练数据和测试数据是否分开,没有"拿练习题当考题"
- 能否说清模型靠哪些特征做判断
- 能否指出自己数据里的一处偏差,并说明它会导致什么错误
教师可下载本单元「线下组织包」(学生任务单 / rubric 评分表 / 答辩模板):前往打印 →
带走的批判清单
对 AI 保持平视——动手前后都问一句
- 这批数据是谁收集的?有没有漏掉某些情况?
- 如果换一批数据,这个结论还成立吗?
- AI 答对了,是真的"懂",还是刚好背景帮了它?