大模型的内部——嵌入·注意力·训练管线
大模型不是魔法,它的内部是可以被看见的。
核心问题:大模型内部到底怎么把语言变成可计算的东西、怎么决定看哪些词、又是怎么被一步步训练出来的?
怎么上:线上 × 线下协同
课前 · 导学/建模
看嵌入空间、注意力、训练管线的机制可视化。
课中 · 创新实践
转化为系统级讲解或可解释性小调研。
课后 · 评估/决策
互评谁讲得最准确、最不误导,修订一处。
线上模块(本平台)
嵌入语义空间
把词拖进二维空间,看"猫/狗"近、"猫/汽车"远——语言被变成了空间里有距离的点(真实向量降维)。
注意力热力图
点句中不同的词,看模型"在看谁",重点一变意思就变——这就是注意力。
训练管线 + 可解释性入门
走一遍"预训练 → 微调 → 对齐(RLHF)"流水线模拟,并试着回答"模型为什么这样答"。
① 嵌入:把"意思"变成空间里的点
AI 看不懂字,它先把每个词变成一串数字(向量),变成空间里的一个点。语义越近,点越近。下面是一张简化的二维语义地图。
② 注意力:读一句话时,重点在看谁
模型读句子时,不会平均看每个词。它给每个词算一个"关注权重"。点下面句子里的一个词当"查询",看 AI 把注意力分给了谁——这是真实的softmax(查询·键 ÷ √维度)算出来的。
👆 点句中一个词,看它的注意力分布。
③ 训练管线:从"只会接龙"到"靠谱助手"
大模型经过三步:预训练 → 微调 → 对齐。下面三步你都亲手走一遍。
预训练 · 只学"猜下一个词"
用下面这份"阅读材料"现场建一个真实的"下一个词"模型(bigram)。从「小」开始,看它怎么逐词接龙。
结论:它没人教对错,只是从海量文字学会"猜下一个词"——这时只会接龙,不会真答你的问题。
微调 · 教它"好好回答"
同一个问题,看"只预训练"和"微调后"的差别。
……小 猫 喜欢 吃 鱼 小 狗 喜欢……(顺着接龙,不回答)
猫是一种爱干净、独立又亲人的小型宠物。(直接回答)
结论:微调用"问题→好答案"的例子,教会它把知识用成"回答"。
对齐(RLHF) · 你来当"人类评分员"
下面 3 组,每组选你更喜欢的回答。你的选择会真实统计成"你教给 AI 的偏好"。
用自己的话讲清一处机制
从嵌入 / 注意力 / 训练管线里挑一处,用自己的话讲清它怎么工作,并指出一处"比喻和真实机制不一样"的地方(≥ 40 字)。这正是你线下当"白盒讲解员"要讲的内容。
✅ 已完成单元 H2。你已经看懂了大模型内部最核心的三块机制。
线下项目(学校组织)
当一回"白盒讲解员"(进阶)
用可视化向同学或低年级讲清大模型机制,或做一次"可解释性"小调研(模型为什么会这样答),产出讲解作品或调研报告并答辩。
- 机制讲解是否准确、不把类比当成真相
- 能否讲清嵌入 / 注意力 / 训练管线各自解决什么
- 可解释性结论是否有证据支撑
带走的系统视角追问
对 AI 既能创造,也能评估与治理——动手前后都问一句
- 你的可视化和真实机制,差在哪里?
- "模型这样答"和"我们能解释它为什么这样答",是一回事吗?
- 看懂机制,会改变你对它输出的信任程度吗?