llm_basics零基础约 50 分钟
第 0-2 课
LLM 在做什么:词元、概率、训练与推理
学完你能做到
- 理解 LLM 不是数据库查询器,而是在生成下一个词元
- 分清训练模型和日常调用模型
- 理解幻觉为何不是“偶尔粗心”而是系统性风险
大语言模型最核心的动作:预测下一个词元
先建立直觉
手机输入法会猜“今天天气很”后面可能是“好”。LLM 做的是非常复杂、规模非常大的续写;它一次写一点,再根据刚写出的内容继续写。
训练和推理:两段完全不同的工作
| 阶段 | 谁通常在做 | 输入与结果 | 你能否在聊天时改变 |
|---|---|---|---|
| 训练 | 模型公司或研究机构 | 海量数据 + 算力 → 更新模型参数 | 通常不能 |
| 推理 / 调用 | 你的应用或用户 | 本次上下文 → 生成本次回答 / 工具调用 | 可以:通过上下文、工具、模型选择改变 |
什么是幻觉,为什么不能靠“请认真一点”解决
先建立直觉
考试时一个人不知道答案却必须把空填满,他可能写出一句语法通顺、听起来很像答案的话。
案例推演:一句流畅的回答为什么仍可能完全错误
用户问“学校 2027 年寒假从哪天开始”,模型回答得十分肯定,还补充了不存在的通知编号。团队需要沿着生成过程找到风险,而不是把它归结为“模型粗心”。
本节追问:从 token 预测到最终断言,中间缺失了哪个约束? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。
| 阶段 | 本步要做的决定 | 什么算证据 | 最常见的失败 |
|---|---|---|---|
| 形成上下文 | 检查本轮是否提供了 2027 年正式校历 | 上下文中存在可读取的原文与发布日期 | 只有旧校历和用户问题 |
| 生成候选 | 模型按语言模式预测后续 token | 输出流畅只代表序列概率较高 | 把流畅度当成真实性 |
| 核验断言 | 把日期、编号等事实逐项对照来源 | 每个具体断言都有证据位置 | 要求“认真回答”却不提供核验工具 |
| 表达边界 | 证据不足时明确未知并说明获取路径 | 结论强度不超过证据强度 | 为了显得有帮助而补全一个日期 |
阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。
常见误解
在系统提示词中写“绝不幻觉”
实际上
可观察症状:模型仍会生成语法正确但无法证实的内容。
更可靠的修复:把事实查询接入可验证来源,并在输出前执行断言级校验。
案例工作坊 · 建议真正动手完成
25 分钟- 把模型回答拆成“事实断言”和“解释性文字”。
- 为每条事实断言指定可接受的证据。
- 写一个证据不足时仍然有帮助的回答。
查看参考答案
LLM 的直接目标是生成合适的 token 序列,不是自动证明每个句子。可靠性来自上下文中的证据、外部核验和不确定性表达,而不是流畅或自信。
迁移检查:换一个场景还会不会
模型回答非常流畅,最稳妥的判断是什么?