智能体入门课
llm_basics零基础50 分钟

第 0-2 课

LLM 在做什么:词元、概率、训练与推理

学完你能做到

  • 理解 LLM 不是数据库查询器,而是在生成下一个词元
  • 分清训练模型和日常调用模型
  • 理解幻觉为何不是“偶尔粗心”而是系统性风险

大语言模型最核心的动作:预测下一个词元

先建立直觉

手机输入法会猜“今天天气很”后面可能是“好”。LLM 做的是非常复杂、规模非常大的续写;它一次写一点,再根据刚写出的内容继续写。

训练和推理:两段完全不同的工作

阶段谁通常在做输入与结果你能否在聊天时改变
训练模型公司或研究机构海量数据 + 算力 → 更新模型参数通常不能
推理 / 调用你的应用或用户本次上下文 → 生成本次回答 / 工具调用可以:通过上下文、工具、模型选择改变

什么是幻觉,为什么不能靠“请认真一点”解决

先建立直觉

考试时一个人不知道答案却必须把空填满,他可能写出一句语法通顺、听起来很像答案的话。

案例推演:一句流畅的回答为什么仍可能完全错误

用户问“学校 2027 年寒假从哪天开始”,模型回答得十分肯定,还补充了不存在的通知编号。团队需要沿着生成过程找到风险,而不是把它归结为“模型粗心”。

本节追问:从 token 预测到最终断言,中间缺失了哪个约束? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。

每一步都要回答:看到了什么?为何这样决定?怎样证明? 1 形成上下文 检查本轮是否提供了 2027 年正式校历 观察 → 决策 → 留证据 2 生成候选 模型按语言模式预测后续 token 观察 → 决策 → 留证据 3 核验断言 把日期、编号等事实逐项对照来源 观察 → 决策 → 留证据 4 表达边界 证据不足时明确未知并说明获取路径 观察 → 决策 → 留证据 完整案例链:不是记住名词,而是能够用证据作出下一步决定
四步案例推演。手机上可左右滑动查看;每个箭头都代表一次需要证据支撑的状态转换。
阶段本步要做的决定什么算证据最常见的失败
形成上下文检查本轮是否提供了 2027 年正式校历上下文中存在可读取的原文与发布日期只有旧校历和用户问题
生成候选模型按语言模式预测后续 token输出流畅只代表序列概率较高把流畅度当成真实性
核验断言把日期、编号等事实逐项对照来源每个具体断言都有证据位置要求“认真回答”却不提供核验工具
表达边界证据不足时明确未知并说明获取路径结论强度不超过证据强度为了显得有帮助而补全一个日期

阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。

常见误解

在系统提示词中写“绝不幻觉”

实际上

可观察症状:模型仍会生成语法正确但无法证实的内容。

更可靠的修复:把事实查询接入可验证来源,并在输出前执行断言级校验。

案例工作坊 · 建议真正动手完成

25 分钟
  1. 把模型回答拆成“事实断言”和“解释性文字”。
  2. 为每条事实断言指定可接受的证据。
  3. 写一个证据不足时仍然有帮助的回答。
查看参考答案

LLM 的直接目标是生成合适的 token 序列,不是自动证明每个句子。可靠性来自上下文中的证据、外部核验和不确定性表达,而不是流畅或自信。

迁移检查:换一个场景还会不会

模型回答非常流畅,最稳妥的判断是什么?