智能体入门课
safe_adaptation_loop进阶85 分钟

9B

学习与适应:Agent 怎样变好而不是越改越坏

参考:来源 F · 第 9 章

学完你能做到

  • 区分上下文适应、记忆、检索、参数训练和系统改版
  • 设计有评估门槛的学习闭环
  • 避免把线上自修改误当成智能

“它记住了我的偏好”“它下一次答得更好”“模型被重新训练了”是三件不同的事。课程必须先把这些边界分清,否则团队会把数据库写入、提示词变化和模型学习混在一起。

变化发生在哪里例子是否改变模型参数主要风险
本轮上下文根据刚才的纠正重新回答会话结束后消失
长期记忆记住用户偏好先看中文解释错误记忆和隐私
知识库/RAG加入新版教材和答案过期、来源冲突
提示词或策略将常见错因加入诊断规则修好一类题却破坏另一类
微调/训练用标注轨迹更新模型数据污染、遗忘、成本
运行轨迹结果与反馈 提出改动记忆/规则/提示词 离线评估旧题+新题+红队 质量门提升且无退化 灰度发布可回滚 未通过:保留证据,修改候选方案
安全学习闭环:线上反馈先成为候选改动,必须经过离线验证和批准,不能直接改写生产行为。

个性化导师怎样真正学习

  1. 保存可验证事实:学生在哪个时间点选了什么、原文是什么、标准答案是什么。
  2. 从多题轨迹中提出假设:可能是弱读识别,而不是凭一道错题下结论。
  3. 用新材料验证迁移:如果只在原题做对,可能只是记住答案。
  4. 把验证后的能力标签写入学习档案,并给出过期时间和置信度。
  5. 新证据与旧判断冲突时降低置信度,而不是强行维护原结论。

设计一个不会乱学的导师

20 分钟
  1. 列出哪些数据可以自动写入学生档案,哪些必须由学生确认。
  2. 设计一套“旧能力不退化”的回归题。
  3. 写出删除错误记忆和撤销错误策略的入口。

案例推演:用户点了“不喜欢”,系统应该立刻改提示词吗

一个差评可能来自事实错误、语气偏好、界面误触或任务本身无解。若 Agent 自动把单次反馈写入全局规则,局部修复会伤害其他用户。

本节追问:反馈怎样经过归因、评估和发布才成为可靠学习? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。

每一步都要回答:看到了什么?为何这样决定?怎样证明? 1 收集证据 保留任务、输出、反馈与后续行为 观察 → 决策 → 留证据 2 归因分类 区分模型、检索、工具、规则和体验问题 观察 → 决策 → 留证据 3 生成改进 提出可测试的最小修改和预期影响 观察 → 决策 → 留证据 4 受控发布 离线评估、灰度、监控、回滚 观察 → 决策 → 留证据 完整案例链:不是记住名词,而是能够用证据作出下一步决定
四步案例推演。手机上可左右滑动查看;每个箭头都代表一次需要证据支撑的状态转换。
阶段本步要做的决定什么算证据最常见的失败
收集证据保留任务、输出、反馈与后续行为反馈能关联到具体版本和场景只统计赞踩总数
归因分类区分模型、检索、工具、规则和体验问题有人工抽样与可复核标签所有差评都归咎提示词
生成改进提出可测试的最小修改和预期影响改动对应明确失败模式直接累计更多禁止条款
受控发布离线评估、灰度、监控、回滚新旧版本在代表性任务上比较一条好案例就全量上线

阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。

常见误解

让线上 Agent 自行修改自己的核心规则

实际上

可观察症状:错误反馈、攻击和偶然样本被永久放大。

更可靠的修复:反馈进入隔离学习管线,经过数据治理、评估与发布审批。

案例工作坊 · 建议真正动手完成

25 分钟
  1. 为一次差评列出四种可能原因和区分证据。
  2. 设计十例回归集验证一个提示词修改。
  3. 写出灰度发布的停止与回滚指标。
查看参考答案

学习不是即时记住所有反馈,而是把反馈转成可验证假设,经评估后发布。在线执行系统与离线改进系统应隔离。

迁移检查:换一个场景还会不会

单个用户差评后最稳妥的第一步是?

检查一下

把新教材加入向量库属于哪种变化?

线上用户反馈后最安全的下一步是什么?