safe_adaptation_loop进阶约 85 分钟
9B
学习与适应:Agent 怎样变好而不是越改越坏
参考:来源 F · 第 9 章
学完你能做到
- 区分上下文适应、记忆、检索、参数训练和系统改版
- 设计有评估门槛的学习闭环
- 避免把线上自修改误当成智能
“它记住了我的偏好”“它下一次答得更好”“模型被重新训练了”是三件不同的事。课程必须先把这些边界分清,否则团队会把数据库写入、提示词变化和模型学习混在一起。
| 变化发生在哪里 | 例子 | 是否改变模型参数 | 主要风险 |
|---|---|---|---|
| 本轮上下文 | 根据刚才的纠正重新回答 | 否 | 会话结束后消失 |
| 长期记忆 | 记住用户偏好先看中文解释 | 否 | 错误记忆和隐私 |
| 知识库/RAG | 加入新版教材和答案 | 否 | 过期、来源冲突 |
| 提示词或策略 | 将常见错因加入诊断规则 | 否 | 修好一类题却破坏另一类 |
| 微调/训练 | 用标注轨迹更新模型 | 是 | 数据污染、遗忘、成本 |
个性化导师怎样真正学习
- 保存可验证事实:学生在哪个时间点选了什么、原文是什么、标准答案是什么。
- 从多题轨迹中提出假设:可能是弱读识别,而不是凭一道错题下结论。
- 用新材料验证迁移:如果只在原题做对,可能只是记住答案。
- 把验证后的能力标签写入学习档案,并给出过期时间和置信度。
- 新证据与旧判断冲突时降低置信度,而不是强行维护原结论。
设计一个不会乱学的导师
20 分钟- 列出哪些数据可以自动写入学生档案,哪些必须由学生确认。
- 设计一套“旧能力不退化”的回归题。
- 写出删除错误记忆和撤销错误策略的入口。
案例推演:用户点了“不喜欢”,系统应该立刻改提示词吗
一个差评可能来自事实错误、语气偏好、界面误触或任务本身无解。若 Agent 自动把单次反馈写入全局规则,局部修复会伤害其他用户。
本节追问:反馈怎样经过归因、评估和发布才成为可靠学习? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。
| 阶段 | 本步要做的决定 | 什么算证据 | 最常见的失败 |
|---|---|---|---|
| 收集证据 | 保留任务、输出、反馈与后续行为 | 反馈能关联到具体版本和场景 | 只统计赞踩总数 |
| 归因分类 | 区分模型、检索、工具、规则和体验问题 | 有人工抽样与可复核标签 | 所有差评都归咎提示词 |
| 生成改进 | 提出可测试的最小修改和预期影响 | 改动对应明确失败模式 | 直接累计更多禁止条款 |
| 受控发布 | 离线评估、灰度、监控、回滚 | 新旧版本在代表性任务上比较 | 一条好案例就全量上线 |
阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。
常见误解
让线上 Agent 自行修改自己的核心规则
实际上
可观察症状:错误反馈、攻击和偶然样本被永久放大。
更可靠的修复:反馈进入隔离学习管线,经过数据治理、评估与发布审批。
案例工作坊 · 建议真正动手完成
25 分钟- 为一次差评列出四种可能原因和区分证据。
- 设计十例回归集验证一个提示词修改。
- 写出灰度发布的停止与回滚指标。
查看参考答案
学习不是即时记住所有反馈,而是把反馈转成可验证假设,经评估后发布。在线执行系统与离线改进系统应隔离。
迁移检查:换一个场景还会不会
单个用户差评后最稳妥的第一步是?
检查一下
把新教材加入向量库属于哪种变化?
线上用户反馈后最安全的下一步是什么?