智能体入门课
feedback_governance_lab进阶95 分钟

9B-实验

适应实验室:反馈怎样变成可发布的系统改进

参考:来源 F · 第 9 章进阶

学完你能做到

  • 建立反馈数据生命周期
  • 区分个体适应和全局策略更新
  • 掌握离线评估、灰度、监控与回滚

学习系统最难的不是“收集反馈”,而是判断反馈代表什么。一次点赞可能表示答案正确,也可能只表示语气舒服;一次改写可能是用户偏好,也可能是在纠正事实。因此必须把反馈变成带来源、对象、置信度和有效期的数据。

反馈信号能说明什么不能直接说明什么处理方式
明确纠正用户认为某处错误用户一定正确保存原答案、纠正和证据,待验证
选择/点击用户在多个选项中偏好一个偏好原因作为弱信号聚合,不单独改策略
任务结果动作是否达到业务目标失败归因连接完整轨迹与环境状态
教师标注高质量领域判断对所有用户都适用进入带版本的训练/评估数据
模型自评潜在缺陷线索真实质量只作候选信号,必须外部验证
原始轨迹输入/动作/结果 反馈归因错在哪里/谁判断 清洗与分层个体/群体/全局 候选改动记忆/规则/模型 评估与发布回归/灰度/回滚 全程保留:来源、时间、权限、版本、可删除性 上线结果成为新证据,但不能覆盖旧轨迹
反馈数据生命周期。原始轨迹不能直接变成生产规则,中间必须经过归因、清洗、分层和评估。

哪一层可以自动改变

改变层典型作用域可否自动最低保护
会话状态当前任务通常可以不越过目标和权限
用户偏好记忆单个用户低风险项可建议写入可见、可编辑、可删除
检索知识一组用户需要来源流程版本、有效期、冲突策略
系统提示词/路由全部用户不应直接自动离线回归、灰度、回滚
模型参数/代码全部能力最高风险隔离训练、完整评测和人工批准
离线评估质量/安全/成本 影子流量不影响用户 1% 灰度受控人群 10% → 50% → 100%逐级观察 自动回滚触发器错误率↑ / 质量↓ / 成本失控 / 安全事件 回到稳定版本
灰度发布不是一次性开关,而是逐步扩大流量;任何关键指标恶化都自动回到上一稳定版本。

反馈治理设计

30 分钟
  1. 为听力导师列出五种反馈信号,并标注强弱。
  2. 选择一个可自动写入的个体偏好和一个必须审核的全局策略。
  3. 设计离线、影子流量、1% 灰度三个阶段的指标与回滚阈值。

综合演算:把 200 条失败反馈变成一次安全发布

团队收集到“引用错误、答案太长、工具超时、拒绝过多”等混合反馈。需要从聚类、抽样、根因到评估集和灰度发布走完整闭环。

本节追问:怎样证明改进不是只对反馈样本过拟合? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。

每一步都要回答:看到了什么?为何这样决定?怎样证明? 1 建失败谱 按任务、严重度、组件和用户影响分层 观察 → 决策 → 留证据 2 选择干预 针对根因分别改检索、工具、提示或 UI 观察 → 决策 → 留证据 3 构建评估 反馈样本、留出样本、反例和安全集并测 观察 → 决策 → 留证据 4 灰度发布 小流量观察真实分布并准备回滚 观察 → 决策 → 留证据 完整案例链:不是记住名词,而是能够用证据作出下一步决定
四步案例推演。手机上可左右滑动查看;每个箭头都代表一次需要证据支撑的状态转换。
阶段本步要做的决定什么算证据最常见的失败
建失败谱按任务、严重度、组件和用户影响分层类别覆盖率与代表样本可查看让模型随意总结成三个主题
选择干预针对根因分别改检索、工具、提示或 UI每项改动有因果假设一个大改动同时改变所有组件
构建评估反馈样本、留出样本、反例和安全集并测主指标提升且护栏不退化只在原 200 条上测到满分
灰度发布小流量观察真实分布并准备回滚指标按版本和类别拆分全量后才发现拒答暴增

阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。

常见误解

用模型给自己的改动打分

实际上

可观察症状:评价偏差与生成偏差相关,可能共同漏错。

更可靠的修复:结合确定性检查、独立评审、人类抽样和线上行为指标。

案例工作坊 · 建议真正动手完成

25 分钟
  1. 把四类反馈各选十条做分层样本。
  2. 为引用错误设计两个结果指标和两个护栏指标。
  3. 写一份从 5% 到 100% 的发布门槛。
查看参考答案

可靠改进要建立从反馈到根因、从干预到独立评估、从灰度到回滚的证据链,并用留出集防止只记住旧错误。

迁移检查:换一个场景还会不会

为什么必须保留留出评估集?