feedback_governance_lab进阶约 95 分钟
9B-实验
适应实验室:反馈怎样变成可发布的系统改进
参考:来源 F · 第 9 章进阶
学完你能做到
- 建立反馈数据生命周期
- 区分个体适应和全局策略更新
- 掌握离线评估、灰度、监控与回滚
学习系统最难的不是“收集反馈”,而是判断反馈代表什么。一次点赞可能表示答案正确,也可能只表示语气舒服;一次改写可能是用户偏好,也可能是在纠正事实。因此必须把反馈变成带来源、对象、置信度和有效期的数据。
| 反馈信号 | 能说明什么 | 不能直接说明什么 | 处理方式 |
|---|---|---|---|
| 明确纠正 | 用户认为某处错误 | 用户一定正确 | 保存原答案、纠正和证据,待验证 |
| 选择/点击 | 用户在多个选项中偏好一个 | 偏好原因 | 作为弱信号聚合,不单独改策略 |
| 任务结果 | 动作是否达到业务目标 | 失败归因 | 连接完整轨迹与环境状态 |
| 教师标注 | 高质量领域判断 | 对所有用户都适用 | 进入带版本的训练/评估数据 |
| 模型自评 | 潜在缺陷线索 | 真实质量 | 只作候选信号,必须外部验证 |
哪一层可以自动改变
| 改变层 | 典型作用域 | 可否自动 | 最低保护 |
|---|---|---|---|
| 会话状态 | 当前任务 | 通常可以 | 不越过目标和权限 |
| 用户偏好记忆 | 单个用户 | 低风险项可建议写入 | 可见、可编辑、可删除 |
| 检索知识 | 一组用户 | 需要来源流程 | 版本、有效期、冲突策略 |
| 系统提示词/路由 | 全部用户 | 不应直接自动 | 离线回归、灰度、回滚 |
| 模型参数/代码 | 全部能力 | 最高风险 | 隔离训练、完整评测和人工批准 |
反馈治理设计
30 分钟- 为听力导师列出五种反馈信号,并标注强弱。
- 选择一个可自动写入的个体偏好和一个必须审核的全局策略。
- 设计离线、影子流量、1% 灰度三个阶段的指标与回滚阈值。
综合演算:把 200 条失败反馈变成一次安全发布
团队收集到“引用错误、答案太长、工具超时、拒绝过多”等混合反馈。需要从聚类、抽样、根因到评估集和灰度发布走完整闭环。
本节追问:怎样证明改进不是只对反馈样本过拟合? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。
| 阶段 | 本步要做的决定 | 什么算证据 | 最常见的失败 |
|---|---|---|---|
| 建失败谱 | 按任务、严重度、组件和用户影响分层 | 类别覆盖率与代表样本可查看 | 让模型随意总结成三个主题 |
| 选择干预 | 针对根因分别改检索、工具、提示或 UI | 每项改动有因果假设 | 一个大改动同时改变所有组件 |
| 构建评估 | 反馈样本、留出样本、反例和安全集并测 | 主指标提升且护栏不退化 | 只在原 200 条上测到满分 |
| 灰度发布 | 小流量观察真实分布并准备回滚 | 指标按版本和类别拆分 | 全量后才发现拒答暴增 |
阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。
常见误解
用模型给自己的改动打分
实际上
可观察症状:评价偏差与生成偏差相关,可能共同漏错。
更可靠的修复:结合确定性检查、独立评审、人类抽样和线上行为指标。
案例工作坊 · 建议真正动手完成
25 分钟- 把四类反馈各选十条做分层样本。
- 为引用错误设计两个结果指标和两个护栏指标。
- 写一份从 5% 到 100% 的发布门槛。
查看参考答案
可靠改进要建立从反馈到根因、从干预到独立评估、从灰度到回滚的证据链,并用留出集防止只记住旧错误。
迁移检查:换一个场景还会不会
为什么必须保留留出评估集?