智能体入门课
research_discovery_lab进阶95 分钟

9D-实验

专题研究实验室:假设图、证据矩阵与研究型多 Agent

参考:来源 F · 第 21 章进阶

学完你能做到

  • 把开放问题变成可检验假设
  • 建立证据矩阵和冲突处理
  • 设计研究型多 Agent 与停止规则

专题研究最容易制造“看起来很努力”的假象:开很多搜索、堆很多链接、写很长总结。真正的研究过程必须让每次检索服务于一个问题:它支持、反驳还是区分哪个假设?

为什么学生听不到答案句? H1 声音识别失败弱读 / 连读 / 尾音 H2 语义边界错误否定 / 转折 / 指代 H3 信息保持失败听到但快速遗忘 无字幕复述声音区分“没听到” 给文本再判断答案区分“听到没理解” 分段与整段对照区分“保持失败” 新材料复测:只有可迁移结果才更新能力画像
假设图:不要只寻找支持主假设的材料,必须主动保留竞争解释和能够区分它们的关键测试。
证据项支持 H1支持 H2支持 H3可靠性
能看懂文本但无字幕听不出直接对照
逐句能答对,整段答错需要控制题目难度
把 if 漏听成确定事实需查看原音频位置
只在原题复听后做对未知未知未知不能证明迁移

矩阵的价值是暴露“证据不足”和“一个证据支持多个解释”,避免过早下结论。

研究型多 Agent 不是按角色过家家

研究监督者问题 / 预算 / 停止条件 检索 Agent找来源与反例 分析 Agent更新假设矩阵 验证 Agent读原文与查冲突 综合 Agent结论与未知 共享证据板来源片段 · 页码/时间戳 · 假设关系 · 冲突 · 置信度
研究团队围绕共享证据板协作。监督者管理问题和预算,验证者有权否决没有原文支持的结论。
研究停止函数
stop = (required_dimensions_covered
        and decisive_uncertainties_below_threshold
        and no_unresolved_high_impact_conflict)
       or marginal_information_gain < minimum
       or budget.exhausted()

return {supported_findings, competing_explanations, unknowns, next_tests}

完成一张研究工作纸

30 分钟
  1. 选择一个学习问题,写三个竞争假设。
  2. 建立至少五行证据矩阵,并标出可靠性和冲突。
  3. 分配检索、验证、综合角色,定义共享证据对象与停止条件。

综合演算:用证据矩阵完成一次可审计专题研究

任务是判断“学校是否应全面禁止学生使用生成式 AI”。政策、学习效果、作弊、可及性和隐私证据相互冲突,简单列正反观点无法支持决策。

本节追问:怎样把价值冲突、事实证据与政策选项分开? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。

每一步都要回答:看到了什么?为何这样决定?怎样证明? 1 拆决策 列目标、利益相关者、可选政策和评价指标 观察 → 决策 → 留证据 2 建证据矩阵 每项主张记录来源、方法、适用范围与反证 观察 → 决策 → 留证据 3 并行研究 子 Agent 按独立证据主题工作并共享术… 观察 → 决策 → 留证据 4 综合选项 说明不同条件下各政策的收益、风险与未知 观察 → 决策 → 留证据 完整案例链:不是记住名词,而是能够用证据作出下一步决定
四步案例推演。手机上可左右滑动查看;每个箭头都代表一次需要证据支撑的状态转换。
阶段本步要做的决定什么算证据最常见的失败
拆决策列目标、利益相关者、可选政策和评价指标事实问题与价值取舍分别记录把个人立场写成事实结论
建证据矩阵每项主张记录来源、方法、适用范围与反证空白和冲突一眼可见只保存链接和一句摘要
并行研究子 Agent 按独立证据主题工作并共享术语标准交付结构一致且来源可核验按赞成/反对分工造成确认偏差
综合选项说明不同条件下各政策的收益、风险与未知建议与证据强度匹配强行输出唯一确定答案

阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。

常见误解

让一个“赞成 Agent”和一个“反对 Agent”辩论

实际上

可观察症状:角色立场鼓励挑证据,未必覆盖真实决策维度。

更可靠的修复:按证据领域与方法分工,再由独立综合器检查覆盖和冲突。

案例工作坊 · 建议真正动手完成

25 分钟
  1. 建立至少八行的政策证据矩阵。
  2. 标出三个事实未知和两个价值取舍。
  3. 写出带适用条件的三档政策建议。
查看参考答案

复杂专题研究应把问题结构、证据质量、适用范围和价值权衡分开。多 Agent 按证据域并行比按立场对抗更不易放大确认偏差。

迁移检查:换一个场景还会不会

政策证据矩阵中最不应缺少的是?