1
从工作流到 Agent:到底是谁决定下一步
参考:来源 A · Google
学完你能做到
- 说清 agent 和"直接问大模型"的区别
- 判断一个具体的产品算不算 agent
- 理解为什么 agent 不是一个开关而是一个程度
Agent 是什么
先建立直觉
你让助理"帮我订下周去北京的机票"。
不是 agent 的做法:助理说"好的,请告诉我具体日期、航班号、舱位、乘机人身份证号",你说一句他做一步。
是 agent 的做法:助理自己去查你的日历确认哪天有空,自己去查有哪些航班,发现你常坐的那家没票了,自己换一家查,最后回来说"订好了,周三早上八点"。
区别不在于谁更聪明,在于中间那些步骤是谁决定的。
先别急着用 Agent:聊天、工作流和 Agent 分别解决什么
“能不能做成一个聊天框?”是很好的起点。聊天框适合人每一步都愿意参与的事:解释概念、改一段文字、一起头脑风暴。它的优点是直接、可控、成本低;它并不比 Agent 落后。
当步骤是固定的,例如“上传发票 → 提取字段 → 生成报表”,应先用工作流:人把每一步写清楚,程序稳定地按顺序跑。只有当下一步必须看现场情况才能决定,例如研究资料、排查线上故障、在多个工具间反复核对,才让 Agent 在明确边界内选择下一步。
和直接问大模型差在哪:四条
这张表来自 Google 白皮书,是全篇最值得背下来的内容。左边是你直接调 API 问一句大模型,右边是 agent。
| 比什么 | 直接问大模型 | Agent |
|---|---|---|
| 知道多少 | 只知道训练时看过的东西 | 能通过连到外部系统,知识可以延伸出去 |
| 记不记得 | 问一句答一句。除非你自己实现,否则它不记得上一句 | 有管理好的会话历史,支持多轮。每一轮 = 一个输入加一个回应 |
| 能不能动手 | 没有原生的工具能力 | 工具是架构里自带的 |
| 会不会规划 | 没有原生的逻辑层。你只能靠提示词硬凑 | 内建,用 、 这类框架来推理 |
注意第二行:"记不记得"这件事,普通调用是可以自己实现的——只要每次把历史都重发一遍。
常见误解
Agent 就是更聪明的大模型。
实际上
完全不是。agent 用的还是同一个模型,聪明程度没变。变的是它外面那圈代码——给了它工具、给了它记忆、给了它循环的能力。
打个比方:同一个人,给他一台电脑和一部电话,他能做的事就多了。但他本人的智力没有变化。
案例推演:固定审批流何时应该让出下一步决定权
普通请假只需固定表单和审批;但“跨国研究合作申请”材料差异很大,系统需要根据缺失文件、金额和合规地区选择不同检查。
本节追问:任务中哪部分适合 Workflow,哪部分需要 Agent? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。
| 阶段 | 本步要做的决定 | 什么算证据 | 最常见的失败 |
|---|---|---|---|
| 找稳定路径 | 把登录、提交、签字和归档写成固定流程 | 步骤与规则长期稳定且可枚举 | 为了时髦把所有步骤交给模型 |
| 找开放决策 | 识别材料解释、追问和工具选择 | 下一步依赖非结构化内容与新观察 | 用数百条 if/else 穷举文本差异 |
| 组合控制 | Workflow 包住合规边界,Agent 处理开放子任务 | Agent 只能在允许节点与工具内行动 | Agent 可以跳过强制审批 |
| 测量升级 | 只有固定流程无法覆盖时才增加自主性 | 比较完成率、异常率和维护成本 | 默认自主性越高越先进 |
阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。
常见误解
把整个审批系统改成自由 Agent
实际上
可观察症状:路径难以预测,强制规则可能被绕过。
更可靠的修复:采用“确定性骨架 + 局部 Agent 决策”,逐段开放自主权。
案例工作坊 · 建议真正动手完成
25 分钟- 把申请流程画成固定节点和开放节点。
- 为一个开放节点列出允许工具与停止条件。
- 说明何种指标证明 Agent 比新增规则更合算。
查看参考答案
Workflow 由代码预先决定路径;Agent 根据上下文和观察决定下一步。现实系统常将两者组合,而不是二选一。
迁移检查:换一个场景还会不会
哪项最适合保留为确定性 Workflow?
检查一下
一个程序:接收用户问题 → 调用大模型生成 SQL → 执行 SQL → 把结果给大模型总结 → 返回。它是 agent 吗?