智能体入门课
what_is_an_agent零基础55 分钟

1

从工作流到 Agent:到底是谁决定下一步

参考:来源 A · Google

学完你能做到

  • 说清 agent 和"直接问大模型"的区别
  • 判断一个具体的产品算不算 agent
  • 理解为什么 agent 不是一个开关而是一个程度

Agent 是什么

先建立直觉

你让助理"帮我订下周去北京的机票"。

不是 agent 的做法:助理说"好的,请告诉我具体日期、航班号、舱位、乘机人身份证号",你说一句他做一步。

是 agent 的做法:助理自己去查你的日历确认哪天有空,自己去查有哪些航班,发现你常坐的那家没票了,自己换一家查,最后回来说"订好了,周三早上八点"。

区别不在于谁更聪明,在于中间那些步骤是谁决定的

先别急着用 Agent:聊天、工作流和 Agent 分别解决什么

“能不能做成一个聊天框?”是很好的起点。聊天框适合人每一步都愿意参与的事:解释概念、改一段文字、一起头脑风暴。它的优点是直接、可控、成本低;它并不比 Agent 落后。

当步骤是固定的,例如“上传发票 → 提取字段 → 生成报表”,应先用工作流:人把每一步写清楚,程序稳定地按顺序跑。只有当下一步必须看现场情况才能决定,例如研究资料、排查线上故障、在多个工具间反复核对,才让 Agent 在明确边界内选择下一步。

对话框人主导每一轮 LLM解释 · 写作 · 共同判断 工作流程序主导固定顺序 ABC表单 · 审批 · 批量处理 Agent模型在权限内决定下一步 判断研究 · 排障 · 开放式任务
选择原则:不是“能用 Agent 就用 Agent”,而是把决定权放在真正需要它的地方。

和直接问大模型差在哪:四条

这张表来自 Google 白皮书,是全篇最值得背下来的内容。左边是你直接调 API 问一句大模型,右边是 agent。

比什么直接问大模型Agent
知道多少只知道训练时看过的东西能通过连到外部系统,知识可以延伸出去
记不记得问一句答一句。除非你自己实现,否则它不记得上一句有管理好的会话历史,支持多轮。每一轮 = 一个输入加一个回应
能不能动手没有原生的工具能力工具是架构里自带的
会不会规划没有原生的逻辑层。你只能靠提示词硬凑内建,用 这类框架来推理

注意第二行:"记不记得"这件事,普通调用是可以自己实现的——只要每次把历史都重发一遍。

常见误解

Agent 就是更聪明的大模型。

实际上

完全不是。agent 用的还是同一个模型,聪明程度没变。变的是它外面那圈代码——给了它工具、给了它记忆、给了它循环的能力。

打个比方:同一个人,给他一台电脑和一部电话,他能做的事就多了。但他本人的智力没有变化。

案例推演:固定审批流何时应该让出下一步决定权

普通请假只需固定表单和审批;但“跨国研究合作申请”材料差异很大,系统需要根据缺失文件、金额和合规地区选择不同检查。

本节追问:任务中哪部分适合 Workflow,哪部分需要 Agent? 先不要急着看结论。沿着下面四步,逐项区分输入、决策、证据和失败信号。

每一步都要回答:看到了什么?为何这样决定?怎样证明? 1 找稳定路径 把登录、提交、签字和归档写成固定流程 观察 → 决策 → 留证据 2 找开放决策 识别材料解释、追问和工具选择 观察 → 决策 → 留证据 3 组合控制 Workflow 包住合规边界,Agent… 观察 → 决策 → 留证据 4 测量升级 只有固定流程无法覆盖时才增加自主性 观察 → 决策 → 留证据 完整案例链:不是记住名词,而是能够用证据作出下一步决定
四步案例推演。手机上可左右滑动查看;每个箭头都代表一次需要证据支撑的状态转换。
阶段本步要做的决定什么算证据最常见的失败
找稳定路径把登录、提交、签字和归档写成固定流程步骤与规则长期稳定且可枚举为了时髦把所有步骤交给模型
找开放决策识别材料解释、追问和工具选择下一步依赖非结构化内容与新观察用数百条 if/else 穷举文本差异
组合控制Workflow 包住合规边界,Agent 处理开放子任务Agent 只能在允许节点与工具内行动Agent 可以跳过强制审批
测量升级只有固定流程无法覆盖时才增加自主性比较完成率、异常率和维护成本默认自主性越高越先进

阅读方式:先遮住后两列自己回答,再用“证据”和“失败”两列检查理解。

常见误解

把整个审批系统改成自由 Agent

实际上

可观察症状:路径难以预测,强制规则可能被绕过。

更可靠的修复:采用“确定性骨架 + 局部 Agent 决策”,逐段开放自主权。

案例工作坊 · 建议真正动手完成

25 分钟
  1. 把申请流程画成固定节点和开放节点。
  2. 为一个开放节点列出允许工具与停止条件。
  3. 说明何种指标证明 Agent 比新增规则更合算。
查看参考答案

Workflow 由代码预先决定路径;Agent 根据上下文和观察决定下一步。现实系统常将两者组合,而不是二选一。

迁移检查:换一个场景还会不会

哪项最适合保留为确定性 Workflow?

检查一下

一个程序:接收用户问题 → 调用大模型生成 SQL → 执行 SQL → 把结果给大模型总结 → 返回。它是 agent 吗?