做产品 PMaker 首页
搜索
跟随系统
颜色主题
空格的键盘
选能完成需求的最低复杂度确定性代码分支循环能写死就停在这模型调用只做判断或抽取就停在这Tool Loop下一步依赖中间结果才上Workflow有状态机与审批才上多 Agent要隔离或真并行才上每上一级都先回答:低一级为什么不够

上一级不是更好,只是更贵;先证明低一级不够再往上爬。

先问这件事要不要 Agent

不是所有用了大模型的项目都是 Agent。先走复杂度阶梯,选能完成需求的最低一级,并记下你拒绝了哪一级、为什么。

先选最低的一级。不是所有调用了大模型的项目都叫 Agent,也不是步骤一多就该拆成多 Agent。复杂度阶梯的用处,是逼你在往上爬之前先证明低一级不够——每上一级,你付的是 token、延迟、失败面和验证成本,换来的只是更多自主性,而自主性只在你能验证它的时候才值钱。

八个级别,从最低开始爬

  1. 确定性函数:分支、循环、错误处理能用普通代码写清楚。
  2. 单次模型调用:一段文本进,一段文本出,中间没有其他环节。
  3. 结构化模型调用:模型只负责判断或抽取,输出进 Schema。
  4. 单 Agent Tool Loop:下一步依赖中间结果,工具选择无法预先确定。
  5. 程序控制的 Workflow:有固定状态机,分支与终止条件可编码,需要审批与审计。
  6. 可恢复的耐久 Workflow:任务要跨天恢复、允许人工中断或需要严格重放。
  7. 多 Agent:子任务可并行、上下文应隔离、权限必须隔离,或评审需要独立视角。
  8. 分布式 Agent 系统:跨服务、跨团队部署,各自有独立生命周期与发布节奏。

用法不是从第一级往上评估八次,而是从第八级往下问「我真的需要它吗」,直到某一级的答案是「不能再降了」。

有大模型不等于 Agent

一个快速检验:把这次模型调用换成一个返回固定值的 stub,主干流程还能跑通吗?能跑通,说明模型只是流程里的一个零件,你在写第三级的代码,不是在造 Agent。

常见的误判是「项目里用了 LLM,所以是 Agent」。真正的分界在于谁决定下一步:下一步由你的代码写死,就是 workflow 里嵌了一次调用;下一步由模型根据工具结果自己决定,才算 agent langchain-what-is-agent。命名本身不重要,重要的是你按哪一级的方式去验证和运维——把第三级当第七级运维,你会为不存在的自主性付一整套 Gate 和回滚的成本。

这条分界不是某家框架的说法。Anthropic 的《Building Effective Agents》把 workflow 定义为「用预定义代码路径编排 LLM 与工具」、把 agent 定义为「模型自己决定流程与工具调用」,并建议大多数场景从最简单的可行模式开始,自主性只在收益可测时才加 anthropic-bea。OpenAI 的官方构建指南同样把「这个问题值不值得用 Agent」放在框架与实现之前 openai-agents-guide

第 0 级:已知意图不该过模型

阶梯最底下还有一层确定性前置,放在 LLM 之前拦截已知意图。

语义路由:为已知意图准备数百条参考语句(可以由 LLM 合成),向量化入库;新请求相似度过阈值就直接调用绑定工具,省掉「框架问模型 → 模型决定调工具 → 结果回填 → 再问模型」这一整轮往返。

语义缓存:请求与响应成对入库,相似请求直接返回缓存响应;官方建议问题、FAQ 可以预生成问答对提前入库。

Redis 的实测数据很直白:完整链路 13 秒、约 400 token,缓存命中后 345ms、0 token redis-semantic-routing

三个坑要提前处理。阈值必须用测试数据跑基准校准,不能拍脑袋。长请求按句分块匹配,用户会把真实意图埋在闲聊里。最危险的是否定敏感:「X 是什么」和「X 不是什么」在通用 embedding 里距离极近,语义缓存会返回相反答案,高风险场景要换否定敏感的模型或加一层校验。另外,这两种模式只在意图集合相对收敛时成立,开放域问答上它不是银弹。

多步骤不等于多 Agent

流程有八个步骤,不代表需要八个 Agent。步骤多属于第五级:确定性 Workflow。只有在子任务能明显并行、上下文需要隔离、权限必须隔离,或者评审需要独立视角且有可测收益时,才考虑往第七级走。多个 Tool 也不等于多 Agent——同一个 Agent 挂十个工具,仍然是单一上下文、单一责任主体。

把决策记下来

每次选型记录三件事:选中哪一级、拒绝了哪些更高级、理由是什么。这条记录的价值在三个月后体现:模型升级时,你才分得清当时卡住的是能力不足还是设计偷懒。

还有一层校准值得做。淘天团队的复盘给出一个更冷静的比例:生码只占研发链路的 20%–30%,决定端到端周期的是需求流转、评审、联调等待这些环节 taotian-loop。把最复杂的那一级押在编码上,未必撬动最大收益——先量出瓶颈在哪,再决定在哪一级投入。

参考资料

  1. Reduce LLM calls with vector search design patterns
  2. What is an agent?
  3. Building Effective Agents
  4. A Practical Guide to Building Agents
  5. 淘天集团 AI 研发提效:从单点工具到研发链路闭环