选型判断标准:从最简方案起步

本条目是「Prompt 2.0 方法论」的第 16 部分,对应学习清单条目 2.5.4。

前置依赖:ReAct框架、Plan-and-Execute框架、Reflexion框架

为以下铺垫:Skill Engineering、Loop Engineering


一、核心观点

选型判断标准:不是所有任务都需复杂框架,从最简方案起步。

用大炮打蚊子,蚊子没死,你先破产。能一次 LLM 调用解决的,就别上 Agent——复杂度是负债,不是勋章。


二、定义与原理(类比先行)

2.1 类比:出行选工具

下楼取快递,走路就行;跨城,高铁;出国,飞机。没人因为「喜欢飞机」就每天开飞机去楼下取快递。选框架也一样:按任务距离(复杂度)选,不为炫技。

2.2 选型决策树


flowchart TD

    Q[任务路径能预先规划?] -->|否: 路径不确定| R[ReAct]

    Q -->|是: 步骤清晰| P[Plan-and-Execute]

    P --> Q2[质量要求极高?]

    Q2 -->|是| PR[Plan-and-Execute + Reflexion]

    Q2 -->|否| P


三、选型原则

3.1 从最简方案起步(Anthropic 铁律)

方案复杂度适用场景
单次 LLM 调用简单任务(问答、分类、生成)
ReAct路径不确定
Plan-and-Execute步骤固定
Plan-and-Execute + Reflexion质量敏感、需多轮迭代

3.2 不要过度设计

  • ❌ 简单任务套复杂 Agent 框架;没需求就上 Reflexion;为用技术而用技术

  • ✅ 简单任务用单次调用;路径不确定用 ReAct;步骤固定用 Plan-and-Execute;质量敏感用 Reflexion

3.3 架构-任务对齐(警惕多 Agent)

  • 顺序推理任务上,盲目上多 Agent 反而降低 39–70% 性能(PlanCraft 等顺序规划任务上可降 70%)。

  • 多 Agent 并非越多越好:当单 Agent 基线准确率已超约 45%,再加 Agent 边际收益趋零甚至为负;无验证的并行还会把错误放大 17.2 倍


四、示例

  • 简单任务(「Python 是什么?」):answer = llm.generate(...)——不需要任何框架

  • 中等任务(查天气):ReAct 循环即可

  • 复杂任务(完整 API 文档):Plan-and-Execute + Reflexion


五、最新研究与企业数据(2024–2026)

  • Anthropic《Building Effective Agents》(2024-12):核心方法论即「从最简单的方案起步,只有当简单方案不够时才加复杂性」;许多任务一个带检索的 LLM 调用就够,不必默认上 Agent。

  • Google Research《Towards a Science of Scaling Agent Systems》(2025/2026):180 组受控实验给出量化法则——多 Agent 在顺序推理任务上性能下降 39–70%,但在可并行任务(金融分析)上集中式协调 +80.9%;并发现单 Agent 基线准确率超 45% 后,加 Agent 多无增益。这直接支撑「先简后繁、按任务性质选型」。


六、学习资源

  • 权威指南:Anthropic《Building Effective Agents》

  • 研究:Google《Towards a Science of Scaling Agent Systems》(arXiv:2512.08296)

  • 进阶Context Engineering · ReAct 框架


核心要点

要点速记
核心从最简方案起步,不为炫技上框架
类比取快递走路、出国才飞机
决策路径不定→ReAct;步骤定→Plan;质量敏→+Reflexion
警惕顺序任务上多 Agent 反降 39–70%;单 Agent>45% 后加 Agent 无益
一手依据Anthropic:先简后繁;Google:顺序任务多 Agent -39~70%

下一篇Context Engineering——Prompt 2.0 讲完,进入 Context 层:Prompt 写得再好,上下文被污染也会失效。


参考来源(一手链接 · 可溯源深挖)

速记卡(面试闪卡)

Q1:一句话讲清「选型判断标准:从最简方案起步」到底是什么?

A:选型铁律:从最简方案起步,一次 LLM 调用能解决就别上 Agent——复杂度是负债,顺序任务上多 Agent 反降 39–70%。

Q2:核心观点:先简后繁 —— 怎么理解? —— 怎么理解?

A:选型判断标准的核心是”不是所有任务都需复杂框架,从最简方案起步”。生活类比:用大炮打蚊子,蚊子没死你先破产——能一次 LLM 调用解决的,就别上 Agent。复杂度是负债不是勋章,多一层抽象多一层维护和出错面。英文术语:simplicity first(先简后繁)、complexity as liability(复杂度即负债)。

Q3:出行类比 + 选型决策树 —— 怎么理解? —— 怎么理解?

A:选型像出行选工具:下楼取快递走路就行,跨城高铁,出国飞机——没人因”喜欢飞机”每天开飞机取快递。按任务距离(复杂度)选,不为炫技。决策树:路径不确定→ReAct;步骤清晰→Plan-and-Execute;质量敏感→再叠加 Reflexion。生活类比:短途别上高速,简单任务别上 Agent。英文术语:ReAct、Plan-and-Execute、Reflexion。

Q4:选型原则:警惕盲目多 Agent —— 怎么理解? —— 怎么理解?

A:研究给出量化法则:顺序推理任务上盲目上多 Agent 反而降 39–70%(PlanCraft 等可降 70%);单 Agent 基线准确率超 45% 后,加 Agent 边际收益趋零甚至为负;无验证的并行还会把错误放大 17.2 倍。生活类比:一个菜多个厨师抢着炒,反而炒砸。架构-任务要对齐。英文术语:multi-agent degradation(多 Agent 退化)、marginal return(边际收益)。

Q5:示例 + 研究佐证 —— 怎么理解? —— 怎么理解?

A:按复杂度对号入座:简单问答(“Python 是什么”)一次调用;查天气用 ReAct 循环;完整 API 文档用 Plan-and-Execute + Reflexion。Anthropic《Building Effective Agents》和 Google 180 组受控实验都支撑”先简后繁、按任务性质选型”——许多任务一个带检索的 LLM 调用就够,不必默认上 Agent。英文术语:controlled experiment(受控实验)、single LLM call(单次 LLM 调用)。

Q6:核心速记主线有哪些?

  • 铁律:从最简方案起步,复杂度是负债

  • 类比:取快递走路、出国才飞机,不为炫技

  • 决策:路径不定→ReAct;步骤定→Plan;质量敏→+Reflexion

  • 警惕:顺序任务多 Agent 反降 39–70%;单 Agent>45% 后无益

口诀

A:选型铁律要记牢,最简起步别花哨;

大炮打蚊反破产,复杂度是负债潮;

路径不定上 ReAct,步骤固定 Plan 跑;

顺序任务多 Agent 降,先简后繁才牢靠。

相关链接