选型判断标准:从最简方案起步
本条目是「Prompt 2.0 方法论」的第 16 部分,对应学习清单条目 2.5.4。
前置依赖:ReAct框架、Plan-and-Execute框架、Reflexion框架
为以下铺垫:Skill Engineering、Loop Engineering
一、核心观点
选型判断标准:不是所有任务都需复杂框架,从最简方案起步。
用大炮打蚊子,蚊子没死,你先破产。能一次 LLM 调用解决的,就别上 Agent——复杂度是负债,不是勋章。
二、定义与原理(类比先行)
2.1 类比:出行选工具
下楼取快递,走路就行;跨城,高铁;出国,飞机。没人因为「喜欢飞机」就每天开飞机去楼下取快递。选框架也一样:按任务距离(复杂度)选,不为炫技。
2.2 选型决策树
flowchart TD Q[任务路径能预先规划?] -->|否: 路径不确定| R[ReAct] Q -->|是: 步骤清晰| P[Plan-and-Execute] P --> Q2[质量要求极高?] Q2 -->|是| PR[Plan-and-Execute + Reflexion] Q2 -->|否| P
三、选型原则
3.1 从最简方案起步(Anthropic 铁律)
| 方案 | 复杂度 | 适用场景 |
|---|---|---|
| 单次 LLM 调用 | 低 | 简单任务(问答、分类、生成) |
| ReAct | 中 | 路径不确定 |
| Plan-and-Execute | 中 | 步骤固定 |
| Plan-and-Execute + Reflexion | 高 | 质量敏感、需多轮迭代 |
3.2 不要过度设计
-
❌ 简单任务套复杂 Agent 框架;没需求就上 Reflexion;为用技术而用技术
-
✅ 简单任务用单次调用;路径不确定用 ReAct;步骤固定用 Plan-and-Execute;质量敏感用 Reflexion
3.3 架构-任务对齐(警惕多 Agent)
-
顺序推理任务上,盲目上多 Agent 反而降低 39–70% 性能(PlanCraft 等顺序规划任务上可降 70%)。
-
多 Agent 并非越多越好:当单 Agent 基线准确率已超约 45%,再加 Agent 边际收益趋零甚至为负;无验证的并行还会把错误放大 17.2 倍。
四、示例
-
简单任务(「Python 是什么?」):
answer = llm.generate(...)——不需要任何框架 -
中等任务(查天气):ReAct 循环即可
-
复杂任务(完整 API 文档):Plan-and-Execute + Reflexion
五、最新研究与企业数据(2024–2026)
-
Anthropic《Building Effective Agents》(2024-12):核心方法论即「从最简单的方案起步,只有当简单方案不够时才加复杂性」;许多任务一个带检索的 LLM 调用就够,不必默认上 Agent。
-
Google Research《Towards a Science of Scaling Agent Systems》(2025/2026):180 组受控实验给出量化法则——多 Agent 在顺序推理任务上性能下降 39–70%,但在可并行任务(金融分析)上集中式协调 +80.9%;并发现单 Agent 基线准确率超 45% 后,加 Agent 多无增益。这直接支撑「先简后繁、按任务性质选型」。
六、学习资源
-
权威指南:Anthropic《Building Effective Agents》
-
研究:Google《Towards a Science of Scaling Agent Systems》(arXiv:2512.08296)
核心要点
| 要点 | 速记 |
|---|---|
| 核心 | 从最简方案起步,不为炫技上框架 |
| 类比 | 取快递走路、出国才飞机 |
| 决策 | 路径不定→ReAct;步骤定→Plan;质量敏→+Reflexion |
| 警惕 | 顺序任务上多 Agent 反降 39–70%;单 Agent>45% 后加 Agent 无益 |
| 一手依据 | Anthropic:先简后繁;Google:顺序任务多 Agent -39~70% |
下一篇:Context Engineering——Prompt 2.0 讲完,进入 Context 层:Prompt 写得再好,上下文被污染也会失效。
参考来源(一手链接 · 可溯源深挖)
-
Anthropic (2024-12)《Building Effective Agents》:anthropic.com/engineering/building-effective-agents
-
Google Research (2025/2026)《Towards a Science of Scaling Agent Systems》:research.google/blog/towards-a-science-of-scaling-agent-systems(arXiv:2512.08296)
速记卡(面试闪卡)
Q1:一句话讲清「选型判断标准:从最简方案起步」到底是什么?
A:选型铁律:从最简方案起步,一次 LLM 调用能解决就别上 Agent——复杂度是负债,顺序任务上多 Agent 反降 39–70%。
Q2:核心观点:先简后繁 —— 怎么理解? —— 怎么理解?
A:选型判断标准的核心是”不是所有任务都需复杂框架,从最简方案起步”。生活类比:用大炮打蚊子,蚊子没死你先破产——能一次 LLM 调用解决的,就别上 Agent。复杂度是负债不是勋章,多一层抽象多一层维护和出错面。英文术语:simplicity first(先简后繁)、complexity as liability(复杂度即负债)。
Q3:出行类比 + 选型决策树 —— 怎么理解? —— 怎么理解?
A:选型像出行选工具:下楼取快递走路就行,跨城高铁,出国飞机——没人因”喜欢飞机”每天开飞机取快递。按任务距离(复杂度)选,不为炫技。决策树:路径不确定→ReAct;步骤清晰→Plan-and-Execute;质量敏感→再叠加 Reflexion。生活类比:短途别上高速,简单任务别上 Agent。英文术语:ReAct、Plan-and-Execute、Reflexion。
Q4:选型原则:警惕盲目多 Agent —— 怎么理解? —— 怎么理解?
A:研究给出量化法则:顺序推理任务上盲目上多 Agent 反而降 39–70%(PlanCraft 等可降 70%);单 Agent 基线准确率超 45% 后,加 Agent 边际收益趋零甚至为负;无验证的并行还会把错误放大 17.2 倍。生活类比:一个菜多个厨师抢着炒,反而炒砸。架构-任务要对齐。英文术语:multi-agent degradation(多 Agent 退化)、marginal return(边际收益)。
Q5:示例 + 研究佐证 —— 怎么理解? —— 怎么理解?
A:按复杂度对号入座:简单问答(“Python 是什么”)一次调用;查天气用 ReAct 循环;完整 API 文档用 Plan-and-Execute + Reflexion。Anthropic《Building Effective Agents》和 Google 180 组受控实验都支撑”先简后繁、按任务性质选型”——许多任务一个带检索的 LLM 调用就够,不必默认上 Agent。英文术语:controlled experiment(受控实验)、single LLM call(单次 LLM 调用)。
Q6:核心速记主线有哪些?
-
铁律:从最简方案起步,复杂度是负债
-
类比:取快递走路、出国才飞机,不为炫技
-
决策:路径不定→ReAct;步骤定→Plan;质量敏→+Reflexion
-
警惕:顺序任务多 Agent 反降 39–70%;单 Agent>45% 后无益
口诀
A:选型铁律要记牢,最简起步别花哨;
大炮打蚊反破产,复杂度是负债潮;
路径不定上 ReAct,步骤固定 Plan 跑;
顺序任务多 Agent 降,先简后繁才牢靠。
相关链接
-
系列清单:Agent 方法论与产品思维学习路线图
-
上一层级:Prompt 2.0 方法论 · 索引
-
同主题:ReAct 框架 · Plan-and-Execute 框架 · Reflexion 框架