主流 Agent 开发框架如何选型
Agent 的裸循环(思考-行动-观察)百行代码就能实现,但生产 Agent 需要的状态管理、工具编排、记忆、可观测把人劝退——于是框架应运而生。LangGraph、AutoGen、CrewAI、Dify 各占一方,选型成了新问题。本文给出一张对比地图和按场景的选型路径。
四类编排哲学
LangGraph(图状态机):把 Agent 流程建模为节点(步骤)+ 边(转移)的有向图,状态显式传递,支持循环、分支、人工介入点(interrupt)。哲学=流程即代码,可控性优先。适合:多步骤业务流(审批、多阶段数据处理)、需要确定性与可恢复性的场景。
AutoGen / AG2(多智能体对话):Agent 之间以”对话”协作(ConversationPattern),一个 Agent 的输出是另一个的输入,靠角色设定分工。哲学=协作即对话。适合:研究类、辩论式推理、代码生成+评审双人组等”多角色互评”场景。
CrewAI(角色团队):更高层抽象:定义 Role(角色)、Task(任务)、Crew(团队)与流程(顺序/层级),上手最快。哲学=组织架构隐喻。适合:内容生产流水线(调研→写作→编辑)、快速验证多角色协作想法。
Dify / Coze(低代码平台):可视化画布编排 LLM+工具+知识库,内置 RAG 与发布渠道。哲学=配置即应用。适合:业务团队自助搭建客服/问答类 Agent、不想维护代码栈的场景。
对比维度表
| 维度 | LangGraph | AutoGen | CrewAI | Dify/Coze |
|---|---|---|---|---|
| 编排模型 | 显式图/状态机 | 对话驱动 | 角色-任务 | 可视化画布 |
| 控制粒度 | 最细(每边可控) | 中 | 中粗 | 粗 |
| 学习曲线 | 陡 | 中 | 缓 | 最缓 |
| 状态/持久化 | 内建 checkpoint | 需自建 | 弱 | 平台托管 |
| 人工介入 | 原生 interrupt | 支持 | 弱 | 平台功能 |
| 可观测 | LangSmith 生态 | 一般 | 一般 | 平台内置 |
| 代码掌控 | 全代码 | 全代码 | 全代码 | 平台锁定 |
选型路径(按场景对号)
- 业务流程复杂、要审计与可恢复(金融/工单类)→ LangGraph:checkpoint 支持断点续跑,interrupt 支持人工审批
- 多角色互评/研究型任务 → AutoGen:对话模式天然匹配
- 内容流水线、快速出 MVP → CrewAI:半天搭出调研-写作-审校三人组
- 非工程团队、问答/客服类 → Dify/Coze:免代码上线,后续复杂了再迁移
- 深度定制、团队工程能力强 → 自研循环(122 篇的百行内核)+ 自选组件(记忆用向量库、工具用 Function Calling 协议):框架收敛的今天,自研成本比想象低,且无框架升级债
三个通用判断原则
- 先问要不要 Agent:固定流程能用普通 LLM 链(prompt→tool→prompt)解决的,不上 Agent 框架——自主循环意味着不可预测与成本
- 可控性 > 抽象层级:生产环境选能把”模型自由发挥范围”框死的框架(显式图/白名单工具),而非最聪明的
- 生态与退出成本:看工具集成数量、trace 能力、以及”换框架要重写多少”——编排逻辑与业务工具解耦写好,迁移才不痛
趋势观察
各框架在互相学习:LangGraph 加了多 Agent 模板,AutoGen 转向图内核(AG2/SK 融合),CrewAI 补状态管理——编排模型在收敛为”图+状态+工具协议”的共识。选型时不必赌某个框架赢,把业务工具与提示词资产框架无关化,才是对抗收敛期动荡的正确姿势。
选型一句话:流程要硬控选 LangGraph,角色要互评选 AutoGen,团队要快选 CrewAI,业务要自助选 Dify,能力要满配自研——先确认”真的需要 Agent”,再在这五者间对号入座。







