Agent 框架横向对比
前置:会调大模型 API。不需要用过其中任何一个框架。
本专题回答:这 11 个框架分别让你的代码长成什么样,我这个项目该用哪个,或者能不能干脆不用。
你准备开一个新项目,做一个会自己查资料、调工具的东西。第一件事是打开搜索框,然后你会看到十几个名字:LangChain、LangGraph、DeepAgents、ADK、Eino……每一个的首页都说自己是「构建 AI Agent 的框架」,每一个都有几万个 star。
这时候最难受的不是选不出来,是不知道它们到底有没有在比同一件事。有的是给你一套写法,有的是替你把崩溃恢复做掉,有的干脆已经是一个装上就能用的成品。
这个专题把 11 个框架一个一个拆开看,每篇都回答同样四个问题:它让你写的代码长什么样、上下文爆了怎么办、跑一半崩了怎么办、要人工审批怎么办。
一、先看这张图:框架其实分三层
绝大多数选型吵架,都是因为拿不同层的东西在比。
怎么用这张图:
- 你说「LangChain 和 LangGraph 哪个好」—— 这问题不成立,LangChain 就跑在 LangGraph 上面
- 你说「Dify 15 万星比 LangGraph 强」—— Dify 是个产品,LangGraph 是个库,不在一个维度
- 你真正该问的是:我现在缺的是哪一层?
- 想少写点胶水代码 → 缺 Framework
- 任务跑一半老崩、要人审批 → 缺 Runtime
- 懒得自己设计工具和提示词,想装上就用 → 缺 Harness
三层是叠起来的,不是三选一。
二、11 个框架,一张表看完
| # | 框架 | Star | 版本 | 语言 | 层 | 一句话 |
|---|---|---|---|---|---|---|
| 02 | LangChain | 144.5k | 1.3.15 | Py / TS | 框架 | 集成最多,1.x 之后变轻了,值得重新看 |
| 03 | LangGraph | 39.9k | 1.2.11 | Py / TS | 运行时 | 长任务崩了能从断点续跑 |
| 04 | DeepAgents | 27.9k | 0.7.7 | Py / TS | 全家桶 | Claude Code 那套,但模型随便换 |
| 05 | Claude Agent SDK | 7.9k | 0.2.139 | Py / TS | 全家桶 | 直接把 Claude Code 开放给你调 |
| 06 | OpenAI Agents SDK | 28.7k | 0.21.1 | Py / TS | 框架 | 概念最少,半天就能读完全部代码 |
| 07 | Google ADK | 21.2k | 2.7.1 | 五种语言 | 框架 | 最像企业软件,自带评测和调试 UI |
| 08 | Microsoft AF | 12.9k | 1.14.0 | Py / .NET | 框架 | .NET 团队基本没别的选 |
| 09 | LlamaIndex | 51.7k | 0.14.23 | Py / TS | 框架 | 别人从编排出发,它从「文档怎么读」出发 |
| 10 | Qwen-Agent | 17.0k | —— | Py | 框架 | Qwen 官方配套,一行代码起 WebUI |
| 11 | Spring AI | 9.3k+10.6k | 2.0.0 | Java | 框架 | Java 团队几乎唯一的成熟选择 |
| 12 | Eino | 12.7k | v0.9.15 | Go | 框架 | Go 里唯一完整的,还带编译期类型检查 |
还有一篇 13 横向对比与选型决策,是全专题的结论汇总。
多智能体协作那一派(CrewAI / MetaGPT / CAMEL 这类「给 Agent 分配角色」的框架)另开专题单独讲,不在本专题范围内。
三、看 star 之前,先知道这三件事
3.1 榜首那几个根本不是框架
n8n 20 万星、AutoGPT 18.7 万、Langflow 15.3 万、Dify 15.3 万 —— 它们是产品,装上就能用,star 里一大半是非开发者。而 LangGraph 这种给工程师写代码的库,天然拿不到那个量级。
拿它们比 star,等于用下载量比 Photoshop 和 libpng。 所以本专题不把它们放进横向对比。
3.2 星多不代表还活着
AutoGen 60.5 万…… 不对,60.5k star,最后一次提交是 2026 年 4 月。 因为微软把它和 Semantic Kernel 合并成了新框架 Microsoft Agent Framework —— 那个新的才 12.9k star。
新框架 star 少,恰恰因为它新。 所以每次评估必须看最近提交时间。这个故事在 08 里展开,是本专题最值得记住的一课。
3.3 有些能力换了模型就没了
「支持 100+ 模型」这句话,各家都在说。但真正要问的是:
明年我要把模型从 A 换成 B,得改多少行代码?
| 你在用 | 换模型基本没事 | 换模型直接废掉 |
|---|---|---|
| OpenAI Agents SDK | Agent、Handoff、Session | 托管搜索工具、Realtime 语音、官方 Tracing |
| Google ADK | Agent、Workflow、Tools | Agent Engine 托管、内置 Google 搜索 |
| Microsoft AF | Agent、Workflow | Foundry 托管、Azure Durable 集成 |
| Claude Agent SDK | Hooks、MCP 机制 | 几乎全部 —— 它本来就是为 Claude 调的 |
| LangChain / LangGraph / DeepAgents | 基本全部 | 可观测性最顺的路是 LangSmith |
这不是说原厂框架不好,是说你得知道自己踩了几个不可迁移的坑。
四、你的语言可能已经替你选好了
现实是:大部分团队的选型,第一步就被后端语言砍掉八成选项。
Python 之外的选择比想象中少,但也不是没有:Java 走 Spring AI,Go 走 Eino,.NET 走 MAF —— 各自都只有一个理性答案。
五、按你的处境挑三篇读
| 你的处境 | 读这三篇 |
|---|---|
| 从零选框架 | 01 三层结构 → 13 选型结论 → 选中的那篇 |
| 已在用 LangChain,被 LangGraph / DeepAgents 绕晕 | 02 → 03 → 04 |
| 要做长任务 / Deep Research | 04 → 05 → 03 |
| 要做编码 Agent | 05 → 04 |
| 要做 RAG / 文档问答 | 09 LlamaIndex → 02 → 14 |
| 后端是 Java | 11 Spring AI → 01 → 14 |
| 后端是 Go | 12 Eino → 01 → 14 |
| 在 GCP / Azure 上落地 | 07 ADK → 08 微软 → 14 |
| 用国产模型 / 有信创要求 | 10 Qwen-Agent → 11 Spring AI → 12 Eino |
| 准备面试 | 01 + 14,再补 03 的状态机部分 |
每篇都按同一套顺序写:核心抽象 → 循环怎么转 → 状态放哪 → 多智能体 → 人工介入 → 上生产 → 什么时候别用它。最后一节通常最有用 —— 各家首页都只讲自己适合什么。
六、站内相关
- Agent 应用面试题汇总 —— Agent Loop、工具调用、上下文管理的概念题
- RAG 面试题汇总 —— 配合 09 LlamaIndex 看
- Anthropic《长期运行代理的有效工具》精读 —— 工具怎么设计,比选哪个框架更影响效果
- RAG Agent Platform 多租户智能体平台 —— 自研平台里的实际取舍
- EvalHub:LLM 与 Agent 评测平台 —— 换框架之前,先有评测