1. 为什么“会调 API”不等于“会做 Agent 工程”很多人准备 Agent 岗位面试时第一反应是背概念ReAct、CoT、Tool Calling、Multi-Agent。但真正坐到面试官对面问题往往不是“什么是 Agent”而是“你的 Agent 为什么在 Demo 里能跑上线三天就开始乱调工具”。这就是 zero2Agent 这类学习路线要解决的核心矛盾——它把 Agent 工程从“概念认知”一路推到“生产可用”而不是停在会写一个 while 循环调模型的层面。我先把结论摆出来Agent 工程能力可以拆成四层。最底层是认知层你要能区分 Agent 和 Workflow知道不是所有自动化都值得上 Agent第二层是机制层Tool Calling、Memory、Planning、Reflection 这些机制你得能自己手写一遍第三层是框架层LangGraph、原厂 SDK、各类开源框架你要能横向对比并说清选型理由第四层是生产层容错、评估、训练、多 Agent 协作、Worktree 隔离这些工程问题才是大厂面试真正的分水岭。这份学习大纲的价值在于它给了一条可复制的路径而不是一堆零散文章。你可以把它理解成一张“能力地图”每个阶段有明确的知识点、配套练习、以及用真实面试题自测的验证动作。下面我会按阶段拆开讲每个阶段都给出可跟做的练习清单和自测问题最后给出一套用 TaoToken 做模型验证的配置让你在本地就能把学到的机制跑通。先说清楚适合谁如果你学过深度学习想转 LLM 应用开发或者会 Python 但 Agent 工程能力是零散的又或者用过 Claude Code、Cursor 却说不清背后实现原理这份路线就是为你准备的。它不承诺“三天速成”但它承诺每一阶段都能落到可运行的代码和可回答的面试题上。2. 阶段划分与每阶段核心知识点拆解我把整条路线分成六个阶段前三个阶段打认知和机制基础中间两个阶段做框架与生产工程最后一个阶段专门刷面试真题。每个阶段我都给出核心知识点、配套练习、以及自测标准。2.1 阶段一Agent Basic——建立正确认知这个阶段只有一件事把“Agent 是什么”这件事想清楚。核心知识点包括 Agent vs Workflow 的本质区别、Tool Calling 的完整机制、Memory 的三种设计模式、Planning Reflection 的适用边界。Agent 和 Workflow 的区别面试里最容易被追问。Workflow 是预先定义好的有向路径节点之间没有循环你写死 A→B→CAgent 则是模型驱动工具调用图内存在回路下一步走哪里由模型根据当前状态决定。用一句话概括Workflow 是你编排流程Agent 是模型编排自己。Tool Calling 也不是“给模型一个函数列表”那么简单。完整链路是你把工具描述name、description、parameters schema传给模型模型返回一个 tool_call 结构你的运行时解析这个结构、执行真实函数、把结果作为 tool message 回传模型再决定下一步。这里面每一步都有坑比如参数校验失败怎么办、工具执行超时怎么办。Memory 的三种模式要能说清短期记忆就是当前对话的 message 列表长期记忆通常落到向量库或 KV 存储外部存储则是把结构化状态存到数据库。选型标准是对话内需要就短期跨会话需要就长期需要精确查询就外部存储。配套练习手写一个最小 Agent Loop不用任何框架只用一个模型 API 加一个计算器工具让它能回答“23 乘以 47 再加 100 是多少”。这个练习能逼你把 Tool Calling 的完整链路走一遍。自测问题为什么 Demo 能跑、落地就崩能答出“Demo 里工具少、状态简单、没有并发和失败重试生产里工具几十个、状态跨会话、失败是常态”就算过关。2.2 阶段二从 60 行代码推导 Agent 框架这个阶段的核心观点是主流框架过度封装真正的生产 Agent 都是轻量自研。你要能从 60 行核心代码出发推导出完整框架。推导路径是这样的workflow node node有向路径无循环chatbot workflow loop外层循环支持多轮对话agent chatbot tools图内回路由模型驱动工具。这三步走完你就理解了 Agent 框架的本质。核心知识点还包括 RAG 作为 VectorDB 的工程实践、Tool/MCP/Skill 三种工具形态对比、Context 与 Memory 的压缩策略、多 Agent 并行团队架构。这里重点说工具形态Tool 是你自己实现的函数MCP 是标准化的工具协议Skill 是可复用的能力封装。三者的选择取决于复用范围和标准化需求。配套练习用 60 行以内的代码实现一个带工具调用的 Agent然后逐步加上多轮对话、上下文压缩、第二个工具。每加一个能力记录代码增长了多少行你会对“框架到底帮你做了什么”有全新认识。自测问题为什么自己实现比直接用框架更重要能答出“框架封装了控制流出问题时你无法定位是模型问题还是框架问题自研让你掌握每一层”就到位了。2.3 阶段三手写 Coding Agent——最硬核的机制训练这个阶段是整个路线最硬核的部分从 30 行 Agent Loop 逐步构建出完整的 Coding Agent 系统。机制基础篇覆盖 Agent Loop、Tool Dispatch、TodoWrite、Subagent、Skill Loading、Context Compact进阶篇覆盖 Task DAG、Background Tasks、Agent Teams、Protocols、Autonomous Agent、Worktree Isolation。每一课都是在前一课基础上增量构建。比如 Agent Loop 是最小闭环Tool Dispatch 解决工具路由TodoWrite 让 Agent 能管理任务列表Subagent 做 Context 隔离Context Compact 解决长对话压缩。进阶篇里 Worktree Isolation 的工程意义特别值得说多个 Agent 并行改代码时用 git worktree 给每个 Agent 独立工作目录避免互相覆盖。配套练习跟着 12 节课的节奏每节课后自己重写一遍代码不看参考实现。重点练 Subagent 的 Context 隔离和多 Agent Team 的通信协调。自测问题Claude Code 的 Agent Loop 怎么跑的Subagent 的 Context 隔离怎么做多 Agent Team 之间怎么通信和协调Worktree 隔离的工程意义是什么这四个问题能答清楚这个阶段就过了。2.4 阶段四图结构编排与框架横向对比LangGraph 用图结构描述 Agent 执行逻辑核心是 State Node Graph 三件套。State 用 TypedDict 设计Node 是节点函数Graph 编译后运行。条件分支用 add_conditional_edges 根据状态动态路由并行执行用 Fan-out/Fan-in 做多节点并发。SDK 框架部分要横向对比三大原厂 SDKOpenAI Agents SDK 用 function_tool 装饰器、Runner 自动循环、handoffs 做多 AgentGoogle genai SDK 支持 AI Studio 和 Vertex AI 两种后端Claude Anthropic SDK 用 Messages API、Tool Use 手动循环、Extended Thinking。核心结论是轻量原厂 SDK 比第三方框架更稳定、更适合生产。框架调研部分覆盖 13 个主流框架包括阿里的 AgentScope、字节的 Eino 和 DeerFlow、微软的 Semantic Kernel 和 AutoGen、Google ADK、Vercel AI SDK 等。每个框架记一句话特色就够了面试时能说出选型理由才是关键。配套练习用 LangGraph 实现一个带条件分支的 Agent再用 OpenAI Agents SDK 实现同样功能对比两者代码量和可维护性。自测问题为什么选这个框架不选那个能结合团队规模、语言栈、生产稳定性要求给出有理有据的回答就算过关。2.5 阶段五Agent 训练与生产工程这个阶段在面试中杀伤力极大因为能把 Agent 训练讲清楚的候选人很少。核心知识点包括 Agent SFT、Agent RL、GRPO vs PPO、数据混合策略、Agent 评估指标、从 SFT 到部署的完整 Pipeline。Agent SFT 的关键是轨迹数据 vs 单轮 QA 的区别训 Agent 不能用普通 SFT 数据因为 Agent 的行为是多步的每一步的输入输出都要作为训练样本而且要做 Loss Mask只对模型生成的 token 算 loss工具返回的结果不算。Agent RL 部分要理解轨迹构造和 Loss Mask 策略GRPO 和 PPO 的对比与选型。评估指标要能说清怎么衡量 Agent 好不好比如任务完成率、工具调用准确率、平均步数、失败恢复率。配套练习构造一个小规模的 Agent 轨迹数据集做一次 SFT 微调观察模型在多步任务上的表现变化。自测问题为什么训 Agent 不能用普通 SFT 数据能答出“Agent 是多步决策单轮 QA 丢失了中间步骤的监督信号”就到位了。2.6 阶段六大厂面试真题库与自测这个阶段覆盖蚂蚁、阿里、字节、腾讯、携程的真实面试题11 大核心维度包括架构设计、工具管理、容错与恢复、Memory 与 Context、评估与可视化、多 Agent 协作、工程踩坑、Prompt Engineering、RAG 检索、训练与数据、AI 代码测试。每道题都有“新手答”vs“高手答”的对比。举个例子面试官问“多 Agent 协作怎么做容错”新手答“加 try-catch失败了重试”高手答“从超时熔断、状态回滚、降级策略、人工介入四个层面展开结合具体架构说明”。这个对比能让你直观看到差距在哪。配套练习把 11 个维度每个维度挑 3 道题先自己答一遍再对照高手答记录差距点。反复练到能自然说出高手答的框架。自测问题随便抽一道真题你能在 3 分钟内给出结构化回答并且覆盖至少三个层面就算具备生产级 Agent 工程能力的面试水平。3. 用 TaoToken 做模型验证的可复制配置学完机制后你需要一个稳定的模型入口来跑练习。我用 TaoToken 做本地验证它的 API 兼容 OpenAI 格式配置简单。下面给出完整配置你可以直接复制。先拿 API Key访问 https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite 创建密钥。注意 API 域名是 https://taotoken.net/api不要加 UTM 参数。环境变量配置写入.env文件TAOTOKEN_API_KEYsk-你的密钥 TAOTOKEN_BASE_URLhttps://taotoken.net/api如果你用 Claude Code 做 Coding Agent 练习配置~/.claude/settings.json{ env: { ANTHROPIC_BASE_URL: https://taotoken.net/api, ANTHROPIC_API_KEY: sk-你的密钥, ANTHROPIC_MODEL: claude-sonnet-4-20250514 } }如果你用 Cline 或 Roo Code 这类 VS Code 插件在 MCP 配置里写{ mcpServers: { taotoken: { command: npx, args: [-y, taotoken/mcp-server], env: { TAOTOKEN_API_KEY: sk-你的密钥, TAOTOKEN_BASE_URL: https://taotoken.net/api } } } }如果你用 Codex配置~/.codex/auth.json{ OPENAI_API_KEY: sk-你的密钥, OPENAI_BASE_URL: https://taotoken.net/api }三件套记牢Base URL 是https://taotoken.net/apiKey 是你创建的密钥Model ID 按需选比如claude-sonnet-4-20250514或gpt-4o。这三个要素在任何一个工具里配置都跑不出这个范围。注意配置文件里的路径要和工具实际读取路径一致比如 Claude Code 读的是~/.claude/settings.json写错位置不会生效。4. 验证请求与成功结果配置完成后先用一个最小请求验证链路通不通。用 Python 写一个测试脚本import os from openai import OpenAI client OpenAI( api_keyos.getenv(TAOTOKEN_API_KEY), base_urlos.getenv(TAOTOKEN_BASE_URL) ) response client.chat.completions.create( modelclaude-sonnet-4-20250514, messages[ {role: user, content: 用一句话解释 Agent 和 Workflow 的区别} ] ) print(response.choices[0].message.content)运行后如果输出类似“Workflow 是预先编排的固定路径Agent 是模型根据状态动态决定下一步”说明链路通了。再验证 Tool Calling 是否正常tools [ { type: function, function: { name: calculate, description: 计算数学表达式, parameters: { type: object, properties: { expression: {type: string} }, required: [expression] } } } ] response client.chat.completions.create( modelclaude-sonnet-4-20250514, messages[{role: user, content: 帮我算 23 乘以 47 再加 100}], toolstools ) print(response.choices[0].message.tool_calls)如果返回的tool_calls里有calculate调用和参数23*47100说明 Tool Calling 链路正常。这两个验证跑通你就可以用这个入口做后面所有阶段的练习了。想直接对话验证模型效果可以访问 https://taotoken.net/chat?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite 在网页端试。长期做编码和 Agent 练习建议用 Coding Planhttps://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewrite5. 本篇常见错误排查配置和练习过程中最容易踩的坑我按真实报错整理一遍。401 Unauthorized最常见的原因是 Key 没生效或 Base URL 写错。检查.env里的TAOTOKEN_API_KEY是否有多余空格TAOTOKEN_BASE_URL是否是https://taotoken.net/api而不是带 UTM 的地址。如果用的是 Claude Code检查settings.json里ANTHROPIC_BASE_URL是否写成了https://taotoken.net/api注意不要漏掉/api。local proxy failed这个报错通常出现在你本地有代理工具时。检查环境变量里是否有HTTP_PROXY或HTTPS_PROXY指向本地端口如果有临时 unset 掉再试。另外确认没有把 Base URL 写成localhost或127.0.0.1。reading choices 报错通常是响应结构解析失败。检查你用的 SDK 版本是否和 API 兼容比如 OpenAI SDK 要用response.choices[0].message.content如果返回的是流式响应要改成遍历chunk.choices[0].delta.content。另外确认 model ID 拼写正确写错模型名有时会返回空 choices。OAuth 相关报错如果你用 Claude Code 或 Codex报 OAuth 错误说明工具在尝试走官方登录流程。检查settings.json或auth.json里是否同时存在官方 token 和自定义 Base URL两者冲突时会报 OAuth 失败。清掉官方 token只保留自定义配置。工具调用返回空检查 tools 的 schema 是否符合 JSON Schema 规范parameters里type必须是objectproperties里每个字段要有type。description 写清楚工具用途模型靠它决定是否调用。多 Agent 练习时 Context 串了这是 Subagent 隔离没做好。每个 Subagent 要有独立的 message 列表不要把主 Agent 的完整历史传进去只传必要的任务描述和上下文摘要。提示遇到报错先看 HTTP 状态码401 是认证问题404 是路径问题429 是限流500 是服务端问题。按状态码定位比盲猜快得多。6. 按背景选路线与持续自测不同背景的人路线不一样。没有 Agent 开发经验的从 Agent Basic 开始建立认知后再进 OpenClaw 和 Claude Code。有 Agent 开发经验的可以直接从 Claude Code 和 LangGraph 切入补机制细节。目标是求职面试的走速通路线Agent Basic 建立认知然后刷 Agent Interview 真题再补 Agent Training 短板2-3 周能覆盖核心考点。目标是工程落地的走进阶路线Agent Basic → OpenClaw → Claude Code → LangGraph → SDK 框架4-6 周。想全面学习的按模块顺序全部学完6-8 周最后做一个 Final Project 把多 Agent 协作、容错、评估串起来。自测动作要贯穿始终。每学完一个阶段用三个问题验证这个阶段的核心机制我能手写出来吗这个阶段的面试题我能结构化回答吗这个阶段的知识能和我已有的项目经验结合吗三个都能答“是”再进下一阶段。最后给一个实用技巧把每次练习的代码和面试题回答都存到一个 git 仓库里按阶段建目录。面试前不用重新学直接翻自己的仓库看当时的代码和回答回忆速度比重新看书快得多。Agent 工程是练出来的不是看出来的动手跑通每一个机制比背一百个概念都管用。
阅读完成 · 觉得有帮助?