Anthropic Agent 工程学习地图
官方来源:Anthropic Engineering
实践项目:PPT Master
这里不是 Anthropic 文章的简单转载,也不是逐篇摘要的集合,而是一条从基础概念走向综合判断的学习路径。
整个目录分成两层:
- Engineering 文章合集负责收录和检索官方文章;
- 系统解读负责回答研究问题,并用 PPT Master 的当前实现检验原文方法的适用范围。
学习原则
先理解原文解决了什么问题,再比较多篇文章之间的递进与差异,最后讨论哪些方法已经进入 PPT Master、哪些只适用于不同规模或不同风险环境。
一、学习路径总览
这条路径不要求一次读完全部文章。基础系列用于建立共同语言,综合专题则围绕真实工程问题选读。
二、准备:SDK 与官方原文
| 入口 | 用途 |
|---|---|
| Anthropic SDK 核心实战指南 | 熟悉 Claude API、工具调用和 SDK 的基本使用方式 |
| Anthropic Engineering 文章合集 | 查看已收录原文、发布日期、内容简介和分析状态 |
| 官方课程精读 | 提示词十元素结构、工具四步契约、评估三种评分体系,并标注已失效的 API 细节 |
SDK 指南是一篇独立教程,不等同于对《Building agents with the Claude Agent SDK》的系统分析。后者在“运行架构”专题中与 Harness、Managed Agents 一起讨论。
课程精读覆盖的是单次调用层面的方法论(写好一个提示词、调好一次工具、评估一个提示词),与本目录其余专题讨论的长时运行系统构成上下游关系。
三、Agent 工程基础系列
这六篇建立后续专题共用的概念、上下文、接口与验证语言。
| 篇目 | 核心问题 |
|---|---|
| 基础 01|Building effective agents | 如何在 Workflow 与 Agent 之间分配控制权 |
| 基础 02|Agent Skills | 知识和能力如何通过渐进式披露分层组织 |
| 基础 03|Effective context engineering | 如何管理注意力预算与运行时上下文 |
| 基础 04|Effective harnesses | 如何用制品和交接维持跨会话连续性 |
| 基础 05|Writing effective tools | Agent 与环境之间的工具接口如何设计 |
| 基础 06|Demystifying evals | 如何定义任务、试验、评估器与最小评估集 |
六篇之间是互补关系:架构决定控制权,Skills 与上下文工程管理信息,Harness 管理长任务连续性,工具提供行动接口,评估负责判断变化是否真正有效。
四、专题综合分析
后续学习不再机械遵循“一篇原文对应一篇解读”,而是让多篇原文共同回答一个研究问题。
| 专题 | 综合分析 | 共同研究问题 |
|---|---|---|
| 专题 01|运行架构 | 从 Agent 循环到 Managed Agents | Agent 如何从基础执行循环演进为可持续、可恢复、可替换的长周期系统 |
| 专题 02|安全边界 | 从权限提示到确定性边界 | 如何减少人工审批摩擦,同时限制自主 Agent 的最大破坏半径 |
| 专题 03|多 Agent | 并行协作的适用边界 | 哪些任务能从并行中获益,何时共享状态与协调成本会抵消收益 |
| 专题 04A|评估可信度 | 评估结果为什么会失真 | 任务区分度、运行环境与数据污染如何分别破坏评估信号 |
| 专题 04B|质量治理 | 从故障复盘理解评估盲区 | 为什么离线评估、流量观察和真实用户体验可能得出不同结论 |
| 专题 05|工具规模化 | 从工具调用到程序化编排 | 如何控制工具发现、调用编排、中间结果与上下文消耗 |
“评估可信度”和“质量治理”属于同一总专题,但分别处理两类证据:前者研究测试本身为什么失真,后者研究生产问题为什么没有被既有观测及时发现。
五、保留为延伸材料的文章
并非每篇官方文章都适合进入当前综合专题。
| 文章 | 处理方式 | 原因 |
|---|---|---|
| Introducing Contextual Retrieval | 保留在原文索引 | 主要属于 RAG 与知识检索管线,适合以后进入独立检索专题 |
| Desktop Extensions | 作为 MCP 参考材料 | 重点是安装、打包和分发,不是 Agent 运行时工具编排 |
| Claude Code: Best practices | 作为维护型使用指南 | 内容会随产品持续更新,不适合冻结成一次性系统解读 |
| Raising the bar on SWE-bench | 作为历史评估案例 | 模型版本和成绩具有明显时效性,方法层价值由评估专题吸收 |
这里的“保留”不是价值判断,而是研究边界:只有多篇材料能够共同回答稳定问题时,才值得形成综合分析。
六、如何阅读综合专题
每篇综合分析都遵循四条证据边界:
- 原文事实:Anthropic 明确描述的机制、实验与结论;
- 综合推断:把多篇文章放在一起后形成的比较与演进关系;
- 项目事实:从 PPT Master 当前规则、工作流和工具实现中能够核实的行为;
- 个人判断:基于前述证据得出的采用、部分采用或暂不采用结论。
PPT Master 不是用来证明 Anthropic 的方法普遍正确,而是一个现实工程参照。项目规模、部署形态、风险边界或维护成本不同时,同一种方法可能得到不同选择。