跳转到正文

Anthropic Agent 工程学习地图

官方来源:Anthropic Engineering
实践项目:PPT Master

这里不是 Anthropic 文章的简单转载,也不是逐篇摘要的集合,而是一条从基础概念走向综合判断的学习路径。

整个目录分成两层:

  • Engineering 文章合集负责收录和检索官方文章;
  • 系统解读负责回答研究问题,并用 PPT Master 的当前实现检验原文方法的适用范围。

学习原则

先理解原文解决了什么问题,再比较多篇文章之间的递进与差异,最后讨论哪些方法已经进入 PPT Master、哪些只适用于不同规模或不同风险环境。


一、学习路径总览

这条路径不要求一次读完全部文章。基础系列用于建立共同语言,综合专题则围绕真实工程问题选读。


二、准备:SDK 与官方原文

入口用途
Anthropic SDK 核心实战指南熟悉 Claude API、工具调用和 SDK 的基本使用方式
Anthropic Engineering 文章合集查看已收录原文、发布日期、内容简介和分析状态
官方课程精读提示词十元素结构、工具四步契约、评估三种评分体系,并标注已失效的 API 细节

SDK 指南是一篇独立教程,不等同于对《Building agents with the Claude Agent SDK》的系统分析。后者在“运行架构”专题中与 Harness、Managed Agents 一起讨论。

课程精读覆盖的是单次调用层面的方法论(写好一个提示词、调好一次工具、评估一个提示词),与本目录其余专题讨论的长时运行系统构成上下游关系。


三、Agent 工程基础系列

这六篇建立后续专题共用的概念、上下文、接口与验证语言。

篇目核心问题
基础 01|Building effective agents如何在 Workflow 与 Agent 之间分配控制权
基础 02|Agent Skills知识和能力如何通过渐进式披露分层组织
基础 03|Effective context engineering如何管理注意力预算与运行时上下文
基础 04|Effective harnesses如何用制品和交接维持跨会话连续性
基础 05|Writing effective toolsAgent 与环境之间的工具接口如何设计
基础 06|Demystifying evals如何定义任务、试验、评估器与最小评估集

六篇之间是互补关系:架构决定控制权,Skills 与上下文工程管理信息,Harness 管理长任务连续性,工具提供行动接口,评估负责判断变化是否真正有效。


四、专题综合分析

后续学习不再机械遵循“一篇原文对应一篇解读”,而是让多篇原文共同回答一个研究问题。

专题综合分析共同研究问题
专题 01|运行架构从 Agent 循环到 Managed AgentsAgent 如何从基础执行循环演进为可持续、可恢复、可替换的长周期系统
专题 02|安全边界从权限提示到确定性边界如何减少人工审批摩擦,同时限制自主 Agent 的最大破坏半径
专题 03|多 Agent并行协作的适用边界哪些任务能从并行中获益,何时共享状态与协调成本会抵消收益
专题 04A|评估可信度评估结果为什么会失真任务区分度、运行环境与数据污染如何分别破坏评估信号
专题 04B|质量治理从故障复盘理解评估盲区为什么离线评估、流量观察和真实用户体验可能得出不同结论
专题 05|工具规模化从工具调用到程序化编排如何控制工具发现、调用编排、中间结果与上下文消耗

“评估可信度”和“质量治理”属于同一总专题,但分别处理两类证据:前者研究测试本身为什么失真,后者研究生产问题为什么没有被既有观测及时发现。


五、保留为延伸材料的文章

并非每篇官方文章都适合进入当前综合专题。

文章处理方式原因
Introducing Contextual Retrieval保留在原文索引主要属于 RAG 与知识检索管线,适合以后进入独立检索专题
Desktop Extensions作为 MCP 参考材料重点是安装、打包和分发,不是 Agent 运行时工具编排
Claude Code: Best practices作为维护型使用指南内容会随产品持续更新,不适合冻结成一次性系统解读
Raising the bar on SWE-bench作为历史评估案例模型版本和成绩具有明显时效性,方法层价值由评估专题吸收

这里的“保留”不是价值判断,而是研究边界:只有多篇材料能够共同回答稳定问题时,才值得形成综合分析。


六、如何阅读综合专题

每篇综合分析都遵循四条证据边界:

  1. 原文事实:Anthropic 明确描述的机制、实验与结论;
  2. 综合推断:把多篇文章放在一起后形成的比较与演进关系;
  3. 项目事实:从 PPT Master 当前规则、工作流和工具实现中能够核实的行为;
  4. 个人判断:基于前述证据得出的采用、部分采用或暂不采用结论。

PPT Master 不是用来证明 Anthropic 的方法普遍正确,而是一个现实工程参照。项目规模、部署形态、风险边界或维护成本不同时,同一种方法可能得到不同选择。


← 返回 AI 研究