Anthropic Engineering 文章合集
Anthropic Engineering 是 Anthropic 技术团队的官方博客,发布关于构建可靠 AI 系统的深度技术文章。这些文章涵盖了 AI Agent 开发的方方面面,是学习现代 AI 工程实践的优质资源。
📅 收录状态:截至 2026-08-12,已收录 Anthropic Engineering 首页展示的全部 25 篇文章,并保留 1 篇已迁移至 Claude Blog 的 Claude Agent SDK 专题文章。当前已完成 6 篇基础解读,并将 16 篇后续文章组织为 5 个专题、6 篇综合分析。完整路径见 Anthropic Agent 工程学习地图。
📚 文章索引
🤖 Agent 开发核心
| 文章 | 日期 | 简介 |
|---|---|---|
| Building effective agents | 2024-12-19 | 必读 — Agent 开发的奠基性文章,介绍如何构建有效的 AI Agent,包括架构设计、工作流模式和最佳实践(系统解读) |
| Building agents with the Claude Agent SDK | 2025-09-29 | 使用 Claude Agent SDK 构建 Agent 的官方教程(专题:Agent 运行架构) |
| Effective context engineering for AI agents | 2025-09-29 | 上下文工程实践指南,如何高效管理和利用 Agent 的上下文窗口(系统解读) |
| Equipping agents for the real world with Agent Skills | 2025-10-16 | Agent Skills 介绍,如何为 Agent 装备真实世界的能力(系统解读) |
| Effective harnesses for long-running agents | 2025-11-26 | 探讨长时间运行 Agent 面临的跨上下文窗口挑战,借鉴人类工程师经验设计更有效的 Agent 框架(系统解读) |
| Harness design for long-running application development | 2026-03-24 | 通过规划、生成与评估三类 Agent,提升前端设计和长时间自主软件开发的质量(专题:Agent 运行架构) |
| Scaling Managed Agents: Decoupling the brain from the hands | 2026-04-08 | 将 Agent 的会话、运行框架与沙箱解耦,以稳定接口支撑可扩展的长周期任务(专题:Agent 运行架构) |
🛠️ 工具设计与使用
| 文章 | 日期 | 简介 |
|---|---|---|
| Introducing Contextual Retrieval | 2024-09-19 | 上下文检索技术介绍,提升 RAG 系统的检索质量 |
| The "think" tool: Enabling Claude to stop and think | 2025-03-20 | "think" 工具介绍,让 Claude 在复杂工具使用场景中能够停下来思考(专题:工具规模化) |
| Writing effective tools for agents — with agents | 2025-09-11 | 如何为 Agent 编写有效的工具,用 Agent 来辅助工具开发(系统解读) |
| Introducing advanced tool use on the Claude Developer Platform | 2025-11-24 | Claude 开发者平台的高级工具使用功能介绍(专题:工具规模化) |
💻 Claude Code 与编程
| 文章 | 日期 | 简介 |
|---|---|---|
| Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet | 2025-01-06 | Claude 3.5 Sonnet 在 SWE-bench 基准测试中的表现提升 |
| Claude Code: Best practices for agentic coding | 2025-04-18 | Claude Code 最佳实践,如何高效使用 AI 进行代码开发 |
| Beyond permission prompts: making Claude Code more secure and autonomous | 2025-10-20 | 通过沙箱等技术使 Claude Code 更安全、更自主(专题:Agent 安全边界) |
| How we built Claude Code auto mode: a safer way to skip permissions | 2026-03-25 | 使用模型分类器自动处理部分权限判断,在减少审批疲劳的同时提升安全性(专题:Agent 安全边界) |
| How we contain Claude across products | 2026-05-25 | 总结 claude.ai、Claude Code 与 Cowork 的容器、沙箱和虚拟机隔离实践(专题:Agent 安全边界) |
🔌 MCP 与集成
| 文章 | 日期 | 简介 |
|---|---|---|
| Desktop Extensions: One-click MCP server installation | 2025-06-26 | Claude Desktop 的桌面扩展功能,一键安装 MCP 服务器 |
| Code execution with MCP: Building more efficient agents | 2025-11-04 | 使用 MCP 进行代码执行,构建更高效的 Agent(专题:工具规模化) |
🔬 研究与事后分析
| 文章 | 日期 | 简介 |
|---|---|---|
| How we built our multi-agent research system | 2025-06-13 | Anthropic 如何构建多 Agent 研究系统(专题:多 Agent 协作) |
| A postmortem of three recent issues | 2025-09-17 | 三个近期问题的事后分析,透明地分享经验教训(专题:质量治理) |
| Building a C compiler with a team of parallel Claudes | 2026-02-05 | 使用多个并行 Claude 实例协作构建 C 编译器的实践探索(专题:多 Agent 协作) |
| An update on recent Claude Code quality reports | 2026-04-23 | 复盘 Claude Code、Claude Agent SDK 与 Cowork 的三类质量问题及修复措施(专题:质量治理) |
🧪 测试与评估
| 文章 | 日期 | 简介 |
|---|---|---|
| Demystifying evals for AI agents | 2026-01-09 | 全面解析 AI Agent 的评估方法,包括评估器类型、能力评估及非确定性处理等策略(系统解读) |
| Designing AI-resistant technical evaluations | 2026-01-21 | 探讨如何设计难被 AI 破解的技术评估,分享性能工程团队在招聘测试设计中的博弈与思考(专题:评估可信度) |
| Quantifying infrastructure noise in agentic coding evals | 2026-02-05 | 量化 Agent 编程评估中基础设施噪声的影响,提升评估结果的可靠性(专题:评估可信度) |
| Eval awareness in Claude Opus 4.6’s BrowseComp performance | 2026-03-06 | 分析模型识别评测并定位、解密答案的现象,以及联网评测面临的完整性风险(专题:评估可信度) |
🎯 推荐学习路径
文章索引适合查找原文,系统学习则建议按“基础系列 → 专题综合分析”推进。完整说明见 Anthropic Agent 工程学习地图。
第一阶段:建立共同语言
- Building effective agents:理解 Workflow、Agent、工具与环境反馈;
- Agent Skills:理解知识与能力的分层组织;
- Effective context engineering:理解注意力预算与上下文管理;
- Effective harnesses:理解长任务交接与恢复;
- Writing effective tools:理解 Agent 与环境的接口;
- Demystifying evals:理解任务、试验和评估器。
第二阶段:围绕工程问题综合学习
| 专题 | 综合分析 |
|---|---|
| Agent 如何从基础循环演进为长周期系统 | 从 Agent 循环到 Managed Agents |
| 如何兼顾自主性与安全边界 | 从权限提示到确定性边界 |
| 什么任务适合多 Agent 并行 | 多 Agent 并行协作的适用边界 |
| 评估信号和生产质量为什么会错位 | 评估可信度 · 质量治理 |
| 大规模工具使用如何控制上下文消耗 | 从工具调用到程序化编排 |
第三阶段:按需查看延伸材料
Contextual Retrieval、Desktop Extensions、Claude Code Best Practices 与早期 SWE-bench 文章仍保留在上方索引中。它们分别属于检索、产品分发、持续更新指南和历史基准案例,不为追求覆盖率强行并入当前专题。
🔗 相关资源
- Claude 开发者控制台: console.anthropic.com
- Claude 开发者文档: anthropic.com/docs
- Anthropic 招聘: anthropic.com/jobs
持续更新
Anthropic Engineering 会持续发布新文章,建议定期访问官方页面获取最新内容。