AI Agent三层工程:框架、循环与图

beamnxw 发布于 2026-07-26 阅读 38

本文介绍了AI Agent架构的三个关键层:Agent Harness Engineering(代理框架工程)、Loop Engineering(循环工程)和Graph Engineering(Graph工程)。Harness负责模型外的代码、配置和执行逻辑,包括工具、内存、权限等;Loop设计重复执行和反馈循环,如验证循环、事件驱动循环;Graph通过显式节点、边和状态转换控制工作流拓扑。文章强调三者不可混淆,应协同设计以构建可靠的生产级Agent系统,并提供了诊断故障和选择合适层的实用指南。

图像

一篇实用指南,关于人们常混淆的三个架构层次

这种混淆是可以理解的。这三个概念都围绕同一个模型,都影响可靠性,并且都可能包含“循环”。但它们不是同义词。它们描述的是不同的工程决策,一旦智能体离开演示笔记本,开始接触文件、API、客户或生产代码,这种区别就变得至关重要。

30秒速答

  • 执行框架工程构建模型周围的运行机制
  • 循环工程设计重复的工作与反馈循环
  • Graph 工程使工作流拓扑结构显式化:节点、分支、汇合、状态转换和受控循环

清晰的思维模型是:环境 → 反馈 → 流程

为什么这些术语突然变得重要

一个原始的语言模型无法生成文本、维护项目状态、运行测试套件、查看浏览器、强制执行审批规则或重启失败的任务。这些能力来自于它所处的环境。随着智能体软件日趋成熟,一套标准的工程栈终于开始成形。最底层是 Agent 执行框架,即实际运行模型的代码。接下来是循环,负责处理重复执行和质量检查。最后,规划出指导整个流程的结构化路径。

术语标签仍未完全标准化。在当前框架中,“agent harness”这个术语开始具有相当具体的定义。“loop engineering”一词于 2026 年作为从业者中的新术语出现。Graph 工程应从实践角度而非学术领域来理解;它只是将智能体工作流创建为显式有向图或状态机的过程。这种实践性的区分很有帮助,因为它能防止流行词掩盖真正的设计问题。

图像

Agent 执行框架工程

根据 Langchain 的定义,智能体是模型加上执行框架,而执行框架是模型之外的代码、配置和执行逻辑。在实践中,这包括系统提示、工具定义、记忆、文件系统、沙箱、模型路由、交接、中间件 Hook、压缩、权限、日志记录和验证接口。

OpenAI 的 Agents SDK 从运行时的角度描述了相同的操作核心:运行器调用模型、执行工具调用、处理交接、携带状态,并且仅在运行达到真正的终止条件时才停止。

图像

“执行框架”这个词很有用,因为它将注意力从模型崇拜上移开。两个团队可以使用相同的基础模型,但得到截然不同的结果,因为一个团队为模型提供了干净的工具、稳定的工作区、受限的权限和可观察的状态,而另一个团队只给了它一个模糊的提示和一个不可靠的 API 封装。智力可能相似,但工作条件不同。一个严谨的执行框架通常包含:

  • 上下文注入:指令、检索到的事实、对话状态、技能和特定任务策略
  • 操作面:API、浏览器、Shell、代码解释器、数据库和兼容 MCP 的工具
  • 持久化:文件、检查点、会话、进度日志、Git 历史和长期记忆
  • 执行控制:超时、重试、预算、模型路由、子智能体生成和审批门
  • 安全与治理:权限、隔离、允许列表、机密处理和人工授权
  • 可观测性:追踪、工具输入输出、状态转换、成本、延迟和评估结果

图像

模型位于一个更广泛的执行框架之中,包含上下文、控制、行动、持久化和验证。将模型从你的架构图中移除。剩下的所有东西很可能就是执行框架的一部分:工具、数据访问、状态存储、沙箱、中间件、评估器、重试策略和用户界面。

执行框架工程在何处发挥作用

执行框架的工作对于长时间运行的任务至关重要。在多会话编码中,Anthropic 发现仅仅使用上下文压缩是不够的。这本身并不是一个更好的提示,但他们创建了一个良好的设置:一个初始化器、一个进度文件、Git 历史,以及一种增量工作的纪律,使得每个新的上下文都能理解已经做了什么以及还有哪些事情要做。这是一个针对智能体的改进工作系统。当智能体不具备某项能力、无法干净地返回、丢失状态、访问过多、无法审计或在不同的环境中表现不同时,就应用执行框架工程。

循环工程

每个使用工具的智能体都有一个内嵌的小循环:

调用模型 → 查看结果 → 运行工具 → 将观察结果输入模型 → 重复直到返回最终答案

当开发者有意识地围绕该行为构建或叠加新的循环时,就进入了 OpenAI 所说的循环工程。例如,验证循环允许智能体创建工件、执行确定性检查或评分器、接收显式反馈,并且仅在存在证据错误时重复。事件驱动循环在满足计划、Webhook 或收到新文档时唤醒智能体。改进循环分析追踪和失败情况、修改指令/工具,并测试新版本是否工作得更好。LangChain 在 2026 年的框架中将它们称为循环栈,而不是一个神奇的 while 语句。

一个设计良好的循环的构成:

  • 触发器:启动另一个周期的事物;用户请求、计划、失败的测试、新数据或评估器反馈
  • 目标:要达成的特定状态,而不是“不断改进”的模糊指令
  • 状态与记忆:下一个周期需要知道的内容,而无需重放所有内容
  • 行动策略:智能体可以更改、调用、委托或花费的内容
  • 证据:测试、模式验证、引用、差异比较、指标或人工审查
  • 反馈:关于证据为何失败的简洁、可操作的描述
  • 停止规则:成功、预算限制、超时、不可恢复的错误或人工升级

图像

验证循环将智能体循环包裹起来,加入外部评分器和显式的通过条件。不要基于置信度循环。要基于证据循环。“智能体说完成了”不是停止条件;“测试通过、链接可解析、模式验证通过、审查者批准”才是。

为什么循环工程不仅仅是提示工程

提示告诉模型在一次调用中做什么。循环则指定了系统在调用之后做什么:

如何观察结果、选择反馈、决定是否继续、持久化进度以及终止

提示质量仍然很重要,但循环将一次性指令转化为受管理的过程。主要的权衡是成本和延迟。每个评分器、审查者或重试都会增加一次模型调用或工具运行。Anthropic 的更广泛指导是:优先选择最简单的可工作架构,只有在性能提升能够证明增加智能体复杂性的合理性时才增加。同样的建议也适用于循环:在失败成本高于验证成本的地方添加循环。

Graph 工程

Graph 工程提出了一个不同的问题:不仅关注智能体做什么,还关注哪个组件被允许下一步运行。步骤用节点表示,允许的步骤用边表示。这些边可以指示顺序、条件分支、并行扇出、汇合、循环和人工中断。状态在整个图中遍历,拓扑结构允许检查所需的控制流。LangGraph 是用于长时间运行、有状态智能体的底层编排基础设施,具有持久执行、状态和人机协同控制,并明确关注对智能体的控制而非工作流抽象。Microsoft AutoGen 的文档非常直接:当你需要对智能体顺序进行精确控制、针对不同结果有不同的下一步、确定性分支或带有循环的复杂多步骤过程时,使用图。Graph 工程师实际做出的决策:

  • 节点边界:哪些工作属于确定性函数、LLM 调用、专家智能体或人工审查步骤
  • 状态模式:每个节点可以读取或更新什么,以及如何合并并行更新
  • 路由条件:哪些证据将工作向前、向后、侧向发送或升级
  • 并发性:哪些可以并行运行,哪些必须汇合,以及哪些共享资源需要协调
  • 循环与出口:哪里允许重试、允许多少次,以及什么使循环安全
  • 持久性:检查点发生在哪里,以及在中断后如何恢复执行

图像

上述画布使得智能体、技能和关系作为一个组合系统可供检查。这里的 Graph 工程意味着基于图的执行工程。这与知识图谱工程不同,后者中的图表示数据中的实体和关系。工作流图表示控制和状态转换。

什么时候值得使用图

当流程有重要的分支、并行工作、审批、恢复路径或多个专家智能体时,图是有价值的。当工作仅仅是“给一个智能体三个工具,让它工作”时,图就没那么有用了。图可以改善调试,但也可能过早地固化假设。如果模型必须动态地制定计划,那么将每条可能的路径强制放入图中可能会使系统更加脆弱,而不是更健壮。

三个层次如何在一个真实系统中协同工作

考虑一个负责生成事实性行业简报的研究与发布智能体。

图像

注意嵌套关系:图运行在执行框架内;一个或多个循环存在于图内部;执行框架为这些循环提供它们所需的状态、工具和评估器。这些类别存在重叠,因为软件层次是重叠的,但每个层次仍然为团队在系统失败时提供了不同的杠杆。

根据失败症状选择合适的工程层

症状 从哪开始 可能的修复
智能体无法安全地访问正确的数据或工具。 执行框架 工具契约、权限、沙箱、上下文注入。
智能体跨会话忘记进度。 执行框架 持久状态、检查点、进度工件、压缩。
第一次尝试通常接近但不可靠。 循环 外部评分器、确定性测试、反馈和有界重试。
智能体在成功后继续工作,或在有证据之前停止。 循环 基于证据的终止状态和预算感知的停止规则。
多个专家必须以受控顺序运行。 显式节点、边、路由条件和汇合。
在多步骤过程中难以定位失败。 图 + 执行框架 与图节点和转换对齐的有状态追踪。
工作流变化太频繁,无法使用固定图。 更简单的执行框架 保持控制由模型驱动;推迟图的形式化。

弱智能体架构背后的昂贵错误

在理解工作之前构建图

团队有时会在观察到能力强大的智能体如何实际解决问题之前,就将业务流程转化为数十个节点。从更简单执行框架的追踪开始,然后形式化稳定的路径。

让同一个模型在没有安全措施的情况下编写和评分

自我审查可能有帮助,但容易受到共同盲点的影响。尽可能优先使用确定性检查,分离审查者上下文,并对高影响操作要求人工批准。

将“不断重试”作为循环规范

无限制的重试循环是成本漏洞。每个循环都需要一个可衡量的目标、新鲜证据、最大尝试次数和一个命名的升级路径。

将执行框架视为垃圾堆放场

更多的工具和记忆并不自动更好。拥挤的工具集增加了选择错误,嘈杂的上下文增加了混乱,宽泛的权限增加了风险。

将编排失败归咎于模型

模型无法可靠地补偿陈旧状态、模糊的工具模式、损坏的 API 或缺失的退出条件。改进拥有该失败的层次。

生产级设计清单

  • 执行框架:工具是否狭窄、有文档且可观察?状态是否持久?权限是否最小特权?操作员能否暂停、检查并恢复运行?
  • 循环:什么证据证明成功?失败时返回什么反馈?允许多少次重试?预算耗尽时会发生什么?
  • :哪些路径必须是确定性的?哪里可以并行工作?哪些状态是共享的?人工门和恢复路径在哪里?
  • 评估:团队能否重放真实追踪、比较版本,并将改进归因于特定更改而非直觉?
  • 运维:是否在生产环境中监控成本、延迟、失败率、干预率和任务级成功率?

记住区别的最简单方法

执行框架工程是为了让模型能够运行而对其进行工程设计。循环工程使迭代可验证、可恢复。Graph 工程使复杂的执行路径显式化并可控制。这三者中的任何一个都不能被其他替代。即使执行框架丢失了状态,一个画得很漂亮的图也不够。然而,即使有最好的执行框架,如果没有证据或停止规则,那也是浪费钱!精心设计的循环在分支、并行和审批嵌入临时代码时仍然难以操作。如果这三层被联合设计,只要团队清楚每层应该解决什么问题,可靠的智能体系统就会诞生。

读者常用的搜索词

  • agent harness vs loop engineering
  • graph engineering for AI agents
  • AI agent orchestration
  • LLM agent architecture
  • production AI agents
  • LangGraph workflows
  • AutoGen GraphFlow
  • agent verification loops

来源与延伸阅读

  • The Anatomy of an Agent Harness - 了解 Agent 执行框架如何将 AI 模型转变为自主工作引擎。探索核心组件:文件系统、沙箱和记忆。
  • Agents SDK | OpenAI API - 了解 OpenAI Agents SDK 如何组合以及接下来该阅读哪些文档。
  • LangChain and LangGraph Agent Frameworks Reach v1.0 Milestones - LangChain 1.0 和 LangGraph 1.0 来了。使用标准化工具、中间件定制和持久状态,更快地构建生产级 AI 智能体。
  • GraphFlow (Workflows) - AutoGen - 在本节中,你将学习如何使用 GraphFlow(或简称为“flow”)创建多智能体工作流。它使用结构化执行并精确控制智能体如何交互以完成任务。我们将首先向你展示如何创建和运行一个 flow。
  • The Art of Loop Engineering - 智能体自动化真实世界的工作,但可靠性能需要的不仅仅是一个好模型,它需要一个为特定任务精心设计的执行框架。本文探讨了核心智能体循环、如何通过堆叠和扩展循环构建更有效的智能体,以及如何使用 LangChain 原语为每一层进行检测。
  • Introducing AutoGen Studio from Microsoft Research - AutoGen Studio 基于微软灵活的、用于编排 AI 智能体的开源框架 AutoGen,提供了一个用户友好的界面,使开发者能够快速构建、测试、定制和共享多智能体 AI 解决方案,几乎无需编码。
  • How to Build a Custom Agent Harness - 有效的智能体是使用与手头任务紧密耦合的执行框架构建的。使用 LangChain 的 create_agent 加上中间件是构建自定义执行框架的最简单方法。本指南涵盖了核心智能体循环以及如何为智能体的用例进行定制。
  • A practical guide to building agents - 设计、编排和部署 AI 智能体的全面指南——涵盖用例、模型选择、工具设计、护栏和多智能体模式。
  • Building Effective AI Agents - 来自 Anthropic 及其客户的关于构建生产级单智能体和多智能体系统的实用建议和指导。
  • 原文链接: x.com/beamnxw/status/208...
  • 登链社区 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~

相关文章

0 条评论