AI Agent循环工程的艺术

langchain 发布于 2026-06-17 阅读 11

文章深入探讨了构建高效AI Agent的循环架构,提出了四个层级:基础Agent循环(模型调用工具完成任务)、验证循环(通过评分器确保输出质量)、事件驱动循环(连接外部事件自动触发Agent运行)和爬山循环(利用运行轨迹分析自动优化Agent配置)。通过LangChain原语(如create_agent、RubricMiddleware、LangSmith部署和Engine)实现这些循环,并强调了人类监督的重要性。文章认为,Agent的真正潜力在于外围循环的构建,尤其是事件驱动和自我改进循环,能带来复合价值。

智能体之所以有用,是因为它们通过在现实世界中执行操作来帮助我们自动化工作。但要可靠地让智能体完成有价值的工作,需要的不仅仅是好的模型,还需要一个精心设计的、适合一系列任务的框架。

核心智能体算法很简单:给 LLM 提供上下文,让它在一个循环中调用工具,直到任务完成。这是最基本的循环,但远不是驱动智能体的唯一循环。Swyx 最近写了一篇关于“循环工艺:堆叠循环的艺术”的好文章,提出了你可以堆叠和扩展循环来构建更有效智能体的观点。

以下是我们对这个堆栈的看法,以及如何使用 LangChain 原语在每个层级进行配置。

循环 1:智能体

从核心来看,智能体只是一个在循环中调用工具直到任务完成的模型。

这就是 LangChain 的 create_agent 提供给你的。选择任意模型,连接工具,你就有了一个可运行的智能体循环。工具 赋予了智能体在现实世界中采取行动的能力。

以我们的内部文档智能体为例(我们将在本文其余部分将其作为贯穿示例)。在第一个循环层级,它接收一个文档改进的请求,模型进行规划和起草修改,并使用工具来克隆仓库、读取文件、编写文档、创建 PR 等。

层级 2:验证循环

智能体循环能完成工作,但并不能总是在第一次尝试时就产生正确或一致的结果。当一致性很重要时,通常有必要将其包装在一个验证循环中,该循环检查输出,并在输出不合格时将反馈发送回模型。

验证循环增加了一个评分器:它根据评分标准检查智能体的输出,如果失败,则将结果连同反馈一起发回。评分器可以是确定性的,也可以是智能体式的(LLM 作为评委 是一个经典例子)。

RubricMiddleware 处理这种模式,或者你可以在 create_agent 上通过 after_agent Hook 来配置。

对于我们的文档编写器示例,评分器在每次尝试后运行测试,检查所有链接是否可访问、所有 CI 检查是否通过,以及改动范围是否仅限于实际请求的内容。不需要手动审查就能捕获这些类型的错误。

一个权衡:增加验证会增加每次运行的延迟和成本。当质量比速度更重要时(这是大多数生产用例的情况),这样做是值得的。

层级 3:事件驱动循环

智能体开发最重要的部分之一是集成层:将你的智能体连接到生态系统,使其能够在后台运行。

事件驱动循环将你的智能体连接到你的生态系统。一个事件触发——一份新文档落地、一个计划触发、一个 webhook 到达——然后智能体运行。智能体不是手动调用的东西;它是一个在更大系统内持续运行的组件。

LangSmith Deployment 支持触发基础设施,包括对 cron 计划webhooks 的支持。cron 的一种流行应用案例是 openclaw 中的“心跳”,它将你的智能体变成一个始终在线、主动的助手。

我们的文档智能体由 Fleet(我们无代码的智能体构建器)驱动。Fleet 的频道计划处理事件驱动和 cron 风格的触发。我们使用一个频道,每当在 #docs-plz Slack 频道中发送消息时,就触发文档智能体。

层级 4:爬山循环

前三个循环自动化工作。第四个(可以说是最重要的)循环自动化改进!

每次智能体运行都会产生一条追踪:关于模型做了什么、它调用了哪些工具、评分器反馈等的记录。这些追踪包含关于哪些有效、哪些无效的高价值信号。爬山循环在这些追踪上运行一个分析智能体,并根据发现结果用改进过的配置重写框架。这可能包括提示/工具的调整或评分器的调整。

在 LangSmith 中,你可以使用 Engine(我们的追踪分析智能体)来配置第四个循环。

以文档智能体类比收尾,我们在文档智能体的追踪上运行 Engine 来检测任何问题。当多个追踪表明存在潜在问题时,会提交一个 issue,要求对有问题的提示或工具进行更改。

这里的关键动作是返回箭头不仅仅循环回顶部——它深入内部并直接更新智能体循环。外部循环的每个周期都使内部循环更有效。

展望未来: 提示和工具的配置是最简单的改进点,但它们不是唯一的选择。对于运行开放权重模型的团队,爬山循环可以反馈到 RL 微调中,使用追踪或评估结果作为训练信号来改进模型本身。像记忆和检索技能这样的辅助上下文也可以以同样的方式改进。循环是模式;它优化什么取决于你。

人类监督与专业知识

自动化并不意味着将人类排除在循环之外。在每个层级,都有自然点,人类监督能增加价值。自动评分器可以检查链接是否可访问;需要人类才能注意到框架对于受众来说是错误的。那种源自背景、经验和品味的判断,正是人类审查发挥价值的地方。

一些专业知识应该被编码到提示/工具本身中,但对于敏感操作,实时的人类审查是必不可少的(想想金融交易、数据库操作等)。LangChain 使得在每个循环中配置这些接触点变得简单:

  1. 在智能体循环中,在进行敏感操作或工具调用前要求人类输入
  2. 在验证循环中,人类可以为敏感工作流充当评分器
  3. 在应用循环中,人类可以在输出返回给最终用户前批准它们
  4. 在爬山循环中,框架改进在部署前可以经过人类审查

所有 LangChain 的开源框架都将添加“人在回路”作为第一类原语

汇总

如果你更喜欢表格视图,下面是这四个循环的堆叠方式:

循环 作用 影响 LangChain 原语
1. 智能体循环 模型重复调用工具直到任务完成 自动化工作 create_agent,任意 LangChain 支持的模型
2. 验证循环 智能体运行,输出根据标准评分,失败时带反馈重试 确保工作质量和正确性 RubricMiddleware
3. 事件驱动循环 事件触发智能体运行,更新真实系统 大规模自动化工作 带有 cron 触发器/webhooks 的 LangSmith Deployment 或 Fleet 频道
4. 爬山循环 生产运行的追踪反馈给分析智能体,改进框架配置 框架改进 LangSmith Engine

这就是循环工程——或者像 swyx 所说的循环工艺——在实际中的样子。AI 领导者如 SteipeteBorisAndrej 都得出了相同的结论:智能体的潜力在于你围绕它们构建的循环。

我们已经思考循环 1 和 2 有一段时间了。但焦点应该转向循环 3 和 4,通过将智能体嵌入到你的生态系统中,并让它们根据你的标准持续改进,价值会复合增长。

Satya 从组织层面阐述了利害关系:尽早构建学习循环的公司,其中人类判断和 token 资本复合增长,将会建立难以复制的优势。

致谢

感谢 VivekMasonHarrisonHunter 的审阅。

参考

  • 原文链接: langchain.com/blog/the-a...
  • 登链社区 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~

相关文章

0 条评论