AI编程中的循环:从ReAct到多代理编排

mvanhorn 发布于 2026-06-09 阅读 138

文章探讨了AI编程中“循环”(loops)的概念,由Peter Steinberger和Boris Cherny推广。

Image

  1. 本周 AI 编程中最常被重复的句子只有六个单词,而几乎所有提到它的人都没法给出定义。一条推文让整个时间线都为之着迷,于是我针对大家争论的那个词跑了 /last30days。答案是真实存在的,它已有五年历史,而点睛之笔在于:现在昂贵的部分不是模型,而是循环。

那条让时间线着迷的推文

本周,有一条推文让整个 AI 编程时间线都为之痴迷。Peter Steinberger 在 6 月 7 日将其发布,浏览量超过 220 万,而回复区则因它的真实含义而变成了一场混战。

“这是本月提醒:你不再应该提示编程 Agent 了。你应该设计循环,让循环去提示你的 Agent。” @steipete ,2026 年 6 月 7 日

这就是每个人都在引用的话。最说明问题的回复来自 Varadh Jain,他问出了唯一重要的问题:这在实践中是什么样子的?而 Matthew Berman 的回答则成为了整个氛围的基调。

“除了他和 boris,没人知道。” @MatthewBerman ,2026 年 6 月 7 日

这才是真实的故事。并不是循环是未来,而是一个六个单词的短语获得了 200 万浏览量,同时推崇它的人却在回复中争论它的含义。我没有翻白眼,因为我每晚都在运行一个循环,在我睡觉时它会在我大约三十个开源仓库中开启拉取请求。90 秒的研究找回了十五条 Reddit 帖子、二十一条 X 帖子,以及一个令人不安的模式:AI 编程中最响亮的概念,却是大多数重复它的人无法解释的。一群人高喊提示工程已死。另一群人,那些真正在键盘上动手的人,则更加谨慎。

“不是 ralph/goal 循环,那已经是老掉牙了。可能是一种持续协调循环,负责监督其他线程/Agent。” @trashpandaemoji ,2026 年 6 月 7 日

那条回复是所有人发布的最接近正确答案的内容。请记住它。

循环到底是什么

Boris Cherny 在 2024 年 9 月将 Claude Code 作为副项目创建。据报道,如今 GitHub 上所有公开提交中,将近 4% 都来自它。在 6 月 2 日由 WorkOS 举办的 Acquired Unplugged 活动上,他给出了你能找到的关于循环最清晰的定义。

“现在它实际上又升级了,我认为,到了下一层抽象:我不再提示 Claude 了。我有正在运行的循环。是它们在提示 Claude 并决定做什么。我的工作是编写循环。”

Boris Cherny,WorkOS Acquired Unplugged,2026 年 6 月 2 日

所以,简单版本是这样的。循环是你编写的一个小程序,它替你提示编程 Agent,读取 Agent 生成的内容,判断是否完成,如果没有完成,就再次提示它。你不再是那个在循环中打字提示的人。你变成了循环的作者。模型变成了一个子程序。

Boris 用三个阶段来讲述,而将自己放在他的阶梯上是理解它的最快方法。一年前,他通过自动补全手动编写代码。然后他并行运行五到十个 Claude 会话,并分别提示每个会话。现在他根本不提示了。他编写提示 Claude 的循环,而几百个 Agent 读取他的 GitHub、Slack 和 Twitter,并决定下一步构建什么。他有证据。

“在过去 30 天里,我对 Claude Code 的 100% 贡献都是由 Claude Code 编写的。我完成了 259 个 PR。”

Boris Cherny,via Simon Willison,2025 年 12 月 27 日

他在 11 月删除了 IDE,之后再也没打开过。提示工程已死的那群人忽略了一个细微差别:他并不是说工程师过时了。仍然需要有人决定构建什么、与客户交谈、协调团队,而且他说优秀的工程师比以往任何时候都更重要。工作没有消失。它上升了一个高度,从编写代码变成了编写那个编写代码的东西。

光谱:从 ReAct 到协调

回复之所以乱成一团,是因为“循环”掩盖了至少五种不同的事物。下面是阶梯,从最老到最新,这样你就可以避免与别人各说各话。

第一阶段是学术性的 while 循环。2022 年的 ReAct 论文 将其形式化:模型推理、调用工具、读取结果、重复直到完成。一个模型,一个循环,人类在旁边看着。第二阶段是 2023 年的 AutoGPT,它给循环设定了一个目标并让它自我提示,结果以什么也没做就永远循环而闻名。那次失败为此后多年来“Agent 只是个玩具”的观点埋下了种子。

第三阶段是 Trash Panda 称为“老掉牙”的:ralph 循环,由 Geoffrey Huntley 于 2025 年 7 月发布。它简单得令人难以置信,是一个 bash 单行命令,将同一个提示文件反复输送给 Agent。它真正的创新在于纪律:每次迭代都将上下文重置为一组固定的锚点文件,而不是让对话不断增长。Huntley 用大约 297 美元就用它构建了一整套编程语言。第四阶段将其产品化:在 2026 年春季,Codex 和 Claude Code 都推出了 /goal 命令,它运行 ralph 循环,直到一个小型验证模型确认任务完成。

第五阶段才是 Boris 和 Steinberger 真正的意思,它确实是全新的,而不是简单的重命名。有四件事发生了变化。循环成为了工作单元,而不是任务。循环开始并发地、按计划地监督其他循环。调度取代了人工启动,因此循环在基础设施的时间上运行,而不是在你的注意力上。持久性变得明确,通过 git 支持的状态和崩溃恢复,因为这些东西必须能在重启后存活。ralph 假设你的终端一直开着。2026 年的版本假设它不会。所以 Trash Panda 说对了两次:单 Agent 的 ralph 循环是老掉牙的,而构建在其之上的多 Agent 协调循环才是新事物。

它就是个戴了帽子的 cron 任务

整个语料库中最好的怀疑论者观点是四个单词,发布在某人对循环将成为未来趋势的狂热吹捧之下。

“Cron 任务最近有个有趣的重新包装。”

X 回复,循环讨论,2026 年 6 月

这值得一个直接的回答,而不是回避,因为这句话说对了一半。是的,调度层就是 cron。Boris 实际上就是在 cron 上运行他的。Claude Code 中的 /loop 命令底层使用的就是 cron。如果你对循环的全部定义就是按定时器运行的东西,那么没错,我们在 1975 年就发明了那个,你可以回家了。

Cron 从未拥有的是中间的那部分。Cron 任务运行一个固定的脚本。循环运行一个模型,该模型查看当前状态,决定下一步做什么,执行它,检查是否成功,并决定是否继续。这个决定是 Agent 做出的,而不是你,也不是硬编码的分支。将这些堆叠起来,让一个循环调度并监督其他循环,给它们提供持久的共享状态,你就有了 cron 无法表达的东西。诚实的框架既不是“循环是新的魔法”,也不是“循环只是 cron”。而是:循环是 cron 加上一个决策者,而有趣的工程是你围绕这个决策所包装的一切,以确保它不会跑偏。

当你实际构建一个循环时,它是什么样子

理论够了。入门很简单,只需一行命令。Claude Code 推出了 /loop,而 Boris 自己的例子就是标准的起点。粘贴这个,然后更改名词。

/loop 盯紧我所有的 PR。自动修复构建问题,当评论进来时,使用一个工作树 Agent 来修复它们。

这是他更完整的配方。几天后,Boris 发布了五条建议,关于如何让 Opus 自主运行数小时或数天。

用他自己的话说,五条建议:使用自动模式处理权限,这样 Claude 就不会请求批准;使用动态工作流让 Claude 协调成百上千个 Agent 来完成一项任务;使用 /goal 或 /loop 来推动 Claude 继续前进直到完成;在云端使用 Claude Code,这样你就可以合上笔记本电脑;确保 Claude 有一种方法来端到端地自我验证其工作。@bcherny ,2026 年 6 月

第五条建议正是炒作忽略而实践者痴迷的地方:一个循环的可靠性取决于其检查自身工作的能力。

这就是整个想法的缩影。你没有编写步骤。你编写了意图和停止行为,然后循环在每个时间步提示 Agent。在 TikTok 上,这个框架对普通观众来说表达得很清晰。

“循环模式是最明确的迹象之一,表明 AI 编程正在从一次性提示转向后台操作。” @ai.native.founder 在 TikTok 上,2026 年 6 月

最深入的实践是 Steve Yegge 的 Gas Town,于 1 月推出:由一位市长 Agent 协调的二十到三十个 Claude Code 实例,加上运行持续循环的巡逻 Agent,状态存储在 git 中,这样工作就能在崩溃后生存。这就是 Trash Panda 想要表达的“监督其他线程的持续协调循环”,已经发布并开源了。

但研究中最实用的教训是:一个循环的好坏取决于其自我检查的能力。增长最快的子主题不是协调,而是验证。

“你的编程 Agent 可以快速行动,但糟糕的提交也会快速累积。” @DanKornas ,2026 年 6 月

Kornas 正在发布 roborev,这是一个在后台审查每个提交并在上下文还新鲜时将结果反馈给 Agent 的工具。一个编写代码而没有反馈的开放循环,是一台生成自信错误(confident mistakes)的机器。一个编写、运行、读取结果并纠正的循环才是真正有效的。循环本身不是魔法。循环内部的反馈才是。

剧情反转:循环现在成了昂贵的部分

这里,研究从哲学问题转向了财务问题。整个 Agent 神话中最犀利的破灭来自于一位在职工程师。

“今年我部署的每个 AI agent 就是一个 for 循环、一个 LLM 调用,以及一个围绕 JSON 解析的 try/catch。唯一具有 Agent 特性的东西,是月底的 Anthropic 账单。” @rohit_jsfreaky ,2026 年 6 月

那张账单可不是开玩笑。本月的收据:Uber 在四个月内花光了年度 AI 预算后,将工程师们使用 Claude Code 和 Cursor 的预算限制为每人每工具每月 1,500 美元。一旦模型以几乎零成本编写代码,成本就转移到了运行它的循环上。

“AI 编程中最昂贵的不再是编写代码,而是管理 Agent 循环。” @runes_leo ,2026 年 6 月

而所有在生产环境中的人都害怕的失败模式,就是那个永不停止的循环。

“没有防护措施,你就会有无限循环和超出预算几个数量级的账单惊喜。” @cv_usk ,2026 年 6 月

这就是为什么 2026 年所有关于循环的严肃文章都聚焦于相同的三个硬性停止条件:最大迭代次数、无进展检测,以及 Token 或美元预算上限。关于循环的浪漫版本是:你编写循环,一千个 Agent 在一夜之间构建起你的公司。生产版本是:你编写循环,而你的大部分工作是确保它们停止。Gartner 将 Agentic AI 置于期望膨胀的顶峰,实际上只有大约 17% 的组织在部署 Agent。时间线上的热议与实际情况之间的差距,才是真正的现状。

不是循环,是技能

以下是我自己的看法,也是我在观察了一周之后得出的结论。循环是管道。真正的资产是它所调用的技能。

Steinberger 另一个反复出现的观点与循环观点相辅相成,并且是更持久的那一半:如果你做一件事超过一次,就把它变成一个自动化的技能;如果你做一件困难的事,事后把它变成技能,这样下次就免费了。一个内部没有可复用技能的循环,只是一个围绕陌生人的 while-true 循环。一个调用一组精炼、经过测试、命名的技能的循环,是一个能产生复利的系统。那位实际在转换的 Reddit 实践者说得最好。

“很多人在 Twitter 上翻白眼,但我竖起了耳朵。”

r/ChatGPTCoding,2026 年 6 月

所以,“循环到底是什么”这个问题的答案,并不是关于提示工程已死的激进观点。而是这样:停止成为循环里的那个东西。把循环写一次,给它值得调用的技能和反馈以便它能自我检查,设置上限让它停止,然后让它在 cron 上运行,而你则去决定下一步构建什么。Steinberger 和 Boris 从两个角度描述的是同一个东西。真正知道答案的只有那些已经构建了一个的人。好消息是,从本月开始,入门方式就是一个斜杠命令。

研究中的关键模式

  • 循环是 cron 加上一个决策者:每次时间步,是由模型(而不是硬编码的分支)来选择下一步行动。
  • 发展脉络是真实的:2022 年的 ReAct,2023 年的 AutoGPT,2025 年的 ralph,2026 年春季的 /goal,现在的协调循环。单 Agent 的 ralph 是老掉牙的;多 Agent 监督是新的一层。
  • 循环的好坏取决于其反馈。持续的审查和验证门控是让循环值得信赖的关键。
  • 昂贵的资源从 Token 转移到了循环管理。设定迭代上限、检测无进展、设置美元预算。
  • 循环内部的可复用单元是技能,而不是提示。调用精炼命名的技能的循环能产生复利;每次都重新推导一切的循环只会烧钱。
  • 原文链接: x.com/mvanhorn/status/20...
  • 登链社区 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~

相关文章

0 条评论