OpenAI与Anthropic转向Harness架构,多Agent协同编程成AI软件工程新方向

在包括 OpenAI、Anthropic、Cognition 等顶尖 AI 团队中间,工程师们正在开始将研发的重点从优化 Prompt 转移到编写系统级的 Harness。这一转变标志着 AI 编程领域正经历从单模型对话向系统级工作流的关键演进。OpenAI 高管指出,AI 编程领域正从优化 Prompt 转向编写系统级 Harness,而 Anthropic 团队已经用实际案例展示了这一新方向的巨大潜力。

所谓 Harness,是指为 AI 模型打造的执行环境、测试闭环与反馈基础设施的统称。在执行任务时,系统会动态弹起数百个独立容器环境去平行跑代码和验证结果。这种模式彻底改变了以往依赖单一模型对话完成编程任务的做法,将 AI 编程提升到了系统工程的层面。

16个Claude并行作战:Anthropic的编译器项目揭秘

今年 2 月,Anthropic 团队展示了一个令人瞩目的案例:用 16 个 Claude 并行运行在 2000 个云端 Session 中写出一个 C 语言编译器。这是生成式 AI 在软件工程领域走向多 Agent 协同的一个里程碑。在这个项目中,不同的 Claude 实例扮演了不同角色,形成了一个完整的软件开发团队。

具体分工如下:1 个架构师 Agent 负责设计抽象语法树(AST),4 个编码 Agent 负责不同模块,两个测试 Agent 专门写单元测试,1 个审计 Agent 负责 Review 代码流和安全性。这种角色分工模式使得每个 Agent 都能专注于自己的专长领域,通过并行协作大幅提升了开发效率。

配图

从Prompt优化到系统级Harness:研发重心的根本转移

主导研究员 Nicholas Carlini 指出:「大部分精力都花在了为模型打造环境、测试闭环与反馈基础设施上。」这句话揭示了当前 AI 编程领域的核心变化:工程师们不再单纯追求更好的 Prompt 技巧,而是致力于构建能够充分发挥模型潜力的系统级基础设施。

这种转变意味着,AI 编程的竞争焦点正在从模型本身的推理能力,转向模型与 Harness 的深度结合。那些只靠在本地电脑跑 Python 脚本和简单 API 调用的 Agent 框架,即将全面触顶。未来的竞争将从比谁的模型推理能力更强,转变成比谁的模型潜力释放得更彻底。

多Agent协同:AI软件工程的新范式

Anthropic 的编译器项目展示了多 Agent 协同的巨大潜力。16 个 Claude 实例在 2000 个云端 Session 中并行运行,每个实例都承担着明确的职责。这种并行协作模式不仅大幅提升了开发速度,还通过角色分离实现了质量保障:测试 Agent 独立于编码 Agent 工作,审计 Agent 则从全局视角审查代码流和安全性。

这种多 Agent 协同模式正在成为 AI 软件工程的新方向。与传统的单模型对话相比,多 Agent 系统能够更好地处理复杂任务,通过专业化分工和并行执行实现更高的效率和质量。不同 Agent 之间的协作机制,包括任务分配、结果汇总和冲突解决,正在成为新的研究热点。

未来两到三个月:智能体工作流将成为日常

Nicholas Carlini 预测,未来两到三个月,这样的智能体工作流可能会成为我们的日常。这一判断基于当前技术发展的速度和各大 AI 团队的投入力度。随着 Harness 基础设施的不断完善,多 Agent 协同的编程模式将逐渐从实验性质的项目走向生产环境。

结合 Thibault Sottiaux 的判断,「本地轻指挥,云端重执行」将会成为标配。开发者界面(如 IDE、Terminal、Web UI)将彻底变为操控板,真正的代码重构、测试跑通、浏览器自动化模拟等计算密集任务,全部会在云端动态集群中并行消化,再将最终差异(Diff)和日志流式推回本地。

开发者角色转变:从代码编写者到系统指挥者

这一变革将深刻改变开发者的工作方式。在 Harness 模式下,开发者的主要工作不再是逐行编写代码,而是设计 Agent 的角色分工、定义任务边界、配置测试和审计流程。开发者界面将变成指挥中心,通过本地轻量级操作控制云端的大规模计算资源。

这种转变对开发者提出了新的技能要求。除了传统的编程能力外,开发者还需要理解如何设计有效的 Agent 协作机制,如何配置 Harness 环境,以及如何解读和分析云端返回的 Diff 和日志。AI 编程的工程化程度将大幅提升,软件开发将更像是在指挥一个由 AI Agent 组成的团队。

数据来源:今日头条(原文)

猜你喜欢