微信扫码
添加专属顾问
多智能体系统构建的两种对立观点:Anthropic的优化方案与Cognition的警告,究竟谁更有道理? 核心内容: 1. 多智能体系统的定义与基本架构 2. Cognition指出的多智能体架构弊端 3. Anthropic提出的针对性解决方案
昨天最热的的两篇文章是关于多智能体系统构建的讨论。
先是 Anthropic 发布了他们在深度搜索多智能体构建过程中的一些经验,具体:包括多智能体系统的优势、架构概览、提示工程与评估、智能体的有效评估等方面。
另外一边 Devin 的开发商 Cognition 的一个负责人 Walden 发布文章告诫大家不要构建多智能体,指出一些常见但实际效果不佳的方法,特别是多智能体架构的弊端。
这篇文章主要就是结合两篇文章看一下 Cognition 提到的多智能体架构弊端和 Anthropic 给出的解决方案。同时后面也会有两篇文章非常详细的总结。
多智能体系统由多个智能体(大型语言模型 [LLM] 自主地循环使用工具)协同工作组成。
在这种系统中,一个主智能体(或协调器)会根据用户查询规划研究过程,然后使用工具创建并行操作的子智能体,这些子智能体同时搜索信息。这种架构允许主智能体协调整个过程,同时将任务委托给专门的子智能体。
所以具体的步骤一般为:
总的来说 Anthropic 也承认 Cognition 提到的多智能体问题的存在,但是他们也做了很多约束和措施来解决这些问题。
首先是领域选择: 他们将多智能体系统应用于他们认为特别适合并行化和开放式探索的领域——研究任务,而不是普遍适用于所有任务(例如他们承认编码任务就不太适合,Cognition 就是做的编程智能体)。
然后是严格的架构和设计: 采用协调者-工作者模式,并通过详细的提示工程来明确子智能体的任务和职责,以最大程度地减少误解和冲突
最后引入高级上下文管理: 引入记忆机制和通过文件系统传递输出等方式,来解决上下文窗口限制和信息流失的问题。
我们来看看具体的对比。
Cognition的观点: 多智能体架构非常脆弱,关键的失败点在于子智能体可能误解任务并产生不一致的结果,导致最终的智能体难以整合这些误解。智能体需要长期运行并保持连贯对话时,可靠性至关重要,而上下文工程是核心。多智能体系统会导致“决策过于分散,上下文无法充分共享”,从而产生“脆弱的系统”
Anthropic的观点: Anthropic承认多智能体系统确实会带来“智能体协调、评估和可靠性方面的新挑战”。他们也指出,“代理系统中的微小变化会级联为大的行为变化”,这使得为复杂的、需要维护状态的智能体编写代码变得非常困难。代理系统中的错误复合性质意味着,对于传统软件来说的次要问题可能会完全扰乱智能体。早期的智能体确实存在协调问题,例如“为简单查询生成50个子代理”、“无休止地搜索不存在的来源”以及“过度更新互相干扰”。
Cognition的观点: 子智能体即使共享原始任务上下文,也可能因为无法看到其他子智能体正在做什么而导致工作不一致,因为它们的行动基于相互冲突的未预设假设。他们强调原则1是“共享完整上下文和完整的智能体追踪,而不仅仅是单独的消息”,原则2是“行动带有隐含决策,冲突的决策会导致糟糕的结果”。
Anthropic 首先也承认了这些限制:“有些领域需要所有智能体共享相同上下文,或者涉及智能体之间许多依赖关系,目前不适合多智能体系统”。他们特别提到,“大多数编码任务涉及的真正可并行化任务比研究任务少,而且LLM智能体目前还不擅长实时协调和委派给其他智能体”。这与《Don’t Build Multi-Agents》中提到的Claude Code子智能体不并行写代码以及“编辑应用模型”中小型模型误解指令的问题形成了呼应。
然后我们来看一下 Anthropic 是如何克服这些限制的:
Cognition的观点: 推荐最简单的遵循原则的方法是使用“单线程线性智能体”,其中上下文是连续的。他们认为目前的智能体在长上下文、主动的交流方面不如人类可靠,因此多智能体协作只会导致脆弱的系统。
Anthropic的观点: Anthropic则积极拥抱多智能体并行性,认为它是“扩展性能的关键方式”。
他们认为,对于像研究这样开放式、不可预测的问题,多智能体系统特别适用,因为它提供了灵活性,能够根据发现调整方法,并允许子智能体并行操作,从而实现“压缩”和“关注点分离”。他们通过内部评估发现,多智能体研究系统在广度优先的查询上,性能比单智能体系统提高了90.2%。
文章主要围绕以下两项上下文工程(Context Engineering)原则展开:
构建长期运行智能体的理论与挑战 文章指出,LLM智能体框架的表现令人失望,目前还没有单一的构建方法成为标准。特别是在构建严肃的生产级应用时,可靠性至关重要,而上下文工程是实现可靠性的核心。上下文工程旨在动态、自动化地为LLM提供完成任务所需的理想格式信息。
文章以一个常见的将任务分解为多个部分的智能体为例,说明了多智能体架构的脆弱性。
最简单的遵循这些原则的方法是使用单线程线性智能体。在这种架构中,上下文是连续的。然而,对于包含许多子部分的超大任务,可能会出现上下文窗口溢出问题。对于真正长期运行的任务,文章提出了一种更高级的方法:引入一个新的LLM模型,其主要目的是将历史行动和对话压缩成关键细节、事件和决策。这需要大量投入来确定什么是关键信息并构建一个擅长此任务的系统。
Cognition 文章指出,虽然让决策者之间“对话”以解决问题看似合理,就像人类在分歧时会沟通一样,但到2025年,智能体尚不能以比单个智能体更可靠的方式进行这种长上下文、主动的交流。
人类在高效地传达重要知识方面非常高效,但这种效率需要非凡的智能。 自ChatGPT推出后不久,人们一直在探索多个智能体相互协作以实现目标。尽管作者对未来智能体之间协作的可能性持乐观态度,但目前来看,运行多个智能体协作只会导致脆弱的系统。决策变得过于分散,并且智能体之间无法充分共享上下文。
跨智能体上下文传递的难题目前没有人投入专门的精力去解决,并预测当单线程智能体在与人类沟通方面变得更好时,这个问题将“免费”得到解决,从而解锁更大的并行性和效率。
Anthropic 的多智能体研究系统是一个利用多个 Claude 智能体协同工作来更有效地探索复杂主题的系统。该系统旨在通过其研究功能,使 Claude 能够跨网络、Google Workspace 和任何集成进行搜索,以完成复杂的任务。
研究工作涉及开放性问题,很难预先预测所需的步骤,因为研究过程本质上是动态且路径依赖的。多智能体系统特别适合研究任务,因为它要求具备灵活性,以便在调查过程中根据发现进行调整或探索切线联系。
多智能体系统能够通过以下方式提升性能:
然而,多智能体系统也有其缺点:它们通常会快速消耗大量 token。在 Anthropic 的数据中,智能体通常比聊天交互多使用约 4 倍的 token,而多智能体系统则比聊天多使用约 15 倍的 token。因此,多智能体系统需要任务的价值足够高,以支付其增加的性能成本,从而实现经济可行性。此外,一些需要所有智能体共享相同上下文或涉及许多智能体之间依赖关系的领域,目前不适合多智能体系统,例如大多数编码任务。
Anthropic 的研究系统采用协调器-工作器(orchestrator-worker)模式的多智能体架构,其中一个主智能体协调整个过程,同时将任务委托给专门的并行操作的子智能体。
其工作流程如下:
与传统使用检索增强生成(RAG)的方法不同,Anthropic 的架构使用多步骤搜索,动态查找相关信息,适应新发现,并分析结果以形成高质量的答案。
多智能体系统与单智能体系统存在关键差异,包括协调复杂性的快速增长。提示工程是 Anthropic 改进智能体行为的主要手段。
学到的提示原则包括:
Anthropic 的提示策略侧重于灌输良好的启发式规则而非僵硬的规则,通过研究人类专家如何进行研究并将其策略编码到提示中,如将难题分解为小任务、评估来源质量、根据新信息调整搜索方法以及识别何时应注重深度或广度。
评估多智能体系统面临独特的挑战,因为即使起点相同,智能体也可能采取完全不同的有效路径来达到目标12。评估方法需要灵活,既要判断智能体是否达到了正确的结果,也要判断其过程是否合理。
关键评估方法包括:
将智能体系统从原型转化为可靠的生产系统面临显著的工程挑战,因为代理系统中的错误具有复合性质。
主要挑战包括:
尽管面临这些挑战,多智能体系统已被证明对开放式研究任务非常有价值。
用户反馈称,Claude 帮助他们发现了未曾考虑的商业机会,导航复杂的医疗保健选项,解决了棘手的技术错误,并节省了数天的工作时间,因为发现了他们独自无法找到的研究联系。
通过精心的工程设计、全面的测试、注重细节的提示和工具设计、强大的操作实践以及研究、产品和工程团队之间的紧密协作,多智能体研究系统能够可靠地大规模运行。
目前,研究功能最常见的使用案例包括:开发专业领域软件系统(10%)、开发和优化专业技术内容(8%)、开发业务增长和收入生成策略(8%)、协助学术研究和教育材料开发(7%),以及研究和验证人员、地点或组织信息(5%)。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-08-07
AI 产品做出来不再是难题之后
2026-08-07
参数化 Memory 漫谈(纯干货)
2026-08-07
基于 KV-Cache 通信的多智能体系统模块化设计:Agent Primitives 技术解析
2026-08-06
体验完「千问办公」,我开始期待它的后续了
2026-08-06
什么是 Harness 工程?从 AI Agent 到递归自我改进的完整路径
2026-08-06
WorkBuddy进化史:一款AI产品背后,是一套新的团队工作方式
2026-08-06
DeepSeek Harness 真要来了,WorkBuddy 会被干掉吗
2026-08-06
把DeepSeek接入Codex,强大又超有性价比!
2026-05-19
2026-05-16
2026-06-10
2026-06-04
2026-05-14
2026-05-21
2026-05-16
2026-05-28
2026-06-22
2026-05-21
2026-08-06
2026-08-05
2026-08-05
2026-07-31
2026-07-30
2026-07-28
2026-07-28
2026-07-28
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。