免费POC, 零成本试错
FDE知识库

FDE知识库

学习大模型的前沿技术与行业落地应用


收藏

基于 KV-Cache 通信的多智能体系统模块化设计:Agent Primitives 技术解析

发布日期:2026-08-07 08:06:23 浏览次数: 1823
作者:智见AGI

微信搜一搜,关注“智见AGI”

推荐语

传统多智能体系统开发如“手工作坊”成本高、架构难复用,伊利诺伊大学团队提出Agent Primitives模块化设计,用KV-Cache直接对话解决通信衰减难题。

核心内容:
1. 传统MAS开发与通信的痛点(成本高、架构难复用、自然语言通信信息衰减)
2. 三种可复用Agent Primitives原语设计(评审、投票选择、规划执行)
3. KV-Cache直接通信机制(替代自然语言,通过键值缓存拼接传递信息)

杨芳贤
53AI创始人/腾讯云(TVP)最具价值专家

 

 

解读论文:Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems
作者:Haibo Jin, Peng Kuang, Ye Yu, Xiaopeng Yuan, Haohan Wang
(伊利诺伊大学香槟分校) · 发表:ICML 2026(PMLR 306)
链接:https://arxiv.org/abs/2602.03695
一、业务痛点:手搭的多智能体系统,为什么又贵又不稳

今天大部分多智能体系统(MAS)的开发方式,本质上还是"手工作坊":针对某个任务设计几个角色,为每个角色写一套提示词,规定好谁先发言、谁做裁判、消息怎么传。换一个任务,这套架构往往要推倒重来。这带来两个直接的工程成本:架构复杂度随任务复杂度线性甚至超线性增长,团队里没有一套可复用的"标准件"。

更隐蔽的问题出在通信层。绝大多数 MAS 靠自然语言在智能体之间传递信息,这样做的好处是人类可读、便于调试,但代价是长上下文、多轮交互中的信息衰减。论文用两组压力测试量化了这一点:把一条辅助指令插入到长文本的中间位置时,用自然语言通信的方案指令遵循率从两端的 80%+ 骤降到 15.6%;在数学推理任务中逐步注入无关推理片段作为噪声,注入 25 句无关内容后,自然语言通信方案的准确率从 100% 跌到 40%。也就是说,智能体之间用自然语言传话,传得越多、传得越久,出错概率越高——这对任何依赖多轮智能体协作的生产系统都是实打实的可靠性风险。

二、核心结论:把 MAS 拆成三种可复用的"原语",靠 KV-Cache 直接对话

论文的核心思路是把神经网络设计中"用残差块、注意力头这类可复用组件搭建复杂模型"的思路,平移到多智能体系统架构设计上。作者观察到,现有 MAS 架构虽然千差万别,但内部的计算模式可以归纳为少数几种反复出现的结构单元,并据此实例化了三种 Agent Primitive(智能体原语):

  • Review Primitive(评审原语):一个 Solver 和一个 Critic 构成的迭代自我批评回路,Critic 只给反馈、不直接改答案。
  • Voting and Selection Primitive(投票选择原语):多个 Solver 并行产生候选方案,一个 Selector 在潜在表示层面(而非文本层面)做聚合选择。
  • Planning and Execution Primitive(规划执行原语):一个 Planner 生成结构化的潜在计划,一个 Executor 据此执行,不重新设计计划。

每个原语内部的智能体之间不通过自然语言传话,而是直接拼接 KV-Cache(键值缓存),把前一个智能体处理完序列后留下的键值张量,通过 RoPE 位置重编码后拼接到下一个智能体的系统提示词 KV-Cache 之后,让后者在此基础上直接续写。这样做的前提是所有参与的智能体必须共享同一套模型参数和位置编码方案(下文会展开这一约束)。

三个原语对外都暴露和标准 LLM 智能体一样的接口,因此可以像积木一样即插即用、任意组合。为了让系统自动化,论文引入一个 Organizer(默认用 GPT-5.2 担任)根据输入查询自动选择并编排原语,背后由一个收录了 45 条已知 MAS 结构(含 Multi-Agent Debate、DyLAN、Self-Refine、AFlow、MAS-GPT 等经典方案)的 Knowledge Pool 提供检索式结构参考。

图 1. Agent Primitives 整体架构总览图。(来源:论文原图,arXiv:2602.03695)
图 1. Agent Primitives 整体架构总览图。(来源:论文原图,arXiv:2602.03695)
三、评测目标与维度:为什么比、比什么

作者设计的评测体系覆盖三个任务大类、8 个基准、5 个开源模型底座(Qwen3-4B/8B/14B,DeepSeek-R1-Distill-Qwen-32B/Llama-70B),对比维度包括:

  • 性能:准确率(%),相对单智能体基线的提升幅度。
  • 效率:Token 用量、单次查询平均推理耗时(秒)。
  • 成本归一化效率:每 0.01 美元花费对应的准确率百分点(cost-normalized efficiency)。
  • 稳定性:跨模型底座(Qwen 系 vs LLaMA 系 vs DeepSeek 蒸馏系)的方差表现。
  • 消融:Organizer 选择(GPT-5.2 vs Claude-4 vs 随机)、Knowledge Pool 有无、RoPE 位置重编码有无。

选择这套维度组合的用意是:准确率提升必须叠加效率数据一起看,否则"更高分"很可能只是"更贵"的另一种说法,这正是自然语言 MAS(TextMAS)长期被诟病的地方。

四、验证过程与数据表现

相对单智能体与文本通信 MAS 的提升

在 Qwen3-8B 底座上,Primitives-based MAS 平均准确率达到 75.3%,相对单智能体基线(58.8%)提升 16.5 个百分点;对照组 TextMAS 的平均提升只有 7.3 个百分点,且方差明显更大。在最难的 AIME25/AIME24 上,小模型(Qwen3-4B)的提升幅度甚至达到 20-26.7 个百分点。

相对既有 MAS 方法的横向对比

在统一使用 Llama-3-70B-Instruct 的设定下,作者对比了 LLM-Debate、Self-Refine、Quality-Diversity、SPP、AgentVerse、GPTSwarm、DyLAN、MAS-GPT 共 8 个代表性 MAS 基线:

方法
MATH
GSM8K
HumanEval+
GPQA
单智能体
50.60%
92.40%
75.80%
36.70%
MAS-GPT(此前最优)
68.70%
93.40%
78.90%
37.60%
Primitives-based MAS
72.40%
93.80%
82.30%
53.20%

GPQA-Diamond(研究生水平知识问答)上的优势最为悬殊:53.2% 对比此前方法普遍在 33.6%-40.2% 区间,超出接近 13 个百分点。

效率数据:真正的差异化优势

以 Llama-3-70B-Instruct 为例(论文 Table 15),TextMAS 的输出 token 用量普遍是单智能体的 2-6 倍,而 Primitives-based MAS 的 token 用量与单智能体基本持平甚至更低(例如 GSM8K 上 934 → 1,017 token);跨全部 5 个模型底座统计,Primitives-based MAS 相对 TextMAS 的 token 用量和推理延迟均降低约 3-4 倍,相对单智能体推理仅增加 1.3-1.6 倍开销。

值得一提的是 LatentMAS(另一种同样使用 KV-Cache 通信的对照方法)在 token 效率上有时甚至优于 Agent Primitives,但代价是稳定性——在 DeepSeek-R1-Distill-Llama-70B 上,LatentMAS 相对单智能体基线平均准确率下降了 10.1%。这组对比揭示了本文方法的定位:它是"保守但稳健"的 KV-Cache 通信策略,用适度的效率让渡换取跨模型底座的稳定性。

消融实验:RoPE 重编码是硬约束,不是锦上添花

去掉 RoPE 位置重编码后,Qwen3-8B 上的 Primitives-based MAS 在 AIME25 上从 73.3% 跌到 60.0%;而在 DeepSeek-R1-Distill-Llama-70B 上跌幅更为剧烈,AIME25 从 56.7% 跌到 26.7%,HumanEval+ 从 85.3% 跌到 31.1%,降幅超过一半。这说明 KV-Cache 拼接时的位置重编码不是可选的工程细节,而是保证跨智能体潜在通信有效性的必要条件。

另外,移除 Knowledge Pool 后,Qwen3-8B 在 AIME25 上准确率下降约 10 个百分点;即便是训练/检索池中完全没有出现过的分布外任务(ARC-Challenge),Organizer 仍能带来 +2.3% 至 +2.5% 的提升,且引入检索池后再提升约 1.2 个百分点——说明这套机制具备一定的跨任务迁移能力,不完全依赖记忆库覆盖度。

五、与相关工作的对比

在"潜在通信"这一细分方向,论文明确对比了三条并行路线:ThoughtComm(Zheng et al., 2025)用可训练的编解码器学习共享潜在空间,需要额外训练;Cache-to-Cache(Fu et al., 2025)研究跨模型的语义投影转移,试图解决 KV-Cache 无法跨模型迁移的问题;Latent-MAS(Zou et al., 2025)同样传递 KV-Cache 但采取更激进的分块压缩策略。Agent Primitives 与这三者的关键差异在于:它不是单纯优化"信息怎么传得更好",而是用 KV-Cache 通信直接实现原语内部的计算结构本身,通信机制和架构抽象是一体的。

在"自动化 MAS 构建"这条脉络上,AFlow、ADAS、MAS-GPT 等工作已经在探索用 LLM 自动生成任务专属的智能体架构,但它们生成的仍然是"智能体级别"的手工设计产物;Agent Primitives 的 Organizer 是在"原语级别"做选择和编排,粒度更粗、复用性更强,这也是论文反复强调的"关键差异"(Key Differences)所在。

六、适用边界与局限性

硬约束:只支持同构模型底座。KV-Cache 通信生效的前提是"输入-输出对齐假设"——参与通信的智能体必须共享相同的模型参数和位置编码方案,论文明确表示实验"仅限于使用同一 LLM 的智能体"。这意味着如果企业级系统需要混合调用不同厂商模型(比如同时接入 GPT、Claude、Qwen 智能体),本文的核心通信机制无法直接套用,需要退回自然语言通信,或等待跨模型语义迁移技术(如 Cache-to-Cache)进一步成熟。

Organizer 质量直接决定系统上限。随机选择原语组合会导致准确率下降 5-12.4 个百分点,开源 Organizer(Qwen3-32B)也明显弱于闭源模型;这意味着 Organizer 本身是一个不可忽视的成本项和潜在单点故障。

原语集合固定为三种,不覆盖去中心化协商、动态拓扑演化等更复杂的协作模式——这是一个有意为之的简化,作者聚焦的是"可复用的最小计算单元",而不是"覆盖所有 MAS 模式的通用框架"。

验证任务集中在数学、代码、问答,这类任务天然有明确的正确性判据,Voting/Review 这类原语容易发挥作用;对开放式生成、创意写作等缺乏明确对错标准的任务,原语设计的适配效果本文未做验证。

七、技术与商业价值

对已经在同一模型底座上运行多智能体链路的团队而言,这篇论文提供了一条同时降本、提速、还提升准确率的具体路径:3-4 倍的 token/延迟降低,加上两位数的准确率提升,这在生产环境里是少见的"双赢"而非"性能换成本"的权衡。GPQA 这类高难度知识问答上超出 13 个百分点的提升,也说明该方法对"需要深度推理"的高价值查询场景收益更为明显,值得优先在这类场景试点。

更长远的价值在于给"多智能体系统工程化"提供了一个类比坐标系:用残差块、注意力头类比原语,意味着未来的 MAS 平台设计可以像深度学习框架一样,沉淀出一套标准算子库,而不是每个任务都从零手搭。对正在做企业级智能体平台的团队来说,这个类比本身就值得纳入架构设计的参考框架。

八、选型与落地建议
  • 同构模型底座、成本敏感、任务偏推理密集型(数学/代码/知识问答)的场景:这是 Agent Primitives 最合适的落地场景,建议直接对标论文的三种原语实现,评估从 TextMAS 迁移过来的收益。
  • 多厂商、多模型混合部署的场景:KV-Cache 通信机制目前不适用,建议关注 Cache-to-Cache 一类跨模型语义迁移技术的进展,短期内仍以自然语言通信为主,但可以借鉴"Review / Voting / Planning-Execution"这三种结构抽象来精简手工设计的智能体角色数量,降低架构复杂度,即便通信层暂时无法升级为潜在表示。
  • 已有大量历史 MAS 设计沉淀的团队:Knowledge Pool 的构建方法值得复用——45 条结构的检索式指导已经证明能带来 5-12 个百分点的增益,如果团队内部积累了更多历史工作流设计,扩大检索池规模是一个低成本的优化方向。
  • Organizer 选型:论文的成本归一化分析显示,用相对便宜的 Llama-3-70B 做 Organizer,在 MATH 上的成本效率(258.6 分/0.01美元)反而高于用昂贵的 GPT-5.2(129.3 分/0.01美元),这提示在准确率要求不是极端严苛的场景下,Organizer 不必用最贵的模型,值得做一次针对自身任务分布的成本-性能扫描再定型。

    53AI,企业落地大模型首选服务商

    产品:场景落地咨询+大模型应用平台+行业解决方案

    承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业

    联系我们

    售前咨询
    186 6662 7370
    预约演示
    185 8882 0121

    微信扫码

    添加专属顾问

    回到顶部

    加载中...

    扫码咨询

    扫码登录
    登录即表示您同意《53AI网站服务协议》
    服务协议

    欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。

    在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。

    一、 定义

    本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。

    会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。

    知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。

    二、 账号注册与登录

    登录方式:本网站支持以下登录方式,您可根据实际情况选择:

    微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。

    手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。

    账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。

    实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。

    未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。

    三、 服务内容与规范

    知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。

    服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。

    禁止行为:您在使用服务时不得实施以下行为:

    利用技术手段批量爬取、下载、转存知识库内容;

    将知识库内容用于商业目的或未经授权地向第三方传播;

    干扰本网站正常运行或侵犯其他用户合法权益;

    发布违法违规信息或从事违反公序良俗的活动。

    四、 知识产权声明

    权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。

    有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。

    侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。

    五、 个人信息保护

    我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。

    您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。

    您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。

    六、 免责声明

    内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。

    不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。

    第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。

    七、 违约责任

    如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。

    如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。

    八、 法律适用与争议解决

    本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。

    因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。

    九、 其他

    本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。

    本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。

    我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。


    已查阅