微信扫码
添加专属顾问
马斯克的xAI发布Grok 4大模型,开创"多智能体内生化"新范式,AI军备竞赛进入新阶段。 核心内容: 1. Grok 4的核心创新:多智能协作训练机制 2. 新一代大模型军备竞赛与算力需求爆发 3. HLE基准测试揭示模型真实能力边界
就在几天前,马斯克的xAI正式发布Grok 4大模型,号称世界最强AI。
我们团队这几天仔细研究了Grok 4相关的研究资料,有一些新发现,对未来AI产业趋势及算力展望具有一定价值,遂整理成此文,用一篇文章的篇幅给大家介绍清楚Grok 4的发展脉络。
核心要点:
Grok 4的核心创新是在训练阶段引入多智能协作,即“多智能体内生化”
OpenAI o1实现了“思维链内生化”;Gemini实现了“多模态内生化”;Grok 4则是率先走出了“多智能体内生化”的一步,将进一步推高基座模型的性能上限,Agent走向2.0时代
预训练、后训练、测试时均存在Scaling Law。过去两年以预训练为主,今年开始后训练、测试时推理需求快速增长,新一代大模型军备竞赛已启动,算力需求持续指数级增长
Grok 4在各大Benchmark表现出众,但Benchmark测试污染严重,结果仅供参考,经实测发现Grok 4现阶段编程能力较弱,未来将单独推出Coding版本模型
下面我们正式开始。
(1)大力出奇迹,性能登顶各大Benchmark
Grok 4是在xAI自研的Colossus超算上训练而成的,其训练规模远超前代模型,计算资源投入为 Grok-2 的100倍、Grok-3 的 10 倍,实现了推理性能、多模态能力和上下文处理能力的跃升。
Grok 4拥有两个版本:Grok 4(月费30美金)、Grok 4 Heavy(月费300美金,是的你没看错,300美金!)。其中Grok 4是单Agent版本,而Heavy是多Agent协作版本,能够同时启动多个Agent并行工作,并最后整合结果。
图:Grok 4 vs Heavy,AlphaEngine
经过实测,Grok 4在多个Benchmark上均取得了优秀的成绩。在GPQA、AIME25、LCB(Jan-May)、HMMT25、USAMO25等多项测评中,Grok 4都超越了o3、Gemini 2.5 Pro、Claude 4 Opus等模型。
相比这些Benchmark而言,更值得关注的是在被称为AI界"最后审判"的HLE(人类最后考试)中,Grok 4 Heavy获得了44.4%的成绩,此前的冠军Gemini 2.5 Pro只有26.9%,成功率显著提升。
HLE为什么这么重要,它到底是什么来头呢?
(2)HLE:人类最后的考试
随着大模型能力的提升,许多最新模型能够在现有Benchmark表现出极高的准确率,导致这些基准失去了分辨模型智能水平的能力。
因此,Center for AI Safety和Scale AI在25年初提出了HLE,即“人类最后的考试”,旨在成为最后一个广泛覆盖学术能力的封闭式基准测试,专注于评估模型在人类知识前沿的表现。
HLE包含2500个极具挑战性的问题,覆盖数学、人文学科、自然科学等超过100个学科,设计为无法通过简单的互联网检索快速回答的问题。
在Grok 4推出之前,市面上最强大的模型在HLE上的表现普遍非常不理想,比如GPR-4o的准确率仅为2.7%。
有趣的是,大模型在给出错误回答的时候,往往表现出极高的置信度,这说明了大模型在处理复杂问题上的短板。
这么说大家可能还感觉不够直观,我截取了HLE测试集中的几个样例问题,大家可以试着解答一下,看看自己能否超越Grok 4 Heavy。
图:HLE问题,考察图文理解,古代文字破译
图:HLE问题,考察数学能力
图:HLE问题,考察计算机,图论
图:HLE问题,考察生物化学
(3)Grok 4的核心创新:多智能体内生化
Grok 4 Heavy 的核心创新在于训练阶段即引入多智能体协作,我们将其称为“多智能体内生化”。
何谓“内生化”?我们来回顾一下过去3年大模型的发展历史,你一定会一目了然。
还记得在22年风靡一时的CoT思维链吗?当时人们为了让大模型达到更好的回答效果,需要引入一些提示词来诱发大模型进行深度思考,比如“Let's think step by step”。
当时,CoT能力属于Prompt工程,是独立于大模型能力之外的一种提示词技巧。
图:2022年的大模型分享,CoT
然后在24年9月,OpenAI推出的o1模型首次明确将深度思考能力“内化”到大模型中,确立了从Scaling Training到Scaling Inference的训练新范式。
图:2023年的大模型分享,Q*及慢思考
图:2024年的大模型分享,OpenAI o1的“深度思考内生化”
随后25年2月的DeepSeek进一步验证了将“CoT能力内化”确实能够大幅提升大模型的推理性能。
图:2025年的大模型分享,DeepSeek R1技术原理
回顾历史后,我们能清晰地发现大模型发展的一条主线:大模型逐渐把Prompt工程、深度思考等能力纳入到训练过程中,实现能力内生化。
好比两个学生,其中一个拿着参考书进行开卷考试,另一个真正学习并掌握了知识(内生化)。相比之下,后者往往能考出高分并且发挥更稳定。
融会贯通一定是优于刻板记忆和机械调用的。
Grok 4这次的最大突破,在于将Agent能力也进行了内生化,融入到训练过程中。
Grok 4在训练中融合了Agent调用及实时搜索等能力,将多个Agent之间的debate和self-check变成了大模型的内生能力。
今年5月的一篇论文详细阐述了从AI Agent到Agentic AI的发展趋势,强调从单一任务的执行迈向多代理协作的新范式。
Grok 4这次显然更往前走了一步,率先将Agentic AI所特有的多代理协作、动态任务分配、持久记忆等能力训练进入大模型中,让AI内生化地支持Agentic AI,从而更有效的解决复杂任务。
(4)深度思考内生化、Agent内生化、多模态内生化
在OpenAI o1出现之前,人们为了激发大模型的深度思考能力,往往需要学习大量提示词工程技巧,但现在这些技巧已经不再重要。
在Grok 4 Heavy出现之前,人们会通过Manus等Agent工具让大模型处理复杂任务。当Agent能力内生化的方向得到确立,越来越多的AI大厂将加入其中,竞争会愈发激烈。
未来通用型Agent产品需要有新的定位,把重心聚焦于工具链的完备设计、业务知识的注入、记忆层的辅助等,基于更加聪明的内核,解决更多复杂的任务。
其实除了“Agent能力内生化”之外,大模型发展还有一条主线,即:多模态内生化。
通俗点来讲,就是未来大模型应该能够输入任何模态的数据,也能够输出任何模态的数据。
大模型的I/O不应该只能是文本或图片,也应该包含视频和音频。
这在业界被称为Omni Model,算是大家公认的目标。
值得注意的是,这里的“内生化”和大家平时体验到的接收语音输入的大模型有着本质区别。多模态内生化指的是大模型能够原生的理解图片、音频、视频,而非先转码成文字之后再进行理解。
截至目前,OpenAI的所有模型尚不支持视频模态输入,而Google Gemini目前已经能够支持视频模态的输入和输出,毕竟Google旗下的Youtube拥有世界上最大的视频资源库,大家能够从最近推出的Veo 3的惊艳效果上具象化的感受到这个巨大的竞争优势。
图:Veo 3生成的AI视频
既然AI能力内生化是行业发展的大势所趋,那么我们应该清醒的意识到,大模型应用类公司的核心壁垒只有2点:其一是私域数据的持续积累;其二是对应用场景的深度洞察。
(5)AI Coding能力的认知分歧,以及Base44带来的启发
Grok 4上线后,经历了全球网友的检阅,实测反馈分歧较大,和xAI官方公布的跑分结果有着一定出入。
其实这点是容易理解的,现在主流Benchmark测评污染太严重。只要一个测评的问题集流传到互联网上,就有可能被加入到大模型的训练集中,导致测评误差。
以前研究员可以通过控制大模型训练集的数据范围来解决测试集污染的问题,但这次Grok 4把实时搜索和Agent能力都内化到大模型中去了,数据污染的边界无法得到有效的人为控制,没有人能够保证Benchmark的关键语料是否漏进训练数据中。
所以Benchmark看看就好,实际还是得看海量用户的实测体验。
根据大家的反馈,Grok 4在代码生成能力上目前还有所不足。Grok 4生成的代码往往存在依赖库丢失、界面UI粗糙等问题。
在使用Grok 4编写游戏时,经常把最重要的pygame库都给丢失了,这也是大家诟病Grok 4的核心原因之一。
马斯克显然也意识到了目前模型的短板,因此放出预期,在未来几个月内将会发布coding模型,值得期待。
大家对大模型Coding能力的理解其实存在一种误区。
人们心目中一个强大的coding model往往是那种能够刷榜LeetCode,精通各种算法的奥赛型选手。
但其实落地到商业场景,人们真正需要的coding model其实是一个能够整合各种Github repo资源,构建项目级应用的实战派选手。
这其实也是最近炙手可热的Base44获得成功的主要原因之一。
Base44是一家专注于Vibe Coding(氛围编程)的AI初创企业,由以色列程序员Shlomo于2024年12月创立,仅运营6个月即以8000万美元(约5.7亿元人民币)被以色列软件巨头Wix收购,成为该领域首笔并购案例。
相比其他AI Coding产品而言,Base44更加专注于通过自然语言交互生成完整软件系统,覆盖数据库搭建、身份验证、数据分析等功能。
图:Base44核心数据,AlphaEngine
Base44的目标用户主要是无编程经验的普通开发者,他们能够使用Base44一站式创建完整的项目,这是广大用户最朴素的需求。
随着Grok 4将更多实用的Agent能力内生化到模型中,相信未来AI能够真正实现这个效果,媲美全栈高级程序员。
(6)Grok 4之后的全球算力需求展望
今年年初以来,海外大模型发展提速,你方唱罢我登场。
图:AI四人转
海外AI基础模型持续提速的根源,在于算力资源的持续投入。据称xAI每个月要消耗10亿美元的资金,预估2025年全年总支出将高达130亿美金,这一数字远超行业平均水平。
Grok4是在xAI自建的Colossus超算中心上训练而成的,依托20万张GPU集群,其计算资源投入是Grok2的100倍、Grok3的10倍,上下文窗口扩展到了25.6万tokens,远超Claude 3 Opus。
Grok4将Colossus超算的80%算力投入推理训练中,这也是直接推动其在HLE基准测试中达到44.4%的核心原因。
Colossus超算中心位于美国田纳西州孟菲斯市,目前已部署35万块H100,总浮点运算能力达到100 EFLOPS,预计下半年将扩展到超过50万张卡。
图:AI巨头算力布局
预训练、后训练、测试时均存在Scaling Law。过去两年以预训练为主,今年开始后训练、测试时推理需求快速增长。
多Agent内生化开了算力需求增长的新维度,在可见的未来将会给全球算力需求带来几何级增长。
图:黄仁勋提出的Scaling Law三重奏得到验证
(7)结语:Agent内生化趋势明确,新一代AI训练军备竞赛已启动
随着Grok 4打响了Agent能力内生化的第一枪,各个AI大厂大概率会跟进,训练端仍然有较大的Scaling空间,新一代大模型训练的军备竞赛已然开始。
让我们一起拭目以待!
(文毕)
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-08-07
AI 产品做出来不再是难题之后
2026-08-07
参数化 Memory 漫谈(纯干货)
2026-08-07
基于 KV-Cache 通信的多智能体系统模块化设计:Agent Primitives 技术解析
2026-08-06
体验完「千问办公」,我开始期待它的后续了
2026-08-06
什么是 Harness 工程?从 AI Agent 到递归自我改进的完整路径
2026-08-06
WorkBuddy进化史:一款AI产品背后,是一套新的团队工作方式
2026-08-06
DeepSeek Harness 真要来了,WorkBuddy 会被干掉吗
2026-08-06
把DeepSeek接入Codex,强大又超有性价比!
2026-05-19
2026-06-10
2026-05-16
2026-06-04
2026-05-14
2026-05-12
2026-05-21
2026-05-16
2026-05-28
2026-06-22
2026-08-06
2026-08-05
2026-08-05
2026-07-31
2026-07-30
2026-07-28
2026-07-28
2026-07-28
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。