微信扫码
添加专属顾问
今天的大消息莫过于meta发布llama3[1]了,作为一个AI软件系统从业人员,趁热解读一下,总结版本如下:
llama3的发布,更强调了数据工程的重要:模型架构不变,更多的数据量和更高数据质量能够带来明显模型效果提升
更多的数据,依赖更多的算力,开源大模型玩家的算力需求再次提升了一个量级,即万卡H100级别,再次感受到了算力忧患
集群系统层面:meta的集群同时在走RoCE和InfiniBand两条路;万卡级别系统容错与故障恢复愈发重要
meta的llama3算法改动太小,长序列、多模态等常见能力都没有支持,而官方声称目前8B和80B只是一个开始,llama3还未完成训练,后续会支持长序列、多模态这些能力,不知道是不是meta感受到了什么压力,着急先发布了?
1. llama3 与llama2的模型结构(计算)区别
llama3与llama2的模型架构完全相同,只是model的一些配置(主要是维度)有些不同,llama2推理的工程基本可以无缝支持llama3。在meta官方的代码库[2,3],模型计算部分的代码是一模一样的,也就是主干decoder only,用到了RoPE、SwiGLU、GQA等具体技术。
llama3-8B与llama2-7B的模型具体差别
通过对比huggingface模型中的config.json,首先可以看出,模型都是 `LlamaForCausalLM` 这个类,模型结构不变。具体差别在于:
① vocab_size:32000 ->128256。词汇表的扩大,导致embedding参数的增大 (128256-32000)*4096*2 Byte=752MB,另外模型最后一层lm_head的输出维度就是vocab_size,所以lm_head的参数同样增大752MB,总计带来模型增大1504MB;
② max_position_embeddings:4096->8192。也即context window扩大了,训练时输入的序列长度增大,推理能支持的序列长度增大,没有实际计算的差别。
③ num_key_value_heads:32 -> 8。即使用了GQA,因为num_attention_heads维持32,也就是计算时key、value要复制 4份。参数量会下降,K_proj、V_proj的参数矩阵会降为llama2-7B的1/4,共计减少 32*4096*4096*2*2/4*3 Byte(1536MB)
④ intermediate_size:11008->14336。只是FFN时的中间维度变了,计算范式不变。参数量增大:32*4096*(14336-11008)*3*2/1024/1024 Byte (2496MB)
综上:通过以上几个设置和维度的变化,最终带来模型增大了2464M,这也是7B->8B的原因,本质上的计算模式没有变化
ps:还有一个小改动(其实是huggingface自己的修改),权重的数据格式torch.float16->torch.bfloat16。llama2和llama3都是用bf16训练的,只是huggingface官方导入llama2时转成float16去推理了,据这个issue描述[4]可能会出现NaN,后面huggingface的codellama就用了torch.bfloat16,此次llama3也是同样的操作,即与官方发布的权重保持一致
2. 效果提升主要是数据工程
① 数据量:预训练,llama3 用了超15T token(来自公开可获取的来源),是llama2的7倍多,其中代码相关的数据是llama2的4倍多;Fine-tuning阶段的数据除了公开能获取的 instruction datasets, 还有自己制作的超过1千万人工标注 examples。
② 数据质量:预训练阶段, “为确保 Llama 3 在最高质量的数据上进行训练,我们开发了一系列数据过滤pipeline。这些管道包括使用启发式过滤器、NSFW 过滤器、语义重复数据删除方法和文本分类器来预测数据质量。”
Instruction fine-tuning阶段的数据质量也非常重要。“模型质量的一些最大改进来自于对这些数据的精心整理,以及对人类注释者提供的注释进行多轮质量检查保证。”
③ 数据混合比例的探索:“我们进行了大量实验,以评估在最终预训练数据集中混合不同来源数据的最佳方法”
3. 模型训练的基础设施
3.1 集群细节
meta使用了2个定制的24K的GPU集群,通过model card[5]中的“H100-80GB (TDP of 700W)”可以推断出用的是SXM形态的H100,其fp16算力990TFLOPS。meta实现了“同时在 16K 个 GPU 上进行训练时,每个 GPU 超过 400 TFLOPS 的计算利用率”,也即超过40%的利用率
关于这两个24K的GPU集群,meta在另一篇关于AI基础设施的博客[6]中有更详细的介绍。核心的区别在于:
Cluster1采用基于RoCE方案,基于Arista 7800的RoCE网络结构解决方案,配备 Wedge400 和 Minipack2 OCP 机架式交换机
Cluster2采用Infiniband方案,采用英伟达 Quantum2 InfiniBand Fabric。两种解决方案都能实现 400 Gbps 端点互联。
目的是通过这两个方案,评估这些不同类型的互连是否适合大规模培训以及是否具有可扩展性,从而为今后如何设计和构建更大、更大规模的集群提供更多启示。
可见meta在同时走RoCE 和 InfiniBand两条线,并且它声称通过网络、软件、模型架构的协同设计大模型训练的workload没有出现网络瓶颈。其实llama2的技术报告[7]中,meta就是用了一个RoCE一个Infiniband,相同的互联带宽,两个A100集群,原文如下:
With this two-cluster setup, we were able to compare the suitability of these different types of interconnect for large scale training. RoCE (which is a more affordable, commercial interconnect network) can scale almost as well as expensive Infiniband up to 2000 GPUs, which makes pretraining even more democratizable。
说白了,核心问题还是IB太贵了,天下苦秦久矣。。。
3.2 容错和故障恢复
meta此次llama3的pretrain训练强调的一个点,为了最大限度地延长 GPU 的正常运行时间,我们开发了一种先进的新训练堆栈,可以自动检测、处理和维护错误。我们还极大地改进了硬件可靠性和无声数据损坏检测机制(detection mechanisms for silent data corruption),并开发了新的可扩展存储系统,减少了检查点和回滚的开销。这些改进使总体有效训练时间缩短了 95% 以上。与 Llama 2 相比,这些改进将 Llama 3 的训练效率提高了约三倍。
万卡级别的集训训练,容错已经成为非常重要的问题,这一点,在Grok、Google Gemini等都有强调,尤其是Google Gemini的technical report中提出,这么大规模的系统中会出现一个棘手的问题SDC-“Silent Data Corruption”
另外Google在NDSI2024有一篇paper[8]专门讲他们的大规模集群训练容错相关feature如何设计,后面有机会我们详细讲。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-06-22
2026-06-18
2026-07-23
2026-06-20
2026-06-23
2026-06-22
2026-06-28
2026-07-11
2026-07-06
2026-06-23
2026-09-11
2026-09-11
2026-09-11
2026-09-10
2026-09-08
2026-09-07
2026-09-07
2026-09-03
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。