微信扫码
添加专属顾问
我要投稿
本次发布我们在Llama3.1上首个工作:OpenBuddy-Llama3.1-8B-v22.1-131K。
Llama3.1:开源模型的新里程碑
7月23日,Meta发布了新一代开源模型系列:Llama3.1。其中405B参数的版本刷新了开源模型性能的上限,在多种指标上的测试成绩接近GPT-4等闭源模型的水平,甚至在部分基准测试中展现出来了超越头部闭源模型的潜力。
同时,Meta在本次发布时修改了许可协议中对数据蒸馏方面的限制,允许开发者使用Llama3.1-405B模型的输出训练其它模型。
Llama3.1-8B-Instruct:利用合成数据增强小模型
除了模型尺寸的提升之外,Meta还尝试了在数据集构成、训练方法、 位置编码缩放等方向上增强模型的综合能力,并于同日发布了8B、70B模型的3.1增强版本。
Llama3.1-8B-Instruct基于8种语言的语料、问答对进行训练,支持英语、德语、法语、意大利语、葡萄牙语、西班牙语、印地语和泰语。借助特有的长文扩容技术,其上下文长度高达131072 tokens。模型训练集中的知识截止日期更新到了2023年12月,和上个版本相比具备更新的知识储备。
除了语言、长文、时效性方面的提升外,Meta尝试了借助405B模型等大模型合成数据,并用合成数据提升小模型的能力的路线。在后期训练中,Meta使用了超过2500万条合成数据,使8B小模型的能力得到进一步提升。
在代码、数学等测试模型的认知、推理能力的基准中,Llama3.1-8B-Instruct取得了令人振奋的成绩,具备和GPT 3.5 Turbo相接近的综合能力水平:
OpenBuddy-Llama3.1-8B-v22.1:新一代开源跨语言模型
尽管Llama3.1仍然不具备中文能力,但模型已经在8种语言上得到了充分的训练,具备一定的跨语言潜力。本次时长约为半天的训练过程中,我们尝试使用了约10%的少量数据,在Llama3.1-8B-Instruct的基础上进行以增强中文语言能力为主要目标的训练过程。
经过少量数据训练后,模型具备了中文问答和跨语言翻译能力。和上一代8B模型相比,本次发布的模型在一些容易产生概念混淆的问题上,能够输出通常只有更大模型才能生成的答案,具备更强的认知潜力。
Q: 为什么手机只有100/100的电啊,根本就不够用,建议以后手机都有200/200的电
A: 手机电量显示为 100/100 的设计主要是为了向用户提供一个直观的电量剩余指示。这种设计简化了电量显示,使得用户可以快速了解当前的电量状况。然而,实际上,手机的电池容量并不是 100 单位,而是以毫瓦时(mAh)或瓦时(Wh)等单位来衡量,这意味着它们能够存储和释放电能的量。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-10-30
开源可信MCP,AICC机密计算新升级!
2025-10-30
OpenAI 开源了推理安全模型-gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b
2025-10-29
刚刚,OpenAI 再次开源!安全分类模型 gpt-oss-safeguard 准确率超越 GPT-5
2025-10-29
AI本地知识库+智能体系列:手把手教你本地部署 n8n,一键实现自动采集+智能处理!
2025-10-29
n8n如何调用最近爆火的deepseek OCR?
2025-10-29
OpenAI终于快要上市了,也直面了这23个灵魂拷问。
2025-10-29
保姆级教程:我用Coze干掉了最烦的周报
2025-10-29
维基百科,终结了!马斯克开源版上线,用AI重写「真相」
2025-08-20
2025-09-07
2025-08-05
2025-08-20
2025-08-26
2025-08-22
2025-09-06
2025-08-06
2025-10-20
2025-08-22
2025-10-29
2025-10-28
2025-10-13
2025-09-29
2025-09-17
2025-09-09
2025-09-08
2025-09-07