微信扫码
添加专属顾问
我要投稿
最近一年,大模型开源领域更加蓬勃发展,无论是模型参数规模的飞跃,还是在代码生成、数学推理、语言理解等多方面的能力提升,大模型已经成为推动 AI 应用和研究的重要基石。从 Transformer 的提出到 MoE(Mixture of Experts)技术的广泛应用,这些创新不断刷新人类对 AI 潜力的认知。
12月26日,DeepSeek 上线并开源了全新系列模型 DeepSeek-V3 的首个版本。DeepSeek-V3 为 DeepSeek 自研 MoE 模型,采用 FP8 训练 (原生 FP8 权重也已同步开源),671B 参数,激活 37B,在 14.8T token 上进行了预训练。DeepSeek-V3 训练消耗的算力仅为 Llama 3 4050B 的 1/11,但在性能上的表现却领先众多国内外优秀的大模型,其高效和对算力资源依赖之小令人惊艳。根据官方技术报告,DeepSeek-V3 针对分布式推理做了创新的优化,进而显著提升了分布式 MoE 模型的负载分配效率,从整个系统上为未来更大规模的模型提供了新的可扩展性框架的可能。通过算法和工程上的创新,相比前代 V2.5,DeepSeek-V3 的生成吐字速度提升了 3 倍。
司南 OpenCompass 第一时间对 DeepSeek-V3 进行了评测,评测结果已更新至司南大语言模型公开学术榜单。
评测解读
司南OpenCompas大语言模型公开学术榜单-实时榜 排名前 10 模型得分
DeepSeek-V3 以 71.9 分的平均成绩超越了包括最新的 Gemini-2.0-Flash-Exp、Claude-3.5-Sonnet-20241022 在内的一系列国外模型,荣登 OpenCompass 开源学术榜单首位,标志着开源模型达到了比肩商业模型的能力水平。
DeepSeek-V3 在复杂推理场景上展现了卓越的能力,尤其在代码、数学、综合知识推理上均取得优异性能。
此外,上海人工智能实验室开源的大模型推理部署框架 LMDeploy 现已支持 DeepSeek-V3 的原生 FP8 高效推理,LMDeploy 开源链接:https://github.com/InternLM/lmdeploy
了解更多
司南 OpenCompass 大语言模型公开学术榜单链接如下:
https://rank.opencompass.org.cn/leaderboard-llm-academic/
https://huggingface.co/spaces/opencompass/Compass_Academic_Leaderboard
司南 OpenCompass 开源评测工具链:
https://github.com/open-compass/OpenCompass/
司南 OpenCompass 将持续关注国内外最新发布的开源及闭源大模型,并进行全面、客观、中立的性能评测,输出评测结果以及专业分析,为业界提供可信赖的大模型评估参考,推动大模型评测的公正性和客观性,促进大语言模型评测技术的健康发展和持续创新。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-03-21
Hugging Face:AI 界的 GitHub 与开源协作的终极生态杠杆
2026-03-21
OpenMAIC课程生成很惊艳,但"像一堂课"不等于"是一堂有效的课"
2026-03-20
企业级 Agent 多智能体架构与选型指南 -- 来自1000+行业应用实践积累
2026-03-20
ollama v0.18.2 发布!OpenClaw 安装优化、Claude 加速、MLX 量化全面升级
2026-03-19
开源版Cowork——Eigent集成ERNIE 5.0,让AI Agent自动化高效工作
2026-03-17
打造 Claude Code 并行自主开发环境:Auto Claude + GLM 4.7
2026-03-17
又一款开源的LLM生成3D场景的3D编辑器,这次功能更强大了
2026-03-17
英伟达的NemoClaw,能帮AI代理这匹“野马”套上缰绳吗?
2026-01-27
2026-01-30
2026-01-12
2026-01-29
2026-01-27
2025-12-22
2026-01-28
2026-01-21
2025-12-23
2026-01-06
2026-03-17
2026-03-13
2026-03-02
2026-02-05
2026-01-28
2026-01-26
2026-01-21
2026-01-21