微信扫码
添加专属顾问
我要投稿
论文链接:
百科知识:DeepSeek-V3 在知识类任务(MMLU, MMLU-Pro, GPQA, SimpleQA)上的水平相比前代 DeepSeek-V2.5 显著提升,接近当前表现最好的模型 Claude-3.5-Sonnet-1022。
长文本:长文本测评方面,在DROP、FRAMES 和 LongBench v2 上,DeepSeek-V3 平均表现超越其他模型。
代码:DeepSeek-V3 在算法类代码场景(Codeforces),远远领先于市面上已有的全部非 o1 类模型,并在工程类代码场景(SWE-Bench Verified)逼近 Claude-3.5-Sonnet-1022。
数学:在美国数学竞赛(AIME 2024, MATH)和全国高中数学联赛(CNMO 2024)上,DeepSeek-V3 大幅超过了所有开源闭源模型。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-01-05
从 Issues 到 Wishes:开源协作模式的范式转移
2026-01-04
AgentRun Sandbox SDK 正式开源!集成 LangChain 等主流框架,一键开启智能体沙箱新体验
2026-01-04
让 AI 接管 Windows 和 MacOS,这个 GitHub 开源项目牛啊。
2026-01-04
开源TTS模型技术选型分析报告v1.0
2026-01-03
Google 开源 InkSight,把手写笔记直接变成可编辑数字笔记!
2026-01-02
每个开发者都值得真正试试的 6 款开源 CLI 工具
2026-01-02
又是量化基金,第二个DeepSeek时刻到来了?
2026-01-01
RustFS:高性能的分布式对象存储,MinIO的国产化理想替代方案,比MinIO快2.3倍!
2025-11-19
2025-10-20
2025-10-27
2025-10-27
2025-11-17
2025-12-10
2025-10-29
2025-11-07
2025-10-21
2025-10-24
2026-01-02
2025-12-24
2025-12-22
2025-11-12
2025-11-10
2025-11-03
2025-10-29
2025-10-28