微信扫码
添加专属顾问
我要投稿
论文链接:
百科知识:DeepSeek-V3 在知识类任务(MMLU, MMLU-Pro, GPQA, SimpleQA)上的水平相比前代 DeepSeek-V2.5 显著提升,接近当前表现最好的模型 Claude-3.5-Sonnet-1022。
长文本:长文本测评方面,在DROP、FRAMES 和 LongBench v2 上,DeepSeek-V3 平均表现超越其他模型。
代码:DeepSeek-V3 在算法类代码场景(Codeforces),远远领先于市面上已有的全部非 o1 类模型,并在工程类代码场景(SWE-Bench Verified)逼近 Claude-3.5-Sonnet-1022。
数学:在美国数学竞赛(AIME 2024, MATH)和全国高中数学联赛(CNMO 2024)上,DeepSeek-V3 大幅超过了所有开源闭源模型。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-05-19
DeepWiki × LoongCollector:AI 重塑开源代码理解
2025-05-19
狂揽7.5k星!这款开源API网关彻底解放开发者:一键聚合GPT-4、Suno、Midjourney,还能在线充值!
2025-05-18
狂揽31.2K星!再见RAG,这款让AI拥有超强记忆力的开源神器,绝了!
2025-05-17
AI 开源框架:Dify、Zylon、AutoGPT、Flowise、LangChain、React-Flow怎么选?
2025-05-17
刚刚,OpenAI丢出最强编程智能体Codex!倒反天罡——新上线功能竟是微软Copilotb鼻祖?
2025-05-17
不用等了!吴恩达MCP课程来了!
2025-05-17
刚刚,OpenAI发布自主编码代理Codex,程序员的工作将被彻底颠覆?
2025-05-16
5.5k Stars! Nanobrowser: 基于多智能体架构的开源浏览器自动化工具(支持多LLM集成)
2024-07-25
2025-01-01
2025-01-21
2024-05-06
2024-09-20
2024-07-20
2024-07-11
2024-06-12
2024-12-26
2024-08-13
2025-05-17
2025-05-17
2025-05-17
2025-05-16
2025-05-14
2025-05-12
2025-04-30
2025-04-29