微信扫码
添加专属顾问
我要投稿
DeepSeek低调开源金牌级数学推理模型,首次实现可自证的AI数学证明能力,突破传统"答对≠会证"的困境。核心内容: 1. DeepSeek-Math-V2在IMO、CMO等顶级数学竞赛中达到金牌线 2. 创新的"生成-验证"双向增强飞轮机制详解 3. 模型自我反省与自动扩数据技术突破
刚刚,DeepSeek又悄悄开源了DeepSeek-Math-V2:迈向可自证的数学推理。
model、paper都已开源。
DeepSeekMath-V2 展现出强大的定理证明能力:在 IMO 2025、CMO 2024 上达到金牌线,并在 Putnam 2024 上以扩展测试时计算斩获 118/120 的近满分成绩。虽然前路仍长,但这些结果首次表明——可自证的数学推理不仅可行,更是通往更强数学 AI 的必由之路。
过去一年,大模型靠「最终答案奖励」把 AIME、HMMT 等竞赛刷到饱和,但
DeepSeekMath-V2 的目标:让模型像数学家一样,自己写证明、自己挑毛病、自己改到无懈可击。
|
证明生成器 |
||
|
证明验证器 |
||
|
元验证器 |
三者组成一个可扩展的强化学习闭环:
训练时要求一次输出两段:
##Solution
……(证明正文)
##Self Evaluation
Here is my evaluation of the solution: …
\boxed{score}
奖励设计:
当验证器 & 元验证器足够强,用“多数元验证一致”原则自动给新证明打标签;
最近两轮训练完全取消人工标注,专家抽测一致性>96%。
| 118/120 |
https://github.com/deepseek-ai/DeepSeek-Math-V2/blob/main/DeepSeekMath_V2.pdf
https://hf-mirror.com/deepseek-ai/DeepSeek-Math-V2
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
DeepSeek
推荐阅读
Agents:(编排、记忆、插件、workflow、协作)" data-itemshowtype="0" linktype="text" data-linktype="2">动手设计AI Agents:(编排、记忆、插件、workflow、协作)
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-11-28
DeepSeek强势回归,开源IMO金牌级数学模型
2025-11-28
GPT-5危了!DeepSeek开源世界首个奥数金牌AI,正面硬刚谷歌
2025-11-26
7800美元!微博Vibethinker-1.5B数学能力超越R1-671B
2025-11-25
混元OCR模型宣布开源,参数仅1B,多项核心能力SOTA
2025-11-25
5分钟部署AstrBot+NapCat:用Docker把 DeepSeekAI接入你的QQ
2025-11-25
OpenAI 推出 Shopping Research:AI 正在重塑电商价值链
2025-11-25
Gemini Prompt:直接开源!我把「顶尖商业咨询」写进了一套 AI 指令里
2025-11-24
字节跳动开源RL框架verl:让大模型强化学习效率提升20倍,已支持671B参数模型训练
2025-09-07
2025-09-06
2025-10-20
2025-09-08
2025-10-27
2025-10-27
2025-11-19
2025-10-03
2025-09-17
2025-09-29
2025-11-12
2025-11-10
2025-11-03
2025-10-29
2025-10-28
2025-10-13
2025-09-29
2025-09-17