微信扫码
添加专属顾问
我要投稿
DeepSeek低调开源金牌级数学推理模型,首次实现可自证的AI数学证明能力,突破传统"答对≠会证"的困境。 核心内容: 1. DeepSeek-Math-V2在IMO、CMO等顶级数学竞赛中达到金牌线 2. 创新的"生成-验证"双向增强飞轮机制详解 3. 模型自我反省与自动扩数据技术突破
刚刚,DeepSeek又悄悄开源了DeepSeek-Math-V2:迈向可自证的数学推理。
model、paper都已开源。
DeepSeekMath-V2 展现出强大的定理证明能力:在 IMO 2025、CMO 2024 上达到金牌线,并在 Putnam 2024 上以扩展测试时计算斩获 118/120 的近满分成绩。虽然前路仍长,但这些结果首次表明——可自证的数学推理不仅可行,更是通往更强数学 AI 的必由之路。
过去一年,大模型靠「最终答案奖励」把 AIME、HMMT 等竞赛刷到饱和,但
DeepSeekMath-V2 的目标:让模型像数学家一样,自己写证明、自己挑毛病、自己改到无懈可击。
| 证明生成器 | ||
| 证明验证器 | ||
| 元验证器 |
三者组成一个可扩展的强化学习闭环:
训练时要求一次输出两段:
##Solution
……(证明正文)
##Self Evaluation
Here is my evaluation of the solution: …
\boxed{score}
奖励设计:
当验证器 & 元验证器足够强,用“多数元验证一致”原则自动给新证明打标签;
最近两轮训练完全取消人工标注,专家抽测一致性>96%。
| 118/120 |
https://github.com/deepseek-ai/DeepSeek-Math-V2/blob/main/DeepSeekMath_V2.pdf
https://hf-mirror.com/deepseek-ai/DeepSeek-Math-V2
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
DeepSeek53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-05-25
DeepSeek 要用蜜雪冰城的打法,做中国版 Claude Code
2026-05-25
DeepSeek V4还能更省!新工具缓存命中率高达99.82%,2折稳定到手
2026-05-25
Anthropic开源Claude小企业插件:不用写prompt,15套现成流程顶半个运营团队
2026-05-21
麻省理工团队开源GenCAD,用一张图片生成完整CAD模型与参数化程序
2026-05-21
真Agent框架生态的主语言已经变为TypeScript
2026-05-20
Hermes Agent + Ollama本地安装指南
2026-05-20
Qwen3.7来了,全球排名第13,国内第一
2026-05-17
开源、零依赖、R@5 精度 95%:agentmemory 凭什么比 mem0 更值得用
2026-03-30
2026-04-03
2026-04-09
2026-03-23
2026-03-03
2026-03-31
2026-04-01
2026-03-04
2026-03-09
2026-03-30
2026-05-16
2026-04-22
2026-04-21
2026-04-15
2026-04-09
2026-04-01
2026-03-17
2026-03-13