微信扫码
添加专属顾问
我要投稿
OpenAI 首次公开 o3-mini 模型的推理过程,与 DeepSeek R1 激烈对比,引发行业震动。 核心内容: 1. OpenAI 公开 o3-mini 模型的思维链功能,增强模型透明度 2. o3-mini 模型如何解答井字棋问题,推理过程详解 3. AI 推理透明度的竞争意义,及对用户信任度的影响
OpenAI 研究科学家 Noam Brown 在 X 平台发文称:
「在 o1-Preview 发布前,我们向大家介绍 ? 时,看到思维链(CoT)实时运行往往是他们的『顿悟』时刻,让他们意识到这将是一件大事。
这些虽然不是原始的思维链,但已经非常接近了。我很高兴我们能与世界分享这一体验!」
随后,他进一步阐述道:
「o3-mini 是首个能够持续准确解答井字棋问题的大语言模型。虽然概括后的思维链看起来有些混乱,但从右侧可以看到,模型最终还是成功找到了正确答案。」
这种差异也进一步反映在响应速度上,DeepSeek R1 的思考时间相对较长,而 o3-mini(high)则更快。
就答案而言,DeepSeek R1 的解答往往更加完整详实,比方说第一道测试题它还会特意加入了贴心的注解。相比之下, o3-mini(high) 则显得「公事公办」。
如开篇所说,此次 o3-mini 公布的并非完整版思维链,因此向公众开放后,也引发了不少质疑声。
面对争议,OpenAI CEO Sam Altman 也很快在 X 平台作出解释:「我们尝试整理原始的思维链,使其更易读,并在需要时进行翻译,但尽量保持其原始风格。」
不过,正如一位网友一针见血地指出:如果没有 DeepSeek,我们还能看到 o3-mini 哪怕是「阉割版」的思维链吗?恐怕答案不言自明。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-05-09
谁来给企业端即将大规模入职的Agent盖办公室?
2026-05-09
鹅厂员工觉得好的code模型应该具备什么能力?
2026-05-09
Markdown要被抛弃了?Claude Code工程师自曝:我已彻底放弃使用Markdown!团队倾向使用HTML!网友:其他编辑工具会被淘汰吗?
2026-05-09
“Claude Code 你就作吧,我换 Codex 了”
2026-05-09
LLM 输出到这步才算可靠:生产级输出验证与质量工程实战
2026-05-09
OpenAI发布Codex for Chrome,能自动操控浏览器干活了!
2026-05-08
Codex Chrome 插件实测:多标签并行后,AI 浏览器代理终于顺手了
2026-05-08
AI吞噬软件的叙事要分化了?
2026-04-15
2026-03-31
2026-03-13
2026-02-14
2026-04-07
2026-03-17
2026-03-17
2026-03-21
2026-04-07
2026-02-20
2026-05-09
2026-05-09
2026-05-09
2026-05-08
2026-05-07
2026-04-26
2026-04-22
2026-04-18