收藏

奥特曼率队深夜血战DeepSeek，o3-mini急上线！价格骨折免费用，ChatGPT被挤爆

发布日期：2025-02-01 10:53:46 浏览次数： 2970

作者：新智元

微信搜一搜，关注“新智元”

o3-mini，真的来了。

刚刚，OpenAI官宣o3-mini和o3-mini-high两大版本正式在ChatGPT上线。

诚如奥特曼所言，免费用户直接打开「Reason」即可体验，Plus用户每天会有更多用量，具体来说：

- ChatGPT免费版：首次体验推理模型

- ChatGPT Plus和团队版：每天150次对话限制

- ChatGPT Pro：无限制访问

- ChatGPT Enterprise和ChatGPT Edu：将在一周内可用

- API：向3-5级开发者开放（初期暂不支持图像分析功能）

- 输入1.10美元/百万token、输出4.40美元/百万token

感谢DeepSeek，o3-mini的价格这次算是彻底给打下来了——比OpenAI o1-mini便宜63%，比满血版o1便宜93%。（但仍是GPT-4o mini的7倍左右）

订阅用户已经在第一时间「告别」了o1-mini，还没来得及说再见

OpenAI表示，o3-mini的发布是在追求高效能智能技术道路上的又一重要里程碑。

通过优化科学（Science）、技术（Technology）、工程（Engineering）和数学（Mathematics）领域的推理能力，同时保持较低的成本，让高质量AI技术变得更加平易近人。

值得一提的是，在ChatGPT中，o3-mini采用的是「中等推理强度」，在速度和准确性之间取得平衡。所有付费用户还可以在模型选择器中选择o3-mini-high——响应时间略长但智能水平更高的版本。

目前，由于太过火爆，ChatGPT的项目和自定义GPTs功能都已经被挤崩了。

集成搜索，两种版本可选

去年12月，十二天直播最后一弹，o3系列首次亮相便惊艳了所有人。相较于上一代o1模型，o3在ARC-AGI等多项基准测试中刷新SOTA。

与o1-mini一样，o3-mini是最具性价比的推理模型，可谓是突破性能边界的「小巨人」。

在STEM领域，尤其是科学、数学和编程等方面，o3-mini性能表现卓越超越o1，并继承了上一代低成本和低延迟的优点。

对于开发者来说，o3-mini简直就是一份「大礼包」，它首次在小型推理模型中支持：包括函数调用、结构化输出和开发者消息、流式传输功能。

开发者可以根据需求选择低、中、高三种推理强度，让o3-mini在处理复杂问题时进行「深度思考」，灵活平衡速度和准确性。

遗憾地是，o3-mini暂不支持视觉功能。

如前所述，从今天起，o3-mini将通过Chat Completions API，Assistants API和Batch API向3-5级指定开发者开放。

同时，o3-mini还整合了搜索功能，能够提供带有相关网络来源链接最新响应。

一起来看看这款「小而美」的o3-mini有什么过人之处。

快速、强大、专为STEM领域推理优化

与其前身OpenAI o1类似，OpenAI o3-mini专门针对STEM推理进行了优化。

采用了中等推理强度的o3-mini，在数学、编程和科学领域的表现与o1不相上下，且响应速度更快。

报告地址：https://cdn.openai.com/o3-mini-system-card.pdf

专家测试评估显示，o3-mini相比o1-mini能够生成更准确、更清晰的答案，推理能力更强。

在测试中，o3-mini的响应结果获得了56%的偏好度，在处理复杂现实问题时的重大错误率更是降低了39%。

在中等推理强度设置下，o3-mini在最具挑战性的推理和智能评估项目（包括AIME和GPQA）中，均达到了与o1相当的水平。

数学竞赛（AIME 2024）

在低推理强度下，o3-mini达到了与o1-mini相当的水平；在中等推理强度下，其表现可与o1媲美；而在高推理强度下，o3-mini的表现更是超越了o1-mini和o1。

博士级科学问题（GPQA Diamond）

研究级数学（FrontierMath）

在高推理强度模式下，o3-mini在FrontierMath中的表现优于前代产品。当配合Python工具使用时，高推理强度的o3-mini能够一次性解决超过32%的测试题目，其中包括28%以上的T3级问题。

编程竞赛（Codeforces）

随着推理强度的提升，OpenAI o3-mini的Elo得分不断提高，各层级表现均优于o1-mini。在中等推理强度下，其表现已能与o1相媲美。

软件工程（SWE-bench Verified）

o3-mini在高推理强度模式下，使用开源Agentless框架能达到39%的成功率，使用内部工具框架则可达到61%的成功率。

LiveBench编码

人类偏好评估

外部专家评测结果显示，o3-mini较o1-mini表现出更强的推理能力，能够生成更准确、更清晰的答案，尤其是在STEM领域中。在对比测试中，o3-mini获得了56%的用户偏好度，且在处理复杂现实问题时的重大错误率降低了39%。

在技术报告中，o3-mini编程性能超越了GPT-4o和o1-preview，与o1不相上下。

模型的速度与性能

o3-mini在保持与o1相当智能水平的同时，实现了更快的运行速度和更高的计算效率。

除前文提到的STEM评估外，在中等推理强度下，o3-mini在其他数学能力和事实准确性测试中均取得了显著优势。

对比测试（A/B Testing）结果显示，o3-mini的平均响应时间为7.7秒，较o1-mini的10.16秒提升了24%。

o1-mini和o3-mini（medium）的延迟对比

安全评估

OpenAI在训练o3-mini确保其安全响应，采用的关键技术之一是审慎对齐（deliberative alignment）。

这项技术使模型能够在响应用户提示词前，对人工制定的安全规范进行全面推理。

与o1相似，o3-mini在高难度安全性测试和越狱评估中，明显优于GPT-4o。

在正式部署前，研究人员采用与o1相同的准备方法，结合外部红队测试和安全性评估，对o3-mini的安全风险进行了全面评估。

禁止内容评估

越狱评估

OpenAI急了

去年年底放出o3和o3-mini的预览时，CEO奥特曼就曾表示，o3-mini将会在1月份发布。

随后，奥特曼又在1月17日预告称，o3-mini会在几周内发布。

现在，o3-mini果然如约而至（卡在ddl最后一天），但外面的世界已经是天差地别。

面对正在快速崛起的DeepSeek-R1，o3-mini存在着一个关键问题——「不开源」。

这也就意味着，它无法离线使用、无法下载代码，也无法以相同的程度进行自定义。对于很多应用过来说，它的吸引力相对于R1明显大打折扣。

在上下文窗口方面，DeepSeek-R1约为128K/130K token，而o3-mini略胜一筹达到了200K token。其中，每个输出最多100K token，跟满血版o1相同。

在价格方面，相比于输入/输出token分别为0.14/0.55美元的DeepSeek-R1，o3-mini依然贵出了天际。

但作为一款美国模型，o3-mini在身份上无疑占尽了好处：应该会是欧美很多企业的首选。

奥特曼亲自率队

这一次，最强最新的o3-mini模型训练，奥特曼本尊下场亲自率队。研究项目主管分别是Carpus Chang和Kristen Ying。

接下来，如果说OpenAI还藏在什么杀手锏，那就是满血版的o3了。根据12月时的说法，它将在「此后不久」发布。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-06-19

从 BERT 标注到 Agent Skill：短文本标签体系的四次“工业革命”

2026-05-14

多轮 Agent 场景下，滴滴的 EAGLE-3 训推加速实践

2026-05-06

谁说 Mac 只能写代码？Google 官宣：M 芯片本地微调 Gemma 4 时代开启！

2026-04-20

用 Unsloth 微调 Embedding 模型，让你的 RAG 检索不再答非所问

2026-04-15

ComfyUI v0.19.0 更新：大量新节点、新模型、新修复与性能优化全面落地，工作流与训练能力再升级

2026-04-13

Agent 持续学习落地路径：先做 Traces，再做 Context，最后才微调模型 | Jinqiu Select

2026-03-23

养死四只龙虾的小白有感

2026-03-22

Mistral Forge 的真正意义：企业AI从“租用”走向“拥有”

联系获取

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

ComfyUI v0.19.0 更新：大量新节点、新模型、新修复与性能优化全面落地，工作流与训练能力再升级

2026-04-15

Agent 持续学习落地路径：先做 Traces，再做 Context，最后才微调模型 | Jinqiu Select

2026-04-13

用 Unsloth 微调 Embedding 模型，让你的 RAG 检索不再答非所问

2026-04-20

谁说 Mac 只能写代码？Google 官宣：M 芯片本地微调 Gemma 4 时代开启！

2026-05-06

多轮 Agent 场景下，滴滴的 EAGLE-3 训推加速实践

2026-05-14

从 BERT 标注到 Agent Skill：短文本标签体系的四次“工业革命”

2026-06-19

大家都在问

DeepSeek 发布新论文，提出全新 MHC 架构，有何创新与应用前景？

2026-01-02

LoAR做Fine-Tuning微调原理到底是什么？

2025-11-19

如何将 AI 代码采纳率从30%提升到80%？

2025-09-25

大模型微调，为什么99%的企业都不应该碰这个坑？

2025-06-20

万不得已，不要对 LLM 进行微调？

2025-06-17

可以将任何符合OpenAPI规范的接口转 MCP Server吗？

2025-05-21

OpenAI发布GPT-4.1系列模型，对行业最大吸引力是什么？

2025-05-17

私有部署大模型需要多少显存？

2025-05-14

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS Skill 提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件 FDE AI+医疗 MaxKB Palantir Glean Openclaw

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部

扫码登录

登录即表示您同意《53AI网站服务协议》

服务协议

欢迎您使用【53AI 官方网站】（以下简称“本网站”或“我们”）。本《会员服务协议》（以下简称“本协议”）是您（以下简称“会员”或“用户”）与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。

在您注册或登录前，请务必审慎阅读、充分理解各条款内容，特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时，即视为您已完全理解并同意接受本协议的全部内容。

一、定义

本网站：指由【深圳市博思协创网络科技有限公司】运营的，域名为【53ai.com】的网站及相关移动端页面。

会员服务：指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。

知识库内容：指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。

二、账号注册与登录

登录方式：本网站支持以下登录方式，您可根据实际情况选择：

微信公众号授权登录：您同意将您的微信OpenID信息授权给本网站，用于创建或关联会员账号。

手机验证码登录：您需提供真实有效的手机号码，并通过短信验证码完成身份验证与登录/注册。

账号安全：您的账号仅限您本人使用，禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失，由您自行承担。

实名认证：根据相关法律法规要求，我们可能要求您在特定功能下完成实名认证。如您拒绝提供，可能无法使用部分或全部服务。

未成年人保护：若您未满18周岁，请在法定监护人的陪同下阅读本协议，并在征得监护人同意后使用本服务。

三、服务内容与规范

知识库查阅权限：会员登录后，有权按照其会员等级对应的权限范围，在线浏览、检索本网站知识库中的相关文章及内容。

服务变更：我们有权根据业务发展需要，调整、变更或终止部分服务内容，并将以网站公告、公众号消息等方式提前通知。

禁止行为：您在使用服务时不得实施以下行为：

利用技术手段批量爬取、下载、转存知识库内容；

将知识库内容用于商业目的或未经授权地向第三方传播；

干扰本网站正常运行或侵犯其他用户合法权益；

发布违法违规信息或从事违反公序良俗的活动。

四、知识产权声明

权利归属：本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有，受《中华人民共和国著作权法》等法律保护。

有限许可：本网站授予会员一项非独占、不可转让、不可转授权的普通许可，仅限于个人学习、研究之目的在线查阅知识库内容。

侵权追责：未经书面许可，任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现，我们保留追究其法律责任的权利。

五、个人信息保护

我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息，请单独阅读《隐私政策》。

您通过微信公众号授权或手机号验证所提供的信息，我们将严格按照《个人信息保护法》的规定处理，仅用于身份识别、服务提供及安全验证等必要用途。

您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。

六、免责声明

内容准确性：知识库内容仅供参考，不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证，您应自行判断并承担使用风险。

不可抗力：因自然灾害、政策法规变化、网络故障、第三方平台接口异常（如微信接口维护、运营商短信通道故障）等不可抗力导致的服务中断或延迟，我们不承担违约责任。

第三方链接：本网站可能包含指向第三方网站的链接，该等网站的内容和服务不受我们控制，请您自行甄别风险。

七、违约责任

如您违反本协议约定，我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施，并保留要求赔偿损失的权利。

如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失，您应承担全部赔偿责任（包括但不限于罚款、赔偿金、律师费、公证费等）。

八、法律适用与争议解决

本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。

因本协议产生的或与本协议有关的任何争议，双方应友好协商解决；协商不成的，任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。

九、其他

本协议构成双方就本服务达成的完整协议，取代此前任何口头或书面约定。

本协议任一条款被认定为无效或不可执行的，不影响其他条款的效力。

我们对本协议享有最终解释权，并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效，继续使用服务即视为同意修订内容。

已查阅