微信扫码
添加专属顾问
我要投稿
数学:在高中AIME数学竞赛中,o1-mini的得分为70.0%,与o1的74.4%具有竞争力,且成本明显更低,同时也优于o1-preview的44.6%。o1-mini的得分(约答对11/15道题)使其位列全美约前500名高中生。
编程:在Codeforces竞赛网站上,o1-mini的Elo评分为1650,接近o1的1673,并且高于o1-preview的1258。这个Elo评分将该模型排在Codeforces平台上约86%的程序员之上。o1-mini还在HumanEval编程基准测试以及高中级别的网络安全夺旗挑战赛(CTF)中表现出色。
STEM:在一些需要推理的学术基准测试中,如GPQA(科学)和MATH-500,o1-mini的表现优于GPT-4o。然而,在诸如MMLU的任务上,o1-mini表现不如GPT-4o,并且由于缺乏广泛的世界知识,o1-mini在GPQA上的表现也落后于o1-preview。
人类偏好评估:我们让人工评估员在多个领域的复杂、开放式提示下对o1-mini和GPT-4o进行比较,采用与o1-preview对比GPT-4o相同的方法。与o1-preview相似,o1-mini在需要大量推理的领域中更受青睐,但在语言集中的领域中,GPT-4o更受偏好。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-12-11
左脚踩右脚:大模型的有趣且简单的微调方式“SHADOW-FT”
2025-12-11
大模型训练的高效内存解决方案:流水线感知的细粒度激活卸载,实现显存开销与吞吐性能的联合最优
2025-12-08
一杯咖啡成本搞定多模态微调:FC DevPod + Llama-Factory 极速实战
2025-12-04
OpenAI公开新的模型训练方法:或许能解决模型撒谎问题,已在GPT-5 thiking验证
2025-11-23
微调Rerank模型完整指南
2025-11-22
大模型微调全流程实战指南:基于IPO框架的深度解析与优化
2025-11-21
AI基础 | Qwen3 0.6B 微调实现轻量级意图识别
2025-11-20
从零开始:手把手教你微调Embedding模型,让检索效果提升10倍!
2025-10-12
2025-10-14
2025-10-21
2025-09-24
2025-09-20
2025-09-25
2025-11-05
2025-11-05
2025-11-21
2025-12-04