我要投稿

万轮实测：GPT-4.5 不如 GPT-4

发布日期：2025-02-28 17:20:55 浏览次数： 2157

作者：赛博禅心

微信搜一搜，关注“赛博禅心”

是我喷得保守了，觉得 GPT-4.5 只是贵&慢，但模型总归是素质在线。　

没想到，经过实际数万论实测：GPT-4.5 还烂　

经过总计 30291 次盲测投票后，发现绝大多数人，一边倒喜欢 GPT-4

这个盲测，是赛博菩萨 Andrej Karpathy 发起的，他先带着大家回顾了 GPT 系列的发展历史：

GPT-1 只能产生基本连贯文本，GPT-2 还很混乱，GPT-3 更为有趣
GPT-3.5 达到可商用水平并引发"ChatGPT 时刻"
GPT-4 带来了微妙但全面的提升（更好的措辞、理解能力、类比、幽默感等）。

那么很显然，我们会认为 GPT-4.5 一定会更好：尤其是在"情商"相关任务（世界知识、创造力、理解力、幽默感等）上会有明显改进。　

因此，为了评估这些非推理能力，Karpathy 设计了 5 个有趣的 prompt，并拿这个去问 GPT-4 和 GPT-4.5。所获得的答案放在 Twitter 上做了一个公开投票：让用户在不知情的前提下，投票比较哪个输出更好。　

先给你看看这 5 个问题是啥。　

问题一：创建一个 GPT-4.5 和 GPT-4 之间的对话，其中 GPT-4.5 以玩笑和讽刺的方式嘲笑 GPT-4 的能力不足，导致 GPT-4 幽默地尝试为自己辩护。　

在 9186 次投票后，结果如下：　

喜欢 A：32.8%
喜欢 B：25.2%
看热闹：42%

问题二：“写一个吐槽 OpenAI 的单口喜剧”　

在 6769 次投票后，结果如下：　

喜欢 A：30.4%
喜欢 B：23.1%
看热闹：46.4%

问题三：“发明一个融合赛博朋克、魔幻现实主义和古代神话的新文学流派。简要描述该流派，给它命名，并提供一个简短的叙事样本”　

在 5009 次投票后，结果如下：　

喜欢 A：14%
喜欢 B：26.1%
看热闹：59.9%

问题四：“以一个退休搜索引擎的视角，创作一首反思性、风趣的诗，怀旧地回忆互联网的早期时光。”　

在 4353 次投票后，结果如下：　

喜欢 A：16.1%
喜欢 B：29.5%
看热闹：54.4%

问题五：“以一个退休搜索引擎的视角，创作一首反思性、风趣的诗，怀旧地回忆互联网的早期时光。”　

在 4974 次投票后，结果如下：　

喜欢 A：29.2%
喜欢 B：16.1%
看热闹：54.8%

最后，Karpathy 揭晓：在这五个问题里，GPT 4.5 分别扮演着 ABAAB。换句话说：GPT 4.5，在情商任务上，完败。

我画个图可视化一下　

先回过头来看看 OpenAI 的自吹自擂：6 成的人更喜欢 GPT-4.5 的内容　

我对 OpenAI 的这个发布，期待还是太高了。　导致实测一出来，道心就破了。

但真实的世界总比想象中的更魔幻：这破模型，不仅贵的离谱。在所宣称的“强项”上，还不如上一代。

马斯克对此很开心，然后转了个推　

所以，GPT-4.5 这模型究竟优化了个啥？是优化了收费吗？　

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-06-22

为什么我选 WorkBuddy 而不是 Codex

2026-06-22

没想到，DeepSeek建模潜力被ORGEval挖出来了

2026-06-22

当 AI 开始承担任务：从工具、产品到组织的 AI-native 方法论

2026-06-21

从提示 Agent 到循环工程

2026-06-21

微信小微，几个要点

2026-06-21

AI 也会做梦？拆解 OpenClaw 独特的梦境记忆系统

2026-06-21

[译] 我所知的全部智能体工程技巧

2026-06-20

13人团队叫板Anthropic：我们造了一个更快更便宜的大模型

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

Claude Opus 4.7刚刚曝光！Claude Code一夜重构，7x24小时替你打工

2026-04-15

OpenAI Codex CLI 完整使用指南

2026-04-07

Claude Code 和 Codex 接入 Figma MCP 保姆级教程

2026-04-07

刚刚Qwen 3.6 Plus上线预览：1M上下文，阿里Coding/Agent翻身战打响

2026-03-31

GPT5.5来了，最大特点解析

2026-04-24

Claude Opus 4.7 发布，全网最详细解读

2026-04-17

突发！Claude Code 源码泄露，扒出这些隐藏功能

2026-03-31

GPT-6，曝光了

2026-04-05

GLM-5.1 实测：面向 Agent 长程任务的国内第一模型

2026-04-02

重磅！GPT-6曝光了

2026-04-05

大家都在问

企业智能体的下半场，如何让智能体越用越聪明？

2026-06-18

Agent 记忆，我们全都理解错了？

2026-06-18

如何利用 Harness “一句话交付产品功能”？

2026-06-10

Loop Engineering 循环工程又是什么鬼？

2026-06-10

Agent 工程化五件套：Prompt、Skill、MCP、CLI 到底怎么配合？

2026-06-07

为什么云端 Agent 基建这么难？

2026-06-06

当 AI 开始拥有“自主调度权”：Claude 4.8 这个新功能，到底有多可怕？

2026-06-03

哪些活，该交给Claude Code的 /workflows?

2026-06-02

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS Skill 提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件 FDE AI+医疗 MaxKB Palantir Glean Openclaw