GPT-4.5 深度评测:更懂人心,但非全能战士
2025 年 2 月 28 日凌晨,OpenAI 以一场 13 分钟的直播发布了最新语言模型 GPT-4.5(代号 Orion)。作为 GPT-4 的迭代版本,这一号称“史上最大规模、最高情商”的模型迅速引发热议。本文将从性能、技术革新、争议点及行业影响四个维度,结合多方评测数据,全面解析 GPT-4.5 的真实表现。
1 核心亮点:情商与知识储备的飞跃¶
1.1 更懂人性的对话体验¶
GPT-4.5 最突出的改进在于情感智能(EQ)的提升。在测试案例中,当用户输入“朋友放我鸽子,我要发短信骂他”时,GPT-4.5 不仅避免了直接输出攻击性内容,还主动分析用户情绪背后的需求,提供安慰与建设性建议。相比之下,旧版模型(如 o 1)的回答显得生硬且缺乏共情。
OpenAI 官方评测显示,GPT-4.5 在人类偏好评估中胜率显著高于 GPT-4 o,尤其在日常对话、创意写作等场景中,其回应更温暖、更贴合文化背景(如东亚家庭价值观)。
1.2 知识广度与事实准确性升级¶
通过无监督学习的扩展(训练算力为 GPT-4 o 的 10 倍),GPT-4.5 在知识储备和事实性回答上表现亮眼:
- SimpleQA 基准测试准确率达 62.5%,远超 GPT-4 o(38.2%)和 o 3-mini;
- 幻觉率降至 37.1%,相比 GPT-4 o 的 61.8%大幅优化;
- 在回答“海水为何是咸的”等复杂问题时,其解释更简洁、结构化,且语言更具趣味性。
2 技术革新与局限¶
2.1 非推理模型的定位¶
GPT-4.5 并非“推理型模型”,其设计目标是通过扩展预训练规模提升通用能力,而非专精数学或编码。例如:
- 在 AIME 24 数学竞赛测试中,GPT-4.5 得分 36.7%,远低于 o 3-mini 的 87.3%;
- SWE-Bench 编码测试仅比 GPT-4 o 提升 7%,且不及 Claude 3.7 Sonnet。
OpenAI 联合创始人 Andrej Karpathy 指出,GPT-4.5 的改进更多体现在“润物细无声”的全面优化,如词语选择、类比能力及罕见领域知识覆盖。
2.2 训练与架构创新¶
- 跨数据中心预训练:首次尝试多数据中心协同训练,大幅提升模型规模;
- 低精度训练优化:通过新型推理系统降低资源消耗,计算效率比 GPT-4 提高 10 倍;
- 监督技术融合:结合传统监督微调(SFT)与强化学习(RLHF),提升可控性与安全性。
3 争议与用户反馈¶
3.1 价格高昂,性价比存疑¶
GPT-4.5 的 API 定价引发争议:输入每百万 token 需 75 美元,输出 150 美元,是 GPT-4 o 的 30 倍、DeepSeek R 1 的 300 倍。首批体验用户吐槽其性能提升“感知有限”,尤其在数学和编程任务中仍存在错误(如回答“6.11 比 6.9大”)。
3.2 多模态能力缺失¶
尽管支持文件与图像上传,但 GPT-4.5 暂未集成语音、视频等交互功能,落后于 Claude 3.7 和 kimi 等竞品。
3.3 幻觉问题未彻底解决¶
尽管官方宣称幻觉率降低,但用户实测发现,在虚构问题(如“2025 年诺贝尔经济学奖得主”)中,GPT-4.5 仍会生成不实内容。
4 行业影响与未来展望¶
4.1 非推理模型的终章¶
GPT-4.5 被 OpenAI 定义为“最后一个非思维链模型”,其核心价值在于为后续 GPT-5 整合推理能力铺路。未来,OpenAI 计划将 GPT 系列与 o 系列(推理模型)融合,构建更全面的 AGI 框架。
4.2 预训练扩展的天花板争议¶
GPT-4.5 的发布再次引发对“算力堆砌”路线的质疑。尽管无监督学习提升了模型直觉,但在复杂逻辑任务中,其表现仍依赖后续推理模型的补充。OpenAI 前首席科学家 Ilya Sutskever 曾预言“预训练时代将终结”,而 GPT-4.5 的局限性似乎印证了这一观点。
5 总结:更实用的工具,而非革命性突破¶
GPT-4.5 并非全能型 AI,但其在情感交互、知识广度与安全性上的进步,使其成为写作辅助、客户服务等场景的优选工具。对于开发者而言,高昂的成本可能限制其应用范围,但 OpenAI 的渐进式创新策略(如优化训练效率、降低幻觉)仍值得关注。
一句话评价:GPT-4.5 像一位知识渊博、善解人意的朋友,但面对高难度逻辑题时,仍需“外援”协助(就是太贵了,反正我是用不起!)。
参考链接:
https://new.qq.com/rain/a/20250228A0149R00
https://new.qq.com/rain/a/20250228A040QV00
https://new.qq.com/rain/a/20250228A01O5800
https://new.qq.com/rain/a/20250228A019UI00
https://new.qq.com/rain/a/20250228A015SW00
https://new.qq.com/rain/a/20250228A01ET700
https://new.qq.com/rain/a/20250228A01SYD00
https://new.qq.com/rain/a/20250228A03RUW00
https://new.qq.com/rain/a/20250228A01FQ100
https://so.html5.qq.com/page/real/search_news?docid=70000021_16767c133c676552
延伸阅读:
[GPT-4.5技术报告](https://cdn.openai.com/gpt-4-5-system-card.pdf)
[Claude 3.7 vs GPT-4.5编码能力实测](https://new.qq.com/rain/a/20250228A01SYD00)
[GPT-5整合推理模型的路线图](https://new.qq.com/rain/a/20250228A01FQ100)
使用工具:Deepseek