跳转至

GPT-4.5 深度评测:更懂人心,但非全能战士

2025 年 2 月 28 日凌晨,OpenAI 以一场 13 分钟的直播发布了最新语言模型 GPT-4.5(代号 Orion)。作为 GPT-4 的迭代版本,这一号称“史上最大规模、最高情商”的模型迅速引发热议。本文将从性能、技术革新、争议点及行业影响四个维度,结合多方评测数据,全面解析 GPT-4.5 的真实表现。

1 核心亮点:情商与知识储备的飞跃

1.1 更懂人性的对话体验

GPT-4.5 最突出的改进在于情感智能(EQ)的提升。在测试案例中,当用户输入“朋友放我鸽子,我要发短信骂他”时,GPT-4.5 不仅避免了直接输出攻击性内容,还主动分析用户情绪背后的需求,提供安慰与建设性建议。相比之下,旧版模型(如 o 1)的回答显得生硬且缺乏共情。

OpenAI 官方评测显示,GPT-4.5 在人类偏好评估中胜率显著高于 GPT-4 o,尤其在日常对话、创意写作等场景中,其回应更温暖、更贴合文化背景(如东亚家庭价值观)。

1.2 知识广度与事实准确性升级

通过无监督学习的扩展(训练算力为 GPT-4 o 的 10 倍),GPT-4.5 在知识储备和事实性回答上表现亮眼:

  • SimpleQA 基准测试准确率达 62.5%,远超 GPT-4 o(38.2%)和 o 3-mini;
  • 幻觉率降至 37.1%,相比 GPT-4 o 的 61.8%大幅优化;
  • 在回答“海水为何是咸的”等复杂问题时,其解释更简洁、结构化,且语言更具趣味性。

2 技术革新与局限

2.1 非推理模型的定位

GPT-4.5 并非“推理型模型”,其设计目标是通过扩展预训练规模提升通用能力,而非专精数学或编码。例如:

  • 在 AIME 24 数学竞赛测试中,GPT-4.5 得分 36.7%,远低于 o 3-mini 的 87.3%;
  • SWE-Bench 编码测试仅比 GPT-4 o 提升 7%,且不及 Claude 3.7 Sonnet。

OpenAI 联合创始人 Andrej Karpathy 指出,GPT-4.5 的改进更多体现在“润物细无声”的全面优化,如词语选择、类比能力及罕见领域知识覆盖。

2.2 训练与架构创新

  • 跨数据中心预训练:首次尝试多数据中心协同训练,大幅提升模型规模;
  • 低精度训练优化:通过新型推理系统降低资源消耗,计算效率比 GPT-4 提高 10 倍;
  • 监督技术融合:结合传统监督微调(SFT)与强化学习(RLHF),提升可控性与安全性。

3 争议与用户反馈

3.1 价格高昂,性价比存疑

GPT-4.5 的 API 定价引发争议:输入每百万 token 需 75 美元,输出 150 美元,是 GPT-4 o 的 30 倍、DeepSeek R 1 的 300 倍。首批体验用户吐槽其性能提升“感知有限”,尤其在数学和编程任务中仍存在错误(如回答“6.11 比 6.9大”)。

3.2 多模态能力缺失

尽管支持文件与图像上传,但 GPT-4.5 暂未集成语音、视频等交互功能,落后于 Claude 3.7 和 kimi 等竞品。

3.3 幻觉问题未彻底解决

尽管官方宣称幻觉率降低,但用户实测发现,在虚构问题(如“2025 年诺贝尔经济学奖得主”)中,GPT-4.5 仍会生成不实内容。

4 行业影响与未来展望

4.1 非推理模型的终章

GPT-4.5 被 OpenAI 定义为“最后一个非思维链模型”,其核心价值在于为后续 GPT-5 整合推理能力铺路。未来,OpenAI 计划将 GPT 系列与 o 系列(推理模型)融合,构建更全面的 AGI 框架。

4.2 预训练扩展的天花板争议

GPT-4.5 的发布再次引发对“算力堆砌”路线的质疑。尽管无监督学习提升了模型直觉,但在复杂逻辑任务中,其表现仍依赖后续推理模型的补充。OpenAI 前首席科学家 Ilya Sutskever 曾预言“预训练时代将终结”,而 GPT-4.5 的局限性似乎印证了这一观点。

5 总结:更实用的工具,而非革命性突破

GPT-4.5 并非全能型 AI,但其在情感交互、知识广度与安全性上的进步,使其成为写作辅助、客户服务等场景的优选工具。对于开发者而言,高昂的成本可能限制其应用范围,但 OpenAI 的渐进式创新策略(如优化训练效率、降低幻觉)仍值得关注。

一句话评价:GPT-4.5 像一位知识渊博、善解人意的朋友,但面对高难度逻辑题时,仍需“外援”协助(就是太贵了,反正我是用不起!)。


参考链接:

https://new.qq.com/rain/a/20250228A0149R00  

https://new.qq.com/rain/a/20250228A040QV00  

https://new.qq.com/rain/a/20250228A01O5800  

https://new.qq.com/rain/a/20250228A019UI00  

https://new.qq.com/rain/a/20250228A015SW00  

https://new.qq.com/rain/a/20250228A01ET700  

https://new.qq.com/rain/a/20250228A01SYD00  

https://new.qq.com/rain/a/20250228A03RUW00  

https://new.qq.com/rain/a/20250228A01FQ100  

https://so.html5.qq.com/page/real/search_news?docid=70000021_16767c133c676552

延伸阅读:

[GPT-4.5技术报告](https://cdn.openai.com/gpt-4-5-system-card.pdf)  

[Claude 3.7 vs GPT-4.5编码能力实测](https://new.qq.com/rain/a/20250228A01SYD00)  

[GPT-5整合推理模型的路线图](https://new.qq.com/rain/a/20250228A01FQ100)  

使用工具:Deepseek