GPT-5.2正式发布!让打工人每周少干10小时

2025-12-11 | 来源: 爱范儿 | 转到微信 | 有0人参与评论 | 字体: 放大缩小 | 收藏 | 打印

1106 天，OpenAI 从掀桌子的人，变成了被掀桌子的人。

伴随着 Google Gemini 3 的发布，OpenAI CEO 奥特曼上周罕见拉响了「Code Red」红色警报，并宣布所有资源回流 ChatGPT 主线，其他业务一律靠边站。

这是 OpenAI 成立以来第一次进入「红色警报」状态，也是它第一次如此明确地承认：竞争压力已经大到必须全力应对。

而就在刚刚，OpenAI 发布了 GPT-5.2 模型，打出了一记力量感十足的重拳。GPT-5.2 将向 ChatGPT 付费用户开放，并通过 API 提供给开发者，分为三个版本：

不聊天，真干活，GPT-5.2 闯进打工人职场

本以为 OpenAI 会专注提升 ChatGPT 的个性化和消费者体验，结果 GPT-5.2 的发布方向依旧是走职场实用主义的路数。

用 OpenAI 应用 CEO Fidji Simo 的话来说：「我们设计 GPT-5.2 是为了给用户创造更多经济价值。」

什么叫经济价值？

就是让 AI 真的能干活，做表格、写 PPT、敲代码、看图、读长文、调用工具、搞定复杂项目，这些都是 GPT-5.2 的拿手好戏。

数据也挺唬人。平均每个 ChatGPT 企业版用户说，AI 每天能给他们省 40 到 60 分钟，重度用户更狠，每周能省 10 小时以上。

GPT-5.2 Thinking 是这次发布的重头戏。

在评估 44 个职业知识型任务的 GDPval 测试中，它成为首个在总体表现上达到或超过人类专家水平的模型。具体来说，在与行业专家的对比中，GPT-5.2 Thinking 在 70.9% 的任务中胜出或持平，由人类专家亲自评判。

这些任务可不是随便出的题，涵盖了美国 GDP 排名前 9 个行业，包括销售演示文稿、会计报表、急诊排班计划、制造业图纸、短视频制作等等，都是真实工作场景里的硬活。

编程方面的提升更明显。

自断后路不到12小时,范曾忧虑的事成真了

周休3天即将到来?每周工作减为4天

APEC深圳会议首场活动正式举行 21个经济体参与

SWE-Bench Pro 是个相当严格的测试，评估模型在真实世界软件工程中的能力，涉及四种编程语言，比只测 Python 的版本难多了。GPT-5.2 Thinking 在这个测试里拿到了 55.6% 的成绩，创下业界新高。

更夸张的是在 SWE-bench Verified 里直接干到 80%，成为目前最高记录。这意味着 GPT-5.2 Thinking 能更可靠地调试生产环境中的代码、实现功能需求、重构大型代码库，端到端的修复工作做得更高效，减少人工介入。

前端开发也有明显提升。

早期测试者说，它在处理复杂或非常规的前端 UI 任务时表现更出色，特别是涉及 3D 元素的场景，妥妥的全栈工程师助手。

OpenAI 还放出了几个根据单一提示生成的示例：海浪模拟器、节日贺卡生成器、打字雨游戏。就一个提示词，整个单页应用就出来了，可调节的参数、逼真的动画效果、平静的 UI 风格，全都有。

幻觉率降低30%，长文本能力接近完美

事实准确性这块，GPT-5.2 Thinking 相较于 GPT-5.1 Thinking 的「幻觉率」更低。

在一组匿名化的 ChatGPT 查询中，出现错误的回答减少了约 30%。对于专业人士来说，这意味着在研究、写作、分析与决策支持等任务中，出错率更低，用起来更放心。

不过 OpenAI 也提醒，就像所有模型一样，GPT-5.2 并不完美，关键性任务还是得自己核查。

长文本推理能力也树立了新标杆。

在 OpenAI MRCRv2 基准测试中，GPT-5.2 表现领先。这个测试评估的是模型能不能正确整合分布在长文档中的信息，对于深度文档分析这类涉及数十万 token 的跨文档信息整合任务来说，GPT-5.2 的准确率远超 GPT-5.1。

尤其在 MRCR 的 4 针测试（不同于「大海捞针」，而是要求模型在海量文本里，区分并找出多个一模一样的「针」中的特定一个）中，最多 256k token 的上下文，GPT-5.2 是首个接近 100% 准确率的模型。

这意味着专业用户可以用 GPT-5.2 高效处理超长文档，报告、合同、学术论文、访谈记录、多文件项目，它都能在处理上百页内容时保持逻辑一致和信息准确。视觉理解方面，GPT-5.2 Thinking 是目前 OpenAI 最强的视觉模型。在图表推理和软件界面理解方面，错误率下降了约一半。