OpenAI公布秘术:两个设置,GPT-5.6 Sol ARC-AGI-3成绩暴涨三倍!

OpenAI公布秘术:两个设置,GPT-5.6 Sol ARC-AGI-3成绩暴涨三倍! 在官方测试框架下GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3%但换用与 ChatGPT、Codex 更接近的运行方式后得分直接提升至 38.3%约提升 3 倍。今天对技术细节一直讳莫如深的 OpenAI终于 OpenAI 了一把。按照 Sam Altman 的说法他们是公布了一篇goblin-level 的 blog。他们只改变了两个设置就能让模型在 ARC-AGI-3 的得分提升 3 倍链接https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/在官方测试框架下GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3%但换用与 ChatGPT、Codex 更接近的运行方式后得分直接提升至 38.3%约提升 3 倍。在此期间模型本身并没有发生变化只是改变了两个设置。OpenAI 发现长期运行的 Agent 如果无法保留自己的推理过程也无法有效压缩历史上下文就很难基于过去经验持续学习。这也带来了一个新的问题当 AI Agent 开始执行越来越长、越来越复杂的任务时我们评测的究竟是模型本身还是模型所处的运行环境以下是博客内容。一段加速播放的视频展示了 GPT-5.6 Sol 尝试解决 ARC-AGI-3 基准测试中谜题的过程。左侧为官方测试框架official harness右侧为 Responses API 测试框架该框架能够保留推理过程并支持上下文压缩。在该游戏的排行榜上目前没有任何前沿模型能够通过第一关之后的关卡。而在 Responses API 测试框架下GPT-5.6 Sol 成功解决了全部六个关卡。ARC-AGI-3测试 AI 如何学习陌生游戏ARC-AGI-3 是一个用于评估 AI Agent 学习和推理能力的基准测试。与传统问答任务不同ARC-AGI-3 不会直接告诉模型游戏规则而是让 Agent 自己探索陌生的二维游戏环境通过观察结果和不断尝试逐渐理解游戏机制。因此它测试的并非单次回答能力而是 AI 在长期交互过程中的学习能力。ARC-AGI-3 采用了一个较为通用的测试框架不包含额外工具或针对特定模型的优化。ARC 团队认为这样可以更公平地比较不同模型同时暴露模型在推理和学习上的不足。但 OpenAI 在分析 GPT-5.6 Sol 的测试过程时发现通用测试框架中的一些设计可能影响了模型发挥。GPT-5.6 Sol 为什么表现不佳最初GPT-5.6 Sol 在 ARC-AGI-3 上的表现让 OpenAI 感到困惑。此前GPT-5.6 Sol 已经解决了一些长期存在的数学开放问题也能够完成《宝可梦 火红》《杀戮尖塔》等复杂游戏任务。但在 ARC-AGI-3 中它的表现却明显下降。OpenAI 检查模型运行过程后发现问题并不完全来自模型能力而是测试框架限制了 Agent 的长期记忆。第一个问题推理过程被丢弃。GPT-5.6 Sol 在执行每一次游戏操作后之前产生的私有推理过程都会被删除。这意味着每执行一个新动作模型都需要重新理解当前游戏状态。虽然它还能看到过去执行过的操作记录和简单说明但无法访问此前形成的计划、规律判断以及行动背后的思考过程。第二个问题历史上下文被截断。ARC-AGI-3 测试框架采用滚动截断机制。当上下文超过限制后最早的消息会被删除。因此随着游戏持续进行GPT-5.6 Sol 不仅无法记住过去的思考也会逐渐失去对早期行动和观察结果的记忆。OpenAI 认为这两个因素共同导致模型难以在长时间任务中积累经验。它就像一个玩家每走一步都需要重新理解游戏规则同时还会忘记自己之前尝试过什么。两个设置得分提高 3 倍为了解决这一问题OpenAI 使用了与 ChatGPT 和 Codex 更接近的运行方式重新实现了 ARC-AGI-3 测试框架。其中关键是两个 API 设置保留推理过程retained reasoningOpenAI 的模型在生成回答或调用工具之前会产生内部推理过程。在 ChatGPT 和 Codex 中这些推理信息会作为上下文的一部分保留下来。开启该设置后GPT-5.6 Sol 不需要每一步都重新分析游戏而是可以利用过去形成的理解继续行动。OpenAI 观察发现保留推理后模型每次行动前需要的思考时间减少同时能够基于过去经验形成更加连贯的策略。上下文压缩compaction此前 ARC-AGI-3 使用滚动截断方式解决上下文长度问题即直接删除最早的信息。但这种方式会导致模型丢失关键历史。上下文压缩则会对已有信息进行整理在限制上下文规模的同时保留重要内容。启用上下文压缩后GPT-5.6 Sol 能够在更长时间运行中保持对游戏规律的理解并减少输出 token。如图所示在长时间任务中GPT-5.6 Sol 会将此前累积的推理过程压缩为摘要并继续基于压缩后的上下文进行推理从而避免随着任务增长丢失早期信息。中间列展示了两种测试框架对模型上下文窗口使用方式的差异。由于更改设置后能够更好地记住过去的信息它在每次行动时所需的思考更少执行速度也明显更快。最终在两个设置共同作用下GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的成绩从 13.3% 提升至 38.3%约提升 3 倍。与此同时模型输出 token 消耗降低了约 6 倍。写在最后OpenAI 表示这次实验希望提醒开发者基准测试很少只测量模型本身。它们同时也受到 API 设置、测试框架设计以及提示词方式的影响。对于希望最大化模型性能的 API 开发者OpenAI 建议采用与自身产品一致的配置对于模型之间的比较OpenAI 也建议参考采用这些设置的评测结果因为它们更接近 ChatGPT 和 Codex 中的真实使用环境。ARC-AGI-3 为了保证评测公平采用了一个统一、简化的测试框架但这个框架没有考虑到 Agent 产品中的一些关键能力如推理保留、上下文压缩导致模型表现被低估。这么说来未来衡量模型能力可能还需要一个更接近使用场景的评测体系。