据OpenAI于2026年7月29日发布的技术文章显示,团队在ARC-AGI-3基准测试中,通过启用两项API相关设置,使GPT-5.6的表现获得显著提升:一项是保留推理过程,另一项是启用上下文压缩。来源摘要称,这两项设置不仅提升了模型在ARC-AGI-3上的得分,还改善了效率,整体效果达到“tripled scores”的级别。对于关注模型调用质量、成本和稳定性的开发者而言,这一信息的重点不只是“模型更强”,而是提示API侧参数配置正在成为影响复杂任务表现的关键变量。
两项设置改变了什么:推理保留与压缩机制
从来源披露的信息看,OpenAI强调的并非更换模型或增加外部工具,而是在GPT-5.6调用中开启两项设置。其一是保留推理,意味着模型在连续任务或需要多步判断的场景中,能够更好地利用已经形成的中间推理状态,减少重复思考带来的损耗。其二是启用compaction,即对上下文或推理相关信息进行压缩整理,让关键内容在更长任务链中得以保留,同时降低无效信息占用。
ARC-AGI-3这类基准通常更关注抽象推理、模式识别和泛化能力。来源显示,两项设置组合后,对GPT-5.6在该基准中的表现产生了明显拉动。这说明在复杂推理任务里,API调用方式可能与模型本身能力同等重要:同一个模型,在不同参数和状态管理策略下,可能表现出截然不同的效率与准确率。
对开发者和API使用者的影响
对使用OpenAI、Claude、Gemini等模型API的团队来说,这一案例有几个直接启示。首先,模型评测不能只看“裸调用”的结果,还应记录上下文策略、推理保留、压缩开关等配置。其次,复杂任务不一定只靠更大模型解决,合理的API设置可能在不改变模型的情况下带来更高产出。再次,若业务场景涉及代码生成、智能体、多轮规划、数据分析或自动化操作,上下文管理和推理状态管理将直接影响可用性。
- 评测维度变化:同一模型在不同API设置下可能得分差异明显,企业内部评测应固定并记录参数。
- 成本优化空间:启用压缩可能帮助减少冗余上下文,提高长任务运行效率,但实际账单仍需按平台计费规则核算。
- 智能体场景受益:需要连续推理和多轮执行的Agent,更依赖对中间状态的保留与整理。
- 接入复杂度上升:开发者需要理解更多API设置,而不是只填写model与prompt。
为什么这对API中转和模型调用生态重要
站在API中转、额度管理和批量调用的角度,这类设置的意义在于:未来的模型接入不只是“能不能调通”,而是“能否以稳定、可控、低成本的方式调出最佳效果”。当推理保留和压缩成为影响成绩的变量,平台侧就需要更清晰地暴露参数、记录调用配置,并支持不同业务按场景选择策略。
例如,轻量问答可能不需要复杂状态管理;而长链路任务、自动化工作流、评测任务则可能需要开启相关能力。对于API批量用户来说,这也意味着压测和灰度发布要更细:不仅比较不同模型,也要比较不同设置组合在延迟、成功率、Token消耗和任务完成率上的差异。
总体来看,OpenAI这次围绕GPT-5.6和ARC-AGI-3的案例,传递出的信号是:API参数配置正在从辅助选项变成性能工程的一部分。开发者若希望稳定获得高质量结果,应把模型选择、提示词设计、上下文压缩、推理保留和成本监控放在同一套工程体系中评估,而不是只依赖默认调用。
