AI 资讯 · 2026年7月30日

OpenAI称两项API设置让GPT-5.6在ARC-AGI-3得分提升至三倍:保留推理与启用压缩成关键

据OpenAI于2026年7月29日发布的技术文章显示,团队在ARC-AGI-3基准测试中,通过启用两项API相关设置,使GPT-5.6的表现获得显著提升:一项是保留推理过程,另一项是启用上下文压缩。来源摘要称,这两项设置不仅提升了模型在ARC-AGI-3上的得分,还改善了效率,整体效果达到“tripled scores”的级别。对于关注模型调用质量、成本和稳定性的开发者而言,这一信息的重点不只是“模型更强”,而是提示API侧参数配置正在成为影响复杂任务表现的关键变量。

两项设置改变了什么:推理保留与压缩机制

从来源披露的信息看,OpenAI强调的并非更换模型或增加外部工具,而是在GPT-5.6调用中开启两项设置。其一是保留推理,意味着模型在连续任务或需要多步判断的场景中,能够更好地利用已经形成的中间推理状态,减少重复思考带来的损耗。其二是启用compaction,即对上下文或推理相关信息进行压缩整理,让关键内容在更长任务链中得以保留,同时降低无效信息占用。

ARC-AGI-3这类基准通常更关注抽象推理、模式识别和泛化能力。来源显示,两项设置组合后,对GPT-5.6在该基准中的表现产生了明显拉动。这说明在复杂推理任务里,API调用方式可能与模型本身能力同等重要:同一个模型,在不同参数和状态管理策略下,可能表现出截然不同的效率与准确率。

对开发者和API使用者的影响

对使用OpenAI、Claude、Gemini等模型API的团队来说,这一案例有几个直接启示。首先,模型评测不能只看“裸调用”的结果,还应记录上下文策略、推理保留、压缩开关等配置。其次,复杂任务不一定只靠更大模型解决,合理的API设置可能在不改变模型的情况下带来更高产出。再次,若业务场景涉及代码生成、智能体、多轮规划、数据分析或自动化操作,上下文管理和推理状态管理将直接影响可用性。

  • 评测维度变化:同一模型在不同API设置下可能得分差异明显,企业内部评测应固定并记录参数。
  • 成本优化空间:启用压缩可能帮助减少冗余上下文,提高长任务运行效率,但实际账单仍需按平台计费规则核算。
  • 智能体场景受益:需要连续推理和多轮执行的Agent,更依赖对中间状态的保留与整理。
  • 接入复杂度上升:开发者需要理解更多API设置,而不是只填写model与prompt。

为什么这对API中转和模型调用生态重要

站在API中转、额度管理和批量调用的角度,这类设置的意义在于:未来的模型接入不只是“能不能调通”,而是“能否以稳定、可控、低成本的方式调出最佳效果”。当推理保留和压缩成为影响成绩的变量,平台侧就需要更清晰地暴露参数、记录调用配置,并支持不同业务按场景选择策略。

例如,轻量问答可能不需要复杂状态管理;而长链路任务、自动化工作流、评测任务则可能需要开启相关能力。对于API批量用户来说,这也意味着压测和灰度发布要更细:不仅比较不同模型,也要比较不同设置组合在延迟、成功率、Token消耗和任务完成率上的差异。

总体来看,OpenAI这次围绕GPT-5.6和ARC-AGI-3的案例,传递出的信号是:API参数配置正在从辅助选项变成性能工程的一部分。开发者若希望稳定获得高质量结果,应把模型选择、提示词设计、上下文压缩、推理保留和成本监控放在同一套工程体系中评估,而不是只依赖默认调用。

OpenMagic API

Need more than content? Move into the product flow.

If you are here for model access, pricing, developer docs, or the future API console, the dedicated product path now lives on api.openmagic.ai.

登录免费注册