AI 资讯 · 2026年9月14日

OpenAI:启用两项 API 设置后,GPT-5.6 在 ARC-AGI-3 基准得分提升至约三倍

据 OpenAI 于 2026 年 7 月 29 日发布的技术说明,其团队在 ARC-AGI-3 基准测试中,通过启用两项 API 相关设置,使 GPT-5.6 的测试表现出现显著提升:来源摘要显示,相关调整让模型得分提升至约三倍,同时改善了运行效率。这两项设置的核心方向分别是保留推理过程启用压缩/整理机制。对开发者和 API 使用者而言,这一案例的重点不只是“模型更强”,而是说明在复杂任务中,调用参数与上下文管理策略可能直接影响最终能力释放。

两项设置为何会影响基准表现

ARC-AGI-3 属于更强调抽象推理、任务迁移和问题求解能力的评测场景。来源显示,GPT-5.6 在该基准上的提升并非单纯来自更换模型,而是来自 API 调用层面的配置变化。这意味着,同一个模型在不同调用方式下,可能呈现出明显不同的结果。

第一项方向是保留推理。对于需要多步分析、反复验证和从中间结论继续推进的任务,如果系统能够让模型在后续步骤中有效利用已有推理状态,就可能减少“重新思考”的成本,也降低中间信息丢失造成的偏差。第二项方向是启用 compaction,即对已有上下文或推理内容进行压缩、整理,让模型在有限上下文窗口或较长任务链中继续保留关键线索。

从 API 使用视角看,这类机制本质上是在解决一个常见问题:复杂任务并不只消耗 token,还消耗“连续性”。如果每轮调用都让模型从零开始,或者长上下文中关键信息被稀释,模型即便本身能力很强,也可能无法稳定复现高质量推理。

对开发者:模型能力之外,调用策略成为性能变量

这次信息对开发者的直接启示是,评估模型时不能只看模型名称和单次响应效果,还要关注 API 是否支持适合任务形态的设置。尤其是在自动化解题、智能体工作流、代码分析、数据推理、复杂客服和企业内部知识处理场景中,任务往往不是一次问答完成,而是多轮、长链路、带状态的过程。

  • 长任务链路:保留关键推理状态,有助于减少重复分析。
  • 多轮智能体:压缩上下文可提升连续执行任务时的信息利用率。
  • 成本控制:如果效率同步改善,可能减少无效 token 与重复调用。
  • 评测复现:同一模型在不同参数组合下表现差异可能很大,测试时应记录调用配置。

对接入方来说,这也提醒我们:API 中转、额度管理和并发调度不应只解决“能不能调用”,还要关注“如何稳定调用”。当模型厂商持续开放更多推理、记忆、压缩、上下文处理相关能力时,中间层平台需要把这些能力更清晰地暴露给开发者,避免因为默认配置不合适而损失模型表现。

对 API 成本与稳定性的影响

来源摘要同时提到效率提升。虽然公开摘要没有给出具体成本、token 消耗或延迟数据,但从机制上看,保留推理与 compaction 可能让模型在复杂任务中减少重复路径,进而改善单位任务的完成效率。对于批量调用用户,这类变化值得重点测试,因为最终成本不只取决于单价,也取决于每个任务需要多少轮调用、多少上下文和多少重试。

在生产环境中,建议开发者不要只用简单 prompt 做模型选型,而应建立贴近业务的测试集,并对不同配置进行 A/B 测试。特别是当业务包含长上下文、多轮决策或推理型任务时,应把推理保留、上下文压缩、最大输出、并发限制、失败重试等因素一起纳入评估。

本站视角:中转接入需要跟上“参数时代”

这则消息反映出一个趋势:大模型 API 的竞争正在从“模型参数更大、基准分更高”扩展到“调用方式更精细、上下文管理更智能”。对于使用 OpenAI、Claude、Gemini 等模型的开发者来说,未来接入体验的差异,可能来自模型本身,也可能来自平台是否支持完整参数、是否能稳定透传设置、是否便于监控 token 与错误率。

因此,企业在选择 API 接入方案或中转服务时,应关注三点:是否支持新模型与新参数快速适配;是否能在高并发下保持稳定;是否提供成本、额度和调用日志层面的可观测能力。OpenAI 这次关于 GPT-5.6 与 ARC-AGI-3 的案例说明,正确启用 API 能力本身就是性能优化的一部分,开发者不应把默认调用等同于模型上限。

OpenMagic API

Need more than content? Move into the product flow.

If you are here for model access, pricing, developer docs, or the future API console, the dedicated product path now lives on api.openmagic.ai.

登录免费注册