1. GPT-5.6把成本再压20%,模型竞争开始从“更强”转向“更省地强”
发生了什么:OpenAI披露GPT-5.6已进入生产环境,并通过流量分析、路由优化和底层Kernel重写,把端到端服务成本压低20%、Token生成效率提升15%以上。同一天,另一则测试数据显示,仅靠API程序设置调整,GPT-5.6 Sol在ARC-AGI-3上的得分就能从13.3%拉到38.3%。
为什么重要:这说明前沿模型的竞争重心已经明显改变。过去大家盯着参数、榜单和单次回答质量,现在更关键的是谁能把同样的能力以更低的推理成本、更稳的服务方式交付出去。尤其当模型开始承担代码、Agent和长任务时,真正影响毛利和用户体验的,不是实验室里的极限成绩,而是线上每一次推理的吞吐、路由和缓存策略。OpenAI这次给出的信号很直接:模型本身仍重要,但“把模型跑便宜”已经成为第一层竞争力。
具体细节:最值得记住的不是单个数字,而是这几个数字如何互相印证。成本下降20%与效率提升15%以上,背后是内核和调度层优化,而不只是换一版权重;ARC-AGI-3从13.3%到38.3%的跳升,则说明很多所谓“模型能力”其实被服务配置、推理保留和压缩策略强烈影响。再叠加腾讯开源AngelSpec、Moonshot开源MoonEP这些工程动作,行业已经在把“更好的推测解码、更平衡的专家并行、更低的通信开销”当成主战场。今天看的是OpenAI,明天所有头部模型公司都会被迫走到这一步。