
本周发布的全新AI基准测试ALE(Agents Last Exam,智能体终极考试)首次对前沿模型进行真实世界多步任务测评,涵盖OS级操作、CAD设计、视频特效、代码重构等复杂场景。OpenAI的GPT-5.5以24.0%的通过率夺得第一,略高于Anthropic的Claude Fable 5(22.0%)。
ALE与以往基准的本质区别在于:不考"会不会",考的是"能不能坚持做完"。研究者发现,很多模型在前几步表现优秀,但到第几十步时开始"忘掉初衷"——而GPT-5.5的优势恰恰在于长时间保持上下文一致性的能力。
与此同时,OpenAI首席科学家Jakub Pachocki向员工透露,GPT-5.6已进入内部测试阶段,相比GPT-5.5有"有意义的性能提升",最快或于6月下旬发布。OpenAI与Anthropic的模型军备竞赛正在以月为单位加速推进。