昊梵体育网

GPT-6 Astra 这次的成绩有点夸张了。 从目前公布的这批 Benchmark 来看,我觉得 GPT-6 很可能已经是现阶段世界上综合能力最强的模型。 最离谱的还是 ARC-AGI-3,GPT-5.6 Sol 只有 7.8%,GPT-6 直接干到了接近 99%。FrontierMath Tier 4 达到 97.6%,BenchCAD 95.9%,Terminal-Bench Science 也从 22. ​

GPT-6 Astra 这次的成绩有点夸张了。

从目前公布的这批 Benchmark 来看,我觉得 GPT-6 很可能已经是现阶段世界上综合能力最强的模型。

最离谱的还是 ARC-AGI-3,GPT-5.6 Sol 只有 7.8%,GPT-6 直接干到了接近 99%。FrontierMath Tier 4 达到 97.6%,BenchCAD 95.9%,Terminal-Bench Science 也从 22.4%暴涨到64.6%,几乎各个方向都在大幅提升。

而且这次提升的不只是传统的数学、推理、代码,真正值得关注的是 Agent 和电脑操作能力。AutomationBench 从18.1%提升到41.4%,这意味着模型越来越不只是“回答问题”,而是真的开始具备完成复杂任务的能力。

当然 Benchmark 不能代表全部真实体验,而且不同模型的测试环境也不完全一样。但只看目前公开的数据,GPT-6 Astra 确实已经坐到了第一梯队最前面。

现在就差真正大规模开放之后,看实际体验到底能不能配得上这组恐怖的数据了。