最难的那套AI智商测试,被英伟达一个Agent刷到满分了。
ARC-AGI-3,圈内公认最刁钻的抽象推理基准,25个环境183关,英伟达的AVO(Agent for Visual Operations)直接100%全清。这不是又训了个更大的模型,而是一个"会自己搭工具、自己排流程"的智能体。
有意思的是TechCrunch那句点评:真正立功的不是模型本身,是套在它外面的harness(运行框架)。这跟最近OpenAI把Codex Harness开源、DeepSeek的Harness周更是一个方向,大家越来越认同,Agent的胜负手正从"底层模型多强"转到"运行时架构、工具编排、上下文管理"这些骨架功夫上。
堆参数那套故事,可能要翻篇了。骨架搭得巧,普通模型也能干翻笨重的大块头。
换个角度想,当"怎么用"比"用什么"更值钱,是不是反而给中小团队留了口饭吃?