昊梵体育网

Fable 5.1一出,GPT 5.6明显不够看,Agentic几个角度的基准成

Fable 5.1一出,GPT 5.6明显不够看,Agentic几个角度的基准成绩甚至不是同一代即视感,前沿模型能力进化还在大踏步向前。OpenAI亮出Astra,号称电脑操作水平超越人类,这个角度还能理解,安全方面的一些表述则会让外部生疑:在找漏洞与戳漏洞、秀肌肉与像Myhtos一样找揍之间,Astra到底是几个意思,用俗话说究竟想干嘛——OpenAl称,Astra能在没有人工指导的情况下,发现计算机系统中未知的安全漏洞,并直接利用这些漏洞。公司还说 Astra在衡量模型入侵已知系统漏洞能力的ExploitBench测试中拿到了满分。不过这事的另一个实质是:Astra和Mythos前后脚证明了同一件事,模型能力临界点,也是智能安全的临界点,这两者会一起到来,那个可能无法彻底对齐、无法百分百安全约束、已经开始进入递归自我改进通道、会在Agent里走出Sandbox自作主张乃至偶尔行为失控(会被利用)的AI已经来了,尽管一部分人对硬币的这一面无动于衷、不以为然。