Astra 在 AGI 测试上接近满分。
一家软件公司把客户项目丢给 Fable 5.1 和 GPT-6 Astra。
GPT-5.6 盲评。总分 86 对 84。
分数接近。分项不是。
①质量和审查,Fable 更高
Fable 质量 88,审查 84
代码组织 90 对 78
结构更清楚,找 bug 更全
四个人为问题全找到
Astra 只找到 2 个,还说审查完成
②长任务和指令,Astra 更省
Astra 长任务 93,指令 96
32 分钟自己修完报错
侧边栏却滚不到退出按钮
得缩小页面才够得着
③订阅、上下文、安全触发
Claude Code 里 Fable 有 100 万上下文
Codex 里 Astra 默认只有 27.2 万
安全触发时 Astra 会拒绝
Claude Code 可能静默换成更弱的模型
④对照实验
同一段需求贴两次
不写布局,按官方指南措辞
打开成品先别看代码
登录、滚动、退出、小屏,手测一遍
自测通过,不等于侧边栏能滚到底。
你们测过自己的仓库吗?分项差在哪?
#AI编程 #claudecode #Codex #Fable #GPT6Astra #编程工具 #模型评测 #AI反常识howto #AI工具 #大模型










