Anthropic砍的不是模型价,是Agent成本
Anthropic 这次 Fable 5.1 最值得看的,不是模型又强了多少,而是它直接动了 Agent 最敏感的一项成本。
9 月 1 日,Claude Fable 5.1 正式发布。标准输入、输出价格仍然维持每百万 token 10 美元和 50 美元,但缓存读取价格从 Fable 5 的 1 美元直接降到 0.25 美元,降幅达到 75%。相比之下,Opus 5 的缓存读取还是 0.5 美元,GPT-5.6 Sol 当前缓存输入价格为 0.4 美元。
为什么这一刀这么重要?因为 Agent 和普通聊天最大的区别,是它会不断回头读东西。
代码仓库、系统提示词、历史对话、工具定义、前几轮执行结果,一项任务跑几十甚至几百步时,大量上下文会被反复读取。Prompt Cache 的作用,就是不用每次都重新计算这些已经处理过的内容。
Anthropic 自己给出的估算很直接:缓存降价以后,普通工作负载整体成本大约可以下降 25%,高度 Agent 化的任务最高可以降低约 45%。
甚至可以反过来算。
如果唯一变化是缓存读取价格下降 75%,最终账单下降 25%,意味着原来的典型任务里,缓存读取成本大约占三分之一;如果 Agent 任务节省 45%,缓存相关费用原来可能接近六成。
所以这不是一个“不痛不痒的 API 降价”,而是在专门砍长任务的边际成本。
更有意思的是,Anthropic 其实有降价动力。
Ramp 对企业客户的统计显示,Fable 5 发布一个月后,只占 Anthropic 客户购买 token 的 6%,虽然价格很高,但也只贡献了 Anthropic 模型支出的 11.4%。同期 GPT-5.6 Sol 在 OpenAI 侧分别占到约 25% 的 token 和 23% 的模型支出。换句话说,旗舰能力很强,但企业没有充分把工作负载迁过去。
Fable 5.1 这次其实是在解决一个很现实的问题:
模型够强,但每跑一步都太贵,企业就不会放心让 Agent 跑很久。
价格一旦下来,Agent 才敢多读代码、多查资料、多调用工具、多做几轮自我检查。
Cognition 的动作也很快,Fable 5.1 已经进入 Devin Desktop、CLI 和 Cloud。它们实际测试的 FrontierCode 任务里,Fable 5.1 单任务成本从 Fable 5 的 5.84 美元降到 2.68 美元;Cognition 预计真实 Devin 工作负载能够省下约 10%—25%。
这件事还有另一层值得看。
Anthropic 正在疯狂提前锁算力。
近期公司先签下约 450 亿美元的 Nscale 算力合同,随后又被报道与 Lambda 达成约 350 亿美元的云计算协议。前者将主要使用下一代 Nvidia Vera Rubin 系统,并预计从 2027 年开始陆续上线。
所以现在看到的是一个非常典型的 AI 商业循环:先锁巨额算力 → 降低推理边际成本 → 鼓励 Agent 跑得更久 → 把更多企业任务迁进模型 → 再消化新增算力。
这比单纯“模型降价”有意思得多。
但原稿里“受益的是 DRAM 和 NVMe”这句话,我建议别直接下结论。
Anthropic 官方明确写的是,Prompt Cache 的 KV 表示保存在内存中、不落盘;默认缓存周期是 5 分钟,也可以付费使用 1 小时缓存。随着 Agent 上下文越来越长,确实会提高对内存容量、内存带宽以及缓存调度效率的要求,但目前没有证据证明 Fable 5.1 的降价会直接转化成某一类 DRAM 或 NVMe 的确定性增量需求。
同样,“因为 10 月要按 2 万亿美元上市,所以降价”也不要写成确定事实。
FT 报道的是部分 Anthropic 投资者预计其秋季 IPO 估值可能达到 2 万亿美元或更高;Ramp 的 11.4% 数据又确实说明旗舰利用率并不算高。两件事放在一起,可以判断 Anthropic 有非常强的动力在上市前提高旗舰模型使用规模,但这依然属于商业逻辑推断,不是 Anthropic 官方给出的降价理由。
还有最后一个变量:OpenAI Astra。
OpenAI 已经确认 Astra 是下一款能力更强的模型,并首次触发了其“Critical”级网络安全能力标准,但目前官方没有公布明确发布时间和价格,所以“9 月 15 日前看定价”这一句目前不能写死。
所以我觉得这次真正值得记住的一句话是:AI价格战已经从“每百万token多少钱”,进入“完成一整项工作到底多少钱”。
下一轮竞争,可能不是谁的输入价再便宜 1 美元,而是谁能让一个 Agent 连续工作几个小时、读几百万 token、调用几十次工具之后,账单依然让企业愿意买单。
这才是 Fable 5.1 降价真正值得看的地方。
