今天上午DeepSeek V4 Flash的API出现了一次性能下降听到这儿你可能想说这不就是个技术故障吗但我告诉各位这恰恰是今天最值得细品的一条消息OpenCode那边直接说了原因是前所未有的访问量导致的容量不足翻译成人话就是人太多了服务器被挤爆了这不是事故这是幸福的烦恼先给各位看几组数据你就知道什么叫用脚投票了根据全球最大AI聚合平台OpenRouter的最新周报DeepSeek V4 Flash上周的周调用量达到7.22万亿Token环比增长13直接登顶全球第一你没看错全球第一排在它后面的分别是小米MiMoV2.5腾讯Hy3OpenCode那边更夸张单日处理量达到8万亿Token而且这8万亿里有将近40是开发者付费使用的不是免费白嫖是真金白银在调用更狠的是什么OpenCode的CEO在8月1日透露V4 Flash上线后使用量单日增长了30新订阅用户也同步增长了30上线没几天就直接把服务器干趴下了各位想想这需求有多猛那为什么这么火五个字便宜还能打V4 Flash采用的是MoE架构总参数2840亿但每次推理只激活130亿参数推理算力只有V3.2的10KV Cache占用只有7成本极低性能还不妥协价格方面输入每百万Token收费0.14美元输出0.28美元Artificial Analysis算了一笔账完成同样的测试任务V4 Flash平均每次只要0.03美元Kimi K3要0.86美元GPT56 Sol要1.86美元Claude Fable 5更是高达3.15美元价差最大达到105倍更关键的是便宜没好货这句话在V4 Flash身上不成立Terminal Bench 2.1智能体测试V4从预览版的61.8分直接飙到82.7分这个分数超过了GLM5.2的81.0分只比Claude Opus 4.8的85分低一点点130亿激活参数的小模型硬生生打穿了7000多亿参数模型的能力天花板高性能加超低价全球开发者直接把生产环境的推理流量往V4 Flash上迁移这才是API被挤爆的真正原因有老铁可能还记得前阵子Kimi K3发布的时候也发生过类似的事上线48小时用户请求量指数级增长直接逼近GPU集群承载上限不得不暂停C端新用户订阅当时市场一片哗然今天DeepSeek V4 Flash遇到的情况本质上是一模一样的剧本这说明什么国产大模型已经不是能不能打的问题了而是太能打了以至于自己都扛不住的阶段当然也有声音说国产模型能力赶上来了但可用性和容量还有改善空间这个说法没毛病但我跟各位说一个更重要的视角大模型商业化有一个不可能三角高性能低成本高可用三者很难同时满足V4 Flash把高性能和低成本这两项做到了极致那高可用这一角被挤压其实是商业化爆发的必然结果这不是能力的质疑这是成长的阵痛可用性问题是能解决的产能问题但需求问题是伪造不了的市场验证今天下午官方已经宣布服务恢复了一次API波动而已别慌真正值得关注的是背后那条主线国产AI从技术领先走向商业落地的关键一步最后说两句对各位投资的启发第一别被短期的API波动吓到这是产能爬坡的正常现象第二关注调用量而不是参数竞赛V4 Flash用130亿激活参数打败了几千亿参数的模型说明推理效率和成本优势才是商业化的核心指标第三大模型调用量的爆发式增长直接拉动AI算力需求这条产业链上的机会值得多看一眼

