DeepSeek斩杀线【DeepSeek V4-Flash 0731=新斩杀线:被干掉的不是天花板,是“贵且弱”的中间层】
7.31 DeepSeek-V4-Flash正式版API公测:284B总参/13B激活MoE、1M上下文,AA智能指数50(追平Gemini 3.6 Flash,逼平GPT-5.6 Luna的51),Terminal Bench 2.1冲到82.7(预览版61.8),DeepSWE从7.3飙到54.4,Agent能力是后训练喂出来的,不是堆参数。
价格才是推土机:输入¥1/输出¥2每百万token,缓存命中¥0.02,单任务成本约为Claude Opus 4.8的1/90、Gemini 3.1 Pro的1/43、GLM-5.2的1/16;海外初创迁移后月推理成本降60%–85%。
所谓“斩杀70%”,斩的是性能≤V4-Flash、单价≥V4-Flash的右下象限模型:
• 国内中端闭源API(旧版GLM-4 Plus、Qwen-Plus老档、豆包2.1 Pro档日常调用、部分小厂“套壳微调API”)——无自研差异化又被高价反衬,最先退场;
• 海外legacy专有API中“中等档”产品(Claude Fable 5普通档、GPT-5.6 Sol非Max档、Mistral Medium 3.5档)——同能力更贵,开发者用脚投票;
• 纯套壳中间件/“大模型SaaS”无场景壁垒者——底层一切换,毛利归零。
砍不动的三类:
① 真天花板(Opus 5/4.8 Max、GPT-5.6 Sol Max、Kimi K3、Gemini 3.1 Pro)——长程Agent/世界知识/多模态仍领先半代到一代;
② 合规与私有化层(政企大客户买OpenAI/谷歌/本土大厂供链,不为省token);
③ 垂直专家模型(医疗/法律/工业仿真,靠数据与工作流壁垒吃饭)。
幻觉这块得说老实话:V4-Flash AA-Omniscience幻觉率从前代96%降到84%,准确率没变,是“乱答少了”不是“知道更多”;世界知识仍落后Gemini 3.1 Pro约3–6个月,纯百科/事实检索别无脑上。
结论:DeepSeek不是干掉大模型行业,是把“性价比断层”焊死成行业标准——以后新模型发布必须先回答“同能力你比V4-Flash贵多少”,答不上来就进右下角。V4-Pro正式版还没出,斩杀线还会再抬一次。
(评测整理自Artificial Analysis/OpenRouter/官方日志,非投资建议)