昊梵体育网

没有发布会,没有PPT,凌晨偷偷换了一代模型,跑分直接翻了5倍。DeepSeek

没有发布会,没有PPT,凌晨偷偷换了一代模型,跑分直接翻了5倍。DeepSeek这波深夜突袭,把Agent战场的牌桌直接掀了。

8月13日凌晨,DeepSeek API页面悄悄更新了版本号:deepseek-v4-pro-0813。模型名没变,调用方式没变,文档没变,但你今天调用的已经不是昨天那个模型了。核心跑分数据:DeepSWE从12.8飙到62.7翻了近5倍,Terminal Bench从72.1涨到87.9,Cybergym从52.7暴涨到83.3,AutomationBench从12.8到31.8,DSBench-Hard从31.1到67.2。放到全球牌桌上对比,Terminal Bench 87.9距离榜首Kimi-K3的88.3只差0.4分,HLE 60.0距离Fable 5的63.0差3分。关键是没有任何一项掉出第一梯队。价格方面给到100万token上下文加38.4万最大输出,缓存命中价压到0.025元每百万token,输出6元每百万token,并发上限500。

翻译一下:DeepSWE跑分翻5倍是什么概念?这不是答题考试涨分,是干活的活儿翻了5倍。Terminal Bench考的是终端里真实操作的能力,Cybergym考的是安全攻防,这些全是干活的测试不是答题的测试。以前的模型是学霸,这次升级的方向是长工。100万token上下文是什么概念?能塞进去七八本长篇小说或者一个中型项目的全部代码。缓存命中0.025元是什么概念?海外同级旗舰的零头都不到。Terminal Bench差Kimi-K3 0.4分,这个差距比一次测试的随机波动大不了多少。

过去两年大模型卷的是推理,奥数题编程竞赛知识问答,分数再高离替你把活干完还有距离。这次DeepSeek暴涨的每一项都指向同一个方向:让模型在真实环境里长时间多步骤地完成任务。没有单项第一但没有任何短板,这才是Agent模型最难做到的事。用一句话概括:国产AI离海外旗舰只差一步,而且这一步是以月为单位在缩短的。DeepSeek此前已经预告API要整体涨价,这次V4 Pro定价比Flash贵3倍某种程度上就是靴子落地。没有发布会没有PPT,一张跑分图一个不变的模型名,当产品足够硬的时候营销是最不重要的那一环。当DeepSeek深夜偷偷换了代跑分翻5倍的时候,你觉得国产AI和海外旗舰还差多远?

当DeepSeek凌晨不开发布会、跑分直接翻5倍的时候,你觉得海外大模型的优势还能撑几个月?