昊梵体育网

#how i ai# DeepSeek 今天上线了实验版多模态模型,DeepSeek-V4-Flash-Vision-Exp。 纯文本能力和 V4-Flash 正式版打平,但视觉理解一加上去,Agent 能力直接跳一档,已经摸到 Opus-4.8 的边上。 几个关键基准分数: Terminal Bench 2.1:83.9 NL2Repo:57.7 DeepSWE:59.3 DSBench-Hard:63.6 Au ​

how i ai

DeepSeek 今天上线了实验版多模态模型,DeepSeek-V4-Flash-Vision-Exp。

纯文本能力和 V4-Flash 正式版打平,但视觉理解一加上去,Agent 能力直接跳一档,已经摸到 Opus-4.8 的边上。

几个关键基准分数:

Terminal Bench 2.1:83.9NL2Repo:57.7DeepSWE:59.3DSBench-Hard:63.6AutomationBench(Public):25.7ApexBench(PassLast Exam:27.3Chartography:64.3ZeroBench(Pass第一,纯文本部分(Agent、推理、世界知识)和 V4-Flash 正式版持平。

第二,一旦 benchmark 需要视觉理解,它相比 V4-Flash 就是大幅跃升 多模态 Agent 能力已经接近 Opus-4.8。

公开基准里的 Code Agent 文本任务,DeepSeek 系列统一用自家的 DeepSeek Harness 极简模式跑,max 档、topp=0.95、temperature=1.0。所以这些分数要在同一框架里横向看。

对于要做,能看截图/图表/界面再动手的 agent 场景(比如自动化运维、UI 操作、图表分析),这是个个非常大的提升。