how i ai
DeepSeek 今天上线了实验版多模态模型,DeepSeek-V4-Flash-Vision-Exp。
纯文本能力和 V4-Flash 正式版打平,但视觉理解一加上去,Agent 能力直接跳一档,已经摸到 Opus-4.8 的边上。
几个关键基准分数:
Terminal Bench 2.1:83.9NL2Repo:57.7DeepSWE:59.3DSBench-Hard:63.6AutomationBench(Public):25.7ApexBench(PassLast Exam:27.3Chartography:64.3ZeroBench(Pass第一,纯文本部分(Agent、推理、世界知识)和 V4-Flash 正式版持平。
第二,一旦 benchmark 需要视觉理解,它相比 V4-Flash 就是大幅跃升 多模态 Agent 能力已经接近 Opus-4.8。
公开基准里的 Code Agent 文本任务,DeepSeek 系列统一用自家的 DeepSeek Harness 极简模式跑,max 档、topp=0.95、temperature=1.0。所以这些分数要在同一框架里横向看。
对于要做,能看截图/图表/界面再动手的 agent 场景(比如自动化运维、UI 操作、图表分析),这是个个非常大的提升。
