昊梵体育网

DeepSeek 补强多模态能力,V4-Flash-Vision-Exp 上线~

DeepSeek 补强多模态能力,V4-Flash-Vision-Exp 上线~

DeepSeek 正式上线实验性质多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,并开放 API 服务。

开发者可以通过设置 model='deepseek-v4-flash-vision-exp' 调用该模型。该模型保持 DeepSeek-V4-Flash 在 Agent、推理、世界知识等纯文本能力,同时加入视觉理解能力,让 Agent 可以处理包含图片信息的更多应用场景。

从官方公布的 Benchmark 结果来看,DeepSeek-V4-Flash-Vision-Exp 在纯文本任务上与 DeepSeek-V4-Flash 正式版保持一致;而在需要视觉理解的多模态 Agent 评测中,相比 DeepSeek-V4-Flash 实现明显提升。官方表示,其多模态 Agent 能力已经接近 Opus-4.8。

这次升级的重点,是让 Agent 开始理解更多来自真实环境的视觉信息。

过去,Agent 更多围绕文本、代码和结构化数据工作;加入视觉理解能力后,模型可以进一步处理图片、界面截图、设计文件等内容,为更多图文混合任务提供支持。

在官方展示中,DeepSeek-V4-Flash-Vision-Exp 可以结合 Agent 框架和工具调用能力,完成商业旅游 PPT 生成、开发者网站视觉重构、前端 Mini Demo 创作等任务示例。

对于开发者而言,该模型接入方式与现有 DeepSeek API 保持一致。

模型支持 Chat Completions、Messages 和 Responses 三种调用方式,支持文本与图片混合输入。图片可以通过 base64、外部 URL 或 Files API 三种方式传入。

其中,Files API 提供了更适合多轮任务的图片管理方式:用户上传图片后,可以通过 file_id 在后续请求中重复引用,同一张图片无需再次上传,从而减少请求带宽消耗。

在成本方面,图片会转换为 Token 参与计费,每张图片最多占用 384 Tokens,计费价格与 DeepSeek-V4-Flash 保持一致。

DeepSeek-V4-Flash-Vision-Exp 的上线,让 DeepSeek API 增加了视觉理解入口,也为开发者构建图文混合输入、多模态 Agent 应用提供了新的模型选择。

DeepSeek 多模态模型 视觉理解 AI妙生图大模型 Agent 图像理解