昊梵体育网

给AI装上眼睛,这个插件让DeepSeek终于能看图了

DeepSeek V4系列上线第一周,GitHub讨论区里冒出一个高频问题:怎么让DeepSeek看图? 原因很直接——
DeepSeek V4系列上线第一周,GitHub讨论区里冒出一个高频问题:怎么让DeepSeek看图?
原因很直接——V4 Pro和V4 Flash都是纯文本模型,输入模态只声明了text。贴张报错截图进去,Harness直接返回:MODEL_DOES_NOT_SUPPORT_IMAGES。
社区没等官方。一个名叫ModLens的插件悄悄长到905颗星,成了DSH生态里第一个解决视觉问题的答案。
纯文本模型的"睁眼瞎"困境
DeepSeek V4系列的参数规模和推理能力都够硬核,但缺了一只眼睛。前端报错截图、UI设计稿、流程图——这些日常开发中最常见的图片输入,DeepSeek只能对着文字干瞪眼。
8月21日,DeepSeek官方悄悄上线了V4 Flash Vision Exp,这是V4系列首个直接支持图片输入的视觉模型。但在这之前的一周里,开发者们已经用脚投票,把ModLens推到了DSH视觉插件的头部位置。
ModLens的README第一句话就写得很清楚:"Give a text-only model sight"——给纯文本模型一双眼睛。
技术方案:请个会看图的朋友在旁边念
ModLens的思路不复杂,但很聪明。
它没有试图让DeepSeek本身变成视觉模型,而是在中间加了一层"翻译":粘贴图片后,ModLens调用外部视觉引擎(比如Gemini、Qwen-VL、Claude等),把图片内容解析成结构化JSON——OCR识别的文字、版面布局区域、实体与关系列表——然后把这些证据喂给DeepSeek继续推理。
打个比方,就像请了个会看图的朋友坐在旁边,把图里的内容念给你听。你还是那个纯文本大脑,但凭空多了双眼睛。
核心工具叫modlens_read_image,输出不是模糊的图片描述,而是带引用依据的结构化证据。模型回答时可以引用具体内容,而不是靠想象脑补。
零配置起步,复用本机已有登录态
ModLens另一个让开发者买单的设计是"零配置"。
它支持6个内置视觉provider(Gemini API、OpenAI兼容端点、Anthropic等)加上4个本机CLI登录复用(Claude Code、Codex、OpenCode、Pi)。如果你机器上已经有Claude Code或Gemini的登录态,ModLens会直接征用,不用额外配置任何API Key。
什么都没有?装个免费的Antigravity CLI,浏览器登录一次就能用,识别耗时15-45秒。配个免费Gemini Key的话,每次识别只要5-10秒。
一个坑提前说:安装必须锁版本号
ModLens的安装命令看着简单:
dsh plugin --profile web add @liustack/modlens@3.18.3
但有个坑必须提前说:别用@latest。
原因是pnpm 11会扣住最近24小时内发布的版本,dist-tag只在剩下的里面解析。直接用@latest装到的,会是一天前发布的旧版。作者README里特意强调了这点,照做就行。
装完重启dsh web,硬刷新一次页面。模型选择器里会多出带(modlens vision)后缀的模型变体,选中后直接粘贴图片就能识图。
适用场景:前端、UI、文档全覆盖
ModLens最香的场景是前端开发。页面做完截个图丢给DSH,让它自己检查还原度——OCR保留的不只是文字,还有元素位置关系和语义。
其他高频用法:分析报错截图定位bug、识别流程图中的文字信息、长截图OCR提取内容、UI设计稿转代码。
8月21日DeepSeek官方视觉模型上线后,ModLens和原生视觉能力可以配合使用。对于纯文本模型路由,ModLens仍然是唯一解;对于支持视觉的新模型,原生能力更快。两套方案互不冲突。
插件化生态的典型案例
ModLens的流行不是偶然。DeepSeek Harness的"一切皆插件"设计,让社区补能力的速度极快——开源一周就冒出数千个插件。ModLens抓住了"纯文本模型不能看图"这个最痛的点,用最小的侵入性解决了它。
不用hook,不套壳,不跑本地代理进程,不改任何harness配置。卸载等于删个文件夹,agent立刻回到原样。
这种轻量级解决方案,可能比官方亲自下场更灵活。毕竟,等官方补齐所有能力的时候,社区早就把需求迭代三轮了。