2026年8月21日,DeepSeek随工具链DeepSeek Harness 0.1.1-rc.1版本正式推出DeepSeek-V4-Flash-Vision-Exp——一款视觉多模态体验模型。这是DeepSeek首次将图像理解能力深度整合进命令行智能体工具链,让Agent第一次可以在终端环境里直接"看到"图像内容。官方将其表现与Claude Opus 4.8对标,但成本仅为后者的约1/12。
一、从文本到视觉:补全多模态的最后一块拼图
在此之前,DeepSeek虽然已在网页端提供识图模式,但命令行工具链始终缺少原生的视觉输入通道。开发者想让Agent处理截图、设计稿或图表时,只能手动将画面内容转述为文字描述,既繁琐又容易丢失关键信息。
DeepSeek-V4-Flash-Vision-Exp的登场标志着这一局面的终结。它原生支持图片请求与图文混合指令输入,用户可以将工作截图和具体需求同时发送给智能体,由模型同时解析文字指令与画面信息,再输出执行方案。配合前一日发布的v0.1.0-rc.8版本,DeepSeek Harness的/goal、/plan等关键指令已正式实现图文混合输入,多模态处理的最后一块拼图就此补全。
该模型构建在DeepSeek-V4-Flash及V4-Pro模型基础之上,V4-Flash系列主打轻量高速,使得视觉能力在体验版阶段就能保持较快的响应节奏,适合高频调用的自动化场景。更重要的是,它并非独立API,而是与开源命令行智能体框架DeepSeek Harness深度绑定——开发者通过指定npm命令升级工具链即可抢先体验,无需额外申请或切换平台。
二、性能表现:逼近Opus 4.8,成本却只有1/12
DeepSeek官方在发布时将DeepSeek-V4-Flash-Vision-Exp直接对标Anthropic Opus 4.8。从官方公布的基准测试数据来看:
| 对比维度 | DeepSeek-V4-Flash-Vision-Exp | Opus-4.8 |
|---|---|---|
| Terminal Bench 2.1 | 83.9 | 85.0 |
| ApexBench(Pass@1) | 36.5 | 39.4 |
| Agents' Last Exam | 27.3 | 25.7 |
| DeepSWE | 59.3 | 58.0 |
| ZeroBench(Pass@5) | 35.0 | 34.0 |
| 输入价格(高峰/百万tokens) | 3.0元 | 约35元 |
| 输出价格(高峰/百万tokens) | 9.0元 | 约175元 |
在Agents' Last Exam和ZeroBench两项多模态基准上,DeepSeek-V4-Flash-Vision-Exp反超Opus-4.8;在ApexBench和Chartography上落后不超过4分,整体多模态Agent能力已接近Opus-4.8水平。与自家V4-Flash文本版相比,视觉能力的加入未拖累任何文本基准成绩。
而在定价方面,DeepSeek输入价格仅为Opus-4.8的约1/12,输出价格约为1/19,配合2500的高并发限制,成本优势极为显著。这意味着开发者可以用接近"白菜价"的成本,获得接近旗舰级的视觉理解能力。
三、应用场景:截图报错、设计稿转代码、图表解读
DeepSeek-V4-Flash-Vision-Exp的视觉能力让命令行Agent从"只能听指令"升级为"能看图干活",具体场景包括:
截图报错自动修复:开发者把报错截图连同修复目标发给Agent,模型识别截图中的堆栈信息与代码上下文,直接定位问题并给出修改方案
设计稿转页面结构:将UI设计稿图片与需求描述混合输入,Agent读取视觉布局后生成对应的页面骨架或组件代码
数据图表解读分析:面对报表、曲线图等图片素材,模型提取关键数值与趋势,结合文字指令输出分析结论
运维监控图巡查:把监控面板截图交给终端Agent,由它判断指标异常并触发相应处理流程
在AI工具导航的视角下,DeepSeek-V4-Flash-Vision-Exp代表的是一种"底层能力型"AI组件——它不直接面向终端用户解决某个具体问题(如写文章、做PPT),而是为开发者提供构建多模态Agent的基础能力。这与AI写作工具或AI PPT等应用层产品形成鲜明对比:后者面向内容创作输出成品,前者面向自动化流程提供感知能力。在AI办公软件推荐的逻辑中,这种视觉能力更适合集成进企业的自动化运维、代码审核或数据处理管线中,作为底层智能组件而非独立办公应用。
四、如何使用:一行命令启动Web UI
DeepSeek-V4-Flash-Vision-Exp随DeepSeek Harness 0.1.1-rc.1版本发布,开发者通过以下步骤即可体验:
一键启动:执行
npx @deepseek-ai/dsh web自动下载并启动Web UI(版本0.1.1-rc.2),默认地址 http://127.0.0.1:3080配置模型:Settings → Models 中输入DeepSeek API Key(从 platform.deepseek.com 获取)
视觉交互:在对话中发送图片,模型通过Files API上传后理解内容,支持"分析截图并给建议"等多模态指令
高级模式:
/plan进入规划模式;支持Agent Teams多智能体协作与MCP外部工具接入
该模型并非独立API,需通过升级工具链来使用,与网页端识图功能的主要区别在于:网页端面向普通对话场景,而此体验版将视觉能力整合进命令行工具链,供Agent在自动化流程中直接调用。
五、开源与价格
DeepSeek Harness本身为开源工具链,视觉模型体验版随版本更新免费开放,开发者无需为启用视觉输入支付额外费用。模型推理仍依托DeepSeek平台侧能力,具体配额与计费以官方政策为准,工具链层面不设付费门槛。当前版本主要面向开发者与Agent构建者,普通用户可先在DeepSeek网页端体验识图能力。
