今日重磅!DeepSeek 全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 平台!这是一个实验性质的模型,主打视觉 Agent 能力的大幅提升,同时保持文本能力不缩水。
核心亮点
- 视觉 Agent 能力大幅跃升:在视觉 Agent Benchmark 上,相比 DeepSeek-V4-Flash 实现了质的飞跃
- 接近 Opus-4.8 水平:多模态 Agent 综合表现已接近 Claude Opus-4.8 旗舰水平,且部分指标已超越
- 文本能力不缩水:纯文本能力(Agent、推理、世界知识等)与 DeepSeek-V4-Flash 正式版保持对齐
- 加量不加价:API 价格与文本版 V4-Flash 完全一致
- 支持 Thinking with images:思维链中允许模型对图像进行二次处理(翻转、裁剪、放大等)
官方 Benchmark 数据
以下数据来自 DeepSeek 官方公布的测试结果:
| 评测集 | V4-Flash | V4-Flash-Vision-Exp | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 83.9 | 85.0 |
| NL2Repo | 57.7 | 57.7 | - |
| DeepSWE | 54.4 | 59.3 | - |
| DSBench-Hard | 63.6 | 63.6 | - |
| ApexBench (Pass@1) | - | 36.5 | 39.4 |
| Agents’ Last Exam | - | 27.3 | 25.7 |
| Chartography | - | 64.3 | 65.0 |
| ZeroBench (Pass@5) | - | 35.0 | 34.0 |
| AutomationBench | - | 25.7 | - |
注:V4-Flash 在 ApexBench 与 Agents Last Exam 上会忽略多模态元素,因此这两个指标上 V4-Flash-Vision-Exp 提升显著。在 Agents Last Exam 和 ZeroBench 上,V4-Flash-Vision-Exp 甚至分别高出 Opus-4.8 1.6 分和 1 分,已实现部分超越。
价格详情(与 V4-Flash 完全一致)
数据来源:DeepSeek 官方定价页
| 计费项(每百万 tokens) | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | 0.05 元 | 0.10 元 |
| 输入(缓存未命中) | 1.5 元 | 3.0 元 |
| 输出 | 4.5 元 | 9.0 元 |
高峰时段:北京时间周一至周五 9:00-12:00、14:00-18:00;其余时间为空闲时段,价格为高峰的一半。
图片按尺寸转换为 token 计费,缩放到约 800×800 后折算,单张图片最多折算 384 tokens,不额外收取视觉专项费用。
示例:一张 1920×1080 图片约消耗 369 tokens,按缓存未命中高峰时段(3 元/百万)计算约 0.011 元,价格仍非常亲民。
硬核测评结果(来源:知乎独立测评)
以下测评基于 DeepSeek Harness(DSH)极简模式,测试模型的多模态推理能力,涵盖简单 / 中等 / 困难三个难度等级。
几何常识推理(中等难度)
Prompt:根据图片求角度大小(格点角问题)。
测试结果:
正确(答案:30度)
模型在 12 分钟思考后通过正弦定理推导出正确答案。思维链中模型主动对图像进行了 alpha 通道区分、裁剪放大等二次处理,逐行扫描深色像素并用最小二乘法拟合直线,最终完成计算。
挑战一:侦探桌上线索拼图(困难)
Prompt:根据桌面照片回答人物身份、时间线、事件推断。
测试结果:
部分正确,存在过度推理
优点:能够进行多图片元素关联、时间线建立、发现矛盾信息。
问题:将超市小票的物品证据过度升级为"人物位置证据"(家人可能代买);根据手机时间推断人在本地属于过度推理。
挑战二:超市货架统计(简单)
Prompt:识别缺货商品、最贵商品、计算总价。
测试结果:
基本准确
OCR、商品统计和数学计算表现优秀,没有明显幻觉,对结构化信息处理能力强。
挑战三:车站信息导航(困难)
Prompt:选车次、规划路线(含无障碍需求)。
测试结果:
部分正确,存在脑补
优点:正确读取车次、时间、检牌口信息。
问题:对地图进行了过度脑补,如主动建议"优先走无障碍电梯/直梯",但图片中并未标注电梯位置;路径描述属于推测而非图片直接信息。
挑战四:停车场空间理解(困难)
Prompt:判断车位状态、识别违规、规划驶出路线、推荐空余车位。
测试结果:
表现稳定且准确
四个问题均给出正确结论,规则明确的空间理解任务表现较强。注意:此测试 DSH 跑了 48 步,耗时十几分钟。
测评总结
| 能力维度 | 表现 |
|---|---|
| 图像识别与描述 | 强,能快速准确识别 |
| OCR 文字识别 | 强,对商品标签、表格识别准确 |
| 密集目标统计 | 强,货架等密集场景统计可靠 |
| 数学计算 | 强,可进行复杂几何推理 |
| 空间导航推理 | 中等,存在现实世界常识补全过度问题 |
| 不确定性判断 | 中等,抗幻觉能力有提升空间 |
| 多元素关联推理 | 中等,能建立时间线和逻辑链 |
核心问题:识别能力和结构化推理很强,但涉及现实世界常识补全时容易"想太多"——这是大多数视觉大模型的通病,非 DeepSeek 独有。
测评花销:整个测评流程仅花费 2.5 元,性价比极高。
与竞品对比
| 维度 | DeepSeek V4-Flash-Vision-Exp | Claude Opus-4.8 |
|---|---|---|
| 多模态 Agent 能力 | 接近 Opus-4.8(部分指标已超越) | 业界标杆 |
| 纯文本能力 | 与 V4-Flash 持平 | 顶级 |
| API 价格 | 极低(见上方定价) | 较高 |
| 实验性质 |
适用场景
- 视觉 Agent:需要理解图片/图表并进行决策的自动化任务
- 截图解析 & OCR:报错截图、界面识别、文档扫描
- 图表 & 表格理解:数据可视化分析、技术文档配图理解
- GUI 智能体:屏幕操作、UI 自动化测试
- 具身智能:实时视觉反馈(如机械臂抓取、机器人导航等)
- 商业视觉内容:PPT 生成、海报设计等需要视觉创意的工作
调用方式
model = 'deepseek-v4-flash-vision-exp'
支持三种调用格式(Chat Completions / Messages / Responses),图片可通过 base64、外部 URL 或 Files API 传入。Files API 目前免费。
详细调用方法:官方文档
注意事项
- 该模型为 实验性质(Exp),官方不建议直接用于生产环境,后续会持续迭代优化
- 涉及现实世界常识推理时,建议人工复核输出,避免过度脑补
- 复杂多模态 Agent 任务推荐开启 max 推理档位
- 适配 DeepSeek Harness 0.1.1 智能体框架,支持工具调用与 Function Call
总体来说,这次 DeepSeek 在多模态视觉理解上的突破很有诚意——在保持文本能力不缩水的前提下,视觉 Agent 能力已接近 Opus-4.8,且部分指标(Agents Last Exam、ZeroBench)已实现超越,而价格却与文本版一致。对于需要视觉理解能力的 Agent 开发者来说,这个实验模型值得关注!







