AI 快讯 | DeepSeek-V4-Flash-Vision-Exp 发布:多模态视觉理解能力大幅跃升

:fire: 今日重磅!DeepSeek 全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 平台!这是一个实验性质的模型,主打视觉 Agent 能力的大幅提升,同时保持文本能力不缩水。


:key: 核心亮点

  • 视觉 Agent 能力大幅跃升:在视觉 Agent Benchmark 上,相比 DeepSeek-V4-Flash 实现了质的飞跃
  • 接近 Opus-4.8 水平:多模态 Agent 综合表现已接近 Claude Opus-4.8 旗舰水平,且部分指标已超越
  • 文本能力不缩水:纯文本能力(Agent、推理、世界知识等)与 DeepSeek-V4-Flash 正式版保持对齐
  • 加量不加价:API 价格与文本版 V4-Flash 完全一致
  • 支持 Thinking with images:思维链中允许模型对图像进行二次处理(翻转、裁剪、放大等)

:bar_chart: 官方 Benchmark 数据

以下数据来自 DeepSeek 官方公布的测试结果:

评测集 V4-Flash V4-Flash-Vision-Exp Opus-4.8
Terminal Bench 2.1 82.7 83.9 85.0
NL2Repo 57.7 57.7 -
DeepSWE 54.4 59.3 -
DSBench-Hard 63.6 63.6 -
ApexBench (Pass@1) - 36.5 39.4
Agents’ Last Exam - 27.3 25.7
Chartography - 64.3 65.0
ZeroBench (Pass@5) - 35.0 34.0
AutomationBench - 25.7 -

:pushpin: 注:V4-Flash 在 ApexBench 与 Agents Last Exam 上会忽略多模态元素,因此这两个指标上 V4-Flash-Vision-Exp 提升显著。在 Agents Last Exam 和 ZeroBench 上,V4-Flash-Vision-Exp 甚至分别高出 Opus-4.8 1.6 分1 分,已实现部分超越。


:money_bag: 价格详情(与 V4-Flash 完全一致)

数据来源:DeepSeek 官方定价页

计费项(每百万 tokens) 空闲时段 高峰时段
输入(缓存命中) 0.05 元 0.10 元
输入(缓存未命中) 1.5 元 3.0 元
输出 4.5 元 9.0 元

:alarm_clock: 高峰时段:北京时间周一至周五 9:00-12:00、14:00-18:00;其余时间为空闲时段,价格为高峰的一半。

:light_bulb: 图片按尺寸转换为 token 计费,缩放到约 800×800 后折算,单张图片最多折算 384 tokens,不额外收取视觉专项费用。

:bar_chart: 示例:一张 1920×1080 图片约消耗 369 tokens,按缓存未命中高峰时段(3 元/百万)计算约 0.011 元,价格仍非常亲民。


:test_tube: 硬核测评结果(来源:知乎独立测评)

以下测评基于 DeepSeek Harness(DSH)极简模式,测试模型的多模态推理能力,涵盖简单 / 中等 / 困难三个难度等级。

几何常识推理(中等难度)

Prompt:根据图片求角度大小(格点角问题)。

测试结果:white_check_mark: 正确(答案:30度)

模型在 12 分钟思考后通过正弦定理推导出正确答案。思维链中模型主动对图像进行了 alpha 通道区分、裁剪放大等二次处理,逐行扫描深色像素并用最小二乘法拟合直线,最终完成计算。

挑战一:侦探桌上线索拼图(困难)

Prompt:根据桌面照片回答人物身份、时间线、事件推断。

测试结果:warning: 部分正确,存在过度推理

优点:能够进行多图片元素关联、时间线建立、发现矛盾信息。

问题:将超市小票的物品证据过度升级为"人物位置证据"(家人可能代买);根据手机时间推断人在本地属于过度推理。

挑战二:超市货架统计(简单)

Prompt:识别缺货商品、最贵商品、计算总价。

测试结果:white_check_mark: 基本准确

OCR、商品统计和数学计算表现优秀,没有明显幻觉,对结构化信息处理能力强。

挑战三:车站信息导航(困难)

Prompt:选车次、规划路线(含无障碍需求)。

测试结果:warning: 部分正确,存在脑补

优点:正确读取车次、时间、检牌口信息。

问题:对地图进行了过度脑补,如主动建议"优先走无障碍电梯/直梯",但图片中并未标注电梯位置;路径描述属于推测而非图片直接信息。

挑战四:停车场空间理解(困难)

Prompt:判断车位状态、识别违规、规划驶出路线、推荐空余车位。

测试结果:white_check_mark: 表现稳定且准确

四个问题均给出正确结论,规则明确的空间理解任务表现较强。注意:此测试 DSH 跑了 48 步,耗时十几分钟。


:chart_increasing: 测评总结

能力维度 表现
图像识别与描述 强,能快速准确识别
OCR 文字识别 强,对商品标签、表格识别准确
密集目标统计 强,货架等密集场景统计可靠
数学计算 强,可进行复杂几何推理
空间导航推理 中等,存在现实世界常识补全过度问题
不确定性判断 中等,抗幻觉能力有提升空间
多元素关联推理 中等,能建立时间线和逻辑链

核心问题:识别能力和结构化推理很强,但涉及现实世界常识补全时容易"想太多"——这是大多数视觉大模型的通病,非 DeepSeek 独有。

测评花销:整个测评流程仅花费 2.5 元,性价比极高。


:vs_button: 与竞品对比

维度 DeepSeek V4-Flash-Vision-Exp Claude Opus-4.8
多模态 Agent 能力 接近 Opus-4.8(部分指标已超越) 业界标杆
纯文本能力 与 V4-Flash 持平 顶级
API 价格 极低(见上方定价) 较高
实验性质 :white_check_mark: :cross_mark:

:light_bulb: 适用场景

  1. 视觉 Agent:需要理解图片/图表并进行决策的自动化任务
  2. 截图解析 & OCR:报错截图、界面识别、文档扫描
  3. 图表 & 表格理解:数据可视化分析、技术文档配图理解
  4. GUI 智能体:屏幕操作、UI 自动化测试
  5. 具身智能:实时视觉反馈(如机械臂抓取、机器人导航等)
  6. 商业视觉内容:PPT 生成、海报设计等需要视觉创意的工作

:package: 调用方式

model = 'deepseek-v4-flash-vision-exp'

支持三种调用格式(Chat Completions / Messages / Responses),图片可通过 base64、外部 URL 或 Files API 传入。Files API 目前免费。

详细调用方法:官方文档


:warning: 注意事项

  • 该模型为 实验性质(Exp),官方不建议直接用于生产环境,后续会持续迭代优化
  • 涉及现实世界常识推理时,建议人工复核输出,避免过度脑补
  • 复杂多模态 Agent 任务推荐开启 max 推理档位
  • 适配 DeepSeek Harness 0.1.1 智能体框架,支持工具调用与 Function Call

总体来说,这次 DeepSeek 在多模态视觉理解上的突破很有诚意——在保持文本能力不缩水的前提下,视觉 Agent 能力已接近 Opus-4.8,且部分指标(Agents Last Exam、ZeroBench)已实现超越,而价格却与文本版一致。对于需要视觉理解能力的 Agent 开发者来说,这个实验模型值得关注!