AI 快讯 | DeepSeek V4 Pro 正式版上线:软件工程全球第二,价格仅为竞品零头
一句话总览:DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)本周上线,软件工程能力跻身全球第二(仅次于 Claude Opus 5),支持百万 Token 上下文,价格是同级前沿模型里最低的——复杂任务交给它做,成本只要竞品的零头。
这次更新,业务上意味着什么
正式版相比预览版补齐了 Agent 和图像能力,思考强度分三档可调,支持百万 Token 上下文、最高 384K 输出和多种 Agent 接口。
几个关键数字:
- 软件工程能力全球第二:SWE-bench Verified 96.4% 的问题解决率,仅次于 Claude Opus 5
- Agent 能力大幅提升:已成为 DeepSeek 内部员工的 Agentic Coding 主力模型,使用体验优于 Claude Sonnet 4.5,交付质量接近 Opus 4.6 非思考模式
- 数学、STEM、竞赛级代码:超越目前已公开评测的所有开源模型(含 Kimi K2.6 Thinking、GLM-5.1 Thinking)
- 价格门槛直接打穿:8 月 17 日起峰谷定价,空闲时段输出 13.5 元/百万 Token,约为同级别闭源模型的 1/25;Pro 输出价 3.48 美元/百万 Token,是大型前沿模型中最低的
实测中的表现:提示词和效果
在真实业务任务的六场景实测中(任务规划、复杂编程、长期记忆、浏览器自动化、知识库构建、超长上下文),全部一次跑通、零死循环。挑几个典型的:
任务 1:让 AI 全程接管一场内部分享
下周要做一场关于「AI Agent 在企业中的落地实践」的内部分享,让 Agent 全程接管:1) 调研客服 / 营销 / 研发三大场景下的 AI Agent 落地案例;2) 生成一份 8 页的 PPT 文件;3) 把分享要点沉淀到知识库。
实测:229.5 秒跑完全流程,35 次工具调用没有一次冗余,PPT、知识库文档全部交付。
任务 2:生成一个「全球运营中心」实时大屏
做一个「ATLAS AI · 全球运营中心」实时大屏(单 HTML 文件),包含实时核心指标、双 Y 轴 QPS/延迟折线图、全球节点地图、5 维能力雷达、GPU 集群柱状图、实时事件流、Top 模型排行榜。
实测:381.7 秒完成,写完还主动打开浏览器截图回看效果。
任务 3:跨会话记住你的品牌,写运营计划
先分三轮把咖啡品牌的零散信息(定位、视觉、供应链、选址、店长候选人)灌给 AI,然后开一个全新会话,让它「基于对我品牌的所有了解」写 30 天运营计划。新会话里它主动检索记忆,14 条信息一字不差全部用上,还给出了结构化建议(店长薪资怎么谈、用股权预期补差距)。
任务 4:从零搭一个知识库
让 AI 联网调研 MCP 主题、整理 4 个主流 Server + 2 个客户端,按索引页 + 分类目录 + 交叉链接组织。它没有写成一坨大文档,而是切成了互相链接的概念页 / Server 页 / 客户端页,每篇结尾带「相关阅读」。
任务 5:56 万词的《战争与和平》全本问答
让 AI 拉取 3.36MB 的英文全本,回答「Pierre 第一次出场的场景」这类细节题。它没有硬塞上下文,而是先落盘、再搜索定位、按行号分段读取——Andrei 的天空场景精准定位到第 15869 行,原文引用一字不差。
榜单和口碑
- Arena.ai:V4 Pro(思考模式)代码竞技场开源模型第 3、综合第 14,定性为「相较 V3.2 的重大飞跃」
- Vals AI:Vibe Code 基准开源权重第一,「压倒性优势」,击败 Gemini 3.1 Pro,较上代约 10 倍性能跃升
- DolphinDB 工程实测:8 维度评分(结果 30 分 + 过程 70 分),V4 Pro 优秀率 100%、稳定性全场最高、Token 消耗全场最低
- 社区评价:「GPT-5.5,对不起,DeepSeek V4 才是新的震撼时刻」
对业务落地意味着什么
- 一个复杂任务可以全交给 AI:调研 + PPT + 知识库一条龙,4 分钟跑完,全程步骤可见
- 成本结构变了:Agent 任务往往要几十次模型调用,V4 Pro 在大型前沿模型里价格最低,还有峰谷价,夜间批量任务更划算
- Pro + Flash 组合是官方推荐姿势:Pro 管复杂规划、关键决策,Flash 管搜索、整理、简单修改——官方接入配置默认就是这个组合



