21CTO导读:DeepSeek V4 Pro突袭上线Agent能力大跃进、性能逼近Fable 5。
中国AI 新创公司 DeepSeek 深夜无预警出招。
就在 8 月12 日深夜,DeepSeek 官网API 文件悄悄将模型切换至“DeepSeek-V4-Pro-0813”,显示V4 Pro 正式版很可能已通过API 上线。
更受人瞩目的是,社区流出的评测显示,新版在多项AI 智能体(Agent)测试中逼近Anthropic 的Claude Fable 5,部分项目甚至已经超越;加上几乎与Grok 4.6 同步登场,前沿AI 模型的效能与价格战再度升温。
从DeepSeek 官网变化来看,这次V4 Pro 正式版上线相当低调。目前官方API「模型与价格」页面已将deepseek-v4-pro 对应版本标示为DeepSeek-V4-Pro-0813,支持 100 万Token 上下文、最高38.4 万Token 输出,以及JSON Output、Tool Calls、Responses API、Anthropic API 与FIM 等功能。
Agent能力跃升多项测试逼近Fable 5
真正引发技术圈关注的,是流传中的新版评测对比表。
多家科技媒体引述DeepSeek 官方群组发布的资料指出,DeepSeek-V4-Pro-0813 在多项测试中的表现已接近Anthropic Claude Code Fable 5,相较先前V4 Pro 预览版有明显提升,其中又以智能体相关测试最受瞩目。
不同于传统大型语言模型主要比较知识问答、数学与逻辑推理,Agent 测试更着重AI 实际“干活”的能力,包括工具呼叫、多步骤任务、代码编写与修改,以及持续执行复杂工作,而这正是DeepSeek V4 系列一路押注的方向。
DeepSeek 今年4 月推出V4 预览版时便强调,V4 Pro 在Agentic Coding 评测中达到当时开源模型领先水准,并针对Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流Agent 产品进行适配与最佳化,同时支援100 万Token 上下文与思考模式。
到了7 月底,V4 Flash 正式版进一步强化智能体能力,DeepSeek 公布Terminal Bench 2.1、NL2Repo、DeepSWE 与Toolathlon verified 等多项测试成绩,并称正式版Agent 能力已大幅超越V4-Pro-Preview。如今V4 Pro 正式版进一步逼近Fable 5,意味DeepSeek 在Agent 领域累积的后训练与工程最佳化,正逐步转化为更强的实际任务执行能力。
不过,目前新版评测表主要来自官方群组及社群流传,DeepSeek 尚未在官方更新日志公布V4-Pro-0813 的完整基准测试成绩,因此相关分数仍属非正式披露,不能完全等同官方正式公布的基准成绩。
能力升级价格未变,但涨价已在路上
除了性能,价格也是此次V4 Pro 更新的另一大焦点。目前DeepSeek API 价格页面显示,新版V4 Pro 并未随能力升级同步调涨价格,延续先前大幅降价后的低价策略。
撞车Grok 前沿模型价格战升温
更巧的是,DeepSeek V4 Pro-0813 上线时间,几乎与Grok 4.6 正面撞车。
就在DeepSeek 新版模型悄悄现身前几个小时,Grok 4.6 也宣布刚刚发布。根据相关资料,Grok 4.6 在Artificial Analysis 推出的GDPVal-AA v2 智能体评估中拿下1753 Elo,排名第一;Artificial Analysis Intelligence Index 则取得61 分。
价格同样成为Grok 的主要武器。 Grok 4.6 API 定价为每百万输入Token 2 美元、输出6 美元,主打相较其他前沿模型更低的成本。如今DeepSeek V4 Pro-0813 又在多项测试中逼近Fable 5,同时维持低价,两款模型几乎同时向市场释出相同讯号:前沿模型之间的能力差距持续缩小,而价格正成为下一阶段更重要的竞争武器。
过去AI 模型竞争主要围绕“谁是最强模型”展开,但当DeepSeek、Grok 等模型不断向第一梯队逼近,市场的比较方式也开始改变。如果效能差距已缩小到一定程度,开发者是否还愿意为更昂贵的模型支付数倍成本,正成为新的竞争焦点。
从“便宜”走向“能干活”
DeepSeek V4 Pro 此次升级的意义,并非只是一次普通版本迭代。
今年4 月推出V4 时,DeepSeek 已将重心由传统聊天模型转向Agent,把百万Token 上下文、AI编码工程与工具呼叫能力列为核心卖点;随后V4 Flash 正式版又进一步强化Code Agent、Search Agent 等能力。
这也与Grok 4.6 的升级方向不谋而合。 Grok 4.6 同样将长时间运行的智能体、复杂程式设计与知识工作列为重点,并透过开发者工具提供服务。
DeepSeek V4 Pro-0813 与Grok 4.6 几乎同日登场,某种程度也折射出AI 产业竞争进入新阶段:前沿模型战场正从单纯比拼参数、聊天与基准测试能力,转向智能体执行能力、Token 成本与开发者生态的全面较量。
作者:场长
本篇文章为 @ 场长 创作并授权 21CTO 发布,未经许可,请勿转载。
内容授权事宜请您联系 webmaster@21cto.com或关注 21CTO 微信公众号。
该文观点仅代表作者本人,21CTO 平台仅提供信息存储空间服务。
请扫描二维码,使用微信支付哦。