17611538698
webmaster@21cto.com

DeepSeek V4 Pro 正式版上线:Agent能力大跃进、性能逼近Fable 5

动态 0 13 1小时前
图片

21CTO导读:DeepSeek V4 Pro突袭上线Agent能力大跃进、性能逼近Fable 5。 

中国AI 新创公司 DeepSeek 深夜无预警出招。 


就在 8 月12 日深夜,DeepSeek 官网API 文件悄悄将模型切换至“DeepSeek-V4-Pro-0813”,显示V4 Pro 正式版很可能已通过API 上线。


更受人瞩目的是,社区流出的评测显示,新版在多项AI 智能体(Agent)测试中逼近Anthropic 的Claude Fable 5,部分项目甚至已经超越;加上几乎与Grok 4.6 同步登场,前沿AI 模型的效能与价格战再度升温。

从DeepSeek 官网变化来看,这次V4 Pro 正式版上线相当低调。目前官方API「模型与价格」页面已将deepseek-v4-pro 对应版本标示为DeepSeek-V4-Pro-0813,支持 100 万Token 上下文、最高38.4 万Token 输出,以及JSON Output、Tool Calls、Responses API、Anthropic API 与FIM 等功能。

官方“首次呼叫API”页面也已将deepseek-v4-pro 列为可呼叫模型,并提供思考模式的呼叫范例,显示新版模型已进入实际服务阶段。
不过,DeepSeek 至今尚未同步发布V4-Pro-0813 的正式更新日志。
官方更新页面最新公告仍停留在7 月31 日的V4 Flash 正式版,当时明确表示仅升级V4 Flash API,V4 Pro API 及App、Web 端模型并未改变,同时预告说“DeepSeek-V4-Pro 正式版将会尽快发布”。
因此严格来说,目前较精确的说法是V4 Pro 正式版已透过API 上线,而非DeepSeek 已正式发布完整的V4 Pro 产品公告。

Agent能力跃升多项测试逼近Fable 5

真正引发技术圈关注的,是流传中的新版评测对比表。


多家科技媒体引述DeepSeek 官方群组发布的资料指出,DeepSeek-V4-Pro-0813 在多项测试中的表现已接近Anthropic Claude Code Fable 5,相较先前V4 Pro 预览版有明显提升,其中又以智能体相关测试最受瞩目。


图片

不同于传统大型语言模型主要比较知识问答、数学与逻辑推理,Agent 测试更着重AI 实际“干活”的能力,包括工具呼叫、多步骤任务、代码编写与修改,以及持续执行复杂工作,而这正是DeepSeek V4 系列一路押注的方向。

DeepSeek 今年4 月推出V4 预览版时便强调,V4 Pro 在Agentic Coding 评测中达到当时开源模型领先水准,并针对Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流Agent 产品进行适配与最佳化,同时支援100 万Token 上下文与思考模式。

到了7 月底,V4 Flash 正式版进一步强化智能体能力,DeepSeek 公布Terminal Bench 2.1、NL2Repo、DeepSWE 与Toolathlon verified 等多项测试成绩,并称正式版Agent 能力已大幅超越V4-Pro-Preview。如今V4 Pro 正式版进一步逼近Fable 5,意味DeepSeek 在Agent 领域累积的后训练与工程最佳化,正逐步转化为更强的实际任务执行能力。

不过,目前新版评测表主要来自官方群组及社群流传,DeepSeek 尚未在官方更新日志公布V4-Pro-0813 的完整基准测试成绩,因此相关分数仍属非正式披露,不能完全等同官方正式公布的基准成绩。

能力升级价格未变,但涨价已在路上

除了性能,价格也是此次V4 Pro 更新的另一大焦点。目前DeepSeek API 价格页面显示,新版V4 Pro 并未随能力升级同步调涨价格,延续先前大幅降价后的低价策略。

但低价可能不会维持太久。 DeepSeek 已在官网价格页面明确预告,计划在不久的将来调高DeepSeek API 服务整体价格,而且“预计涨幅会比较大”,实际价格则有待官方后续通知。
图片
换言之,现阶段V4 Pro 正式版呈现“效能升级、价格暂时不变”的状态,但未必能长期维持。这也让此次更新更像是在涨价前先完成一波模型效能升级与产品切换,再视算力供给、呼叫量及商业化状况调整价格。

撞车Grok 前沿模型价格战升温

更巧的是,DeepSeek V4 Pro-0813 上线时间,几乎与Grok 4.6 正面撞车。

就在DeepSeek 新版模型悄悄现身前几个小时,Grok 4.6 也宣布刚刚发布。根据相关资料,Grok 4.6 在Artificial Analysis 推出的GDPVal-AA v2 智能体评估中拿下1753 Elo,排名第一;Artificial Analysis Intelligence Index 则取得61 分。

价格同样成为Grok 的主要武器。 Grok 4.6 API 定价为每百万输入Token 2 美元、输出6 美元,主打相较其他前沿模型更低的成本。如今DeepSeek V4 Pro-0813 又在多项测试中逼近Fable 5,同时维持低价,两款模型几乎同时向市场释出相同讯号:前沿模型之间的能力差距持续缩小,而价格正成为下一阶段更重要的竞争武器。

过去AI 模型竞争主要围绕“谁是最强模型”展开,但当DeepSeek、Grok 等模型不断向第一梯队逼近,市场的比较方式也开始改变。如果效能差距已缩小到一定程度,开发者是否还愿意为更昂贵的模型支付数倍成本,正成为新的竞争焦点。

从“便宜”走向“能干活”

DeepSeek V4 Pro 此次升级的意义,并非只是一次普通版本迭代。

今年4 月推出V4 时,DeepSeek 已将重心由传统聊天模型转向Agent,把百万Token 上下文、AI编码工程与工具呼叫能力列为核心卖点;随后V4 Flash 正式版又进一步强化Code Agent、Search Agent 等能力。

如今V4 Pro 正式版持续向Fable 5 等顶级闭源模型靠拢,显示DeepSeek 的竞争目标已不只是打造“更便宜的通用大模型”,而是试图在AI 从聊天走向实际工作的过程中,抢占Agent 基础模型的位置。

这也与Grok 4.6 的升级方向不谋而合。 Grok 4.6 同样将长时间运行的智能体、复杂程式设计与知识工作列为重点,并透过开发者工具提供服务。

DeepSeek V4 Pro-0813 与Grok 4.6 几乎同日登场,某种程度也折射出AI 产业竞争进入新阶段:前沿模型战场正从单纯比拼参数、聊天与基准测试能力,转向智能体执行能力、Token 成本与开发者生态的全面较量。

作者:场长

评论

我要赞赏作者

请扫描二维码,使用微信支付哦。

分享到微信