DeepSeek战略转向Agent,Token成本成为核心突破点。日前,DeepSeekV4-Flash正式版上线公测,截至目前,公测仍在进行中。
Artificial Analysis最新公布的数据显示,在目前全球主流大模型中,DeepSeek V4 Flash已经成为推理成本最低的模型之一。
据DeepSeek于7月31日在API文档更新的日志显示,V4-Flash正式版版本名为DeepSeek-V4-Flash-0731。截至目前,DeepSeek网页端和App端使用的模型尚未同步更换。
![]()
Artificial Analysis官网截图
V4-Flash正式版上线当天,第三方评测机构Artificial Analysis给其综合能力打出50分,这与谷歌Gemini 3.6 Flash相当,但仍低于月之暗面的Kimi K3、OpenAI GPT-5.6以及Anthropic Claude Opus 5等模型。
同日,DeepSeek也明确表示,V4-Pro正式版能力更强,但目前尚未发布。
相比模型能力本身,此次升级引发业内更多讨论的是V4-Flash的成本控制能力。
财闻注意到,2023年以来,大模型竞争更多围绕参数规模、推理能力和基准测试成绩展开。而随着模型能力逐渐趋同,国内外模型厂商持续加码Agent、企业级AI应用和API生态,模型价格也再次成为竞争焦点。
参数规模未变
重点转向Agent能力
DeepSeek早在4月24日就发布了V4预览版,包括V4-Pro和V4-Flash。Flash预览版总参数约2840亿,单Token激活约130亿,支持100万Token上下文。
此次0731版本的模型结构和规模均未变化,DeepSeek明确表示,升级主要来自重新后训练。
V4-Flash正式版原生支持Responses API格式,支持Agent任务、工具调用(Tool Calling)、多轮推理等能力,并进一步兼容Codex接口,为开发者提供更完整的智能体开发能力。
相比此前版本,V4-Flash更加面向开发者和企业场景,而不仅仅是普通用户聊天应用。
官方公布的测试结果显示,V4-Flash-0731在Terminal Bench 2.1、DeepSWE、Toolathlon等九项代码和智能体测试中,均超过V4-Pro预览版。其中,DeepSWE成绩由预览版的7.3分提高至54.4分,Terminal Bench 2.1由61.8分升至82.7分,Toolathlon-Verified由49.7分升至70.3分。
每百万输出Token仅需2元
V4-Flash目前的API价格为每百万输入Token 0.14美元、每百万输出Token 0.28美元。Artificial Analysis估算,它完成一项基准测试任务的平均成本约为0.03美元,同一套测试中,Kimi K3约为0.86美元,OpenAI GPT-5.6 Sol约为1.86美元,Claude Fable 5约为3.15美元。V4-Flash与后者的成本差距超过100倍。
![]()
DeepSeek官网截图
国内模型市场此前已进行多轮降价。官网数据显示,阿里Qwen3.6-Flash在较短上下文下,每百万Token输入和输出价格分别为1.2元和7.2元;字节跳动豆包Seed-2.1-turbo分别为3元和15元,面向代码和Agent任务的Seed-Evolving分别为6元和30元;月之暗面Kimi K2.7 Code分别为6.5元和27元,旗舰模型Kimi K3则达到20元和100元。
一些轻量模型的输入价格低于V4-Flash,但在代码能力、上下文长度和复杂任务定位上并不完全相同。V4-Flash的特殊之处,在于同时提供100万Token上下文、较强的代码和工具调用能力,以及每百万输出Token仅2元的价格。
棱镜咨询创始人况玉清接受财闻采访时称,中国开源模型在部分尖端任务上仍与OpenAI、Anthropic存在差距,但在通用任务和中高端应用场景中,替代效应已经十分明显。
“当模型能力相差不大,竞争的核心就会转向性价比,这将直接压缩头部厂商的定价能力和盈利空间。”况玉清说。
不过,较低的API报价并不一定意味着企业最终承担的成本更低。
燕基空间研究中心何基永向财闻表示,价格将成为下一阶段大模型竞争的“入场券”,但真正的衡量标准是单位有效产出成本。
“企业最终比较的不是每百万Token的标价,而是完成一项任务需要多少钱,其中还包括准确率、响应速度、重试次数和人工干预成本。”何基永说。
输出价格对Agent应用尤其重要。传统聊天通常只需要模型完成一次回答,而智能体需要反复读取文件、搜索资料、调用工具、修改代码并验证结果,一项任务可能产生几十次模型调用,消耗数十万乃至数百万Token。





京公网安备 11011402013531号