当前位置: 首页 » 资讯 » 科技头条 » 正文

DeepSeek-V4-Flash正式API上线!Agent能力暴涨6倍,价格仅为Claude的1/90

IP属地 中国·北京 编辑:陆辰风 TechWeb 时间:2026-08-01 12:37:13

8月1日消息,AI圈又炸了。DeepSeek悄然上线了V4-Flash正式版API,一个“廉价版”模型,却在Agent能力上碾压了三个月前的Pro预览版。更让人震惊的是——它只重新做了后训练,模型骨架一点没变。

昨晚,DeepSeek-V4-Flash正式版API上线。

消息一出,开发者社区瞬间沸腾。

这不是一次普通的版本迭代。一个2840亿参数的MoE模型,激活参数仅130亿,价格低至0.2元/百万tokens(缓存命中),却在多项Agent基准测试中,硬生生把三个月前的V4-Pro预览版摁在地上摩擦。

最让人细思极恐的是模型结构、尺寸一点没变,只是重新做了一遍后训练。

这意味着什么?后训练优化的空间,可能比我们想象的大得多。

九项基准测试,全面碾压

先看硬指标。

DeepSeek-V4-Flash正式版采用MoE架构,总参数量2840亿,激活参数130亿,支持100万token上下文,可切换思考/非思考模式。

官方公布的9项Agent基准测试成绩,堪称惊艳:

最大的亮点在DeepSWE(专门用于评估 AI Agent在‌真实、长周期、多步骤编程任务‌中的自主解决能力)从预览版的7.3分飙升至54.4分,暴涨超过6倍。在 Terminal Bench 2.1(评估 AI Agent在‌Linux 终端环境中自主规划、执行多步命令行任务及错误恢复能力‌的权威基准测试) 中,Flash 正式版得分82.7,高于V4-Pro-Preview的72.1和GLM-5.2 的81.0,逼近Opus-4.8的 85.0。

在海外模型评测机构Artificial Analysis的智能指数测试中,V4-Flash-0731(最高推理档位)拿下50分,而同类可比模型的中位数仅为17分。

差距,肉眼可见。

真正恐怖的是:模型没变,只重做了后训练

如果说性能提升是常规操作,那这次升级的方式才真正值得细品。

DeepSeek官方确认:V4-Flash-0731的模型结构、尺寸与预览版完全一致,仅重新进行了后训练。

同一个骨架,同一套参数规模,只是后训练的策略更精细了,结果就在Agent基准测试上产生了质的飞跃。

这让很多人开始重新思考:堆参数真的是唯一出路吗?

后训练阶段的优化空间,可能被严重低估了。

与此同时,DeepSeek自研的Agent测试框架DeepSeek Harness也首次正式亮相。

开发者实测:便宜到离谱,干活还不赖

性能是纸面上的,真正让开发者兴奋的是实测体验。

有用户晒出账单:“蹬了一小时才不到一块钱”。

价格有多夸张?输入命中缓存0.02元/百万tokens,未命中1元,输出2元。大约只有Claude的1/90(DeepSeek-V4-Flash的输出价格约0.28美元,Claude Opus 4.8输出25美元)。

最让人上头的场景是Claude Code。

有开发者分享:“今天正式版出来后,就用官方API接入Claude Code中开始干活,不到4个小时,差不多消耗了1亿token,缓存命中率竟然达到了99%,关键是干活质量还不错,很少返工。”

另一位用户更直接:“一遍写完,真实测试一遍完美通过,顺手还修了十几个bug……最恐怖的是opencode花了0.1美元。”

从事Qt/C++上位机、STM嵌入式开发的个人开发者反馈:“flash0731的agent表现与v4-pro-preview的表现非常接近”,“目前初步使用感觉flash在能力上和pro-preview相比没有明显差异,但是人是便宜啊!!!”

微博上有用户评价:“最近又高强度的使用了DeepSeek V4 Flash,感觉优势貌似又回来了点儿,在代码和Terminal指令这块貌似也提升很大。”

槽点也很真实:普通用户玩不了

当然,质疑声也不少。

最大的槽点是仅限API公测。网页端和App都没有更新,普通用户暂时无法体验。“对大众玩家不够友好”是高频反馈。

指令遵循仍有短板。有开发者指出:“这版本太喜欢框框干了,没说清楚的事情不太适合交给他干,会出错岔子的;很清晰、有边界的任务可以交给他。”

另外,Agent模式下推理语言被锁定为英文,系统提示词完全无效。GitHub上已有用户提出希望开放语言控制参数。

嵌入式开发仍有瑕疵。有开发者反馈:“在嵌入式开发表现已经比上半年的许多模型表现好很多了,但是还是会出现端口识别不清、写出连编译都通过不了的代码。”

原生支持Responses API,剑指Codex生态

除了模型本身,工程侧的适配同样值得关注。

V4-Flash正式版原生支持OpenAI的Responses API格式,并针对性适配了Codex。开发者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中直接调用DeepSeek模型。

Responses API目前仅支持V4-Flash,V4-Pro预计8月初接入。

这意味着开发者可以用更低的成本,无缝接入Codex生态。

长上下文效率:单token计算量降至27%

V4-Flash在长上下文场景下的工程优化同样值得一提:

100万token场景下,V4系列的单token推理计算量仅为V3.2的27%,KV Cache占用降至约10%。

长链路任务的算力与显存成本,被大幅压缩。

巧合还是狙击?同日OpenAI宣布降价80%

就在DeepSeek-V4-Flash正式版上线的同一天,OpenAI宣布GPT-5.6 Luna降价80%。

时间点耐人寻味。

一边是国际巨头主动降价,一边是中国厂商用1/90的价格交出更强的Agent能力。

有评论一针见血:“DeepSeek-V4-Flash正式版的Agent能力全面超越此前的Pro预览版,相当于用更便宜的价格交出了更强的干活能力。这是在证明,低价不等于低能。”

有业内人士指出,这次升级释放了一个明确的信号,大模型竞赛正在从“堆参数”转向“精调优”。同样的模型骨架,仅靠后训练的优化,就能在Agent能力上实现6倍增长。这对整个行业的启发是深远的,参数的尽头可能不是更大,而是更聪明地训练。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。