8月1日消息,AI圈又炸了。DeepSeek悄然上线了V4-Flash正式版API,一个“廉价版”模型,却在Agent能力上碾压了三个月前的Pro预览版。更让人震惊的是——它只重新做了后训练,模型骨架一点没变。
昨晚,DeepSeek-V4-Flash正式版API上线。
消息一出,开发者社区瞬间沸腾。
这不是一次普通的版本迭代。一个2840亿参数的MoE模型,激活参数仅130亿,价格低至0.2元/百万tokens(缓存命中),却在多项Agent基准测试中,硬生生把三个月前的V4-Pro预览版摁在地上摩擦。
最让人细思极恐的是模型结构、尺寸一点没变,只是重新做了一遍后训练。
这意味着什么?后训练优化的空间,可能比我们想象的大得多。
九项基准测试,全面碾压
先看硬指标。
DeepSeek-V4-Flash正式版采用MoE架构,总参数量2840亿,激活参数130亿,支持100万token上下文,可切换思考/非思考模式。
官方公布的9项Agent基准测试成绩,堪称惊艳:
最大的亮点在DeepSWE(专门用于评估 AI Agent在真实、长周期、多步骤编程任务中的自主解决能力)从预览版的7.3分飙升至54.4分,暴涨超过6倍。在 Terminal Bench 2.1(评估 AI Agent在Linux 终端环境中自主规划、执行多步命令行任务及错误恢复能力的权威基准测试) 中,Flash 正式版得分82.7,高于V4-Pro-Preview的72.1和GLM-5.2 的81.0,逼近Opus-4.8的 85.0。
在海外模型评测机构Artificial Analysis的智能指数测试中,V4-Flash-0731(最高推理档位)拿下50分,而同类可比模型的中位数仅为17分。
差距,肉眼可见。
真正恐怖的是:模型没变,只重做了后训练
如果说性能提升是常规操作,那这次升级的方式才真正值得细品。
DeepSeek官方确认:V4-Flash-0731的模型结构、尺寸与预览版完全一致,仅重新进行了后训练。
同一个骨架,同一套参数规模,只是后训练的策略更精细了,结果就在Agent基准测试上产生了质的飞跃。
这让很多人开始重新思考:堆参数真的是唯一出路吗?
后训练阶段的优化空间,可能被严重低估了。
与此同时,DeepSeek自研的Agent测试框架DeepSeek Harness也首次正式亮相。
开发者实测:便宜到离谱,干活还不赖
性能是纸面上的,真正让开发者兴奋的是实测体验。
有用户晒出账单:“蹬了一小时才不到一块钱”。
价格有多夸张?输入命中缓存0.02元/百万tokens,未命中1元,输出2元。大约只有Claude的1/90(DeepSeek-V4-Flash的输出价格约0.28美元,Claude Opus 4.8输出25美元)。
最让人上头的场景是Claude Code。
有开发者分享:“今天正式版出来后,就用官方API接入Claude Code中开始干活,不到4个小时,差不多消耗了1亿token,缓存命中率竟然达到了99%,关键是干活质量还不错,很少返工。”
另一位用户更直接:“一遍写完,真实测试一遍完美通过,顺手还修了十几个bug……最恐怖的是opencode花了0.1美元。”
从事Qt/C++上位机、STM嵌入式开发的个人开发者反馈:“flash0731的agent表现与v4-pro-preview的表现非常接近”,“目前初步使用感觉flash在能力上和pro-preview相比没有明显差异,但是人是便宜啊!!!”
微博上有用户评价:“最近又高强度的使用了DeepSeek V4 Flash,感觉优势貌似又回来了点儿,在代码和Terminal指令这块貌似也提升很大。”
槽点也很真实:普通用户玩不了
当然,质疑声也不少。
最大的槽点是仅限API公测。网页端和App都没有更新,普通用户暂时无法体验。“对大众玩家不够友好”是高频反馈。
指令遵循仍有短板。有开发者指出:“这版本太喜欢框框干了,没说清楚的事情不太适合交给他干,会出错岔子的;很清晰、有边界的任务可以交给他。”
另外,Agent模式下推理语言被锁定为英文,系统提示词完全无效。GitHub上已有用户提出希望开放语言控制参数。
嵌入式开发仍有瑕疵。有开发者反馈:“在嵌入式开发表现已经比上半年的许多模型表现好很多了,但是还是会出现端口识别不清、写出连编译都通过不了的代码。”
原生支持Responses API,剑指Codex生态
除了模型本身,工程侧的适配同样值得关注。
V4-Flash正式版原生支持OpenAI的Responses API格式,并针对性适配了Codex。开发者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中直接调用DeepSeek模型。
Responses API目前仅支持V4-Flash,V4-Pro预计8月初接入。
这意味着开发者可以用更低的成本,无缝接入Codex生态。
长上下文效率:单token计算量降至27%
V4-Flash在长上下文场景下的工程优化同样值得一提:
100万token场景下,V4系列的单token推理计算量仅为V3.2的27%,KV Cache占用降至约10%。
长链路任务的算力与显存成本,被大幅压缩。
巧合还是狙击?同日OpenAI宣布降价80%
就在DeepSeek-V4-Flash正式版上线的同一天,OpenAI宣布GPT-5.6 Luna降价80%。
时间点耐人寻味。
一边是国际巨头主动降价,一边是中国厂商用1/90的价格交出更强的Agent能力。
有评论一针见血:“DeepSeek-V4-Flash正式版的Agent能力全面超越此前的Pro预览版,相当于用更便宜的价格交出了更强的干活能力。这是在证明,低价不等于低能。”
有业内人士指出,这次升级释放了一个明确的信号,大模型竞赛正在从“堆参数”转向“精调优”。同样的模型骨架,仅靠后训练的优化,就能在Agent能力上实现6倍增长。这对整个行业的启发是深远的,参数的尽头可能不是更大,而是更聪明地训练。
转载请注明出处。

相关文章
精彩导读
热门资讯
关注我们