DeepSeek V4-Flash 正式版:架构没动,后训练把 Agent 能力拉了一截

DeepSeek V4-Flash 正式版:架构没动,后训练把 Agent 能力拉了一截 DeepSeek V4-Flash 正式版架构没动后训练把 Agent 能力拉了一截7 月 31 日下午DeepSeek 通过 API 文档更新日志放出了 V4-Flash 正式版0731。之前传的是 8 月 3 日提前了三天没有预热没有发布会。模型 ID 是deepseek-v4-flash当前指向 0731 版本。这次只升了 Flash 的 APIPro 的 API 和 App/Web 端都没动Pro 正式版预计 8 月初。先把结论放前面模型架构一个参数没改纯靠重做后训练在 Agent 任务上全面反超自家 1.6T 旗舰的预览版——而且这一点已被第三方独立评测复现。这件事比跑分本身更值得聊。架构没动只换了调音师V4-Flash-0731 和 preview 版在模型结构、参数规模上完全一致2840 亿总参数130 亿激活256 个专家100 万上下文384K 最大输出MoE 架构FP4FP8 混合精度MIT 许可。变了的只有后训练。DeepSeek 的后训练分两步先按领域——推理、编码、数学、世界知识、Agent 工具使用——分别用 SFT GRPO 训出专家模型然后合并模型不是简单看专家的输出分布而是观察专家的行为分布做在线策略蒸馏学的不只是专家说了什么而是专家怎么思考的。这次 Agent 能力暴涨就是在第二步里专门强化了 Agent 与工具使用方向的蒸馏力度。同一台引擎换了个调音师声音就完全不一样了。跑分先看官方完整对照表再挑刺眼的说官方这张表把 Flash-0731、Flash-Preview、Pro-Preview、GLM-5.2、Opus-4.8 五列并排正好可以把提升拆成三个干净的维度避免把不同对比对象混为一谈。第一维自我跃迁0731 vs Flash-Preview。DeepSWE软件工程 Agent7.3 → 54.4约7.5 倍——这个幅度已经不是优化能解释的更像是把 Agent 长链任务里的工具调用规划这门课从没上补到了精通。Terminal Bench 2.1 从 61.8 涨到 82.720.9Toolathlon-Verified 从 49.7 涨到 70.320.6DSBench-Hard 从 25.8 涨到 59.6。第二维反超 1.6T 的 Pro-Preview。9 项全部反超。注意对比对象是 Pro-Preview 自己的数DeepSWE 12.8 → 54.44 倍多Terminal Bench 2.1 72.1 → 82.710.6Toolathlon-Verified 55.9 → 70.314.4DSBench-Hard 31.1 → 59.6近翻倍。一个 284B / 13B 激活的模型在 Agent 任务上把自家 1.6T / 49B 激活的旗舰预览版逐项压住参数量差近六倍、激活参数差近四倍——按常理该反过来。第三维横向定位。对 GLM-5.29 项全部领先Cybergym 其无数据印证在 Agent / 编码场景已反超 GLM-5.2。对 Opus-4.8则要诚实Opus 仍逐项领先但多数项差距已收窄到个位数其中 Agents’ Last Exam 几乎追平25.2 vs 25.7、AutomationBench 仅差 2.1真正的短板是 NL2Repo−15.5与 DSBench-Hard−12.1。换句话说Flash 已经咬住了 Opus 的衣角但还没咬住咽喉。另外几个 preview 没测或测不全的NL2Repo 54.2Cybergym 76.7网络安全 AgentAgents’ Last Exam 25.2DSBench-FullStack 68.7。方向很明确——DeepSeek 在往能真正干活的 Agent 场景上押重注而不是只刷聊天和问答类 benchmark。横着比第三方综合智能指数怎么说官方自测难免既当运动员又当裁判所以第三方独立评测的读数更值得看。在 Artificial Analysis 的综合智能指数v4.19 项评测加权上V4-Flash-0731 50与 Gemini 3.6 Flash 并列排在全行业约第 12–13 位正卡在第一梯队尾部 / 第二梯队头部的分界线上。这张图给出了三个比官方跑分更硬的信号其一第三方独立复现了Flash 反超 Pro。同榜上DeepSeek V4 Pro (max)只有440731 比自家旗舰高6 分。官方说基准测试远超 V4-Pro-Preview这里由独立评测盖了章。其二同 lineage 的纯后训练增益可量化。榜上同时保留了旧DeepSeek V4 Flash (max) 400731 比它高10 分——同一架构、同一预训练权重仅换后训练综合智能指数 10。其三对 GLM 与头部的定位要校准。GLM-5.2 在综合指数上是51仍比 0731 高 1 分所以反超 GLM严格说只成立在 Agent / 编码基准上综合智能上二者基本持平。头部 Claude Opus 561、GPT-5.6 Sol59、Kimi K357则领先 0731 达 9–11 分差距是实打实的规模代差不是几句摸到尾巴能抹平的。把官方表图0和这张第三方榜图1叠起来看结论才完整在干活的 Agent 维度上 0731 已跻身一线、甚至压过自家旗舰在什么都知道一点的综合智能维度上它站在一线门口与 GLM 并肩距真正的头部还差一个身位。价格以及把性能和价格画在一张图上跑分再漂亮贵得离谱也没意义。每百万 token输入缓存命中 $0.0028缓存未命中 $0.14输出 $0.28。V4-Pro 对应是 $0.0036 / $0.435 / $0.87——Flash 大约是它的三分之一到四分之一。对比 Claude Opus 4.7 的输出价Flash 只有约八十九分之一。并发 Flash 给到 2500Pro 是 500对要批量跑 Agent 的团队来说这个并发差比单价差更要命。但便宜和聪明分开看都没意义得画在一张图上。这张图的左上角是Most attractive quadrant最具吸引力象限高智能 低成本。图中的蓝色箭头把旧 Flash约 $0.023 / 40 分指向了 0731 的位置——成本几乎没动智能垂直跃迁到 50于是 0731 直接落进了最优象限。这才是性价比三个字最干净的画法。落到倍数上更直观。在 50 分这一档智能上Gemini 3.6 Flash 单任务成本约 $0.55是 0731 的约 20 倍GLM-5.253 分约 $0.28是约 10 倍。反过来在 $0.02–0.03 这一档成本上GPT-5.6 Luna 的 medium 档只有 38 分、low 档 33 分花一样的钱0731 给的智能高出一大截。而且别忘了0731 的定价与旧 Flash 完全相同——它不是靠降价挤进最优象限的而是靠后训练把分子智能抬高、分母成本不动硬生生把性价比曲线垂直拉了上去。⚠️ 一个提醒官方宣布要上峰谷定价高峰时段北京时间 9:00–12:00、14:00–18:00价格翻倍。截至 7 月 31 日还没生效但窗口期不会太长。有大量调用需求的现在就是锁价的时机。顺手送的两个新功能Responses APIV4-Flash-0731 原生支持V4-Pro 要等 8 月初。这是更贴近 Agent 工作流的 API 设计不只是 ChatCompletions 换皮。Codex 适配针对 OpenAI Codex 做了专门适配写代码、读代码、重构的体验应该会更好。另外别忘了旧的deepseek-chat和deepseek-reasoner在 7 月 24 日已经停用调用会直接 HTTP 报错新 ID 是deepseek-v4-flash。自部署前沿开源模型第一次够得着消费级硬件这条可能是最值得私藏的。FP4FP8 混合精度加上 CSA/HCA 混合注意力推理效率压得很低。INT4 量化大约 100GB 显存就能跑两张 RTX 6000 Ada48GB就够1M 上下文时 KV-Cache 只有标准 GQA 的 1.4% 左右。100GB 显存意味着什么这是前沿竞争力开源模型第一次落到消费级邻近硬件能部署的门槛上。手里有两张 48G 显卡的这个模型值得认真跑一跑。我比较在意的两件事第一后训练的天花板可能比很多人想的高——而且现在有了第三方证据。初稿这只是推测但图1 把它量化了同一架构、同一预训练权重仅换后训练综合智能指数从 40 拉到 50、并反超自家 Pro 的 44。这暗示我们今天看到的模型能力很可能只是后训练策略的函数而非架构本身的极限。当然也要补一句限定后训练能放大的是预训练已埋下的潜力世界知识这类靠数据量的能力Flash 仍明显逊于闭源顶级——后训练是杠杆不是无中生有。V4-Pro 正式版 8 月初就要来若 Flash 后训练能涨这么多Pro 的涨幅只会更夸张。第二Agent 正在变成真正的战场。这一点连评测机构都在用脚投票——Artificial Analysis 在综合榜之外已经单设了Agentic Index维度。过去两年大模型卷的是聊天、写作、代码生成V4-Flash 这一波把战火明确引到了能不能真干活终端操作、工具调用、软件工程、网络安全。这些 benchmark 不讨巧但更接近真实场景也正是 0731 后训练重点蒸馏的方向。总结没有一句话总结因为这事本来就不是一句话能说清的。一个 284B 的模型用一套后训练把 1.6T 旗舰预览版在 Agent 任务上逐项压住、在第三方综合榜上反超 6 分同时把输出价格压到 $0.28/M、并发开到 2500、协议选 MIT、还顺手把自部署门槛踩到消费级附近并凭成本不动、智能垂直跃迁挤进了性价比最优象限。它验证的不只是 DeepSeek 自己的后训练范式更像是在问整个行业一个问题之前是不是把太多精力花在把模型做大上了当然也要清醒——在综合智能的绝对高度上0731 仍站在一线门口距 Opus 5、GPT-5.6 Sol、Kimi K3 还有 9–11 分的规模代差。后训练是杠杆规模仍是底座二者并不矛盾。数据来源DeepSeek 官方 API 更新日志与定价页、HuggingFace 技术分析、Artificial AnalysisIntelligence Index v4.12026-07-31、IT 之家、快科技、财联社。跑分与榜单数据截至 2026-07-31。