今天(7月31日),DeepSeek V4-Flash 正式版 API 上线公测。

Flash 正式版在 Agent 能力上全面超越了自家的 V4-Pro-Preview,而且在所有有数据的基准测试项上,还赢了 GLM-5.2。

Flash > Pro,Flash > GLM-5.2?看官方对比表
看官方对比表 DeepSeek 官方直接放出了 V4-Flash 正式版与 V4-Pro-Preview、GLM-5.2、Opus 4.8 的横评对比:

几个关键信号:
Terminal Bench 82.7——衡量模型在终端环境中执行命令、操作文件系统、完成多步骤任务的能力。Flash 正式版不仅远超自家 Pro-Preview(72.1),还逼近了 Opus 4.8(85.0)的区间。82.7 意味着模型已经能在绝大多数常见运维和开发场景中独立完成操作链。
CyberGym 76.7 和 Toolathlon 70.3——分别对应网络安全攻防和多工具协同能力。对比表中可以看到,这两项 Flash 分别领先 Pro-Preview 将近一倍(Pro-Preview 仅 52.7 和 55.9)。Flash 不只是"会写代码",而是真正具备了复杂工具链编排的 Agent 素质。
DSBench-Hard 59.6——内部 Coding Agent 难题集,接近 60% 的通过率在实际工程场景中已经具备实用价值。而 Pro-Preview 在这项上只有 31.1。
更值得关注的是:Flash 在全部 9 项有数据的 Agent 基准上,全面赢了 GLM-5.2。 Terminal Bench 82.7 vs 81.0、NL2Repo 54.2 vs 48.9、DeepSWE 54.4 vs 46.2、Toolathlon 70.3 vs 59.9、DSBench-FullStack 68.7 vs 61.8、DSBench-Hard 59.6 vs 54.5——每一项都是 Flash 领先。GLM-5.2 是智谱当前最强的模型,Flash 作为 DeepSeek 的"轻量版",在 Agent 场景下不仅反超自家 Pro,还跨厂商碾压了 GLM-5.2。
同架构,只重训后训练
这里有个值得琢磨的技术细节:
V4-Flash-0731 的模型结构、尺寸和 V4-Flash-preview 保持一致,仅重新进行了后训练。
换句话说,DeepSeek 没有换更大的模型、没有加更多参数,纯粹靠优化后训练(post-training)就把 Agent 能力拉到了超过 Pro-Preview、甚至超过 GLM-5.2 的水平。这对行业是个有意思的信号——模型能力的提升不一定靠堆规模,训练方法论同样能带来质的飞跃。
API 层面的两个重要变化
第一,原生支持 Responses API 格式并针对性适配 Codex。
这意味着你可以直接用 OpenAI 最新的 Responses API 规范来调用 DeepSeek,并且针对 OpenAI Codex 做了专门优化。对已经在用 Codex 工作流的开发者来说,迁移成本极低——换个 base_url 和 model 名就行。
第二,本次只升级了 Flash 的 API 接口,Pro 及 APP/WEB 端未做更改。
官方明确说了:V4-Pro 正式版将会尽快发布。如果 Flash 已经这么强了,Pro 正式版会到什么水平?这是接下来最值得期待的看点。
对普通用户意味着什么
如果你是开发者或重度 Agent 用户,这次的信号很直接:
Flash 的价格,买到的是超过 Pro-Preview、甚至超过 GLM-5.2 的 Agent 能力——性价比进一步拉高
Codex 生态无缝接入——不用重构现有工作流
Pro 版还在后面——DeepSeek 显然留了后手
对于关注 AI Agent 落地的朋友来说,DeepSeek 这波操作说明一件事:国产大模型在 Code Agent 方向的追赶速度,比很多人预期的要快。Terminal Bench 82.7 这个数字放在几个月前,还是顶级闭源模型的专属区间。而 Flash 作为"轻量版",不仅反超自家 Pro,还全面赢了 GLM-5.2——这个信号值得重视。
当然,基准测试归基准测试,实际体验还需要时间验证。但至少从纸面数据看,DeepSeek V4-Flash 正式版已经交出了一份有说服力的答卷。
数据来源:DeepSeek API 官方更新日志,截止 2026-07-31。
你觉得 DeepSeek Flash 正式版反超 Pro 还赢 GLM-5.2,是训练方法论的突破,还是各家模型在 Agent 方向的差距本来就没那么大?评论区聊聊。
关注智纪探索,给你带来最新 AI 资讯和 Agent 使用技能。
