DeepSeek V4-Flash 跑 Codex 实测:4 个任务全过,花费不到 5 分钱
7 月 31 日,DeepSeek 把 V4-Flash 正式版 API 推上线公测,更新日志里有一句话比基准成绩更值得注意:正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。用大白话说,DeepSeek 把 OpenAI 编程 Agent 需要的接口格式直接做进了自己的 API,Codex 这类客户端不用再套一层翻译代理。
写这篇文章时,我整个 Codex 会话就跑在 deepseek-v4-flash 上,本地配置里 model = "deepseek-v4-flash"、model_provider = "deepseek"。所以除了整理公开资料,我还顺手用这个模型跑了一组本地 Agent 任务。下文按「模型是什么、基准如何、多少钱、怎么接、实测结果」展开,所有数字都标注了来源,实测部分只记录我机器上真实发生的结果。
模型是什么
本次上线的是 DeepSeek-V4-Flash-0731,调用时模型名统一写 deepseek-v4-flash。官方更新日志说明,0731 的模型结构、尺寸与 Preview 一致,只是重新做了后训练,Agent 能力大幅增强。
几个关键参数:
- 架构:MoE。媒体引述 DeepSeek 口径为总参数约 284B、激活参数约 13B;Hugging Face 权重页显示约 304B 参数、约 167GB,两种口径有出入,仅作量级参考。
- 上下文长度:1M token;最大输出 384K token。
- 思考模式:支持非思考与思考模式,默认思考模式。
- 接口:OpenAI ChatCompletions、Anthropic 格式、Responses API 都支持;其中 Responses API 目前只有 V4-Flash 能用,
deepseek-v4-pro预计 2026 年 8 月初接入。 - 并发限制:V4-Flash 官方标注 2500,V4-Pro 为 500。
官方基准成绩
DeepSeek 在更新日志里公布了 9 项基准,几乎全部是「干活」类任务,不是传统的写代码评测:
| 基准 | 分数 |
|---|---|
| Terminal Bench 2.1(终端操作) | 82.7 |
| Cybergym(安全对抗) | 76.7 |
| Toolathlon verified(工具调用) | 70.3 |
| DSBench-FullStack(全栈开发,内部测试集) | 68.7 |
| DSBench-Hard(Coding Agent 难题,内部测试集) | 59.6 |
| DeepSWE(软件工程任务) | 54.4 |
| NL2Repo(自然语言建仓库) | 54.2 |
| Agent Last Exam | 25.2 |
| Automation Bench (Public) | 25.1 |

图:官方公布的 9 项基准,按分数降序排列。
测试条件要如实说明:公开基准集上的 Code Agent 任务用的是 DeepSeek 自家即将发布的 Harness 极简模式,max 档位、top_p=0.95、temperature=1.0;DSBench 两项是内部测试集。也就是说,这些数字是「模型 + 官方 Harness」的成绩,不代表任何第三方框架下的表现,只能当上限参考。
第三方也有独立观察。Simon Willison 在 7 月 31 日的笔记里提到,Artificial Analysis 把 V4-Flash-0731 排到了 MiniMax M3(428B 模型)前面,并评价它「可能是当前性价比最高的模型」。另一个值得记录的细节:V4-Flash 之前还有一轮 Preview,正式版不是修修补补,而是同架构重做后训练后成绩全面反超自家 V4-Pro-Preview(Agent Last Exam 从 15.8 涨到 25.2),说明在 Agent 赛道上,后训练策略的空间比想象中大。
价格:便宜到什么程度
官方价格按人民币计价,单位是每百万 token:
| 计费项 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 输入(缓存命中) | 0.02 元 | 0.025 元 |
| 输入(缓存未命中) | 1 元 | 3 元 |
| 输出 | 2 元 | 6 元 |

图:官方模型页价格,单位元/百万 token。
两个要点:
- 缓存命中价差极大。0.02 元对 1 元是 50 倍价差,官方叫「上下文硬盘缓存」,不需要客户端传 cache key,命中自动计价。对 Codex 这类每轮工具调用都会重发上下文的 Agent 来说,这条直接决定真实账单。
- 峰谷定价即将生效。DeepSeek 官方预告 API 将引入峰谷定价,高峰时段(北京时间每日 9:00-12:00 和 14:00-18:00)价格为平时 2 倍,覆盖所有计费项,具体生效时间以官方通知为准。也就是说今天看到的 0.02/1/2 可能不是长期价。
怎么接入 Codex
官方文档给了一条很清楚的路径:Codex 通过 Responses API 与模型交互,DeepSeek 原生实现了这个格式,所以把 DeepSeek 配成模型提供方后,Codex CLI、ChatGPT 桌面端、VS Code 的 Codex 插件会共用同一份配置。
方式一:一键脚本(推荐)
前提是已经装过 Codex CLI 或 ChatGPT 桌面端,并且至少运行过一次(~/.codex 目录存在):
# macOS / Linux
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)
# Windows
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
脚本做的事情:把现有 ~/.codex/config.toml 备份到 backup-deepseek/;写入 ~/.codex/models.json(向 Codex 声明模型元数据);给 config.toml 增加 [model_providers.deepseek] 段,保留原有 MCP 服务器和项目信任设置;写入前校验语法,校验失败不改任何文件。
方式二:手动配置
先写 ~/.codex/models.json。deepseek-v4-flash 的模型目录里几个关键字段:
{
"slug": "deepseek-v4-flash",
"display_name": "DeepSeek-V4-Flash",
"context_window": 1048576,
"max_context_window": 1048576,
"default_reasoning_level": "high",
"supported_reasoning_levels": ["low", "high", "max"],
"supports_parallel_tool_calls": true,
"input_modalities": ["text"],
"minimal_client_version": "0.144.0"
}
再在 config.toml 里指定模型和提供方:
model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
model_catalog_json = "C:/Users/<you>/.codex/models.json"
API Key 按官方文档在 DeepSeek 开放平台生成,不要把 Key 写进仓库或博客。

图:三种 Codex 客户端形态共用同一份模型目录与提供方配置,请求走 Responses API 到 api.deepseek.com。
直接用 Responses API 调用
不通过 Codex 也可以直接用官方 OpenAI SDK 调用:
from openai import OpenAI
client = OpenAI(
api_key="<your DeepSeek API key>",
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
)
print(response.output_text)
兼容性上几个容易踩的坑(官方文档明示):
- 无状态:
previous_response_id、conversation、store都不支持,多轮对话要自己把历史作为 input items 传回;服务端不会维护会话。 - 不支持的参数静默忽略:
text.verbosity、reasoning.summary、parallel_tool_calls等传了也不报错,所以现有 Responses API 客户端通常能直接连。 - 流式事件没有
data: [DONE]:流以response.completed/response.incomplete/response.failed结束,按 OpenAI 习惯写 SSE 解析的要注意。 - 超长输入直接 400:超过 1M 上下文窗口会报错而不是截断。
- 只收文本:
input_image内容块不会报错,但会被替换成占位文本,多模态图片输入目前不支持。 reasoning.effort支持,web_search工具由服务端执行;custom工具目前只认apply_patch(Codex 兼容用)。
另外提醒迁移用户:旧模型名 deepseek-chat 和 deepseek-reasoner 已于 2026-07-24 停止使用,新代码一律用 deepseek-v4-flash 或 deepseek-v4-pro。
本地实测:4 个 Agent 任务
光看官方数字不够,我在本机用 Codex CLI(0.146.0)配 deepseek-v4-flash 跑了 4 个任务,覆盖「从零实现 + 自测」「修 bug」「终端数据处理」「仓库探查与文档一致性」四类典型 Agent 场景。推理档位用默认 high,每个任务在独立空目录里执行(修 bug 和仓库探查两个任务预置了文件),用 codex exec --json 记录 token 用量,用计时器记录耗时。

图:4 个任务的真实输出摘录,全部通过。
| 任务 | 内容 | 结果 | 耗时 | 输入 token(缓存命中) | 输出 token |
|---|---|---|---|---|---|
| 1 实现 CLI | 从零写 textstats.py(行数/词数/高频词)+ pytest 测试并验证 | 3 passed | 73.1s | 114,137(107,008) | 3,040 |
| 2 修 bug | 修复预埋 bug 的计算器,不改测试 | 10 passed | 68.0s | 133,258(130,432) | 2,475 |
| 3 数据处理 | bash 生成 100 行 CSV,Python 聚合并自检 | 总数自洽 | 69.6s | 132,868(131,456) | 3,334 |
| 4 仓库探查 | 读小项目回答 3 个问题,修复 README/配置不一致 | 运行一致 | 50.1s | 108,688(107,264) | 1,847 |
合计:4 个任务全部完成,总耗时约 4.4 分钟;输入合计 488,951 token,其中 476,160 命中缓存(命中率 97.4%);输出合计 10,696 token。按官方价计算总成本约 0.044 元。
值得记录的 5 个观察
- 自动缓存把账单压得很低。4 个任务总输入近 49 万 token,但 97.4% 走了缓存命中价(0.02 元/百万),未命中部分只有 1.28 万 token,最终花费不到 5 分钱。Agent 每轮工具调用都要带全量上下文,这个缓存机制对使用成本的影响是决定性的。
- 自我验证闭环是真实的。任务 1 里模型自己写的测试断言有误(把
the的出现次数写成 3,实际是 4),它运行 pytest 发现失败后,自己核对 CLI 输出并修正断言,第二次运行 3 个测试全过。整个过程没有人工介入。 - 不会被误导性注释带偏。任务 2 的代码里有一行注释声称
is_prime缺了return True,但代码本身是对的。模型核对后明确报告「这个注释有误导,函数行为正确」,只修了真正有 bug 的factorial(range(1, n)应为range(1, n + 1))。 - 工具调用有冗余现象。任务 1 中,同一个 CLI 命令被重复执行了多次(约 7 次相同命令)。这可能是模型主动重试,也可能是客户端并行工具调用的产物,单次观测无法定论,但值得继续盯。
- 限流是真实存在的。整个评测会话期间 API 出现过一次 429 Too Many Requests,客户端重试后恢复。官方并发标注 2500 很高,但个人 API Key 还有自己的 RPM/TPM 配额,密集并行任务时仍可能触发。
局限
这是 n=1 的小样本实测:任务规模小、环境单一、没有和别的模型做对照,不能替代标准基准。官方基准是「模型 + 自家 Harness」的成绩,其中两项还是内部测试集,第三方复现前谨慎引用。价格与功能随时可能变(峰谷定价即将上线),以官方文档为准。
结论
deepseek-v4-flash 的定位很清楚:用极低单价承接 Codex 这类高频工具调用的 Agent 工作负载。官方基准和第三方排名都指向「接近顶级模型的 agent 能力,价格差一个数量级」;我的小样本实测支持这个判断——4 个任务全部通过,花费不到 5 分钱,且自动缓存和思考模式都如文档所述工作。
适合用它跑的场景:个人开发者日常编码、批量小任务、预算敏感的原型验证、需要长上下文的仓库分析。需要留意的边界:Responses API 目前无状态;模型只收文本输入;限流依赖你 Key 的配额;峰谷定价生效后高峰时段成本翻倍;deepseek-v4-pro 的 Responses/Codex 支持还要等 8 月初。
参考
- DeepSeek 更新日志:https://api-docs.deepseek.com/updates/
- 接入 Codex 官方文档:https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex/
- 模型与价格:https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
- Responses API 指南:https://api-docs.deepseek.com/zh-cn/guides/responses_api/
- Simon Willison 笔记:https://simonwillison.net/2026/Jul/31/deepseek-v4-flash-0731/
- Apidog 兼容性分析:https://apidog.com/blog/deepseek-v4-flash-responses-api-codex/
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。