DeepSeek V4-Flash 跑 Codex 实测:4 个任务全过,花费不到 5 分钱
原创 · 约 22 分钟阅读 · 阅读 --

DeepSeek V4-Flash 跑 Codex 实测:4 个任务全过,花费不到 5 分钱

作者: Alex Xiang


7 月 31 日,DeepSeek 把 V4-Flash 正式版 API 推上线公测,更新日志里有一句话比基准成绩更值得注意:正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。用大白话说,DeepSeek 把 OpenAI 编程 Agent 需要的接口格式直接做进了自己的 API,Codex 这类客户端不用再套一层翻译代理。

写这篇文章时,我整个 Codex 会话就跑在 deepseek-v4-flash 上,本地配置里 model = "deepseek-v4-flash"model_provider = "deepseek"。所以除了整理公开资料,我还顺手用这个模型跑了一组本地 Agent 任务。下文按「模型是什么、基准如何、多少钱、怎么接、实测结果」展开,所有数字都标注了来源,实测部分只记录我机器上真实发生的结果。

模型是什么

本次上线的是 DeepSeek-V4-Flash-0731,调用时模型名统一写 deepseek-v4-flash。官方更新日志说明,0731 的模型结构、尺寸与 Preview 一致,只是重新做了后训练,Agent 能力大幅增强。

几个关键参数:

  • 架构:MoE。媒体引述 DeepSeek 口径为总参数约 284B、激活参数约 13B;Hugging Face 权重页显示约 304B 参数、约 167GB,两种口径有出入,仅作量级参考。
  • 上下文长度:1M token;最大输出 384K token。
  • 思考模式:支持非思考与思考模式,默认思考模式。
  • 接口:OpenAI ChatCompletions、Anthropic 格式、Responses API 都支持;其中 Responses API 目前只有 V4-Flash 能用,deepseek-v4-pro 预计 2026 年 8 月初接入。
  • 并发限制:V4-Flash 官方标注 2500,V4-Pro 为 500。

官方基准成绩

DeepSeek 在更新日志里公布了 9 项基准,几乎全部是「干活」类任务,不是传统的写代码评测:

基准分数
Terminal Bench 2.1(终端操作)82.7
Cybergym(安全对抗)76.7
Toolathlon verified(工具调用)70.3
DSBench-FullStack(全栈开发,内部测试集)68.7
DSBench-Hard(Coding Agent 难题,内部测试集)59.6
DeepSWE(软件工程任务)54.4
NL2Repo(自然语言建仓库)54.2
Agent Last Exam25.2
Automation Bench (Public)25.1

官方 9 项 Agent 基准成绩

图:官方公布的 9 项基准,按分数降序排列。

测试条件要如实说明:公开基准集上的 Code Agent 任务用的是 DeepSeek 自家即将发布的 Harness 极简模式,max 档位、top_p=0.95temperature=1.0;DSBench 两项是内部测试集。也就是说,这些数字是「模型 + 官方 Harness」的成绩,不代表任何第三方框架下的表现,只能当上限参考。

第三方也有独立观察。Simon Willison 在 7 月 31 日的笔记里提到,Artificial Analysis 把 V4-Flash-0731 排到了 MiniMax M3(428B 模型)前面,并评价它「可能是当前性价比最高的模型」。另一个值得记录的细节:V4-Flash 之前还有一轮 Preview,正式版不是修修补补,而是同架构重做后训练后成绩全面反超自家 V4-Pro-Preview(Agent Last Exam 从 15.8 涨到 25.2),说明在 Agent 赛道上,后训练策略的空间比想象中大。

价格:便宜到什么程度

官方价格按人民币计价,单位是每百万 token:

计费项deepseek-v4-flashdeepseek-v4-pro
输入(缓存命中)0.02 元0.025 元
输入(缓存未命中)1 元3 元
输出2 元6 元

Flash 与 Pro 价格对比

图:官方模型页价格,单位元/百万 token。

两个要点:

  1. 缓存命中价差极大。0.02 元对 1 元是 50 倍价差,官方叫「上下文硬盘缓存」,不需要客户端传 cache key,命中自动计价。对 Codex 这类每轮工具调用都会重发上下文的 Agent 来说,这条直接决定真实账单。
  2. 峰谷定价即将生效。DeepSeek 官方预告 API 将引入峰谷定价,高峰时段(北京时间每日 9:00-12:00 和 14:00-18:00)价格为平时 2 倍,覆盖所有计费项,具体生效时间以官方通知为准。也就是说今天看到的 0.02/1/2 可能不是长期价。

怎么接入 Codex

官方文档给了一条很清楚的路径:Codex 通过 Responses API 与模型交互,DeepSeek 原生实现了这个格式,所以把 DeepSeek 配成模型提供方后,Codex CLI、ChatGPT 桌面端、VS Code 的 Codex 插件会共用同一份配置。

方式一:一键脚本(推荐)

前提是已经装过 Codex CLI 或 ChatGPT 桌面端,并且至少运行过一次(~/.codex 目录存在):

# macOS / Linux
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)
# Windows
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

脚本做的事情:把现有 ~/.codex/config.toml 备份到 backup-deepseek/;写入 ~/.codex/models.json(向 Codex 声明模型元数据);给 config.toml 增加 [model_providers.deepseek] 段,保留原有 MCP 服务器和项目信任设置;写入前校验语法,校验失败不改任何文件。

方式二:手动配置

先写 ~/.codex/models.jsondeepseek-v4-flash 的模型目录里几个关键字段:

{
  "slug": "deepseek-v4-flash",
  "display_name": "DeepSeek-V4-Flash",
  "context_window": 1048576,
  "max_context_window": 1048576,
  "default_reasoning_level": "high",
  "supported_reasoning_levels": ["low", "high", "max"],
  "supports_parallel_tool_calls": true,
  "input_modalities": ["text"],
  "minimal_client_version": "0.144.0"
}

再在 config.toml 里指定模型和提供方:

model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
model_catalog_json = "C:/Users/<you>/.codex/models.json"

API Key 按官方文档在 DeepSeek 开放平台生成,不要把 Key 写进仓库或博客。

Codex 接入 DeepSeek 的配置链路

图:三种 Codex 客户端形态共用同一份模型目录与提供方配置,请求走 Responses API 到 api.deepseek.com。

直接用 Responses API 调用

不通过 Codex 也可以直接用官方 OpenAI SDK 调用:

from openai import OpenAI

client = OpenAI(
    api_key="<your DeepSeek API key>",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)
print(response.output_text)

兼容性上几个容易踩的坑(官方文档明示):

  • 无状态previous_response_idconversationstore 都不支持,多轮对话要自己把历史作为 input items 传回;服务端不会维护会话。
  • 不支持的参数静默忽略text.verbosityreasoning.summaryparallel_tool_calls 等传了也不报错,所以现有 Responses API 客户端通常能直接连。
  • 流式事件没有 data: [DONE]:流以 response.completed / response.incomplete / response.failed 结束,按 OpenAI 习惯写 SSE 解析的要注意。
  • 超长输入直接 400:超过 1M 上下文窗口会报错而不是截断。
  • 只收文本input_image 内容块不会报错,但会被替换成占位文本,多模态图片输入目前不支持。
  • reasoning.effort 支持,web_search 工具由服务端执行;custom 工具目前只认 apply_patch(Codex 兼容用)。

另外提醒迁移用户:旧模型名 deepseek-chatdeepseek-reasoner 已于 2026-07-24 停止使用,新代码一律用 deepseek-v4-flashdeepseek-v4-pro

本地实测:4 个 Agent 任务

光看官方数字不够,我在本机用 Codex CLI(0.146.0)配 deepseek-v4-flash 跑了 4 个任务,覆盖「从零实现 + 自测」「修 bug」「终端数据处理」「仓库探查与文档一致性」四类典型 Agent 场景。推理档位用默认 high,每个任务在独立空目录里执行(修 bug 和仓库探查两个任务预置了文件),用 codex exec --json 记录 token 用量,用计时器记录耗时。

本地 4 个任务实测终端记录

图:4 个任务的真实输出摘录,全部通过。

任务内容结果耗时输入 token(缓存命中)输出 token
1 实现 CLI从零写 textstats.py(行数/词数/高频词)+ pytest 测试并验证3 passed73.1s114,137(107,008)3,040
2 修 bug修复预埋 bug 的计算器,不改测试10 passed68.0s133,258(130,432)2,475
3 数据处理bash 生成 100 行 CSV,Python 聚合并自检总数自洽69.6s132,868(131,456)3,334
4 仓库探查读小项目回答 3 个问题,修复 README/配置不一致运行一致50.1s108,688(107,264)1,847

合计:4 个任务全部完成,总耗时约 4.4 分钟;输入合计 488,951 token,其中 476,160 命中缓存(命中率 97.4%);输出合计 10,696 token。按官方价计算总成本约 0.044 元

值得记录的 5 个观察

  1. 自动缓存把账单压得很低。4 个任务总输入近 49 万 token,但 97.4% 走了缓存命中价(0.02 元/百万),未命中部分只有 1.28 万 token,最终花费不到 5 分钱。Agent 每轮工具调用都要带全量上下文,这个缓存机制对使用成本的影响是决定性的。
  2. 自我验证闭环是真实的。任务 1 里模型自己写的测试断言有误(把 the 的出现次数写成 3,实际是 4),它运行 pytest 发现失败后,自己核对 CLI 输出并修正断言,第二次运行 3 个测试全过。整个过程没有人工介入。
  3. 不会被误导性注释带偏。任务 2 的代码里有一行注释声称 is_prime 缺了 return True,但代码本身是对的。模型核对后明确报告「这个注释有误导,函数行为正确」,只修了真正有 bug 的 factorialrange(1, n) 应为 range(1, n + 1))。
  4. 工具调用有冗余现象。任务 1 中,同一个 CLI 命令被重复执行了多次(约 7 次相同命令)。这可能是模型主动重试,也可能是客户端并行工具调用的产物,单次观测无法定论,但值得继续盯。
  5. 限流是真实存在的。整个评测会话期间 API 出现过一次 429 Too Many Requests,客户端重试后恢复。官方并发标注 2500 很高,但个人 API Key 还有自己的 RPM/TPM 配额,密集并行任务时仍可能触发。

局限

这是 n=1 的小样本实测:任务规模小、环境单一、没有和别的模型做对照,不能替代标准基准。官方基准是「模型 + 自家 Harness」的成绩,其中两项还是内部测试集,第三方复现前谨慎引用。价格与功能随时可能变(峰谷定价即将上线),以官方文档为准。

结论

deepseek-v4-flash 的定位很清楚:用极低单价承接 Codex 这类高频工具调用的 Agent 工作负载。官方基准和第三方排名都指向「接近顶级模型的 agent 能力,价格差一个数量级」;我的小样本实测支持这个判断——4 个任务全部通过,花费不到 5 分钱,且自动缓存和思考模式都如文档所述工作。

适合用它跑的场景:个人开发者日常编码、批量小任务、预算敏感的原型验证、需要长上下文的仓库分析。需要留意的边界:Responses API 目前无状态;模型只收文本输入;限流依赖你 Key 的配额;峰谷定价生效后高峰时段成本翻倍;deepseek-v4-pro 的 Responses/Codex 支持还要等 8 月初。

参考

打开原图 ↗