gpt-5.6没额度了,我用deepseek-v4-flash 连续跑两天花了 14 亿 token,40人民币
原创 · 约 9 分钟阅读 · 阅读 --

gpt-5.6没额度了,我用deepseek-v4-flash 连续跑两天花了 14 亿 token,40人民币

作者: Alex Xiang


上篇《5毛钱的 deepseek-v4-flash 能干什么》拿它做了一次单点巡检,证明“便宜模型也能干大活”。但那只是一次任务,样本太小。这次我直接把 Codex 的主力模型换成 deepseek-v4-flash,连续跑了 48 小时真实工作,然后把所有会话记录翻出来统计:多少 token、缓存命中多少、reasoning 占了多少、到底交付了什么,再和之前用 gpt-5.6-sol 的会话对比。这篇不是评测报告,是一次带数据的真实使用复盘。

起因:codex没额度了

一直用gpt-5.6-sol ,被频繁的重置惯坏了,三天额度就见底了,谁知道这次死活也不重置,都已经超过4天半了。用 gpt-5.6-sol 做主力,质量确实好,但目前看不控制的话,周额度绝对是不够用的。deepseek-v4-flash 的官方单价是缓存命中 0.02 元/百万、未命中 1 元/百万、输出 2 元/百万,比 GPT 系 API 的 5 / 0.5 / 30 美元每百万便宜一到两个数量级。便宜的前提是缓存要命中——而 Codex 这类 agent 每一轮都要把整个上下文重发一遍,缓存命中率直接决定真实账单。上篇的 94% 命中已经让我觉得可行,这次干脆让它当主力跑两天。

48 小时干了什么:三个线程,一长串可验证的交付

这两天实际主要开了三个 deepseek-v4-flash 的会话,都是真实工作,下面是这些会话的主要内容:

  • 会话 A:先处理“测试账号某页面报错”的工单,最后交付了「某服务成功率自动下线机制」,自动合并PR并提交测试环境;
  • 会话 B:恢复一个之前中断的由gpt-5.6-sol一直跑了一周的某服务开发的 goal,持续24小时,完成若干子任务,并推进到生产侧;
  • 会话 C:从“网站上线验证”开始,陆续做了线上环境排查、某服务线上问题修复(提交若干PR )、某仓库CI 流程精简、某仓库smoke test增加容错、给同事做的十几个代码的PR review 与 approve、某服务代码的整体分析,最后还建了一个服务的上线 PR。

没有一次会话是因为模型“卡住”或上下文溢出中断的。三个线程都从 08-03 下午一路跑到了 08-05 中午,连续 46 到 48 小时。

数据怎么说:14 亿 token,99.4% 缓存命中,约 40 块钱

从 Codex 会话记录(rollout JSONL)里统计,三个线程合计:

指标数值
事件数17,535
累计输入 token1,411,089,346
其中缓存命中1,402,989,952(99.4%)
未命中输入8,099,394
输出 token1,837,393
其中 reasoning1,052,759(57.3%)

按 DeepSeek 官方单价折算:

  • 未命中输入 809 万 × 1 元/百万 ≈ 8.1 元
  • 缓存输入 14.03 亿 × 0.02 元/百万 ≈ 28.1 元
  • 输出 183.7 万 × 2 元/百万 ≈ 3.7 元
  • 合计 ≈ 40 元

两天高强度工程开发,覆盖验证、修复、CI、Review、部署一整套流程,API 等价成本大约四十块钱。这是官方 API 口径的估算,不是 Codex 订阅账单;但量级是清楚的。

和 gpt-5.6-sol 对比:能比的只有这些维度

我翻出之前用 gpt-5.6-sol 做的连续一周某服务开发的会话作为对照。中途换过登录,resume 看不到历史,只能从本机会话目录里把当时的 rollout 文件找回来。那条主线线程的具体内容就不细说了,任务类型跟这两天基本一致,都是工程实现、运维排查和审计。

维度deepseek-v4-flash(近48h)gpt-5.6-sol(之前一周开发主线)
事件数17,535224,489
累计输入 token14.11 亿72.4 亿
缓存命中率99.4%97.1%
输出 token183.7 万1,502.9 万
reasoning 占比57.3%23.8%
会话跨度连续 46–48h跨一周多的主线线程
任务类型工程实现 / 运维 / Review工程实现 / 运维 / 审计

几个能直接比的点:

  • 缓存命中率:99.4% 对 97.1%。在每轮重发全上下文的场景下,这 2.3 个百分点的差距对成本的影响被 DeepSeek 的缓存定价放大了几十倍。
  • reasoning 占比:57% 对 24%。deepseek-v4-flash 明显“想得多”,输出预算里有一半多是思考 token。这不是缺点,但意味着 max_tokens 必须留足,否则会出现上篇那种“正文被 reasoning 吃光”的现象。
  • 长会话续航:deepseek 三个线程连续跑两天没有中断;gpt-5.6-sol 那边是跨一周多的主线线程(22.4 万事件),说明长线程本身两边都扛得住。
  • 成本量级:按官方 API 价,同样规模的输出,量级差约 40 倍。

必须诚实:两条样本时长和规模不同,所以“每个任务花多少 token”这种指标我不列。上面只列不受这些差异影响的维度(缓存命中率、reasoning 占比、续航),以及用真实交付物说话的结果。

我的评价:值不值,边界在哪

值得。至少在我这种“长上下文、多仓库、多任务串行”的使用方式里,deepseek-v4-flash 表现稳定:两天里把从线上验证到 PR 合并的完整链路都走通了,没有一次因为模型问题返工。99.4% 的缓存命中率说明它的上下文复用做得很好,这也是它能便宜到 40 块跑两天的根本原因。

边界有三条:

  1. reasoning 占比高,输出预算要留足。57% 的输出是思考 token,调用方如果还按“输出 token = 正文长度”来设预算,会踩上篇 glm-5.2 那种坑。
  2. 缓存是生命线。14 亿输入里 99.4% 靠缓存兜着,一旦缓存失效(换任务、改系统提示、跨会话),成本会向未命中价靠拢,量级立刻上来。长会话里中途切换上下文要小心。
  3. 这是真实使用样本,不是受控评测。之前那条主线里“审计/评审”类任务占比更高,deepseek 在这类任务上还没有同等规模的对照样本,不下结论。

局限

  • 样本是我自己的真实工作,两批任务的时长与规模不同(48h 对一周多),对比维度受限;
  • 成本是 API 等价估算(DeepSeek 官方价 / GPT-5.5 参考价),不是 Codex 订阅实际账单;
  • 48 小时没出问题,不构成对更长或更复杂任务的承诺。

下一步我打算把 deepseek-v4-flash 用到“跨周的长期 goal”上,重点观察缓存命中率和长上下文漂移——这两个才是它能不能长期当主力的真正试金石。

打开原图 ↗