gpt-5.6没额度了,我用deepseek-v4-flash 连续跑两天花了 14 亿 token,40人民币
上篇《5毛钱的 deepseek-v4-flash 能干什么》拿它做了一次单点巡检,证明“便宜模型也能干大活”。但那只是一次任务,样本太小。这次我直接把 Codex 的主力模型换成 deepseek-v4-flash,连续跑了 48 小时真实工作,然后把所有会话记录翻出来统计:多少 token、缓存命中多少、reasoning 占了多少、到底交付了什么,再和之前用 gpt-5.6-sol 的会话对比。这篇不是评测报告,是一次带数据的真实使用复盘。
起因:codex没额度了
一直用gpt-5.6-sol ,被频繁的重置惯坏了,三天额度就见底了,谁知道这次死活也不重置,都已经超过4天半了。用 gpt-5.6-sol 做主力,质量确实好,但目前看不控制的话,周额度绝对是不够用的。deepseek-v4-flash 的官方单价是缓存命中 0.02 元/百万、未命中 1 元/百万、输出 2 元/百万,比 GPT 系 API 的 5 / 0.5 / 30 美元每百万便宜一到两个数量级。便宜的前提是缓存要命中——而 Codex 这类 agent 每一轮都要把整个上下文重发一遍,缓存命中率直接决定真实账单。上篇的 94% 命中已经让我觉得可行,这次干脆让它当主力跑两天。
48 小时干了什么:三个线程,一长串可验证的交付
这两天实际主要开了三个 deepseek-v4-flash 的会话,都是真实工作,下面是这些会话的主要内容:
- 会话 A:先处理“测试账号某页面报错”的工单,最后交付了「某服务成功率自动下线机制」,自动合并PR并提交测试环境;
- 会话 B:恢复一个之前中断的由gpt-5.6-sol一直跑了一周的某服务开发的 goal,持续24小时,完成若干子任务,并推进到生产侧;
- 会话 C:从“网站上线验证”开始,陆续做了线上环境排查、某服务线上问题修复(提交若干PR )、某仓库CI 流程精简、某仓库smoke test增加容错、给同事做的十几个代码的PR review 与 approve、某服务代码的整体分析,最后还建了一个服务的上线 PR。
没有一次会话是因为模型“卡住”或上下文溢出中断的。三个线程都从 08-03 下午一路跑到了 08-05 中午,连续 46 到 48 小时。
数据怎么说:14 亿 token,99.4% 缓存命中,约 40 块钱
从 Codex 会话记录(rollout JSONL)里统计,三个线程合计:
| 指标 | 数值 |
|---|---|
| 事件数 | 17,535 |
| 累计输入 token | 1,411,089,346 |
| 其中缓存命中 | 1,402,989,952(99.4%) |
| 未命中输入 | 8,099,394 |
| 输出 token | 1,837,393 |
| 其中 reasoning | 1,052,759(57.3%) |
按 DeepSeek 官方单价折算:
- 未命中输入 809 万 × 1 元/百万 ≈ 8.1 元
- 缓存输入 14.03 亿 × 0.02 元/百万 ≈ 28.1 元
- 输出 183.7 万 × 2 元/百万 ≈ 3.7 元
- 合计 ≈ 40 元
两天高强度工程开发,覆盖验证、修复、CI、Review、部署一整套流程,API 等价成本大约四十块钱。这是官方 API 口径的估算,不是 Codex 订阅账单;但量级是清楚的。
和 gpt-5.6-sol 对比:能比的只有这些维度
我翻出之前用 gpt-5.6-sol 做的连续一周某服务开发的会话作为对照。中途换过登录,resume 看不到历史,只能从本机会话目录里把当时的 rollout 文件找回来。那条主线线程的具体内容就不细说了,任务类型跟这两天基本一致,都是工程实现、运维排查和审计。
| 维度 | deepseek-v4-flash(近48h) | gpt-5.6-sol(之前一周开发主线) |
|---|---|---|
| 事件数 | 17,535 | 224,489 |
| 累计输入 token | 14.11 亿 | 72.4 亿 |
| 缓存命中率 | 99.4% | 97.1% |
| 输出 token | 183.7 万 | 1,502.9 万 |
| reasoning 占比 | 57.3% | 23.8% |
| 会话跨度 | 连续 46–48h | 跨一周多的主线线程 |
| 任务类型 | 工程实现 / 运维 / Review | 工程实现 / 运维 / 审计 |
几个能直接比的点:
- 缓存命中率:99.4% 对 97.1%。在每轮重发全上下文的场景下,这 2.3 个百分点的差距对成本的影响被 DeepSeek 的缓存定价放大了几十倍。
- reasoning 占比:57% 对 24%。deepseek-v4-flash 明显“想得多”,输出预算里有一半多是思考 token。这不是缺点,但意味着
max_tokens必须留足,否则会出现上篇那种“正文被 reasoning 吃光”的现象。 - 长会话续航:deepseek 三个线程连续跑两天没有中断;gpt-5.6-sol 那边是跨一周多的主线线程(22.4 万事件),说明长线程本身两边都扛得住。
- 成本量级:按官方 API 价,同样规模的输出,量级差约 40 倍。
必须诚实:两条样本时长和规模不同,所以“每个任务花多少 token”这种指标我不列。上面只列不受这些差异影响的维度(缓存命中率、reasoning 占比、续航),以及用真实交付物说话的结果。
我的评价:值不值,边界在哪
值得。至少在我这种“长上下文、多仓库、多任务串行”的使用方式里,deepseek-v4-flash 表现稳定:两天里把从线上验证到 PR 合并的完整链路都走通了,没有一次因为模型问题返工。99.4% 的缓存命中率说明它的上下文复用做得很好,这也是它能便宜到 40 块跑两天的根本原因。
边界有三条:
- reasoning 占比高,输出预算要留足。57% 的输出是思考 token,调用方如果还按“输出 token = 正文长度”来设预算,会踩上篇 glm-5.2 那种坑。
- 缓存是生命线。14 亿输入里 99.4% 靠缓存兜着,一旦缓存失效(换任务、改系统提示、跨会话),成本会向未命中价靠拢,量级立刻上来。长会话里中途切换上下文要小心。
- 这是真实使用样本,不是受控评测。之前那条主线里“审计/评审”类任务占比更高,deepseek 在这类任务上还没有同等规模的对照样本,不下结论。
局限
- 样本是我自己的真实工作,两批任务的时长与规模不同(48h 对一周多),对比维度受限;
- 成本是 API 等价估算(DeepSeek 官方价 / GPT-5.5 参考价),不是 Codex 订阅实际账单;
- 48 小时没出问题,不构成对更长或更复杂任务的承诺。
下一步我打算把 deepseek-v4-flash 用到“跨周的长期 goal”上,重点观察缓存命中率和长上下文漂移——这两个才是它能不能长期当主力的真正试金石。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。