5毛钱的 deepseek-v4-flash 能干什么
本文涉及服务内容为虚拟内容,但完全参考真实场景,结论是可信的。
前几天写了《DeepSeek V4-Flash 跑 Codex 实测:4 个任务全过,花费不到 5 分钱》,那是用小任务验证模型能不能干活。这次换个真实的大活:给公司做一次完整服务巡检,把发现的问题整理成结论,最后把这次巡检的 token 和账单对清楚,最终的结论是——只花了 5 毛钱!
巡检对象:若干集群加外部托管服务的服务面
需要检测的是主要服务的正确性和稳定性,包括官网、开放 API、镜像仓库这些服务。需要按一定规则对服务做真实场景的模拟测试。
结果:核心服务全绿
花了多少钱
巡检窗口从开工到发送飞书消息前后二十来分钟,共 30 条记录:
| 项 | token 数 |
|---|---|
| 输入(含缓存) | 6,293,834 |
| 其中缓存命中 | 5,915,008 |
| 未命中输入 | 378,826 |
| 输出 | 16,606 |
| 合计 | 6,310,440 |
成本按两种口径对账:
- 按 DeepSeek V4-Flash 官方单价(缓存命中 0.02 元/百万、未命中 1 元/百万、输出 2 元/百万):约 0.53 元;
- 按 OpenAI GPT-5.5 API 等价单价(输入 5 / 缓存 0.5 / 输出 30 美元每百万)做参照估算:约 5.35 美元,折合人民币约 36 元。
两个数字差这么多,是因为 DeepSeek 的缓存命中价只有未命中价的 1/50,而这次巡检 94% 的输入都走了缓存。对 Codex 这类每轮工具调用都要把整个上下文重发一遍的 Agent,缓存命中率直接决定真实账单。上一篇文章里 4 个小任务 97.4% 缓存命中、总花费不到 5 分钱;这次大上下文任务的缓存命中率略低(94%),但绝对量上去之后,未命中输入的 37.9 万 token 才是成本大头——按 DeepSeek 单价算也就是 0.38 元。整条会话如果算上巡检之前的杂活(改配置、查问题之类),合计也就一块钱出头。
5 毛钱买到什么
把这次巡检拆开看,5 毛钱买到的东西包括:
- 所有服务的一轮探活检查;
- 模拟真实用户场景的多轮测试;
- 测试结果的飞书文档报告并发送飞书消息
- 上面这张可以直接写进运维报告的 token 与成本对账表。
比产物更重要的是过程本身可复用:采集脚本、渲染脚本、巡检配置都是现成的,下次巡检不需要重新发明流程,模型要做的只是执行、核对和判断。这是 agent 做运维和传统”写个脚本跑一遍”的区别——脚本是静态的,agent 会在结果异常时继续下钻,会把发现组织成结论,而不是只吐一堆 JSON。
局限
- 成本是估算口径:DeepSeek 单价取自官方定价页,峰谷定价上线后高峰时段会翻倍;GPT-5.5 等价单价只是参照,不代表真实账单。
- 巡检是只读操作,没有改任何线上配置;发现的问题需要人工确认后按流程处理,agent 不越权。
下次可以试试把这条巡检链路接到定时任务里,让 agent 每天自动跑一遍,只有状态变化时才通知到人。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。