Luna 输入降到 0.2 美元:模型路由经济学和杰文斯悖论
古董级程序员,大厂出来后一直在创业公司,现在仍在一线做 AI 相关开发。这个专栏补的是 AI 时代程序员容易忽略的硬底座,这篇从账单出发,把模型路由这件事讲成一道成本工程题。
2026 年 7 月 30 日,OpenAI 调整 GPT-5.6 系列 API 价格:轻量级 Luna 输入从每百万 token 1 美元降到 0.2 美元(降 80%),输出从 6 美元降到 1.2 美元;均衡档 Terra 输入从 2.5 美元降到 2 美元、输出从 15 美元降到 12 美元(降 20%);旗舰 Sol 不降价,但新增 Fast 模式,处理速度最高 2.5 倍、收费 2 倍。到 8 月初,OpenAI 宣布月活用户破 10 亿、企业客户 200 万。
对写代码的人来说,这条新闻值得拆成两件事看:一是同一个任务用哪档模型,成本差一个数量级,这是路由问题;二是单价越便宜,总需求反而可能越大,这是杰文斯悖论。这篇先把第一件事做成能复算的账本,再讲第二件事为什么影响你的架构判断。
先摆价格:三档模型不是三个版本,是三条产品线
| 模型 | 定位 | 输入(每百万 token) | 输出(每百万 token) | 本次调整 |
|---|---|---|---|---|
| Luna | 高频、低延迟、量大 | $0.20 | $1.20 | 降 80% |
| Terra | 均衡日常负载,约 GPT-5.5 性能、一半成本 | $2.00 | $12.00 | 降 20% |
| Sol | 旗舰推理、复杂编码与科学计算 | 约 $5(未变) | 约 $30(未变) | 新增 2.5x Fast 模式,收费 2 倍 |
注意 Sol/Terra/Luna 是三条各自迭代的产品线,不是同一个模型的“大中小杯”。OpenAI 的意图是让每个档位按自己的节奏升级,价格锚定的是使用场景而不是版本号。这对工程选型是好事:你可以把“精度”和“成本”解耦,按任务特性路由。
成本模型:两行公式,先算清楚再选型
一个 API 调用的成本由输入和输出分开计价:
单次成本 = 输入 token × 输入单价 + 输出 token × 输出单价
真实账单通常还要乘上重试次数,Agent 场景还要把每一轮重发的上下文算进去(Codex 这类 Agent 每轮都会重发整个上下文,缓存命中率直接决定真实单价——我们之前跑 deepseek-v4-flash 时缓存命中 94%,靠的就是这个)。先把不命中缓存的基准算明白,再把缓存当作折扣项。
拿一个月 5000 万输入 token、1000 万输出 token 的固定流量算:
| 模型 | 月成本(降价后) | 相对 Luna |
|---|---|---|
| Luna | 50 × 0.2 + 10 × 1.2 = $22 | 1x |
| Terra | 50 × 2 + 10 × 12 = $220 | 10x |
| Sol | 50 × 5 + 10 × 30 = $550 | 25x |

同一个流量,Luna 和 Sol 相差 25 倍。放到 Agent 场景更直观:一次典型步骤 6 万 token 上下文进、3000 token 计划+补丁出,Luna 约 1.6 美分,Terra 约 15.6 美分,Sol 约 39 美分。一天一千个步骤,Luna 16 美元,Terra 156 美元。选错档位的代价,是按天计而不是按月计。
路由决策:按任务特性分流,而不是按模型名气
路由不是“贵的模型永远更好”。同一个任务,能不能被便宜模型高质量完成,取决于任务的可验证性和失败代价:
| 任务特性 | 建议档位 | 理由 |
|---|---|---|
| 复杂重构、跨模块设计、高风险变更 | Sol | 一步到位比十轮返工便宜;错误直接进主干 |
| 日常 CRUD、单文件改动、有测试兜底 | Terra | 性价比均衡,约 5.5 级性能半价 |
| 批量分类、抽取、重试次数多的任务 | Luna | 量大、可重试、失败代价低,单价决定总成本 |
| 需要 2.5 倍速的交互/同步场景 | Sol Fast | 延迟敏感才值得付两倍价 |
伪代码可以这样写:
def route(task: Task) -> str:
if task.requires_deep_reasoning or task.failure_cost == "high":
return "sol"
if task.is_batch or task.retryable:
return "luna"
return "terra"
真正的路由逻辑不会只有三行,但核心判断就两个问题:这一步错了会怎样,以及这一步能重试多少次。能重试的交给便宜的,不能重试的交给贵的,其余按延迟要求排。
失败场景:账单爆炸的三个典型写法
- 无上限重试:把 Luna 用在抽取任务上,解析失败就重试 3 次,等于把 4 倍成本写进代码。重试要带退避、上限和降级。
- 上下文重发不看缓存:Agent 每轮重发 10 万 token 上下文,不命中缓存时,Luna 每轮光上下文就 2 美分,一万轮就是 200 美元。路由之前先确认 API 的缓存输入档位和命中率。
- 全员 Sol:团队习惯性把复杂任务默认给旗舰模型,账单按 25 倍跑。先用 Terra 跑通、用测试兜底,只有测试证明 Terra 不够才升级。
验收清单(部署前逐条勾):
- 每个调用点标注了预期模型档位,而不是全局默认
- 重试有上限、退避和降级路径
- 输入/输出 token 有埋点,月账单可以按任务类型拆分
- 批量任务先在小样本上对比 Luna 与 Terra 的质量差异
- 缓存命中率进入监控指标,低于阈值报警
杰文斯悖论:单价下降为什么会让总需求上升
接下来是产业层面。摩根士丹利 8 月 3 日发布报告《开放权重模型与三种未来情景》,核心观点是:开放权重模型不会削弱 AI 算力需求,反而可能推高总需求。这正是不懂经济学的人容易反直觉的地方——杰文斯悖论:19 世纪经济学家威廉·斯坦利·杰文斯发现,瓦特改良蒸汽机让煤炭效率大幅提升后,煤炭总消耗不降反升,因为更便宜的能源催生了更多用途。
同样的逻辑套在 token 上:单次推理变便宜,企业会把 AI 塞进更多任务——日志分类、客服首响、代码预检、数据清洗、边缘设备——每个新用途都产生新的 token 和算力需求。摩根士丹利特别强调两点:开放权重不等于开源(许可证和再分发规则完全不同),开放权重也不等于免费(运行它仍需 GPU、电力和运维)。所以“开源模型便宜 → 闭源完蛋”是错误推论;更准确的推论是“便宜 → 普及 → 总用量上升”。
同期的数字在互相印证:微软、亚马逊、谷歌、Meta 四家 2026 年合计 AI 基础设施投入约 7000 亿美元;中信证券 8 月 4 日也判断开源模型能力提升带来“智能平权”和“Token 平价”。DeepSeek V4-Flash 免费、Meta Muse Code 贡献者档输出 0.2 美元/百万 token——闭源厂商的降价不是慈善,是在给整个市场“以价换量”,赌的是杰文斯悖论在自己这边成立。
对程序员的两条判断
第一条:模型路由会成为新的基本功。 就像早年开发要懂缓存和索引一样,现在每个 AI 功能上线前都要回答“为什么用这个模型、贵在哪、错了会怎样”。这不是选型洁癖,是成本工程。
第二条:别因为单价降了就放松用量管理。 杰文斯悖论的工程版是:token 便宜到一定程度,团队会忍不住把一切任务都交给 LLM,然后总账单和延迟预算一起失控。降价放大了“用量管理”的重要性,而不是取消了它。架构上值得做的动作是:给模型调用加配额、把批量任务和交互任务分流、让便宜模型成为默认、让贵模型成为例外。
观察点放在三件事上:Sol 维持原价但新增 2.5x Fast 模式,说明高端推理和低延迟需求仍然稀缺;开放权重模型的“Token 平价”会继续挤压闭源入门档;以及——当 Luna 和 DeepSeek V4-Flash 都便宜到可以忽略单价时,真正决定账单的变量就只剩缓存命中率和重试次数了。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。