Luna 输入降到 0.2 美元:模型路由经济学和杰文斯悖论
原创 · 约 12 分钟阅读 · 阅读 --

Luna 输入降到 0.2 美元:模型路由经济学和杰文斯悖论

作者: Alex Xiang


古董级程序员,大厂出来后一直在创业公司,现在仍在一线做 AI 相关开发。这个专栏补的是 AI 时代程序员容易忽略的硬底座,这篇从账单出发,把模型路由这件事讲成一道成本工程题。

2026 年 7 月 30 日,OpenAI 调整 GPT-5.6 系列 API 价格:轻量级 Luna 输入从每百万 token 1 美元降到 0.2 美元(降 80%),输出从 6 美元降到 1.2 美元;均衡档 Terra 输入从 2.5 美元降到 2 美元、输出从 15 美元降到 12 美元(降 20%);旗舰 Sol 不降价,但新增 Fast 模式,处理速度最高 2.5 倍、收费 2 倍。到 8 月初,OpenAI 宣布月活用户破 10 亿、企业客户 200 万。

对写代码的人来说,这条新闻值得拆成两件事看:一是同一个任务用哪档模型,成本差一个数量级,这是路由问题;二是单价越便宜,总需求反而可能越大,这是杰文斯悖论。这篇先把第一件事做成能复算的账本,再讲第二件事为什么影响你的架构判断。

先摆价格:三档模型不是三个版本,是三条产品线

模型定位输入(每百万 token)输出(每百万 token)本次调整
Luna高频、低延迟、量大$0.20$1.20降 80%
Terra均衡日常负载,约 GPT-5.5 性能、一半成本$2.00$12.00降 20%
Sol旗舰推理、复杂编码与科学计算约 $5(未变)约 $30(未变)新增 2.5x Fast 模式,收费 2 倍

注意 Sol/Terra/Luna 是三条各自迭代的产品线,不是同一个模型的“大中小杯”。OpenAI 的意图是让每个档位按自己的节奏升级,价格锚定的是使用场景而不是版本号。这对工程选型是好事:你可以把“精度”和“成本”解耦,按任务特性路由。

成本模型:两行公式,先算清楚再选型

一个 API 调用的成本由输入和输出分开计价:

单次成本 = 输入 token × 输入单价 + 输出 token × 输出单价

真实账单通常还要乘上重试次数,Agent 场景还要把每一轮重发的上下文算进去(Codex 这类 Agent 每轮都会重发整个上下文,缓存命中率直接决定真实单价——我们之前跑 deepseek-v4-flash 时缓存命中 94%,靠的就是这个)。先把不命中缓存的基准算明白,再把缓存当作折扣项。

拿一个月 5000 万输入 token、1000 万输出 token 的固定流量算:

模型月成本(降价后)相对 Luna
Luna50 × 0.2 + 10 × 1.2 = $221x
Terra50 × 2 + 10 × 12 = $22010x
Sol50 × 5 + 10 × 30 = $55025x

同一流量在不同档位上的月度账单:Luna 22 美元、Terra 220 美元、Sol 550 美元

同一个流量,Luna 和 Sol 相差 25 倍。放到 Agent 场景更直观:一次典型步骤 6 万 token 上下文进、3000 token 计划+补丁出,Luna 约 1.6 美分,Terra 约 15.6 美分,Sol 约 39 美分。一天一千个步骤,Luna 16 美元,Terra 156 美元。选错档位的代价,是按天计而不是按月计。

路由决策:按任务特性分流,而不是按模型名气

路由不是“贵的模型永远更好”。同一个任务,能不能被便宜模型高质量完成,取决于任务的可验证性失败代价

任务特性建议档位理由
复杂重构、跨模块设计、高风险变更Sol一步到位比十轮返工便宜;错误直接进主干
日常 CRUD、单文件改动、有测试兜底Terra性价比均衡,约 5.5 级性能半价
批量分类、抽取、重试次数多的任务Luna量大、可重试、失败代价低,单价决定总成本
需要 2.5 倍速的交互/同步场景Sol Fast延迟敏感才值得付两倍价

伪代码可以这样写:

def route(task: Task) -> str:
    if task.requires_deep_reasoning or task.failure_cost == "high":
        return "sol"
    if task.is_batch or task.retryable:
        return "luna"
    return "terra"

真正的路由逻辑不会只有三行,但核心判断就两个问题:这一步错了会怎样,以及这一步能重试多少次。能重试的交给便宜的,不能重试的交给贵的,其余按延迟要求排。

失败场景:账单爆炸的三个典型写法

  1. 无上限重试:把 Luna 用在抽取任务上,解析失败就重试 3 次,等于把 4 倍成本写进代码。重试要带退避、上限和降级。
  2. 上下文重发不看缓存:Agent 每轮重发 10 万 token 上下文,不命中缓存时,Luna 每轮光上下文就 2 美分,一万轮就是 200 美元。路由之前先确认 API 的缓存输入档位和命中率。
  3. 全员 Sol:团队习惯性把复杂任务默认给旗舰模型,账单按 25 倍跑。先用 Terra 跑通、用测试兜底,只有测试证明 Terra 不够才升级。

验收清单(部署前逐条勾):

  • 每个调用点标注了预期模型档位,而不是全局默认
  • 重试有上限、退避和降级路径
  • 输入/输出 token 有埋点,月账单可以按任务类型拆分
  • 批量任务先在小样本上对比 Luna 与 Terra 的质量差异
  • 缓存命中率进入监控指标,低于阈值报警

杰文斯悖论:单价下降为什么会让总需求上升

接下来是产业层面。摩根士丹利 8 月 3 日发布报告《开放权重模型与三种未来情景》,核心观点是:开放权重模型不会削弱 AI 算力需求,反而可能推高总需求。这正是不懂经济学的人容易反直觉的地方——杰文斯悖论:19 世纪经济学家威廉·斯坦利·杰文斯发现,瓦特改良蒸汽机让煤炭效率大幅提升后,煤炭总消耗不降反升,因为更便宜的能源催生了更多用途。

同样的逻辑套在 token 上:单次推理变便宜,企业会把 AI 塞进更多任务——日志分类、客服首响、代码预检、数据清洗、边缘设备——每个新用途都产生新的 token 和算力需求。摩根士丹利特别强调两点:开放权重不等于开源(许可证和再分发规则完全不同),开放权重也不等于免费(运行它仍需 GPU、电力和运维)。所以“开源模型便宜 → 闭源完蛋”是错误推论;更准确的推论是“便宜 → 普及 → 总用量上升”。

同期的数字在互相印证:微软、亚马逊、谷歌、Meta 四家 2026 年合计 AI 基础设施投入约 7000 亿美元;中信证券 8 月 4 日也判断开源模型能力提升带来“智能平权”和“Token 平价”。DeepSeek V4-Flash 免费、Meta Muse Code 贡献者档输出 0.2 美元/百万 token——闭源厂商的降价不是慈善,是在给整个市场“以价换量”,赌的是杰文斯悖论在自己这边成立。

对程序员的两条判断

第一条:模型路由会成为新的基本功。 就像早年开发要懂缓存和索引一样,现在每个 AI 功能上线前都要回答“为什么用这个模型、贵在哪、错了会怎样”。这不是选型洁癖,是成本工程。

第二条:别因为单价降了就放松用量管理。 杰文斯悖论的工程版是:token 便宜到一定程度,团队会忍不住把一切任务都交给 LLM,然后总账单和延迟预算一起失控。降价放大了“用量管理”的重要性,而不是取消了它。架构上值得做的动作是:给模型调用加配额、把批量任务和交互任务分流、让便宜模型成为默认、让贵模型成为例外。

观察点放在三件事上:Sol 维持原价但新增 2.5x Fast 模式,说明高端推理和低延迟需求仍然稀缺;开放权重模型的“Token 平价”会继续挤压闭源入门档;以及——当 Luna 和 DeepSeek V4-Flash 都便宜到可以忽略单价时,真正决定账单的变量就只剩缓存命中率和重试次数了。

打开原图 ↗