技术热点透视20260911:编程模型杀进「性价比」时代
古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

2026 年 9 月 10 日,Cognition 发布了新的编程模型 SWE-2,一同发布的还有一件更值得琢磨的事:它没有价目表。这家做出 Devin 的公司既没有开放独立 API,也没有放出权重,而是把模型直接塞进了 Devin 的订阅里——每月 20 美元起的 Pro+ 可以无限使用 SWE-2,当月的 Pro 用户还能拿到免费额度。过去两年,编程模型领域的竞争一直是同一套叙事:谁在基准上多出两三个点,谁就更聪明,谁就配得上更高的每百万 token 单价。SWE-2 换了一个问题来问,它不再争「最聪明」,而是争「在离前沿只差一点点的前提下,谁更便宜」。如果这句话成立,接下来一年整个赛道的定价方式都得重写。
01发生了什么:SWE-2 到底是什么
SWE-2 的底座不是 Cognition 自研的,而是月之暗面(Moonshot AI)的 Kimi K3——一个 2.8 万亿参数、开源权重的中国模型。Cognition 在它之上做后训练(post-training),按官方说法,这是第一次有人把强化学习真正扩展到万亿参数级别的底座上。
训练过程里,单次 RL 同时覆盖 medium、high、max 三档推理努力(effort)级别,而不是分三次训出三个模型。工程侧配套了 NVFP4/FP8 的量化感知内核、用于提升吞吐的在线 draft 模型,训练环境数量翻了三倍,其中还加入了指令跟随覆盖和专门对抗旧 checkpoint 的自动验证器。
把这些细节摆在一起看,它不是一次「换个开源底座蹭一波」的投机,而是围绕成本和稳定性重做的一整条训练管线——尤其是那个「对抗旧 checkpoint 的自动验证器」,这是吃过能力回退的亏的团队才会写进方案里的东西。
分发方式同样反常:不卖独立 API、不放权重,只捆绑进 Devin 订阅。这意味着 Cognition 要的不是 token 调用费,而是订阅留存和高频使用。
02数字里的「性价比」:离前沿多远,便宜多少
Cognition 自报的成绩单是这样的(均为官方数据,待独立复现):
- FrontierCode 1.1 Main:SWE-2 = 50.0%;Fable 5.1 = 50.9%;GPT-6 Astra = 53.3%;再往下是 Grok 4.6 的 48.0%、GPT-5.6 Sol 的 47.5%、Kimi K3 的 44.2%,以及自家上一代 SWE-1.7 的 42.0%。
- DeepSWE 1.1:SWE-2 = 73.0%,高于 Kimi K3 的 68.5% 和 Sol 的 72.7%,略低于 Astra 的 74.1%。
- Terminal-Bench 2.1:SWE-2 = 92.8%,是全场最高,超过 Fable 5.1 的 91.4% 和 Astra 的 89.9%。
- Terminal-Bench 4.0(更难的长程 agentic 任务):SWE-2 = 27.3%,而 Fable 5.1 = 55.8%、Astra = 57.9%。
换算成性价比口径:SWE-2 距 Fable 5.1 只差 0.9 分,成本却低约 64%;距 Astra 差 3.3 分,成本大约只有四分之一。
SWE-2 落在帕累托前沿的左上角:便宜且接近前沿,但在最难的长程任务上仍有代差
效率侧的变化更陡:medium 档平均 53 步,而 SWE-1.7 是 127 步,步数少 58%、成本降 81%;从接手任务到第一次真正改动代码,中位步数从 48 步降到 18 步。这组数字意味着一件事——它不只是便宜,它是靠「少绕路」变便宜的。
但同一份成绩单里,藏着一句必须读的小字。在 Terminal-Bench 4.0 上,SWE-2 只有 27.3%,而 Fable/Astra 约 56。这不是差一点,是差了一倍多。50.0 对 53.3 看起来只是 3.3 分的距离,27.3 对 55.8 才是真实的能力断层:前者衡量「能不能把常规任务做对」,后者衡量「能不能在一个需要连续跑几十分钟、中途靠自己发现偏航并纠回来的任务里不迷路」。只看 FrontierCode 那一栏就下单的团队,会买到一个跟自己预期不符的东西。
03真正的拐点:护城河从「预训练」挪到了「后训练 + harness」
即便如此,SWE-2 依然是这两年编程模型领域信号意义最强的一次发布,因为它把护城河的位置挪走了。
Cognition 是一家两百人量级的公司,没有自己的预训练底座,用的是一个开源权重的中国模型,然后靠后训练把 Kimi K3 的 44.2% 推到 50.0%,同时把单次任务的成本压到前沿模型的三分之一上下。「谁拥有最好的模型」这个问题正在失效,取而代之的是「谁拥有最好的 loop」——后训练的 RL 配方、托住模型的 harness、以及真实用户任务回流构成的数据飞轮。
护城河转移:商品化的底座之外,真正决定交付价值的是后训练、harness 与数据飞轮
所谓「harness 才是新的编程单位」,说的就是这件事:模型的理论上限由底座决定,但它在你的产品里实际交付多少价值,由套在它外面那一层决定;而那一层的差距,恰恰是 44.2 到 50.0 这 5.8 分。Cognition 能同时调度三档努力级别、能用自动验证器去对抗自己上一版 checkpoint 的退步、能把训练环境铺到三倍规模,这些能力既读不进模型卡,也不写在参数表里。
04成本惩罚式 RL:竞争进入「帕累托前沿」阶段
最能说明竞争阶段变化的,是它的奖励函数设计。SWE-2 的训练目标是 R = S − λ·C,其中 S 是任务成功率,C 是运行时与 API 的综合成本,λ 则随底座在该努力级别上的帕累托前沿切线斜率来缩放。翻译成人话:模型不只因为「做对了」得分,还要为「做得省」负责,而这个「省」的尺度不是拍脑袋定的,是从当前前沿的成本—效果曲线上量出来的。
当一个团队开始用帕累托前沿的切线斜率设定训练超参,说明它已经接受天花板短期内摸不到,转而经营那条曲线本身的形状。这是工程上的成熟信号:行业从「追 ceiling」进入「追前沿的形状」,而形状是可以被工程优化、可以被复用的。
05一条产品逻辑:不卖 API,卖订阅
分发方式同样是判断的一部分。不卖独立 API、不放权重,只捆绑进 Devin 订阅,意味着 Cognition 要的不是 token 调用费,而是订阅留存和高频使用。这和 OpenAI 把 Astra 连同工具链一起推向终端是同一个动作的两个版本:模型厂自己做工具,工具商被迫自建模型能力,中间那层靠信息差吃饭的独立「套壳」生意被两头挤压。
对 Cognition 而言,SWE-2 的低价不是让利,而是获客成本——用每月 20 美元换一个天天在用编程 agent 的用户,比按 token 卖给他更划算,前提是成本真的降得下来。所以那组「步数少 58%、成本降 81%」不是商业模型的副产品,而是商业模型得以成立的地基。
06冷思考:别被 50.0% 骗了
冷水也该泼。以上所有数字都是 Cognition 自报,尚无独立复现;由于不提供独立 API 与公开价目表,所谓「便宜 64%」「成本约四分之一」是拿自家系统与竞品 API 价格做的相对换算,不是一张能照着采购的报价单——基准的运行配置、批量折扣、缓存命中率任何一项变动,都会让这个比例漂移。
更关键的是 Terminal-Bench 4.0 那 28.5 分的落差:在最难的长程任务上,前沿依然领先,而且领先得不体面。便宜能买到的是「把八十分的任务做得同样好、成本低得多」,买不到的是「把最难那一类任务做出来」。对大多数团队来说前者已经足够,但如果你指望 agent 独立扛下跨仓库、跨会话的大型重构,SWE-2 现在还不是那个答案——它把性价比的天花板抬高了,没有把能力的天花板抬到同一高度。
编程模型的竞争已经从「谁更聪明」翻篇到「在离前沿足够近的地方谁更便宜」,而便宜这件事本身,正在从一种模型能力变成一种工程能力。
其他动态
- DeepSeek 发布 V4.1 Flash:552B 非对称 CED 架构,输入侧仅激活 8B、输出侧 16B,KV Cache 降至上一代的 1/4,缓存命中价 0.02 元/百万 token(降幅 60%),V4 Pro 将于 9 月 14 日下线。
- OpenAI 推出 Agents API 公测:把沙箱、工具调用与环境隔离打包成标准化 API,云端智能体的基础设施层开始收敛。
- 宇树科技开源 UnifoLM-WLA-1.0 通用人形机器人基座模型:6B 参数、约 2500 小时真机数据,单模型统筹 64 个任务(10 全身移动 + 54 桌面),具备跨末端执行器泛化能力。
- 高德发布 ABot-Earth 0.7:称全球首个 3D 原生城市世界模型,消费级 GPU 上约 10 分钟可生成公里级 3D 城市。
- 甲骨文与 OpenAI 签下约 5 年、3000 亿美元算力采购协议;受此推动,甲骨文 RPO 达 4550 亿美元,同比增长 359%。
- 蚂蚁灵波开源 LingBot-World 2.0 三款模型(最小 1.3B 可单卡运行);面壁智能 MiniCPM5-2B 登上 Hugging Face Trending 榜首。
- Atlassian 发布 agentic engineering 系统:在 Jira 与 DX 侧推出 Code Context、Agent loops、AI Review、DX for Agentic Development 等能力。
- 乐聚联合安徽电信、华为发布全国首个 5G-A 具身智能套餐「具身翼联」,把机器人接入运营商网络资费体系。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。