如果你昨天睡得早,今天醒来可能会觉得 AI 圈换了个世界。一觉之间,OpenAI 和 Anthropic 同时把中端模型的价格砍了一半还多,GitHub 又讲了一个一个人加一群 agent 重写八十万行代码的故事。今天的简报只讲这三件事,外加一条轻松的花边。信息很多,但值得记住的判断其实就几句。
OpenAI 发布 GPT-6 Sol 和 Luna,中端价格直接腰斩
先看原始信息。OpenAI 在官方公告里介绍了 GPT-6 家族的两位新成员。Sol 定位专业工作主力,API 价格为每百万 token 输入 2 美元、输出 10 美元;Luna 定位轻量高频场景,输入 0.10 美元、输出 0.50 美元。两者相比 GPT-5.6 同位模型的促销价,一律便宜 50%。
翻译成人话,就是过去你花 4 美元才能买到的输入能力,现在 2 美元就够,而最便宜的 Luna 输出价格已经压到 0.50 美元。这个价位意味着大量过去"用不起"的场景,比如全量邮件摘要、每条客服工单都过一遍模型、给每个用户实时生成个性化内容,现在都可以敞开算了。
最能说明问题的是 OpenAI 贴出的对比数据。在 Zapier 的 AutomationBench 业务流测试里,GPT-6 Sol 开到 xhigh 档拿到 33.2% 的得分,单个任务成本 0.27 美元;Claude Opus 5 开到 max 档只有 26.9%,成本是 Sol 的 11 倍多。在覆盖 55 个行业的 Agents' Last Exam 评测里,Sol 的成绩也压过了 Opus 5 的历史最高分,而成本低 60%。
我的判断是,这不是一次普通的版本迭代,而是 OpenAI 在主动定义中端市场的游戏规则。推理成本降下来之后,它选择把省下的钱直接换成价格优势,用"同价位碾压你,高价位便宜十倍"的方式挤压所有竞品的腰部产品线。对整个行业来说,模型层的毛利率正在被重新定价。
对 opcpay.org 的读者来说,如果你在做一个重度依赖模型调用的产品,这周是重新算账的好时机。把产品里每个 AI 功能的 token 消耗拉出来,按新价格重跑一遍单位经济模型,很多之前算不过来的功能,现在可能已经悄悄扭亏了。反过来,如果你的竞对先完成这轮重算,价格战的主动权就在他手里。
Anthropic 回应,Claude Opus 5.5 用便宜 40% 的价格对齐旗舰性能
Anthropic 也没闲着。Claude Opus 5.5 是 Claude 5.5 家族的第一个模型,官方说法是它在大多数工作上已经达到 Fable 5.1 的水平,而典型负载的运行成本比 Opus 5 低 40%。
具体拆开看几个数字。输入输出定价为每百万 token 4 美元和 20 美元,比 Opus 5 便宜 20%;更关键的是缓存读取只要 0.20 美元,降幅 60%,而缓存读取恰恰是 agent 和编码场景里占比最大的成本项。输出速度也比 Opus 5 快 30% 以上。早期测试者里有人用它一天之内完成了 68 万行代码的迁移,这种量级的工作过去是一个工程团队好几周的活。
还有一个容易被忽略的细节。Opus 5.5 是 Anthropic 发布"放缓前沿"宣言之后的第一个新模型,发布前找了 METR 等外部机构做评估,在他们最全面的对齐审计里拿到了历史最高分。也就是说,Anthropic 在讲一个"更快更便宜,但更安全"的复合故事,安全和成本不再是二选一。
我的判断是,这是对 OpenAI 价格战最体面的一次回应。Anthropic 没有跟进腰斩,而是把降幅集中在缓存这种懂行的人最在意的项目上,同时用安全叙事守住品牌溢价。两家其实在做同一件事,把前沿能力以越来越低的价格摊平到日常工作中。
对你的意义在于选型。如果你的 agent 应用有大量重复上下文,Opus 5.5 的缓存定价可能比表面价格战更实在;如果你的场景是短平快的批处理,Luna 那个 0.50 美元的输出价几乎是为这类负载量身定做的。模型选型正在从"哪个最强"变成"哪个结构最适合我的负载形状",这是今年最值得建立的工程直觉。
GitHub 用 Copilot 重写 Copilot,一个人加 agent 干完八十万行 Rust
这个故事我建议每个做技术决策的人都读一遍原文,Migrating the GitHub Copilot runtime to Rust, using Copilot。
原始事实是这样的。Copilot 的 agent 运行时原本是 TypeScript 写的,跑在 Node.js 上,支撑着 Copilot CLI、桌面应用、VS Code、Visual Studio、Office 全家桶等一长串产品。GitHub 团队用 Copilot 自己动手,把它完全重写成超过 80 万行生产级 Rust 代码。绝大部分代码由 AI agent 写成,拆成 128 个 PR 增量合入,没有停机切换。原本需要一个完整团队一到两年的项目,主要由一名开发者花几个月完成,期间团队其他人还在继续扩展运行时的功能。
我的判断是,这篇文章的分量不在 Rust,而在它第一次用大厂生产环境的真实数据回答了那个所有人都在问的问题,即用 agent 做大规模重写到底划不划算。GitHub 给出的答案是,这种量级的重写在 agent 出现之前在经济上根本不成立,而现在成立了。文中那句"性能提升了数量级"和"回归被快速发现快速修复",几乎是给所有观望重写的技术负责人发了一张许可证。
对读者的意义有两层。一层是务实的,如果你的项目里有一个"早就该重写但一直没人手"的模块,现在重新评估它的时机到了,agent 把这类项目的成本砍掉了一个数量级。另一层是战略的,当重写变得便宜,技术债的定义也在变,敢不敢欠债、欠了债多久还清,这些老问题的答案都在松动。
顺带一提轻松的那条。GPT-6 Astra 破解了一条悬置 21 年的 Enigma 电文,从 2005 年起没人能解开的残留密文,被模型推理撞开了。它不影响你的单位经济模型,但它是那种会让你停下来想一想模型能力边界到底在哪的新闻。
今天的密度确实罕见。三家大厂在同一天围绕"更便宜的能力"出牌,把价格战从旗舰市场烧到了中端,又用一篇工程长文证明了便宜下来的能力能兑换成什么。如果你只能从今天带走一句话,我会说是这句,模型价格每降一半,就有一批原本不成立的 AI 产品成立,先重算账的人先拿到这波红利。