Claude Opus 5 没有降价,客户开始决定每任务成本

同样是每百万 token 输入 5 美元,为什么 Shopify 觉得便宜、Spotify 觉得不值?

分享
四角铆死的深靛蓝价格牌上标着 Claude Opus 5 和每百万 token 5/25 美元,牌下轨道上一枚琥珀色 effort 滑块把身后一排单任务成本方块逐级推高,示意标价不动而每任务成本由客户决定

Editor's Note

从 Fable 5 免费访问额度原定到期,到新订阅政策正式生效,Anthropic 用 13 天调整了三次安排。几天后发布的 Opus 5,基础单价一个数字没动。两个动作放在一起,比一次直接降价透露得更多。

按 Artificial Analysis 7 月的 Intelligence Index 加权口径,DeepSeek V4 Flash 平均每项评测任务的成本约为 2 美分,Claude Fable 5 约为 2.75 美元,后者约为前者的 138 倍。OpenAI 联合创始人兼总裁 Greg Brockman 已经把竞争焦点概括为「任务性价比」。

价格表仍由卖方制定,一个任务最终烧掉多少 token,却越来越取决于买方如何选择模型、推理档位和路由规则。决定权交出去之后,模型公司的定价权还剩下多少?


美国时间 7 月 7 日,Anthropic 旗舰模型 Fable 5 的免费访问额度原定到期,之后转为按 token 收费,每百万 token 输入 10 美元、输出 50 美元,与开发者 API 同价。WIRED 当时判断,这可能是前沿模型实验室首次面向消费者采用按量计费。

到期前,Anthropic 先把日期推迟到 7 月 12 日,随后再次延长至 7 月 19 日

7 月 18 日,公司改变方案,宣布从 7 月 20 日起把 Fable 5 纳入 Max 和 Team Premium 的常规权益,使用量仍受 50% 周限额约束。Pro 和 Team Standard 用户不能直接从订阅中调用 Fable 5,Anthropic 改为一次性提供 100 美元的使用额度。

从原定到期日到新政策生效,13 天里发生了两次延期和一次政策调整。(文中日期均为美国当地时间。)

美国时间 7 月 24 日,Claude Opus 5 发布。

Opus 5 属于 Anthropic 的主力产品线,API 单价与上一代 Opus 4.8 完全相同,每百万 token 输入 5 美元、输出 25 美元,只有 Fable 5 的一半。按照 Anthropic 公布的测试结果,在编程基准 CursorBench 3.2 上,Opus 5 最高推理档与 Fable 5 的峰值成绩相差不到 0.5%,单任务成本约为后者的一半。它也取代上一代模型,成为 Claude Max 的默认选项。

Anthropic 对 Fable 5 的定位没有变化,仍然推荐它处理「持续数天的自主项目」。变化发生在它周围:面向普通用户的产品中,上面没有更贵的选项,下面却多了一个半价的默认模型。

Anthropic 对几次延期的解释是算力不足。需求难以预测,公司只能分阶段开放,每获得一批新算力,就再延长一次使用期限。它同期与 SpaceX、Amazon 和 Google 签订的算力协议,也指向相同的约束。

算力紧张可以解释日期为什么一改再改,却不能完全解释产品规则为什么这样调整。Anthropic 没有只缩减使用限额,而是把 effort 档位、自动回落规则和速度选项一并交给客户。

其他公司的报价也在朝同一个方向变化。

OpenAI 7 月上旬发布的 GPT-5.6 按价格分成三档:Sol 每百万 token 输入 5 美元、输出 30 美元;Terra 为 2.50 美元和 15 美元;Luna 为 1 美元和 6 美元。

OpenAI 在官方材料中直接比较了成本。按其模拟测算,在 Artificial Analysis Intelligence Index 上,Sol 最高推理档与 Fable 5 的差距不到 1 分,耗时少 61%,估算成本约为后者的一半。在长任务评测 Agents' Last Exam 上,两个低价档以约十六分之一的成本超过 Fable 5。

这些结果来自 OpenAI 自己的测试,但它选择公开比较单任务成本,本身已经说明定价叙事发生了变化。

分档就是一次产品判断。把「够用」和「最好」拆成不同价签,通常比整体降价更划算。

Google 的 Gemini 3.6 Flash 定价为每百万 token 输入 1.50 美元、输出 7.50 美元。按照 Google 公布的数据,它完成同类任务时生成的输出 token 比上一代 Gemini 3.5 Flash 少 17%。Flash 产品线也从未与旗舰模型采用相同价格。

Meta 第一次为 Muse Spark 1.1 开放付费 API,输入和输出价格分别为每百万 token 1.25 美元和 4.25 美元,大约是 OpenAI 与 Anthropic 顶级模型价格的四分之一。

Musk 为 SpaceXAI 的 Grok 4.5 提出的卖点也指向同一组指标:达到 Opus 级别,同时更快、消耗的 token 更少、价格更低。这仍是厂商宣传口径,但比较单位已经从模型单价转向完成任务的总成本。

这些公司都在单价之外,增加了另一种报价方式:完成一项任务究竟要花多少钱。

7 月 22 日,Bloomberg 刊发对 OpenAI 联合创始人兼总裁 Greg Brockman 的采访。他把竞争焦点概括为,如何构建「最高效、最智能、任务性价比最好的模型」。

一旦按完成任务的总花费计算,模型之间的价差会变得非常直接。

Artificial Analysis 的 Intelligence Index 加权口径,DeepSeek V4 Flash 平均完成一项评测任务花费约 2 美分,Claude Fable 5 约为 2.75 美元,后者约为前者的 138 倍。

这里衡量的是一组基准测试的加权平均成本,不能等同于所有真实业务中的同一项任务。但它已经提供了一种新口径:模型能力可以继续比较,客户最终付出的总成本也要单独计算。

对中国采购方,这种变化更加直接。能省下多少钱,越来越少取决于与哪家厂商谈成了什么折扣,更多取决于路由表、模型组合和推理档位如何配置。

🔒 以下为 Dailyio 会员专属内容

与 Opus 5 同时上线的四项能力都没碰基础单价,为什么每一项都会改变最终账单?微软免费拿到 OpenAI 的模型授权,为什么还要自己重做一个?Shopify 禁止工程师使用非前沿模型,Spotify 拒绝开放最新两代 Opus,两套账为什么都能成立?

成为 Dailyio 会员,读完定价权移交的完整机制,以及接下来两个季度该盯住的那个信号。