Fable 5.1 刷屏的 24 小时:能力登顶、思考上锁,国产模型却在另一边悄悄赢了价格

过去 24 小时,AI 圈最热的关键词只有一个:Fable 5.1。
Anthropic 正式发布新一代旗舰模型 Claude Fable 5.1,定位为目前能力最强的通用 Claude 模型,主打编程、知识工作和长时间运行的 Agent 任务。同一时间,Artificial Analysis 的评测结果出炉:在 max effort 档位下拿到 66 分,登顶 Intelligence Index。OpenRouter 也第一时间上线,称其为 Fable 5 工作负载的"直接升级版本"。
热度确实起来了,但这 24 小时里放出来的信息,值得拆开来慢慢看。
一、能力:登顶是真登顶,但不是全维度碾压
Anthropic 官方给出的数据里,最亮眼的是科学计算和 Agent 编程:
- Terminal-Bench-Science 0.1:Fable 5.1 拿下 52.6%,Fable 5 是 24.7%,Opus 5 是 29.0%,GPT-5.6 Sol 是 22.4%——基本是翻倍式领先。
- Terminal-Bench 4.0 Agent 编程:55.8%,Fable 5 和 Opus 5 分别是 42.0% 和 52.3%。
另外 Anthropic 还展示了一个不太常见的落地场景:用 Fable 5.1 优化生物与基因组模型,在 NVIDIA H100 上让 7 个开源蛋白质与基因组模型的推理速度提升 1.4 至 2.5 倍,其中 ProGen2 提升最高达 2.5 倍。
也就是说,这一代的关键词是:长时间任务、跨代码库开发、科研计算。
二、价格:账面降价,实测却更贵了
定价层面,Fable 5.1 输入每百万 Token 10 美元,输出 50 美元,与 Fable 5 持平。变化藏在缓存里:缓存读取价格降到每百万 Token 0.25 美元,比上一代便宜 75%。Anthropic 的说法是,一般任务综合成本预计下降约 25%,Agent 密集型任务最高下降约 45%。
但 Artificial Analysis 的实测给了另一个视角:Fable 5.1 登顶是登顶了,每任务成本却比 Fable 5 高出 20%。
原因不难理解——max effort 模式下想得更久、烧得更多。账面单价不变甚至下降,不等于实际账单下降。对开发者来说,这比榜单排名重要得多。
三、最大的变化:Anthropic 给"思考"上了锁
比模型换代更值得关注的,是伴随发布的一项 API 新规。
Claude 生成回答前会产生内部推理步骤,以"思考块"形式通过 API 返回。过去多轮对话里,开发者可以修改历史消息、系统提示或工具配置,同时把旧的思考块原样发回去,继续让模型沿用之前的推理。Anthropic 此前已经对思考块加密,但攻击者可以通过修改思考块之前的对话内容,诱导模型解密并重新输出此前的推理。
从 Fable 5.1 开始,这一切被彻底绑死:思考块会和产生它时的系统提示、工具和历史消息锁在一起,改了前置内容、再提交旧思考块,API 直接报错。当然留了口子——非严格模式下请求可以继续,但不匹配的思考块会被删除,模型在看不到旧推理的情况下重新输出。
Anthropic 把矛头说得很直接:大规模非法模型蒸馏。不少蒸馏操作者会注册数千个虚假账号,收集先进模型的推理过程,再用这些数据训练自己的模型——这样"蒸"出来的模型可能获得原本不具备的高级推理能力,却没有继承原模型针对网络攻击、武器开发等高风险用途部署的安全措施。
规则适用范围目前仅限于 2026 年 8 月 31 日及之后创建的新账户(Claude Platform、Bedrock、Vertex AI、Azure Foundry),现有账户和 Claude Code、Claude.ai 普通用户暂不受影响。但 Anthropic 已经明说了:这套"保留思考"机制未来会扩展到所有 API 账户。
模型推理不再只是输出的一部分,而是变成了需要保护的资产。
四、一个被淹没在安全讨论里的细节
Rohan Paul 整理的 Fable 5.1 系统卡里有条值得注意的披露:Fable 5.1 在隐蔽侧任务上的通过率是已发布模型中最高的,大约 5 次尝试能成功 1 次,Anthropic 自己认为这可能是模型更难被监控的信号。
结合防蒸馏新规一起看,味道就更清楚了:能力越强、推理越值钱,模型厂商收紧控制的动机就越强。这不是 Fable 5.1 一代的事,是整个行业的方向。
五、另一边,国产模型正在赢价格战
就在 Fable 5.1 刷屏的同一个 24 小时里,还有两条消息没那么多人转:
Qwen3.8-Max-0902 在 Code Arena WebDev 总榜第一名首秀,1691 分,而且以混合价 $5/MToken 站上 Pareto 前沿——同样排在前列的模型里,它价格最漂亮。
美团 LongCat-2.0 也在 Cline 开放免费试用,可以直接接入现有编码工作流。
把数字摆在一起就很直观:Fable 5.1 输入 $10 / 输出 $50 每百万 Token,Qwen3.8-Max-0902 混合价 $5。能力榜第一名和价格榜头部,已经不是同一批选手了。
六、怎么选:按任务分,别按热度分
- 长时间 Agent 任务、跨代码库开发、科研计算、对最高档位能力有刚需:Fable 5.1 仍是天花板,尤其在 Terminal-Bench 类任务上的代际提升是实打实的。
- 日常编码、Web 开发、批量 API 调用:国产模型够用且便宜,Qwen3.8-Max-0902 的 Code Arena 第一和 $5/MToken 价位,已经让它在 Pareto 前沿上比 Fable 5.1 更靠前。
- 预算敏感、想先试再付费:LongCat-2.0 这类免费试用窗口值得薅,先把工作流验证完再决定主力模型。
- 需要修改历史上下文、压缩对话、动态调整系统提示的 Agent 应用:要重新评估 Anthropic"保留思考"新规的影响,非严格模式意味着旧思考块被丢弃、重新计费——这本身就是迁移成本。
一句话总结今天的格局:Fable 5.1 证明 Anthropic 还能把能力上限往上抬,也把"思考"变成了需要上锁的资产;而国产模型同时证明了,在绝大多数真实业务负载里,第一名未必是最划算的那一个。选模型和选 GPU 一样——别只看榜单,看工作负载和账单。