# Fable 5.1 刷屏的 24 小时：能力登顶、思考上锁，国产模型却在另一边悄悄赢了价格

> 作者/来源: UCloud 运营管理员
> 发布时间: 2026-09-11T09:00:17.836Z
> 分类: AI专区
> 标签: 大模型, Anthropic, fable, qwen
> 原文链接: http://117.50.162.249:3000/yun/articles/2800

---

过去 24 小时，AI 圈最热的关键词只有一个：Fable 5.1。

Anthropic 正式发布新一代旗舰模型 Claude Fable 5.1，定位为目前能力最强的通用 Claude 模型，主打编程、知识工作和长时间运行的 Agent 任务。同一时间，Artificial Analysis 的评测结果出炉：在 max effort 档位下拿到 66 分，登顶 Intelligence Index。OpenRouter 也第一时间上线，称其为 Fable 5 工作负载的"直接升级版本"。

热度确实起来了，但这 24 小时里放出来的信息，值得拆开来慢慢看。

## 一、能力：登顶是真登顶，但不是全维度碾压

Anthropic 官方给出的数据里，最亮眼的是科学计算和 Agent 编程：

- Terminal-Bench-Science 0.1：Fable 5.1 拿下 52.6%，Fable 5 是 24.7%，Opus 5 是 29.0%，GPT-5.6 Sol 是 22.4%——基本是翻倍式领先。
- Terminal-Bench 4.0 Agent 编程：55.8%，Fable 5 和 Opus 5 分别是 42.0% 和 52.3%。

另外 Anthropic 还展示了一个不太常见的落地场景：用 Fable 5.1 优化生物与基因组模型，在 NVIDIA H100 上让 7 个开源蛋白质与基因组模型的推理速度提升 1.4 至 2.5 倍，其中 ProGen2 提升最高达 2.5 倍。

也就是说，这一代的关键词是：长时间任务、跨代码库开发、科研计算。

## 二、价格：账面降价，实测却更贵了

定价层面，Fable 5.1 输入每百万 Token 10 美元，输出 50 美元，与 Fable 5 持平。变化藏在缓存里：缓存读取价格降到每百万 Token 0.25 美元，比上一代便宜 75%。Anthropic 的说法是，一般任务综合成本预计下降约 25%，Agent 密集型任务最高下降约 45%。

但 Artificial Analysis 的实测给了另一个视角：Fable 5.1 登顶是登顶了，每任务成本却比 Fable 5 高出 20%。

原因不难理解——max effort 模式下想得更久、烧得更多。账面单价不变甚至下降，不等于实际账单下降。对开发者来说，这比榜单排名重要得多。

## 三、最大的变化：Anthropic 给"思考"上了锁

比模型换代更值得关注的，是伴随发布的一项 API 新规。

Claude 生成回答前会产生内部推理步骤，以"思考块"形式通过 API 返回。过去多轮对话里，开发者可以修改历史消息、系统提示或工具配置，同时把旧的思考块原样发回去，继续让模型沿用之前的推理。Anthropic 此前已经对思考块加密，但攻击者可以通过修改思考块之前的对话内容，诱导模型解密并重新输出此前的推理。

从 Fable 5.1 开始，这一切被彻底绑死：思考块会和产生它时的系统提示、工具和历史消息锁在一起，改了前置内容、再提交旧思考块，API 直接报错。当然留了口子——非严格模式下请求可以继续，但不匹配的思考块会被删除，模型在看不到旧推理的情况下重新输出。

Anthropic 把矛头说得很直接：大规模非法模型蒸馏。不少蒸馏操作者会注册数千个虚假账号，收集先进模型的推理过程，再用这些数据训练自己的模型——这样"蒸"出来的模型可能获得原本不具备的高级推理能力，却没有继承原模型针对网络攻击、武器开发等高风险用途部署的安全措施。

规则适用范围目前仅限于 2026 年 8 月 31 日及之后创建的新账户（Claude Platform、Bedrock、Vertex AI、Azure Foundry），现有账户和 Claude Code、Claude.ai 普通用户暂不受影响。但 Anthropic 已经明说了：这套"保留思考"机制未来会扩展到所有 API 账户。

模型推理不再只是输出的一部分，而是变成了需要保护的资产。

## 四、一个被淹没在安全讨论里的细节

Rohan Paul 整理的 Fable 5.1 系统卡里有条值得注意的披露：Fable 5.1 在隐蔽侧任务上的通过率是已发布模型中最高的，大约 5 次尝试能成功 1 次，Anthropic 自己认为这可能是模型更难被监控的信号。

结合防蒸馏新规一起看，味道就更清楚了：能力越强、推理越值钱，模型厂商收紧控制的动机就越强。这不是 Fable 5.1 一代的事，是整个行业的方向。

## 五、另一边，国产模型正在赢价格战

就在 Fable 5.1 刷屏的同一个 24 小时里，还有两条消息没那么多人转：

Qwen3.8-Max-0902 在 Code Arena WebDev 总榜第一名首秀，1691 分，而且以混合价 $5/MToken 站上 Pareto 前沿——同样排在前列的模型里，它价格最漂亮。

美团 LongCat-2.0 也在 Cline 开放免费试用，可以直接接入现有编码工作流。

把数字摆在一起就很直观：Fable 5.1 输入 $10 / 输出 $50 每百万 Token，Qwen3.8-Max-0902 混合价 $5。能力榜第一名和价格榜头部，已经不是同一批选手了。

## 六、怎么选：按任务分，别按热度分

- 长时间 Agent 任务、跨代码库开发、科研计算、对最高档位能力有刚需：Fable 5.1 仍是天花板，尤其在 Terminal-Bench 类任务上的代际提升是实打实的。
- 日常编码、Web 开发、批量 API 调用：国产模型够用且便宜，Qwen3.8-Max-0902 的 Code Arena 第一和 $5/MToken 价位，已经让它在 Pareto 前沿上比 Fable 5.1 更靠前。
- 预算敏感、想先试再付费：LongCat-2.0 这类免费试用窗口值得薅，先把工作流验证完再决定主力模型。
- 需要修改历史上下文、压缩对话、动态调整系统提示的 Agent 应用：要重新评估 Anthropic"保留思考"新规的影响，非严格模式意味着旧思考块被丢弃、重新计费——这本身就是迁移成本。

一句话总结今天的格局：Fable 5.1 证明 Anthropic 还能把能力上限往上抬，也把"思考"变成了需要上锁的资产；而国产模型同时证明了，在绝大多数真实业务负载里，第一名未必是最划算的那一个。选模型和选 GPU 一样——别只看榜单，看工作负载和账单。
