Anthropic 发布 Claude Fable 5.1 防蒸馏大模型:跑分翻倍缓存降价75%

Ai资讯1小时前发布 大国Ai
19 0 0

摘要

2026年9月2日,Anthropic 正式发布旗舰大模型 Claude Fable 5.1 与 Mythos 5.1。新模型在 Agentic 科研、编程、知识推理、Computer Use 等几乎所有核心基准测试中拿下第一,其中 Terminal-Bench-Science 成绩较上一代翻倍。与此同时,Fable 5.1 引入 Preserved Thinking 机制,对思考块(thinking block)实施防蒸馏保护,缓存读取费用大幅下调75%,复杂 Agent 任务综合成本最高可节省45%。本文将从跑分数据、防蒸馏机制、价格变化三个维度,带你全面看懂这次重磅更新。

一、Fable 5.1 是什么:一次“代际式”的小版本升级

尽管命名上只是从 5 到 5.1,但从各项评测数据看,这次升级的幅度更像是一次代际跨越。在 SWE-bench Pro 上,Fable 5.1 拿到 81.2 分,超越 Opus 5 的 79.2 和 GPT-5.6 Sol 的 64.6。有分析认为,此次发布正值 Anthropic IPO 前夕,是一套精心打出的产品组合拳。

Anthropic 发布 Claude Fable 5.1 防蒸馏大模型:跑分翻倍缓存降价75%

模型本身支持 1M tokens 上下文窗口、128K 最大输出,具备扩展思考、视觉理解、结构化输出、PDF 输入、代码执行与引用等能力。

二、核心跑分:几乎全线第一,科研能力翻倍

Agentic 科研:断层式领先

Terminal-Bench-Science 0.1 上,Fable 5.1 拿到 52.6%,而 Fable 5 只有 24.7%、Opus 5 为 29.0%、GPT-5.6 Sol 仅 22.4%——比自家上一代翻了一倍多,是 GPT-5.6 Sol 的两倍以上。海外评测也以“Science Score 翻倍”来概括这一突破。

Agentic 编程

Terminal-Bench 4.0 上,Fable 5.1 达到 56%(Mythos 5.1 可到 61%),Opus 5 为 52.3%,GPT-5.6 Sol 只有 37.3%。CursorBench 3.2.0 上同样以 73.4% 排名第一。

知识工作与推理

GDPval-AA v2 上 Fable 5.1 拿到 1853 分,Opus 5 为 1824,GPT-5.6 Sol 垫底(1711)。Humanity’s Last Exam 上,无工具 60.9%、有工具 65.0%,两项均为最高。

Computer Use 与业务流程自动化

OSWorld 2.0 上,Fable 5.1 的 partial/strict 得分为 77.9/41.7,两项均领先 Opus 5(75.4/39.6)。业务流程自动化方面,AutomationBench 上拿到 31.4%,几乎是 Fable 5(17.1%)的两倍,断层领先第二名 Opus 5 的 26.9%。

三、防蒸馏机制:思考块“上锁”才是里子

如果说跑分翻倍是“面子”,那么 Preserved Thinking(思考块保护)才是这次发布的“里子”。

为什么要防蒸馏?

此前存在一种公开的模型蒸馏手法:在多轮对话中修改 thinking block 之前的系统提示词、工具和消息,诱导 Claude 将加密的推理过程解密并输出,再拿这些推理数据去训练其他模型,从而在未经授权的情况下复制 Claude 的能力。

Fable 5.1 怎么做?

Fable 5.1 改变了 Messages API 对思考块的处理方式:API 会校验 thinking block 是否在原始上下文中返回,一旦系统提示词、工具或之前的消息被改动,请求将直接报错。开发者也可选择 non-strict 模式,此时不报错,但被修改上下文的思考块会被丢弃,代价是模型看不到自己之前的推理过程。

目前该限制仅针对 2026 年 8 月 31 日之后新创建的 API 账号,老账号暂不受影响,但 Anthropic 表示未来模型会全面执行;Claude Code、Claude Cowork、claude.ai 用户则完全不受影响。此外值得注意的是,Fable 5.1 的水印机制被指存在开发者不能忽视的盲区。实测中也有开发者遇到了 “The Block Is Bound to a Different Conversation” 相关报错及应对方案讨论。

四、价格:缓存读取降价75%,复杂 Agent 任务最高省45%

Fable 5.1 模型单价维持不变,但缓存读取费用大幅下调75%。对于上下文动辄数十万 token 的复杂 Agent 任务,综合成本最高可降低45%。业内普遍认为,缓存降价叠加上涨的 Agent 能力,将进一步拉低企业级智能体应用的部署门槛。

五、总结

Claude Fable 5.1 用“跑分翻倍 + 缓存降价75% + 防蒸馏上锁”三件事,同时回应了能力、成本和商业护城河三个层面的竞争:对开发者而言是更强的 Agent 能力和更低的调用成本,对 Anthropic 自身而言则是在 IPO 前夕强化技术资产保护的关键一步。至于实际体验如何——有实测称其写作和对话“和真人没区别”,不妨亲自上手验证。

© 版权声明

相关文章

暂无评论

none
暂无评论...