Claude Fable 5.1发布:AI亲自做科学,缓存价格直降75%

Ai资讯1小时前发布 大国Ai
11 0 0

摘要

2026年9月2日,Anthropic正式发布Claude Fable 5.1Claude Mythos 5.1双模型。Fable 5.1全平台上线,编程能力刷新CursorBench 3.2纪录至73.4%;Mythos 5.1则以白名单形式专供网络安全与生命科学团队。新模型不仅在科研基准Terminal-Bench-Science上实现翻倍式提升,还在真实案例中重绘金星地形图、设计蛋白命中率逼近50%、手写GPU Kernel让基因组分析成本从1.8万美元砍至8千美元。同时,缓存读取价格从每百万Token 1美元降至0.25美元,降幅高达75%。本文将从跑分、真实科研案例、编程能力、安全策略四大维度,全面解析这代模型为何被称为“神话级”升级。

一、双模型齐发:一个开放,一个锁进白名单

9月2日,Anthropic官方宣布Claude Fable 5.1和Claude Mythos 5.1同时上线。两者被官方定义为“世界上最先进的用于编程和知识工作的模型”。

Claude Fable 5.1发布:AI亲自做科学,缓存价格直降75%

定位上有明确分工:Claude Fable 5.1面向全平台开放,人人可用;而战力全开的Claude Mythos 5.1则被锁在白名单内,只对经过审核的网络安全与生命科学团队开放。从重构复杂工程代码,到攻坚高维科研长战线任务,这对“孪生大脑”瞄准的是过去人类专家都感到棘手的长链路复杂任务。

二、跑分断层式领先:各项基准全面碾压

先看成绩单。与上一代Fable 5、Opus 5以及OpenAI的GPT-5.6 Sol相比,Fable 5.1的跑分拉出了断层式代差。

科研探索:在Agentic scientific research基准Terminal-Bench-Science 0.1上,Fable 5.1拿下52.6%,而上一代Fable 5只有24.7%,GPT-5.6 Sol仅22.4%,直接实现翻倍。

代码工程:在Terminal-Bench 4.0上,Fable 5.1从前代的42.0%飙升至55.8%;放开护栏的Mythos 5.1更是推到惊人的60.9%。

知识工作:在GDPval-AA v2基准中获得1853分,超过Opus 5的1824分。

综合认知:在被称为“人类最后的考试”的Humanity’s Last Exam上,不带工具得分60.9%,带工具实测跨过65.0%门槛。

电脑操作:OSWorld 2.0上strict口径得分41.7%,同样领先所有对手。

商业工作流:AutomationBench成绩跃升至31.4%,相比前代17.1%几乎翻倍。

真实IDE编码:CursorBench 3.2.0上以73.4%刷新内部纪录。

值得注意的是,哪怕把思考程度调至最低,Fable 5.1照样能以极低的Token消耗跑出超越前代的效果——能力跃迁与成本下降同时发生。

三、价格大幅下调:缓存读取直降75%

跑分之外,这次真正引爆讨论的是定价策略。

Fable 5.1基础定价与上一代持平:输入每百万Token 10美元,输出50美元。但在最吃资源的缓存读取上,价格直接从1美元砍到0.25美元,降幅高达75%。

放到真实任务中:普通场景总成本能降约25%;对于重度跑Agent的长战线任务,最高能省下45%。

作为对比,GPT-5.6 Sol目前的短上下文促销价为输入2美元、输出10美元、缓存0.2美元。业内开发者Matt Shumer评价称:Fable 5.1的降价让它的定价更接近GPT-5.6 Sol,同时却是一个能力更强的模型。

四、AI亲自下场做科学:三个前沿真实案例

跑分只是表象,真正的分水岭在于——从这一代开始,AI彻底褪去辅助工具的外衣,开始亲自做科学了。Anthropic直接展示了三个前沿案例。

案例一:重绘三分之一个金星

30多年前,NASA的麦哲伦号给金星拍过一轮雷达,但高程数据分辨率只有10-20公里——换算到地球上,相当于一整座城市只占几个像素。过去人类只完成了其中五分之一区域的高程图。

Fable 5.1拿着这批数据训练了一个神经网络,重新生成了覆盖金星约三分之一面积的高分辨率地形图,细节推进到2至3公里,高度估计准确性最高提升25%。

案例二:蛋白质设计命中率逼近50%

现代药物的原理之一,是设计一个小蛋白精准锁定体内靶点。结合亲和力越高,药物低剂量见效的可能性越大。

Mythos 5.1调用开源设计工具后,其设计稿被送往外部机构做真实湿实验。结果是目前测过的最强一档:在EGFR、Nipah G等三个靶点上,亲和力直接达到Adaptyv Bio竞赛最佳方案的10倍;在12个靶点上的总体命中率逼近50%——要知道,该领域的常态命中率仅有一成到一成半。在15-PGDH靶点上,抑制它在临床前研究中已被证明可促进组织修复和肌肉再生。

案例三:手写GPU Kernel,成本砍半

基因组和蛋白质研究经常要在GPU上重复运行深度学习模型,一次全基因组分析可能执行成千上万次推理,单次慢一点,累计成本迅速放大。给这类模型手写GPU Kernel,通常是顶尖性能工程师数周的工作量,学术实验室往往请不起。

Mythos 5.1只拿着公开源代码,几天内就为7个开源生物模型(包括ChromBPNet、Enformer、Evo 2等)手写了GPU Kernel,在NVIDIA H100上速度最高提升2.5倍,且输出结果与原版完全一致。换算成账单:一项扫三百万个变异的分析,用Evo 2大模型跑,成本从1.8万美元直接砍到8千美元。

五、全球最强编程AI:长链路任务的完整交付

Fable 5.1能亲自做科学,底气源自极其硬核的代码逻辑。现在Agent不怕写代码,怕的是跑数小时、调用几十个工具后忘了最初目标,或报错后摸不到病根。

Fable 5.1强化的正是一条完整的动作闭环:读取仓库文档→拆解任务→执行修改→运行测试→检查结果→定位失败→继续下一轮。用Anthropic的话说,它在遇到障碍时会明确指出卡在哪里,极少走“看似完成、实则留下隐患”的捷径。

一个典型案例:它帮对冲基金Millennium解决了一个潜伏四五年的天坑Bug——面对百万次一崩的幽灵报错,一路追到外部依赖、反汇编了第三方库,把别人地盘里的病根连根拔起,真正做到了长链路任务的“一次完整交付”。

上线后第一波实测同样亮眼:Anthropic研究员Alex Albert丢给它一张地皮照片,它能自主完成房屋设计、高质量渲染,甚至生成电影级漫游导览;还能手搓全交互式人脑模型,用代码精准复刻大脑皮层沟回;生成ARC生存游戏也是一把过。与GPT-5.6 Sol的对比测试中(同提示词一次性输出,Fable花费5.69美元,Sol仅0.88美元),Fable更追求写实,海浪与景深更逼真;Sol则风格简洁且始终如一,各有千秋。

六、安全策略一松一紧:能挖漏洞,拒绝蒸馏

Anthropic这次在安全上的动作,主打“一松一紧”。

,是护栏不再“神经质”。以前程序员用Claude审自家代码常被误判为黑客,现在Fable 5.1放开权限允许识别代码漏洞,网络安全误报直接降了六成。但底线依然卡死:只能找漏洞,绝不许写利用漏洞的攻击代码,渗透测试等高危操作仍需交给管得更严的Opus。

,则是“反蒸馏机制”。为堵死多轮对话中修改上下文、套取Claude思维链的路子,Fable 5.1在API底层上了锁:只要提交的提示词与生成思维块时不一致,API要么直接报错拦截,要么把整个思维块全部抽走。该机制先对8月31日之后注册的API新账号生效,未来所有新模型将强制全员生效。

结语

硅谷顶尖研究者曾反复提及一个愿景:AI最大的价值,是把几十年的生物医学与基础科学进程压缩到几年之内。从重绘金星地图,到蛋白命中率翻上数倍,再到手搓GPU Kernel改写科研算力账单,Claude Fable 5.1和Mythos 5.1正在让这个预言变成现实。科学发现的门槛正肉眼可见地往下塌——只是别忘了,那只递出火种的手,也在同一时刻用“反蒸馏”悄悄抽走了身后的梯子。


参考资料:Anthropic官方发布页

© 版权声明

相关文章

暂无评论

none
暂无评论...