Fable 5.1发布:科研与编程能力升级
Anthropic 发布 Fable 5.1,重点强化科学研究、终端任务与编程能力,并将缓存读取价格下调 75%。本文梳理其基准成绩、分子设计与模型加速案例,以及金星地形建模和上海地图生成演示。
Anthropic 发布 Fable 5.1,核心变化集中在科学研究、终端任务和编程能力上。官方数据称,新模型在多项基准测试中超过前代,同时将缓存读取价格下调 75%;不过,其输入与输出价格并未调整,部分测试中的综合任务成本也有所上升。

科学研究成为此次更新重点
与以往发布相比,Anthropic 此次更强调模型在科学研究场景中的能力。官方介绍首先展示了 Terminal-Bench-Science,反映出 Fable 5.1 在科研终端任务、数据分析和计算工作流方面的定位。
从公布的数据看,Fable 5.1 在多数任务上取得了比 Fable 5 更高的成绩,并降低了完成任务所需的成本。但在 AA Benchmark 中,新模型的任务成本反而更高,说明基准分数提升并不意味着所有使用场景都能同步降本。

API 价格与缓存成本
Fable 5.1 的输入、输出价格保持不变,主要价格调整来自缓存读取:
- 原缓存读取价格:每百万 Token 1 美元
- 新缓存读取价格:每百万 Token 0.25 美元
- 降幅:75%
对于提示词重复率较高、可充分利用缓存的 Agent、代码分析和科研工作流,这项调整可能明显降低长期运行成本。

Terminal-Bench 4.0 成绩提升
在较新的 Terminal-Bench 4.0 测试中,Fable 5.1 的成绩达到 55.8%,相比 Fable 5 进一步提升。作为对比,原文列出的 GPT-5.6 Sol 成绩为 37.3%。
Terminal-Bench 主要考察模型在终端环境中完成复杂任务的能力,涉及命令执行、工具调用、环境理解和多步骤操作。该成绩表明,Fable 5.1 在自动化开发与终端 Agent 场景中具备更强竞争力。

原文还整理了其他模型在同类测试中的表现,用于观察 Fable 5.1 与不同模型之间的差距。

CursorBench 提升至 73.4%
在 CursorBench 中,Fable 5.1 的成绩从前代的 70.3% 提升至 73.4%。该测试侧重代码理解、编辑和软件开发任务,成绩增长意味着新模型在 AI 编程场景中的稳定性与任务完成能力有所增强。

分子设计与蛋白质研究
在生物科学案例中,Fable 5.1 被用于设计高亲和力结合剂。根据官方披露的数据,在三个靶标上,模型设计结果的结合亲和力最高可达到参赛最佳设计的 10 倍。
在蛋白质设计竞赛中,其命中率达到 50%。作为参考,原文给出的行业常见命中率约为 10%至15%。如果这些结果能够在更多实验中复现,大模型有望缩短候选分子的筛选周期,并减少前期实验成本。

加速计算生物学模型
计算生物学通常需要在 GPU 上反复运行针对特定任务训练的机器学习模型,执行速度直接影响研究周期与硬件成本。
Anthropic 展示的案例称,Fable 5.1 针对七个开源深度学习模型提出优化方案,最高实现 2.5 倍加速。由于科研人员可能需要将同一模型运行数千次,优化后的预计 GPU 成本可降低 30%至60%。
以往类似优化往往需要性能工程团队投入数周时间,而该案例中的工作在数天内完成。需要注意的是,实际加速幅度仍会受到模型结构、硬件环境和工作负载等因素影响。

建立更精细的金星地形图
在计算分析与建模实验中,Fable 5.1 参与训练神经网络,并生成覆盖约三分之一金星区域的高分辨率地形图。
官方案例显示,新地图能够呈现约 2 至 3 公里尺度的细节,而此前数据的精度约为 10 至 12 公里;高度测量准确度也提高了约 25%。这一案例体现了大模型在科研代码开发、数据处理和建模流程中的辅助价值。

上海三维地图生成演示
原文还展示了一项持续运行一个多小时的地图生成任务:模型从地球视角构建上海地图,并加入行政区和地标搜索功能。演示支持从全球视角逐步缩放至上海,呈现城市空间与重点建筑信息。
该案例为一次生成结果,任务展示时尚未完全运行结束,因此更适合作为复杂前端开发、地理数据处理和长时间 Agent 执行能力的示例,而不能单独作为稳定性结论。

总结
Fable 5.1 的主要升级可以归纳为三点:科研任务能力增强、终端与编程基准成绩提升,以及缓存读取成本下降。分子设计、深度学习模型加速和行星地形建模等案例,也表明 Anthropic 正在扩大大模型在科学计算领域的应用范围。
与此同时,基准成绩和官方案例仍需结合真实业务验证。对于开发者而言,缓存命中率、长任务稳定性、工具调用成功率及总体 Token 消耗,仍是评估实际成本与生产可用性的关键指标。原文提到,OpenAI 也已开始预热 Astra,后续模型竞争预计将继续围绕推理、编程、Agent 与科学研究能力展开。





暂无评论,期待您的发言...