Anthropic发布Claude Fable 5.1,成本最高可降45%

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:1,845

摘要:Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,重点强化长周期Agent能力,面向可持续数小时的编程、研究和企业知识工作。Fable 5.1的API输入、输出单价保持不变,缓存读取单价下降75%。

产联社编辑 | 黄钰慧

image.png

【产联社】Anthropic正在推动Claude从完成单次任务,走向持续执行数小时的长周期工作。当地时间9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,将其定位为面向编程和知识工作的最新模型。Fable 5.1此次升级的重点,是让Agent承担更长、更复杂的任务,在减少人工介入的情况下推进编程、多步骤研究和企业知识工作。

Fable 5.1的API输入、输出单价没有变化,分别为每百万Token 10美元和50美元。缓存读取单价则下降75%,从每百万Token 1美元降至0.25美元。Anthropic根据实际工作负载估算,按Token计费时,Fable 5.1运行典型任务的总成本较Fable 5降低约25%;对于上下文密集、工具调用频繁的复杂编程和高度Agent化任务,节省幅度最高可达约45%。

按照Anthropic的说明,Fable 5.1和Mythos 5.1是同一个模型,但采用不同级别的安全限制。Fable 5.1设置了更严格的网络安全和生命科学防护,因此可以广泛提供;Mythos 5.1则为经过审核的网络防御人员和生命科学专业人士提供更宽松的相关权限。目前,Mythos 5.1仅向一组美国机构开放,Anthropic称正与美国政府协调,以扩大至更多美国及国际合作方。对绝大多数企业和个人用户而言,现阶段能够直接使用的是Fable 5.1。

Claude开始接手更长的任务

Fable 5.1最明显的变化之一,是Claude能够在较少人工介入的情况下,把复杂工作持续推进更长时间。

过去的大模型已经可以写代码、检索资料、操作计算机并调用工具,但把一项完整工作交给AI持续执行,仍可能面临目标偏移、错误累积和流程中断等问题。Anthropic也表示,现有自动行为审计对超长上下文工作和多Agent环境的可见度仍然有限。

Fable 5.1试图减少长任务执行过程中的人工接管。Anthropic称,新模型更适合长周期编程、多步骤研究,以及文档、电子表格和演示文稿制作。其API还新增在工具调用之间返回可读进度更新等测试版功能。开发者需要启用并正确展示相关更新,用户才能看到这些进度信息。

这种能力已经出现在部分企业的早期测试中。据Anthropic发布页援引Ramp高级机器学习工程师Dwight Temple的说法,Fable 5.1曾在一项机器学习任务中无人值守运行38小时。模型判断此前的实验结果受到标签问题影响,在修正后并行启动六组实验,并于次日整理实验结果、给出后续建议。

另一个案例来自投资管理机构Millennium。据该公司一名高级投资组合经理介绍,其内部系统的一段代码存在一个约每运行100万次才出现一次的罕见崩溃,团队四五年来一直未能解释原因,其他模型也没有找到问题。Fable 5.1通过反汇编外部供应商的程序库,并将结果与核心转储文件比对,最终把故障追溯至该程序库中的一个Bug。

这两个案例体现了此次升级的方向。Claude正在尝试承担过去需要人持续排查、验证和推进的一整段工作,而不只是完成单个步骤。

Anthropic公布的基准测试也体现了这一变化。在Agent科研任务基准Terminal-Bench-Science 0.1中,Fable 5.1得分为52.6%,Fable 5在Anthropic测试设置下得分为24.7%;在业务流程测试AutomationBench中,两者分别得分31.4%和17.1%。

Fable 5.1面向的工作不再局限于编程。Anthropic把它的适用范围延伸至企业知识工作,包括多步骤研究、数据分析,以及文档、电子表格和演示文稿制作。一个项目可以从资料搜集开始,继续完成分析和成果制作,但最终效果仍取决于模型所接入的工具、数据和工作环境。

科研也是Anthropic此次重点展示的场景之一。据该公司介绍,Fable 5.1利用NASA麦哲伦号探测器30多年前获取的雷达影像以及已有的金星局部地图,训练神经网络,为约三分之一的金星表面生成了新的高分辨率高程图。Anthropic称,新地图可呈现2至3公里尺度的细节,优于原有数据约10至20公里的尺度,高程估计准确度最高提升25%。

生命科学领域的部分高权限工作则由安全限制更宽松的Mythos 5.1承担。例如,Anthropic让Mythos 5.1使用开源蛋白质设计和折叠工具,并将其设计送交两家外部机构进行实验验证。

长周期Agent开始比拼成本

当AI开始连续工作数小时甚至更长时间,完成整项任务的成本就会成为与模型能力同样重要的因素。

Fable 5.1没有下调API输入、输出单价,仍按每百万输入Token 10美元、每百万输出Token 50美元收费,与Fable 5一致。Anthropic调整的是缓存读取单价,其价格从每百万Token 1美元降至0.25美元,降幅为75%。

缓存读取是指API复用此前已经处理并存入提示缓存的输入内容,例如较长的系统提示词、文档或对话前缀,而不必在每次请求中按普通输入价格重新处理。它并不意味着模型可以自动或永久记住全部历史信息,只有形成缓存命中时,相关Token才按照缓存读取价格计费。

因此,此次调价对上下文密集的长周期Agent任务影响更明显。Anthropic依据2026年8月连续四周的实际使用数据测算,在Claude Enterprise、Claude Code和API等典型场景中,按默认推理强度运行相同工作负载时,Fable 5.1的总成本较Fable 5预计降低约25%;对于缓存读取占成本大部分的上下文密集、工具密集任务,节省幅度最高可达约45%。

Anthropic还试图通过不同推理强度平衡能力和成本。按照官方测试,Fable 5.1在低或中等推理强度下,部分基准测试结果已经接近或超过Fable 5在更高推理强度下的结果。这意味着开发者可以根据任务复杂程度调整推理强度,但实际费用和效果仍需结合自身工作负载评估。

Fable 5.1已经通过Claude面向用户和开发者的产品以及Claude API提供,并登陆Amazon Bedrock、Claude Platform on AWS、Google Cloud和Microsoft Foundry等平台。个人用户的具体可用范围还取决于订阅方案、组织设置和用量计费安排。

从编程Agent走向企业工作流

随着长任务能力提升,Claude能够承担的工作进一步延伸至企业日常工作。

编程一直是Claude的重要应用场景,但Anthropic此次为Fable 5.1划定的适用范围更宽。除了跨代码库开发功能、代码审查和性能优化,新模型还面向研究、数据分析、文档、电子表格和演示文稿等任务。

过去使用大模型完成这类任务,通常需要员工把工作拆成多个步骤,例如先搜集资料,再整理和分析数据,随后制作表格并形成报告。Agent的目标是把这些环节连接起来,让模型在获得相应工具和权限后判断下一步需要完成什么,并把任务推进至可供人工审核的阶段。

如果模型能够承担更多中间环节,衡量AI价值的标准就会从单次回答是否准确,逐步转向整项任务需要多少时间、多少人工介入,以及最终结果能否进入后续业务流程。因此,Fable 5.1更现实的价值,是减少人在每个中间步骤上的持续监督,把更多人工精力留给任务设定、权限控制、关键判断和最终验收。

同一模型,不同安全权限

Fable 5.1和Mythos 5.1并非传统意义上一强一弱的两款模型。按照Anthropic的表述,两者基于同一个模型,主要区别在于所采用的安全限制不同。

在网络安全领域,Fable 5.1已经可以用于从源代码中识别软件漏洞,但渗透测试、漏洞利用程序生成,以及基于二进制文件的漏洞扫描等具有双重用途、风险较高的任务,仍会被安全机制转交至Opus模型。Anthropic称,调整后的网络安全防护使Claude Code每次会话受到的安全机制干预平均减少约60%。

企业数据如何处理,也是模型能否进入生产环境的重要问题。Anthropic此次公布Enterprise Frontier Safeguards,计划允许符合条件的企业把相关活动数据保存在由客户控制的云基础设施中,而不是Anthropic的系统中,默认情况下,需要人工复核的内容也由客户处理。该机制尚未全面上线,将从2026年秋季开始分阶段推出。

按照Anthropic公布的计划,EFS将支持Claude Code、Claude Enterprise、Claude Platform、Amazon Bedrock、Claude Platform on AWS、Google Agent Platform和Microsoft Foundry。符合条件的客户在EFS正式可用前,可以对Fable 5.1和Fable 5采用零数据保留安排。

随着Agent运行时间延长、接触的企业系统增多,数据控制和安全权限也会成为模型能否进入生产环境的重要条件。对于用户而言,更有现实意义的问题也正是这一点。模型能否在可接受的成本、权限和人工监督条件下,把一项完整工作持续推进下去,这比单项跑分更接近实际价值。

商务合作/报料请联系侯经理 18801065284(微信同号)

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

7
2
分享
上一篇 下一篇