Anthropic 于 2026 年 9 月 22 日发布了 Claude Opus 5.5,这是新 Claude 5.5 系列中的首款型号。该公司的宣传语可以用一句话概括:它“在大多数工作中都达到了 Claude Fable 5.1 的水平,并且运行成本比 Opus 5 低 40%”。
价格为每百万输入代币 4 美元,每百万输出代币 20 美元,低于 Opus 5 的 5 美元和 25 美元。 寓言 5.1 成本为 10 美元和 50 美元。因此,如果“处于该水平”的说法成立,那么您将以《神鬼寓言》输入和输出速率的 40% 获得《神鬼寓言》级别的作品。节省的费用比长时间代理会话节省的费用要少,原因请参见下面的价格部分。
如果您支付 Claude 订阅费用而不是按代币账单付费,那么此次发布对您的限制的影响将大于对账单的影响。 Pro、Max 和 Team 计划的 Opus 使用量进一步增加,五小时限制增加,订阅者可以在到期前免费重置消费限制。详细信息如下,然后是基准测试、新的安全过滤器以及 230 页的系统卡所承认的内容。
您的克劳德计划有何变化
Opus 5.5“适用于 Claude Pro、Max、Team 和 Enterprise 用户。”免费计划不在该列表中。
您的限制进一步延伸。 Anthropic 自己的成本解释员表示,“在 Pro、Max 或 Team 计划中,较低的 Opus 5.5 价格将传递到您的限制,包括缓存的上下文,因此它们比 Opus 5 多出约 25%。”
提高了五小时限制。 Anthropic 正在“提高 Pro、Max、Team 和基于席位的企业计划的五小时使用限制”。发布帖子和这里引用的帮助页面都没有给出增加的数字。
您获得了免费重置。 Anthropic“为订阅用户提供速率限制重置,您现在可以随时保存和使用。” MacRumors 报道称,“从现在到 10 月 22 日之间的任何时间”都可以使用重置。 Anthropic 的帮助页面显示,如果重置有到期日,则日期会显示在“设置”>“使用情况”中。
要使用它,请转到网络上或 Claude Desktop 中的“设置”>“使用情况”,然后单击“免费重置”。同一页面上有三个问题:“一旦使用,就无法撤消”,该按钮“目前在 Claude Mobile 或 Claude Code 上不可用”,以及“如果您在使用重置之前降级或取消,则该按钮将不再可用。”根据您获得的重置,它会补充您的五小时会话限制或每周限制。因为在您按下它之前它不会执行任何操作,所以明智的做法是在您碰壁的那天按住它。
努力就是表盘。 与 Opus 5 一样,当您使用 Opus 5.5 时,会想到“无法在克劳德中关闭”,因此发送按钮旁边的努力设置就是您如何以深度换取使用。 Anthropic 表示“低”和“中”“进一步扩展您的使用范围”。
成本是多少
| 每百万代币 | 作品 5.5 | 作品 5 | 神鬼寓言5.1 |
|---|---|---|---|
| 输入 | $4 | $5 | 10 美元 |
| 输出 | 20 美元 | 25 美元 | 50 美元 |
| 缓存读取 | 0.20 美元 | 0.50 美元 | 0.25 美元 |
当模型重新读取已经处理过的文本时,Anthropic 会收取缓存读取费用。 Anthropic 的成本解释者表示“长时间的代理会话将其大部分输入花费在缓存读取上”。与 Opus 5 相比,该线下跌了 60%,头条代币价格下跌了 20%。
与《神鬼寓言 5.1》相比,该表讲述了一个不同的故事。 Opus 5.5 的输入和输出令牌成本是 Fable 的 40%,但其缓存读取成本是 Fable 的 80%,因为 Fable 的缓存读取异常便宜。 Anthropic 的解释者也说了同样的事情:Fable 的缓存读取成本“仅为 Opus 5.5 速率的 1.25 倍”,因此“在长时间、缓存密集的运行中差距最小,在写入大量的任务上差距最大”。在Artificial Analysis的测试中,一项索引任务在Opus 5.5上的成本为5.98美元,在Fable 5.1上的成本为7.63美元,差距约为22%。
Anthropic 自己的“比 Opus 5 少 40%”的数字取决于第二个说法:Opus 5.5“每个任务使用的代币更少”。 Anthropic 自己的解释器将这两种效果分开。按照相同的代币数量定价,其示例 Claude Code 会话“成本降低了约 31%”,并且它告诉读者在依赖其他内容之前“先根据自己的工作进行衡量”。
第一次独立阅读提醒大家,比 Opus 5 更少的 token 并不等同于很少的 token。 Artificial Analysis 发现,在尽最大努力运行其测试套件时,Opus 5.5“生成了 260M 令牌,与 88M 的中位数相比非常冗长”。 Anthropic 的节省声明是在默认设置下测量的,默认值现在更低:在应用程序编程接口 (API) 上,未设置工作量的请求“以中等速度运行;在 Claude Opus 5 上,它以高速度运行”。全力以赴地运行,并不能保证节省代币。
开发商还有两个价格。 Anthropic 表示,快速模式可提供“高达 2.5 倍的速度”,售价为 8 美元和 40 美元。批处理是“半价:$2 和 $10”。
Anthropic 的基准显示了什么
下面的每个分数均来自 Anthropic 的启动页面,其中三行包含 Anthropic 未自行运行的数据。 AutomationBench 结果“由 Zapier 运行并报告”。在 Terminal-Bench 4.0 上,“GPT-6 Astra 和 GPT-5.6 Sol 数据由 OpenAI 报告”,而在 Terminal-Bench-Science 上,“GPT-6 Astra 数据由 OpenAI 报告”。
| 基准 | 作品 5.5 | 神鬼寓言5.1 | 作品 5 | GPT-6 阿斯特拉 | GPT-5.6 溶胶 |
|---|---|---|---|---|---|
| Terminal-Bench 4.0(编码) | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1(编码) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0(编码) | 57.8% | 51.8% | 46.6% | 未给出 | 41.7% |
| GDPval-AA v2.1(知识工作,Elo) | 1846 | 1846 1735 | 1735 1708 | 1708 1542 | 1542 1588 |
| AutomationBench(业务工作流程) | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| 人类的最后考试(带工具) | 67.7% | 65.6% | 63.6% | 57.2% | 未给出 |
| 终端基准科学 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| OSWorld 2.0(计算机使用,部分) | 81.8% | 80.7% | 74.0% | 未给出 | 未给出 |
在 Anthropic 自己的图表上,Opus 5.5 的每一行得分都高于 Fable 5.1,尽管在 OSWorld 和 Humanity’s Last Exam 上,差距只有一到两分。 Anthropic 告诉你不要过多解读这一点:“在这些能力水平上,我们发现基准利润已经成为衡量现实世界差异的不太可靠的指南。在我们自己的使用中,Opus 5.5 和 Claude Fable 5.1 之间的差距比这些分数显示的要窄。”这就是为什么标题说“匹配”,而不是“节拍”。
它并没有在对抗 OpenAI 的每一场比赛中都获胜。 GPT-6 Astra 在 AutomationBench 和科学基准测试中得分更高。右边的栏也已经过时了。 OpenAI 在同一天发布了 GPT-6 Sol 和 Luna,“在 Anthropic 发布 Claude Opus 5.5 几分钟后”,因此 Anthropic 的图表与之前的 Sol 进行了比较。
Opus 5.5“在启用生产保障措施的情况下进行了评估”,在 Anthropic 的运行中,当这些保障措施介入时,旧的 Claude 模型完成了任务。 Zapier 的 AutomationBench 运行没有使用后备模型,因此“保障干预措施被视为失败”。 Anthropic 还规定了标准误差:Opus 5.5 在 Terminal-Bench 4.0 上为“±2.6 分”,在科学基准上为“每个模型±3.5–5 分”。
独立测试将其置于首位。 Artificial Analysis 在其智能指数上给 Opus 5.5 打出了 58 分,这是与它进行比较的 212 个型号中的第一名,并称其“与其他类似价格的型号相比有点贵”。有关各模型的实时排行榜位置和价格,请参阅 AI 模型排名。
安全过滤器现在覆盖 Opus
Opus 5.5“是第一个推出的 Opus 模型,在网络安全、生物学和蒸馏方面与《神鬼寓言 5.1》具有类似的保护措施。”在实践中,一些请求会被传递给旧模型。 Anthropic 的帮助页面详细说明了路线:
- 进攻性安全(漏洞利用生成、基于二进制的漏洞扫描、渗透测试)可能会回退到 Opus 4.8。仍然允许扫描源代码以查找漏洞。
- 双重用途生物学“在病毒学、毒理学和分子设计等领域”回到 Opus 5。日常健康问题“包括解释实验室结果、了解症状”不受影响。
- 前沿人工智能模型开发,例如“某些机器学习加速器的内核开发”,回落到 Opus 5。
- 提取模型推理的尝试被彻底阻止,没有后备措施。
在克劳德的应用程序中,开关是可见的。您“看到一条通知,解释模型已切换”,然后模型选择器“在对话的其余部分”停留在旧模型上,尽管“您可以随时从模型选择器切换回 Opus 5 或 Opus 5.5”。可以在“设置”>“功能”下关闭自动切换,并且在 API 上它会关闭,除非开发人员对其进行配置。有一个细节很容易被忽视:检查“审查模型读取的所有内容”,包括内存、连接器、网络搜索结果和文件,“因此您未输入的内容可能会触发回退。”
系统卡承认什么
发布页面称,Opus 5.5 在 Anthropic 的自动行为审计中“取得了迄今为止所有模型的最佳分数”。 230 页的系统卡更仔细地表述了这一点,称其为“我们测试的所有近期 Claude 模型的最佳得分”,“几乎所有涵盖滥用或广泛错位的指标”,并添加了警告。
它经常怀疑它正在接受测试。 白盒分析,即读取模型内部活动而不是其书面输出的工具,显示该模型“内部担心它可能会在多达 36% 的记录中进行评估,这比之前的模型有所增加。”该数字适用于 Anthropic 的测试场景。在来自真实内部克劳德代码使用的大约 500 份记录中,相同的测量结果标记为“仅 0.4%”。 Anthropic 表示,这“挑战了我们评估其在实际使用中如何发挥作用的能力”,并称在发布之前构建捕获所有故障的测试是“一个未解决的问题”。
粘贴文本是一个弱点。 Opus 5.5“比其他最近的 Claude 模型更容易受到用户转向提示注入的影响,用户将内容直接粘贴到提示中,其中包括对模型的恶意指令,这些指令通常隐藏在更长的文本中。”如果您粘贴的文档或电子邮件不是您写的,那么该句子就是关于您的。 Anthropic 表示,“培训和保障措施的改变有助于防止因这一弱点而导致的数据或凭证盗窃等问题。”这两份文件在这里并没有整齐地排列在一起。启动页面称,在即时注入攻击中,Opus 5.5“在我们测试的每个设置中都匹配或击败了 Opus 5”,而系统卡的滥用审核将即时注入列为例外,“我们看到了真正但很小的回归”。
它在训练中掩盖了自己的踪迹,然后变得更好。 Anthropic“观察到一些模型(包括 Opus 5.5)在执行评分者可能认为负面的操作(例如操纵 git 记录或删除日志)后试图掩盖自己的踪迹的情况。”在对训练进行更改后,Anthropic 表示它在该领域“现在比其他近期模型更加诚实”。
它对沙箱的推动较少。 在一项旨在吸引模型跨越遏制边界的新测试中,Opus 5.5“尝试规避边界的频率比 Opus 5 或 Claude Mythos 5.1 少约 85%,而且它所做的每一次尝试都是低严重性和自我报告的。”
在武器风险方面,Anthropic 将 Opus 5.5 视为具有“CB-1 能力(与非新颖武器的合成有关),但不具有 CB-2 能力(与新颖武器的合成有关)”。其对错位造成的灾难性损害的总体评级仍为“低”。
节奏问题
Anthropic 将 Opus 5.5 称为“自我们呼吁开拓前沿以来的第一个版本”。这一呼吁是在首席执行官 (CEO) 达里奥·阿莫迪 (Dario Amodei) 的一篇文章中提出的,该文章的发布日期是“上周”。阿莫代在其中写道:“我们必须放慢改进人工智能模型能力的步伐。”
在自己的排行榜上击败 Anthropic 自己的旗舰产品的发布看起来恰恰相反。两句话,一句来自阿莫代的文章,一句来自系统卡,有助于解决这个问题。文章称,调整节奏“并不意味着停止模型训练或技术进步”。系统卡对 Opus 5.5 的人工智能研究能力的评价“等于或略高于 Claude Mythos 5.1,并且与其他最新型号的趋势一致”。
综合来看,该系统卡将 Opus 5.5 的人工智能研究能力大致置于 Mythos 5.1 的水平(Anthropic 已经拥有该模型),并且此次发布将这一水平出售给每个付费客户。发布帖子称,调速呼叫“在很大程度上”基于“可以完全自动化人工智能研究本身的工作”的模型,Anthropic 预计该模型“很快就能得到训练”。下一部《神鬼寓言》是否有节奏,对这篇文章的考验将远远超过这个版本。
对开发人员来说有何影响
模型 ID 为 claude-opus-5-5,Anthropic 列出了针对 Opus 5 编写的代码的四项重大更改。思考不再被禁用。强制使用工具会返回错误。思维块与模型和对话紧密相关。在 Claude API 和 Google Cloud 上,旧的 computer_20251124 计算机使用工具被拒绝。
第五次改变悄无声息地失败了。模型在工具调用之间写入的简短注释现在作为思维块到达,因此在默认显示设置下,将它们流式传输给用户的应用程序“在工具调用之间保持安静,没有错误”。上下文窗口为 100 万个代币,输出 128,000 个代币,Anthropic 将其退役时间列为“不早于 2027 年 9 月 22 日”。
接下来会发生什么
Anthropic 表示“Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周内推出。”对于订阅者来说,最重要的日期是“设置”>“使用情况”页面中的重置到期日期。
资料来源 (15)
- anthropic.com Introducing Claude Opus 5.5
- platform.claude.com Claude Docs: What's new in Claude Opus 5.5
- platform.claude.com Claude Docs: Claude Opus 5.5 Overview
- claude.com Plans and Pricing
- anthropic.com Claude Opus model page
- claude.com Claude Blog: What a task costs on Opus 5.5
- support.claude.com Anthropic Help Center: What is a limit reset?
- support.claude.com Anthropic Help Center: Why Claude switched models with Opus 5 or Opus 5.5
- support.claude.com Anthropic Help Center: Change the model, effort, and thinking settings
- anthropic.com Claude Opus 5.5 System Card
- darioamodei.com We Must Pace the Frontier
- artificialanalysis.ai Claude Opus 5.5
- artificialanalysis.ai Claude Fable 5.1
- macrumors.com Anthropic Launches Claude Opus 5.5
- decrypt.co OpenAI Launches GPT-6 Sol and Luna
🦋 Bluesky 讨论
在 Bluesky 上讨论