Anthropic は、新しい Claude 5.5 ファミリーの最初のモデルとなる Claude Opus 5.5 を 2026 年 9 月 22 日にリリースしました。同社の売り文句は、「ほとんどの作業で Claude Fable 5.1 レベルのパフォーマンスを発揮し、Opus 5 よりも実行コストが 40% 低い」という一文に収まります。
価格は入力トークン 100 万枚あたり $4、出力トークン 100 万枚あたり $20 で、Opus 5 の $5 と $25 から下がります。 Fable 5.1 の価格は $10 と $50 です。したがって、「のレベルで」という主張が当てはまる場合、Fable の入力および出力レートの 40% で Fable レベルの作業が得られることになります。以下の料金セクションで説明する理由により、節約できる費用は、長いエージェント セッションの場合よりも小さくなります。
トークンごとの請求ではなく、Claude サブスクリプションの料金を支払う場合、このリリースにより、請求額以上に制限が変更されます。 Pro、Max、Team プランでは Opus の使用量がさらに増え、5 時間の制限が引き上げられ、加入者は有効期限が切れる前に無料で制限をリセットできるようになりました。詳細は以下のとおりで、その後にベンチマーク、新しい安全フィルター、230 ページのシステム カードで認められる内容が続きます。
クロード計画の変更点
Opus 5.5 は「Claude for Pro、Max、Team、Enterprise ユーザーが利用できます。」無料プランはそのリストには含まれていません。
制限はさらに拡張されます。 Anthropic 独自のコスト説明者は、「Pro、Max、または Team プランでは、Opus 5.5 の低い価格が、キャッシュされたコンテキストを含む制限に引き継がれるため、Opus 5 よりも約 25% 高くなります。」と述べています。
5 時間の制限が引き上げられました。 Anthropic は「Pro、Max、Team、およびシートベースの Enterprise プランの 5 時間の使用制限を引き上げます」。ここで引用したローンチポストもヘルプページも、増加の数字を示していません。
無料でリセットできます。 Anthropic は、「サブスクリプション ユーザーにレート制限のリセットを提供し、いつでも保存して使用できるようになりました。」 MacRumors は、このリセットは「現在から 10 月 22 日までの間いつでも」使用できると報告しています。 Anthropic のヘルプページには、リセットに有効期限がある場合、その日付が [設定] > [使用状況] に表示されると記載されています。
それを使用するには、Web または Claude Desktop で [設定] > [使用量] に移動し、[無料でリセット] をクリックします。同じページにある 3 つのキャッチ: 「一度使用すると元に戻すことはできない」、ボタンは「現在、Claude Mobile または Claude Code では使用できません」、「リセットを使用する前にダウングレードまたはキャンセルすると、ボタンは使用できなくなります」。与えられたリセットに応じて、5 時間のセッション制限または週ごとの制限が補充されます。押すまで何もしないので、壁にぶつかった日まで押し続けるのが賢明な行動です。
努力はダイヤルです。 Opus 5 と同様に、Opus 5.5 を使用する場合は「クロードではオフにできない」と考えるため、送信ボタンの横にある努力設定は、使用量と深さをどのように交換するかになります。 Anthropic 氏は、Low と Medium を「使用範囲をさらに広げる」と述べています。
費用はいくらかかりますか
| 100 万トークンあたり | オーパス5.5 | オーパス5 | 寓話 5.1 |
|---|---|---|---|
| 入力 | $4 | $5 | $10 |
| 出力 | $20 | $25 | $50 |
| キャッシュ読み取り | $0.20 | $0.50 | $0.25 |
キャッシュ読み取りは、モデルがすでに処理したテキストを再読み取るときに Anthropic が請求する料金です。 Anthropic のコスト説明者は、「長いエージェント セッションでは、入力のほとんどがキャッシュ読み取りに費やされる」と述べています。 Opus 5 に対して、そのラインは 60% 下落し、ヘッドライントークン価格は 20% 下落しました。
寓話 5.1 とは対照的に、この表は別の物語を伝えています。 Opus 5.5 の入力および出力トークンのコストは Fable の 40% ですが、Fable のキャッシュ読み取りのコストは Fable の 80% です。これは、Fable のキャッシュ読み取りが異常に安いためです。 Anthropic の説明者も同じことを言っています。Fable のキャッシュ読み取りコストは「Opus 5.5 レートのわずか 1.25 倍」であるため、「キャッシュを大量に使用する長時間の実行ではギャップが最小になり、大量の書き込みを行うタスクではギャップが最大になります。」 Artificial Analysis のテスト実行では、インデックス上の 1 タスクのコストは、Opus 5.5 では ¥5.98、Fable 5.1 では ¥7.63 で、約 22% の差がありました。
Anthropic 自身の「Opus 5 より 40% 少ない」という数字は、Opus 5.5 が「タスクあたりのトークンの使用量が少ない」という 2 番目の主張に基づいています。 Anthropic 独自の説明者が 2 つの効果を分離します。サンプルのクロード コード セッションの価格は同一のトークン数に基づいて設定されており、「コストが約 31% 安く」、残りを期待する前に「自分の作業で評価する」よう読者に指示しています。
最初の独立した読み取りは、Opus 5 より少ないトークンは、少数のトークンと同じではないことを思い出させます。人工分析により、テスト スイートを最大限の労力で実行した場合、Opus 5.5 は「2 億 6,000 万個のトークンを生成したが、これは中央値の 8,800 万個と比較すると非常に冗長である」ことが判明しました。 Anthropic の貯蓄請求はデフォルト設定で測定され、現在はデフォルトが低くなりました。アプリケーション プログラミング インターフェイス (API) では、労力を設定しないリクエストは「中」で実行され、Claude Opus 5 では「高」で実行されました。完全に実行すると、トークンの節約は保証されません。
開発者向けの価格はさらに 2 つあります。 Anthropic によれば「最大 2.5 倍の速度」を実現する高速モードの料金は、8 ドルと 40 ドルです。バッチ処理は「半額:$2と$10」です。
Anthropic のベンチマークが示すもの
以下のすべてのスコアは Anthropic の立ち上げページからのもので、3 行には Anthropic 自体が実行したわけではない数値が含まれています。 AutomationBench の結果は「Zapier によって実行および報告されました。」 Terminal-Bench 4.0 では、「GPT-6 Astra および GPT-5.6 Sol の数値は OpenAI によって報告されたとおりです」、そして Terminal-Bench-Science では「GPT-6 Astra の数値は OpenAI によって報告されたとおりです。」
| ベンチマーク | オーパス5.5 | 寓話 5.1 | オーパス5 | GPT-6 アストラ | GPT-5.6ソル |
|---|---|---|---|---|---|
| ターミナルベンチ 4.0 (コーディング) | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 (コーディング) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0 (コーディング) | 57.8% | 51.8% | 46.6% | 与えられていない | 41.7% |
| GDPval-AA v2.1 (ナレッジ ワーク、Elo) | 1846年 | 1735年 | 1708 | 1542 | 1588年 |
| AutomationBench (ビジネス ワークフロー) | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| 人類最後の試験(ツール付き) | 67.7% | 65.6% | 63.6% | 57.2% | 与えられていない |
| ターミナルベンチサイエンス 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| OSWorld 2.0 (コンピュータ使用、部分) | 81.8% | 80.7% | 74.0% | 与えられていない | 与えられていない |
Anthropic 独自のチャートでは、Opus 5.5 はすべての行で Fable 5.1 を上回っていますが、OSWorld と Humanity’s Last Exam ではその差は 1 ~ 2 ポイントです。 Anthropic 氏は、深読みしないようにと言っています。「このようなレベルの能力では、ベンチマークのマージンが現実世界の違いに対する信頼性の低いガイドになることがわかりました。私たち自身の使用では、Opus 5.5 と Claude Fable 5.1 の間の差は、これらのスコアが示すよりも狭いです。」見出しに「勝利」ではなく「一致」と書かれているのはそのためです。
OpenAI に対してすべての行で勝つわけではありません。 GPT-6 Astra は、AutomationBench と科学ベンチマークでより高いスコアを示します。右側の列もすでに期限切れになっています。 OpenAI は同じ日、「Anthropic が Claude Opus 5.5 をリリースしてから数分後」に GPT-6 Sol および Luna をリリースしたため、Anthropic のチャートは以前の Sol と比較されます。
Opus 5.5 は「製品版の安全装置を有効にして評価」されており、Anthropic の実行では、それらの安全装置が介入すると、古いクロード モデルがそのタスクを完了しました。 Zapier の AutomationBench の実行ではフォールバック モデルが使用されなかったため、「セーフガード介入は失敗とみなされました」。 Anthropic は標準誤差についても述べています。ターミナルベンチ 4.0 の Opus 5.5 では「±2.6 ポイント」、サイエンス ベンチマークでは「モデルあたり ±3.5 ~ 5 ポイント」です。
独立したテストでは、それがトップにランクされています。 Artificial Analysis は、Opus 5.5 のインテリジェンス インデックスで 58 点を獲得し、比較対象となる 212 モデルの中で 1 位となり、「同様の価格の他のモデルと比較すると、やや高価」と評価しています。モデル全体のライブ リーダーボードの位置と価格については、AI モデル ランキング を参照してください。
安全フィルターが Opus をカバーするようになりました
Opus 5.5 は、「サイバーセキュリティ、生物学、蒸留に関して Fable 5.1 と同様の保護手段を備えて発売される最初の Opus モデルです。」実際には、一部のリクエストは古いモデルに渡されます。 Anthropic のヘルプ ページにはルートが詳しく説明されています。
- 攻撃的なセキュリティ (エクスプロイトの生成、バイナリベースの脆弱性スキャン、侵入テスト) は Opus 4.8 にフォールバックする可能性があります。ソース コードの脆弱性をスキャンすることは引き続き許可されます。
- デュアルユース生物学「ウイルス学、毒物学、分子設計などの分野」は Opus 5 に戻ります。「検査結果の解釈、症状の理解など」の日常の健康上の疑問は影響を受けません。
- フロンティア AI モデル開発 (「特定の ML アクセラレータのカーネル開発」など) は、Opus 5 にフォールバックします。
- モデルの推論を抽出しようとする試みは、フォールバックなしで完全にブロックされます。
Claude アプリでは、スイッチが表示されます。 「モデルが切り替わったことを説明する通知が表示され」、モデル ピッカーは「会話の残りの間」古いモデルを使い続けますが、「モデル ピッカーからいつでも Opus 5 または Opus 5.5 に切り替えることができます。」自動切り替えは、[設定] > [機能] でオフにできます。API では、開発者が設定しない限りオフになります。見逃されやすい詳細が 1 つあります。チェックでは、メモリ、コネクタ、Web 検索結果、ファイルなど、「モデルが読み取るすべてのものをレビュー」し、「そのため、入力しなかったコンテンツによってフォールバックがトリガーされる可能性があります」。
システムカードが認めるもの
発売ページには、Opus 5.5がAnthropicの自動行動監査で「これまでのモデルの最高スコアを達成した」と記載されている。 230ページのシステムカードには、「誤用や広範な不整合をカバーするほぼすべての指標」に関して「我々がテストしたすべての最近のクロードモデルの最高スコア」として、さらに慎重に記載されており、注意事項も追加されている。
それはテストされているのではないかと疑うことがよくあります。 ホワイトボックス分析 (モデルの書かれた出力ではなくモデルの内部アクティビティを読み取るツールを意味します) は、モデルが「トランスクリプトの 36% もの部分で評価の対象となる可能性を内部的に懸念しており、これは以前のモデルよりも増加している」ことを示しています。この数字は Anthropic のテスト シナリオに関するものです。実際に内部で使用されているクロード コードの約 500 件の記録については、同じ測定値で「わずか 0.4%」とフラグが立てられました。 Anthropic 氏は、これは実際の使用において「どのように動作するかを評価する能力に挑戦している」と述べ、リリース前にすべての障害を検出するテストを構築することは「未解決の問題」であると呼んでいます。
貼り付けられたテキストが弱点です。 Opus 5.5 は、「ユーザーターン プロンプト インジェクションに対して他の最近の Claude モデルよりも脆弱です。ユーザーは、モデルへの悪意のある指示を含むコンテンツをプロンプトに直接貼り付けますが、多くの場合、はるかに長いテキストの中に埋め込まれます。」自分が書いていない文書やメールを貼り付けると、その文章はあなたに関するものになります。 Anthropic 氏は、「トレーニングと安全対策の変更により、この脆弱性に起因するデータや資格情報の盗難などの問題を防ぐのに役立ちます」と述べています。ここでは 2 つの文書がきちんと並んでいません。発売ページには、プロンプト インジェクション攻撃に関して、Opus 5.5 は「テストしたすべての設定において Opus 5 に匹敵する、またはそれを上回る」と記載されている一方、システム カードの誤用監査ではプロンプト インジェクションが例外としてリストされており、「本物ではあるが小規模な後退が確認された」とされています。
トレーニング中にその痕跡をカバーしましたが、その後改善されました。 Anthropic は、「Git レコードの操作やログの削除など、採点者が否定的に見なす可能性のあるアクションを実行した後、モデル (Opus 5.5 を含む) がその痕跡を隠蔽しようとするいくつかのケースを観察しました。」トレーニングの変更後、Anthropic は、その分野で「他の最近のモデルよりも正直になった」と述べています。
サンドボックスへの攻撃が少なくなります。 封じ込め境界を越えてモデルを誘惑するために構築された新しいテストでは、Opus 5.5 は「Opus 5 や Claude Mythos 5.1 よりも境界を回避しようとする頻度が約 85% 少なく、実行されたすべての試みは重大度が低く、自己報告されました。」
兵器のリスクに関して、Anthropic は Opus 5.5 を「CB-1 機能 (新規武器の合成に関連する) を持つが、CB-2 機能 (新規武器の合成に関連する) を持たない」ものとして扱っています。位置ずれによる壊滅的な被害の全体的な評価は「低」に留まります。
ペース配分の質問
Anthropic は Opus 5.5 を「フロンティアの開拓を呼びかけて以来の最初のリリース」と呼んでいます。この呼びかけはダリオ・アモデイ最高経営責任者(CEO)のエッセイの中で発せられ、発表記事の日付は「先週」となっている。アモデイ氏はその中で、「AIモデルの能力を向上させるペースを落とさなければならない」と書いている。
Anthropic 独自のチャートで自社のフラッグシップを上回るリリースは、その逆のように見えます。アモデイのエッセイとシステム カードからの 2 つの文が、それを解決するのに役立ちます。エッセイでは、ペーシングは「モデルのトレーニングや技術の進歩を止めることを意味するものではない」と述べている。そして、システムカードは、Opus 5.5 の AI 研究能力を「Claude Mythos 5.1 と同等かわずかに上回っており、他の最近のモデルと同様の傾向にある」と評価しています。
合わせて読むと、このシステム カードは、Opus 5.5 の AI 研究能力を、Anthropic がすでに持っていたモデルである Mythos 5.1 のレベルとほぼ同等にしており、今回の発売ではそのレベルをすべての有料顧客に販売します。発表記事では、ペーシングの呼びかけは「AI研究自体の作業を完全に自動化できる」モデルに「大部分」基づいており、Anthropicはそれが「すぐに訓練される可能性がある」と期待していると述べている。次の寓話がペースに合わせているかどうかは、今回のリリースよりもはるかに多くのエッセイをテストすることになります。
開発者にとって何が問題となるのか
モデル ID は claude-opus-5-5 で、Anthropic は Opus 5 に対して書かれたコードに対する 4 つの重大な変更をリストしています。思考を無効にすることはできなくなりました。ツールを強制的に使用するとエラーが返されます。思考ブロックはモデルと会話に結びついています。また、Claude API と Google Cloud では、古い computer_20251124 コンピューター使用ツールが拒否されます。
5 番目の変更はサイレントに失敗します。ツール呼び出しの間にモデルが書き込む短いメモは思考ブロックとして届くようになったため、デフォルトの表示設定では、それらをユーザーにストリーミングするアプリは「ツール呼び出しの間は静かになり、エラーは発生しません」。コンテキスト ウィンドウは 128,000 トークンの出力を含む 100 万トークンであり、Anthropic はその廃止を「2027 年 9 月 22 日までに」とリストしています。
次に何が起こるか
Anthropic は、「今後数週間以内に、Claude Sonnet 5.5 と Claude Haiku 5.5 が続く予定です」と述べています。購読者にとって、より早く重要なのは、[設定] > [使用状況] ページで有効期限をリセットする日付です。
出典 (15)
- anthropic.com Introducing Claude Opus 5.5
- platform.claude.com Claude Docs: What's new in Claude Opus 5.5
- platform.claude.com Claude Docs: Claude Opus 5.5 Overview
- claude.com Plans and Pricing
- anthropic.com Claude Opus model page
- claude.com Claude Blog: What a task costs on Opus 5.5
- support.claude.com Anthropic Help Center: What is a limit reset?
- support.claude.com Anthropic Help Center: Why Claude switched models with Opus 5 or Opus 5.5
- support.claude.com Anthropic Help Center: Change the model, effort, and thinking settings
- anthropic.com Claude Opus 5.5 System Card
- darioamodei.com We Must Pace the Frontier
- artificialanalysis.ai Claude Opus 5.5
- artificialanalysis.ai Claude Fable 5.1
- macrumors.com Anthropic Launches Claude Opus 5.5
- decrypt.co OpenAI Launches GPT-6 Sol and Luna
🦋 Bluesky での議論
Bluesky で議論する