リンクをコピーしました!

2025年AI実力ランキング:OpenAIがリード、追うGoogle

AIの停滞期は終わった。2025年12月、史上最大規模のモデルリリースが相次いだ。本分析では、なぜOpenAIとAnthropicが同率1位なのか、そしてなぜGoogleの巨大なGemini 3エコシステムが僅差で3位につけているのかを詳しく解説する。

🌐
機械翻訳

この記事は英語の原文から自動翻訳されています。 英語の原文を読む

OpenAI、Anthropic、GoogleのAIエンティティがリーダーボードのフォーメーションで並ぶ未来的なデジタルアリーナ

GPT-5.2、Gemini 3、Claude Opus 4.5:6週間でAIの頂点は塗り替えられた

2025年初頭の「AIは壁にぶつかった」という物語は、もはや完全に過去のものだ。今年の大半、業界は奇妙な停滞期にあった。GPT-4.5は2月に肩透かしとともに登場し、スケーリングをめぐる議論は弱気に傾き、「AIはバブルだ」というのがディナーの席での無難な意見だった。

その空気は、わずか6週間で一変した。

11月12日から12月11日にかけて、「ビッグ3」は矢継ぎ早に本命モデルを投入した。OpenAIのGPT-5.1(11月12日)、GoogleのGemini 3(11月18日)、AnthropicのClaude Opus 4.5(11月24日)だ。そしてOpenAIは二の矢を放つ。GPT-5.2は12月11日に登場したが、これはGeminiの勢いに関する社内の「コードレッド」メモを受け、12月下旬に予定されていた発表を前倒ししたものだと報じられている。 埃はまだ収まっていないが、ベンチマーク、そしてより重要な「使ってみた感」の答えはすでに出ている。

開発者、戦略立案者、あるいは2026年のサブスクリプションを検討しているプロフェッショナルにとって、これが新しい序列に関する冷徹な現実だ。

トップは事実上の同着だが、その理由はまったく異なる。

ランキング:引き分けの決着

2023年のGPT-4発表以来初めて、単独の「王者」は存在しない。代わりに、最先端では実質的な二強体制が成立し、その少し後ろに巨大な一角が追随している。

第1位(同着):OpenAIのGPT-5.2

推論エンジン

OpenAIは再びやってのけた。ただし、多くの人が予想していた形ではない。GPT-5.2は単に「より物知り」になったわけではない。回答時の推論という点で、根本的に異なる存在だ。

GPT-5.2はInstant、Thinking、Proという3つのモードで提供され、リーダーボードを塗り替えているのはThinkingティアだ。パターン記憶を罰し、真のルール推論を評価するために作られたベンチマーク「ARC-AGI-2」において、GPT-5.2 Thinkingは52.9%のスコアを記録した。Claude Opus 4.5の37.6%、Gemini 3 Proの31.1%に対してだ。AIME 2025数学オリンピックの問題セットでは満点の100%を記録し、実務における専門的知的作業を測るOpenAIのベンチマーク「GDPval」でも70.9%で首位に立った(Gemini 3は53.5%)。

その知能には相応の対価が伴う。入力100万トークンあたり1.75ドル、出力100万トークンあたり14ドル――GPT-5.1より約40%高い水準であり、Proティアの価格はThinkingのおよそ一桁上だ。

論理、数学、そして冷徹な推論の王者であることに議論の余地はない。

第1位(同着):AnthropicのClaude Opus 4.5

自ら値下げしたコーディングの働き者

GPT-5.2が冷徹な論理エンジンだとすれば、Claude Opus 4.5は現場を支える働き者だ。

ここで重要な数字は2つある。1つ目は80.9%――実際のリポジトリで実際のバグを修正できるかどうかを測るベンチマーク「SWE-bench Verified」におけるOpus 4.5のスコアだ。 GPT-5.2が12月に登場した後でさえ、OpenAIの最高スコアは同テストで80.0%にとどまる。つまり2週間先に出ていたモデルが、わずかとはいえコーディング王座を守り抜いた形だ。 2つ目の数字は価格だ。入力100万トークンあたり5ドル、出力100万トークンあたり25ドル――Opus 4.1の価格からおよそ3分の2の値下げであり、しかもそれをコーディングリーダーボード首位のタイミングで実施した。

トレードオフはコンテキストだ。20万トークンのウィンドウは、Gemini 3の100万トークンに比べればごく一部にすぎない。Anthropicの賭けは、専門的な作業の大半――午後いっぱいのペアプログラミング、契約書のレビュー、エージェントのループ処理――は20万トークンで十分に収まるはずであり、開発者はOpusクラスの知能を2024年ミドルティア並みの価格で喜んで受け入れるだろう、というものだ。

安全性に配慮し、文章表現に優れ、市場最高の「ペアプログラマー」である。そして今回初めて、Opusクラスの知能が日常業務向けの価格で提供されている。

第2位:GoogleのGemini 3

エコシステムの巨人

Googleは3位だが、侮ってはいけない。

11月のわずか6日間、Gemini 3は打倒すべき本命に見えた。LMArenaのEloレーティングで史上初めて1500の大台を突破する1501という記録的スコアで登場し、主要な推論ベンチマークでGPT-5.1を上回った。 しかし、12月のGPT-5.2による反撃が、痛いところで差を再び広げた。ARC-AGI-2では31.1%対52.9%、GDPvalでは53.5%対70.9%だ。 最も難易度の高い新規推論問題においては、Gemini 3は明らかに二強に後れを取っている。

しかし、Gemini 3には他にはない強みがある。モダリティとリーチだ。

3モデルの中で最も強力なマルチモーダルモデルであり、動画、音声、画像をネイティブに扱える。加えてClaudeの20万トークンをはるかに凌ぐ100万トークンのコンテキストウィンドウを持つ。GoogleはSearchやWorkspaceスイートとの統合にも力を入れている。単体の頭脳としては最も賢いわけではないが、Googleのエコシステムで生活しているなら最も役立つ「アシスタント」だ。

技術的深掘り:知能のアーキテクチャ

なぜこうなったのか。なぜこの分裂が起きたのか。2強が2025年に異なる賭けをしたからだ。

「テスト時計算」への転換

OpenAIはすべてを推論時の思考にかけた。ただ大きなモデルを訓練する(訓練計算量)のではなく、モデルが答える前により長く「考える」ように最適化した(推論計算量)。

Total ComputeTraining Ops+(Inference Ops×Reasoning Steps)\text{Total Compute} \approx \text{Training Ops} + (\text{Inference Ops} \times \text{Reasoning Steps})

これこそがGPT-5.2のThinkingモードとProモードの正体だ。回答時にどれだけ推論に費やすかを調整するダイヤルである。難しい質問に答える前にモデルが一呼吸置くのは、遅れているのではなく考えているからであり、パターンマッチング型のモデルが軒並み落第する新規ルール問題のクラスで、まさにARC-AGI-2のスコアが跳ね上がった理由でもある。

効率性への賭け

一方Anthropicは、最先端の知能を一日中動かせるほど安くすることに賭けた。

Opus 4.5の目玉はベンチマークではなく、請求書だった。SWE-bench Verifiedで首位を維持しながらフラッグシップの価格をおよそ3分の2削減したことは、Anthropicが利益の在り処をどこに見ているかを物語っている。それは1回の英雄的な回答にではなく、1タスクにつき何千回も呼び出しを行うエージェントやコーディングアシスタントにある。1%優れているが3倍高いモデルは、その市場では負ける。

これこそClaudeが「働き手」モデルのように感じられる理由だ。持続的な実務利用のために設計され、そして今や、そのために価格設定されている。

歴史:業界はどうやってここまで来たか

2025年12月を理解するには、2025年初頭の「不満の冬」を振り返る必要がある。

2025年2月までに、スケーリング則は壁にぶつかったように見えた。長らく噂されていた「Orion」ことGPT-4.5――多くの人がGPT-5になると予想していたモデル――は、巨大で運用コストがかさむ割に、日常タスクでは前モデルとほとんど差がなかった。 投資家は神経質になり始めた。物語は「AIはバブルだ」へと傾いていった。

その壁を打ち破ったのは、より大きな事前学習run(プレトレーニング)ではなかった。推論だった。

思考の連鎖(chain of thought)に対する強化学習――モデルに問題を解き進めるよう訓練し、答えが正しければ報酬を与える手法――は、生の事前学習が頭打ちになっていた領域でスケールすることが判明した。OpenAIのoシリーズがそのコンセプトを証明し、8月のGPT-5の発表でそれがフラッグシップに組み込まれ、 2025年末までにはすべての最先端ラボが自社のラインナップを思考モード中心に再構築していた。

今回の12月のリリースサイクルは、その転換が生んだ最初の本格的な収穫だ。結果はどうなったか。壁は打ち破られた。もはや収穫逓減は物語の中心ではなく、差別化こそがそれだ。

展望分析:2026年とその先

では、業界はこれからどこへ向かうのか。

CTOやエンジニアリングマネージャーにとって、2026年の戦略は明確だ。モデル・オーケストレーションである。

「すべてを支配する一つのモデル」を選ぶ時代は終わった。OpenAIのエンタープライズライセンスさえ買っておけば済む、という話ではもはやない。

「ルーター」アーキテクチャ

2026年に勝つスタックは、次のような形になるだろう。

  1. GPT-5.2をトップに置き、「アーキテクト」として機能させる。ユーザーのクエリを受け取り、分解し、実行計画を立てる。
  2. Claude Opus 4.5を「ワーカー」とする。計画を受け取り、具体的なコードやコンテンツを書き、安全性とスタイル面のニュアンスを担保する。
  3. Gemini 3を「目と耳」とする。動画、音声、大規模な文書入力をすべて処理してから、他のモデルにコンテキストを渡す。

知能のコストは下がり続けているが、専門特化した知能の価値は急騰している。

コストというボトルネック

このロケットの勢いを止め得る唯一の要因は請求額だ。ピークの推論能力は今やプレミアム商品であり、GPT-5.2はGPT-5.1より40%高い価格で発表され、そのProティアはThinkingティアのおよそ一桁上で運用される。 「思考」を伴う回答はどれも、単純な回答の何倍ものトークンを消費する――だからこそAnthropicの値下げはこれほど攻撃的な一手であり、計算資源の希少性がアーキテクチャの効率化への移行を押し進め続けているのだ。

2026年は、基本的なタスクをデバイス上でこなす「小型モデル」(SLM)の年になり、複雑な推論が必要な場合にのみビッグ3に判断を委ねるようになるだろう。だが誤解してはならない。ガラスの天井はすでに打ち破られている。

OpenAIとAnthropicは頂点で互いに打ち合いを続けている。Googleはその戦いの舞台となる競技場を建設している。イノベーションのペースは、かつてないほど速い。

出典

Advertisement

🦋 Bluesky での議論

Bluesky で議論する

投稿を検索中...