ライブデスク、毎日更新
AIモデル・ランキング: いま1位はどれか
実際に引用されるリーダーボード、各モデルの料金、今月の新モデルを、自動で更新される1ページにまとめました。
2026年9月13日時点で、AnthropicのClaude Fable 5.1 (max)がLMArenaのテキスト・リーダーボードで首位に立ち、Claude Opus 5 (max)とClaude Opus 4.6 (high)が僅差で続いています。
有名ブランドのモデルの中では、GLM 5.3 Flashが出力100万トークンあたり$0.25で最も安く、Claude Fable 5.1が$50.00で最も高額です。
上位は統計的にほぼ同順位であることが多く、2つのモデルの誤差幅が重なる場合、投票では優劣を付けられません。
リーダーボード
LMArenaのテキスト・リーダーボード。利用者が匿名の2モデルと並行して対話し、良い方の回答に投票します。1モデルにつき1行。推論レベルの違いは最上位のものにまとめています。
| # | モデル | 開発元 | スコア | 投票数 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max) | Anthropic | 1,508 ±9 | 5,783 |
| 2 | Claude Opus 5 (max) | Anthropic | 1,505 ±5 | 20,706 |
| 3 | Claude Opus 4.6 (high) | Anthropic | 1,503 ±4 | 71,993 |
| 4 | Gemini 3.8 Flash (high) | 1,495 ±9 | 5,076 | |
| 5 | Claude Fable 5 | Anthropic | 1,493 ±5 | 30,057 |
| 6 | Gemini 3.7 Flash (high) | 1,490 ±9 | 5,640 | |
| 7 | Claude Opus 4.7 (high) | Anthropic | 1,490 ±4 | 60,002 |
| 8 | Muse Spark 1.3 (max) | Meta | 1,490 ±9 | 4,723 |
| 9 | Muse Spark 1.2 (xhigh) | Meta | 1,489 ±11 | 3,227 |
| 10 | Gemini 3.5 Flash (high) | 1,482 ±4 | 38,257 | |
| 11 | Qwen3.8 (max) | Alibaba | 1,481 ±6 | 16,670 |
| 12 | Muse Spark 1.1 | Meta | 1,480 ±5 | 27,615 |
| 13 | Gemini 3.1 Pro Preview | 1,480 ±3 | 106,951 | |
| 14 | Gemini 3 Pro | 1,479 ±4 | 40,654 | |
| 15 | Gemini 3.6 Flash (high) | 1,476 ±5 | 26,445 | |
| 16 | GLM 5.3 (max)オープンウェイト | Z.ai | 1,475 ±6 | 10,960 |
| 17 | Qwen3.7 Max Preview | Alibaba | 1,474 ±10 | 3,705 |
| 18 | Muse Spark | Meta | 1,473 ±6 | 13,565 |
| 19 | Kimi K3 (max)オープンウェイト | Moonshot | 1,472 ±5 | 20,987 |
| 20 | GLM 5.3 Flashオープンウェイト | Z.ai | 1,472 ±7 | 10,038 |
| 21 | Qwen3.5 Max Preview | Alibaba | 1,471 ±5 | 21,476 |
| 22 | GPT-5.5 (high) | OpenAI | 1,471 ±4 | 64,924 |
| 23 | GPT-5.4 (high) | OpenAI | 1,470 ±4 | 60,537 |
| 24 | ERNIE 5.1 | Baidu | 1,468 ±5 | 37,058 |
| 25 | GLM 5.2 (max)オープンウェイト | Z.ai | 1,467 ±5 | 36,798 |
LMArenaテキスト・リーダーボード, 2026年9月13日公開。スコアはアリーナ評価と95%の誤差幅。誤差幅が重なる行は統計的に同順位です。
オープンウェイトの上位モデル
同じLMArenaの投票から、重みを自分でダウンロードして動かせるモデルだけを抜き出したもの。灰色の数字は総合順位です。
| # | モデル | 開発元 | スコア | 投票数 |
|---|---|---|---|---|
| 1 | GLM 5.3 (max)総合20位 | Z.ai | 1,475 ±6 | 10,960 |
| 2 | Kimi K3 (max)総合23位 | Moonshot | 1,472 ±5 | 20,987 |
| 3 | GLM 5.3 Flash総合24位 | Z.ai | 1,472 ±7 | 10,038 |
| 4 | GLM 5.2 (max)総合29位 | Z.ai | 1,467 ±5 | 36,798 |
| 5 | Mimo V2.5 Pro総合32位 | Xiaomi | 1,465 ±4 | 60,919 |
| 6 | GLM 5.1総合33位 | Z.ai | 1,462 ±4 | 48,901 |
| 7 | Kimi K2.6総合38位 | Moonshot | 1,455 ±5 | 37,502 |
| 8 | DeepSeek V4 Pro総合43位 | DeepSeek | 1,451 ±4 | 54,130 |
| 9 | GLM 5総合51位 | Z.ai | 1,446 ±5 | 27,605 |
| 10 | Kimi K2.5 (thinking)総合53位 | Moonshot | 1,446 ±4 | 70,513 |
| 11 | DeepSeek V4 Pro High Preview総合54位 | DeepSeek | 1,445 ±4 | 51,485 |
| 12 | Nvidia Nemotron 3 Ultra 550b A55B Nvfp4総合55位 | Nvidia | 1,445 ±7 | 10,693 |
| 13 | DeepSeek V4 Pro High 20260813総合58位 | DeepSeek | 1,444 ±7 | 9,008 |
| 14 | Gemma 4 31b総合64位 | 1,442 ±8 | 5,894 | |
| 15 | Hy3総合65位 | Tencent | 1,441 ±8 | 8,047 |
LMArenaテキスト・リーダーボード, 2026年9月13日公開。スコアはアリーナ評価と95%の誤差幅。誤差幅が重なる行は統計的に同順位です。
各モデルの料金
各ファミリーの現行モデルの100万トークンあたり定価、安い順。100万トークンはおよそ75万語のテキスト(入力または出力)に相当します。
| モデル | 開発元 | 入力 | 出力 | 1ドルで | コンテキスト |
|---|---|---|---|---|---|
| GLM 5.3 Flash | Z.ai | $0.075 | $0.25 | 約300万語 | 131.1万 |
| DeepSeek V4.1 Flash | DeepSeek | $0.15 | $0.60 | 約125万語 | 104.9万 |
| GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | 約62.5万語 | 105万 |
| DeepSeek V4 Pro 0813 | DeepSeek | $0.66 | $1.98 | 約37.9万語 | 104.9万 |
| Gemini 3.8 Flash | $0.75 | $3.75 | 約20万語 | 104.9万 | |
| GPT-5.4 Mini | OpenAI | $0.75 | $4.50 | 約16.7万語 | 40万 |
| Claude Haiku 4.5 | Anthropic | $1.00 | $5.00 | 約15万語 | 20万 |
| GLM 5.3 | Z.ai | $1.40 | $4.40 | 約17万語 | 131.1万 |
| Grok 4.6 | xAI | $2.00 | $6.00 | 約12.5万語 | 50万 |
| GPT-5.6 Sol | OpenAI | $2.00 | $10.00 | 約7.5万語 | 105万 |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | 約7.5万語 | 100万 |
| GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | 約6.3万語 | 105万 |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 | 約6.3万語 | 104.9万 | |
| Kimi K3 | Moonshot | $2.648 | $13.283 | 約5.6万語 | 104.9万 |
| Claude Opus 5 | Anthropic | $5.00 | $25.00 | 約3万語 | 100万 |
| GPT-6 Astra | OpenAI | $10.00 | $50.00 | 約1.5万語 | 105万 |
| Claude Fable 5.1 | Anthropic | $10.00 | $50.00 | 約1.5万語 | 100万 |
100万トークンあたりの米ドル、入力と出力。 OpenRouterの公開モデル一覧, 2026年9月15日確認。これは定価です。予算を組む前に開発元の料金ページで確認してください。思考モードは推論分も出力として課金されます。
今月の新モデル
有名メーカーのモデルのうち、過去30日間に登録されたもの。新しい順。
| 登録日 | モデル | 開発元 | $/M 入力 / 出力 |
|---|---|---|---|
| 5日前2026年9月10日 | DeepSeek V4.1 Flash | DeepSeek | $0.15 / $0.60 |
| 11日前2026年9月4日 | GPT-6 Astra | OpenAI | $10.00 / $50.00 |
| 11日前2026年9月4日 | GPT-6 Astra Pro | OpenAI | $10.00 / $50.00 |
| 12日前2026年9月3日 | Qwen3.8 Max (0902) | Alibaba | $2.00 / $6.00 |
| 13日前2026年9月2日 | Muse Spark 1.3 Contributor | Meta | $0.10 / $0.20 |
| 13日前2026年9月2日 | Muse Spark 1.3 | Meta | $1.25 / $4.25 |
| 13日前2026年9月2日 | Gemini 3.8 Flash | $0.75 / $3.75 | |
| 14日前2026年9月1日 | Claude Fable 5.1 | Anthropic | $10.00 / $50.00 |
| 15日前2026年8月31日 | Granite 4.2 8B | IBM | $0.06 / $0.25 |
| 18日前2026年8月28日 | Hy4 preview | Tencent | $0.834 / $2.501 |
| 20日前2026年8月26日 | Qwen3.8 Flash | Alibaba | $0.15 / $0.47 |
| 20日前2026年8月26日 | GLM 5.3 Flash | Z.ai | $0.075 / $0.25 |
| 25日前2026年8月21日 | Muse Spark 1.2 Contributor | Meta | $0.10 / $0.20 |
| 25日前2026年8月21日 | DeepSeek V4 Flash Vision Exp | DeepSeek | $0.22 / $0.66 |
| 26日前2026年8月20日 | Hy-MT2-1.8B | Tencent | $0.044 / $0.177 |
| 26日前2026年8月20日 | Hy-MT2-30B-A3B | Tencent | $0.074 / $0.295 |
| 27日前2026年8月19日 | Hy-MT2-7B | Tencent | $0.074 / $0.295 |
| 28日前2026年8月18日 | GLM 5.3 | Z.ai | $1.40 / $4.40 |
過去30日間、主要メーカーの新モデルはありません。
主要メーカーによる過去30日間の登録。2026年9月15日確認。出典: OpenRouterのモデル一覧.
ランキングの仕組み
LMArena(UCバークレーのLMSYSグループによる旧Chatbot Arena)は、訪問者に同じ質問へ答える匿名の2モデルを見せ、どちらの回答が良かったかを尋ねます。何百万というその投票がBradley-Terry評価に反映されます。チェスのEloと同じ系統の数学で、モデルのスコアは他のモデルに対してどれだけ勝つかを表します。各スコアの横の95%の幅は不確実性で、投票5,000件のモデルは70,000件のモデルより幅が広くなります。ここではLMArenaの標準の総合テキストボードを、1モデル1行で表示しています。LMArenaは同じモデルを異なる推論設定(「high」「max」)で複数回掲載しますが、当サイトでは最上位のものだけを残し、設定を括弧内に示しています。
料金の読み方
AI企業はトークン単位で課金し、1トークンは英単語の約4分の3にあたるため、100万トークンはおよそ75万語です。入力はあなたが送るもの(質問や貼り付けた文書)、出力はモデルが書き返すものです。高いのは出力側で、「思考」や推論モードは隠れた推論も出力として課金するため、難しい質問は回答の長さから想像するより数倍の費用になることがあります。ここに示す料金はOpenRouterの公開カタログの定価で、各社自身の料金を反映しています。OpenAI、Anthropic、Googleは、急がない処理向けに半額のバッチ料金も販売しています。予算を組む前には必ず開発元の料金ページで確認してください。
実際にはどれを使うべきか
APIではなくチャットアプリでAIを使うなら、ランキングは見た目ほど重要ではありません。上位10モデルは数ポイント差の中にあり、ChatGPT、Claude、Geminiの無料プランはいずれもこのグループのモデルで動いており、日常で差が出るのはアプリの機能です。記憶、ファイルの扱い、音声、そして職場で使えるかどうか。気に入ったアプリと支払う料金で選んでください。トークン単位で支払うなら、読むべきは料金表です。最も安いブランドモデルと最も高いモデルの差は100倍を超え、日常的な作業なら安い側でたいてい十分です。
このページがわからないこと
対戦投票が測るのは、チャット画面で人がどちらの回答を好んだかです。コーディングの正確さ、長文文書の処理、画像理解、速度、エージェント内での挙動は測りません。LMArenaはその一部について別のボードを運営しており、Artificial Analysisのようなベンチマーク集は独自の指標を公開しています。この表は「人気投票」であって、選挙の全体ではないと考えてください。
よくある質問
いま最も優れたAIモデルはどれですか?
LMArenaのブラインド対戦投票によれば、このページの表の最上位にあるモデルです。誤差幅の列を確認してください。上位数モデルの幅が重なっていれば実質的に同順位で、順位は週ごとに入れ替わることがあります。
このページはどのくらいの頻度で更新されますか?
1日1回です。LMArenaは数日おきに新しいリーダーボードのスナップショットを公開し、OpenRouterの料金表は開発元が価格を変更したりモデルを登録したりするたびに変わります。デスクは次の日次実行でその両方を取り込み、各表の下に最終確認日を記します。
「オープンウェイト」とは何ですか?
開発元がモデルの重みを、自分でダウンロードして自前のハードウェアや借りたクラウドで動かせるライセンスで公開していることです。プロプライエタリなモデルは、それを作った企業を通じてしか使えません。
LMArenaでは同じモデルが2回載っているのに、ここでは1回なのはなぜ?
LMArenaは同じモデルを異なる推論設定ごとに別の行として採点します。当サイトでは各モデルの最上位の設定だけを残してモデルの一覧として読めるようにし、設定は名前の後ろの括弧内に示しています。
最も安いモデルで十分ですか?
日常的な文章作成、要約、質問への回答の大半には十分です。大手の安価な階層は、たいていそのフラッグシップの小型版です。長く慎重な推論、複雑なコード、最初の一回で最良の回答が必要なときに高価な階層に払ってください。
続けて読む
- GPT-6 Astra登場:何が変わったか
- Claude Fable 5.1:バグを狩るモデル
- なぜどのAIも同じように聞こえるのか
- Opus 4.6が「コパイロット時代」を終わらせた理由
- 推論モデル入門:話す前に考えるAI
ランキングデータ:LMArena。料金・登録データ:OpenRouter。いずれも各表に出典を明記しています。当サイトはどちらとも提携関係にありません。