ライブデスク、毎日更新

AIモデル・ランキング: いま1位はどれか

実際に引用されるリーダーボード、各モデルの料金、今月の新モデルを、自動で更新される1ページにまとめました。

2026年9月13日時点で、AnthropicのClaude Fable 5.1 (max)がLMArenaのテキスト・リーダーボードで首位に立ち、Claude Opus 5 (max)とClaude Opus 4.6 (high)が僅差で続いています。

有名ブランドのモデルの中では、GLM 5.3 Flashが出力100万トークンあたり$0.25で最も安く、Claude Fable 5.1が$50.00で最も高額です。

上位は統計的にほぼ同順位であることが多く、2つのモデルの誤差幅が重なる場合、投票では優劣を付けられません。

リーダーボード

LMArenaのテキスト・リーダーボード。利用者が匿名の2モデルと並行して対話し、良い方の回答に投票します。1モデルにつき1行。推論レベルの違いは最上位のものにまとめています。

#モデル開発元スコア投票数
1 Claude Fable 5.1 (max) Anthropic 1,508 ±9 5,783
2 Claude Opus 5 (max) Anthropic 1,505 ±5 20,706
3 Claude Opus 4.6 (high) Anthropic 1,503 ±4 71,993
4 Gemini 3.8 Flash (high) Google 1,495 ±9 5,076
5 Claude Fable 5 Anthropic 1,493 ±5 30,057
6 Gemini 3.7 Flash (high) Google 1,490 ±9 5,640
7 Claude Opus 4.7 (high) Anthropic 1,490 ±4 60,002
8 Muse Spark 1.3 (max) Meta 1,490 ±9 4,723
9 Muse Spark 1.2 (xhigh) Meta 1,489 ±11 3,227
10 Gemini 3.5 Flash (high) Google 1,482 ±4 38,257
11 Qwen3.8 (max) Alibaba 1,481 ±6 16,670
12 Muse Spark 1.1 Meta 1,480 ±5 27,615
13 Gemini 3.1 Pro Preview Google 1,480 ±3 106,951
14 Gemini 3 Pro Google 1,479 ±4 40,654
15 Gemini 3.6 Flash (high) Google 1,476 ±5 26,445
16 GLM 5.3 (max)オープンウェイト Z.ai 1,475 ±6 10,960
17 Qwen3.7 Max Preview Alibaba 1,474 ±10 3,705
18 Muse Spark Meta 1,473 ±6 13,565
19 Kimi K3 (max)オープンウェイト Moonshot 1,472 ±5 20,987
20 GLM 5.3 Flashオープンウェイト Z.ai 1,472 ±7 10,038
21 Qwen3.5 Max Preview Alibaba 1,471 ±5 21,476
22 GPT-5.5 (high) OpenAI 1,471 ±4 64,924
23 GPT-5.4 (high) OpenAI 1,470 ±4 60,537
24 ERNIE 5.1 Baidu 1,468 ±5 37,058
25 GLM 5.2 (max)オープンウェイト Z.ai 1,467 ±5 36,798

LMArenaテキスト・リーダーボード, 2026年9月13日公開。スコアはアリーナ評価と95%の誤差幅。誤差幅が重なる行は統計的に同順位です。

オープンウェイトの上位モデル

同じLMArenaの投票から、重みを自分でダウンロードして動かせるモデルだけを抜き出したもの。灰色の数字は総合順位です。

#モデル開発元スコア投票数
1 GLM 5.3 (max)総合20位 Z.ai 1,475 ±6 10,960
2 Kimi K3 (max)総合23位 Moonshot 1,472 ±5 20,987
3 GLM 5.3 Flash総合24位 Z.ai 1,472 ±7 10,038
4 GLM 5.2 (max)総合29位 Z.ai 1,467 ±5 36,798
5 Mimo V2.5 Pro総合32位 Xiaomi 1,465 ±4 60,919
6 GLM 5.1総合33位 Z.ai 1,462 ±4 48,901
7 Kimi K2.6総合38位 Moonshot 1,455 ±5 37,502
8 DeepSeek V4 Pro総合43位 DeepSeek 1,451 ±4 54,130
9 GLM 5総合51位 Z.ai 1,446 ±5 27,605
10 Kimi K2.5 (thinking)総合53位 Moonshot 1,446 ±4 70,513
11 DeepSeek V4 Pro High Preview総合54位 DeepSeek 1,445 ±4 51,485
12 Nvidia Nemotron 3 Ultra 550b A55B Nvfp4総合55位 Nvidia 1,445 ±7 10,693
13 DeepSeek V4 Pro High 20260813総合58位 DeepSeek 1,444 ±7 9,008
14 Gemma 4 31b総合64位 Google 1,442 ±8 5,894
15 Hy3総合65位 Tencent 1,441 ±8 8,047

LMArenaテキスト・リーダーボード, 2026年9月13日公開。スコアはアリーナ評価と95%の誤差幅。誤差幅が重なる行は統計的に同順位です。

Advertisement

各モデルの料金

各ファミリーの現行モデルの100万トークンあたり定価、安い順。100万トークンはおよそ75万語のテキスト(入力または出力)に相当します。

モデル開発元入力出力1ドルでコンテキスト
GLM 5.3 Flash Z.ai $0.075 $0.25 約300万語 131.1万
DeepSeek V4.1 Flash DeepSeek $0.15 $0.60 約125万語 104.9万
GPT-5.6 Luna OpenAI $0.20 $1.20 約62.5万語 105万
DeepSeek V4 Pro 0813 DeepSeek $0.66 $1.98 約37.9万語 104.9万
Gemini 3.8 Flash Google $0.75 $3.75 約20万語 104.9万
GPT-5.4 Mini OpenAI $0.75 $4.50 約16.7万語 40万
Claude Haiku 4.5 Anthropic $1.00 $5.00 約15万語 20万
GLM 5.3 Z.ai $1.40 $4.40 約17万語 131.1万
Grok 4.6 xAI $2.00 $6.00 約12.5万語 50万
GPT-5.6 Sol OpenAI $2.00 $10.00 約7.5万語 105万
Claude Sonnet 5 Anthropic $2.00 $10.00 約7.5万語 100万
GPT-5.6 Terra OpenAI $2.00 $12.00 約6.3万語 105万
Gemini 3.1 Pro Preview Google $2.00 $12.00 約6.3万語 104.9万
Kimi K3 Moonshot $2.648 $13.283 約5.6万語 104.9万
Claude Opus 5 Anthropic $5.00 $25.00 約3万語 100万
GPT-6 Astra OpenAI $10.00 $50.00 約1.5万語 105万
Claude Fable 5.1 Anthropic $10.00 $50.00 約1.5万語 100万

100万トークンあたりの米ドル、入力と出力。 OpenRouterの公開モデル一覧, 2026年9月15日確認。これは定価です。予算を組む前に開発元の料金ページで確認してください。思考モードは推論分も出力として課金されます。

今月の新モデル

有名メーカーのモデルのうち、過去30日間に登録されたもの。新しい順。

登録日モデル開発元$/M 入力 / 出力
5日前2026年9月10日 DeepSeek V4.1 Flash DeepSeek $0.15 / $0.60
11日前2026年9月4日 GPT-6 Astra OpenAI $10.00 / $50.00
11日前2026年9月4日 GPT-6 Astra Pro OpenAI $10.00 / $50.00
12日前2026年9月3日 Qwen3.8 Max (0902) Alibaba $2.00 / $6.00
13日前2026年9月2日 Muse Spark 1.3 Contributor Meta $0.10 / $0.20
13日前2026年9月2日 Muse Spark 1.3 Meta $1.25 / $4.25
13日前2026年9月2日 Gemini 3.8 Flash Google $0.75 / $3.75
14日前2026年9月1日 Claude Fable 5.1 Anthropic $10.00 / $50.00
15日前2026年8月31日 Granite 4.2 8B IBM $0.06 / $0.25
18日前2026年8月28日 Hy4 preview Tencent $0.834 / $2.501
20日前2026年8月26日 Qwen3.8 Flash Alibaba $0.15 / $0.47
20日前2026年8月26日 GLM 5.3 Flash Z.ai $0.075 / $0.25
25日前2026年8月21日 Muse Spark 1.2 Contributor Meta $0.10 / $0.20
25日前2026年8月21日 DeepSeek V4 Flash Vision Exp DeepSeek $0.22 / $0.66
26日前2026年8月20日 Hy-MT2-1.8B Tencent $0.044 / $0.177
26日前2026年8月20日 Hy-MT2-30B-A3B Tencent $0.074 / $0.295
27日前2026年8月19日 Hy-MT2-7B Tencent $0.074 / $0.295
28日前2026年8月18日 GLM 5.3 Z.ai $1.40 / $4.40

主要メーカーによる過去30日間の登録。2026年9月15日確認。出典: OpenRouterのモデル一覧.

ランキングの仕組み

LMArena(UCバークレーのLMSYSグループによる旧Chatbot Arena)は、訪問者に同じ質問へ答える匿名の2モデルを見せ、どちらの回答が良かったかを尋ねます。何百万というその投票がBradley-Terry評価に反映されます。チェスのEloと同じ系統の数学で、モデルのスコアは他のモデルに対してどれだけ勝つかを表します。各スコアの横の95%の幅は不確実性で、投票5,000件のモデルは70,000件のモデルより幅が広くなります。ここではLMArenaの標準の総合テキストボードを、1モデル1行で表示しています。LMArenaは同じモデルを異なる推論設定(「high」「max」)で複数回掲載しますが、当サイトでは最上位のものだけを残し、設定を括弧内に示しています。

料金の読み方

AI企業はトークン単位で課金し、1トークンは英単語の約4分の3にあたるため、100万トークンはおよそ75万語です。入力はあなたが送るもの(質問や貼り付けた文書)、出力はモデルが書き返すものです。高いのは出力側で、「思考」や推論モードは隠れた推論も出力として課金するため、難しい質問は回答の長さから想像するより数倍の費用になることがあります。ここに示す料金はOpenRouterの公開カタログの定価で、各社自身の料金を反映しています。OpenAI、Anthropic、Googleは、急がない処理向けに半額のバッチ料金も販売しています。予算を組む前には必ず開発元の料金ページで確認してください。

Advertisement

実際にはどれを使うべきか

APIではなくチャットアプリでAIを使うなら、ランキングは見た目ほど重要ではありません。上位10モデルは数ポイント差の中にあり、ChatGPT、Claude、Geminiの無料プランはいずれもこのグループのモデルで動いており、日常で差が出るのはアプリの機能です。記憶、ファイルの扱い、音声、そして職場で使えるかどうか。気に入ったアプリと支払う料金で選んでください。トークン単位で支払うなら、読むべきは料金表です。最も安いブランドモデルと最も高いモデルの差は100倍を超え、日常的な作業なら安い側でたいてい十分です。

このページがわからないこと

対戦投票が測るのは、チャット画面で人がどちらの回答を好んだかです。コーディングの正確さ、長文文書の処理、画像理解、速度、エージェント内での挙動は測りません。LMArenaはその一部について別のボードを運営しており、Artificial Analysisのようなベンチマーク集は独自の指標を公開しています。この表は「人気投票」であって、選挙の全体ではないと考えてください。

よくある質問

いま最も優れたAIモデルはどれですか?

LMArenaのブラインド対戦投票によれば、このページの表の最上位にあるモデルです。誤差幅の列を確認してください。上位数モデルの幅が重なっていれば実質的に同順位で、順位は週ごとに入れ替わることがあります。

このページはどのくらいの頻度で更新されますか?

1日1回です。LMArenaは数日おきに新しいリーダーボードのスナップショットを公開し、OpenRouterの料金表は開発元が価格を変更したりモデルを登録したりするたびに変わります。デスクは次の日次実行でその両方を取り込み、各表の下に最終確認日を記します。

「オープンウェイト」とは何ですか?

開発元がモデルの重みを、自分でダウンロードして自前のハードウェアや借りたクラウドで動かせるライセンスで公開していることです。プロプライエタリなモデルは、それを作った企業を通じてしか使えません。

LMArenaでは同じモデルが2回載っているのに、ここでは1回なのはなぜ?

LMArenaは同じモデルを異なる推論設定ごとに別の行として採点します。当サイトでは各モデルの最上位の設定だけを残してモデルの一覧として読めるようにし、設定は名前の後ろの括弧内に示しています。

最も安いモデルで十分ですか?

日常的な文章作成、要約、質問への回答の大半には十分です。大手の安価な階層は、たいていそのフラッグシップの小型版です。長く慎重な推論、複雑なコード、最初の一回で最良の回答が必要なときに高価な階層に払ってください。

続けて読む

ランキングデータ:LMArena。料金・登録データ:OpenRouter。いずれも各表に出典を明記しています。当サイトはどちらとも提携関係にありません。

Advertisement