实时数据台,每日更新
AI 模型排行榜: 现在谁是第一
人们真正引用的排行榜、每个模型的价格和本月新发布,集中在一个会自动更新的页面上。
截至 2026年9月13日,Anthropic 的 Claude Fable 5.1 (max) 领跑 LMArena 文本排行榜,Claude Opus 5 (max) 和 Claude Opus 4.6 (high) 紧随其后。
在知名品牌模型中,GLM 5.3 Flash 最便宜,每百万输出 token 为 US$0.25;Claude Fable 5.1 最贵,为 US$50.00。
榜单顶部通常是统计上的并列:当两个模型的误差区间重叠时,投票无法分出高下。
排行榜
LMArena 文本排行榜:用户同时与两个匿名模型对话,并为更好的回答投票。每个模型一行;不同推理档位合并为排名最高的一档。
| # | 模型 | 厂商 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max) | Anthropic | 1,508 ±9 | 5,783 |
| 2 | Claude Opus 5 (max) | Anthropic | 1,505 ±5 | 20,706 |
| 3 | Claude Opus 4.6 (high) | Anthropic | 1,503 ±4 | 71,993 |
| 4 | Gemini 3.8 Flash (high) | 1,495 ±9 | 5,076 | |
| 5 | Claude Fable 5 | Anthropic | 1,493 ±5 | 30,057 |
| 6 | Gemini 3.7 Flash (high) | 1,490 ±9 | 5,640 | |
| 7 | Claude Opus 4.7 (high) | Anthropic | 1,490 ±4 | 60,002 |
| 8 | Muse Spark 1.3 (max) | Meta | 1,490 ±9 | 4,723 |
| 9 | Muse Spark 1.2 (xhigh) | Meta | 1,489 ±11 | 3,227 |
| 10 | Gemini 3.5 Flash (high) | 1,482 ±4 | 38,257 | |
| 11 | Qwen3.8 (max) | Alibaba | 1,481 ±6 | 16,670 |
| 12 | Muse Spark 1.1 | Meta | 1,480 ±5 | 27,615 |
| 13 | Gemini 3.1 Pro Preview | 1,480 ±3 | 106,951 | |
| 14 | Gemini 3 Pro | 1,479 ±4 | 40,654 | |
| 15 | Gemini 3.6 Flash (high) | 1,476 ±5 | 26,445 | |
| 16 | GLM 5.3 (max)开放权重 | Z.ai | 1,475 ±6 | 10,960 |
| 17 | Qwen3.7 Max Preview | Alibaba | 1,474 ±10 | 3,705 |
| 18 | Muse Spark | Meta | 1,473 ±6 | 13,565 |
| 19 | Kimi K3 (max)开放权重 | Moonshot | 1,472 ±5 | 20,987 |
| 20 | GLM 5.3 Flash开放权重 | Z.ai | 1,472 ±7 | 10,038 |
| 21 | Qwen3.5 Max Preview | Alibaba | 1,471 ±5 | 21,476 |
| 22 | GPT-5.5 (high) | OpenAI | 1,471 ±4 | 64,924 |
| 23 | GPT-5.4 (high) | OpenAI | 1,470 ±4 | 60,537 |
| 24 | ERNIE 5.1 | Baidu | 1,468 ±5 | 37,058 |
| 25 | GLM 5.2 (max)开放权重 | Z.ai | 1,467 ±5 | 36,798 |
LMArena 文本排行榜, 发布于 2026年9月13日。得分为竞技场评分及其 95% 误差区间;区间重叠的行在统计上并列。
最佳开放权重模型
同样的 LMArena 投票,只保留可以自行下载并运行权重的模型。灰色数字是它在总榜中的名次。
| # | 模型 | 厂商 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | GLM 5.3 (max)总榜第 20 | Z.ai | 1,475 ±6 | 10,960 |
| 2 | Kimi K3 (max)总榜第 23 | Moonshot | 1,472 ±5 | 20,987 |
| 3 | GLM 5.3 Flash总榜第 24 | Z.ai | 1,472 ±7 | 10,038 |
| 4 | GLM 5.2 (max)总榜第 29 | Z.ai | 1,467 ±5 | 36,798 |
| 5 | Mimo V2.5 Pro总榜第 32 | Xiaomi | 1,465 ±4 | 60,919 |
| 6 | GLM 5.1总榜第 33 | Z.ai | 1,462 ±4 | 48,901 |
| 7 | Kimi K2.6总榜第 38 | Moonshot | 1,455 ±5 | 37,502 |
| 8 | DeepSeek V4 Pro总榜第 43 | DeepSeek | 1,451 ±4 | 54,130 |
| 9 | GLM 5总榜第 51 | Z.ai | 1,446 ±5 | 27,605 |
| 10 | Kimi K2.5 (thinking)总榜第 53 | Moonshot | 1,446 ±4 | 70,513 |
| 11 | DeepSeek V4 Pro High Preview总榜第 54 | DeepSeek | 1,445 ±4 | 51,485 |
| 12 | Nvidia Nemotron 3 Ultra 550b A55B Nvfp4总榜第 55 | Nvidia | 1,445 ±7 | 10,693 |
| 13 | DeepSeek V4 Pro High 20260813总榜第 58 | DeepSeek | 1,444 ±7 | 9,008 |
| 14 | Gemma 4 31b总榜第 64 | 1,442 ±8 | 5,894 | |
| 15 | Hy3总榜第 65 | Tencent | 1,441 ±8 | 8,047 |
LMArena 文本排行榜, 发布于 2026年9月13日。得分为竞技场评分及其 95% 误差区间;区间重叠的行在统计上并列。
每个模型多少钱
各系列当前模型每百万 token 的标价,从低到高。一百万 token 大约相当于 75 万个英文单词的输入或输出。
| 模型 | 厂商 | 输入 | 输出 | 1 美元可买 | 上下文 |
|---|---|---|---|---|---|
| GLM 5.3 Flash | Z.ai | US$0.075 | US$0.25 | 约 300万 个单词 | 131.1万 |
| DeepSeek V4.1 Flash | DeepSeek | US$0.15 | US$0.60 | 约 125万 个单词 | 104.9万 |
| GPT-5.6 Luna | OpenAI | US$0.20 | US$1.20 | 约 62.5万 个单词 | 105万 |
| DeepSeek V4 Pro 0813 | DeepSeek | US$0.66 | US$1.98 | 约 37.9万 个单词 | 104.9万 |
| Gemini 3.8 Flash | US$0.75 | US$3.75 | 约 20万 个单词 | 104.9万 | |
| GPT-5.4 Mini | OpenAI | US$0.75 | US$4.50 | 约 16.7万 个单词 | 40万 |
| Claude Haiku 4.5 | Anthropic | US$1.00 | US$5.00 | 约 15万 个单词 | 20万 |
| GLM 5.3 | Z.ai | US$1.40 | US$4.40 | 约 17万 个单词 | 131.1万 |
| Grok 4.6 | xAI | US$2.00 | US$6.00 | 约 12.5万 个单词 | 50万 |
| GPT-5.6 Sol | OpenAI | US$2.00 | US$10.00 | 约 7.5万 个单词 | 105万 |
| Claude Sonnet 5 | Anthropic | US$2.00 | US$10.00 | 约 7.5万 个单词 | 100万 |
| GPT-5.6 Terra | OpenAI | US$2.00 | US$12.00 | 约 6.3万 个单词 | 105万 |
| Gemini 3.1 Pro Preview | US$2.00 | US$12.00 | 约 6.3万 个单词 | 104.9万 | |
| Kimi K3 | Moonshot | US$2.648 | US$13.283 | 约 5.6万 个单词 | 104.9万 |
| Claude Opus 5 | Anthropic | US$5.00 | US$25.00 | 约 3万 个单词 | 100万 |
| GPT-6 Astra | OpenAI | US$10.00 | US$50.00 | 约 1.5万 个单词 | 105万 |
| Claude Fable 5.1 | Anthropic | US$10.00 | US$50.00 | 约 1.5万 个单词 | 100万 |
每百万 token 的美元价格,分输入和输出。 OpenRouter 公开模型列表, 核对于 2026年9月15日。这些是标价;做预算前请到厂商官方定价页核实,并注意思考模式会把推理内容按输出计费。
本月新模型
知名厂商在过去 30 天内上架的模型,最新的在前。
| 上架 | 模型 | 厂商 | $/M 输入 / 输出 |
|---|---|---|---|
| 5 天前2026年9月10日 | DeepSeek V4.1 Flash | DeepSeek | US$0.15 / US$0.60 |
| 11 天前2026年9月4日 | GPT-6 Astra | OpenAI | US$10.00 / US$50.00 |
| 11 天前2026年9月4日 | GPT-6 Astra Pro | OpenAI | US$10.00 / US$50.00 |
| 12 天前2026年9月3日 | Qwen3.8 Max (0902) | Alibaba | US$2.00 / US$6.00 |
| 13 天前2026年9月2日 | Muse Spark 1.3 Contributor | Meta | US$0.10 / US$0.20 |
| 13 天前2026年9月2日 | Muse Spark 1.3 | Meta | US$1.25 / US$4.25 |
| 13 天前2026年9月2日 | Gemini 3.8 Flash | US$0.75 / US$3.75 | |
| 14 天前2026年9月1日 | Claude Fable 5.1 | Anthropic | US$10.00 / US$50.00 |
| 15 天前2026年8月31日 | Granite 4.2 8B | IBM | US$0.06 / US$0.25 |
| 18 天前2026年8月28日 | Hy4 preview | Tencent | US$0.834 / US$2.501 |
| 20 天前2026年8月26日 | Qwen3.8 Flash | Alibaba | US$0.15 / US$0.47 |
| 20 天前2026年8月26日 | GLM 5.3 Flash | Z.ai | US$0.075 / US$0.25 |
| 25 天前2026年8月21日 | Muse Spark 1.2 Contributor | Meta | US$0.10 / US$0.20 |
| 25 天前2026年8月21日 | DeepSeek V4 Flash Vision Exp | DeepSeek | US$0.22 / US$0.66 |
| 26 天前2026年8月20日 | Hy-MT2-1.8B | Tencent | US$0.044 / US$0.177 |
| 26 天前2026年8月20日 | Hy-MT2-30B-A3B | Tencent | US$0.074 / US$0.295 |
| 27 天前2026年8月19日 | Hy-MT2-7B | Tencent | US$0.074 / US$0.295 |
| 28 天前2026年8月18日 | GLM 5.3 | Z.ai | US$1.40 / US$4.40 |
过去 30 天主要厂商没有新模型。
主要厂商过去 30 天的上架记录,核对于 2026年9月15日。来源: OpenRouter 模型列表.
排名是怎么来的
LMArena(加州大学伯克利分校 LMSYS 团队原来的 Chatbot Arena)向访问者展示两个匿名模型对同一问题的回答,并请他们选出更好的一个。数百万次这样的投票汇入 Bradley-Terry 评分,它与国际象棋 Elo 属于同一类数学方法,因此一个模型的得分表示它战胜其他模型的频率。每个得分旁的 95% 区间是不确定性:5,000 票的模型区间比 70,000 票的更宽。我们展示的是 LMArena 默认的文本总榜,每个模型一行。LMArena 会把同一模型按不同推理设置("high"、"max")多次列出;我们只保留排名最高的一档,并在括号中注明设置。
价格怎么看
AI 公司按 token 计费,一个 token 约等于四分之三个英文单词,所以一百万 token 大约是 75 万个单词。输入是你发送的内容(你的问题、粘贴的文档),输出是模型写回的内容。贵的是输出,而"思考"或推理模式还会把隐藏的推理过程按输出计费,因此一个难题的花费可能是回答长度所暗示的好几倍。这里的价格是 OpenRouter 公开目录中的标价,与厂商自己的费率一致;OpenAI、Anthropic 和 Google 还为不着急的任务提供半价的批处理档位。做预算前请务必到厂商定价页核实。
你到底该用哪个?
如果你通过聊天应用而不是 API 使用 AI,排行榜没有看上去那么重要。前十名彼此只差几分,ChatGPT、Claude 和 Gemini 的免费档跑的都是这一组的模型,日常真正有差别的是应用的功能:记忆、文件处理、语音,以及你的单位是否允许使用。按你喜欢的应用和愿意付的价格来选。如果你按 token 付费,该看的是价格表:最便宜和最贵的品牌模型相差一百倍以上,日常工作用便宜的那端通常就够了。
这个页面说不了的事
对决投票衡量的是人们在聊天窗口里更喜欢哪个回答。它不衡量编程准确度、长文档处理、图像理解、速度,也不衡量模型在智能体中的表现。LMArena 为其中几项设有单独的榜单,Artificial Analysis 之类的基准测试机构也发布自己的指数。把这张表当作人气投票,而不是整场选举。
常见问题
现在最好的 AI 模型是哪个?
按 LMArena 的盲测对决投票,就是本页表格最上面的那个模型。请看误差区间那一列:如果前几名的区间重叠,它们实际上并列,顺序可能一周一换。
这个页面多久更新一次?
每天一次。LMArena 每隔几天发布新的排行榜快照,OpenRouter 的价格表在厂商调价或上架模型时随时变化;数据台在下一次每日运行时同步两者,并在每张表下方标注最后核对日期。
"开放权重"是什么意思?
厂商以允许你自行下载并运行的许可证发布了模型权重,你可以在自己的硬件或租用的云上运行,而不必只通过厂商的 API。专有模型只能通过开发它的公司使用。
为什么同一个模型在 LMArena 出现两次,这里只有一次?
LMArena 把同一模型在不同推理设置下作为单独的行打分。我们只保留每个模型排名最高的设置,让表格读起来是一份模型清单,并在名称后的括号中注明设置。
最便宜的模型够用吗?
对大多数日常写作、摘要和问答来说够用:大厂的低价档通常是其旗舰的缩小版。需要长而缜密的推理、复杂代码,或者要求一次就给出最佳答案时,再为高价档付费。
继续阅读
- GPT-6 Astra 发布:变了什么
- Claude Fable 5.1:会抓 bug 的模型
- 为什么所有 AI 听起来都一样
- 为什么 Opus 4.6 终结了"副驾驶"时代
- 推理模型解读:先思考再开口的 AI
排名数据:LMArena。价格与上架数据:OpenRouter。两者均在每张表中注明;本站与二者均无关联。