실시간 데스크, 매일 갱신

AI 모델 순위: 지금 1위는 누구인가

사람들이 실제로 인용하는 리더보드, 모델별 가격, 이달의 출시작을 스스로 갱신되는 한 페이지에 모았습니다.

2026년 9월 13일 기준, Anthropic의 Claude Fable 5.1 (max)가 LMArena 텍스트 리더보드 1위이며 Claude Opus 5 (max)와 Claude Opus 4.6 (high)가 근소한 차이로 뒤를 잇습니다.

유명 브랜드 모델 중에서는 GLM 5.3 Flash가 출력 100만 토큰당 US$0.25로 가장 저렴하고 Claude Fable 5.1가 US$50.00로 가장 비쌉니다.

표 상단은 대개 통계적 동률입니다. 두 모델의 오차 범위가 겹치면 투표로는 우열을 가릴 수 없습니다.

리더보드

LMArena 텍스트 리더보드: 사용자가 익명의 두 모델과 나란히 대화하고 더 나은 답변에 투표합니다. 모델당 한 줄이며, 추론 단계는 가장 높은 순위 하나로 합쳤습니다.

#모델제작사점수투표 수
1 Claude Fable 5.1 (max) Anthropic 1,508 ±9 5,783
2 Claude Opus 5 (max) Anthropic 1,505 ±5 20,706
3 Claude Opus 4.6 (high) Anthropic 1,503 ±4 71,993
4 Gemini 3.8 Flash (high) Google 1,495 ±9 5,076
5 Claude Fable 5 Anthropic 1,493 ±5 30,057
6 Gemini 3.7 Flash (high) Google 1,490 ±9 5,640
7 Claude Opus 4.7 (high) Anthropic 1,490 ±4 60,002
8 Muse Spark 1.3 (max) Meta 1,490 ±9 4,723
9 Muse Spark 1.2 (xhigh) Meta 1,489 ±11 3,227
10 Gemini 3.5 Flash (high) Google 1,482 ±4 38,257
11 Qwen3.8 (max) Alibaba 1,481 ±6 16,670
12 Muse Spark 1.1 Meta 1,480 ±5 27,615
13 Gemini 3.1 Pro Preview Google 1,480 ±3 106,951
14 Gemini 3 Pro Google 1,479 ±4 40,654
15 Gemini 3.6 Flash (high) Google 1,476 ±5 26,445
16 GLM 5.3 (max)오픈 웨이트 Z.ai 1,475 ±6 10,960
17 Qwen3.7 Max Preview Alibaba 1,474 ±10 3,705
18 Muse Spark Meta 1,473 ±6 13,565
19 Kimi K3 (max)오픈 웨이트 Moonshot 1,472 ±5 20,987
20 GLM 5.3 Flash오픈 웨이트 Z.ai 1,472 ±7 10,038
21 Qwen3.5 Max Preview Alibaba 1,471 ±5 21,476
22 GPT-5.5 (high) OpenAI 1,471 ±4 64,924
23 GPT-5.4 (high) OpenAI 1,470 ±4 60,537
24 ERNIE 5.1 Baidu 1,468 ±5 37,058
25 GLM 5.2 (max)오픈 웨이트 Z.ai 1,467 ±5 36,798

LMArena 텍스트 리더보드, 2026년 9월 13일 게시. 점수는 아레나 평점과 95% 오차 범위이며, 범위가 겹치는 줄은 통계적으로 동률입니다.

오픈 웨이트 상위 모델

같은 LMArena 투표에서 가중치를 직접 내려받아 실행할 수 있는 모델만 추린 순위입니다. 회색 숫자는 종합 순위입니다.

#모델제작사점수투표 수
1 GLM 5.3 (max)종합 20위 Z.ai 1,475 ±6 10,960
2 Kimi K3 (max)종합 23위 Moonshot 1,472 ±5 20,987
3 GLM 5.3 Flash종합 24위 Z.ai 1,472 ±7 10,038
4 GLM 5.2 (max)종합 29위 Z.ai 1,467 ±5 36,798
5 Mimo V2.5 Pro종합 32위 Xiaomi 1,465 ±4 60,919
6 GLM 5.1종합 33위 Z.ai 1,462 ±4 48,901
7 Kimi K2.6종합 38위 Moonshot 1,455 ±5 37,502
8 DeepSeek V4 Pro종합 43위 DeepSeek 1,451 ±4 54,130
9 GLM 5종합 51위 Z.ai 1,446 ±5 27,605
10 Kimi K2.5 (thinking)종합 53위 Moonshot 1,446 ±4 70,513
11 DeepSeek V4 Pro High Preview종합 54위 DeepSeek 1,445 ±4 51,485
12 Nvidia Nemotron 3 Ultra 550b A55B Nvfp4종합 55위 Nvidia 1,445 ±7 10,693
13 DeepSeek V4 Pro High 20260813종합 58위 DeepSeek 1,444 ±7 9,008
14 Gemma 4 31b종합 64위 Google 1,442 ±8 5,894
15 Hy3종합 65위 Tencent 1,441 ±8 8,047

LMArena 텍스트 리더보드, 2026년 9월 13일 게시. 점수는 아레나 평점과 95% 오차 범위이며, 범위가 겹치는 줄은 통계적으로 동률입니다.

Advertisement

모델별 비용

각 제품군의 현행 모델에 대한 100만 토큰당 정가, 저렴한 순. 100만 토큰은 대략 75만 단어의 텍스트(입력 또는 출력)입니다.

모델제작사입력출력1달러로컨텍스트
GLM 5.3 Flash Z.ai US$0.075 US$0.25 약 300만 단어 131.1만
DeepSeek V4.1 Flash DeepSeek US$0.15 US$0.60 약 125만 단어 104.9만
GPT-5.6 Luna OpenAI US$0.20 US$1.20 약 62.5만 단어 105만
DeepSeek V4 Pro 0813 DeepSeek US$0.66 US$1.98 약 37.9만 단어 104.9만
Gemini 3.8 Flash Google US$0.75 US$3.75 약 20만 단어 104.9만
GPT-5.4 Mini OpenAI US$0.75 US$4.50 약 16.7만 단어 40만
Claude Haiku 4.5 Anthropic US$1.00 US$5.00 약 15만 단어 20만
GLM 5.3 Z.ai US$1.40 US$4.40 약 17만 단어 131.1만
Grok 4.6 xAI US$2.00 US$6.00 약 12.5만 단어 50만
GPT-5.6 Sol OpenAI US$2.00 US$10.00 약 7.5만 단어 105만
Claude Sonnet 5 Anthropic US$2.00 US$10.00 약 7.5만 단어 100만
GPT-5.6 Terra OpenAI US$2.00 US$12.00 약 6.3만 단어 105만
Gemini 3.1 Pro Preview Google US$2.00 US$12.00 약 6.3만 단어 104.9만
Kimi K3 Moonshot US$2.648 US$13.283 약 5.6만 단어 104.9만
Claude Opus 5 Anthropic US$5.00 US$25.00 약 3만 단어 100만
GPT-6 Astra OpenAI US$10.00 US$50.00 약 1.5만 단어 105만
Claude Fable 5.1 Anthropic US$10.00 US$50.00 약 1.5만 단어 100만

100만 토큰당 미국 달러, 입력과 출력. OpenRouter 공개 모델 목록, 2026년 9월 15일 확인. 정가 기준이므로 예산을 잡기 전에 제작사 요금 페이지를 확인하세요. 사고 모드는 추론 분량도 출력으로 과금됩니다.

이달의 신모델

잘 알려진 제작사의 모델 중 최근 30일 안에 등록된 것, 최신순.

등록일모델제작사$/M 입력 / 출력
5일 전2026년 9월 10일 DeepSeek V4.1 Flash DeepSeek US$0.15 / US$0.60
11일 전2026년 9월 4일 GPT-6 Astra OpenAI US$10.00 / US$50.00
11일 전2026년 9월 4일 GPT-6 Astra Pro OpenAI US$10.00 / US$50.00
12일 전2026년 9월 3일 Qwen3.8 Max (0902) Alibaba US$2.00 / US$6.00
13일 전2026년 9월 2일 Muse Spark 1.3 Contributor Meta US$0.10 / US$0.20
13일 전2026년 9월 2일 Muse Spark 1.3 Meta US$1.25 / US$4.25
13일 전2026년 9월 2일 Gemini 3.8 Flash Google US$0.75 / US$3.75
14일 전2026년 9월 1일 Claude Fable 5.1 Anthropic US$10.00 / US$50.00
15일 전2026년 8월 31일 Granite 4.2 8B IBM US$0.06 / US$0.25
18일 전2026년 8월 28일 Hy4 preview Tencent US$0.834 / US$2.501
20일 전2026년 8월 26일 Qwen3.8 Flash Alibaba US$0.15 / US$0.47
20일 전2026년 8월 26일 GLM 5.3 Flash Z.ai US$0.075 / US$0.25
25일 전2026년 8월 21일 Muse Spark 1.2 Contributor Meta US$0.10 / US$0.20
25일 전2026년 8월 21일 DeepSeek V4 Flash Vision Exp DeepSeek US$0.22 / US$0.66
26일 전2026년 8월 20일 Hy-MT2-1.8B Tencent US$0.044 / US$0.177
26일 전2026년 8월 20일 Hy-MT2-30B-A3B Tencent US$0.074 / US$0.295
27일 전2026년 8월 19일 Hy-MT2-7B Tencent US$0.074 / US$0.295
28일 전2026년 8월 18일 GLM 5.3 Z.ai US$1.40 / US$4.40

주요 제작사의 최근 30일 등록 목록, 2026년 9월 15일 확인. 출처: OpenRouter 모델 목록.

순위가 매겨지는 방식

LMArena(UC 버클리 LMSYS 그룹의 옛 Chatbot Arena)는 방문자에게 같은 질문에 답하는 익명의 두 모델을 보여주고 어느 답이 더 나은지 묻습니다. 수백만 건의 그 투표가 체스 Elo와 같은 계열의 수학인 Bradley-Terry 평점에 반영되므로, 모델의 점수는 다른 모델들을 상대로 얼마나 자주 이기는지를 뜻합니다. 각 점수 옆의 95% 범위는 불확실성으로, 투표 5,000건인 모델은 70,000건인 모델보다 범위가 넓습니다. 이 페이지는 LMArena의 기본 종합 텍스트 보드를 모델당 한 줄로 보여줍니다. LMArena는 같은 모델을 추론 설정("high", "max")별로 여러 번 싣지만, 우리는 가장 순위가 높은 것만 남기고 설정을 괄호 안에 표시합니다.

가격 읽는 법

AI 회사는 토큰 단위로 과금하며 토큰 하나는 영어 단어의 약 4분의 3이므로 100만 토큰은 대략 75만 단어입니다. 입력은 여러분이 보내는 것(질문, 붙여넣은 문서)이고 출력은 모델이 써 주는 답입니다. 비싼 쪽은 출력이며, "사고" 또는 추론 모드는 숨겨진 추론까지 출력으로 과금하므로 어려운 질문은 답의 길이로 짐작한 것보다 몇 배의 비용이 들 수 있습니다. 여기 가격은 OpenRouter 공개 카탈로그의 정가로, 제작사 자체 요금을 그대로 반영합니다. OpenAI, Anthropic, Google은 기다릴 수 있는 작업용으로 반값의 배치 요금제도 판매합니다. 예산을 잡기 전에는 반드시 제작사 요금 페이지에서 확인하세요.

Advertisement

실제로 무엇을 써야 할까?

API가 아니라 채팅 앱으로 AI를 쓴다면 순위는 보이는 것만큼 중요하지 않습니다. 상위 10개는 몇 점 차이 안에 있고, ChatGPT, Claude, Gemini의 무료 등급은 모두 이 그룹의 모델로 돌아가며, 일상에서 차이가 나는 것은 앱의 기능입니다. 기억, 파일 처리, 음성, 그리고 직장에서 허용되는지 여부. 마음에 드는 앱과 지불할 가격으로 고르세요. 토큰 단위로 돈을 낸다면 읽어야 할 것은 비용표입니다. 가장 싼 브랜드 모델과 가장 비싼 모델의 차이는 100배가 넘고, 일상 업무에는 대개 싼 쪽이면 충분합니다.

이 페이지가 말해 주지 않는 것

맞대결 투표는 채팅창에서 사람들이 어느 답을 선호했는지를 잽니다. 코딩 정확도, 긴 문서 작업, 이미지 이해, 속도, 에이전트 안에서의 동작은 재지 않습니다. LMArena는 그중 몇 가지에 대해 별도의 보드를 운영하며, Artificial Analysis 같은 벤치마크 모음은 자체 지수를 발표합니다. 이 표는 전체 선거가 아니라 인기 투표로 보세요.

자주 묻는 질문

지금 가장 좋은 AI 모델은 무엇인가요?

LMArena의 블라인드 맞대결 투표 기준으로는 이 페이지 표의 맨 위에 있는 모델입니다. 오차 범위 열을 확인하세요. 상위 몇 개의 범위가 겹치면 사실상 동률이며, 순서는 주마다 바뀔 수 있습니다.

이 페이지는 얼마나 자주 갱신되나요?

하루 한 번입니다. LMArena는 며칠마다 새 리더보드 스냅샷을 내고, OpenRouter 가격표는 제작사가 가격을 바꾸거나 모델을 등록할 때마다 바뀝니다. 데스크는 다음 일일 실행 때 둘 다 반영하고 각 표 아래에 마지막 확인 날짜를 적습니다.

'오픈 웨이트'는 무슨 뜻인가요?

제작사가 모델의 가중치를, 제작사 API를 거치지 않고 여러분의 하드웨어나 빌린 클라우드에서 직접 내려받아 실행할 수 있는 라이선스로 공개했다는 뜻입니다. 독점 모델은 만든 회사를 통해서만 쓸 수 있습니다.

LMArena에는 같은 모델이 두 번 있는데 여기는 왜 한 번인가요?

LMArena는 같은 모델을 추론 설정별로 별도 줄로 채점합니다. 우리는 모델마다 순위가 가장 높은 설정만 남겨 표가 모델 목록으로 읽히게 하고, 설정은 이름 뒤 괄호 안에 표시합니다.

가장 싼 모델로 충분한가요?

일상적인 글쓰기, 요약, 질문 답변 대부분에는 충분합니다. 주요 제작사의 저가 등급은 보통 그 제작사 플래그십의 축소판입니다. 길고 신중한 추론, 복잡한 코드, 한 번에 최선의 답이 필요할 때 비싼 등급에 돈을 쓰세요.

이어서 읽기

순위 데이터: LMArena. 가격 및 등록 데이터: OpenRouter. 둘 다 각 표에 출처를 밝혔으며, 이 사이트는 어느 쪽과도 제휴 관계가 없습니다.

Advertisement