llm.ing

LMArena Text

crowdrun by LMArenaunit: eloCC-BY-4.0observed Jul 21, 202659 modelssource ↗methodology ↗

Caveat: Overall text category; style effects not controlled in this config.

TextWebDevVision
#ModelScore
1Claude Opus 4.6thinking
1512
±4· 62.8K votes
2Claude Fable 5
1504
±6· 14.6K votes
3Claude Opus 4.7thinking
1499
±4· 50.5K votes
4GPT-5.4
1499
±5· 61.8K votes
5GPT-5.4 minihigh-effort
1496
±5· 57.6K votes
6GPT-5.2high-effort
1493
±7· 47.4K votes
7Muse Spark 1.1
1491
±7· 7.8K votes
8Gemini 3.6 Flash
1491
±9· 4.7K votes
9GPT-5.5
1490
±6· 47K votes
10Gemini 3.5 Flashhigh-effort
1490
±6· 10.1K votes
11Gemini 3.1 Pro Preview
1489
±3· 84.1K votes
12GPT-5.6 Solxhigh-effort
1486
±11· 6.1K votes
13GPT-5.1
1485
±8· 42.5K votes
14GPT-5.3 Chat (latest)
1484
±8· 32.8K votes
15Kimi K3
1482
±10· 3.6K votes
16GPT-5.4 nanohigh-effort
1482
±5· 56.6K votes
17Grok 4.5
1478
±11· 7.7K votes
18GLM-5.1
1475
±4· 30.5K votes
19Claude Opus 4.8thinking
1472
±5· 30.8K votes
20Qwen3.7 Plus
1468
±5· 22.2K votes
21Claude Sonnet 4.6
1468
±4· 56.8K votes
22GPT-5.2 Chat
1465
±9· 34.1K votes
23GPT-5high-effort
1465
±17· 6.8K votes
24Gemini 2.5 Flash
1465
±6· 68.7K votes
25Kimi K2.6
1465
±4· 37.6K votes
26GPT-5 Minihigh-effort
1465
±17· 6.8K votes
27Claude Opus 4.5 (latest)thinking-32k
1463
±8· 36.2K votes
28GPT-4.1
1462
±19· 7.8K votes
29Gemini 2.5 Pro
1462
±3· 68K votes
30DeepSeek V4 Pro
1460
±4· 45.1K votes
31Claude Sonnet 5high-effort
1460
±11· 13.4K votes
32Grok 4.3
1457
±6· 46.2K votes
33Qwen3.6 Max Preview
1456
±8· 5.2K votes
34GLM-5
1455
±4· 27.6K votes
35Kimi K2.5thinking
1455
±3· 62.3K votes
36Claude Opus 4.1 (latest)
1454
±8· 40.9K votes
37GLM-5V-Turbo
1450
±7· 7.5K votes
38Claude Sonnet 4.5 (latest)thinking-32k
1450
±6· 73K votes
39GLM-4.6
1449
±9· 28.4K votes
40Gemini 3.1 Flash Lite Preview
1449
±6· 60.5K votes
41Qwen3.5 397B-A17B
1448
±4· 57.8K votes
42Gemini 3.5 Flash Lite
1448
±9· 4.6K votes
43GLM-4.7
1447
±6· 11.7K votes
44Qwen3.6 Plus
1447
±4· 43.8K votes
45MiniMax-M3
1446
±5· 28K votes
46DeepSeek V3.2
1444
±8· 46.3K votes
47DeepSeek V4 Flash
1441
±4· 44.9K votes
48MiniMax-M2.5
1441
±8· 40.8K votes
49Command A
1441
±17· 7.6K votes
50Claude Haiku 4.5 (latest)
1439
±5· 101.8K votes
51MiniMax-M2.7
1435
±6· 49.7K votes
52GLM-4.6V
1433
±29· 2.5K votes
53Qwen3.5 122B-A10B
1432
±9· 28.3K votes
54Qwen3.5 27B
1429
±10· 27.1K votes
55GLM-4.5
1429
±5· 24.3K votes
56DeepSeek R1
1428
±6· 18.5K votes
57Kimi K2 Thinking Turbo
1423
±3· 61K votes
58Qwen3-Next 80B-A3B Instruct
1423
±7· 7.6K votes
59DeepSeek V3.1
1419
±6· 14.9K votes

Dot = elo on a 1398–1522 scale (position, not length); whisker = rating confidence interval. Scores link to model pages; every number keeps its source on the model page.