llm.ing

Median time to first token

independentrun by Artificial Analysisunit: secondsDisplay with attribution; no redistributionobserved Jul 24, 202642 modelssource ↗
AA Intelligence IndexAA Coding IndexAA Agentic IndexMedian output speedMedian time to first token
#ModelScore
1Gemini 2.5 Flash-Lite
0.34s
2Grok Build 0.1
0.55s
3nemotron-3-nano-30b-a3b
0.71s
4GPT-5.4non-reasoning
0.79s
5GPT-4.1
1.00s
6GLM-4.7-Flash
1.17s
7MiniMax-M3
1.20s
8MiniMax-M2.7
1.63s
9GLM-5
1.66s
10MiniMax-M2.1
1.68s
11MiniMax-M2.5
1.70s
12Claude Opus 4.7non-reasoning
1.79s
13Claude Sonnet 4.6
1.87s
14Claude Opus 4.5 (latest)
1.88s
15Qwen Turbo
2.15s
16Qwen3-Next 80B-A3B Instruct
2.16s
17Qwen3.5 35B-A3B
2.19s
18Qwen3.5 397B-A17Bnon-reasoning
2.24s
19Qwen3.5 122B-A10Bnon-reasoning
2.36s
20nvidia-nemotron-nano-9b-v2
2.66s
21Claude Opus 4.6
2.68s
22Qwen3-Coder 480B-A35B Instruct
3.07s
23GLM-4.5V
3.11s
24Qwen3.6 27Bnon-reasoning
3.80s
25Mercury 2
4.09s
26GLM-4.6V
4.46s
27o3-mini
4.65s
28GPT-5.1 Codex
5.25s
29Qwen3.5 27Bnon-reasoning
5.61s
30o3
6.17s
31Gemini 3.5 Flash Lite
9.82s
32Gemini 3.5 Flash
17.54s
33Gemini 2.5 Flashthinking
17.58s
34Gemini 2.5 Pro
21.48s
35GPT-5.2 Codex
35.66s
36GPT-5.1
47.62s
37GPT-5 Mini
90.19s
38GPT-5.5
93.20s
39GPT-5
107.59s
40GPT-5.6 Luna
126.14s
41GPT-5.2
143.65s
42Claude Sonnet 5
175.19s

Bars on a 0–175.19 seconds scale. Scores link to model pages; every number keeps its source on the model page.