Kategoria „Rozumowanie” ocenia zdolność modeli językowych do radzenia sobie ze złożonymi zadaniami logicznymi i analitycznymi. Pod uwagę brane są m.in. wieloetapowa dedukcja, analiza hipotez, rozwiązywanie wymagających problemów naukowych oraz zachowanie spójności rozumowania w długich, wieloetapowych interakcjach.

Wskaźnik ten łączy wyniki z wymagających benchmarków. Pozwala wskazać modele, które najlepiej radzą sobie ze złożonym wnioskowaniem, analizą naukową i wieloetapowym rozwiązywaniem problemów.

Chcesz sprawdzić ogólną wszechstronność modelu? Wnioskowanie stanowi 30% wyniku łącznego. Przejdź do ogólnego rankingu modeli AI , aby zobaczyć, jak najlepsze modele w tej kategorii radzą sobie również z kodowaniem, matematyką oraz realizacją zadań agentowych.

Ostatnia aktualizacja: 2 października 2026
Poz. Nazwa Modelu Względna jakość Wynik
1 Claude Opus 5.5
Jakość rozumowania 97,56%

97,56
2 Gemini 4 Argon
Jakość rozumowania 97,50%

97,50
3 GPT-6 Astra
Jakość rozumowania 95,68%

95,68
4 Claude Opus 5
Jakość rozumowania 93,89%

93,89
5 Claude Fable 5.1
Jakość rozumowania 93,82%

93,82
6 Claude Fable 5
Jakość rozumowania 93,48%

93,48
7 Claude Sonnet 5.5
Jakość rozumowania 92,53%

92,53
8 GPT-5.6 Sol
Jakość rozumowania 92,12%

92,12
9 Kimi K3
Jakość rozumowania 91,28%

91,28
10 Muse Spark 1.3
Jakość rozumowania 91,20%

91,20
11 Claude Opus 4.8
Jakość rozumowania 90,48%

90,48
12 Gemini 3.8 Flash
Jakość rozumowania 89,49%

89,49
13 Muse Spark 1.1
Jakość rozumowania 88,98%

88,98
14 GPT-5.5
Jakość rozumowania 88,95%

88,95
15 Gemini 3.7 Flash
Jakość rozumowania 88,81%

88,81
16 Qwen3.8
Jakość rozumowania 88,79%

88,79
17 Hy4
Jakość rozumowania 88,58%

88,58
18 GPT-6.1 Sol
Jakość rozumowania 88,37%

88,37
19 GLM-5.3
Jakość rozumowania 87,93%

87,93
20 GPT-5.6 Terra
Jakość rozumowania 87,92%

87,92
21 Gemini 3.1 Pro
Jakość rozumowania 87,50%

87,50
22 Grok 4.6
Jakość rozumowania 87,37%

87,37
23 Claude Opus 4.7
Jakość rozumowania 87,32%

87,32
24 Claude Opus 4.6
Jakość rozumowania 86,97%

86,97
25 DeepSeek-V4-Pro
Jakość rozumowania 86,88%

86,88
26 Claude Sonnet 5
Jakość rozumowania 86,38%

86,38
27 GPT-5.4
Jakość rozumowania 86,23%

86,23
28 GPT-6 Sol
Jakość rozumowania 85,99%

85,99
29 Grok 4.5
Jakość rozumowania 85,48%

85,48
30 Qwen3.7
Jakość rozumowania 85,37%

85,37
31 Qwen3.8-Flash-Next
Jakość rozumowania 85,33%

85,33
32 Gemini 3.5 Flash
Jakość rozumowania 84,58%

84,58
33 Seed 2.1 Pro
Jakość rozumowania 84,54%

84,54
34 Muse Spark 1.2
Jakość rozumowania 84,12%

84,12
35 GLM-5.3-Flash
Jakość rozumowania 84,08%

84,08
36 DeepSeek-V4.1-Flash
Jakość rozumowania 84,05%

84,05
37 Gemini 3.6 Flash
Jakość rozumowania 83,89%

83,89
38 MiMo-V2.6-Pro
Jakość rozumowania 83,74%

83,74
39 GPT-5.6 Luna
Jakość rozumowania 83,34%

83,34
40 GLM-5.2
Jakość rozumowania 83,06%

83,06
41 GPT-5.2
Jakość rozumowania 82,81%

82,81
42 DeepSeek-V4-Flash
Jakość rozumowania 82,72%

82,72
43 Step 5
Jakość rozumowania 82,07%

82,07
44 Kimi K2.6
Jakość rozumowania 81,79%

81,79
45 Muse Spark
Jakość rozumowania 81,44%

81,44
46 Gemini 3 Pro
Jakość rozumowania 81,05%

81,05
47 Qwen3.8-27B
Jakość rozumowania 80,65%

80,65
48 MiniMax M3
Jakość rozumowania 80,28%

80,28
49 Claude Sonnet 4.6
Jakość rozumowania 80,22%

80,22
50 Qwen3.7-Plus
Jakość rozumowania 80,08%

80,08
51 Claude Opus 4.5
Jakość rozumowania 79,05%

79,05
52 Grok Build 0.1
Jakość rozumowania 79,02%

79,02
53 Gemini 3 Flash
Jakość rozumowania 78,86%

78,86
54 Seed 2.0 Pro
Jakość rozumowania 78,85%

78,85
55 GPT-6 Luna
Jakość rozumowania 78,61%

78,61
56 Qwen3.6
Jakość rozumowania 78,52%

78,52
57 Hy3
Jakość rozumowania 78,42%

78,42
58 Grok 4.7
Jakość rozumowania 78,22%

78,22
59 GPT-5.3 Codex
Jakość rozumowania 76,55%

76,55
60 MiMo-V2.6-Flash
Jakość rozumowania 76,48%

76,48
61 Qwen3.6 Plus
Jakość rozumowania 76,47%

76,47
62 Inkling
Jakość rozumowania 76,47%

76,47
63 GLM-5.1
Jakość rozumowania 76,36%

76,36
64 Kimi K2.7 Code
Jakość rozumowania 75,81%

75,81
65 Kimi K2.5
Jakość rozumowania 75,62%

75,62
66 Qwen3.5-397B-A17B
Jakość rozumowania 75,26%

75,26
67 MiMo-V2-Pro
Jakość rozumowania 75,21%

75,21
68 LongCat-Flash
Jakość rozumowania 75,17%

75,17
69 GPT-5.2 Codex
Jakość rozumowania 74,86%

74,86
70 Inkling-Small
Jakość rozumowania 74,66%

74,66
71 GPT-5.1
Jakość rozumowania 74,01%

74,01
72 GLM-5
Jakość rozumowania 73,99%

73,99
73 GPT-5.4 mini
Jakość rozumowania 73,10%

73,10
74 MiMo-V2.5
Jakość rozumowania 72,32%

72,32
75 GLM-4.7
Jakość rozumowania 72,25%

72,25
76 MiniMax M2.7
Jakość rozumowania 72,21%

72,21
77 Qwen3
Jakość rozumowania 72,02%

72,02
78 MiMo-V2.5-Pro
Jakość rozumowania 71,98%

71,98
79 GPT-5
Jakość rozumowania 71,98%

71,98
80 Grok 4.3
Jakość rozumowania 71,83%

71,83
81 Gemma 4 31B
Jakość rozumowania 71,41%

71,41
82 KAT-Coder-Pro V2
Jakość rozumowania 71,10%

71,10
83 GPT-5.4 nano
Jakość rozumowania 70,88%

70,88
84 Qwen3.5-122B-A10B
Jakość rozumowania 70,46%

70,46
85 Muse Glimmer
Jakość rozumowania 70,40%

70,40
86 GPT-5.5 Instant
Jakość rozumowania 70,26%

70,26
87 Grok-4
Jakość rozumowania 70,07%

70,07
88 Kimi K2
Jakość rozumowania 70,06%

70,06
89 ChatGPT-4o
Jakość rozumowania 70,00%

70,00
90 Qwen3.5-27B
Jakość rozumowania 69,53%

69,53
91 DeepSeek-V3.2
Jakość rozumowania 69,44%

69,44
92 Step-3.5-Flash
Jakość rozumowania 69,23%

69,23
93 Grok-4.20
Jakość rozumowania 68,61%

68,61
94 MiniMax M2.5
Jakość rozumowania 68,56%

68,56
95 Claude Sonnet 4.5
Jakość rozumowania 68,48%

68,48
96 Solar Pro 4
Jakość rozumowania 68,23%

68,23
97 Grok 4.1 Fast
Jakość rozumowania 68,09%

68,09
98 Qwen3.6-27B
Jakość rozumowania 67,79%

67,79
99 MiMo-V2-Omni
Jakość rozumowania 67,29%

67,29
100 GPT-4.5
Jakość rozumowania 67,13%

67,13