Ranking w kategorii „Matematyka” ocenia zdolność modeli językowych do rozwiązywania złożonych problemów matematycznych i prowadzenia precyzyjnego, wieloetapowego rozumowania. Testy obejmują m.in. zadania na poziomie konkursów i olimpiad matematycznych, problemy wymagające wieloetapowych obliczeń oraz zagadnienia z algebry, teorii liczb i matematyki dyskretnej.
Wyniki opierają się na uznanych matematycznych benchmarkach i zestawieniach. Pozwala to wskazać modele, które najlepiej radzą sobie z rozwiązywaniem problemów matematycznych, wieloetapowym wnioskowaniem i dokładnością obliczeń.
Szukasz modelu o wszechstronnych możliwościach? Sprawność matematyczna odpowiada za 20% oceny końcowej. Sprawdź ogólny ranking modeli AI, aby zobaczyć, jak modele przodujące w matematyce radzą sobie również z programowaniem, wnioskowaniem i zadaniami agentowymi.
| Poz. | Nazwa Modelu | Względna jakość | Wynik |
|---|---|---|---|
| 1 | Gemini 4 Argon |
|
100,00 |
| 2 | GPT-6.1 Sol |
|
99,69 |
| 3 | Muse Spark 1.3 |
|
97,40 |
| 4 | Claude Fable 5.1 |
|
97,08 |
| 5 | Gemini 3.8 Flash |
|
96,76 |
| 6 | Claude Opus 5 |
|
96,37 |
| 7 | Claude Opus 5.5 |
|
96,03 |
| 8 | Gemini 3.7 Flash |
|
95,95 |
| 9 | Claude Fable 5 |
|
95,73 |
| 10 | Gemini 3.6 Flash |
|
93,30 |
| 11 | MiMo-V2.6-Pro |
|
93,27 |
| 12 | Claude Opus 4.6 |
|
93,22 |
| 13 | Gemini 3.1 Pro |
|
93,21 |
| 14 | Claude Opus 4.7 |
|
92,45 |
| 15 | GLM-5.2 |
|
92,33 |
| 16 | Claude Opus 4.8 |
|
92,30 |
| 17 | GPT-5.5 |
|
92,19 |
| 18 | Qwen3.7 |
|
92,14 |
| 19 | GLM-5.3 |
|
92,12 |
| 20 | Grok 4.5 |
|
91,89 |
| 21 | Kimi K3 |
|
91,65 |
| 22 | Qwen3.6 |
|
91,55 |
| 23 | GPT-6 Sol |
|
91,52 |
| 24 | Muse Spark 1.2 |
|
91,51 |
| 25 | Muse Spark 1.1 |
|
91,45 |
| 26 | DeepSeek-V4-Pro |
|
91,22 |
| 27 | MiMo-V2.6-Flash |
|
90,92 |
| 28 | Grok 4.7 |
|
90,55 |
| 29 | GPT-5.4 |
|
90,18 |
| 30 | GPT-5.6 Sol |
|
89,98 |
| 31 | GPT-6 Luna |
|
89,95 |
| 32 | GPT-6 Astra |
|
89,91 |
| 33 | Grok 4.6 |
|
89,90 |
| 34 | Grok-4.20 |
|
89,83 |
| 35 | DeepSeek-V4.1-Flash |
|
89,82 |
| 36 | Claude Sonnet 5 |
|
89,75 |
| 37 | Seed 2.1 Pro |
|
89,42 |
| 38 | Claude Sonnet 5.5 |
|
89,23 |
| 39 | Qwen3.7-Plus |
|
89,23 |
| 40 | Muse Spark |
|
88,99 |
| 41 | GPT-5.2 |
|
88,75 |
| 42 | GLM-5.3-Flash |
|
88,40 |
| 43 | Hy4 |
|
88,31 |
| 44 | Qwen3.8 |
|
88,21 |
| 45 | Gemini 3 Pro |
|
88,03 |
| 46 | Kimi K2.6 |
|
87,79 |
| 47 | Gemini 3 Flash |
|
87,72 |
| 48 | MiMo-V2-Pro |
|
87,64 |
| 49 | DeepSeek-V4-Flash |
|
87,58 |
| 50 | Qwen3.6 Plus |
|
87,49 |
| 51 | Hy3 |
|
87,32 |
| 52 | Kimi K2.5 |
|
87,17 |
| 53 | GPT-5.6 Terra |
|
87,00 |
| 54 | Muse Glimmer |
|
86,85 |
| 55 | GLM-5 |
|
86,38 |
| 56 | Grok-4.1 |
|
86,23 |
| 57 | Claude Sonnet 4.6 |
|
85,83 |
| 58 | Gemini 3.5 Flash |
|
85,74 |
| 59 | Claude Opus 4.5 |
|
85,70 |
| 60 | Qwen3.5-397B-A17B |
|
85,68 |
| 61 | MiMo-V2.5 |
|
85,60 |
| 62 | GLM-5V-Turbo |
|
85,45 |
| 63 | MiMo-V2-Omni |
|
84,98 |
| 64 | GLM-5.1 |
|
84,72 |
| 65 | Grok 4.3 |
|
84,03 |
| 66 | Kimi K2 |
|
83,89 |
| 67 | Inkling |
|
83,45 |
| 68 | Qwen3.5-122B-A10B |
|
83,25 |
| 69 | Inkling-Small |
|
83,16 |
| 70 | MiniMax M2.7 |
|
83,10 |
| 71 | GPT-5.6 Luna |
|
83,08 |
| 72 | Qwen3.8-27B |
|
83,08 |
| 73 | Grok 4.1 Fast |
|
82,94 |
| 74 | Gemini 3.5 Flash-Lite |
|
82,79 |
| 75 | Qwen3.5-27B |
|
82,23 |
| 76 | GLM-4.7 |
|
82,15 |
| 77 | GPT-5.1 |
|
82,12 |
| 78 | Seed 2.0 Pro |
|
82,05 |
| 79 | Gemma 4 31B |
|
81,32 |
| 80 | Qwen3.8-Flash-Next |
|
81,06 |
| 81 | Grok Build 0.1 |
|
80,74 |
| 82 | Qwen3.6-27B |
|
80,61 |
| 83 | Qwen3 |
|
80,56 |
| 84 | ChatGPT-4o |
|
80,28 |
| 85 | GPT-5 |
|
80,24 |
| 86 | Step-3.5-Flash |
|
80,11 |
| 87 | ERNIE 5.0 |
|
79,93 |
| 88 | DeepSeek-V3.2-Speciale |
|
79,78 |
| 89 | DeepSeek-V3.2 |
|
79,77 |
| 90 | Grok-4 |
|
79,54 |
| 91 | LongCat-Flash |
|
79,53 |
| 92 | DeepSeek V3.1 Terminus |
|
79,19 |
| 93 | MiMo-V2.5-Pro |
|
79,10 |
| 94 | Mistral |
|
79,03 |
| 95 | Qwen3 235B A22B |
|
78,76 |
| 96 | MiniMax M2.5 |
|
78,56 |
| 97 | Qwen3.5-35B-A3B |
|
78,38 |
| 98 | Gemma 4 26B-A4B |
|
78,01 |
| 99 | Trinity Large |
|
77,15 |
| 100 | Qwen3 VL 235B A22B |
|
76,79 |