Kategoria „Agenci” ocenia zdolność modeli językowych do samodzielnego wykonywania złożonych zadań. W przeciwieństwie do tradycyjnych testów opartych na pojedynczych zapytaniach, benchmarki agentowe sprawdzają, jak model radzi sobie z wieloetapowym planowaniem, korzystaniem z zewnętrznych narzędzi i interfejsów API, wykonywaniem poleceń w środowisku terminalowym oraz odzyskiwaniem sprawności po wystąpieniu błędów wykonania.

Nasze zestawienie opiera się na wynikach uzyskanych w uznanych benchmarkach agentowych. Ranking wskazuje modele, które najlepiej radzą sobie ze złożonymi, wieloetapowymi zadaniami wymagającymi samodzielnego planowania i korzystania z narzędzi.

Chcesz sprawdzić ogólną wszechstronność modeli? Sprawność agentowa stanowi 20% końcowej oceny. Przejdź do ogólnego rankingu modeli AI, aby zobaczyć, jak najlepsze LLMy wypadają również w programowaniu, matematyce i zaawansowanym wnioskowaniu.

Ostatnia aktualizacja: 2 października 2026
Poz. Nazwa Modelu Względna jakość Wynik
1 Claude Opus 5.5
Jakość agentów 97,13%

97,13
2 Claude Fable 5.1
Jakość agentów 91,95%

91,95
3 GPT-6 Astra
Jakość agentów 89,38%

89,38
4 Claude Opus 5
Jakość agentów 84,59%

84,59
5 DeepSeek-V4.1-Flash
Jakość agentów 84,03%

84,03
6 Claude Fable 5
Jakość agentów 83,02%

83,02
7 GPT-6.1 Sol
Jakość agentów 82,84%

82,84
8 Claude Sonnet 5.5
Jakość agentów 80,57%

80,57
9 DeepSeek-V4-Flash
Jakość agentów 79,80%

79,80
10 GPT-6 Sol
Jakość agentów 79,39%

79,39
11 GPT-5.6 Sol
Jakość agentów 78,84%

78,84
12 Muse Spark 1.3
Jakość agentów 78,51%

78,51
13 Gemini 4 Argon
Jakość agentów 77,69%

77,69
14 Kimi K3
Jakość agentów 77,20%

77,20
15 Qwen3.8
Jakość agentów 75,45%

75,45
16 Seed 2.1 Pro
Jakość agentów 75,39%

75,39
17 GLM-5.3
Jakość agentów 74,53%

74,53
18 Claude Opus 4.8
Jakość agentów 73,52%

73,52
19 Hy4
Jakość agentów 73,50%

73,50
20 MiMo-V2.6-Pro
Jakość agentów 73,47%

73,47
21 Claude Sonnet 5
Jakość agentów 72,39%

72,39
22 Grok 4.7
Jakość agentów 71,82%

71,82
23 Ling 3.0 Flash Fin
Jakość agentów 70,54%

70,54
24 GPT-5.5
Jakość agentów 70,49%

70,49
25 Gemini 3.8 Flash
Jakość agentów 70,41%

70,41
26 Grok 4.6
Jakość agentów 70,15%

70,15
27 Claude Opus 4.7
Jakość agentów 69,80%

69,80
28 DeepSeek-V4-Pro
Jakość agentów 69,57%

69,57
29 GPT-5.6 Terra
Jakość agentów 69,02%

69,02
30 Qwen3.8-Flash-Next
Jakość agentów 68,70%

68,70
31 GLM-5.3-Flash
Jakość agentów 68,20%

68,20
32 GLM-5.2
Jakość agentów 67,42%

67,42
33 Gemini 3.5 Flash
Jakość agentów 67,14%

67,14
34 Grok 4.5
Jakość agentów 66,66%

66,66
35 Claude Opus 4.6
Jakość agentów 66,01%

66,01
36 GPT-6 Luna
Jakość agentów 65,67%

65,67
37 Qwen3.8-27B
Jakość agentów 65,30%

65,30
38 Gemini 3.7 Flash
Jakość agentów 65,07%

65,07
39 Kimi K2.6
Jakość agentów 63,79%

63,79
40 GPT-5.4
Jakość agentów 63,64%

63,64
41 MiMo-V2.6-Flash
Jakość agentów 63,21%

63,21
42 Kimi K2.7 Code
Jakość agentów 63,01%

63,01
43 Muse Spark 1.1
Jakość agentów 62,19%

62,19
44 GLM-5.1
Jakość agentów 62,05%

62,05
45 GPT-5.6 Luna
Jakość agentów 61,19%

61,19
46 GPT-5.3 Codex
Jakość agentów 59,79%

59,79
47 Muse Spark 1.2
Jakość agentów 59,33%

59,33
48 Grok Build 0.1
Jakość agentów 59,25%

59,25
49 Claude Sonnet 4.6
Jakość agentów 58,75%

58,75
50 GPT-5.2 Codex
Jakość agentów 58,73%

58,73
51 MiMo-V2.5
Jakość agentów 57,19%

57,19
52 GPT-5.2
Jakość agentów 55,59%

55,59
53 Qwen3.5-397B-A17B
Jakość agentów 55,29%

55,29
54 Qwen3.6 Plus
Jakość agentów 54,86%

54,86
55 GLM-5
Jakość agentów 54,42%

54,42
56 Step 5
Jakość agentów 54,22%

54,22
57 Ling 3.0 Flash
Jakość agentów 54,07%

54,07
58 GPT-5.4 mini
Jakość agentów 53,84%

53,84
59 GLM-5V-Turbo
Jakość agentów 53,73%

53,73
60 Qwen3.7
Jakość agentów 53,09%

53,09
61 Gemini 3.5 Flash-Lite
Jakość agentów 52,78%

52,78
62 Kimi K2.5
Jakość agentów 51,99%

51,99
63 MiniMax M2.1
Jakość agentów 51,99%

51,99
64 Claude Opus 4.5
Jakość agentów 51,16%

51,16
65 Gemini 3 Flash
Jakość agentów 51,13%

51,13
66 Claude Sonnet 4.5
Jakość agentów 50,61%

50,61
67 MiMo-V2-Pro
Jakość agentów 50,43%

50,43
68 MiniMax M2.5
Jakość agentów 50,26%

50,26
69 GPT-5.4 nano
Jakość agentów 49,94%

49,94
70 Seed 2.0 Pro
Jakość agentów 49,91%

49,91
71 Qwen3.6-27B
Jakość agentów 49,60%

49,60
72 Hy3
Jakość agentów 49,48%

49,48
73 Gemini 3.6 Flash
Jakość agentów 48,93%

48,93
74 Kimi K2
Jakość agentów 48,35%

48,35
75 MiniMax M3
Jakość agentów 48,14%

48,14
76 MiniMax M2.7
Jakość agentów 47,83%

47,83
77 Gemini 3.1 Pro
Jakość agentów 47,55%

47,55
78 Qwen3.5-122B-A10B
Jakość agentów 47,49%

47,49
79 Step-3.5-Flash
Jakość agentów 47,31%

47,31
80 Gemini 3 Pro
Jakość agentów 47,14%

47,14
81 Qwen3.5-27B
Jakość agentów 45,75%

45,75
82 Muse Spark
Jakość agentów 45,23%

45,23
83 Gemma 4 31B
Jakość agentów 44,19%

44,19
84 Qwen3.7-Plus
Jakość agentów 44,16%

44,16
85 Claude Haiku 4.5
Jakość agentów 44,02%

44,02
86 Inkling
Jakość agentów 43,50%

43,50
87 Qwen3 VL 235B A22B
Jakość agentów 43,50%

43,50
88 Step 3.7 Flash
Jakość agentów 43,50%

43,50
89 MiMo-V2.5-Pro
Jakość agentów 43,33%

43,33
90 LongCat-Flash
Jakość agentów 43,15%

43,15
91 Claude Opus 4.1
Jakość agentów 43,15%

43,15
92 Qwen3 VL 32B
Jakość agentów 42,98%

42,98
93 Gemma 4 26B-A4B
Jakość agentów 42,63%

42,63
94 Qwen3.5-35B-A3B
Jakość agentów 42,11%

42,11
95 Qwen3-Next-80B-A3B
Jakość agentów 41,94%

41,94
96 DeepSeek-V3.2
Jakość agentów 41,59%

41,59
97 Qwen3.6-35B-A3B
Jakość agentów 41,07%

41,07
98 Qwen3 235B A22B
Jakość agentów 40,55%

40,55
99 DeepSeek-V3.2-Speciale
Jakość agentów 39,51%

39,51
100 Gemini 3.1 Flash-Lite
Jakość agentów 38,99%

38,99