Kagi LLM Benchmark — leaderboard

Metric: Accuracy (%). Source: help.kagi.com. 145 models tracked.

Top models

#ModelScore
1GPT-5.588.8
2Claude Fable 588.8
3Claude Opus 4.8 (Thinking)88.8
4Claude Opus 4.6 (Thinking)83.6
5Grok 4.583.5
6Claude Opus 4.7 (Thinking)80.7
7Claude Opus 4.5 (Thinking)80.2
8Gemini 3 Pro80.1
9Kimi K2.5 (Thinking)78.5
10GPT-5 Pro76.8
11Grok 4.2075
12GLM-5 (Thinking)75
13Claude Opus 4 (Thinking)74.3
14Grok 473.6
15GPT-573.3

Interactive version: aibenchmarks.dev/benchmark?slug=kagi-llm-benchmark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.