Claude Fable 5.1
Anthropic
- Reasoning index #1
- Text preference #3
- Agent tasks #1
98
100%
3 benchmark signals
A traceable LLM ranking snapshot that brings together multiple public benchmark leaderboards into one decision table, refreshed every day.
Models
20
Signals
44
Updated
2026-09-08
Refreshed daily at 00:00 HKT
Consensus snapshot
Major benchmark signals, normalized into one decision table.
The consensus score is not a raw benchmark score. It normalizes cross-benchmark positions and groups effort levels and variants of one product line under its best result.
Anthropic
98
100%
3 benchmark signals
Anthropic
93
100%
3 benchmark signals
OpenAI
90
40%
1 benchmark signals
Anthropic
88
100%
3 benchmark signals
Meta
79
40%
1 benchmark signals
OpenAI
73
100%
3 benchmark signals
Anthropic
73
60%
2 benchmark signals
Kimi
69
100%
3 benchmark signals
Anthropic
63
60%
2 benchmark signals
Tencent
63
30%
1 benchmark signals
Anthropic
61
60%
2 benchmark signals
58
100%
3 benchmark signals
Meta
56
30%
1 benchmark signals
Alibaba
54
100%
3 benchmark signals
OpenAI
54
60%
2 benchmark signals
Z AI
49
100%
3 benchmark signals
48
30%
1 benchmark signals
Meta
41
100%
3 benchmark signals
Alibaba
41
40%
1 benchmark signals
SpaceXAI
39
100%
3 benchmark signals
Methodology
If you want to connect this leaderboard to model selection, prompt tests, or agent workflows, we can turn it into a repeatable evaluation lane.