Model Benchmark

ExploreCompareEvaluate

Benchmark

See all

Overall Leaderboard

View full
1
Atlas-4 Pro Proprietary
Frontier reasoning · 128k ctx
91.8 ↑ 2.4
2
Nimbus-70B 70B
Open weights · Apache-2.0
89.1 ↑ 1.2
3
Solstice Preview Preview
Proprietary · early access
86.7 ↓ 0.6
4
Meridian-120B 120B
Open weights · MoE
84.3 ↑ 0.3
5
Corvid-8B 8B
Open weights · edge-ready
82.0 ↓ 0.9
Scores are normalized (higher is better) Updated 2h ago

Compare models

Model Alpha Model Beta Model Gamma

Metric Summary

All metrics
Arena Elo (head-to-head)
1,325
↑ 18 vs last week
MMLU (5-shot)
89.6%
↑ 1.3%
HumanEval Pass@1
72.4%
↑ 2.8%
GPQA (Diamond)
56.7%
↓ 0.6%

Leaderboard Preview

Model Arena Elo MMLU HumanEval GPQA Details
1 Proprietary
1,325 89.6% 72.4% 56.7%
2 70B
1,281 87.1% 69.2% 53.9%
3 Preview
1,217 84.0% 66.1% 51.2%