Бенчмарки моделей
Проверенные результаты публичных тестов моделей из каталога OmniRouter.
150результатов
17моделей
72бенчмарка
14источников
23.08.2026актуальность данных
Terminal-Bench 2.1
10 моделей- GPT-5.6 Solнезависимая оценка88,8%
- Kimi K3оценка разработчика88,3%
- GLM-5.3оценка разработчика88,2%
- DeepSeek V4 Pro 0813оценка разработчика87,9%
- Qwen3.8 2.4T A95Bоценка разработчика86,6%
- Claude Opus 4.8независимая оценка85%
- DeepSeek V4 Flash 0731оценка разработчика82,7%
- GLM-5.2оценка разработчика81%
- Qwen3.8 27Bоценка разработчика73%
- MiniMax M3независимая оценка65%
GPQA Diamond
9 моделей- Gemini 3.1 Pro Previewоценка разработчика94,3%
- GPT-5.6 Solнезависимая оценка94,1%
- Kimi K3оценка разработчика93,5%
- MiniMax M3независимая оценка93%
- Qwen3.8 2.4T A95Bоценка разработчика92,6%
- GLM-5.2оценка разработчика91,2%
- Qwen3.8 27Bоценка разработчика89,2%
- Qwen3.6 27Bоценка разработчика87,8%
- Kimi K2 Thinkingоценка разработчика84,5%
NL2Repo-Bench
8 моделей- Claude Opus 4.8независимая оценка69,7%
- DeepSeek V4 Pro 0813оценка разработчика61,5%
- GLM-5.3оценка разработчика58%
- Qwen3.8 2.4T A95Bоценка разработчика55,9%
- DeepSeek V4 Flash 0731оценка разработчика54,2%
- GLM-5.2оценка разработчика48,9%
- Qwen3.8 27Bоценка разработчика42,3%
- Qwen3.6 27Bоценка разработчика36,2%
DeepSWE v1.1
6 моделей- GPT-5.6 Solнезависимая оценка73%
- Kimi K3оценка разработчика67,5%
- GLM-5.3оценка разработчика66,9%
- Claude Opus 4.8независимая оценка58%
- Qwen3.8 2.4T A95Bоценка разработчика56,6%
- Qwen3.8 27Bоценка разработчика42,2%
Humanity's Last Exam (with tools)
6 моделей- GLM-5.3оценка разработчика62,5%
- DeepSeek V4 Pro 0813оценка разработчика60%
- GPT-5.6 Solнезависимая оценка58%
- Claude Opus 4.8независимая оценка57,9%
- Qwen3.8 2.4T A95Bоценка разработчика56,2%
- GLM-5.2оценка разработчика54,7%
SWE-bench Pro
6 моделей- Qwen3.8 2.4T A95Bоценка разработчика67,7%
- GPT-5.6 Solнезависимая оценка64,6%
- GLM-5.2оценка разработчика62,1%
- Qwen3.8 27Bоценка разработчика61,7%
- MiniMax M3независимая оценка59%
- Qwen3.6 27Bоценка разработчика53,5%
CyberGym
5 моделей- GLM-5.3оценка разработчика84,5%
- DeepSeek V4 Pro 0813оценка разработчика83,3%
- GPT-5.5оценка разработчика81,8%
- Claude Opus 4.8независимая оценка78,1%
- DeepSeek V4 Flash 0731оценка разработчика76,7%
Humanity's Last Exam
5 моделей- Qwen3.8 2.4T A95Bоценка разработчика43,6%
- GLM-5.2оценка разработчика40,5%
- MiniMax M3независимая оценка37%
- Qwen3.8 27Bоценка разработчика30,8%
- Qwen3.6 27Bоценка разработчика24%
Toolathlon Verified
5 моделей- Claude Opus 4.8независимая оценка76,2%
- DeepSeek V4 Pro 0813оценка разработчика74,1%
- GLM-5.3оценка разработчика73%
- Qwen3.8 2.4T A95Bоценка разработчика72,5%
- DeepSeek V4 Flash 0731оценка разработчика70,3%
SWE-bench Verified
4 модели- Gemini 3.1 Pro Previewоценка разработчика80,6%
- Qwen3.6 27Bоценка разработчика77,2%
- Kimi K2 Thinkingоценка разработчика71,3%
- gpt-oss-120bоценка разработчика62,4%
BrowseComp
3 модели- GPT-5.5оценка разработчика84,4%
- MiniMax M3оценка разработчика83,5%
- Kimi K2 Thinkingоценка разработчика60,2%
LiveCodeBench v6
3 модели- Qwen3.8 27Bоценка разработчика90,3%
- Qwen3.6 27Bоценка разработчика83,9%
- Kimi K2 Thinkingоценка разработчика83,1%
Terminal-Bench 2.0
3 модели- GPT-5.5оценка разработчика82,7%
- Gemini 3.1 Pro Previewоценка разработчика68,5%
- Qwen3.6 27Bоценка разработчика59,3%
Agents' Last Exam
2 модели- DeepSeek V4 Pro 0813оценка разработчика25,7%
- DeepSeek V4 Flash 0731оценка разработчика25,2%
AIME 2026
2 модели- GLM-5.2оценка разработчика99,2%
- Qwen3.6 27Bоценка разработчика94,1%
AndroidWorld
2 модели- Qwen3.8 27Bоценка разработчика81,9%
- Qwen3.6 27Bоценка разработчика70,3%
AutomationBench (public set)
2 модели- DeepSeek V4 Pro 0813оценка разработчика31,8%
- DeepSeek V4 Flash 0731оценка разработчика25,1%
DeepSWE
2 модели- DeepSeek V4 Pro 0813оценка разработчика62,7%
- DeepSeek V4 Flash 0731оценка разработчика54,4%
FrontierSWE
2 модели- GLM-5.3оценка разработчика78,1%
- Qwen3.8 2.4T A95Bоценка разработчика73,5%
GDPval-AA v2
2 моделиHumanity's Last Exam (full set, no tools)
2 модели- Gemini 3.1 Pro Previewоценка разработчика44,4%
- Kimi K3оценка разработчика43,5%
IFBench
2 модели- Qwen3.8 2.4T A95Bоценка разработчика82,8%
- Qwen3.8 27Bоценка разработчика79,5%
MCP Atlas
2 модели- Kimi K2.7 Codeоценка разработчика76%
- Gemini 3.1 Pro Previewоценка разработчика69,2%
MCP-Atlas (public set)
2 модели- GLM-5.2оценка разработчика76,8%
- MiniMax M3независимая оценка74,2%
MMLU-Pro
2 модели- Qwen3.6 27Bоценка разработчика86,2%
- Kimi K2 Thinkingоценка разработчика84,6%
MMLU-Redux
2 модели- Kimi K2 Thinkingоценка разработчика94,4%
- Qwen3.6 27Bоценка разработчика93,5%
OSWorld-Verified
2 модели- Qwen3.8 27Bоценка разработчика84,3%
- GPT-5.5оценка разработчика78,7%
PaperBench
2 модели- Qwen3.8 2.4T A95Bоценка разработчика93%
- GPT-5.6 Solнезависимая оценка90,5%
ProgramBench
2 модели- Kimi K3оценка разработчика77,8%
- Kimi K2.7 Codeоценка разработчика53,6%
SWE-bench Multilingual
2 модели- Qwen3.6 27Bоценка разработчика71,3%
- Kimi K2 Thinkingоценка разработчика61,1%
Terminal-Bench 3.0
2 моделиЕдиничные результаты
41 бенчмарк- AA-LCRKimi K374,7%источник ↗
- Agents' Last Exam (ALE-CLI)GLM-5.328,5%источник ↗
- AIME 2025 (no tools)Kimi K2 Thinking94,5%источник ↗
- AIME 2025 (with Python)Kimi K2 Thinking99,1%источник ↗
- AndroidBenchQwen3.8 2.4T A95B75,1%источник ↗
- ARC-AGI-2 VerifiedGemini 3.1 Pro Preview77,1%источник ↗
- AutomationBench v1.0.6GLM-5.348,2%источник ↗
- CharXiv ReasoningQwen3.6 27B78,4%источник ↗
- CoWorkBenchQwen3.8 27B70,7%источник ↗
- CritPtKimi K323,4%источник ↗
- Expert-SWE (internal)GPT-5.573,1%источник ↗
- FrontierMath Tier 4GPT-5.535,4%источник ↗
- FrontierMath Tiers 1-3GPT-5.551,7%источник ↗
- GDPval (wins or ties)GPT-5.584,9%источник ↗
- HealthBenchQwen3.8 2.4T A95B60,2%источник ↗
- Humanity's Last Exam (full set, search + code)Gemini 3.1 Pro Preview51,4%источник ↗
- Humanity's Last Exam (full set, with tools)Kimi K356%источник ↗
- Humanity's Last Exam (no tools)DeepSeek V4 Pro 081342,7%источник ↗
- Humanity's Last Exam (text-only, no tools)Kimi K2 Thinking23,9%источник ↗
- Humanity's Last Exam (text-only, with tools)Kimi K2 Thinking44,9%источник ↗
- IMO-AnswerBenchKimi K2 Thinking78,6%источник ↗
- Kimi Claw 24/7 BenchKimi K2.7 Code46,9%источник ↗
- Kimi Code Bench v2Kimi K2.7 Code62%источник ↗
- LiveCodeBench ProGemini 3.1 Pro Preview2 887 Eloисточник ↗
- LongBench v2Qwen3.8 2.4T A95B66,3%источник ↗
- MCP Mark VerifiedKimi K2.7 Code81,1%источник ↗
- MLS Bench LiteKimi K2.7 Code35,1%источник ↗
- MMMUQwen3.6 27B82,9%источник ↗
- MMMU-ProQwen3.6 27B75,8%источник ↗
- Multi-SWE-benchKimi K2 Thinking41,9%источник ↗
- QwenSWEBenchQwen3.8 27B79%источник ↗
- RealWorldQAQwen3.6 27B84,1%источник ↗
- SkillsBenchQwen3.8 2.4T A95B70,2%источник ↗
- SkillsBench (avg@5)Qwen3.6 27B48,2%источник ↗
- SuperGPQAQwen3.6 27B66%источник ↗
- SWE-bench Multimodal (public dev split)Qwen3.8 27B38,6%источник ↗
- SWE-bench Pro (public)Gemini 3.1 Pro Preview54,2%источник ↗
- Terminal-Bench (source version unspecified)Kimi K2 Thinking47,1%источник ↗
- Tool-DecathlonGLM-5.248,2%источник ↗
- ToolathlonGPT-5.555,6%источник ↗
- WebArena-VerifiedQwen3.8 27B64,8%источник ↗