Бенчмарки моделей

Проверенные результаты публичных тестов моделей из каталога OmniRouter.

150результатов
17моделей
72бенчмарка
14источников
23.08.2026актуальность данных

Terminal-Bench 2.1

10 моделей
  • GPT-5.6 Solнезависимая оценка88,8%

    Qwen · получено 23.08.2026 · Benchmark-specific · с инструментами · effort max · источник ↗

  • Kimi K3оценка разработчика88,3%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · effort max · источник ↗

  • GLM-5.3оценка разработчика88,2%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · effort max · источник ↗

  • DeepSeek V4 Pro 0813оценка разработчика87,9%

    DeepSeek · получено 23.08.2026 · DeepSeek official evaluation · effort max · источник ↗

  • Qwen3.8 2.4T A95Bоценка разработчика86,6%

    Qwen · получено 23.08.2026 · Claude Code or benchmark-specific harness · с инструментами · источник ↗

  • Claude Opus 4.8независимая оценка85%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · источник ↗

  • DeepSeek V4 Flash 0731оценка разработчика82,7%

    DeepSeek · получено 23.08.2026 · DeepSeek Harness minimal mode · с инструментами · effort max · источник ↗

  • GLM-5.2оценка разработчика81%

    Z.ai · получено 23.08.2026 · Terminus-2 · с инструментами · источник ↗

  • Qwen3.8 27Bоценка разработчика73%

    Qwen · получено 23.08.2026 · Terminus-2 · с инструментами · источник ↗

  • MiniMax M3независимая оценка65%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · источник ↗

GPQA Diamond

9 моделей
  • Gemini 3.1 Pro Previewоценка разработчика94,3%

    Google DeepMind · получено 23.08.2026 · Google evaluation · без инструментов · effort high · источник ↗

  • GPT-5.6 Solнезависимая оценка94,1%

    Qwen · получено 23.08.2026 · Benchmark-specific · с инструментами · effort max · источник ↗

  • Kimi K3оценка разработчика93,5%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · effort max · источник ↗

  • MiniMax M3независимая оценка93%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · источник ↗

  • Qwen3.8 2.4T A95Bоценка разработчика92,6%

    Qwen · получено 23.08.2026 · Qwen evaluation · источник ↗

  • GLM-5.2оценка разработчика91,2%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · без инструментов · источник ↗

  • Qwen3.8 27Bоценка разработчика89,2%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

  • Qwen3.6 27Bоценка разработчика87,8%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

  • Kimi K2 Thinkingоценка разработчика84,5%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · без инструментов · источник ↗

NL2Repo-Bench

8 моделей
  • Claude Opus 4.8независимая оценка69,7%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · источник ↗

  • DeepSeek V4 Pro 0813оценка разработчика61,5%

    DeepSeek · получено 23.08.2026 · DeepSeek official evaluation · effort max · источник ↗

  • GLM-5.3оценка разработчика58%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · effort max · источник ↗

  • Qwen3.8 2.4T A95Bоценка разработчика55,9%

    Qwen · получено 23.08.2026 · Claude Code or benchmark-specific harness · с инструментами · источник ↗

  • DeepSeek V4 Flash 0731оценка разработчика54,2%

    DeepSeek · получено 23.08.2026 · DeepSeek Harness minimal mode · с инструментами · effort max · источник ↗

  • GLM-5.2оценка разработчика48,9%

    Z.ai · получено 23.08.2026 · OpenHands · с инструментами · источник ↗

  • Qwen3.8 27Bоценка разработчика42,3%

    Qwen · получено 23.08.2026 · Claude Code · с инструментами · источник ↗

  • Qwen3.6 27Bоценка разработчика36,2%

    Qwen · получено 23.08.2026 · Qwen internal agent scaffold · с инструментами · источник ↗

DeepSWE v1.1

6 моделей
  • GPT-5.6 Solнезависимая оценка73%

    Qwen · получено 23.08.2026 · Benchmark-specific · с инструментами · effort max · источник ↗

  • Kimi K3оценка разработчика67,5%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · effort max · источник ↗

  • GLM-5.3оценка разработчика66,9%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · effort max · источник ↗

  • Claude Opus 4.8независимая оценка58%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · источник ↗

  • Qwen3.8 2.4T A95Bоценка разработчика56,6%

    Qwen · получено 23.08.2026 · Claude Code or benchmark-specific harness · с инструментами · источник ↗

  • Qwen3.8 27Bоценка разработчика42,2%

    Qwen · получено 23.08.2026 · Claude Code · с инструментами · источник ↗

Humanity's Last Exam (with tools)

6 моделей

SWE-bench Pro

6 моделей
  • Qwen3.8 2.4T A95Bоценка разработчика67,7%

    Qwen · получено 23.08.2026 · Claude Code or benchmark-specific harness · с инструментами · источник ↗

  • GPT-5.6 Solнезависимая оценка64,6%

    Qwen · получено 23.08.2026 · Benchmark-specific · с инструментами · effort max · источник ↗

  • GLM-5.2оценка разработчика62,1%

    Z.ai · получено 23.08.2026 · OpenHands · с инструментами · источник ↗

  • Qwen3.8 27Bоценка разработчика61,7%

    Qwen · получено 23.08.2026 · Claude Code · с инструментами · источник ↗

  • MiniMax M3независимая оценка59%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · источник ↗

  • Qwen3.6 27Bоценка разработчика53,5%

    Qwen · получено 23.08.2026 · Qwen internal agent scaffold · с инструментами · источник ↗

CyberGym

5 моделей

Humanity's Last Exam

5 моделей
  • Qwen3.8 2.4T A95Bоценка разработчика43,6%

    Qwen · получено 23.08.2026 · Qwen evaluation · источник ↗

  • GLM-5.2оценка разработчика40,5%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · без инструментов · источник ↗

  • MiniMax M3независимая оценка37%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · источник ↗

  • Qwen3.8 27Bоценка разработчика30,8%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

  • Qwen3.6 27Bоценка разработчика24%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

Toolathlon Verified

5 моделей

SWE-bench Verified

4 модели
  • Gemini 3.1 Pro Previewоценка разработчика80,6%

    Google DeepMind · получено 23.08.2026 · Google evaluation · с инструментами · effort high · источник ↗

  • Qwen3.6 27Bоценка разработчика77,2%

    Qwen · получено 23.08.2026 · Qwen internal agent scaffold · с инструментами · источник ↗

  • Kimi K2 Thinkingоценка разработчика71,3%

    Moonshot AI · получено 23.08.2026 · Terminus-2 for Terminal-Bench; SWE-agent-derived internal harness otherwise · с инструментами · источник ↗

  • gpt-oss-120bоценка разработчика62,4%

    OpenAI · получено 23.08.2026 · OpenAI SWE-bench Verified evaluation · с инструментами · effort high · источник ↗

BrowseComp

3 модели
  • GPT-5.5оценка разработчика84,4%

    OpenAI · получено 23.08.2026 · OpenAI evaluation · источник ↗

  • MiniMax M3оценка разработчика83,5%

    MiniMax · получено 23.08.2026 · MiniMax evaluation · с инструментами · источник ↗

  • Kimi K2 Thinkingоценка разработчика60,2%

    Moonshot AI · получено 23.08.2026 · Moonshot AI search agent · с инструментами · источник ↗

LiveCodeBench v6

3 модели
  • Qwen3.8 27Bоценка разработчика90,3%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

  • Qwen3.6 27Bоценка разработчика83,9%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

  • Kimi K2 Thinkingоценка разработчика83,1%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · без инструментов · источник ↗

Terminal-Bench 2.0

3 модели
  • GPT-5.5оценка разработчика82,7%

    OpenAI · получено 23.08.2026 · OpenAI evaluation · источник ↗

  • Gemini 3.1 Pro Previewоценка разработчика68,5%

    Google DeepMind · получено 23.08.2026 · Google evaluation · с инструментами · effort high · источник ↗

  • Qwen3.6 27Bоценка разработчика59,3%

    Qwen · получено 23.08.2026 · Harbor / Terminus-2 · с инструментами · источник ↗

Agents' Last Exam

2 модели

AIME 2026

2 модели
  • GLM-5.2оценка разработчика99,2%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · без инструментов · источник ↗

  • Qwen3.6 27Bоценка разработчика94,1%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

AndroidWorld

2 модели
  • Qwen3.8 27Bоценка разработчика81,9%

    Qwen · получено 23.08.2026 · Qwen evaluation · с инструментами · источник ↗

  • Qwen3.6 27Bоценка разработчика70,3%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

AutomationBench (public set)

2 модели

DeepSWE

2 модели

FrontierSWE

2 модели
  • GLM-5.3оценка разработчика78,1%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · effort max · источник ↗

  • Qwen3.8 2.4T A95Bоценка разработчика73,5%

    Qwen · получено 23.08.2026 · Claude Code or benchmark-specific harness · с инструментами · источник ↗

GDPval-AA v2

2 модели
  • GLM-5.3оценка разработчика1 769 Elo

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · effort max · источник ↗

  • Grok 4.6оценка разработчика1 753 Elo

    xAI · получено 23.08.2026 · Grok Build · с инструментами · effort high · источник ↗

Humanity's Last Exam (full set, no tools)

2 модели
  • Gemini 3.1 Pro Previewоценка разработчика44,4%

    Google DeepMind · получено 23.08.2026 · Google evaluation · без инструментов · effort high · источник ↗

  • Kimi K3оценка разработчика43,5%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · effort max · источник ↗

IFBench

2 модели

MCP Atlas

2 модели

MCP-Atlas (public set)

2 модели
  • GLM-5.2оценка разработчика76,8%

    Z.ai · получено 23.08.2026 · Benchmark-specific · с инструментами · источник ↗

  • MiniMax M3независимая оценка74,2%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · источник ↗

MMLU-Pro

2 модели
  • Qwen3.6 27Bоценка разработчика86,2%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

  • Kimi K2 Thinkingоценка разработчика84,6%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · без инструментов · источник ↗

MMLU-Redux

2 модели
  • Kimi K2 Thinkingоценка разработчика94,4%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · без инструментов · источник ↗

  • Qwen3.6 27Bоценка разработчика93,5%

    Qwen · получено 23.08.2026 · Qwen evaluation · без инструментов · источник ↗

OSWorld-Verified

2 модели
  • Qwen3.8 27Bоценка разработчика84,3%

    Qwen · получено 23.08.2026 · Qwen evaluation · с инструментами · источник ↗

  • GPT-5.5оценка разработчика78,7%

    OpenAI · получено 23.08.2026 · OpenAI evaluation · источник ↗

PaperBench

2 модели
  • Qwen3.8 2.4T A95Bоценка разработчика93%

    Qwen · получено 23.08.2026 · Claude Code or benchmark-specific harness · с инструментами · источник ↗

  • GPT-5.6 Solнезависимая оценка90,5%

    Qwen · получено 23.08.2026 · Benchmark-specific · с инструментами · effort max · источник ↗

ProgramBench

2 модели
  • Kimi K3оценка разработчика77,8%

    Moonshot AI · получено 23.08.2026 · Moonshot AI evaluation · effort max · источник ↗

  • Kimi K2.7 Codeоценка разработчика53,6%

    Moonshot AI · получено 23.08.2026 · Kimi Code CLI · с инструментами · источник ↗

SWE-bench Multilingual

2 модели
  • Qwen3.6 27Bоценка разработчика71,3%

    Qwen · получено 23.08.2026 · Qwen internal agent scaffold · с инструментами · источник ↗

  • Kimi K2 Thinkingоценка разработчика61,1%

    Moonshot AI · получено 23.08.2026 · Terminus-2 for Terminal-Bench; SWE-agent-derived internal harness otherwise · с инструментами · источник ↗

Terminal-Bench 3.0

2 модели
  • GLM-5.3оценка разработчика28,3%

    Z.ai · получено 23.08.2026 · Z.ai evaluation · с инструментами · effort max · источник ↗

  • Grok 4.6оценка разработчика26%

    xAI · получено 23.08.2026 · Grok Build · с инструментами · effort high · источник ↗

Единичные результаты

41 бенчмарк