Skip to content

Leaderboard

Updated Oct 8, 11:55 PM ET

Current AI models ranked on professional work: finance, legal, medical coding and long agent assignments. Same scale as the overall score.

36 scored evaluations · 7 evaluators

Professional board 30 models

Sort

Score: 50 is the reference-group average and each 15 points is about one standard deviation; not a percentage.

  1. 01Claude Opus 5Anthropic · Jul 24, 202634 results · 97% coverage · $5 in / $25 out per 1M tokens73.6
  2. 02Claude Fable 5Anthropic · Jun 9, 202632 results · 88% coverage · $10 in / $50 out per 1M tokens73.6
  3. 03Muse Spark 1.3Meta · Sep 2, 202631 results · 88% coverage · $1.25 in / $4.25 out per 1M tokens72.5
  4. 04Claude Fable 5.1Anthropic · Sep 1, 202634 results · 97% coverage · $10 in / $50 out per 1M tokens72.2
  5. 05Claude Opus 5.5Anthropic · Sep 22, 202632 results · 91% coverage · $4 in / $20 out per 1M tokens71.8
  6. 06Claude Sonnet 5.5Anthropic · Sep 28, 202630 results · 85% coverage · $2 in / $10 out per 1M tokens71.1
  7. 07Grok 4.6xAI · Aug 12, 202634 results · 97% coverage · $2 in / $6 out per 1M tokens67.1
  8. 08Kimi K3Open weightsMoonshot AI · Jul 16, 202633 results · 94% coverage · $0.76 in / $13 out per 1M tokens66.7
  9. 09Grok 4.7xAI · Sep 21, 202631 results · 88% coverage · $2 in / $6 out per 1M tokens66.0
  10. 10Muse Spark 1.2Meta · Aug 5, 202627 results · 79% coverage · $1.25 in / $4.25 out per 1M tokens65.1
  11. 11GPT-6 AstraOpenAI · Sep 3, 202634 results · 97% coverage · $10 in / $50 out per 1M tokens63.1
  12. 12Gemini 3.8 FlashGoogle · Sep 2, 202633 results · 94% coverage · $0.75 in / $3.75 out per 1M tokens63.1
  13. 13Qwen3.8 MaxAlibaba · Aug 2, 202634 results · 97% coverage · — in / — out per 1M tokens62.9
  14. 14Qwen3.8 FlashOpen weightsAlibaba · Aug 26, 202610 results · 30% coverage · $0.15 in / $0.47 out per 1M tokens61.9
  15. 15Gemini 3.7 FlashGoogle · Aug 13, 202632 results · 91% coverage · $0.75 in / $3.75 out per 1M tokens61.6
  16. 16GPT-6.1 SolOpenAI · Sep 29, 202631 results · 88% coverage · $2 in / $10 out per 1M tokens61.2
  17. 17GLM 5.3Open weightsZ.ai · Aug 14, 202634 results · 97% coverage · $0.039 in / $3.39 out per 1M tokens60.7
  18. 18GLM 5.3 FlashOpen weightsZ.ai · Aug 20, 202629 results · 85% coverage · $0.15 in / $0.50 out per 1M tokens60.5
  19. 19Claude Opus 4.8Anthropic · May 28, 202632 results · 88% coverage · $5 in / $25 out per 1M tokens60.2
  20. 20Mistral Large 4Mistral · Oct 6, 202617 results · 52% coverage · $0.68 in / $2.09 out per 1M tokens59.5
  21. 21Claude Opus 4.7Anthropic · Apr 16, 202628 results · 79% coverage · $5 in / $25 out per 1M tokens58.7
  22. 22GPT-5.6 SolOpenAI · Jul 9, 202635 results · 97% coverage · $2 in / $10 out per 1M tokens58.5
  23. 23Muse Spark 1.1Meta · Jul 9, 202621 results · 64% coverage · $1.25 in / $4.25 out per 1M tokens58.5
  24. 24GPT-5.5OpenAI · Apr 23, 202630 results · 85% coverage · $5 in / $30 out per 1M tokens57.9
  25. 25Claude Haiku 5.5Anthropic · Oct 7, 202626 results · 76% coverage · $0.10 in / $0.50 out per 1M tokens57.8
  26. 26Grok 4.5xAI · Jul 8, 202630 results · 85% coverage · $2 in / $6 out per 1M tokens57.7
  27. 27Claude Sonnet 5Anthropic · Jun 30, 202633 results · 94% coverage · $2 in / $10 out per 1M tokens56.2
  28. 28DeepSeek V4 Pro 0813Open weightsDeepSeek · Aug 13, 202632 results · 91% coverage · $1.32 in / $3.96 out per 1M tokens55.8
  29. 29GPT-5.6 TerraOpenAI · Jul 9, 202635 results · 97% coverage · $2 in / $12 out per 1M tokens55.6
  30. 30Qwen3.8 27BOpen weightsAlibaba · Aug 3, 202626 results · 79% coverage · $0.43 in / $2.55 out per 1M tokens55.4

Ranks have no ties and stay as on the full board when filtered. At most 30 models are shown.

Not ranked yet

20 models

These models have a score, but their evidence is too narrow to rank: one bad result could move them a long way. They get a rank once the missing evaluations come in.

How to read this board

Every evaluation is converted to one ability scale. The reference group's average is 50 and each 15 points is about one standard deviation, so a score is not a percentage. Prices never affect the ranking, and an evaluation a model has not taken neither adds nor subtracts.

How the score works

About prices

Prices are list prices in US dollars per million tokens, from OpenRouter's public model list. Cached input is the price of input served from the prompt cache; cache writes and subscriptions are not included. A dash means no price is listed.

Scored evaluations by LiveBench, Epoch AI, LMArena, Vals AI, Mercor, BullshitBench, Artificial Analysis. Every evaluation and its evaluator is listed on the evaluations page; prices come from OpenRouter. The board is also available as JSON at /api/v1/leaderboard.