← chart

Models (679)

ModelCreatorReleaseVariantSrcintelligenceIndex ↓costPerTask gpqa hle terminalBench40 price1mInputTokens price1mOutputTokens outputTokensPerSecond
Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropicclaude-opus-5-5maxrsc57.6$5.98–61.4%59.6%$4.00$20.0095.3
Claude Opus 5.5 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropicclaude-opus-5-5xhighrsc56.0$3.46–57.5%59.6%$4.00$20.0081.5
Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropicclaude-sonnet-5-5maxrsc56.0$7.60–55.0%63.6%$2.00$10.00145.1
Claude Opus 5.5 (Adaptive Reasoning, High Effort, Default Fallback)Anthropicclaude-opus-5-5highrsc53.6$1.82–55.6%56.6%$4.00$20.0076.1
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropicclaude-fable-5-1maxrsc53.4$7.6393.7%59.1%52.0%$10.00$50.0068.9
Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropicclaude-fable-5-1xhighrsc53.2$5.9893.4%58.7%55.1%$10.00$50.0060.8
GPT-6 Astra (max)OpenAIgpt-6-astramaxrsc52.7$3.2696.1%54.7%59.1%$10.00$50.0061.7
GPT-6 Astra (xhigh)OpenAIgpt-6-astraxhighrsc52.4$2.3196.3%54.6%59.6%$10.00$50.0055.6
Claude Sonnet 5.5 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropicclaude-sonnet-5-5xhighrsc51.9$2.74–50.0%57.1%$2.00$10.0099.2
Claude Opus 5.5 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropicclaude-opus-5-5mediumrsc51.2$1.34–54.7%52.5%$4.00$20.0074.1
Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropicclaude-fable-5-1highrsc51.2$3.9190.6%55.9%52.0%$10.00$50.0050.4
GPT-6 Astra (high)OpenAIgpt-6-astrahighrsc50.9$1.7394.9%53.1%54.0%$10.00$50.0054.9
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropicclaude-opus-5maxrsc50.8$5.8693.2%54.9%49.0%$5.00$25.00–
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropicclaude-opus-5xhighrsc49.7$4.8893.7%54.4%46.5%$5.00$25.00–
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropicclaude-fable-5maxrsc49.6$8.7592.6%55.5%42.4%$10.00$50.00–
GPT-6 Astra (medium)OpenAIgpt-6-astramediumrsc49.6$1.5493.9%52.7%49.5%$10.00$50.0053.3
Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropicclaude-fable-5-1mediumrsc48.9$2.9888.6%53.8%44.9%$10.00$50.0050.8
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropicclaude-opus-5highrsc48.1$3.6193.7%52.8%46.0%$5.00$25.00–
Muse Spark 1.3 (max)Metamuse-spark-1-3maxrsc48.1$1.6093.5%48.7%33.3%$1.25$4.25189.5
GPT-6 Sol (max)OpenAIgpt-6-solmaxrsc47.5$1.05–47.9%43.9%$2.00$10.0085.4
GPT-5.6 Sol (max)OpenAIgpt-5-6-solmaxrsc47.0$1.9994.1%49.5%39.9%$4.00$20.00–
Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropicclaude-fable-5-1lowrsc46.8$2.3788.1%48.9%40.4%$10.00$50.0050.2
Claude Sonnet 5.5 (Adaptive Reasoning, High Effort, Default Fallback)Anthropicclaude-sonnet-5-5highrsc46.7$1.08–45.8%43.9%$2.00$10.0095.4
Grok 4.7 (xhigh)SpaceXAIgrok-4-7xhighrsc46.4$3.74–43.1%25.8%$2.00$6.0072.3
Grok 4.7 (high)SpaceXAIgrok-4-7highrsc46.3$2.73–42.3%24.7%$2.00$6.0079.2
MiMo-V2.6-ProXiaomimimo-v2-6-prorsc46.3$0.13–49.4%34.8%$0.43$0.8744.3
GPT-6 Astra (low)OpenAIgpt-6-astralowrsc45.8$0.8293.1%49.2%41.9%$10.00$50.0051.2
Qwen3.8 Max (0902)Alibabaqwen3-8-max-09020902rsc45.4$5.4192.8%43.1%38.9%$2.00$6.0038.3
Muse Spark 1.3 (xhigh)Metamuse-spark-1-3xhighrsc45.1$1.3794.1%47.5%16.7%$1.25$4.25148.6
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropicclaude-opus-5mediumrsc44.8$2.1991.9%51.3%34.3%$5.00$25.00–
GLM-5.3 (max)Z AIglm-5-3maxrsc44.8$2.0191.7%42.3%41.9%$1.40$4.4074.8
Grok 4.6 (high)SpaceXAIgrok-4-6highrsc44.3$1.8694.9%42.9%21.2%$2.00$6.0072.3
Grok 4.6 (xhigh)SpaceXAIgrok-4-6xhighrsc44.2$2.3293.5%44.1%17.2%$2.00$6.0070.3
GPT-6 Sol (xhigh)OpenAIgpt-6-solxhighrsc44.1$0.52–46.3%30.3%$2.00$10.0077.3
GPT-5.6 Sol (xhigh)OpenAIgpt-5-6-solxhighrsc44.0$1.1893.1%47.3%24.7%$4.00$20.00–
Step 5 PreviewStepFunstep-5-previewrsc43.7$0.72–46.5%33.3%$1.00$2.7084.1
Kimi K3 (max)Kimikimi-k3maxrsc43.6$2.0093.5%46.9%12.6%$3.00$15.00–
Grok 4.6 (medium)SpaceXAIgrok-4-6mediumrsc42.8$1.5093.5%42.1%13.1%$2.00$6.0060.5
GPT-6 Sol (high)OpenAIgpt-6-solhighrsc42.8$0.38–44.1%26.3%$2.00$10.0074.4
GPT-5.6 Sol (high)OpenAIgpt-5-6-solhighrsc42.3$0.8192.8%46.0%20.7%$4.00$20.00–
Claude Opus 5.5 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropicclaude-opus-5-5lowrsc42.3$0.55–48.3%31.3%$4.00$20.0075.3
GPT-5.6 Terra (max)OpenAIgpt-5-6-terramaxrsc42.1$1.4092.5%42.9%35.4%$2.00$12.00109.0
GLM 5.3 FlashZ AIglm-5-3-flashmaxrsc41.8$0.2591.2%39.9%32.8%$0.15$0.5049.2
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropicclaude-opus-4-8maxrsc41.8$4.0892.0%48.7%21.7%$5.00$25.00–
Gemini 3.8 Flash (high)Googlegemini-3-8-flashhighrsc40.9$1.2495.3%47.8%19.7%$0.75$3.75238.1
Claude Sonnet 5.5 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropicclaude-sonnet-5-5mediumrsc40.7$0.59–39.8%29.8%$2.00$10.0087.7
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropicclaude-opus-4-7maxrsc40.7–91.4%42.3%–$5.00$25.00–
Qwen3.8 MaxAlibabaqwen3-8-max0803rsc40.2$2.6792.7%43.0%18.7%$2.00$6.00–
Qwen3.8 2.4T A95BAlibabaqwen3-8-2-4t-a95brsc39.9$2.1693.5%42.4%11.1%$2.00$6.0038.5
Qwen3.8-Flash-NextAlibabaqwen3-8-flash-nextrsc39.8$0.3792.3%38.0%25.3%$0.15$0.4753.0
GPT-6 Sol (medium)OpenAIgpt-6-solmediumrsc39.8$0.25–41.0%18.7%$2.00$10.00–
Gemini 3.8 Flash (medium)Googlegemini-3-8-flashmediumrsc39.8$0.9393.5%42.1%19.7%$0.75$3.75–
Gemini 3.7 Flash (medium)Googlegemini-3-7-flashmediumrsc39.6–92.1%39.0%–$0.75$3.75–
Muse Spark 1.2 (xhigh)Metamuse-spark-1-2xhighrsc39.6$0.9790.4%45.5%7.1%$1.25$4.25–
DeepSeek V4.1 Flash (Reasoning, Max Effort)DeepSeekdeepseek-v4-1-flashmaxrsc39.5$0.27–39.2%26.8%$0.30$1.20217.6
Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropicclaude-opus-5lowrsc39.4$1.1088.9%43.4%26.3%$5.00$25.00–
GPT-5.6 Sol (medium)OpenAIgpt-5-6-solmediumrsc39.2$0.5092.6%42.2%14.6%$4.00$20.00–
Gemini 3.7 Flash (high)Googlegemini-3-7-flashhighrsc39.1$0.9394.5%47.9%13.6%$0.75$3.75–
GPT-5.4 (xhigh)OpenAIgpt-5-4xhighrsc39.0–92.0%43.7%–$2.50$15.00–
Grok 4.5 (high)SpaceXAIgrok-4-5highrsc38.8$1.0493.1%42.7%10.6%$2.00$6.00–
GPT-5.5 (xhigh)OpenAIgpt-5-5xhighrsc38.4$2.6393.5%45.8%14.6%$5.00$30.00–
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropicclaude-sonnet-5maxrsc38.2$5.0991.1%41.3%14.1%$2.00$10.0081.7
GPT-5.6 Terra (xhigh)OpenAIgpt-5-6-terraxhighrsc38.0$0.6390.8%41.9%10.1%$2.00$12.00100.4
MiMo-V2.6-FlashXiaomimimo-v2-6-flashrsc37.9$0.062–35.1%22.7%$0.14$0.2842.3
GPT-5.6 Luna (max)OpenAIgpt-5-6-lunamaxrsc37.3$0.1891.1%39.5%11.6%$0.20$1.20–
GPT-6 Luna (max)OpenAIgpt-6-lunamaxrsc37.3$0.068–38.5%12.6%$0.10$0.50143.3
GPT-5.5 (high)OpenAIgpt-5-5highrsc37.0$1.5493.2%45.0%9.1%$5.00$30.00–
Gemini 3.7 Flash (low)Googlegemini-3-7-flashlowrsc36.9–90.1%35.1%–$0.75$3.75–
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeekdeepseek-v4-promaxrsc36.0$0.6792.8%41.0%14.1%$1.32$3.9690.7
Claude Sonnet 5.5 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropicclaude-sonnet-5-5lowrsc35.8$0.41–36.2%20.7%$2.00$10.0089.5
Grok 4.6 (low)SpaceXAIgrok-4-6lowrsc35.1$0.4887.9%27.6%3.0%$2.00$6.0062.5
DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeekdeepseek-v4-flash-visionmaxrsc34.8$0.3191.3%34.5%12.1%$0.44$1.32227.5
GPT-5.6 Luna (xhigh)OpenAIgpt-5-6-lunaxhighrsc34.6$0.08589.5%37.0%3.5%$0.20$1.20–
Kimi K3 (low)Kimikimi-k3lowrsc34.5–84.2%25.0%12.6%$3.00$15.00–
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)Anthropicclaude-sonnet-5xhighrsc34.4$2.87–39.0%7.1%$2.00$10.0073.2
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeekdeepseek-v4-flashmaxrsc34.3$0.2290.8%38.6%12.1%$0.44$1.32–
GLM-5.3 (low)Z AIglm-5-3lowrsc34.3$0.85–36.6%34.8%$1.40$4.4078.9
GPT-5.6 Terra (high)OpenAIgpt-5-6-terrahighrsc34.2$0.3489.6%38.5%1.5%$2.00$12.0094.6
Gemini 3.6 Flash (high)Googlegemini-3-6-flashhighrsc34.0$0.9392.8%40.8%7.1%$0.75$3.75–
GPT-6 Sol (low)OpenAIgpt-6-sollowrsc33.9$0.13–34.9%9.1%$2.00$10.0079.7
GPT-6 Luna (xhigh)OpenAIgpt-6-lunaxhighrsc33.9$0.042–34.3%8.1%$0.10$0.50145.6
GPT-5.5 (medium)OpenAIgpt-5-5mediumrsc33.8$0.9092.6%42.4%5.1%$5.00$30.00–
Muse Spark 1.1 (xhigh)Metamuse-spark-1-1xhighrsc33.7$1.3889.8%46.2%6.1%$1.25$4.25–
GLM-5.2 (max)Z AIglm-5-2maxrsc33.7$1.4789.5%41.1%1.0%$1.40$4.40–
Qwen3.8 27B (xhigh)Alibabaqwen3-8-27bxhighrsc33.7$1.0190.5%33.9%5.6%$0.50$3.0045.5
Gemini 3.5 Flash (medium)Googlegemini-3-5-flashmediumrsc33.6–92.1%41.3%–$1.50$9.00–
Motif 3Motif Technologiesmotif-3rsc33.6–83.4%37.0%––––
GPT-5.6 Sol (low)OpenAIgpt-5-6-sollowrsc33.5$0.2689.8%39.4%1.0%$4.00$20.00–
Gemini 3.8 Flash (low)Googlegemini-3-8-flashlowrsc33.5–92.0%37.1%10.1%$0.75$3.75–
Gemini 3.5 Flash (high)Googlegemini-3-5-flashhighrsc32.6$1.5692.2%42.7%6.6%$1.50$9.00–
GPT-5.3 Codex (xhigh)OpenAIgpt-5-3-codexxhighrsc32.5–91.5%42.5%–$1.75$14.00113.8
Motif 3 (Beta)Motif Technologiesmotif-0714betarsc32.3–86.9%40.4%––––
GPT-6 Luna (high)OpenAIgpt-6-lunahighrsc32.1$0.029–32.9%4.5%$0.10$0.50144.8
GPT-5.6 Luna (high)OpenAIgpt-5-6-lunahighrsc32.1$0.04489.2%33.4%2.5%$0.20$1.20–
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropicclaude-opus-4-6maxrsc31.9–89.6%39.9%–$5.00$25.00–
Claude Sonnet 5 (Adaptive Reasoning, High Effort)Anthropicclaude-sonnet-5highrsc31.7$1.79–35.7%5.1%$2.00$10.0062.8
Muse SparkMetamuse-sparkrsc31.3–88.4%40.7%––––
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropicclaude-opus-4-7highrsc30.9–88.5%33.3%–$5.00$25.00–
GPT-5.5 (low)OpenAIgpt-5-5lowrsc30.7–91.0%32.7%–$5.00$30.00–
K2 Horizon 375B A23BInstitute of Foundation Modelsk2-horizon-375b-a23brsc30.5–87.3%32.0%1.5%–––
DeepSeek V4 Pro 0424 (Reasoning, Max Effort)DeepSeekdeepseek-v4-pro-0424maxrsc30.4$0.1288.8%37.5%14.6%$0.43$0.87–
GPT-5.2 (xhigh)OpenAIgpt-5-2xhighrsc30.4–90.3%37.7%–$1.75$14.00–
DeepSeek V4 Pro 0424 (Reasoning, High Effort)DeepSeekdeepseek-v4-pro-0424highrsc30.1–90.5%35.2%–$0.43$0.87–
GPT-5.6 Terra (medium)OpenAIgpt-5-6-terramediumrsc30.1$0.1887.2%33.3%1.0%$2.00$12.0097.3
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropicclaude-sonnet-4-6maxrsc30.1$2.4987.5%33.6%3.0%$3.00$15.00–
Gemini 3.1 Pro PreviewGooglegemini-3-1-pro-previewrsc29.7$0.6794.1%47.0%4.0%$2.00$12.00131.4
GPT-6 Luna (medium)OpenAIgpt-6-lunamediumrsc29.5$0.018–28.3%2.5%$0.10$0.50–
Qwen3.7 MaxAlibabaqwen3-7-maxrsc29.5$1.1592.3%40.5%1.5%$2.50$7.50–
MiniMax-M3MiniMaxminimax-m3rsc29.2$0.5192.9%39.0%2.0%$0.30$1.20137.6
Claude Opus 4.5 (Reasoning)Anthropicclaude-opus-4-5thinkingrsc29.1–86.6%30.1%–$5.00$25.00–
MiMo-V2-ProXiaomimimo-v2-prorsc28.6–87.0%30.4%––––
GPT-5.2 Codex (xhigh)OpenAIgpt-5-2-codexxhighrsc28.5–89.9%35.7%–$1.75$14.00–
Qwen3.6 Max PreviewAlibabaqwen3-6-maxrsc28.4–88.8%30.8%–$1.30$7.80–
GPT-5.6 Sol (Non-reasoning)OpenAIgpt-5-6-solnon-reasoningrsc28.3–79.0%16.7%–$4.00$20.00–
Nex-N2-Pro (based on Qwen3.5-397B-A17B)Nex AGInex-n2-probased on qwen3.5-397b-a17brsc28.2–89.2%33.7%––––
Solar Pro 4Upstagesolar-pro4rsc28.2–89.1%29.2%0.5%$0.30$1.2084.0
GPT-6 Sol (Non-reasoning)OpenAIgpt-6-solnon-reasoningrsc28.1$0.33–18.4%13.1%$2.00$10.0077.7
Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)Anthropicclaude-sonnet-5mediumrsc28.1$1.0–30.0%2.0%$2.00$10.0058.4
Gemini 3 Pro Preview (high)Googlegemini-3-pro-previewhighrsc28.0–90.8%39.7%–$2.00$12.00–
GLM-5 (Reasoning)Z AIglm-5rsc27.9–82.0%29.3%–$1.00$3.20–
Inkling SmallThinking Machinesinkling-smallrsc27.8–89.5%33.3%1.0%$0.30$1.20226.6
GPT-5.4 (low)OpenAIgpt-5-4lowrsc27.6–87.1%30.8%–$2.50$15.00–
Qwen3.8 27B (medium)Alibabaqwen3-8-27bmediumrsc27.6$1.1384.5%14.1%5.1%$0.50$3.0047.6
GPT-5.6 Terra (low)OpenAIgpt-5-6-terralowrsc27.5$0.1484.3%29.2%1.5%$2.00$12.0093.9
JT-4.1 Flash 236B A21BChina Mobilejt-4-1-flash-236b-a21bnon-reasoningrsc27.3–84.5%17.8%––––
Grok Build 0.1 0616SpaceXAIgrok-build-0-1-0616rsc27.2–89.5%38.3%–$1.00$2.00–
Qwen3.6 PlusAlibabaqwen3-6-plusrsc27.0–88.2%27.8%–$0.50$3.00–
Kimi K2.6Kimikimi-k2-6rsc27.0$0.8091.1%37.5%0.5%$0.95$4.00–
Quasar 438B (max, based on GLM-5.2)Multiverse Computingquasar-438bmaxrsc26.7$2.0273.2%18.7%1.0%$0.60$1.80160.9
GLM-5-TurboZ AIglm-5-turborsc26.6–84.7%27.8%––––
GPT-5.2 (medium)OpenAIgpt-5-2mediumrsc26.5–86.4%26.7%–$1.75$14.00–
Apodex 1.1Apodexapodex-1-1rsc26.4$0.4686.4%34.1%0.0%$0.30$3.00–
Claude Opus 4.6 (Non-reasoning, High Effort)Anthropicclaude-opus-4-6highrsc26.4–84.0%19.1%–$5.00$25.00–
Gemini 3 Flash Preview (Reasoning)Googlegemini-3-flash-previewrsc26.3–89.8%36.6%–$0.50$3.00–
Qwen3.8 27B (low)Alibabaqwen3-8-27blowrsc26.2$1.0584.5%14.0%2.5%$0.50$3.0051.4
GLM-5.1 (Reasoning)Z AIglm-5-1rsc26.1$1.0286.8%30.1%2.0%$1.28$4.07–
GPT-5.5 Instant (June 2026)OpenAIgpt-5-5-instant-06-26june 2026rsc26.0$0.6982.3%19.9%12.6%$5.00$30.00128.7
DeepSeek V4 Flash 0420 (Reasoning, High Effort)DeepSeekdeepseek-v4-flash-0420highrsc26.0–86.7%30.3%3.0%$0.11$0.24–
MiMo-V2.5-ProXiaomimimo-v2-5-prorsc26.0$0.05486.6%35.7%0.0%$0.43$0.8729.0
Kimi K2.7 CodeKimikimi-k2-7-codersc25.8$0.5489.6%35.0%1.0%$0.95$4.00–
Grok 4.20 0309 v2 (Reasoning)SpaceXAIgrok-4-20rsc25.7–91.1%34.5%–$1.25$2.50–
K2 Horizon MoVA 36B A4BInstitute of Foundation Modelsk2-horizon-mova-36b-a4brsc25.3–82.2%23.4%0.0%–––
Hy3Tencenthy3rsc25.3$0.07289.7%33.5%0.5%$0.14$0.5595.6
Grok 4.20 0309 (Reasoning)SpaceXAIgrok-4-20-0309rsc25.2–88.5%32.4%–$2.00$6.00–
MiMo-V2.5Xiaomimimo-v2-5-0424rsc25.2–84.9%27.2%0.0%$0.14$0.2845.4
Qwen3.7 PlusAlibabaqwen3-7-plusrsc25.2$0.2290.0%35.6%1.0%$0.40$1.6057.5
MiMo-V2-Omni-0327Xiaomimimo-v2-omni-0327rsc25.1–85.5%22.6%––––
GPT-5.6 Luna (medium)OpenAIgpt-5-6-lunamediumrsc25.0$0.01685.9%25.8%0.5%$0.20$1.20–
Inkling (xhigh)Thinking Machinesinklingxhighrsc25.0–87.2%31.9%1.0%$1.00$4.05186.2
Ling 3.0 FlashInclusionAIling-3-0-flashrsc24.9–85.5%23.7%0.0%$0.075$0.22378.8
GPT-5 Codex (high)OpenAIgpt-5-codexhighrsc24.9–83.7%27.8%–$1.25$10.00–
Grok 4.3 (high)SpaceXAIgrok-4-3highrsc24.9$0.2190.1%37.2%0.0%$1.25$2.50–
Grok 4.3 (medium)SpaceXAIgrok-4-3mediumrsc24.8–89.0%30.0%–$1.25$2.50–
Solar Open2 250BUpstagesolar-open2-250brsc24.7–85.7%28.5%––––
GPT-5.1 (high)OpenAIgpt-5-1highrsc24.7–87.3%28.5%–$1.25$10.00–
Claude Sonnet 4.6 (Non-reasoning, High Effort)Anthropicclaude-sonnet-4-6non-reasoningrsc24.7–79.9%13.3%–$3.00$15.00–
DeepSeek V4.1 Flash (Non-Reasoning)DeepSeekdeepseek-v4-1-flashnon-reasoningrsc24.7$0.15–10.8%5.6%$0.30$1.20217.5
Ling-3.0-flash-VLInclusionAIling-3-0-flash-vlrsc24.6–86.2%22.0%0.0%$0.075$0.22149.7
Grok 4.3 (low)SpaceXAIgrok-4-3lowrsc24.3–84.3%18.4%–$1.25$2.50–
Claude Sonnet 5 (Adaptive Reasoning, Low Effort)Anthropicclaude-sonnet-5lowrsc24.3$0.51–21.9%2.5%$2.00$10.0060.1
GLM-5.1 (Non-reasoning)Z AIglm-5-1non-reasoningrsc24.2–83.9%27.9%–$1.38$4.40–
DeepSeek V4 Flash 0420 (Reasoning, Max Effort)DeepSeekdeepseek-v4-flash-0420maxrsc24.2$0.1189.4%34.8%2.5%$0.13$0.28–
GPT-5.4 mini (xhigh)OpenAIgpt-5-4-minixhighrsc24.1$0.4587.5%28.1%2.0%$0.75$4.50–
MiMo-V2-OmniXiaomimimo-v2-omnirsc23.9–82.8%22.1%––––
Gemini 3.5 Flash (minimal)Googlegemini-3-5-flashminimalrsc23.8–82.8%24.1%–$1.50$9.00–
GPT-5.1 Codex (high)OpenAIgpt-5-1-codexhighrsc23.7–86.0%25.7%–$1.25$10.00–
Claude Opus 4.5 (Non-reasoning)Anthropicclaude-opus-4-5non-reasoningrsc23.7–81.0%13.2%–$5.00$25.00–
Kimi K2.6 (Non-reasoning)Kimikimi-k2-6non-reasoningrsc23.6–78.8%19.6%–$0.95$4.00–
GLM 5V Turbo (Reasoning)Z AIglm-5v-turborsc23.5–80.9%17.1%––––
Kimi K2.5 (Reasoning)Kimikimi-k2-5rsc23.5–87.9%30.7%–$0.60$2.75–
Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropicclaude-sonnet-4-6non-reasoningrsc23.3–79.7%11.2%–$3.00$15.00–
Claude Sonnet 5 (Non-reasoning, High Effort)Anthropicclaude-sonnet-5non-reasoningrsc23.2–80.0%19.0%–$2.00$10.0058.3
GPT-5.5 (Non-reasoning)OpenAIgpt-5-5non-reasoningrsc23.2–76.8%13.7%–$5.00$30.00–
GPT-5 (high)OpenAIgpt-5highrsc23.0–85.4%28.5%–$1.25$10.00–
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIAnemotron-3-ultra-550b-a55brsc22.9$0.6086.7%28.4%0.5%$0.60$2.50214.9
Qwen3.5 27B (Reasoning)Alibabaqwen3-5-27brsc22.9–85.8%23.9%–$0.30$2.40–
GPT-5 (medium)OpenAIgpt-5mediumrsc22.9–84.2%25.4%–$1.25$10.00–
Claude 4.1 Opus (Reasoning)Anthropicclaude-4-1-opusthinkingrsc22.8–80.9%12.5%–$15.00$75.00–
MiniMax-M2.5MiniMaxminimax-m2-5rsc22.8–84.8%20.5%–$0.30$1.20–
MiniMax-M2.7MiniMaxminimax-m2-7rsc22.8–87.4%29.6%0.0%$0.30$1.20–
Hy3-preview (Reasoning)Tencenthy3-previewrsc22.7–86.7%27.8%–$0.063$0.21–
A.X-K2SK Telecoma-x-k2rsc22.7–85.7%29.6%––––
GPT-5.5 Instant (May 2026)OpenAIgpt-5-5-instant-05-26may 2026rsc22.7–84.6%21.6%–$5.00$30.00–
Ling-3.0-flash-FinInclusionAIling-3-0-flash-finrsc22.6––22.6%0.0%$0.075$0.22165.2
Grok 4SpaceXAIgrok-4rsc22.5–87.7%26.7%–$3.00$15.00–
MiMo-V2-Flash (Feb 2026)Xiaomimimo-v2-0206feb 2026rsc22.4–83.5%22.1%––––
GLM-5.2 (Non-reasoning)Z AIglm-5-2non-reasoningrsc22.4–68.6%9.8%–$1.40$4.40–
Gemini 3 Pro Preview (low)Googlegemini-3-pro-previewlowrsc22.3–88.7%29.5%–$2.00$12.00–
GLM-4.7 (Reasoning)Z AIglm-4-7rsc22.2–85.9%27.4%–$0.60$2.20–
Gemini 3.5 Flash-LiteGooglegemini-3-5-flash-litehighrsc22.2$0.1283.8%18.8%1.0%$0.30$2.50334.8
Kimi K2 ThinkingKimikimi-k2-thinkingrsc22.0–83.8%23.8%–$0.60$2.50–
o3-proOpenAIo3-prorsc21.9–84.5%––$20.00$80.00–
G9v3-39A5BAI9Starsg9v3-39a5brsc21.8–80.5%17.5%–$0.0$0.0–
GLM-5 (Non-reasoning)Z AIglm-5non-reasoningrsc21.8–66.6%7.6%–$1.00$3.20–
KAT Coder Pro V2KwaiKATkat-coder-pro-v2non-reasoningrsc21.7–85.5%16.1%–$0.30$1.20–
DeepSeek V3.2 (Reasoning)DeepSeekdeepseek-v3-2reasoningrsc21.5–84.0%24.6%–$0.28$0.42–
Qwen3.5 397B A17B (Non-reasoning)Alibabaqwen3-5-397b-a17bnon-reasoningrsc21.4–86.1%19.8%–$0.60$3.6086.3
Qwen3.6 27B (Reasoning)Alibabaqwen3-6-27brsc21.4$0.6284.2%23.1%0.0%$0.60$3.60–
Qwen3 Max ThinkingAlibabaqwen3-max-thinkingrsc21.3–86.1%28.0%––––
GPT-5.6 Luna (low)OpenAIgpt-5-6-lunalowrsc21.0$0.009883.5%19.8%0.0%$0.20$1.20–
MiniMax-M2.1MiniMaxminimax-m2-1rsc20.9–83.0%23.2%–$0.30$1.20–
GPT-6 Luna (low)OpenAIgpt-6-lunalowrsc20.9$0.0045–20.3%0.0%$0.10$0.50141.5
DeepSeek V4 Pro 0424 (Non-reasoning)DeepSeekdeepseek-v4-pro-0424non-reasoningrsc20.8–71.7%8.2%–$0.43$0.87–
MiMo-V2-Flash (Reasoning)Xiaomimimo-v2-flashreasoningrsc20.8–84.6%22.8%–$0.10$0.30–
GPT-5 (low)OpenAIgpt-5lowrsc20.8–80.8%19.6%–$1.25$10.00–
GPT-5.6 Terra (Non-reasoning)OpenAIgpt-5-6-terranon-reasoningrsc20.8$0.1474.6%11.4%0.5%$2.00$12.0090.7
GPT-5.4 nano (xhigh)OpenAIgpt-5-4-nanoxhighrsc20.7$0.1881.7%28.3%0.5%$0.20$1.25–
Claude 4.5 Sonnet (Reasoning)Anthropicclaude-4-5-sonnetthinkingrsc20.7$0.5683.4%17.8%0.0%$3.00$15.00–
Claude 4 Opus (Reasoning)Anthropicclaude-4-opusthinkingrsc20.6–79.6%12.3%–$15.00$75.00–
GPT-5 mini (medium)OpenAIgpt-5-minimediumrsc20.6–80.3%15.9%–$0.25$2.00–
K2 Horizon 7BInstitute of Foundation Modelsk2-horizon-7brsc20.6–75.3%18.2%1.0%–––
Qwen3.5 Omni PlusAlibabaqwen3-5-omni-plusnon-reasoningrsc20.4–82.6%14.9%–$0.40$4.8086.9
GPT-5.1 Codex mini (high)OpenAIgpt-5-1-codex-minihighrsc20.4–81.3%18.5%–$0.25$2.00–
Grok 4.1 Fast (Reasoning)SpaceXAIgrok-4-1-fastreasoningrsc20.4–85.3%19.3%––––
o3OpenAIo3rsc20.2–82.7%20.1%–$2.00$8.00170.5
Qwen3.8 27B (Non-reasoning)Alibabaqwen3-8-27bnon-reasoningrsc20.2$2.4981.8%12.1%0.0%$0.50$3.0050.9
GPT-5.4 nano (medium)OpenAIgpt-5-4-nanomediumrsc20.0–76.1%15.9%–$0.20$1.25–
Qwen3.6 27B (Non-reasoning)Alibabaqwen3-6-27bnon-reasoningrsc19.8–82.9%15.1%–$0.60$3.60–
GPT-5.4 mini (medium)OpenAIgpt-5-4-minimediumrsc19.7–82.3%18.6%–$0.75$4.50–
K-EXAONE 2.0 0803LG AI Researchk-exaone-2-0-0803rsc19.7–82.9%18.6%––––
Step 3.7 FlashStepFunstep-3-7-flashhighrsc19.5–80.9%21.4%–$0.20$1.15197.3
Kimi K2.5 (Non-reasoning)Kimikimi-k2-5non-reasoningrsc19.4–78.9%13.2%–$0.60$3.00–
Qwen3.5 27B (Non-reasoning)Alibabaqwen3-5-27bnon-reasoningrsc19.4–84.2%13.9%–$0.30$2.40–
Claude 4.5 Sonnet (Non-reasoning)Anthropicclaude-4-5-sonnetnon-reasoningrsc19.3–72.7%7.2%–$3.00$15.00–
Qwen3.5 35B A3B (Reasoning)Alibabaqwen3-5-35b-a3brsc19.3–84.5%21.0%–$0.25$2.00–
LongCat 2.0LongCatlongcat-2-0rsc19.1$0.05978.0%33.7%0.0%$0.30$1.20–
Gemma 4 31B (Reasoning)Googlegemma-4-31brsc19.0–85.7%23.6%0.0%$0.0$0.035.0
Claude 4 Sonnet (Reasoning)Anthropicclaude-4-sonnetthinkingrsc18.9–77.7%10.7%––––
DeepSeek V4 Flash 0420 (Non-reasoning)DeepSeekdeepseek-v4-flash-0420non-reasoningrsc18.9–71.6%7.8%–$0.092$0.19–
JT-35B-FlashChina Mobilejt-35b-flashnon-reasoningrsc18.7–82.9%6.4%––––
MiniMax-M2MiniMaxminimax-m2rsc18.6–77.7%13.7%–$0.30$1.20–
KAT-Coder-Pro V1KwaiKATkat-coder-pro-v1non-reasoningrsc18.6–76.4%33.6%––––
Claude 4.1 Opus (Non-reasoning)Anthropicclaude-4-1-opusnon-reasoningrsc18.6––––$15.00$75.00–
GLM-4.6 (Reasoning)Z AIglm-4-6reasoningrsc18.5–78.0%14.5%–$0.55$2.20–
Qwen3.5 397B A17B (Reasoning)Alibabaqwen3-5-397b-a17brsc18.4$0.4789.3%29.0%0.0%$0.60$3.6088.8
MiMo-V2.5-Pro (Non-reasoning)Xiaomimimo-v2-5-pronon-reasoningrsc18.3–76.2%14.8%–$0.43$0.8727.7
GPT-6 Luna (Non-reasoning)OpenAIgpt-6-lunanon-reasoningrsc18.3$0.011–8.6%1.5%$0.10$0.50139.3
Qwen3.6 35B A3B (Reasoning)Alibabaqwen3-6-35b-a3brsc18.2$0.4884.1%22.2%0.0%$0.38$2.25138.7
GPT-5.4 (Non-reasoning)OpenAIgpt-5-4non-reasoningrsc18.2–74.8%11.3%–$2.50$15.00–
Grok 4 Fast (Reasoning)SpaceXAIgrok-4-fastreasoningrsc17.9–84.7%19.1%–$0.20$0.50–
Gemini 3 Flash Preview (Non-reasoning)Googlegemini-3-flash-previewnon-reasoningrsc17.9–81.2%15.0%–$0.50$3.00–
Qwen3.5 122B A10B (Non-reasoning)Alibabaqwen3-5-122b-a10bnon-reasoningrsc17.7–82.7%15.9%–$0.40$3.20148.6
Claude 3.7 Sonnet (Reasoning)Anthropicclaude-3-7-sonnetthinkingrsc17.7–77.2%9.7%––––
Muse Glimmer (high)Metamuse-glimmerhighrsc17.5$0.05783.5%22.0%0.5%$0.32$1.35161.9
GLM-4.7 (Non-reasoning)Z AIglm-4-7non-reasoningrsc17.4–66.4%6.4%–$0.60$2.20–
Hy3-preview (Non-reasoning)Tencenthy3-previewnon-reasoningrsc17.0–73.2%7.0%–$0.063$0.21–
Ling-2.6-1TInclusionAIling-2-6-1tnon-reasoningrsc17.0–75.2%8.7%–$0.30$2.50–
GPT-5.2 (Non-reasoning)OpenAIgpt-5-2non-reasoningrsc17.0–71.2%8.0%–$1.75$14.00–
Step 3.5 Flash 2603StepFunstep-3-5-flashrsc17.0–82.6%24.5%–$0.10$0.30–
Doubao Seed CodeByteDance Seeddoubao-seed-codersc16.9–76.4%14.1%––––
Claude 4.5 Haiku (Reasoning)Anthropicclaude-4-5-haikureasoningrsc16.9$0.2867.2%10.4%0.0%$1.00$5.00104.4
GPT-5 mini (high)OpenAIgpt-5-minihighrsc16.8$0.05382.8%21.5%0.0%$0.25$2.00–
Gemma 4 26B A4B (Reasoning)Googlegemma-4-26b-a4brsc16.7–79.2%19.3%–$0.10$0.37–
o4-mini (high)OpenAIo4-minihighrsc16.7–78.4%16.5%–$1.10$4.40–
Ring-2.6-1TInclusionAIring-2-6-1txhighrsc16.6$0.2985.7%21.6%0.5%$0.30$2.50118.4
Step 3.5 FlashStepFunstep-3-5-flash-0202rsc16.6–83.1%21.1%–$0.10$0.30–
Claude 4 Opus (Non-reasoning)Anthropicclaude-4-opusnon-reasoningrsc16.6–70.1%6.2%–$15.00$75.00–
Claude 4 Sonnet (Non-reasoning)Anthropicclaude-4-sonnetnon-reasoningrsc16.6–68.3%4.3%––––
DeepSeek V3.2 Exp (Reasoning)DeepSeekdeepseek-v3-2-0925rsc16.6–79.7%14.9%–$0.28$0.42–
Qwen3 Max Thinking (Preview)Alibabaqwen3-max-thinking-previewpreviewrsc16.3–77.6%12.7%–$1.20$6.00–
Gemini 2.5 ProGooglegemini-2-5-prorsc16.1$0.2384.4%22.5%0.0%$1.25$10.00–
MiMo-V2-Flash (Non-reasoning)Xiaomimimo-v2-flashnon-reasoningrsc16.0–65.6%8.6%––––
DeepSeek V3.2 (Non-reasoning)DeepSeekdeepseek-v3-2non-reasoningrsc16.0–75.1%11.2%–$0.28$0.42–
K2 Horizon 3.7BInstitute of Foundation Modelsk2-horizon-3-7brsc15.6–69.2%13.9%0.0%–––
Qwen3 MaxAlibabaqwen3-maxnon-reasoningrsc15.6–76.4%11.9%–$1.20$6.00–
Qwen3.5 122B A10B (Reasoning)Alibabaqwen3-5-122b-a10brsc15.6$0.3285.7%25.2%0.0%$0.40$3.20133.1
Gemini 3.1 Flash-LiteGooglegemini-3-1-flash-litehighrsc15.6$0.03982.2%17.2%0.5%$0.25$1.50–
GPT-5.6 Luna (Non-reasoning)OpenAIgpt-5-6-lunanon-reasoningrsc15.5$0.01064.5%7.2%1.0%$0.20$1.20–
Gemini 2.5 Flash Preview (Sep '25) (Reasoning)Googlegemini-2-5-flash-preview-09-2025reasoningrsc15.5–79.3%13.8%––––
Claude 4.5 Haiku (Non-reasoning)Anthropicclaude-4-5-haikunon-reasoningrsc15.4–64.6%4.2%–$1.00$5.0091.3
Kimi K2 0905Kimikimi-k2-0905non-reasoningrsc15.3–76.7%6.4%–$0.60$2.50–
Ling 3.0 TinyInclusionAIling-3-0-tinyrsc15.3–73.4%9.3%0.0%$0.0$0.030.7
Claude 3.7 Sonnet (Non-reasoning)Anthropicclaude-3-7-sonnetnon-reasoningrsc15.3–65.6%4.2%–$3.00$15.00–
Qwen3.6 35B A3B (Non-reasoning)Alibabaqwen3-6-35b-a3bnon-reasoningrsc15.2–81.7%13.9%–$0.38$2.25141.5
o1OpenAIo1rsc15.2–74.7%7.0%–$15.00$60.00–
Qwen3.5 35B A3B (Non-reasoning)Alibabaqwen3-5-35b-a3bnon-reasoningrsc15.1–81.9%13.4%–$0.25$2.00–
Gemini 2.5 Pro Preview (Mar' 25)Googlegemini-2-5-pro-03-25mar' 25rsc15.0–83.6%18.0%––––
GLM-4.6 (Non-reasoning)Z AIglm-4-6non-reasoningrsc14.9–63.2%5.5%–$0.57$2.20–
GLM-4.7-Flash (Reasoning)Z AIglm-4-7-flashrsc14.9–58.1%7.6%–$0.070$0.40–
Granite 4.2 30BIBMgranite-4-2-30brsc14.8–64.4%11.2%–$0.16$0.6578.2
DeepSeek V3.1 Terminus (Reasoning)DeepSeekdeepseek-v3-1-terminusreasoningrsc14.8–79.2%16.4%0.0%$1.64$2.75–
Grok 3 mini Reasoning (high)SpaceXAIgrok-3-mini-reasoninghighrsc14.6–79.1%11.0%–$0.30$0.50–
Grok 4.20 0309 (Non-reasoning)SpaceXAIgrok-4-20-0309non-reasoningrsc14.6–78.5%24.5%–$2.00$6.00–
Gemini 2.5 Pro Preview (May' 25)Googlegemini-2-5-pro-05-06may' 25rsc14.5–82.2%19.9%–$1.25$10.00–
DeepSeek V3.2 SpecialeDeepSeekdeepseek-v3-2-specialersc14.5–87.1%28.7%––––
K-EXAONE (Reasoning)LG AI Researchk-exaonersc14.4–78.3%13.9%––––
ERNIE 5.0 Thinking PreviewBaiduernie-5-0-thinking-previewrsc14.3–77.7%13.3%––––
Grok 4.20 0309 v2 (Non-reasoning)SpaceXAIgrok-4-20non-reasoningrsc14.2–77.6%27.9%–$1.25$2.50–
Mistral Medium 3.5Mistralmistral-medium-3-5highrsc14.2$0.5074.8%13.8%0.0%$1.50$7.50168.0
Gemma 4 12B (Reasoning)Googlegemma-4-12brsc14.2–75.3%15.7%–$0.10$0.30151.6
Nova 2.0 Pro Preview (medium)Amazonnova-2-0-pro-previewmediumrsc14.2–78.5%9.4%–$1.25$10.00124.5
Grok Code Fast 1SpaceXAIgrok-code-fast-1rsc14.1–72.7%8.0%––––
Grok 4.3 (Non-reasoning)SpaceXAIgrok-4-3non-reasoningrsc14.0$0.1765.8%6.8%0.0%$1.25$2.50–
DeepSeek V3.1 Terminus (Non-reasoning)DeepSeekdeepseek-v3-1-terminusnon-reasoningrsc13.9–75.1%8.7%–$0.27$1.00–
Gemma 4 31B (Non-reasoning)Googlegemma-4-31bnon-reasoningrsc13.9–76.3%11.8%–$0.14$0.4040.8
DeepSeek V3.2 Exp (Non-reasoning)DeepSeekdeepseek-v3-2-0925non-reasoningrsc13.9–73.8%9.0%–$0.28$0.42–
Apriel-v1.5-15B-ThinkerServiceNowapriel-v1-5-15b-thinkerrsc13.8–71.3%12.1%–$0.0$0.0–
Mercury 2Inceptionmercury-2highrsc13.8–77.0%17.1%0.0%$0.25$0.75–
DeepSeek V3.1 (Non-reasoning)DeepSeekdeepseek-v3-1non-reasoningrsc13.7–73.5%6.7%–$0.57$1.68–
Nova 2.0 Omni (medium)Amazonnova-2-0-omnimediumrsc13.6–76.0%7.0%–$0.30$2.50–
DeepSeek V3.1 (Reasoning)DeepSeekdeepseek-v3-1reasoningrsc13.5–77.9%14.3%–$0.59$1.69–
Qwen3 VL 235B A22B (Reasoning)Alibabaqwen3-vl-235b-a22breasoningrsc13.4–77.2%11.9%–$0.40$4.00–
Apriel-v1.6-15B-ThinkerServiceNowapriel-v1-6-15b-thinkerrsc13.4–73.3%10.8%–$0.0$0.0–
Nova 2.0 Lite (high)Amazonnova-2-0-litehighrsc13.4–81.1%11.6%–$0.30$2.50208.5
GPT-5.1 (Non-reasoning)OpenAIgpt-5-1non-reasoningrsc13.3–64.3%5.3%–$1.25$10.00–
Qwen3.5 9B (Non-reasoning)Alibabaqwen3-5-9bnon-reasoningrsc13.3–78.6%9.4%–$0.17$0.2576.7
EXAONE 4.5 33BLG AI Researchexaone-4-5-33brsc13.2–79.4%12.9%––––
Command A+Coherecommand-a-plusrsc13.1$0.076.1%12.0%0.5%$0.0$0.0191.0
Gemma 4 26B A4B (Non-reasoning)Googlegemma-4-26b-a4bnon-reasoningrsc13.1–71.4%11.5%–$0.13$0.4099.4
Qwen3.5 4B (Reasoning)Alibabaqwen3-5-4brsc13.1–77.1%9.9%–$0.030$0.1526.7
DeepSeek R1 0528 (May '25)DeepSeekdeepseek-r1may '25rsc13.1–81.3%15.8%–$1.35$3.00–
Gemini 2.5 Flash (Reasoning)Googlegemini-2-5-flashreasoningrsc13.1–79.0%12.1%–$0.30$2.50–
GPT-5 nano (high)OpenAIgpt-5-nanohighrsc13.0–67.6%9.5%–$0.050$0.40–
Nemotron 3.5 LightningNVIDIAnemotron-3-5-lightningrsc12.9$0.1074.3%10.6%0.5%$0.070$0.22263.1
Nemotron 3 Super 120B A12B (Reasoning)NVIDIAnvidia-nemotron-3-super-120b-a12brsc12.8$1.6480.0%20.8%0.0%$0.30$0.90165.3
Nova 2.0 Pro Preview (low)Amazonnova-2-0-pro-previewlowrsc12.8–75.1%5.2%–$1.25$10.00127.9
GLM-4.5 (Reasoning)Z AIglm-4-5rsc12.8–78.2%13.0%––––
Kimi K2Kimikimi-k2non-reasoningrsc12.7–76.6%7.4%–$0.57$2.30–
Qwen3 235B A22B 2507 (Reasoning)Alibabaqwen3-235b-a22b-instruct-2507-reasoningrsc12.7$0.08179.0%15.9%0.0%$0.23$2.30–
GPT-4.1OpenAIgpt-4-1non-reasoningrsc12.7–66.6%4.2%–$2.00$8.00–
Qwen3 Max (Preview)Alibabaqwen3-max-previewnon-reasoningrsc12.6–76.4%10.1%–$1.20$6.00–
Nova 2.0 Lite (medium)Amazonnova-2-0-litemediumrsc12.5–76.8%9.0%–$0.30$2.50212.5
GPT-5 nano (medium)OpenAIgpt-5-nanomediumrsc12.5–67.0%8.7%–$0.050$0.40–
Qwen3.5 Omni FlashAlibabaqwen3-5-omni-flashnon-reasoningrsc12.5–74.2%7.6%–$0.10$0.80226.5
o3-miniOpenAIo3-minirsc12.5–74.8%7.9%–$1.10$4.40–
MiniCPM5-2BOpenBMBminicpm5-2brsc12.5–70.2%8.9%0.0%–––
o1-proOpenAIo1-prorsc12.4––––$150$600–
Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning)Googlegemini-2-5-flash-preview-09-2025non-reasoningrsc12.4–76.6%8.7%––––
Mercury 2.5Inceptionmercury-2-5rsc12.3$0.12–11.8%0.0%$0.25$0.75746.4
JT-MINIChina Mobilejt-mininon-reasoningrsc12.2–67.6%6.4%––––
Grok 3SpaceXAIgrok-3non-reasoningrsc12.1–69.3%4.1%–$4.00$20.00–
Seed-OSS-36B-InstructByteDance Seedseed-oss-36b-instructrsc12.1–72.6%9.9%–$0.21$0.57–
Qwen3 235B A22B 2507 InstructAlibabaqwen3-235b-a22b-instruct-2507non-reasoningrsc12.0–75.3%11.1%–$0.23$0.92–
Qwen3 Coder 480B A35B InstructAlibabaqwen3-coder-480b-a35b-instructnon-reasoningrsc11.9–61.8%4.5%–$1.50$7.50–
Qwen3 VL 32B (Reasoning)Alibabaqwen3-vl-32breasoningrsc11.9–73.3%10.1%–$0.16$0.64–
Magistral Medium 1.2Mistralmagistral-medium-2509rsc11.8–73.9%10.3%––––
Sonar Reasoning ProPerplexitysonar-reasoning-prorsc11.8–––––––
Nova 2.0 Lite (low)Amazonnova-2-0-litelowrsc11.8–69.8%4.0%–$0.30$2.50213.0
HyperNova 60B 2605 (high, based on gpt-oss-120b)Multiverse Computinghypernova-60bhighrsc11.7–73.3%16.6%––––
MiniMax M1 80kMiniMaxminimax-m1-80krsc11.7–69.7%8.9%–$0.55$2.20–
GPT-5.4 nano (Non-Reasoning)OpenAIgpt-5-4-nanonon-reasoningrsc11.7–55.8%4.1%–$0.20$1.25–
Nemotron Cascade 2 30B A3BNVIDIAnemotron-cascade-2-30b-a3brsc11.7–75.8%12.0%––––
Gemini 2.5 Flash Preview (Reasoning)Googlegemini-2-5-flash-04-2025rsc11.7–69.8%12.1%––––
gpt-oss-120b (high)OpenAIgpt-oss-120bhighrsc11.6$0.1178.2%19.6%0.0%$0.15$0.59216.0
K2 Think V2Institute of Foundation Modelsk2-think-v2highrsc11.5–71.3%10.1%––––
LongCat Flash LiteLongCatlongcat-flash-litenon-reasoningrsc11.5–63.6%5.8%––––
GPT-5 (minimal)OpenAIgpt-5minimalrsc11.4–67.3%6.0%–$1.25$10.00–
DeepSeek R1 (Jan '25)DeepSeekdeepseek-r1-0120jan '25rsc11.4$0.2670.8%8.5%0.0%$2.00$4.00–
o1-previewOpenAIo1-previewrsc11.4–76.5%––$16.50$66.00–
HyperCLOVA X SEED Think (32B)Naverhyperclova-x-seed-think-32b32brsc11.4–61.5%5.5%––––
Grok 4.1 Fast (Non-reasoning)SpaceXAIgrok-4-1-fastnon-reasoningrsc11.3–63.7%5.1%––––
Mistral Small 4 (Reasoning)Mistralmistral-small-4rsc11.3$0.01576.9%9.9%0.0%$0.15$0.60172.2
GLM-4.6V (Reasoning)Z AIglm-4-6vreasoningrsc11.2–71.9%9.6%–$0.30$0.90–
K-EXAONE (Non-reasoning)LG AI Researchk-exaonenon-reasoningrsc11.2–69.5%5.7%––––
Qwen3 Next 80B A3B (Reasoning)Alibabaqwen3-next-80b-a3breasoningrsc11.2–75.9%12.6%–$0.15$1.20195.1
Qwen3.5 9B (Reasoning)Alibabaqwen3-5-9brsc11.2$0.2180.6%14.9%0.5%$0.14$0.2033.2
GPT-5.4 mini (Non-Reasoning)OpenAIgpt-5-4-mininon-reasoningrsc11.1–60.6%5.9%–$0.75$4.50–
Nova 2.0 Omni (low)Amazonnova-2-0-omnilowrsc11.1–69.9%––$0.30$2.50–
GLM-4.5-AirZ AIglm-4-5-airrsc11.1–73.3%7.0%–$0.17$0.98–
Granite 4.2 8BIBMgranite-4-2-8brsc11.1$0.02463.1%9.7%0.0%$0.060$0.2567.2
Grok 4 Fast (Non-reasoning)SpaceXAIgrok-4-fastnon-reasoningrsc11.1–60.6%4.5%–$0.20$0.50–
Mi:dm K 2.5 ProKorea Telecommi-dm-k-2-5-pro-dec28rsc11.0–70.1%8.1%––––
o3-mini (high)OpenAIo3-minihighrsc11.0–77.3%12.0%0.0%$1.10$4.40–
Ring-1TInclusionAIring-1trsc10.9–77.4%11.1%––––
G9v3-3BAI9Starsg9v3-3brsc10.8–43.8%4.5%–$0.0$0.0–
Trinity Large ThinkingArcee AItrinity-large-thinkingrsc10.8$0.1275.2%15.8%0.5%$0.25$0.80341.8
Qwen3.5 4B (Non-reasoning)Alibabaqwen3-5-4bnon-reasoningrsc10.8–71.2%8.0%–$0.030$0.1525.9
INTELLECT-3 (based on GLM-4.5-Air)Prime Intellectintellect-3based on glm-4.5-airrsc10.6–76.1%13.1%––––
GLM-4.7-Flash (Non-reasoning)Z AIglm-4-7-flashnon-reasoningrsc10.6–45.2%5.0%–$0.070$0.40–
GPT-5 (ChatGPT)OpenAIgpt-5-chatgptnon-reasoningrsc10.4–68.6%6.6%––––
Solar Open 100B (Reasoning)Upstagesolar-open-100bhighrsc10.4–65.7%10.4%––––
Grok 3 Reasoning BetaSpaceXAIgrok-3-reasoningrsc10.4–––––––
Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning)Googlegemini-2-5-flash-lite-preview-09-2025reasoningrsc10.4–70.9%7.0%–$0.10$0.40–
Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIAnemotron-3-nano-omni-30b-a3brsc10.3–46.9%4.8%–$0.20$1.09267.2
gpt-oss-120b (low)OpenAIgpt-oss-120blowrsc10.2–67.2%5.9%–$0.15$0.54217.5
GPT-4.1 miniOpenAIgpt-4-1-mininon-reasoningrsc10.2–66.4%5.0%–$0.40$1.60–
Llama 4 MaverickMetallama-4-mavericknon-reasoningrsc10.0–67.1%4.9%0.0%$0.26$0.91105.5
MiniMax M1 40kMiniMaxminimax-m1-40krsc10.0–68.2%7.8%––––
Nova 2.0 Pro Preview (Non-reasoning)Amazonnova-2-0-pro-previewnon-reasoningrsc10.0–63.6%3.9%–$1.25$10.00132.0
gpt-oss-20b (low)OpenAIgpt-oss-20blowrsc10.0–61.1%5.3%–$0.070$0.21258.7
Qwen3 VL 235B A22B InstructAlibabaqwen3-vl-235b-a22b-instructnon-reasoningrsc9.9–71.2%6.6%–$0.40$1.60–
North Mini CodeCoherenorth-mini-codersc9.9$0.075.7%11.1%0.5%$0.0$0.082.1
GPT-5 mini (minimal)OpenAIgpt-5-miniminimalrsc9.9–68.7%5.1%–$0.25$2.00–
K2-V2 (high)Institute of Foundation Modelsk2-v2highrsc9.9–68.1%10.5%––––
Gemini 2.5 Flash (Non-reasoning)Googlegemini-2-5-flashnon-reasoningrsc9.9–68.3%4.7%–$0.30$2.50–
Qwen3 30B A3B 2507 (Reasoning)Alibabaqwen3-30b-a3b-2507-reasoningrsc9.8$0.07770.7%10.3%0.0%$0.20$2.40–
o1-miniOpenAIo1-minirsc9.8–60.3%3.6%––––
DeepSeek V3 0324DeepSeekdeepseek-v3-0324non-reasoningrsc9.7$0.1165.5%4.7%0.0%$0.84$1.18–
Ling 2.6 FlashInclusionAIling-2-6-flashnon-reasoningrsc9.7–59.3%6.3%––––
Qwen3 Next 80B A3B InstructAlibabaqwen3-next-80b-a3b-instructnon-reasoningrsc9.6–73.8%7.6%–$0.15$1.20182.3
Tri-21B-think PreviewTrillion Labstri-21b-think-previewrsc9.6–53.8%5.8%––––
Qwen3 Coder 30B A3B InstructAlibabaqwen3-coder-30b-a3b-instructnon-reasoningrsc9.6–51.6%3.8%–$0.45$2.25–
GPT-4.5 (Preview)OpenAIgpt-4-5-previewnon-reasoningrsc9.6–––––––
DiffusionGemma 26B A4BGooglediffusiongemma-26b-a4brsc9.5–66.9%10.8%––––
Qwen3 235B A22B (Reasoning)Alibabaqwen3-235b-a22b-instructreasoningrsc9.5–70.0%11.0%–$0.70$8.40–
QwQ 32BAlibabaqwq-32brsc9.5–59.3%7.3%–$0.66$1.00–
Qwen3 VL 30B A3B (Reasoning)Alibabaqwen3-vl-30b-a3breasoningrsc9.5–72.0%8.9%–$0.20$2.40–
Gemini 2.0 Flash Thinking Experimental (Jan '25)Googlegemini-2-0-flash-thinking-exp-0121jan '25rsc9.4–70.1%6.3%––––
Gemma 4 12B (Non-reasoning)Googlegemma-4-12bnon-reasoningrsc9.4–66.1%6.3%–$0.10$0.30144.7
Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning)Googlegemini-2-5-flash-lite-preview-09-2025non-reasoningrsc9.3–65.1%5.1%–$0.10$0.40–
Mistral Large 3Mistralmistral-large-3non-reasoningrsc9.3$0.03168.0%4.2%0.0%$0.50$1.5076.9
Qwen3 Coder NextAlibabaqwen3-coder-nextnon-reasoningrsc9.2$0.5573.7%10.1%0.0%$0.35$1.20129.6
Motif-2-12.7B-ReasoningMotif Technologiesmotif-2-12-7b-reasoningrsc9.2–69.5%8.8%––––
Mistral Medium 3.1Mistralmistral-medium-3-1non-reasoningrsc9.2–58.8%4.7%0.0%–––
Ling-1TInclusionAIling-1tnon-reasoningrsc9.2–71.9%7.3%––––
Nova PremierAmazonnova-premiernon-reasoningrsc9.2–56.9%4.2%––––
Solar Pro 2 (Preview) (Reasoning)Upstagesolar-pro-2-previewhighrsc9.1–57.8%6.1%––––
Granite 4.2 3BIBMgranite-4-2-3brsc9.1$0.006055.9%6.6%0.0%$0.030$0.12231.9
Magistral Medium 1Mistralmagistral-mediumrsc9.1–67.9%9.8%––––
Mistral Medium 3Mistralmistral-medium-3non-reasoningrsc9.0–57.8%4.0%–$0.40$2.00–
K2-V2 (medium)Institute of Foundation Modelsk2-v2mediumrsc9.0–59.8%4.4%––––
Llama Nemotron Super 49B v1.5 (Reasoning)NVIDIAllama-nemotron-super-49b-v1-5reasoningrsc9.0–74.8%7.3%––––
Devstral MediumMistraldevstral-mediumnon-reasoningrsc9.0–49.2%3.8%––––
Mistral Small 4 (Non-reasoning)Mistralmistral-small-4non-reasoningrsc9.0–57.1%3.8%–$0.15$0.60154.5
Tri-21B-ThinkTrillion Labstri-21b-think-v0-5rsc9.0–60.1%5.9%––––
gpt-oss-20b (high)OpenAIgpt-oss-20bhighrsc9.0$0.01268.8%11.0%0.0%$0.070$0.18187.8
GPT-4o (March 2025, chatgpt-4o-latest)OpenAIgpt-4o-chatgpt-03-25non-reasoningrsc9.0–65.5%4.0%––––
Gemini 2.0 Flash (Feb '25)Googlegemini-2-0-flashnon-reasoningrsc8.9–62.3%4.3%––––
Claude 3.5 HaikuAnthropicclaude-3-5-haikunon-reasoningrsc8.9–40.8%3.6%––––
Llama 3.3 Nemotron Super 49B v1 (Reasoning)NVIDIAllama-3-3-nemotron-super-49breasoningrsc8.9–64.3%5.6%––––
Gemma 4 E4B (Reasoning)Googlegemma-4-e4brsc8.9–57.6%3.8%–$0.020$0.1072.8
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIAnvidia-nemotron-3-nano-30b-a3breasoningrsc8.9$0.01775.7%11.4%0.0%$0.050$0.20193.2
Qwen3 4B 2507 (Reasoning)Alibabaqwen3-4b-2507-instruct-reasoningrsc8.8–66.7%6.2%––––
MiniCPM5-1B (Reasoning)OpenBMBminicpm5-1brsc8.8–27.8%6.5%––––
Sarvam 105B (high)Sarvamsarvam-105bhighrsc8.8–73.8%11.0%–$0.042$0.17–
Gemini 2.0 Pro Experimental (Feb '25)Googlegemini-2-0-pro-experimental-02-05non-reasoningrsc8.7–62.2%6.2%––––
Nova 2.0 Lite (Non-reasoning)Amazonnova-2-0-litenon-reasoningrsc8.7–60.3%2.9%–$0.30$2.50225.1
Devstral Small (May '25)Mistraldevstral-small-2505non-reasoningrsc8.7–43.4%4.0%––––
Claude 3 OpusAnthropicclaude-3-opusnon-reasoningrsc8.7–48.9%2.8%–$15.00$75.00–
MiniCPM5-1B (Non-reasoning)OpenBMBminicpm5-1bnon-reasoningrsc8.7–26.9%4.5%––––
Sonar ReasoningPerplexitysonar-reasoningrsc8.7–62.3%–––––
Gemini 2.5 Flash Preview (Non-reasoning)Googlegemini-2-5-flash-04-2025non-reasoningrsc8.7–59.4%3.8%––––
Devstral 2Mistraldevstral-2non-reasoningrsc8.6–59.4%3.6%0.0%–––
Magistral Small 1.2Mistralmagistral-small-2509rsc8.6–66.3%6.4%–$0.50$1.50–
Qwen3 32B (Reasoning)Alibabaqwen3-32b-instructreasoningrsc8.6–66.8%7.4%0.0%$0.16$0.64–
Gemini 2.5 Flash-Lite (Reasoning)Googlegemini-2-5-flash-litereasoningrsc8.5–62.5%6.8%–$0.10$0.40–
DeepSeek V3 (Dec '24)DeepSeekdeepseek-v3non-reasoningrsc8.5$0.02055.7%2.9%0.0%$0.32$0.89–
GPT-4o (Nov '24)OpenAIgpt-4onon-reasoningrsc8.4–54.3%2.4%–$2.50$10.00–
Nanbeige4.1-3BNanbeigenanbeige4-1-3brsc8.4–84.9%10.9%––––
LFM2.5-2.6BLiquid AIlfm2-5-2-6brsc8.4–55.8%6.2%–$0.0$0.0–
Qwen3 VL 32B InstructAlibabaqwen3-vl-32b-instructnon-reasoningrsc8.4–67.1%6.8%–$0.16$0.64–
DeepSeek R1 Distill Qwen 32BDeepSeekdeepseek-r1-distill-qwen-32brsc8.4–61.5%4.6%––––
GLM-4.6V (Non-reasoning)Z AIglm-4-6vnon-reasoningrsc8.4–56.6%3.7%–$0.30$0.90–
Qwen3 235B A22B (Non-reasoning)Alibabaqwen3-235b-a22b-instructnon-reasoningrsc8.3–61.3%4.2%–$0.70$2.80–
Mistral Small 3.2Mistralmistral-small-3-2non-reasoningrsc8.2–50.5%4.3%0.0%$0.075$0.20–
Magistral Small 1Mistralmagistral-smallrsc8.2–64.1%7.6%––––
Gemini 2.0 Flash (experimental)Googlegemini-2-0-flash-experimentalnon-reasoningrsc8.2–63.6%4.1%–$0.0$0.0–
EXAONE 4.0 32B (Reasoning)LG AI Researchexaone-4-0-32breasoningrsc8.2–73.9%11.4%––––
Qwen3 VL 8B (Reasoning)Alibabaqwen3-vl-8breasoningrsc8.2–57.9%3.8%–$0.18$2.10–
Qwen3 14B (Reasoning)Alibabaqwen3-14b-instructreasoningrsc8.2–60.4%4.5%0.0%$0.35$4.20–
Nova 2.0 Omni (Non-reasoning)Amazonnova-2-0-omninon-reasoningrsc8.2–55.5%3.8%–$0.30$2.50–
DeepSeek R1 0528 Qwen3 8BDeepSeekdeepseek-r1-qwen3-8brsc8.1–61.2%5.9%––––
Llama 4 ScoutMetallama-4-scoutnon-reasoningrsc8.1–58.7%3.8%0.0%$0.19$0.68131.4
Qwen2.5 MaxAlibabaqwen-2-5-maxnon-reasoningrsc8.0–58.7%3.8%––––
Qwen3 VL 30B A3B InstructAlibabaqwen3-vl-30b-a3b-instructnon-reasoningrsc7.9–69.5%6.3%–$0.20$0.80–
Hermes 4 - Llama-3.1 70B (Reasoning)Nous Researchhermes-4-llama-3-1-70breasoningrsc7.9–69.9%8.8%––––
Gemini 1.5 Pro (Sep '24)Googlegemini-1-5-pronon-reasoningrsc7.9–58.9%4.6%––––
Solar Pro 2 (Preview) (Non-reasoning)Upstagesolar-pro-2-previewnon-reasoningrsc7.9–54.4%3.7%––––
DeepSeek R1 Distill Llama 70BDeepSeekdeepseek-r1-distill-llama-70brsc7.9–40.2%5.1%–$0.70$1.10–
Claude 3.5 Sonnet (Oct '24)Anthropicclaude-35-sonnetnon-reasoningrsc7.9–59.9%3.7%–$3.00$15.00–
DeepSeek R1 Distill Qwen 14BDeepSeekdeepseek-r1-distill-qwen-14brsc7.8–48.4%4.1%––––
Falcon-H1R-7BTII UAEfalcon-h1r-7brsc7.8–66.1%11.0%––––
GPT-4.1 nanoOpenAIgpt-4-1-nanonon-reasoningrsc7.8–51.2%3.8%–$0.10$0.40–
Solar Pro 3Upstagesolar-pro-3highrsc7.8$0.07972.4%10.3%0.0%$0.15$0.60–
Ling-flash-2.0InclusionAIling-flash-2-0non-reasoningrsc7.8–65.7%6.2%–$0.14$0.57–
Gemma 4 E2B (Reasoning)Googlegemma-4-e2brsc7.8–43.3%4.8%––––
Qwen3 Omni 30B A3B (Reasoning)Alibabaqwen3-omni-30b-a3breasoningrsc7.8–72.6%7.5%–$0.25$0.97111.0
GPT-4o (Aug '24)OpenAIgpt-4o-2024-08-06non-reasoningrsc7.7–52.1%2.3%–$2.50$10.00–
Qwen2.5 Instruct 72BAlibabaqwen2-5-72b-instructnon-reasoningrsc7.7–49.1%3.6%–$0.47$0.49–
SonarPerplexitysonarnon-reasoningrsc7.7–47.1%4.9%––––
Step3 VL 10BStepFunstep3-vl-10brsc7.7–69.0%10.8%––––
Llama 3.3 Instruct 70BMetallama-3-3-instruct-70bnon-reasoningrsc7.7–49.8%3.6%–$0.71$0.7294.8
Qwen3 30B A3B (Reasoning)Alibabaqwen3-30b-a3b-instructreasoningrsc7.6–61.6%6.2%–$0.20$2.40–
Sonar ProPerplexitysonar-pronon-reasoningrsc7.6–57.8%6.6%––––
Devstral Small (Jul '25)Mistraldevstral-smallnon-reasoningrsc7.6–41.4%3.8%––––
QwQ 32B-PreviewAlibabaQwQ-32B-Previewrsc7.6–55.7%3.9%––––
GLM-4.5V (Reasoning)Z AIglm-4-5vreasoningrsc7.6–68.4%6.3%–$0.60$1.80–
Mistral Large 2 (Nov '24)Mistralmistral-large-2non-reasoningrsc7.6–48.6%3.3%––––
Devstral Small 2Mistraldevstral-small-2non-reasoningrsc7.5–53.2%3.5%0.0%–––
Llama 3.1 Nemotron Ultra 253B v1 (Reasoning)NVIDIAllama-3-1-nemotron-ultra-253b-v1reasoningrsc7.5–72.8%7.4%––––
Qwen3 30B A3B 2507 InstructAlibabaqwen3-30b-a3b-2507non-reasoningrsc7.5–65.9%6.9%–$0.20$0.80–
ERNIE 4.5 300B A47BBaiduernie-4-5-300b-a47bnon-reasoningrsc7.5–81.1%3.3%–$0.28$1.10–
Hermes 4 - Llama-3.1 405B (Reasoning)Nous Researchhermes-4-llama-3-1-405breasoningrsc7.5–72.7%10.9%–$1.00$3.0044.1
Solar Pro 2 (Reasoning)Upstagesolar-pro-2highrsc7.5–68.7%7.4%––––
NVIDIA Nemotron Nano 12B v2 VL (Reasoning)NVIDIAnvidia-nemotron-nano-12b-v2-vlreasoningrsc7.5–57.2%5.5%––––
Gemma 4 E4B (Non-reasoning)Googlegemma-4-e4bnon-reasoningrsc7.5–54.9%4.8%–$0.020$0.1073.5
Granite 4.1 30BIBMgranite-4-1-30bnon-reasoningrsc7.4–48.1%4.1%––––
NVIDIA Nemotron Nano 9B V2 (Reasoning)NVIDIAnvidia-nemotron-nano-9b-v2reasoningrsc7.4–57.0%4.9%–$0.040$0.1690.8
Hermes 4 - Llama-3.1 405B (Non-reasoning)Nous Researchhermes-4-llama-3-1-405bnon-reasoningrsc7.4–53.6%4.2%–$1.00$3.0043.5
Gemini 2.0 Flash-Lite (Feb '25)Googlegemini-2-0-flash-lite-001non-reasoningrsc7.4–53.5%3.4%––––
NVIDIA Nemotron 3 Nano 4BNVIDIAnvidia-nemotron-3-nano-4brsc7.4–51.3%4.9%––––
Llama Nemotron Super 49B v1.5 (Non-reasoning)NVIDIAllama-nemotron-super-49b-v1-5non-reasoningrsc7.4–48.1%4.3%––––
Qwen3 32B (Non-reasoning)Alibabaqwen3-32b-instructnon-reasoningrsc7.3–53.5%4.1%–$0.16$0.64–
GPT-4o (May '24)OpenAIgpt-4o-2024-05-13non-reasoningrsc7.3–52.6%1.8%–$5.00$15.00–
Gemini 2.0 Flash-Lite (Preview)Googlegemini-2-0-flash-lite-previewnon-reasoningrsc7.3–54.2%4.1%––––
K2-V2 (low)Institute of Foundation Modelsk2-v2lowrsc7.3–54.1%3.6%––––
Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning)NVIDIAllama-3-1-nemotron-nano-4breasoningrsc7.3–40.8%5.2%––––
Kimi Linear 48B A3B InstructKimikimi-linear-48b-a3b-instructnon-reasoningrsc7.3–41.2%2.5%––––
Llama 3.1 Instruct 405BMetallama-3-1-instruct-405bnon-reasoningrsc7.3–51.5%4.0%––––
Qwen3 8B (Reasoning)Alibabaqwen3-8b-instructreasoningrsc7.3–58.9%3.9%0.0%$0.18$2.10–
Llama 3.3 Nemotron Super 49B v1 (Non-reasoning)NVIDIAllama-3-3-nemotron-super-49bnon-reasoningrsc7.3–51.7%3.8%––––
Qwen3 VL 8B InstructAlibabaqwen3-vl-8b-instructnon-reasoningrsc7.3–42.7%2.7%–$0.18$0.70–
Qwen3 4B (Reasoning)Alibabaqwen3-4b-instructreasoningrsc7.2–52.2%4.4%––––
LFM2.5-8B-A1BLiquid AIlfm2-5-8b-a1brsc7.2–51.3%6.9%––––
Claude 3.5 Sonnet (June '24)Anthropicclaude-35-sonnet-june-24non-reasoningrsc7.2–56.0%3.2%–$3.00$15.00–
Llama 3.1 Tulu3 405BAllen Institute for AItulu3-405bnon-reasoningrsc7.2–51.6%3.3%––––
GPT-4o (ChatGPT)OpenAIgpt-4o-chatgptnon-reasoningrsc7.2–51.1%2.7%––––
Ring-flash-2.0InclusionAIring-flash-2-0rsc7.2–72.5%9.6%–$0.14$0.57–
Pixtral LargeMistralpixtral-large-2411non-reasoningrsc7.1–50.5%2.8%––––
Olmo 3.1 32B ThinkAllen Institute for AIolmo-3-1-32b-thinkrsc7.1–59.1%6.3%–$0.0$0.0–
Mistral Small 3.1Mistralmistral-small-3-1non-reasoningrsc7.1$0.03545.4%4.3%0.0%$0.11$0.17–
Grok 2 (Dec '24)SpaceXAIgrok-2-1212non-reasoningrsc7.1–51.0%3.1%––––
GPT-5 nano (minimal)OpenAIgpt-5-nanominimalrsc7.1–42.8%4.0%–$0.050$0.40–
Gemini 1.5 Flash (Sep '24)Googlegemini-1-5-flash-sep-24non-reasoningrsc7.1–46.3%3.2%––––
Qwen3 VL 4B (Reasoning)Alibabaqwen3-vl-4breasoningrsc7.0–49.4%4.6%––––
GPT-4 TurboOpenAIgpt-4-turbonon-reasoningrsc7.0––3.1%–$10.00$30.00–
Solar Pro 2 (Non-reasoning)Upstagesolar-pro-2non-reasoningrsc7.0–56.1%3.7%––––
Nova ProAmazonnova-pronon-reasoningrsc7.0–49.9%3.2%–$0.80$3.20–
Command ACoherecommand-anon-reasoningrsc7.0–52.7%4.0%–$2.50$10.0059.9
Qwen3.5 2B (Reasoning)Alibabaqwen3-5-2brsc6.9–45.6%2.6%––––
Llama 3.1 Nemotron Instruct 70BNVIDIAllama-3-1-nemotron-instruct-70bnon-reasoningrsc6.9–46.5%4.2%––––
Llama 3.1 Instruct 8BMetallama-3-1-instruct-8bnon-reasoningrsc6.9–25.9%5.3%–$0.020$0.050–
Grok BetaSpaceXAIgrok-betanon-reasoningrsc6.9–47.1%4.5%––––
Qwen2.5 Instruct 32BAlibabaqwen2.5-32b-instructnon-reasoningrsc6.9–46.6%4.0%––––
NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)NVIDIAnvidia-nemotron-3-nano-30b-a3bnon-reasoningrsc6.8–39.9%4.6%–$0.050$0.20233.7
NVIDIA Nemotron Nano 9B V2 (Non-reasoning)NVIDIAnvidia-nemotron-nano-9b-v2non-reasoningrsc6.8–55.7%4.6%–$0.050$0.20159.7
Mistral Large 2 (Jul '24)Mistralmistral-large-2407non-reasoningrsc6.8–47.2%2.9%–$2.00$6.00–
Qwen3 4B 2507 InstructAlibabaqwen3-4b-2507-instructnon-reasoningrsc6.7–51.7%4.5%––––
Qwen2.5 Coder Instruct 32BAlibabaqwen2-5-coder-32b-instructnon-reasoningrsc6.7–41.7%3.5%––––
Qwen3 14B (Non-reasoning)Alibabaqwen3-14b-instructnon-reasoningrsc6.7–47.0%4.1%–$0.35$1.40–
GPT-4OpenAIgpt-4non-reasoningrsc6.7–34.9%––$30.00$60.00–
GLM-4.5V (Non-reasoning)Z AIglm-4-5vnon-reasoningrsc6.7–57.3%3.5%–$0.60$1.80–
Mistral Small 3Mistralmistral-small-3non-reasoningrsc6.7–46.2%3.8%–$0.050$0.080–
Gemini 2.5 Flash-Lite (Non-reasoning)Googlegemini-2-5-flash-litenon-reasoningrsc6.7–47.4%3.7%–$0.10$0.40–
Nova LiteAmazonnova-litenon-reasoningrsc6.7–43.3%4.3%–$0.060$0.24–
GPT-4o miniOpenAIgpt-4o-mininon-reasoningrsc6.7–42.6%4.2%–$0.15$0.60–
Hermes 4 - Llama-3.1 70B (Non-reasoning)Nous Researchhermes-4-llama-3-1-70bnon-reasoningrsc6.7–49.1%3.6%––––
Qwen3 30B A3B (Non-reasoning)Alibabaqwen3-30b-a3b-instructnon-reasoningrsc6.6–51.5%4.6%–$0.20$0.80–
DeepSeek-V2.5 (Dec '24)DeepSeekdeepseek-v2-5non-reasoningrsc6.6–42.3%–––––
Qwen3 4B (Non-reasoning)Alibabaqwen3-4b-instructnon-reasoningrsc6.6–39.8%3.3%––––
Llama 3.1 Instruct 70BMetallama-3-1-instruct-70bnon-reasoningrsc6.6–40.9%4.5%–$0.56$0.56–
Granite 4.1 8BIBMgranite-4-1-8bnon-reasoningrsc6.6–43.3%3.8%––––
Sarvam 30B (high)Sarvamsarvam-30bhighrsc6.6–63.3%7.5%–$0.026$0.11–
Gemini 2.0 Flash Thinking Experimental (Dec '24)Googlegemini-2-0-flash-thinking-exp-1219dec '24rsc6.6–––––––
DeepSeek-V2.5DeepSeekdeepseek-v2-5-sep-2024non-reasoningrsc6.6–––––––
Olmo 3.1 32B InstructAllen Institute for AIolmo-3-1-32b-instructnon-reasoningrsc6.5–53.9%5.0%––––
Mistral SabaMistralmistral-sabanon-reasoningrsc6.5–42.4%4.3%––––
DeepSeek R1 Distill Llama 8BDeepSeekdeepseek-r1-distill-llama-8brsc6.5–30.2%–––––
Gemma 4 E2B (Non-reasoning)Googlegemma-4-e2bnon-reasoningrsc6.5–40.5%4.7%––––
Olmo 3 32B ThinkAllen Institute for AIolmo-3-32b-thinkrsc6.5–61.0%6.4%––––
Gemini 1.5 Pro (May '24)Googlegemini-1-5-pro-may-24non-reasoningrsc6.4–37.1%3.5%––––
R1 1776Perplexityr1-1776rsc6.4–––––––
Qwen2.5 TurboAlibabaqwen-turbonon-reasoningrsc6.4–41.0%4.1%–$0.050$0.20–
Reka Flash (Sep '24)Reka AIreka-flashnon-reasoningrsc6.4––––$0.20$0.80–
Llama 3.2 Instruct 90B (Vision)Metallama-3-2-instruct-90b-visionnon-reasoningrsc6.4–43.2%4.5%––––
Solar MiniUpstagesolar-mininon-reasoningrsc6.4––––$0.15$0.15–
Celeris-1Celerisceleris-1non-reasoningrsc6.3$0.05063.1%6.8%0.0%$0.20$0.702186.1
Grok-1SpaceXAIgrok-1non-reasoningrsc6.3–––––––
Qwen2 Instruct 72BAlibabaqwen2-72b-instructnon-reasoningrsc6.3–37.1%3.7%––––
Phi-4 Mini InstructMicrosoftphi-4-mininon-reasoningrsc6.3–33.1%4.5%–$0.0$0.047.6
EXAONE 4.0 32B (Non-reasoning)LG AI Researchexaone-4-0-32bnon-reasoningrsc6.3–62.8%5.0%––––
Qwen3.5 2B (Non-reasoning)Alibabaqwen3-5-2bnon-reasoningrsc6.2–43.8%5.0%––––
Gemini 1.5 Flash-8BGooglegemini-1-5-flash-8bnon-reasoningrsc6.2–35.9%4.7%––––
Qwen3.5 0.8B (Reasoning)Alibabaqwen3-5-0-8brsc6.1–11.1%1.1%––––
DeepHermes 3 - Mistral 24B Preview (Non-reasoning)Nous Researchdeephermes-3-mistral-24b-previewnon-reasoningrsc6.1–38.2%3.8%––––
Jamba 1.7 LargeAI21 Labsjamba-1-7-largenon-reasoningrsc6.1–39.0%3.7%––––
Granite 4.0 H SmallIBMgranite-4-0-h-smallnon-reasoningrsc6.0–41.6%3.8%–$0.060$0.25–
Ministral 3 14BMistralministral-3-14bnon-reasoningrsc6.0$0.01957.2%4.6%0.0%$0.20$0.2091.3
Jamba 1.5 LargeAI21 Labsjamba-1-5-largenon-reasoningrsc6.0–42.7%4.1%–$2.00$8.00–
Qwen3 Omni 30B A3B InstructAlibabaqwen3-omni-30b-a3b-instructnon-reasoningrsc6.0–62.0%4.6%–$0.25$0.97109.8
Hermes 3 - Llama-3.1 70BNous Researchhermes-3-llama-3-1-70bnon-reasoningrsc6.0–40.1%4.0%–$0.70$0.70–
Qwen3 8B (Non-reasoning)Alibabaqwen3-8b-instructnon-reasoningrsc6.0–45.2%1.9%–$0.18$0.70–
DeepSeek-Coder-V2DeepSeekdeepseek-coder-v2non-reasoningrsc6.0–––––––
OLMo 2 32BAllen Institute for AIolmo-2-32bnon-reasoningrsc6.0–32.8%3.6%––––
Jamba 1.6 LargeAI21 Labsjamba-1-6-largenon-reasoningrsc6.0–38.7%3.6%––––
LFM2 24B A2BLiquid AIlfm2-24b-a2bnon-reasoningrsc5.9–47.4%4.2%––––
Gemini 1.5 Flash (May '24)Googlegemini-1-5-flash-may-24non-reasoningrsc5.9–32.4%4.4%––––
Phi-4Microsoftphi-4non-reasoningrsc5.9–57.5%3.8%–$0.13$0.5044.1
Claude 3 SonnetAnthropicclaude-3-sonnetnon-reasoningrsc5.9–40.0%3.6%––––
Nova MicroAmazonnova-micronon-reasoningrsc5.9–35.8%4.6%–$0.035$0.14260.3
Granite 4.1 3BIBMgranite-4-1-3bnon-reasoningrsc5.9–31.4%3.4%––––
Mistral Small (Sep '24)Mistralmistral-smallnon-reasoningrsc5.8–38.1%4.3%––––
Gemini 1.0 UltraGooglegemini-1-0-ultranon-reasoningrsc5.8–––––––
Phi-3 Mini Instruct 3.8BMicrosoftphi-3-mininon-reasoningrsc5.8–31.9%5.0%––––
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)NVIDIAnvidia-nemotron-nano-12b-v2-vlnon-reasoningrsc5.8–43.9%4.3%–$0.20$0.60207.2
Gemma 3n E4B Instruct Preview (May '25)Googlegemma-3n-e4b-preview-0520non-reasoningrsc5.8–27.8%4.8%––––
Phi-4 Multimodal InstructMicrosoftphi-4-multimodalnon-reasoningrsc5.8–31.5%5.0%–$0.0$0.017.2
Qwen2.5 Coder Instruct 7BAlibabaqwen2-5-coder-7b-instructnon-reasoningrsc5.8–33.9%4.9%––––
Mistral Large (Feb '24)Mistralmistral-largenon-reasoningrsc5.8–35.1%3.5%–$4.00$12.00–
Mixtral 8x22B InstructMistralmistral-8x22b-instructnon-reasoningrsc5.7–33.2%4.0%––––
Llama 2 Chat 7BMetallama-2-chat-7bnon-reasoningrsc5.7–22.7%5.3%–$0.050$0.25–
Llama 3.2 Instruct 3BMetallama-3-2-instruct-3bnon-reasoningrsc5.7–25.5%5.3%––––
MiniCPM-V 4.6 1.3BOpenBMBminicpm-v-4-6-1-3bnon-reasoningrsc5.7–30.5%5.1%––––
Jamba Reasoning 3BAI21 Labsjamba-reasoning-3brsc5.7–33.3%3.8%––––
Qwen3 VL 4B InstructAlibabaqwen3-vl-4b-instructnon-reasoningrsc5.7–37.1%3.6%––––
Qwen1.5 Chat 110BAlibabaqwen1.5-110b-chatnon-reasoningrsc5.7–28.9%–––––
Reka Flash 3Reka AIreka-flash-3rsc5.6–52.9%4.4%–$0.20$0.8095.9
Olmo 3 7B ThinkAllen Institute for AIolmo-3-7b-thinkrsc5.6–51.6%6.0%––––
Claude 2.1Anthropicclaude-21non-reasoningrsc5.6–31.9%3.9%––––
Claude 3 HaikuAnthropicclaude-3-haikunon-reasoningrsc5.6–37.4%4.1%–$0.25$1.25–
OLMo 2 7BAllen Institute for AIolmo-2-7bnon-reasoningrsc5.6–28.8%5.4%––––
Molmo 7B-DAllen Institute for AImolmo-7b-dnon-reasoningrsc5.6–24.0%5.1%––––
Ling-mini-2.0InclusionAIling-mini-2-0non-reasoningrsc5.5–56.2%5.1%––––
DeepSeek R1 Distill Qwen 1.5BDeepSeekdeepseek-r1-distill-qwen-1-5brsc5.5–9.8%3.1%––––
Claude 2.0Anthropicclaude-2non-reasoningrsc5.5–34.4%–––––
DeepSeek-V2-ChatDeepSeekdeepseek-v2non-reasoningrsc5.5–––––––
Mistral Small (Feb '24)Mistralmistral-small-2402non-reasoningrsc5.5–30.2%4.1%––––
Mistral MediumMistralmistral-mediumnon-reasoningrsc5.5–34.9%3.5%––––
GPT-3.5 TurboOpenAIgpt-3-5-turbonon-reasoningrsc5.5–29.7%––$0.50$1.50–
Ministral 3 8BMistralministral-3-8bnon-reasoningrsc5.5$0.01147.1%4.3%0.0%$0.15$0.15104.6
Llama 3 Instruct 70BMetallama-3-instruct-70bnon-reasoningrsc5.5–37.9%4.5%–$0.65$2.75–
Qwen Chat 72BAlibabaqwen-chat-72bnon-reasoningrsc5.4–––––––
Arctic InstructSnowflakearctic-instructnon-reasoningrsc5.4–––––––
LFM 40BLiquid AIlfm-40bnon-reasoningrsc5.4–32.7%4.9%––––
Llama 3.2 Instruct 11B (Vision)Metallama-3-2-instruct-11b-visionnon-reasoningrsc5.4–22.1%5.5%–$0.34$0.3414.1
Qwen3.5 0.8B (Non-reasoning)Alibabaqwen3-5-0-8bnon-reasoningrsc5.4–23.6%5.1%––––
PALM-2Googlepalm-2non-reasoningrsc5.4–––––––
Gemini 1.0 ProGooglegemini-1-0-pronon-reasoningrsc5.3–27.7%4.2%––––
DeepSeek Coder V2 Lite InstructDeepSeekdeepseek-coder-v2-litenon-reasoningrsc5.3–31.9%5.4%––––
Sarvam M (Reasoning, based on Mistral Small 3.1)Sarvamsarvam-mhighrsc5.3–41.6%3.1%–$0.0$0.0–
DeepSeek LLM 67B Chat (V1)DeepSeekdeepseek-llm-67b-chatnon-reasoningrsc5.3–––––––
Llama 2 Chat 70BMetallama-2-chat-70bnon-reasoningrsc5.3–32.7%5.2%––––
Llama 2 Chat 13BMetallama-2-chat-13bnon-reasoningrsc5.3–32.1%4.8%––––
Command-R+ (Apr '24)Coherecommand-r-plus-04-2024non-reasoningrsc5.3–32.3%4.6%––––
OpenChat 3.5 (1210)OpenChatopenchat-35non-reasoningrsc5.3–23.0%4.8%––––
DBRX InstructDatabricksdbrxnon-reasoningrsc5.3–33.1%2.9%––––
Exaone 4.0 1.2B (Reasoning)LG AI Researchexaone-4-0-1-2breasoningrsc5.3–51.5%6.0%––––
Olmo 3 7B InstructAllen Institute for AIolmo-3-7b-instructnon-reasoningrsc5.2–40.0%5.8%–$0.10$0.20–
Exaone 4.0 1.2B (Non-reasoning)LG AI Researchexaone-4-0-1-2bnon-reasoningrsc5.2–42.4%5.7%––––
LFM2.5-1.2B-ThinkingLiquid AIlfm2-5-1-2b-thinkingrsc5.2–33.9%6.2%––––
Jamba 1.7 MiniAI21 Labsjamba-1-7-mininon-reasoningrsc5.2–32.2%4.4%––––
LFM2 2.6BLiquid AIlfm2-2-6bnon-reasoningrsc5.2–30.6%5.5%––––
LFM2.5-1.2B-InstructLiquid AIlfm2-5-1-2b-instructnon-reasoningrsc5.2–32.6%6.7%––––
Jamba 1.5 MiniAI21 Labsjamba-1-5-mininon-reasoningrsc5.2–30.2%5.1%–$0.20$0.40–
Granite 4.0 H 1BIBMgranite-4-0-h-nano-1bnon-reasoningrsc5.2–26.3%5.0%––––
Qwen3 1.7B (Reasoning)Alibabaqwen3-1.7b-instructreasoningrsc5.2–35.6%4.6%––––
Jamba 1.6 MiniAI21 Labsjamba-1-6-mininon-reasoningrsc5.2–30.0%4.3%––––
Mixtral 8x7B InstructMistralmixtral-8x7b-instructnon-reasoningrsc5.1–29.2%4.7%–$0.45$0.70–
Gemma 3 270MGooglegemma-3-270mnon-reasoningrsc5.1–22.4%3.6%––––
Apertus 70B InstructSwiss AI Initiativeapertus-70b-instructnon-reasoningrsc5.1–27.2%5.5%–$0.82$2.92–
Granite 4.0 MicroIBMgranite-4-0-micronon-reasoningrsc5.1–33.6%5.0%––––
DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning)Nous Researchdeephermes-3-llama-3-1-8b-previewnon-reasoningrsc5.1–27.0%4.3%––––
Qwen Chat 14BAlibabaqwen-chat-14bnon-reasoningrsc5.0–––––––
Claude InstantAnthropicclaude-instantnon-reasoningrsc5.0–33.0%3.5%––––
Command-R (Mar '24)Coherecommand-r-03-2024non-reasoningrsc5.0–28.4%4.8%––––
Llama 65BMetallama-65bnon-reasoningrsc5.0–––––––
Mistral 7B InstructMistralmistral-7b-instructnon-reasoningrsc5.0–17.7%4.5%–$0.15$0.20–
Granite 4.0 1BIBMgranite-4-0-nano-1bnon-reasoningrsc5.0–28.1%4.8%––––
Molmo2-8BAllen Institute for AImolmo2-8bnon-reasoningrsc5.0–42.5%4.3%––––
LFM2 8B A1BLiquid AIlfm2-8b-a1bnon-reasoningrsc4.9–34.4%4.9%––––
Granite 3.3 8B (Non-reasoning)IBMgranite-3-3-8b-instructnon-reasoningrsc4.9–33.8%4.2%–$0.030$0.25–
Qwen3 1.7B (Non-reasoning)Alibabaqwen3-1.7b-instructnon-reasoningrsc4.9–28.3%5.3%––––
Gemma 3 27B InstructGooglegemma-3-27b-instructnon-reasoningrsc4.9$0.042.8%4.4%0.0%$0.0$0.0–
Ministral 3 3BMistralministral-3-3bnon-reasoningrsc4.8$0.007835.8%5.4%0.0%$0.10$0.10238.9
Qwen3 0.6B (Non-reasoning)Alibabaqwen3-0.6b-instructnon-reasoningrsc4.8–23.1%4.9%––––
Qwen3 0.6B (Reasoning)Alibabaqwen3-0.6b-instructreasoningrsc4.8–23.9%5.6%––––
Tiny Aya GlobalCoheretiny-aya-globalnon-reasoningrsc4.8–30.5%5.2%–$0.0$0.0131.5
Gemma 3 1B InstructGooglegemma-3-1b-instructnon-reasoningrsc4.8–23.7%5.3%–$0.0$0.0–
Gemma 3 4B InstructGooglegemma-3-4b-instructnon-reasoningrsc4.8–29.1%5.3%–$0.0$0.0–
Gemma 3n E2B InstructGooglegemma-3n-e2b-instructnon-reasoningrsc4.8–22.9%4.2%–$0.0$0.0–
Gemma 3n E4B InstructGooglegemma-3n-e4b-instructnon-reasoningrsc4.8–29.6%4.5%––––
Granite 4.0 350MIBMgranite-4-0-350mnon-reasoningrsc4.8–26.1%5.5%––––
Granite 4.0 H 350MIBMgranite-4-0-h-350mnon-reasoningrsc4.8–25.7%6.4%––––
LFM2 1.2BLiquid AIlfm2-1-2bnon-reasoningrsc4.8–22.8%5.6%––––
LFM2.5-VL-1.6BLiquid AIlfm2-5-vl-1-6bnon-reasoningrsc4.8–28.9%5.1%––––
Llama 3 Instruct 8BMetallama-3-instruct-8bnon-reasoningrsc4.8–29.6%5.1%–$0.045$0.14–
Llama 3.2 Instruct 1BMetallama-3-2-instruct-1bnon-reasoningrsc4.8–19.6%5.5%––––
Apertus 8B InstructSwiss AI Initiativeapertus-8b-instructnon-reasoningrsc4.8–25.6%5.0%–$0.10$0.20–
Gemma 3 12B InstructGooglegemma-3-12b-instructnon-reasoningrsc3.8$0.034.9%4.2%0.0%$0.0$0.0–
K2 Horizon 0.9BInstitute of Foundation Modelsk2-horizon-0-9brsc3.0–29.3%5.4%0.0%–––
Cogito v2.1 (Reasoning)Deep Cogitocogito-v2-1reasoningrsc––76.8%12.0%–$1.25$1.25–
Gemini 3 Deep ThinkGooglegemini-3-deep-thinkrsc––––––––
Mi:dm K 2.5 Pro PreviewKorea Telecommidm-250-pro-rsnsftrsc––72.2%9.1%––––
EXAONE 4.5 33B (Non-reasoning)LG AI Researchexaone-4-5-33bnon-reasoningrsc––––––––
GPT-3.5 Turbo (0613)OpenAIgpt-3-5-turbo-0613non-reasoningrsc––––––––
GPT-4o Realtime (Dec '24)OpenAIgpt-4o-realtime-dec-24non-reasoningrsc––––––––
GPT-4o mini Realtime (Dec '24)OpenAIgpt-4o-mini-realtime-dec-24non-reasoningrsc––––––––
GPT-5.4 Pro (xhigh)OpenAIgpt-5-4-proxhighrsc–––––$30.00$180–
GPT-5.5 Pro (xhigh)OpenAIgpt-5-5-proxhighrsc––––––––