Benchmarks
Artificial Analysis model intelligence leaderboard — collected daily. Click a column to sort.
| Model | Provider | Intelligence | Coding | Math | GPQA | Price (blended, $/1M) | Output speed |
|---|---|---|---|---|---|---|---|
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 59.9 | 76.5 | 0.926 | $20 | 70.428 tok/s | |
| GPT-5.6 Sol (max) | OpenAI | 58.9 | 77.4 | 0.941 | $11.25 | 70.347 tok/s | |
| GPT-5.6 Sol (xhigh) | OpenAI | 57.7 | 78.3 | 0.931 | $11.25 | 64.924 tok/s | |
| Kimi K3 | Kimi | 57.1 | 76.2 | 0.935 | $6 | 37.633 tok/s | |
| GPT-5.6 Sol (high) | OpenAI | 55.9 | 77.2 | 0.928 | $11.25 | 61.254 tok/s | |
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 55.7 | 74.3 | 0.92 | $10 | 64.021 tok/s | |
| GPT-5.6 Terra (max) | OpenAI | 55 | 76.7 | 0.925 | $5.625 | 156.719 tok/s | |
| GPT-5.5 (xhigh) | OpenAI | 54.8 | 74.9 | 0.935 | $11.25 | 92.434 tok/s | |
| Grok 4.5 (high) | SpaceXAI | 53.8 | 72.4 | 0.931 | $3 | 74.156 tok/s | |
| GPT-5.6 Sol (medium) | OpenAI | 53.6 | 76.3 | 0.926 | $11.25 | 61.967 tok/s | |
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 53.5 | 73.6 | 0.914 | $10 | 61.32 tok/s | |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 53.4 | 71.5 | 0.911 | $4 | 87.842 tok/s | |
| GPT-5.5 (high) | OpenAI | 53.1 | 71.6 | 0.932 | $11.25 | 84.06 tok/s | |
| GPT-5.6 Terra (xhigh) | OpenAI | 51.6 | 70.6 | 0.908 | $5.625 | 131.333 tok/s | |
| GPT-5.4 (xhigh) | OpenAI | 51.4 | 71.1 | 0.92 | $5.625 | 152.148 tok/s | |
| GPT-5.6 Luna (max) | OpenAI | 51.2 | 71.4 | 0.911 | $2.25 | 202.618 tok/s | |
| GLM-5.2 (max) | Z AI | 51.1 | 68.8 | 0.895 | $2.15 | 197.162 tok/s | |
| Muse Spark 1.1 (xhigh) | Meta | 50.6 | 71.3 | 0.898 | $2 | 124.217 tok/s | |
| GPT-5.5 (medium) | OpenAI | 50.4 | 71.5 | 0.926 | $11.25 | 76.044 tok/s | |
| Gemini 3.5 Flash (high) | 50.2 | 70.1 | 0.922 | $3.375 | 283.064 tok/s | ||
| Gemini 3.6 Flash (high) | 50.1 | 69.2 | 0.928 | $3 | 301.269 tok/s | ||
| GPT-5.6 Sol (low) | OpenAI | 49.4 | 69.7 | 0.898 | $11.25 | 58.072 tok/s | |
| GPT-5.6 Luna (xhigh) | OpenAI | 49.1 | 68.6 | 0.895 | $2.25 | 190.697 tok/s | |
| GPT-5.6 Terra (high) | OpenAI | 49 | 67.1 | 0.896 | $5.625 | 128.993 tok/s | |
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 47.2 | 63 | 0.875 | $6 | 71.703 tok/s | |
| Gemini 3.1 Pro Preview | 46.5 | 68.8 | 0.941 | $4.5 | 134.865 tok/s | ||
| GPT-5.6 Luna (high) | OpenAI | 46.1 | 63.3 | 0.892 | $2.25 | 198.668 tok/s | |
| Qwen3.7 Max | Alibaba | 46 | 66 | 0.923 | $3.75 | 207.465 tok/s | |
| GPT-5.6 Terra (medium) | OpenAI | 45.6 | 64.7 | 0.872 | $5.625 | 109.715 tok/s | |
| Gemini 3.5 Flash (medium) | 45.4 | 0.921 | $3.375 | 292.831 tok/s | |||
| MiniMax-M3 | MiniMax | 44.4 | 58.6 | 0.929 | $0.525 | 97.049 tok/s | |
| GPT-5.3 Codex (xhigh) | OpenAI | 44.3 | 0.915 | $4.813 | 126.476 tok/s | ||
| DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 44.3 | 59.4 | 0.888 | $0.544 | 73.627 tok/s | |
| Kimi K2.6 | Kimi | 44.2 | 61.8 | 0.911 | $1.712 | 56.002 tok/s | |
| Motif 3 (Beta) | Motif Technologies | 44.1 | 62 | 0.869 | $0 | 0 tok/s | |
| Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 43.7 | 0.896 | $10 | 64.369 tok/s | ||
| GPT-5.5 (low) | OpenAI | 43.5 | 60.9 | 0.91 | $11.25 | 80.902 tok/s | |
| Muse Spark | Meta | 43.1 | 58.6 | 0.884 | $0 | 0 tok/s | |
| DeepSeek V4 Pro (Reasoning, High Effort) | DeepSeek | 43.1 | 58.7 | 0.905 | $0.544 | 67.652 tok/s | |
| Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 42.7 | 0.885 | $10 | 50.252 tok/s | ||
| MiMo-V2.5-Pro | Xiaomi | 42.2 | 60.2 | 0.866 | $0.544 | 58.432 tok/s | |
| GPT-5.2 (xhigh) | OpenAI | 42.2 | 99 | 0.903 | $4.813 | 87.262 tok/s | |
| Kimi K2.7 Code | Kimi | 41.9 | 60.8 | 0.896 | $1.712 | 47.507 tok/s | |
| Claude Sonnet 5 (Non-reasoning, High Effort) | Anthropic | 41.7 | 66.4 | 0.8 | $4 | 63.468 tok/s | |
| GPT-5.6 Sol (Non-reasoning) | OpenAI | 41.2 | 65.1 | 0.79 | $11.25 | 58.623 tok/s | |
| Hy3 | Tencent | 41.2 | 58.8 | 0.897 | $0 | 60.704 tok/s | |
| Nex-N2-Pro | Nex AGI | 41 | 59.1 | 0.892 | $1 | 134.226 tok/s | |
| Claude Opus 4.5 (Reasoning) | Anthropic | 40.8 | 91.3 | 0.866 | $10 | 69.62 tok/s | |
| Inkling (xhigh) | Thinking Machines | 40.7 | 52.1 | 0.872 | $2.572 | 61.11 tok/s | |
| GPT-5.6 Terra (low) | OpenAI | 40.5 | 58.1 | 0.843 | $5.625 | 122.883 tok/s | |
| DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 40.3 | 56.2 | 0.894 | $0.175 | 115.07 tok/s | |
| MiMo-V2-Pro | Xiaomi | 40.3 | 0.87 | $0 | 0 tok/s | ||
| GLM-5.1 (Reasoning) | Z AI | 40.2 | 55.8 | 0.868 | $2.15 | 87.188 tok/s | |
| GPT-5.2 Codex (xhigh) | OpenAI | 40.1 | 0.899 | $4.813 | 162.362 tok/s | ||
| GPT-5.4 mini (xhigh) | OpenAI | 40 | 56.1 | 0.875 | $1.688 | 180.029 tok/s | |
| Qwen3.6 Max Preview | Alibaba | 40 | 0.888 | $2.925 | 45.639 tok/s | ||
| Grok Build 0.1 0616 | SpaceXAI | 39.8 | 51.5 | 0.895 | $1.25 | 53.737 tok/s | |
| Qwen3.6 Plus | Alibaba | 39.6 | 54.5 | 0.882 | $1.125 | 52.411 tok/s | |
| Gemini 3 Pro Preview (high) | 39.6 | 95.7 | 0.908 | $4.5 | 0 tok/s | ||
| GLM-5 (Reasoning) | Z AI | 39.5 | 0.82 | $1.55 | 53.928 tok/s | ||
| GPT-5.4 (low) | OpenAI | 39.1 | 0.871 | $5.625 | 91.879 tok/s | ||
| Qwen3.7 Plus | Alibaba | 39 | 55.9 | 0.9 | $0.7 | 51.783 tok/s | |
| JT-4.1 Flash 236B A21B | China Mobile | 38.8 | 52.4 | 0.845 | $0 | 0 tok/s | |
| GPT-5.4 nano (xhigh) | OpenAI | 38.2 | 56.1 | 0.817 | $0.463 | 161.224 tok/s | |
| GPT-5.6 Luna (medium) | OpenAI | 38.1 | 50.7 | 0.859 | $2.25 | 180.533 tok/s | |
| MiniMax-M2.7 | MiniMax | 38.1 | 52.6 | 0.874 | $0.525 | 58.848 tok/s | |
| GLM-5-Turbo | Z AI | 38.1 | 0.847 | $0 | 0 tok/s | ||
| GPT-5.2 (medium) | OpenAI | 38 | 96.7 | 0.864 | $4.813 | 0 tok/s | |
| Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 37.8 | 49.3 | 0.867 | $1.175 | 211.335 tok/s | |
| Gemini 3 Flash Preview (Reasoning) | 37.8 | 97 | 0.898 | $1.125 | 230.243 tok/s | ||
| Claude Opus 4.6 (Non-reasoning, High Effort) | Anthropic | 37.8 | 0.84 | $10 | 56.657 tok/s | ||
| Grok 4.3 (high) | SpaceXAI | 37.6 | 42.2 | 0.901 | $1.563 | 123.488 tok/s | |
| DeepSeek V4 Flash (Reasoning, High Effort) | DeepSeek | 37.5 | 52 | 0.867 | $0.175 | 0 tok/s | |
| MiMo-V2.5 | Xiaomi | 37.2 | 56.8 | 0.849 | $0.175 | 63.429 tok/s | |
| Qwen3.6 27B (Reasoning) | Alibaba | 37.1 | 53.7 | 0.842 | $1.35 | 59.861 tok/s | |
| Grok 4.20 0309 v2 (Reasoning) | SpaceXAI | 37 | 0.911 | $3 | 234.547 tok/s | ||
| GPT-5.1 (high) | OpenAI | 36.9 | 49.4 | 94 | 0.873 | $3.438 | 110.114 tok/s |
| Gemini 3.5 Flash-Lite | 36.5 | 49.3 | 0.838 | $0.85 | 373.432 tok/s | ||
| Grok 4.20 0309 (Reasoning) | SpaceXAI | 36.5 | 0.885 | $3 | 0 tok/s | ||
| MiMo-V2-Omni-0327 | Xiaomi | 36.4 | 0.855 | $0 | 0 tok/s | ||
| Claude 4.5 Sonnet (Reasoning) | Anthropic | 36.4 | 52.1 | 88 | 0.834 | $6 | 66.878 tok/s |
| GPT-5 Codex (high) | OpenAI | 36.1 | 98.7 | 0.837 | $3.438 | 173.231 tok/s | |
| Grok 4.3 (medium) | SpaceXAI | 36 | 0.89 | $1.563 | 122.245 tok/s | ||
| Claude Sonnet 4.6 (Non-reasoning, High Effort) | Anthropic | 35.9 | 0.799 | $6 | 59.908 tok/s | ||
| Grok 4.3 (low) | SpaceXAI | 35.4 | 0.843 | $1.563 | 105.078 tok/s | ||
| GPT-5.5 (Non-reasoning) | OpenAI | 35.4 | 56.5 | 0.768 | $11.25 | 77.393 tok/s | |
| Kimi K2.5 (Reasoning) | Kimi | 35.4 | 46.8 | 0.879 | $1.2 | 47.528 tok/s | |
| GLM-5.1 (Non-reasoning) | Z AI | 35.4 | 0.839 | $2.15 | 64.08 tok/s | ||
| MiMo-V2-Omni | Xiaomi | 35 | 0.828 | $0 | 0 tok/s | ||
| Gemini 3.5 Flash (minimal) | 34.9 | 0.828 | $3.375 | 241.496 tok/s | |||
| GPT-5.1 Codex (high) | OpenAI | 34.7 | 95.7 | 0.86 | $3.438 | 213.255 tok/s | |
| GPT-5 (high) | OpenAI | 34.7 | 37.8 | 94.3 | 0.854 | $3.438 | 110.522 tok/s |
| Claude Opus 4.5 (Non-reasoning) | Anthropic | 34.7 | 62.7 | 0.81 | $10 | 67.692 tok/s | |
| Kimi K2.6 (Non-reasoning) | Kimi | 34.6 | 0.788 | $1.712 | 41.193 tok/s | ||
| GLM 5V Turbo (Reasoning) | Z AI | 34.5 | 0.809 | $0 | 0 tok/s | ||
| Claude Sonnet 4.6 (Non-reasoning, Low Effort) | Anthropic | 34.3 | 0.797 | $6 | 53.286 tok/s | ||
| GLM-5.2 (Non-reasoning) | Z AI | 34.1 | 46.5 | 0.686 | $2.15 | 110.718 tok/s | |
| GPT-5.6 Terra (Non-reasoning) | OpenAI | 34 | 52.3 | 0.746 | $5.625 | 114.948 tok/s | |
| Qwen3.5 27B (Reasoning) | Alibaba | 33.8 | 0.858 | $0.825 | 79.732 tok/s | ||
| KAT Coder Pro V2 | KwaiKAT | 33.7 | 59.5 | 0.855 | $0.525 | 0 tok/s | |
| Qwen3.5 397B A17B (Reasoning) | Alibaba | 33.7 | 48.2 | 0.893 | $1.35 | 61.343 tok/s | |
| GPT-5 (medium) | OpenAI | 33.7 | 91.7 | 0.842 | $3.438 | 103.111 tok/s | |
| Claude 4.1 Opus (Reasoning) | Anthropic | 33.7 | 80.3 | 0.809 | $30 | 0 tok/s | |
| MiniMax-M2.5 | MiniMax | 33.7 | 0.848 | $0.525 | 86.763 tok/s | ||
| GLM-4.7 (Reasoning) | Z AI | 33.7 | 45.3 | 95 | 0.859 | $1 | 116.591 tok/s |
| Hy3-preview (Reasoning) | Tencent | 33.6 | 0.867 | $0.2 | 149.605 tok/s | ||
| LongCat 2.0 | LongCat | 33.5 | 45.3 | 0.78 | $0 | 0 tok/s | |
| GPT-5.5 Instant (May 2026) | OpenAI | 33.5 | 0.846 | $11.25 | 0 tok/s | ||
| GPT-5.6 Luna (low) | OpenAI | 33.3 | 44.2 | 0.835 | $2.25 | 184.887 tok/s | |
| Grok 4 | SpaceXAI | 33.3 | 92.7 | 0.877 | $11 | 0 tok/s | |
| MiMo-V2-Flash (Feb 2026) | Xiaomi | 33.2 | 0.835 | $0 | 0 tok/s | ||
| Gemini 3 Pro Preview (low) | 33.1 | 86.7 | 0.887 | $4.5 | 0 tok/s | ||
| Kimi K2 Thinking | Kimi | 32.7 | 94.7 | 0.838 | $1.075 | 130.665 tok/s | |
| o3-pro | OpenAI | 32.5 | 0.845 | $35 | 0 tok/s | ||
| GLM-5 (Non-reasoning) | Z AI | 32.4 | 0.666 | $1.55 | 71.248 tok/s | ||
| Qwen3.5 122B A10B (Reasoning) | Alibaba | 32.3 | 45.7 | 0.857 | $1.1 | 138.731 tok/s | |
| Qwen3.5 397B A17B (Non-reasoning) | Alibaba | 32 | 0.861 | $1.35 | 62.429 tok/s | ||
| DeepSeek V3.2 (Reasoning) | DeepSeek | 32 | 44.2 | 92 | 0.84 | $0.315 | 0 tok/s |
| Qwen3 Max Thinking | Alibaba | 31.7 | 0.861 | $0 | 0 tok/s | ||
| Qwen3.6 35B A3B (Reasoning) | Alibaba | 31.6 | 41.9 | 0.841 | $0.557 | 151.85 tok/s | |
| MiniMax-M2.1 | MiniMax | 31.4 | 82.7 | 0.83 | $0.525 | 88.858 tok/s | |
| DeepSeek V4 Pro (Non-reasoning) | DeepSeek | 31.2 | 0.717 | $0.544 | 67.307 tok/s | ||
| GPT-5 (low) | OpenAI | 31.2 | 83 | 0.808 | $3.438 | 94.198 tok/s | |
| MiMo-V2-Flash (Reasoning) | Xiaomi | 31.2 | 96.3 | 0.846 | $0.15 | 0 tok/s | |
| Claude 4 Opus (Reasoning) | Anthropic | 31 | 73.3 | 0.796 | $30 | 0 tok/s | |
| GPT-5 mini (medium) | OpenAI | 30.9 | 85 | 0.803 | $0.688 | 95.272 tok/s | |
| Qwen3.5 Omni Plus | Alibaba | 30.6 | 0.826 | $1.5 | 54.921 tok/s | ||
| Ring-2.6-1T | InclusionAI | 30.6 | 42.8 | 0.857 | $0.85 | 129.263 tok/s | |
| GPT-5.1 Codex mini (high) | OpenAI | 30.6 | 91.7 | 0.813 | $0.688 | 210.408 tok/s | |
| Grok 4.1 Fast (Reasoning) | SpaceXAI | 30.6 | 89.3 | 0.853 | $0 | 0 tok/s | |
| Qwen3.6 27B (Non-reasoning) | Alibaba | 30.5 | 46.6 | 0.829 | $1.35 | 60.312 tok/s | |
| o3 | OpenAI | 30.4 | 88.3 | 0.827 | $3.5 | 159.073 tok/s | |
| DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 30.4 | 43.5 | 89.7 | 0.792 | $1.914 | 0 tok/s |
| Step 3.7 Flash | StepFun | 30.3 | 39.6 | 0.809 | $0.438 | 401.138 tok/s | |
| GPT-5.4 nano (medium) | OpenAI | 30.2 | 0.761 | $0.463 | 173.684 tok/s | ||
| Mistral Medium 3.5 | Mistral | 29.9 | 46.9 | 0.748 | $3 | 135.195 tok/s | |
| GPT-5.4 mini (medium) | OpenAI | 29.8 | 0.823 | $1.688 | 213.803 tok/s | ||
| Claude 4.5 Haiku (Reasoning) | Anthropic | 29.6 | 43.9 | 83.7 | 0.672 | $2 | 151.182 tok/s |
| Gemma 4 31B (Reasoning) | 29.4 | 43.4 | 0.857 | $0 | 35.207 tok/s | ||
| Kimi K2.5 (Non-reasoning) | Kimi | 29.4 | 0.789 | $1.2 | 46.261 tok/s | ||
| Claude 4.5 Sonnet (Non-reasoning) | Anthropic | 29.3 | 37 | 0.727 | $6 | 66.906 tok/s | |
| Qwen3.5 35B A3B (Reasoning) | Alibaba | 29.3 | 0.845 | $0.688 | 142.227 tok/s | ||
| Qwen3.5 27B (Non-reasoning) | Alibaba | 29.3 | 0.842 | $0.825 | 88.997 tok/s | ||
| GPT-5.5 Instant (June 2026) | OpenAI | 28.9 | 39.4 | 0.823 | $11.25 | 0 tok/s | |
| Claude 4 Sonnet (Reasoning) | Anthropic | 28.9 | 37.6 | 74.3 | 0.777 | $6 | 0 tok/s |
| DeepSeek V4 Flash (Non-reasoning) | DeepSeek | 28.7 | 0.716 | $0.175 | 113.262 tok/s | ||
| GLM-4.6 (Reasoning) | Z AI | 28.7 | 45.8 | 86 | 0.78 | $0.963 | 46.152 tok/s |
| JT-35B-Flash | China Mobile | 28.4 | 0.829 | $0 | 0 tok/s | ||
| KAT-Coder-Pro V1 | KwaiKAT | 28.3 | 94.7 | 0.764 | $0 | 0 tok/s | |
| MiniMax-M2 | MiniMax | 28.3 | 78.3 | 0.777 | $0.525 | 96.733 tok/s | |
| Claude 4.1 Opus (Non-reasoning) | Anthropic | 28.2 | $30 | 0 tok/s | |||
| MiMo-V2.5-Pro (Non-reasoning) | Xiaomi | 27.9 | 0.762 | $0.926 | 60.282 tok/s | ||
| GPT-5.4 (Non-reasoning) | OpenAI | 27.7 | 0.748 | $5.625 | 101.664 tok/s | ||
| Qwen3.5 122B A10B (Non-reasoning) | Alibaba | 27.6 | 43.3 | 0.827 | $1.1 | 148.736 tok/s | |
| Gemini 3 Flash Preview (Non-reasoning) | 27.4 | 55.7 | 0.812 | $1.125 | 217.555 tok/s | ||
| Grok 4 Fast (Reasoning) | SpaceXAI | 27.4 | 89.7 | 0.847 | $0.275 | 0 tok/s | |
| Claude 3.7 Sonnet (Reasoning) | Anthropic | 27.1 | 36.4 | 56.3 | 0.772 | $0 | 0 tok/s |
| GPT-5.6 Luna (Non-reasoning) | OpenAI | 26.6 | 39.3 | 0.645 | $2.25 | 178.658 tok/s | |
| GLM-4.7 (Non-reasoning) | Z AI | 26.6 | 48 | 0.664 | $1 | 113.746 tok/s | |
| Hy3-preview (Non-reasoning) | Tencent | 26.1 | 0.732 | $0.2 | 157.895 tok/s | ||
| Ling-2.6-1T | InclusionAI | 26.1 | 0.752 | $0.85 | 0 tok/s | ||
| Step 3.5 Flash 2603 | StepFun | 26 | 0.826 | $0.15 | 297.806 tok/s | ||
| Doubao Seed Code | ByteDance Seed | 26 | 79.3 | 0.764 | $0 | 0 tok/s | |
| GPT-5.2 (Non-reasoning) | OpenAI | 26 | 51 | 0.712 | $4.813 | 70.539 tok/s | |
| Gemini 2.5 Pro | 25.8 | 33.3 | 87.7 | 0.844 | $3.438 | 145.607 tok/s | |
| Gemma 4 26B A4B (Reasoning) | 25.7 | 39.3 | 0.792 | $0.198 | 0 tok/s | ||
| o4-mini (high) | OpenAI | 25.6 | 90.7 | 0.784 | $1.925 | 178.969 tok/s | |
| Claude 4 Opus (Non-reasoning) | Anthropic | 25.5 | 36.3 | 0.701 | $30 | 0 tok/s | |
| Claude 4 Sonnet (Non-reasoning) | Anthropic | 25.5 | 38 | 0.683 | $6 | 0 tok/s | |
| Step 3.5 Flash | StepFun | 25.5 | 0.831 | $0.15 | 288.655 tok/s | ||
| NVIDIA Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 25.4 | 37.7 | 0.8 | $0.381 | 172.453 tok/s | |
| DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 25.4 | 87.7 | 0.797 | $0.315 | 0 tok/s | |
| GPT-5 mini (high) | OpenAI | 25.3 | 15.6 | 90.7 | 0.828 | $0.688 | 110.77 tok/s |
| Gemini 3.1 Flash-Lite | 25 | 34.7 | 0.822 | $0.563 | 325.782 tok/s | ||
| Qwen3 Max Thinking (Preview) | Alibaba | 25 | 82.3 | 0.776 | $2.4 | 64.755 tok/s | |
| Grok 4.3 (Non-reasoning) | SpaceXAI | 24.8 | 35.2 | 0.658 | $1.563 | 95.944 tok/s | |
| K-EXAONE (Reasoning) | LG AI Research | 24.7 | 90.3 | 0.783 | $0 | 0 tok/s | |
| MiMo-V2-Flash (Non-reasoning) | Xiaomi | 24.7 | 49.8 | 67.7 | 0.656 | $0 | 0 tok/s |
| DeepSeek V3.2 (Non-reasoning) | DeepSeek | 24.7 | 59 | 0.751 | $0.315 | 0 tok/s | |
| Qwen3.6 35B A3B (Non-reasoning) | Alibaba | 24.2 | 28.1 | 0.817 | $0.844 | 172.867 tok/s | |
| Qwen3.5 35B A3B (Non-reasoning) | Alibaba | 24 | 37 | 0.819 | $0.688 | 162.744 tok/s | |
| Qwen3 Max | Alibaba | 24 | 80.7 | 0.764 | $2.4 | 59.802 tok/s | |
| gpt-oss-120b (high) | OpenAI | 23.8 | 30.4 | 93.4 | 0.782 | $0.262 | 292.016 tok/s |
| Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 23.8 | 78.3 | 0.793 | $0 | 0 tok/s | ||
| Claude 4.5 Haiku (Non-reasoning) | Anthropic | 23.7 | 39 | 0.646 | $2 | 119.674 tok/s | |
| Claude 3.7 Sonnet (Non-reasoning) | Anthropic | 23.5 | 21 | 0.656 | $6 | 0 tok/s | |
| Kimi K2 0905 | Kimi | 23.5 | 57.3 | 0.767 | $1.075 | 37.138 tok/s | |
| o1 | OpenAI | 23.4 | 39.7 | 0.747 | $26.25 | 0 tok/s | |
| EXAONE 4.5 33B | LG AI Research | 23 | 0.794 | $0 | 0 tok/s | ||
| Gemini 2.5 Pro Preview (Mar' 25) | 23 | 46.7 | 0.836 | $0 | 0 tok/s | ||
| GLM-4.6 (Non-reasoning) | Z AI | 23 | 44.3 | 0.632 | $0.981 | 68.669 tok/s | |
| GLM-4.7-Flash (Reasoning) | Z AI | 22.9 | 0.581 | $0.153 | 90.954 tok/s | ||
| Command A+ | Cohere | 22.5 | 27.8 | 0.761 | $0 | 177.18 tok/s | |
| Grok 4.20 0309 (Non-reasoning) | SpaceXAI | 22.5 | 0.785 | $3 | 0 tok/s | ||
| Grok 3 mini Reasoning (high) | SpaceXAI | 22.5 | 84.7 | 0.791 | $0.35 | 41.07 tok/s | |
| Gemini 2.5 Pro Preview (May' 25) | 22.3 | 0.822 | $3.438 | 0 tok/s | |||
| DeepSeek V3.2 Speciale | DeepSeek | 22.2 | 96.7 | 0.871 | $0 | 0 tok/s | |
| Gemma 4 12B (Reasoning) | 22 | 0.753 | $0.15 | 127.952 tok/s | |||
| ERNIE 5.0 Thinking Preview | Baidu | 21.9 | 85 | 0.777 | $0 | 0 tok/s | |
| Gemma 4 31B (Non-reasoning) | 21.8 | 33.2 | 0.763 | $0.205 | 61.777 tok/s | ||
| Nova 2.0 Pro Preview (medium) | Amazon | 21.8 | 34 | 89 | 0.785 | $3.438 | 137.755 tok/s |
| Grok 4.20 0309 v2 (Non-reasoning) | SpaceXAI | 21.8 | 0.776 | $3 | 197.108 tok/s | ||
| Grok Code Fast 1 | SpaceXAI | 21.6 | 43.3 | 0.727 | $0 | 0 tok/s | |
| Mercury 2 | Inception | 21.4 | 31.1 | 0.77 | $0.375 | 1044.699 tok/s | |
| Qwen3.5 9B (Reasoning) | Alibaba | 21.4 | 28.7 | 0.806 | $0.113 | 48.922 tok/s | |
| DeepSeek V3.1 Terminus (Non-reasoning) | DeepSeek | 21.4 | 53.7 | 0.751 | $0.453 | 0 tok/s | |
| Nemotron Cascade 2 30B A3B | NVIDIA | 21.3 | 0.758 | $0 | 0 tok/s | ||
| DeepSeek V3.2 Exp (Non-reasoning) | DeepSeek | 21.3 | 57.7 | 0.738 | $0.315 | 0 tok/s | |
| Apriel-v1.5-15B-Thinker | ServiceNow | 21.2 | 87.5 | 0.713 | $0 | 0 tok/s | |
| Qwen3 Coder Next | Alibaba | 21.1 | 36.2 | 0.737 | $0.563 | 95.692 tok/s | |
| DeepSeek V3.1 (Non-reasoning) | DeepSeek | 21 | 49.7 | 0.735 | $0.84 | 0 tok/s | |
| Nova 2.0 Omni (medium) | Amazon | 20.9 | 89.7 | 0.76 | $0.85 | 0 tok/s | |
| DeepSeek V3.1 (Reasoning) | DeepSeek | 20.7 | 89.7 | 0.779 | $0.865 | 0 tok/s | |
| Qwen3 VL 235B A22B (Reasoning) | Alibaba | 20.6 | 88.3 | 0.772 | $2.625 | 59.4 tok/s | |
| Apriel-v1.6-15B-Thinker | ServiceNow | 20.5 | 88 | 0.733 | $0 | 0 tok/s | |
| GPT-5.1 (Non-reasoning) | OpenAI | 20.4 | 38 | 0.643 | $3.438 | 101.445 tok/s | |
| Qwen3.5 9B (Non-reasoning) | Alibaba | 20.3 | 23.5 | 0.786 | $0 | 0 tok/s | |
| Gemma 4 26B A4B (Non-reasoning) | 20.1 | 0.714 | $0.198 | 42.763 tok/s | |||
| Qwen3.5 4B (Reasoning) | Alibaba | 20.1 | 22.6 | 0.771 | $0.06 | 22.313 tok/s | |
| Gemini 2.5 Flash (Reasoning) | 20.1 | 73.3 | 0.79 | $0.85 | 231.087 tok/s | ||
| DeepSeek R1 0528 (May '25) | DeepSeek | 20.1 | 76 | 0.813 | $2.063 | 0 tok/s | |
| GPT-5 nano (high) | OpenAI | 19.9 | 83.7 | 0.676 | $0.138 | 177.365 tok/s | |
| North Mini Code | Cohere | 19.8 | 36.5 | 0.757 | $0 | 96.034 tok/s | |
| Mistral Small 4 (Reasoning) | Mistral | 19.6 | 26.6 | 0.769 | $0.262 | 175.446 tok/s | |
| Nova 2.0 Pro Preview (low) | Amazon | 19.6 | 25.9 | 63.3 | 0.751 | $3.438 | 148.941 tok/s |
| Qwen3 235B A22B 2507 (Reasoning) | Alibaba | 19.6 | 22.1 | 91 | 0.79 | $2.625 | 79.256 tok/s |
| GLM-4.5 (Reasoning) | Z AI | 19.5 | 73.7 | 0.782 | $0 | 0 tok/s | |
| GPT-4.1 | OpenAI | 19.4 | 34.7 | 0.666 | $3.5 | 149.273 tok/s | |
| Kimi K2 | Kimi | 19.4 | 57 | 0.766 | $1.002 | 36.903 tok/s | |
| Devstral 2 | Mistral | 19.2 | 31.3 | 36.7 | 0.594 | $0 | 76.033 tok/s |
| Qwen3 Max (Preview) | Alibaba | 19.2 | 75 | 0.764 | $2.4 | 60.688 tok/s | |
| Nova 2.0 Lite (medium) | Amazon | 19 | 88.7 | 0.768 | $0.85 | 215.526 tok/s | |
| Qwen3.5 Omni Flash | Alibaba | 19 | 0.742 | $0.275 | 256.246 tok/s | ||
| o3-mini | OpenAI | 19 | 0.748 | $1.925 | 227.979 tok/s | ||
| GPT-5 nano (medium) | OpenAI | 19 | 78.3 | 0.67 | $0.138 | 173.983 tok/s | |
| o1-pro | OpenAI | 18.9 | $262.5 | 0 tok/s | |||
| Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 18.8 | 56.7 | 0.766 | $0 | 0 tok/s | ||
| JT-MINI | China Mobile | 18.5 | 0.676 | $0 | 0 tok/s | ||
| DeepSeek R1 (Jan '25) | DeepSeek | 18.5 | 24.6 | 68 | 0.708 | $2.431 | 0 tok/s |
| Grok 3 | SpaceXAI | 18.4 | 58 | 0.693 | $8 | 0 tok/s | |
| Seed-OSS-36B-Instruct | ByteDance Seed | 18.3 | 84.7 | 0.726 | $0.3 | 33.215 tok/s | |
| Nova 2.0 Lite (high) | Amazon | 18.2 | 23 | 94.3 | 0.811 | $0.85 | 189.882 tok/s |
| Trinity Large Thinking | Arcee AI | 18.2 | 25.8 | 0.752 | $0.395 | 172.926 tok/s | |
| Qwen3 235B A22B 2507 Instruct | Alibaba | 18.2 | 71.7 | 0.753 | $1.225 | 72.044 tok/s | |
| Qwen3 Coder 480B A35B Instruct | Alibaba | 18 | 39.3 | 0.618 | $3 | 73.145 tok/s | |
| Magistral Medium 1.2 | Mistral | 17.9 | 21.3 | 82 | 0.739 | $2.75 | 42.06 tok/s |
| Qwen3 VL 32B (Reasoning) | Alibaba | 17.9 | 84.7 | 0.733 | $2.625 | 95.737 tok/s | |
| Nova 2.0 Lite (low) | Amazon | 17.8 | 46.7 | 0.698 | $0.85 | 187.444 tok/s | |
| HyperNova 60B 2605 | Multiverse Computing | 17.8 | 23.2 | 0.733 | $0.065 | 406.075 tok/s | |
| Sonar Reasoning Pro | Perplexity | 17.8 | $0 | 0 tok/s | |||
| MiniMax M1 80k | MiniMax | 17.7 | 61 | 0.697 | $0.963 | 0 tok/s | |
| GPT-5.4 nano (Non-Reasoning) | OpenAI | 17.6 | 0.558 | $0.463 | 161.386 tok/s | ||
| Gemini 2.5 Flash Preview (Reasoning) | 17.5 | 0.698 | $0 | 0 tok/s | |||
| Devstral Small 2 | Mistral | 17.4 | 29.3 | 34.3 | 0.532 | $0 | 43.38 tok/s |
| K2 Think V2 | MBZUAI Institute of Foundation Models | 17.3 | 21 | 0.713 | $0 | 0 tok/s | |
| LongCat Flash Lite | LongCat | 17.2 | 0.636 | $0 | 0 tok/s | ||
| GPT-5 (minimal) | OpenAI | 17.2 | 31.7 | 0.673 | $3.438 | 86.425 tok/s | |
| HyperCLOVA X SEED Think (32B) | Naver | 17 | 59 | 0.615 | $0 | 0 tok/s | |
| o1-preview | OpenAI | 17 | 34 | $28.875 | 0 tok/s | ||
| Grok 4.1 Fast (Non-reasoning) | SpaceXAI | 16.9 | 34.3 | 0.637 | $0 | 0 tok/s | |
| GLM-4.6V (Reasoning) | Z AI | 16.8 | 85.3 | 0.719 | $0.45 | 70.739 tok/s | |
| K-EXAONE (Non-reasoning) | LG AI Research | 16.7 | 44 | 0.695 | $0 | 0 tok/s | |
| Qwen3 Next 80B A3B (Reasoning) | Alibaba | 16.7 | 17.4 | 84.3 | 0.759 | $1.875 | 178.918 tok/s |
| Nova 2.0 Omni (low) | Amazon | 16.6 | 56 | 0.699 | $0.85 | 0 tok/s | |
| GPT-5.4 mini (Non-Reasoning) | OpenAI | 16.6 | 0.606 | $1.688 | 185.938 tok/s | ||
| Grok 4 Fast (Non-reasoning) | SpaceXAI | 16.5 | 41.3 | 0.606 | $0.275 | 0 tok/s | |
| GLM-4.5-Air | Z AI | 16.5 | 80.7 | 0.733 | $0.372 | 70.616 tok/s | |
| Mi:dm K 2.5 Pro | Korea Telecom | 16.4 | 76.7 | 0.701 | $0 | 0 tok/s | |
| Ring-1T | InclusionAI | 16.2 | 89.3 | 0.774 | $0 | 0 tok/s | |
| Qwen3.5 4B (Non-reasoning) | Alibaba | 16 | 20.3 | 0.712 | $0.06 | 11.352 tok/s | |
| Mistral Large 3 | Mistral | 15.9 | 20.1 | 38 | 0.68 | $0.75 | 63.835 tok/s |
| INTELLECT-3 | Prime Intellect | 15.6 | 88 | 0.761 | $0 | 0 tok/s | |
| o3-mini (high) | OpenAI | 15.6 | 16.3 | 0.773 | $1.925 | 239.887 tok/s | |
| GLM-4.7-Flash (Non-reasoning) | Z AI | 15.5 | 0.452 | $0.153 | 128.894 tok/s | ||
| DeepSeek V3 0324 | DeepSeek | 15.4 | 21.2 | 41 | 0.655 | $0.483 | 0 tok/s |
| GPT-5 (ChatGPT) | OpenAI | 15.3 | 48.3 | 0.686 | $3.438 | 184.214 tok/s | |
| Solar Open 100B (Reasoning) | Upstage | 15.1 | 0.657 | $0 | 0 tok/s | ||
| Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 15.1 | 68.7 | 0.709 | $0.175 | 0 tok/s | ||
| Grok 3 Reasoning Beta | SpaceXAI | 15.1 | $0 | 0 tok/s | |||
| gpt-oss-120b (low) | OpenAI | 14.9 | 21.2 | 66.7 | 0.672 | $0.262 | 334.254 tok/s |
| gpt-oss-20b (high) | OpenAI | 14.9 | 20.7 | 89.3 | 0.688 | $0.095 | 252.979 tok/s |
| Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 14.9 | 13.8 | 0.469 | $0.131 | 318.053 tok/s | |
| GPT-4.1 mini | OpenAI | 14.8 | 20.2 | 46.3 | 0.664 | $0.7 | 83.582 tok/s |
| Mistral Small 3.1 | Mistral | 14.7 | 26.3 | 3.7 | 0.454 | $0.15 | 156.411 tok/s |
| Mistral Medium 3.1 | Mistral | 14.7 | 20.5 | 38.3 | 0.588 | $0.8 | 82.778 tok/s |
| Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 14.4 | 20.9 | 30.7 | 0.636 | $3.438 | 143.285 tok/s |
| MiniMax M1 40k | MiniMax | 14.4 | 13.7 | 0.682 | $0 | 0 tok/s | |
| Qwen3 30B A3B 2507 (Reasoning) | Alibaba | 14.4 | 12.1 | 56.3 | 0.707 | $0.75 | 156.107 tok/s |
| gpt-oss-20b (low) | OpenAI | 14.3 | 62.3 | 0.611 | $0.103 | 248.107 tok/s | |
| Llama 4 Maverick | Meta | 14.3 | 16.3 | 19.3 | 0.671 | $0.445 | 109.89 tok/s |
| GPT-5 mini (minimal) | OpenAI | 14.3 | 46.7 | 0.687 | $0.688 | 96.865 tok/s | |
| Qwen3 VL 235B A22B Instruct | Alibaba | 14.3 | 70.7 | 0.712 | $1.225 | 48.299 tok/s | |
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 14.2 | 14.4 | 91 | 0.757 | $0.088 | 155.566 tok/s |
| K2-V2 (high) | MBZUAI Institute of Foundation Models | 14.2 | 78.3 | 0.681 | $0 | 0 tok/s | |
| DeepSeek V3 (Dec '24) | DeepSeek | 14.2 | 23 | 26 | 0.557 | $0.493 | 0 tok/s |
| Solar Pro 3 | Upstage | 14.1 | 16.2 | 0.724 | $0 | 0 tok/s | |
| Ling 2.6 Flash | InclusionAI | 14.1 | 25.3 | 0.593 | $0.15 | 151.614 tok/s | |
| Gemini 2.5 Flash (Non-reasoning) | 14.1 | 60.3 | 0.683 | $0.85 | 226.94 tok/s | ||
| o1-mini | OpenAI | 14 | 0.603 | $0 | 0 tok/s | ||
| Qwen3 Next 80B A3B Instruct | Alibaba | 13.7 | 66.3 | 0.738 | $0.875 | 190.498 tok/s | |
| Tri-21B-think Preview | Trillion Labs | 13.6 | 0.538 | $0 | 0 tok/s | ||
| GPT-4.5 (Preview) | OpenAI | 13.6 | $0 | 0 tok/s | |||
| Qwen3 Coder 30B A3B Instruct | Alibaba | 13.6 | 29 | 0.516 | $0.9 | 102.424 tok/s | |
| DiffusionGemma 26B A4B | 13.5 | 19.7 | 0.669 | $0 | 0 tok/s | ||
| QwQ 32B | Alibaba | 13.4 | 29 | 0.593 | $0.745 | 31.176 tok/s | |
| Qwen3 235B A22B (Reasoning) | Alibaba | 13.4 | 82 | 0.7 | $2.625 | 62.296 tok/s | |
| Gemini 2.0 Flash Thinking Experimental (Jan '25) | 13.3 | 24.1 | 0.701 | $0 | 0 tok/s | ||
| Qwen3 VL 30B A3B (Reasoning) | Alibaba | 13.3 | 82.3 | 0.72 | $0.75 | 123.323 tok/s | |
| Gemma 4 12B (Non-reasoning) | 13.2 | 0.661 | $0.15 | 113.279 tok/s | |||
| Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 13.1 | 46.7 | 0.651 | $0.175 | 0 tok/s | ||
| Motif-2-12.7B-Reasoning | Motif Technologies | 12.8 | 80.3 | 0.695 | $0 | 0 tok/s | |
| Ling-1T | InclusionAI | 12.8 | 71.3 | 0.719 | $0 | 0 tok/s | |
| Nova Premier | Amazon | 12.7 | 17.3 | 0.569 | $5 | 63.11 tok/s | |
| Magistral Medium 1 | Mistral | 12.5 | 40.3 | 0.679 | $0 | 0 tok/s | |
| Mistral Medium 3 | Mistral | 12.5 | 30.3 | 0.578 | $0.8 | 49.751 tok/s | |
| Solar Pro 2 (Preview) (Reasoning) | Upstage | 12.5 | 0.578 | $0 | 0 tok/s | ||
| Mistral Small 4 (Non-reasoning) | Mistral | 12.4 | 0.571 | $0.262 | 149.281 tok/s | ||
| Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 12.4 | 76.7 | 0.748 | $0.4 | 81.318 tok/s | |
| K2-V2 (medium) | MBZUAI Institute of Foundation Models | 12.4 | 64.7 | 0.598 | $0 | 0 tok/s | |
| Tri-21B-Think | Trillion Labs | 12.4 | 0.601 | $0 | 0 tok/s | ||
| Devstral Medium | Mistral | 12.4 | 4.7 | 0.492 | $0 | 0 tok/s | |
| GPT-4o (March 2025, chatgpt-4o-latest) | OpenAI | 12.3 | 25.7 | 0.655 | $0 | 0 tok/s | |
| Gemini 2.0 Flash (Feb '25) | 12.3 | 21.7 | 0.623 | $0 | 0 tok/s | ||
| Claude 3.5 Haiku | Anthropic | 12.3 | 15.9 | 0.408 | $0 | 0 tok/s | |
| Gemma 4 E4B (Reasoning) | 12.2 | 9.4 | 0.576 | $0.04 | 111.522 tok/s | ||
| Llama 3.3 Nemotron Super 49B v1 (Reasoning) | NVIDIA | 12.2 | 54.7 | 0.643 | $0 | 0 tok/s | |
| MiniCPM5-1B (Reasoning) | OpenBMB | 12 | 0.278 | $0 | 0 tok/s | ||
| Qwen3 4B 2507 (Reasoning) | Alibaba | 12 | 82.7 | 0.667 | $0 | 0 tok/s | |
| Sarvam 105B (high) | Sarvam | 11.9 | 0.738 | $0.074 | 0 tok/s | ||
| Nova 2.0 Lite (Non-reasoning) | Amazon | 11.8 | 33.7 | 0.603 | $0.85 | 240.051 tok/s | |
| Gemini 2.0 Pro Experimental (Feb '25) | 11.8 | 25.5 | 0.622 | $0 | 0 tok/s | ||
| Claude 3 Opus | Anthropic | 11.8 | 19.5 | 0.489 | $30 | 0 tok/s | |
| Devstral Small (May '25) | Mistral | 11.8 | 0.434 | $0 | 0 tok/s | ||
| MiniCPM5-1B (Non-reasoning) | OpenBMB | 11.7 | 0.269 | $0 | 0 tok/s | ||
| Gemini 2.5 Flash Preview (Non-reasoning) | 11.7 | 0.594 | $0 | 0 tok/s | |||
| Sonar Reasoning | Perplexity | 11.7 | 0.623 | $0 | 0 tok/s | ||
| Qwen3 32B (Reasoning) | Alibaba | 11.5 | 15.3 | 73 | 0.668 | $2.625 | 99.411 tok/s |
| Gemini 2.5 Flash-Lite (Reasoning) | 11.4 | 53.3 | 0.625 | $0.175 | 304.146 tok/s | ||
| Magistral Small 1.2 | Mistral | 11.3 | 14.7 | 80.3 | 0.663 | $0.75 | 84.305 tok/s |
| GPT-4o (Nov '24) | OpenAI | 11.2 | 6 | 0.543 | $4.375 | 204.223 tok/s | |
| Ministral 3 14B | Mistral | 11.1 | 14.4 | 30 | 0.572 | $0.2 | 64.922 tok/s |
| Nanbeige4.1-3B | Nanbeige | 11.1 | 9.6 | 0.849 | $0 | 0 tok/s | |
| Qwen3 VL 32B Instruct | Alibaba | 11.1 | 68.3 | 0.671 | $1.225 | 72.1 tok/s | |
| DeepSeek R1 Distill Qwen 32B | DeepSeek | 11 | 63 | 0.615 | $0 | 0 tok/s | |
| GLM-4.6V (Non-reasoning) | Z AI | 11 | 26.3 | 0.566 | $0.45 | 51.212 tok/s | |
| Qwen3 235B A22B (Non-reasoning) | Alibaba | 10.9 | 23.7 | 0.613 | $1.225 | 63.805 tok/s | |
| Gemini 2.0 Flash (experimental) | 10.7 | 0.636 | $0 | 0 tok/s | |||
| Magistral Small 1 | Mistral | 10.7 | 41.3 | 0.641 | $0 | 0 tok/s | |
| EXAONE 4.0 32B (Reasoning) | LG AI Research | 10.6 | 80 | 0.739 | $0 | 0 tok/s | |
| Mistral Small 3.2 | Mistral | 10.6 | 12.5 | 27 | 0.505 | $0.15 | 151.884 tok/s |
| Qwen3 VL 8B (Reasoning) | Alibaba | 10.6 | 30.7 | 0.579 | $0.66 | 127.248 tok/s | |
| Nova 2.0 Omni (Non-reasoning) | Amazon | 10.5 | 37 | 0.555 | $0.85 | 0 tok/s | |
| DeepSeek R1 0528 Qwen3 8B | DeepSeek | 10.4 | 63.7 | 0.612 | $0 | 0 tok/s | |
| Qwen3 14B (Reasoning) | Alibaba | 10.4 | 13.8 | 55.7 | 0.604 | $1.313 | 62.647 tok/s |
| Qwen2.5 Max | Alibaba | 10.2 | 0.587 | $0 | 0 tok/s | ||
| Llama 4 Scout | Meta | 10 | 8.2 | 14 | 0.587 | $0.3 | 76.185 tok/s |
| Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 10 | 68.7 | 0.699 | $0.198 | 92.074 tok/s | |
| Gemini 1.5 Pro (Sep '24) | 10 | 23.6 | 0.589 | $0 | 0 tok/s | ||
| Solar Pro 2 (Preview) (Non-reasoning) | Upstage | 10 | 0.544 | $0 | 0 tok/s | ||
| Qwen3 VL 30B A3B Instruct | Alibaba | 10 | 72.3 | 0.695 | $0.35 | 126.005 tok/s | |
| Claude 3.5 Sonnet (Oct '24) | Anthropic | 9.9 | 30.2 | 0.599 | $6 | 0 tok/s | |
| DeepSeek R1 Distill Llama 70B | DeepSeek | 9.9 | 53.7 | 0.402 | $0.787 | 33.62 tok/s | |
| Falcon-H1R-7B | TII UAE | 9.8 | 80 | 0.661 | $0 | 0 tok/s | |
| DeepSeek R1 Distill Qwen 14B | DeepSeek | 9.8 | 55.7 | 0.484 | $0 | 0 tok/s | |
| Ling-flash-2.0 | InclusionAI | 9.7 | 65.3 | 0.657 | $0.247 | 58.451 tok/s | |
| Qwen3 Omni 30B A3B (Reasoning) | Alibaba | 9.6 | 74 | 0.726 | $0.43 | 106.51 tok/s | |
| GPT-4o (Aug '24) | OpenAI | 9.6 | 0.521 | $4.375 | 93.186 tok/s | ||
| GPT-4.1 nano | OpenAI | 9.6 | 11.1 | 24 | 0.512 | $0.175 | 188.886 tok/s |
| Qwen2.5 Instruct 72B | Alibaba | 9.6 | 14 | 0.491 | $0.48 | 0 tok/s | |
| Step3 VL 10B | StepFun | 9.5 | 0.69 | $0 | 0 tok/s | ||
| Sonar | Perplexity | 9.5 | 0.471 | $0 | 0 tok/s | ||
| Llama 3.3 Instruct 70B | Meta | 9.4 | 11.9 | 7.7 | 0.498 | $0.62 | 82.139 tok/s |
| Gemma 4 E2B (Reasoning) | 9.3 | 7.2 | 0.375 | $0 | 0 tok/s | ||
| Devstral Small (Jul '25) | Mistral | 9.3 | 29.3 | 0.414 | $0 | 0 tok/s | |
| Sonar Pro | Perplexity | 9.3 | 0.578 | $0 | 0 tok/s | ||
| Qwen3 30B A3B (Reasoning) | Alibaba | 9.3 | 72.3 | 0.616 | $0.75 | 111.635 tok/s | |
| QwQ 32B-Preview | Alibaba | 9.2 | 0.557 | $0 | 0 tok/s | ||
| Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | NVIDIA | 9.1 | 63.7 | 0.728 | $0.9 | 53.54 tok/s | |
| Mistral Large 2 (Nov '24) | Mistral | 9.1 | 14 | 0.486 | $0 | 0 tok/s | |
| GLM-4.5V (Reasoning) | Z AI | 9.1 | 73 | 0.684 | $0.9 | 52.065 tok/s | |
| Qwen3 30B A3B 2507 Instruct | Alibaba | 9.1 | 66.3 | 0.659 | $0.35 | 156.027 tok/s | |
| Ministral 3 8B | Mistral | 9 | 9.7 | 31.7 | 0.471 | $0.15 | 113.082 tok/s |
| Solar Pro 2 (Reasoning) | Upstage | 9 | 61.3 | 0.687 | $0 | 0 tok/s | |
| NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 9 | 75 | 0.572 | $0.3 | 109.693 tok/s | |
| Hermes 4 - Llama-3.1 405B (Reasoning) | Nous Research | 9 | 69.7 | 0.727 | $1.5 | 36.452 tok/s | |
| ERNIE 4.5 300B A47B | Baidu | 9 | 41.3 | 0.811 | $0.485 | 0 tok/s | |
| Gemma 4 E4B (Non-reasoning) | 8.9 | 0.549 | $0.04 | 113.681 tok/s | |||
| Granite 4.1 30B | IBM | 8.9 | 10.4 | 0.481 | $0 | 0 tok/s | |
| NVIDIA Nemotron Nano 9B V2 (Reasoning) | NVIDIA | 8.8 | 69.7 | 0.57 | $0.07 | 79.418 tok/s | |
| Hermes 4 - Llama-3.1 405B (Non-reasoning) | Nous Research | 8.8 | 15.3 | 0.536 | $1.5 | 35.436 tok/s | |
| Gemini 2.0 Flash-Lite (Feb '25) | 8.8 | 0.535 | $0 | 0 tok/s | |||
| NVIDIA Nemotron 3 Nano 4B | NVIDIA | 8.7 | 8 | 0.513 | $0 | 0 tok/s | |
| Llama Nemotron Super 49B v1.5 (Non-reasoning) | NVIDIA | 8.7 | 8 | 0.481 | $0.4 | 123.598 tok/s | |
| K2-V2 (low) | MBZUAI Institute of Foundation Models | 8.6 | 35.3 | 0.541 | $0 | 0 tok/s | |
| GPT-4o (May '24) | OpenAI | 8.6 | 24.2 | 0.526 | $7.5 | 106.998 tok/s | |
| Gemini 2.0 Flash-Lite (Preview) | 8.6 | 0.542 | $0 | 0 tok/s | |||
| Qwen3 32B (Non-reasoning) | Alibaba | 8.6 | 19.7 | 0.535 | $1.225 | 100.677 tok/s | |
| Llama 3.1 Instruct 405B | Meta | 8.5 | 3 | 0.515 | $4.375 | 0 tok/s | |
| Kimi Linear 48B A3B Instruct | Kimi | 8.5 | 36.3 | 0.412 | $0 | 0 tok/s | |
| Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) | NVIDIA | 8.5 | 50 | 0.408 | $0 | 0 tok/s |