SmophyAI

Published daily · Next update 02:00 UTC

Speed · tracked daily

The fastest AI models right now

The fastest AI model right now is OpenAI: gpt-oss-120b at 777 tokens/second via Cerebras. Speed is tracked daily, not benchmarked once - providers re-provision constantly, so a static "fastest model" table goes stale within days.

  1. #1 OpenAI: gpt-oss-120b - 777 tok/s via Cerebras
  2. #2 Google: Gemma 4 31B (free) - 279 tok/s via Cerebras
  3. #3 MiniMax: MiniMax M2.7 - 215 tok/s via Groq
  4. #4 NVIDIA: Nemotron 3 Super (free) - 183 tok/s via Nebius
  5. #5 Poolside: Laguna XS 2.1 (free) - 156 tok/s via Poolside
  6. #6 OpenAI: GPT-5.6 Luna Pro (batch) - 154 tok/s via OpenAI
  7. #7 Google: Gemini 2.5 Flash Lite (batch) - 139 tok/s via Google AI Studio
  8. #8 StepFun: Step 3.7 Flash - 137 tok/s via DeepInfra
  9. #9 NVIDIA: Nemotron 3 Ultra (free) - 130 tok/s via BaseTen
  10. #10 Google: Gemini 3.6 Flash (batch) - 129 tok/s via Google AI Studio
  11. #11 MiniMax: MiniMax M3 (batch) - 123 tok/s via Parasail
  12. #12 DeepSeek: DeepSeek V4 Pro - 122 tok/s via BaseTen
  13. #13 Z.ai: GLM 5.2 (batch) - 115 tok/s via Friendli
  14. #14 OpenAI: GPT-5.6 Luna (batch) - 104 tok/s via Amazon Bedrock
  15. #15 Google: Gemini 2.5 Flash (batch) - 100 tok/s via Google
Top 40 models by real throughput
#ModelFastest providerThroughputLatency p50QualityQuality per $
01OpenAI: gpt-oss-120bCerebras777 tok/s215ms24.1343.1 pts/$
02Google: Gemma 4 31B (free)Cerebras279 tok/s686ms29.7185.6 pts/$
03MiniMax: MiniMax M2.7Groq215 tok/s353ms38.974.1 pts/$
04NVIDIA: Nemotron 3 Super (free)Nebius183 tok/s1405ms25.757.1 pts/$
05Poolside: Laguna XS 2.1 (free)Poolside156 tok/s235ms--
06OpenAI: GPT-5.6 Luna Pro (batch)OpenAI154 tok/s7041ms--
07Google: Gemini 2.5 Flash Lite (batch)Google AI Studio139 tok/s307ms--
08StepFun: Step 3.7 FlashDeepInfra137 tok/s1016ms30.970.6 pts/$
09NVIDIA: Nemotron 3 Ultra (free)BaseTen130 tok/s443ms38.328.4 pts/$
10Google: Gemini 3.6 Flash (batch)Google AI Studio129 tok/s1622ms51.617.2 pts/$
11MiniMax: MiniMax M3 (batch)Parasail123 tok/s690ms45.486.5 pts/$
12DeepSeek: DeepSeek V4 ProBaseTen122 tok/s506ms45.383.3 pts/$
13Z.ai: GLM 5.2 (batch)Friendli115 tok/s702ms52.6489.3 pts/$
14OpenAI: GPT-5.6 Luna (batch)Amazon Bedrock104 tok/s1762ms52.3232.4 pts/$
15Google: Gemini 2.5 Flash (batch)Google100 tok/s407ms--
16OpenAI: GPT-5 Mini (batch)OpenAI96 tok/s1548ms25.837.5 pts/$
17Poolside: Laguna S 2.1 (free)Poolside95 tok/s544ms--
18DeepSeek: DeepSeek V4 Flash 0423DeepSeek80 tok/s767ms51.8460.4 pts/$
19Google: Gemma 4 26B A4B (free)Cloudflare77 tok/s515ms26.1189.8 pts/$
20Xiaomi: MiMo-V2.5DeepInfra75 tok/s682ms38217.1 pts/$
21Google: Gemini 3.1 Flash Lite (batch)Google AI Studio75 tok/s548ms--
22Anthropic: Claude Haiku 4.5 (batch)Google74 tok/s457ms29.914.9 pts/$
23inclusionAI: Ling-2.6-flashNovita71 tok/s594ms14.2946.7 pts/$
24OpenAI: GPT-5.6 Terra (batch)Azure69 tok/s2931ms56.625.2 pts/$
25Anthropic: Claude Sonnet 5 (batch)Azure68 tok/s3445ms55.313.8 pts/$
26Claude Opus 5 (batch)Anthropic66 tok/s3460ms63.16.3 pts/$
27Anthropic: Claude Opus 4.8 (batch)Google66 tok/s2178ms57.35.7 pts/$
28Google: Gemini 3 Flash Preview (batch)Google AI Studio60 tok/s1021ms--
29MoonshotAI: Kimi K3Modal60 tok/s2277ms59.710.0 pts/$
30Xiaomi: MiMo-V2.5-ProDeepInfra59 tok/s687ms42.978.9 pts/$
31Tencent: Hy3DeepInfra59 tok/s463ms--
32Anthropic: Claude Opus 4.7 (batch)Google59 tok/s1048ms555.5 pts/$
33Mistral: Mistral NemoDeepInfra50 tok/s333ms--
34SpaceXAI: Grok 4.5xAI50 tok/s840ms55.818.6 pts/$
35Anthropic: Claude Fable 5 (batch)Anthropic48 tok/s4983ms62.13.1 pts/$
36Qwen: Qwen3.8 MaxAlibaba43 tok/s2026ms58.119.4 pts/$
37Anthropic: Claude Sonnet 4.6 (batch)Google42 tok/s1383ms48.48.1 pts/$
38OpenAI: GPT-5.6 Sol (batch)OpenAI41 tok/s2190ms60.95.4 pts/$
39OpenAI: GPT-4o-mini (batch)OpenAI40 tok/s534ms--
40DeepSeek: DeepSeek V3.2Alibaba40 tok/s743ms32.6108.0 pts/$

Top 5, speed over time

#ModelTokens/second
01OpenAI: gpt-oss-120b777
02Google: Gemma 4 31B (free)279
03MiniMax: MiniMax M2.7215
04NVIDIA: Nemotron 3 Super (free)183
05Poolside: Laguna XS 2.1 (free)156

Daily tracking began Aug 9- this becomes a live chart once there's a third day to plot.

Frequently asked questions

What is the fastest AI model?

As of the latest data, OpenAI: gpt-oss-120b is the fastest widely available AI model at 777 tokens/second via Cerebras.

How fast is OpenAI: gpt-oss-120b in tokens per second?

OpenAI: gpt-oss-120b generates approximately 777 tokens per second on its fastest available provider (Cerebras), measured directly from OpenRouter's endpoint data.