Inference provider
DeepInfra
69 models served. Speed, latency and price below are medians across this provider's catalogue, not per-endpoint measurements.
Models served
69
Median output speed
73 t/s
Median latency
377ms
Median price / 1M
$0.37
Catalogue
Strongest and fastest on this provider
What the catalogue looks like at the top end, on the two axes that usually decide the choice.
Highest Intelligence Index
Among models this provider serves
- GLM 5.2Z.ai52.6
- V4 Flash 0731DeepSeek51.8
- V4 Flash 0423DeepSeek51.8
- MiniMax M3MiniMax45.4
- V4 ProDeepSeek45.3
- Kimi K2.6Moonshot AI45.1
- Kimi K2.7 CodeMoonshot AI43.0
- MiMo-V2.5-ProXiaomi42.9
- InklingThinking Machines42.3
- Hy3Tencent42.2
View as table
| Model | Intelligence |
|---|---|
| GLM 5.2 (Z.ai) | 52.6 |
| V4 Flash 0731 (DeepSeek) | 51.8 |
| V4 Flash 0423 (DeepSeek) | 51.8 |
| MiniMax M3 (MiniMax) | 45.4 |
| V4 Pro (DeepSeek) | 45.3 |
| Kimi K2.6 (Moonshot AI) | 45.1 |
| Kimi K2.7 Code (Moonshot AI) | 43.0 |
| MiMo-V2.5-Pro (Xiaomi) | 42.9 |
| Inkling (Thinking Machines) | 42.3 |
| Hy3 (Tencent) | 42.2 |
Fastest output
Median tokens per second
- gpt-oss-120bOpenAI773 t/s
- GLM 4.7Z.ai502 t/s
- Qwen3 32BQwen423 t/s
- M2.7MiniMax307 t/s
- gpt-oss-20bOpenAI252 t/s
- 234 t/s
- Gemma 4 31BGoogle232 t/s
- Ling-3.0-flashInclusionAI211 t/s
- Qwen3.5-35B-A3BQwen203 t/s
- Qwen3.6 35B A3BQwen177 t/s
View as table
| Model | Tokens/s |
|---|---|
| gpt-oss-120b (OpenAI) | 773 |
| GLM 4.7 (Z.ai) | 502 |
| Qwen3 32B (Qwen) | 423 |
| M2.7 (MiniMax) | 307 |
| gpt-oss-20b (OpenAI) | 252 |
| Llama 3.3 70B Instruct (Meta) | 234 |
| Gemma 4 31B (Google) | 232 |
| Ling-3.0-flash (InclusionAI) | 211 |
| Qwen3.5-35B-A3B (Qwen) | 203 |
| Qwen3.6 35B A3B (Qwen) | 177 |
Full catalogue
All 69 models on DeepInfra
Filter by creator
69 of 69 models| GLM 5.2 Z.aiopen | 52.6 | $0.23 |
| V4 Flash 0731 DeepSeekopen | 51.8 | $0.02 |
| V4 Flash 0423 DeepSeekopen | 51.8 | $0.02 |
| MiniMax M3 MiniMaxopen | 45.4 | $0.11 |
| V4 Pro DeepSeekopen | 45.3 | $0.09 |
| Kimi K2.6 Moonshot AIopen | 45.1 | $0.23 |
| Kimi K2.7 Code Moonshot AIopen | 43.0 | $0.32 |
| MiMo-V2.5-Pro Xiaomiopen | 42.9 | $0.09 |
| Inkling Thinking Machinesopen | 42.3 | $0.37 |
| Hy3 Tencentopen | 42.2 | $0.05 |
| Inkling Small Thinking Machinesopen | 41.2 | $0.12 |
| GLM 5.1 Z.aiopen | 41.0 | $0.29 |
| GLM 5 Z.aiopen | 40.6 | $0.25 |
| M2.7 MiniMaxopen | 38.9 | $0.10 |
| MiMo-V2.5 Xiaomiopen | 38.0 | $0.03 |
| Ling-3.0-flash InclusionAIopen | 37.8 | $0.006 |
| Qwen3.6 27B Qwenopen | 37.7 | $0.32 |
| Kimi K2.5 Moonshot AIopen | 36.0 | $0.26 |
| Qwen3.5-27B Qwenopen | 34.6 | $0.13 |
| GLM 4.7 Z.aiopen | 34.5 | $0.16 |
| Qwen3.5 397B A17B Qwenopen | 34.3 | $0.21 |
| Qwen3.5-122B-A10B Qwenopen | 32.8 | $0.21 |
| Qwen3.6 35B A3B Qwenopen | 32.1 | $0.09 |
| Step 3.7 Flash StepFunopen | 30.9 | $0.10 |
| Qwen3.5-35B-A3B Qwenopen | 29.9 | $0.09 |
| V3.2 DeepSeekopen | 25.1 | $0.05 |
| gpt-oss-120b OpenAIopen | 24.1 | $0.02 |
| GLM 4.6 Z.aiopen | 23.4 | $0.18 |
| GLM 4.7 Flash Z.aiopen | 23.3 | $0.04 |
| Qwen3.5-9B Qwenopen | 21.8 | $0.02 |
| V3.1 Terminus DeepSeekopen | 21.7 | $0.09 |
| gpt-oss-20b OpenAIopen | 15.2 | $0.01 |
| Llama 4 Maverick Metaopen | 14.5 | $0.03 |
| Qwen3 VL 235B A22B Instruct Qwenopen | 14.4 | $0.06 |
| Qwen3 Next 80B A3B Instruct Qwenopen | 13.8 | $0.03 |
| Llama 4 Scout Metaopen | 10.3 | $0.01 |
| Qwen3 VL 30B A3B Instruct Qwenopen | 9.9 | $0.02 |
| Qwen2.5 72B Instruct Qwenopen | 9.4 | $0.03 |
| Nemotron 3 Nano 30B A3B NVIDIAopen | 7.2 | $0.02 |
| Hermes 3 70B Instruct Nous Researchopen | 4.8 | $0.05 |