Inference provider
Venice
31 models served. Speed, latency and price below are medians across this provider's catalogue, not per-endpoint measurements.
Models served
31
Median output speed
84 t/s
Median latency
446ms
Median price / 1M
$0.475
Catalogue
Strongest and fastest on this provider
What the catalogue looks like at the top end, on the two axes that usually decide the choice.
Highest Intelligence Index
Among models this provider serves
- GLM 5.2Z.ai52.6
- V4 Flash 0731DeepSeek51.8
- V4 Flash 0423DeepSeek51.8
- MiniMax M3MiniMax45.4
- V4 ProDeepSeek45.3
- Kimi K2.6Moonshot AI45.1
- Kimi K2.7 CodeMoonshot AI43.0
- GLM 5.1Z.ai41.0
- GLM 5Z.ai40.6
- MiMo-V2.5Xiaomi38.0
View as table
| Model | Intelligence |
|---|---|
| GLM 5.2 (Z.ai) | 52.6 |
| V4 Flash 0731 (DeepSeek) | 51.8 |
| V4 Flash 0423 (DeepSeek) | 51.8 |
| MiniMax M3 (MiniMax) | 45.4 |
| V4 Pro (DeepSeek) | 45.3 |
| Kimi K2.6 (Moonshot AI) | 45.1 |
| Kimi K2.7 Code (Moonshot AI) | 43.0 |
| GLM 5.1 (Z.ai) | 41.0 |
| GLM 5 (Z.ai) | 40.6 |
| MiMo-V2.5 (Xiaomi) | 38.0 |
Fastest output
Median tokens per second
- GLM 4.7Z.ai502 t/s
- Gemma 4 31BGoogle232 t/s
- Qwen3.5-35B-A3BQwen203 t/s
- Qwen3.6 35B A3BQwen177 t/s
- V4 Flash 0731DeepSeek148 t/s
- GLM 5.2Z.ai142 t/s
- Kimi K2.7 CodeMoonshot AI140 t/s
- Nemotron 3 UltraNVIDIA133 t/s
- 116 t/s
- Mistral Small 4Mistral AI102 t/s
View as table
| Model | Tokens/s |
|---|---|
| GLM 4.7 (Z.ai) | 502 |
| Gemma 4 31B (Google) | 232 |
| Qwen3.5-35B-A3B (Qwen) | 203 |
| Qwen3.6 35B A3B (Qwen) | 177 |
| V4 Flash 0731 (DeepSeek) | 148 |
| GLM 5.2 (Z.ai) | 142 |
| Kimi K2.7 Code (Moonshot AI) | 140 |
| Nemotron 3 Ultra (NVIDIA) | 133 |
| Qwen3.5 397B A17B (Qwen) | 116 |
| Mistral Small 4 (Mistral AI) | 102 |
Full catalogue
All 31 models on Venice
Filter by creator
31 of 31 models| GLM 5.2 Z.aiopen | 52.6 | $0.23 |
| V4 Flash 0731 DeepSeekopen | 51.8 | $0.02 |
| V4 Flash 0423 DeepSeekopen | 51.8 | $0.02 |
| MiniMax M3 MiniMaxopen | 45.4 | $0.11 |
| V4 Pro DeepSeekopen | 45.3 | $0.09 |
| Kimi K2.6 Moonshot AIopen | 45.1 | $0.23 |
| Kimi K2.7 Code Moonshot AIopen | 43.0 | $0.32 |
| GLM 5.1 Z.aiopen | 41.0 | $0.29 |
| GLM 5 Z.aiopen | 40.6 | $0.25 |
| MiMo-V2.5 Xiaomiopen | 38.0 | $0.03 |
| Qwen3.6 27B Qwenopen | 37.7 | $0.32 |
| Kimi K2.5 Moonshot AIopen | 36.0 | $0.26 |
| M2.5 MiniMaxopen | 34.5 | $0.08 |
| GLM 4.7 Z.aiopen | 34.5 | $0.16 |
| Qwen3.5 397B A17B Qwenopen | 34.3 | $0.21 |
| Qwen3.6 35B A3B Qwenopen | 32.1 | $0.09 |
| Qwen3.5-35B-A3B Qwenopen | 29.9 | $0.09 |
| V3.2 DeepSeekopen | 25.1 | $0.05 |
| GLM 4.6 Z.aiopen | 23.4 | $0.18 |
| GLM 4.7 Flash Z.aiopen | 23.3 | $0.04 |
| Qwen3.5-9B Qwenopen | 21.8 | $0.02 |
| Qwen3 VL 235B A22B Instruct Qwenopen | 14.4 | $0.06 |
| Nemotron 3 Ultra NVIDIAopen | — | $0.32 |
| Gemma 4 26B A4B Googleopen | — | $0.03 |
| Gemma 4 31B Googleopen | — | $0.03 |
| Mistral Small 4 Mistral AIopen | — | $0.06 |
| Qwen3 235B A22B Thinking 2507 Qwenopen | — | $0.20 |
| Qwen3 Coder 480B A35B Qwenopen | — | $0.04 |
| Qwen3 235B A22B Instruct 2507 Qwenopen | — | $0.02 |
| Uncensored Cognitive Computationsopen | — | $0.03 |
| Mistral Small 3.2 24B Mistral AIopen | — | $0.01 |