Inference provider
Alibaba
49 models served. Speed, latency and price below are medians across this provider's catalogue, not per-endpoint measurements.
Models served
49
Median output speed
57 t/s
Median latency
560ms
Median price / 1M
$0.544
Catalogue
Strongest and fastest on this provider
What the catalogue looks like at the top end, on the two axes that usually decide the choice.
Highest Intelligence Index
Among models this provider serves
- Qwen3.8 MaxQwen58.1
- GLM 5.2Z.ai52.6
- V4 Flash 0423DeepSeek51.8
- Qwen3.7 MaxQwen46.7
- V4 ProDeepSeek45.3
- Kimi K2.7 CodeMoonshot AI43.0
- 41.1
- GLM 5.1Z.ai41.0
- Qwen3.6 PlusQwen40.5
- Qwen3.7 PlusQwen39.4
View as table
| Model | Intelligence |
|---|---|
| Qwen3.8 Max (Qwen) | 58.1 |
| GLM 5.2 (Z.ai) | 52.6 |
| V4 Flash 0423 (DeepSeek) | 51.8 |
| Qwen3.7 Max (Qwen) | 46.7 |
| V4 Pro (DeepSeek) | 45.3 |
| Kimi K2.7 Code (Moonshot AI) | 43.0 |
| Qwen3.6 Max Preview (Qwen) | 41.1 |
| GLM 5.1 (Z.ai) | 41.0 |
| Qwen3.6 Plus (Qwen) | 40.5 |
| Qwen3.7 Plus (Qwen) | 39.4 |
Fastest output
Median tokens per second
- Qwen3 32BQwen423 t/s
- 242 t/s
- Qwen3.5-35B-A3BQwen203 t/s
- 145 t/s
- GLM 5.2Z.ai142 t/s
- Kimi K2.7 CodeMoonshot AI140 t/s
- 138 t/s
- Qwen3 Coder NextQwen129 t/s
- 125 t/s
- 117 t/s
View as table
| Model | Tokens/s |
|---|---|
| Qwen3 32B (Qwen) | 423 |
| Qwen3 Next 80B A3B Thinking (Qwen) | 242 |
| Qwen3.5-35B-A3B (Qwen) | 203 |
| Qwen3.5-122B-A10B (Qwen) | 145 |
| GLM 5.2 (Z.ai) | 142 |
| Kimi K2.7 Code (Moonshot AI) | 140 |
| Qwen3 30B A3B Thinking 2507 (Qwen) | 138 |
| Qwen3 Coder Next (Qwen) | 129 |
| Qwen3 VL 8B Thinking (Qwen) | 125 |
| Qwen3 VL 30B A3B Thinking (Qwen) | 117 |
Full catalogue
All 49 models on Alibaba
Filter by creator
49 of 49 models