Skip to content
llmwaves

Inference provider

Phala

17 models served. Speed, latency and price below are medians across this provider's catalogue, not per-endpoint measurements.

Models served

17

Median output speed

89 t/s

Median latency

414ms

Median price / 1M

$0.355

Catalogue

Strongest and fastest on this provider

What the catalogue looks like at the top end, on the two axes that usually decide the choice.

Highest Intelligence Index

Among models this provider serves

View as table
ModelIntelligence
GLM 5.2 (Z.ai)52.6
V4 Flash 0731 (DeepSeek)51.8
V4 Flash 0423 (DeepSeek)51.8
Kimi K2.6 (Moonshot AI)45.1
GLM 5.1 (Z.ai)41.0
GLM 5 (Z.ai)40.6
Qwen3.6 27B (Qwen)37.7
Kimi K2.5 (Moonshot AI)36.0
Qwen3.5-27B (Qwen)34.6
Qwen3.5 397B A17B (Qwen)34.3

Fastest output

Median tokens per second

View as table
ModelTokens/s
gpt-oss-120b (OpenAI)773
gpt-oss-20b (OpenAI)252
Gemma 4 31B (Google)232
Qwen3.6 35B A3B (Qwen)177
V4 Flash 0731 (DeepSeek)148
GLM 5.2 (Z.ai)142
Qwen3.5 397B A17B (Qwen)116
V3.2 (DeepSeek)100
Kimi K2.6 (Moonshot AI)89
V4 Flash 0423 (DeepSeek)87

Full catalogue

All 17 models on Phala

Filter by creator
17 of 17 models
GLM 5.2
Z.aiopen
52.6$0.23
V4 Flash 0731
DeepSeekopen
51.8$0.02
V4 Flash 0423
DeepSeekopen
51.8$0.02
Kimi K2.6
Moonshot AIopen
45.1$0.23
GLM 5.1
Z.aiopen
41.0$0.29
GLM 5
Z.aiopen
40.6$0.25
Qwen3.6 27B
Qwenopen
37.7$0.32
Kimi K2.5
Moonshot AIopen
36.0$0.26
Qwen3.5-27B
Qwenopen
34.6$0.13
Qwen3.5 397B A17B
Qwenopen
34.3$0.21
Qwen3.6 35B A3B
Qwenopen
32.1$0.09
V3.2
DeepSeekopen
25.1$0.05
gpt-oss-120b
OpenAIopen
24.1$0.02
gpt-oss-20b
OpenAIopen
15.2$0.01
Gemma 4 31B
Googleopen
$0.03
Gemma 3 27B
Googleopen
$0.02
Qwen2.5 7B Instruct
Qwenopen
$0.01