Speech / Image / Video
Models that do more than text
Multimodality is claimed far more often than it is shipped. This page counts only what the model actually accepts and emits.
Image in
169
Audio in
22
Video in
46
Image out
9
Audio out
4
Coverage
Who ships which modality
Number of models per creator carrying each capability. The pattern is lopsided: image input is near-universal, everything else is not.
Multimodal coverage by creator
Model count per capability · darker means more models
| Creator | Image in | Audio in | Video in | Image out | Audio out |
|---|---|---|---|---|---|
| 28 | 13 | 16 | 6 | 2 | |
| OpenAI | 46 | 2 | 0 | 3 | 2 |
| Qwen | 23 | 0 | 14 | 0 | 0 |
| Anthropic | 17 | 0 | 0 | 0 | 0 |
| Mistral AI | 10 | 1 | 0 | 0 | 0 |
| ByteDance Seed | 4 | 0 | 4 | 0 | 0 |
| Meta | 2 | 2 | 2 | 0 | 0 |
| NVIDIA | 3 | 1 | 2 | 0 | 0 |
| xAI | 5 | 0 | 0 | 0 | 0 |
| Z.ai | 3 | 0 | 2 | 0 | 0 |
| Amazon | 4 | 0 | 1 | 0 | 0 |
| Moonshot AI | 4 | 0 | 0 | 0 | 0 |
| Thinking Machines | 2 | 2 | 0 | 0 | 0 |
| Perplexity | 4 | 0 | 0 | 0 | 0 |
Counts exclude batch-pricing duplicates. A creator absent from this grid ships text-only models.
View as table
| Creator | Image in | Audio in | Video in | Image out | Audio out |
|---|---|---|---|---|---|
| 28 | 13 | 16 | 6 | 2 | |
| OpenAI | 46 | 2 | 0 | 3 | 2 |
| Qwen | 23 | 0 | 14 | 0 | 0 |
| Anthropic | 17 | 0 | 0 | 0 | 0 |
| Mistral AI | 10 | 1 | 0 | 0 | 0 |
| ByteDance Seed | 4 | 0 | 4 | 0 | 0 |
| Meta | 2 | 2 | 2 | 0 | 0 |
| NVIDIA | 3 | 1 | 2 | 0 | 0 |
| xAI | 5 | 0 | 0 | 0 | 0 |
| Z.ai | 3 | 0 | 2 | 0 | 0 |
| Amazon | 4 | 0 | 1 | 0 | 0 |
| Moonshot AI | 4 | 0 | 0 | 0 | 0 |
| Thinking Machines | 2 | 2 | 0 | 0 | 0 |
| Perplexity | 4 | 0 | 0 | 0 | 0 |
By capability
Best in each modality
Ranked by Intelligence Index within each capability, so you are comparing what a model can do with how well it thinks.
Image input
Intelligence Index among vision-capable models
- Claude Opus 5Anthropic63.1
- Claude Fable 5Anthropic62.1
- GPT-5.6 SolOpenAI60.9
- Kimi K3Moonshot AI59.7
- Qwen3.8 MaxQwen58.1
- Claude Opus 4.8Anthropic57.3
- Muse Spark 1.2Meta56.8
- GPT-5.6 TerraOpenAI56.6
- GPT-5.5OpenAI56.3
- Grok 4.5xAI55.8
View as table
| Model | Intelligence |
|---|---|
| Claude Opus 5 (Anthropic) | 63.1 |
| Claude Fable 5 (Anthropic) | 62.1 |
| GPT-5.6 Sol (OpenAI) | 60.9 |
| Kimi K3 (Moonshot AI) | 59.7 |
| Qwen3.8 Max (Qwen) | 58.1 |
| Claude Opus 4.8 (Anthropic) | 57.3 |
| Muse Spark 1.2 (Meta) | 56.8 |
| GPT-5.6 Terra (OpenAI) | 56.6 |
| GPT-5.5 (OpenAI) | 56.3 |
| Grok 4.5 (xAI) | 55.8 |
Audio input
Intelligence Index among models that hear
- Muse Spark 1.2Meta56.8
- Muse Spark 1.1Meta53.2
- Gemini 3.5 FlashGoogle52.0
- Gemini 3.6 FlashGoogle51.6
- Gemini 3.1 Pro PreviewGoogle47.7
- InklingThinking Machines42.3
- Inkling SmallThinking Machines41.2
- MiMo-V2.5Xiaomi38.0
- Gemini 3.5 Flash LiteGoogle37.4
- Gemini 2.5 ProGoogle25.9
View as table
| Model | Intelligence |
|---|---|
| Muse Spark 1.2 (Meta) | 56.8 |
| Muse Spark 1.1 (Meta) | 53.2 |
| Gemini 3.5 Flash (Google) | 52.0 |
| Gemini 3.6 Flash (Google) | 51.6 |
| Gemini 3.1 Pro Preview (Google) | 47.7 |
| Inkling (Thinking Machines) | 42.3 |
| Inkling Small (Thinking Machines) | 41.2 |
| MiMo-V2.5 (Xiaomi) | 38.0 |
| Gemini 3.5 Flash Lite (Google) | 37.4 |
| Gemini 2.5 Pro (Google) | 25.9 |
Video input
Intelligence Index among models that read video
- Qwen3.8 MaxQwen58.1
- Muse Spark 1.2Meta56.8
- Muse Spark 1.1Meta53.2
- Gemini 3.5 FlashGoogle52.0
- Gemini 3.6 FlashGoogle51.6
- Gemini 3.1 Pro PreviewGoogle47.7
- MiniMax M3MiniMax45.4
- Qwen3.6 PlusQwen40.5
- MiMo-V2.5Xiaomi38.0
- Qwen3.6 27BQwen37.7
Video input remains the rarest capability in the index.
View as table
| Model | Intelligence |
|---|---|
| Qwen3.8 Max (Qwen) | 58.1 |
| Muse Spark 1.2 (Meta) | 56.8 |
| Muse Spark 1.1 (Meta) | 53.2 |
| Gemini 3.5 Flash (Google) | 52.0 |
| Gemini 3.6 Flash (Google) | 51.6 |
| Gemini 3.1 Pro Preview (Google) | 47.7 |
| MiniMax M3 (MiniMax) | 45.4 |
| Qwen3.6 Plus (Qwen) | 40.5 |
| MiMo-V2.5 (Xiaomi) | 38.0 |
| Qwen3.6 27B (Qwen) | 37.7 |
Image output
Models that generate images, by blended price
- $0.563
- $0.85
- $1.13
- $1.13
- GPT-5 Image MiniOpenAI$2.38
- $4.5
- $4.5
- GPT-5.4 Image 2OpenAI$9.75
- GPT-5 ImageOpenAI$10
Image-generating models are not scored on the text Intelligence Index, so they are ranked on price instead.
View as table
| Model | Blended / 1M |
|---|---|
| Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) (Google) | $0.563 |
| Nano Banana 2 (Gemini 3.1 Flash Image) (Google) | $1.13 |
| Nano Banana Pro (Gemini 3 Pro Image) (Google) | $4.5 |
| GPT-5.4 Image 2 (OpenAI) | $9.75 |
| Nano Banana 2 (Gemini 3.1 Flash Image Preview) (Google) | $1.13 |
| Nano Banana Pro (Gemini 3 Pro Image Preview) (Google) | $4.5 |
| GPT-5 Image Mini (OpenAI) | $2.38 |
| GPT-5 Image (OpenAI) | $10 |
| Nano Banana (Gemini 2.5 Flash Image) (Google) | $0.85 |
Full list
172 multimodal models
Filter by the exact modality you need — the capability chips stack, so 'vision + audio in' is one click each.
| Claude Opus 5 Anthropic | 63.1 | $2.25 |
| Claude Fable 5 Anthropic | 62.1 | $4.50 |
| GPT-5.6 Sol OpenAI | 60.9 | $2.65 |
| Kimi K3 Moonshot AIopen | 59.7 | $1.35 |
| Qwen3.8 Max Qwen | 58.1 | $0.58 |
| Claude Opus 4.8 Anthropic | 57.3 | $2.25 |
| Muse Spark 1.2 Meta | 56.8 | $0.40 |
| GPT-5.6 Terra OpenAI | 56.6 | $0.53 |
| GPT-5.5 OpenAI | 56.3 | $2.65 |
| Grok 4.5 xAI | 55.8 | $0.58 |
| Claude Sonnet 5 Anthropic | 55.3 | $0.90 |
| Claude Opus 4.7 Anthropic | 55.0 | $2.25 |
| Muse Spark 1.1 Meta | 53.2 | $0.40 |
| GPT-5.4 OpenAI | 53.1 | $1.32 |
| GPT-5.6 Luna OpenAI | 52.3 | $0.05 |
| Gemini 3.5 Flash Google | 52.0 | $0.79 |
| Gemini 3.6 Flash Google | 51.6 | $0.68 |
| Gemini 3.1 Pro Preview Google | 47.7 | $1.06 |
| GPT-5.3-Codex OpenAI | 45.5 | $1.21 |
| MiniMax M3 MiniMaxopen | 45.4 | $0.11 |
| Kimi K2.6 Moonshot AIopen | 45.1 | $0.23 |
| GPT-5.2 OpenAI | 43.3 | $1.21 |
| Kimi K2.7 Code Moonshot AIopen | 43.0 | $0.32 |
| Inkling Thinking Machinesopen | 42.3 | $0.37 |
| Nex-N2-Pro Nex AGIopen | 41.7 | $0.09 |
| Inkling Small Thinking Machinesopen | 41.2 | $0.12 |
| GPT-5.2-Codex OpenAI | 41.2 | $1.21 |
| GPT-5.4 Mini OpenAI | 40.9 | $0.40 |
| Qwen3.6 Plus Qwen | 40.5 | $0.17 |
| GPT-5.4 Nano OpenAI | 39.7 | $0.11 |
| Qwen3.7 Plus Qwen | 39.4 | $0.12 |
| Claude Opus 4.6 Anthropic | 38.8 | $2.25 |
| MiMo-V2.5 Xiaomiopen | 38.0 | $0.03 |
| Grok 4.20 xAI | 38.0 | $0.26 |
| Grok 4.3 xAI | 37.9 | $0.26 |
| Qwen3.6 27B Qwenopen | 37.7 | $0.32 |
| GPT-5.1 OpenAI | 37.5 | $0.86 |
| Gemini 3.5 Flash Lite Google | 37.4 | $0.22 |
| Claude Sonnet 4.6 Anthropic | 36.8 | $1.35 |
| Kimi K2.5 Moonshot AIopen | 36.0 | $0.26 |