AI Latency Tracker
· 45 providers · 4 regions
As of July 28, 2026, the fastest-responding AI inference API by edge latency (time-to-first-byte) is fireworks at 19 ms p50, measured from Asia (Tokyo) (100% uptime, n=288). Rankings differ by region — see the table below.
Independent, provider-neutral latency and uptime of AI inference APIs (OpenAI, Anthropic, Google, Mistral, DeepSeek, xAI, OpenRouter and more), measured directly from multiple regions and updated automatically. How this is measured →
Which AI API is fastest right now?
| Region | Fastest AI API | p50 TTFB | Uptime |
|---|---|---|---|
| Asia (Tokyo) | fireworks | 19 ms | 100% |
| Europe (Germany) | nscale | 98 ms | 100% |
| South America (São Paulo) | openrouter | 58 ms | 100% |
| US (Central) | fireworks | 28 ms | 100% |
Which AI APIs are fastest overall?
Composite score 0–100 (100 = as fast as the region leader), averaged across all 4 measured region(s). How it’s computed →
| # | Provider | Speed Index |
|---|---|---|
| 1 | fireworks | 80 |
| 2 | openrouter | 71 |
| 3 | 57 | |
| 4 | meta-llama | 49 |
| 5 | baseten | 38 |
| 6 | sambanova | 37 |
| 7 | inference-net | 36 |
| 8 | cohere | 35 |
| 9 | mistral | 35 |
| 10 | nscale | 33 |
| 11 | cerebras | 33 |
| 12 | nebius | 32 |
| 13 | replicate | 31 |
| 14 | aleph-alpha | 31 |
| 15 | reka | 30 |
Full ranking — Europe (Germany)
Edge latency (time-to-first-byte), p50/p95, last 24h. Other regions: see the per-region pages below.
| # | Provider | p50 TTFB | p95 | Uptime | Samples |
|---|---|---|---|---|---|
| 1 | nscale | 98 ms | 202 ms | 100% | 290 |
| 2 | openrouter | 99 ms | 297 ms | 100% | 290 |
| 3 | fireworks | 100 ms | 301 ms | 100% | 290 |
| 4 | aleph-alpha | 100 ms | 204 ms | 100% | 290 |
| 5 | nebius | 100 ms | 235 ms | 100% | 290 |
| 6 | mistral | 100 ms | 298 ms | 100% | 290 |
| 7 | 101 ms | 300 ms | 100% | 290 | |
| 8 | reka | 101 ms | 299 ms | 100% | 290 |
| 9 | meta-llama | 102 ms | 302 ms | 100% | 290 |
| 10 | inference-net | 102 ms | 704 ms | 100% | 290 |
| 11 | baichuan | 182 ms | 639 ms | 100% | 290 |
| 12 | baseten | 197 ms | 299 ms | 100% | 290 |
| 13 | perplexity | 199 ms | 303 ms | 100% | 290 |
| 14 | replicate | 200 ms | 403 ms | 100% | 290 |
| 15 | cohere | 200 ms | 303 ms | 100% | 290 |
How fast is each region?
- Fastest AI API from Asia (Tokyo)
- Fastest AI API from Europe (Germany)
- Fastest AI API from South America (São Paulo)
- Fastest AI API from US (Central)
How fast is a specific provider?
- ai21 latency by region
- aleph-alpha latency by region
- anthropic latency by region
- baichuan latency by region
- baseten latency by region
- cerebras latency by region
- cohere latency by region
- deepinfra latency by region
- deepseek latency by region
- doubao latency by region
- ernie latency by region
- featherless latency by region
- fireworks latency by region
- friendli latency by region
- glm latency by region
- google latency by region
- groq latency by region
- hunyuan latency by region
- hyperbolic latency by region
- iflytek latency by region
- inference-net latency by region
- kimi latency by region
- meta-llama latency by region
- minimax latency by region
- mistral latency by region
- nebius latency by region
- novita latency by region
- nscale latency by region
- openai latency by region
- openrouter latency by region
- perplexity latency by region
- qwen latency by region
- reka latency by region
- replicate latency by region
- sambanova latency by region
- sarvam latency by region
- sensenova latency by region
- siliconflow latency by region
- stepfun latency by region
- targon latency by region
- together latency by region
- upstage latency by region
- writer latency by region
- xai latency by region
- yi-01ai latency by region