Velocidad, medida y publicada
No decimos que somos rápidos: lo medimos cada hora, contra nuestro propio proxy y contra el proveedor directamente, y publicamos las dos cifras. La diferencia entre ambas es lo que cuesta pasar por nosotros.
Última medición: 18 ago 2026, 13:51
Últimas 24 horas
| Modelo | Primer token (p50 / p95) | Tokens por segundo (p50) | Lo que añadimos |
|---|---|---|---|
| deepseek-flash | — / — ms por nuestra API 5567 / 11462 ms directo al proveedor | — | — |
| gpt-oss-120b | — / — ms por nuestra API 1368 / 1516 ms directo al proveedor | — | — |
| llama-3.3-70b | — / — ms por nuestra API 203 / 208 ms directo al proveedor | — | — |
| mistral-small | — / — ms por nuestra API 193 / 338 ms directo al proveedor | — | — |
| qwen3-235b | — / — ms por nuestra API 204 / 204 ms directo al proveedor | — | — |
Últimos 30 días
| Modelo | Primer token (p50 / p95) | Tokens por segundo (p50) | Lo que añadimos |
|---|---|---|---|
| deepseek-flash | — / — ms por nuestra API 5567 / 11462 ms directo al proveedor | — | — |
| gpt-oss-120b | — / — ms por nuestra API 1368 / 1516 ms directo al proveedor | — | — |
| llama-3.3-70b | — / — ms por nuestra API 203 / 208 ms directo al proveedor | — | — |
| mistral-small | — / — ms por nuestra API 193 / 338 ms directo al proveedor | — | — |
| qwen3-235b | — / — ms por nuestra API 204 / 204 ms directo al proveedor | — | — |
Metodología
Cada hora lanzamos 3 peticiones por modelo, con el mismo prompt de unos 800 tokens de entrada y un máximo de 600 de salida, a temperatura 0.7 para que ninguna respuesta salga de la caché. El tiempo hasta el primer token se mide en el primer fragmento que trae texto, no en el primer byte. Las mismas peticiones se repiten contra el proveedor directamente, desde la misma región.
El código de la sonda está en el repositorio: core/app/bench/probe.py