Velocidad, medida y publicada

No decimos que somos rápidos: lo medimos cada hora, contra nuestro propio proxy y contra el proveedor directamente, y publicamos las dos cifras. La diferencia entre ambas es lo que cuesta pasar por nosotros.

Última medición: 18 ago 2026, 13:51

Últimas 24 horas

ModeloPrimer token (p50 / p95)Tokens por segundo (p50)Lo que añadimos
deepseek-flash
/ ms por nuestra API
5567 / 11462 ms directo al proveedor
gpt-oss-120b
/ ms por nuestra API
1368 / 1516 ms directo al proveedor
llama-3.3-70b
/ ms por nuestra API
203 / 208 ms directo al proveedor
mistral-small
/ ms por nuestra API
193 / 338 ms directo al proveedor
qwen3-235b
/ ms por nuestra API
204 / 204 ms directo al proveedor

Últimos 30 días

ModeloPrimer token (p50 / p95)Tokens por segundo (p50)Lo que añadimos
deepseek-flash
/ ms por nuestra API
5567 / 11462 ms directo al proveedor
gpt-oss-120b
/ ms por nuestra API
1368 / 1516 ms directo al proveedor
llama-3.3-70b
/ ms por nuestra API
203 / 208 ms directo al proveedor
mistral-small
/ ms por nuestra API
193 / 338 ms directo al proveedor
qwen3-235b
/ ms por nuestra API
204 / 204 ms directo al proveedor

Metodología

Cada hora lanzamos 3 peticiones por modelo, con el mismo prompt de unos 800 tokens de entrada y un máximo de 600 de salida, a temperatura 0.7 para que ninguna respuesta salga de la caché. El tiempo hasta el primer token se mide en el primer fragmento que trae texto, no en el primer byte. Las mismas peticiones se repiten contra el proveedor directamente, desde la misma región.

El código de la sonda está en el repositorio: core/app/bench/probe.py