Calculadora de Latencia, Throughput y TTFT de LLMs 2026 (Tokens/Seg)

Calcula el Time to First Token (TTFT), velocidad de generación (tokens/segundo) y tiempo de respuesta para APIs de IA (Groq, OpenAI, Anthropic, DeepSeek, vLLM). Simula concurrencia y latencia de usuario.

Parámetros de la Petición y Entorno de Red

Modelo de 70B a casi 300 t/s. Latencias sub-segundo con máxima capacidad de razonamiento.

Prefill: ~900 t/s

Contexto, instrucciones de sistema y documentos RAG.

Decode: ~280 t/s

Longitud de la respuesta generada (~263 palabras).

Tiempo de ida y vuelta física de paquetes HTTPS (TLS).

300 req/min

Simula la carga de usuarios simultáneos en tu aplicación.

Desglose Cronológico del Request (Pipeline de Inferencia)

1. Conexión de Red (TLS + RTT)+150 ms

Envío del payload HTTP desde el cliente hasta el datacenter del proveedor de IA.

2. Prefill & Procesamiento de Prompt+1079 ms

Cálculo de matrices de atención para los 800 tokens de contexto a ~900 t/s.

Time to First Token (TTFT - Primera palabra)1229 ms (1.23 s)
3. Generación Autoregresiva (Decode)+1.25 s

Emisión secuencial de 350 tokens a ~280 tokens/segundo.

Latencia End-to-EndStreaming Fluido e Instantáneo
2.479segundos

Tiempo total desde que el usuario hace clic hasta que termina de recibir el último token.

TTFT (1er Token)
1229 ms
Velocidad Decode
280 t/s
Percepción de Streaming Humano

Este modelo genera a 56x la velocidad a la que un humano promedio puede leer texto (~5 tokens/segundo o 250 palabras por minuto). La experiencia de streaming se siente instantánea y sin pausas perceptibles.

Throughput del Backend (5 RPS)
Consumo por Segundo
5,750 t/s
Throughput por Minuto
345k TPM

Benchmark Comparativo: Todos los Modelos Top 2026

Basado en 800 tokens input + 350 tokens output
Modelo / ProveedorTipoTTFTVelocidadLatencia TotalAcción
Groq (LPU) - Llama 3.1 8B
Groq
Ultra Rápido740 ms750 t/s
1.207 s
Groq (LPU) - Llama 3.3 70BACTIVO
Groq
Ultra Rápido1229 ms280 t/s
2.479 s
En uso
Google Gemini 2.0 Flash
Google
Ultra Rápido985 ms210 t/s
2.652 s
OpenAI GPT-4o-mini
OpenAI
Rápido1210 ms155 t/s
3.468 s
vLLM Self-Hosted (1x H100 80GB)
Local vLLM
Local957 ms125 t/s
3.757 s
Anthropic Claude 3.5 Haiku
Anthropic
Rápido1371 ms135 t/s
3.964 s
Together AI - DeepSeek-V3
Together AI
Rápido1527 ms140 t/s
4.027 s
OpenAI GPT-4o
OpenAI
Equilibrado1985 ms95 t/s
5.669 s
OpenAI o3-mini (Thinking)
OpenAI
Razonamiento Profundo3283 ms105 t/s
6.616 s
Anthropic Claude 3.5 Sonnet
Anthropic
Equilibrado2505 ms78 t/s
6.992 s
DeepSeek-V3 (API Oficial)
DeepSeek
Equilibrado2408 ms70 t/s
7.408 s
Google Gemini 1.5 Pro
Google
Equilibrado2528 ms65 t/s
7.913 s
DeepSeek-R1 (Thinking)
DeepSeek
Razonamiento Profundo4550 ms55 t/s
10.914 s

Preguntas Frecuentes

TTFT (Tiempo hasta el Primer Token) mide el lapso transcurrido desde que el usuario envía su solicitud hasta que la interfaz muestra la primera palabra generada. Incluye el retardo físico de red (RTT), el encolado en el proveedor y la fase de prefill (procesamiento paralelo del prompt). Un TTFT inferior a 500 ms genera la percepción de respuesta instantánea y reactiva, mientras que un TTFT superior a 2 segundos deteriora sensiblemente la experiencia de usuario.

Calculadoras y Herramientas Recomendadas

Herramientas afines del mismo clúster para complementar tus cálculos