Realidad de los SLAs
Lo que cada SLA de uptime realmente permite
Y el costo real en dólares que representa con $50K de MRR y 2% de impacto de churn.
| SLA de Uptime | Downtime anual permitido | Costo anual típico (estimado) |
|---|---|---|
| 99% | 3d 15h 39m | $50,000+ |
| 99.5% | 1d 19h 49m | $25,000+ |
| 99.9% | 8h 45m 36s | $5,000+ |
| 99.95% | 4h 22m 48s | $2,500+ |
| 99.99% | 52m 33s | $500+ |
| 99.999% | 5m 15s | $50+ |
El Problema de Detección
Cómo se enteran los equipos de las caídas
Detectar más rápido es la forma más barata de reducir el costo de una caída. Cada minuto cuenta.
1. Tickets de soporte
Tiempo promedio de detección: 30-90 minutos. Para cuando llega el primer ticket, ya perdiste docenas de conversiones y tenés usuarios enojados.
2. Menciones en Twitter
Tiempo promedio de detección: 60-120 minutos. Tu VP de Marketing screenshotea un tweet y lo manda a ingeniería. Mal día para todos.
3. Monitoreo en tiempo real
Tiempo promedio de detección: menos de 60 segundos. Una notificación automática le llega a tu equipo apenas sube la tasa de errores. Lo arreglás antes que los usuarios lo noten.
FAQ
Preguntas frecuentes
¿Cuánto cuesta realmente una caída de API?
Depende del modelo de negocio, pero el promedio de Gartner cruzando industrias es $5,600 por minuto de downtime. Para SaaS específicamente, el costo tiene dos partes: pérdida directa de ingresos prorrateada del MRR, e impacto de churn de clientes que cancelan tras un incidente visible. Usá la calculadora para estimar tu número específico.
¿Qué porcentaje de churn es realista por una caída?
Para la mayoría del SaaS B2B, una sola caída visible causa 1-3% de churn de los clientes afectados. Para APIs de pagos, checkouts de e-commerce o infraestructura crítica puede llegar a 5-10%. Cuanto más larga la caída y más clientes afecta, más alta la tasa.
¿Cómo detecto las caídas más rápido?
Usá una herramienta de monitoreo que combine checks de uptime externos (pings desde fuera de tu infra) con monitoreo de ejecución interna (métricas desde dentro de tu servidor). Los pings externos atrapan caídas de DNS, CDN y de plataforma. El monitoreo interno atrapa queries lentas y fallas silenciosas. Mandá las notificaciones al canal que tu equipo de guardia realmente mira (Slack, email, SMS o una herramienta de paging) para que un salto en la tasa de errores llegue a una persona en minutos.
¿Cómo reduzco el costo de las caídas de API?
Tres formas: (1) detectar fallas más rápido, cada minuto ahorrado reduce tanto pérdida directa como impacto de churn, (2) comunicar proactivamente con los clientes durante incidentes, lo que reduce drásticamente el churn vs fallas silenciosas, (3) invertir en redundancia para paths críticos como checkout y autenticación.