Contexto

LogTech em escala, operação 24/7 para 200+ transportadoras, ~15 mil rastreamentos por minuto. Cada deploy era uma cerimônia de 4 horas: runbook, staging, smoke manual, produção e meia hora de observação.

Com 3 SREs, 60% do tempo ia para deploy e firefighting. Incidentes noturnos acordavam o time ~3x por mês. Cada hora fora custava R$ 85k em SLA.

Solução

Três agentes na esteira de deploy e operação:

  1. Guardião de deploy — release gradual com checagem de error rate e latência. Se algo degrada nos primeiros minutos, faz rollback antes do impacto no cliente.
  2. Resolvedor de incidentes — lê alertas, correlaciona logs e traces, aplica o runbook. Escala para humano só quando a confiança na correção é baixa.
  3. Mantenedor de runbooks — atualiza procedimentos quando a infra muda.

Resultado

MTTR: 3,5h → 4 min. Uptime: 99,2% → 99,97%. Deploys: 3/semana manuais → 12/semana com automação. SREs voltaram a trabalhar em arquitetura — e a dormir à noite.

Cobrança: base mensal + bônus pela redução comprovada do MTTR.