Sistema fora do ar: checklist dos primeiros 30 minutos
O sistema caiu e todo mundo está olhando para você. Um roteiro para os primeiros 30 minutos de um incidente — antes de saber o que aconteceu.
Por Equipe We Codex3 min de leitura
Incidentes acontecem com todo sistema. O que define o tamanho do estrago é a reação nos primeiros minutos: quem decide, quem comunica, o que se faz primeiro. Ter um roteiro antes evita improviso sob pressão.
Minutos 0 a 5: confirmar e organizar
- 1.Confirme o problema: é geral ou de um cliente? Afeta o quê?
- 2.Defina um responsável pela coordenação — uma pessoa só.
- 3.Abra um canal dedicado ao incidente.
Minutos 5 a 15: estancar
- 1.O que mudou recentemente? Deploys, configurações, integrações. A maioria dos incidentes tem uma mudança recente por trás.
- 2.Reverter primeiro, investigar depois: se houve deploy, voltar a versão anterior costuma ser o caminho mais rápido.
- 3.Proteger o essencial: desligar funcionalidades não críticas, ativar planos B (Degradação graciosa: funcionar pela metade é melhor que sair do ar, Feature flags: lançar sem medo e desligar sem deploy).
Minutos 15 a 30: comunicar
- 1.Avisar clientes de forma honesta: o que está acontecendo, o que já foi feito, quando haverá nova atualização.
- 2.Atualizar regularmente, mesmo sem novidades.
Depois
- Registro do que aconteceu, linha do tempo e causa.
- Ações para evitar que se repita — sem caça a culpados.
- Se houve dados pessoais envolvidos, avaliar a comunicação obrigatória (LGPD para desenvolvedores: o que muda no código).
O que ajuda antes do incidente
Monitoramento e alertas (Observabilidade para quem não é SRE: métricas, logs e traces), backups testados (Backup que nunca foi restaurado não é backup) e acesso às ferramentas por mais de uma pessoa.
A We Codex oferece suporte e preparo para incidentes. Veja Segurança Anti-Hacker ou fale com a gente.
- Incidentes
- Operação
- Resiliência
- Gestão
Resolver de vez, com quem faz isso todo dia
Quer saber quão exposto está o seu sistema hoje?
Este artigo mostra o caminho. A implementação sob medida — o detalhe que muda o resultado no seu caso — é o trabalho da We Codex, empresa de engenharia do grupo Wocom.
Continue lendo
Tudo sobre Segurança- Ler artigo
Segurança3 min
Backup que nunca foi restaurado não é backup
A empresa faz backup todos os dias. Ninguém nunca tentou restaurar. Quando precisar, vai descobrir se ele funciona. Veja como montar backups que salvam de verdade.
- Ler artigo
Segurança3 min
LGPD para desenvolvedores: o que muda no código
LGPD não é só um banner de cookies e um texto jurídico. Veja o que a lei muda na forma de construir sistemas — do formulário ao backup.
- Ler artigo
Backend & APIs3 min
Feature flags: lançar sem medo e desligar sem deploy
Lançar uma funcionalidade nova para todos de uma vez é arriscado. Com feature flags, você libera aos poucos, testa em produção e desliga sem novo deploy.