postmortem
16 conteúdos publicados sobre este assunto.
Architecture Studies· 16
Post-mortemAWS us-east-1 (2025): Evento Térmico em Datacenter Derruba EC2 e EBSUma falha no sistema de refrigeração de um datacenter em us-east-1 causou superaquecimento de servidores, acionando desligamentos de proteção térmica que degradaram EC2 e EBS na região. O incidente reacende debates críticos sobre concentração de workloads em us-east-1, o papel do isolamento físico por AZ e a necessidade de graceful degradation em arquiteturas de produção.Abrir Post-mortemCoinbase (2026): o control plane do AWS MSK que travou o tradingEm 7 de maio de 2026, um defeito no control plane do Amazon MSK impediu a reeleição automática de líderes de partição em dois clusters Kafka gerenciados da Coinbase, bloqueando silenciosamente os serviços de fee, quoting e execução de trades por horas. O incidente expõe os riscos ocultos de depender de serviços gerenciados como ponto único de coordenação — e a necessidade crítica de observabilidade profunda em infraestrutura que você não opera.Abrir Post-mortemDENIC .de (2026): Assinaturas DNSSEC Quebradas e o Colapso da Cadeia de ConfiançaEm 5 de maio de 2026, a DENIC publicou assinaturas DNSSEC inválidas para o TLD .de, tornando milhões de domínios alemães inacessíveis para resolvers com validação DNSSEC habilitada. O incidente expôs fragilidades estruturais na gestão de chaves, na ausência de validação canary antes da publicação de zonas assinadas e no trade-off fundamental entre segurança criptográfica e disponibilidade operacional.Abrir Post-mortemCloudflare (2026): quando uma dependência single-AZ derruba um cluster 'HA'Em 20 de fevereiro de 2026, a Cloudflare sofreu um outage no plano de controle e em analytics porque Kafka e ClickHouse — serviços críticos de ingestão e consulta de dados — existiam apenas na zona PDX-04, enquanto o cluster declarado como de alta disponibilidade dependia deles de forma implícita. O incidente expõe um padrão recorrente em sistemas distribuídos: a ilusão de HA criada por redundância parcial que não cobre todas as dependências da cadeia.Abrir Post-mortemOpenAI (2024): como um novo serviço de telemetria derrubou o control plane do KubernetesEm dezembro de 2024, a OpenAI implantou um novo agente de telemetria em toda a sua frota Kubernetes simultaneamente. A sobrecarga resultante nos API servers cascateou para uma indisponibilidade global do ChatGPT, da API e do Sora por várias horas — e o próprio control plane saturado impediu o rollback. Uma análise de como a separação entre control plane e data plane, rollouts graduais e desacoplamento de observabilidade não eram opcionais.Abrir Post-mortemCrowdStrike (2024): o content update que derrubou 8,5 milhões de máquinas WindowsEm 19 de julho de 2024, uma atualização de conteúdo do sensor Falcon da CrowdStrike causou leitura fora dos limites em um driver de kernel Windows, provocando BSOD em escala global e paralisando infraestruturas críticas em aviação, saúde e finanças. A ausência de rollout progressivo para atualizações de conteúdo e uma falha no validador interno foram os vetores centrais do incidente. Este post-mortem examina a cadeia de falhas, o blast radius real e as lições arquiteturais que todo engenheiro que opera software em kernel-space deve internalizar.Abrir Post-mortemGoogle Cloud × UniSuper (2024): Quando uma Configuração Apagou uma Subscrição InteiraEm maio de 2024, uma configuração equivocada durante o provisionamento de um ambiente VMware privado na Google Cloud resultou na exclusão completa da subscrição da UniSuper em duas regiões. A recuperação só foi possível porque a UniSuper mantinha backups em um provedor de nuvem separado — uma decisão que salvou dados de 500 mil membros. O incidente expõe falhas sistêmicas em salvaguardas de exclusão, blast radius de automação e a falácia de assumir resiliência dentro de um único provedor.Abrir Post-mortemDatadog (2023): como um patch de segurança do systemd derrubou 5 regiões simultaneamenteEm março de 2023, uma atualização automática de segurança do systemd-networkd reiniciou o subsistema de rede em dezenas de milhares de nós Kubernetes do Datadog ao mesmo tempo, cortando a conectividade gerenciada pelo Cilium em múltiplas regiões. O incidente expôs os riscos de auto-updates de SO sem controle de blast radius, a dependência crítica de CNI plugins no plano de dados e a ausência de isolamento regional em pipelines de atualização.Abrir Post-mortemAtlassian 2022: quando um script de manutenção apaga 400 clientes por duas semanasEm abril de 2022, um script de manutenção mal parametrizado executou hard deletes em ~400 sites de clientes Atlassian Cloud, incluindo Jira, Confluence e outros produtos. A ausência de soft-delete, a falta de dry-run obrigatório e a inexistência de ferramentas de restauração em massa transformaram um erro operacional de minutos em uma indisponibilidade de até 14 dias. Este post-mortem examina a cadeia de falhas, o blast radius real e as lições estruturais que todo time de plataforma deveria internalizar.Abrir Post-mortemRoblox 2021: 73 Horas de Indisponibilidade, Consul e o Efeito de CargaEm outubro de 2021, o Roblox ficou indisponível por 73 horas consecutivas — o maior outage da história da plataforma. A causa raiz foi uma combinação de contenção no BoltDB (backend do Consul) amplificada por um novo recurso de streaming de telemetria ativado durante um período de tráfego elevado. Este post-mortem reconstrói a cadeia de falhas, analisa as decisões de infraestrutura envolvidas e extrai lições aplicáveis a qualquer plataforma que dependa de service mesh e coordenação distribuída.Abrir Post-mortemMeta 2021: Como um Comando de Manutenção Derrubou o Facebook por 6 HorasEm 4 de outubro de 2021, um comando de manutenção mal executado retirou todas as rotas BGP do backbone da Meta, tornando os servidores DNS autoritativos inalcançáveis pela internet. O efeito cascata derrubou Facebook, Instagram, WhatsApp e Oculus simultaneamente por aproximadamente seis horas, afetando bilhões de usuários e expondo fragilidades críticas em sistemas de controle de acesso e recuperação de emergência.Abrir Post-mortemAWS Kinesis us-east-1 (2020): Quando um Limite de Threads do SO Derrubou Metade da AWSEm novembro de 2020, uma expansão de capacidade no front-end do Amazon Kinesis esgotou o limite de threads por processo do sistema operacional, causando falhas em cascata que afetaram Cognito, CloudWatch, Lambda, ECS e dezenas de outros serviços na região us-east-1 por mais de oito horas. O incidente expôs dependências ocultas entre serviços AWS e os riscos de mudanças operacionais aparentemente seguras em sistemas de larga escala.Abrir Post-mortemCloudflare 2019: O Regex que Derrubou uma Rede GlobalEm 2 de julho de 2019, uma única regra de WAF contendo um regex com backtracking catastrófico saturou 100% da CPU em todos os servidores da Cloudflare globalmente, derrubando serviços por aproximadamente 27 minutos. O incidente expôs falhas críticas no processo de deploy de regras, na ausência de proteção contra complexidade algorítmica e na insuficiência do pipeline de testes para detectar padrões patológicos.Abrir Post-mortemGitHub 2018: 43 Segundos de Partição, 24 Horas de Split-Brain no MySQLEm 21 de outubro de 2018, uma janela de manutenção de rede de 43 segundos desencadeou uma cascata de falhas que manteve o GitHub degradado por quase 24 horas. O Orchestrator promoveu réplicas em regiões erradas, criando um split-brain entre datacenters — e revelando como automação de failover sem fencing adequado pode transformar uma microfalha em uma catástrofe de consistência de dados.Abrir Post-mortemAWS S3 us-east-1 (2017): quando um typo derruba a internetEm 28 de fevereiro de 2017, um engenheiro da AWS executou um comando de debug com um parâmetro incorreto e removeu uma quantidade muito maior de servidores do subsistema de indexação do S3 do que o pretendido. O resultado foi quatro horas de degradação severa em us-east-1 que afetou centenas de serviços dependentes — de ferramentas de monitoramento a grandes plataformas SaaS. O incidente expôs fragilidades estruturais em torno de dependências implícitas, ausência de rate limiting em operações destrutivas e a falácia de assumir que uma única região AWS seria suficientemente resiliente.Abrir Post-mortemKnight Capital (2012): US$440M em 45 minutos por um deploy parcialEm 1º de agosto de 2012, a Knight Capital perdeu US$440 milhões em menos de uma hora devido a um deploy parcial que deixou código legado ativo em um dos oito servidores de trading. Uma flag de configuração reutilizada ativou uma função obsoleta que disparou milhões de ordens não intencionais no mercado americano. O incidente é um caso clássico de como falhas de processo em deploy e ausência de mecanismos de kill-switch podem destruir uma empresa em minutos.Abrir