resiliência
12 conteúdos publicados sobre este assunto.
Architecture Studies· 11
Post-mortemAWS us-east-1 (2025): Evento Térmico em Datacenter Derruba EC2 e EBSUma falha no sistema de refrigeração de um datacenter em us-east-1 causou superaquecimento de servidores, acionando desligamentos de proteção térmica que degradaram EC2 e EBS na região. O incidente reacende debates críticos sobre concentração de workloads em us-east-1, o papel do isolamento físico por AZ e a necessidade de graceful degradation em arquiteturas de produção.Abrir Post-mortemAzure (2026): Sobrecarga de Workloads GenAI e o Blast Radius CompartilhadoEm 29 de maio de 2026, a Microsoft Azure sofreu um incidente de disponibilidade ligado à saturação de infraestrutura de roteamento compartilhada por workloads de IA generativa de primeira-parte. O evento expôs o risco clássico de noisy neighbor em escala de nuvem hiper-escalável e levou a Microsoft a migrar cargas GenAI próprias para planos de roteamento dedicados. Esta análise reconstrói o incidente, avalia as decisões de arquitetura envolvidas e extrai lições aplicáveis a qualquer plataforma que hospede inferência de LLM em infraestrutura multi-tenant.Abrir Post-mortemCloudflare (2026): quando uma dependência single-AZ derruba um cluster 'HA'Em 20 de fevereiro de 2026, a Cloudflare sofreu um outage no plano de controle e em analytics porque Kafka e ClickHouse — serviços críticos de ingestão e consulta de dados — existiam apenas na zona PDX-04, enquanto o cluster declarado como de alta disponibilidade dependia deles de forma implícita. O incidente expõe um padrão recorrente em sistemas distribuídos: a ilusão de HA criada por redundância parcial que não cobre todas as dependências da cadeia.Abrir Post-mortemOpenAI (2024): como um novo serviço de telemetria derrubou o control plane do KubernetesEm dezembro de 2024, a OpenAI implantou um novo agente de telemetria em toda a sua frota Kubernetes simultaneamente. A sobrecarga resultante nos API servers cascateou para uma indisponibilidade global do ChatGPT, da API e do Sora por várias horas — e o próprio control plane saturado impediu o rollback. Uma análise de como a separação entre control plane e data plane, rollouts graduais e desacoplamento de observabilidade não eram opcionais.Abrir Post-mortemCrowdStrike (2024): o content update que derrubou 8,5 milhões de máquinas WindowsEm 19 de julho de 2024, uma atualização de conteúdo do sensor Falcon da CrowdStrike causou leitura fora dos limites em um driver de kernel Windows, provocando BSOD em escala global e paralisando infraestruturas críticas em aviação, saúde e finanças. A ausência de rollout progressivo para atualizações de conteúdo e uma falha no validador interno foram os vetores centrais do incidente. Este post-mortem examina a cadeia de falhas, o blast radius real e as lições arquiteturais que todo engenheiro que opera software em kernel-space deve internalizar.Abrir Post-mortemGoogle Cloud × UniSuper (2024): Quando uma Configuração Apagou uma Subscrição InteiraEm maio de 2024, uma configuração equivocada durante o provisionamento de um ambiente VMware privado na Google Cloud resultou na exclusão completa da subscrição da UniSuper em duas regiões. A recuperação só foi possível porque a UniSuper mantinha backups em um provedor de nuvem separado — uma decisão que salvou dados de 500 mil membros. O incidente expõe falhas sistêmicas em salvaguardas de exclusão, blast radius de automação e a falácia de assumir resiliência dentro de um único provedor.Abrir Post-mortemRoblox 2021: 73 Horas de Indisponibilidade, Consul e o Efeito de CargaEm outubro de 2021, o Roblox ficou indisponível por 73 horas consecutivas — o maior outage da história da plataforma. A causa raiz foi uma combinação de contenção no BoltDB (backend do Consul) amplificada por um novo recurso de streaming de telemetria ativado durante um período de tráfego elevado. Este post-mortem reconstrói a cadeia de falhas, analisa as decisões de infraestrutura envolvidas e extrai lições aplicáveis a qualquer plataforma que dependa de service mesh e coordenação distribuída.Abrir TeardownNetflix: Chaos Engineering e Resiliência por DesignUma reconstrução arquitetural de como a Netflix transformou falhas inevitáveis em prática deliberada — da Simian Army ao failover regional automatizado. Este teardown examina as decisões técnicas, os trade-offs reais e o que separa resiliência de verdade de alta disponibilidade cosmética.Abrir Post-mortemAWS Kinesis us-east-1 (2020): Quando um Limite de Threads do SO Derrubou Metade da AWSEm novembro de 2020, uma expansão de capacidade no front-end do Amazon Kinesis esgotou o limite de threads por processo do sistema operacional, causando falhas em cascata que afetaram Cognito, CloudWatch, Lambda, ECS e dezenas de outros serviços na região us-east-1 por mais de oito horas. O incidente expôs dependências ocultas entre serviços AWS e os riscos de mudanças operacionais aparentemente seguras em sistemas de larga escala.Abrir Post-mortemGitHub 2018: 43 Segundos de Partição, 24 Horas de Split-Brain no MySQLEm 21 de outubro de 2018, uma janela de manutenção de rede de 43 segundos desencadeou uma cascata de falhas que manteve o GitHub degradado por quase 24 horas. O Orchestrator promoveu réplicas em regiões erradas, criando um split-brain entre datacenters — e revelando como automação de failover sem fencing adequado pode transformar uma microfalha em uma catástrofe de consistência de dados.Abrir Post-mortemAWS S3 us-east-1 (2017): quando um typo derruba a internetEm 28 de fevereiro de 2017, um engenheiro da AWS executou um comando de debug com um parâmetro incorreto e removeu uma quantidade muito maior de servidores do subsistema de indexação do S3 do que o pretendido. O resultado foi quatro horas de degradação severa em us-east-1 que afetou centenas de serviços dependentes — de ferramentas de monitoramento a grandes plataformas SaaS. O incidente expôs fragilidades estruturais em torno de dependências implícitas, ausência de rate limiting em operações destrutivas e a falácia de assumir que uma única região AWS seria suficientemente resiliente.Abrir