reliability
7 conteúdos publicados sobre este assunto.
Artigos· 6
AWS & CloudECS Early Success Criteria: onde termina o rollback do seu deployEm 4 de setembro de 2026 o Amazon ECS passou a deixar você declarar quando um rolling deployment é bem-sucedido, com um healthyPercent sobre o desired count. Isso não é um botão de deploy mais rápido — é a definição de onde o circuit breaker e o rollback por alarme param de proteger. Este briefing mostra a aritmética do parâmetro, os dois modos de limpeza da revisão fonte e o que o seu painel passa a esconder.Abrir AWS & CloudDaemon crítico ou não-crítico: o contrato de falha do ECSEm 3 de setembro de 2026 a AWS passou a permitir declarar um ECS Managed Daemon como não-crítico, e com isso transformou uma decisão que antes era implícita em um parâmetro versionado. O que está em jogo não é o daemon: é o contrato de falha entre um agente transversal e a instância que o hospeda. Este teardown dissseca a anatomia do padrão, a regra de decisão que uso para classificar cada agente e o que se paga — em churn, em ponto cego e em conta — ao classificar errado.Abrir AWS & CloudDocumentDB 8.0: MVU direto reduz risco, não elimina migraçãoO suporte a major version upgrade direto para o Amazon DocumentDB 8.0 é uma melhoria importante para quem ainda carrega clusters 3.6 ou 4.0. Eu trataria o recurso como redução de passos e de exposição, não como desculpa para pular ensaio, testes de compatibilidade e plano de rollback.Abrir AWS & CloudMWAA com Airflow 3.3.1: estado, linguagem e disciplina operacionalEu vejo o suporte do Amazon MWAA ao Apache Airflow 3.3.1 como uma evolução importante para pipelines que não cabem mais no modelo puramente stateless. O ganho real está em estado durável, particionamento de assets e melhor ergonomia de operação; o risco está em tratar recursos experimentais como plataforma corporativa madura cedo demais.Abrir AWS & CloudAutoScalingInstanceRefresh no CloudFormation: Dissecando o PadrãoA integração do Instance Refresh como update policy nativa do CloudFormation fecha uma lacuna operacional que forçava equipes a orquestrar deploys de AMI fora do ciclo de IaC. Neste artigo, disseco a anatomia do padrão, seus modos de falha reais e quando ele é — e não é — a escolha certa para ambientes de alta criticidade.Abrir Arquitetura de SoluçõesPostmortem de Priorização: Quando o Roadmap Vira IncidenteDecisões de priorização de roadmap raramente parecem incidentes até que produção quebre. Este artigo reconstrói a anatomia de uma falha real causada por débito técnico acumulado, ADRs ignorados e pressão de entrega — e propõe as mudanças estruturais que evitam a recorrência.Abrir