kubernetes
7 conteúdos publicados sobre este assunto.
Artigos· 3
IA & AgentesTreino e inferência na mesma GPU: quatro formas de partilhar 10 mil aceleradoresO China Merchants Bank venceu o CNCF End User Case Study Contest ao colocar treino, fine-tuning e inferência num único plano de controle Kubernetes sobre quase 10 mil aceleradores heterogêneos: utilização média de 35% para mais de 60% e custo por milhão de tokens cortado em mais de 60%. Analiso o que faz esse número acontecer — fila com quota, autoscaling por métrica, virtualização de GPU e cache de dados — e comparo quatro formas de reproduzi-lo na AWS, com a matriz de decisão que eu usaria num banco.Abrir AWS & CloudECS Auto Scaling: Métricas de Alta Resolução vs. Abordagens TradicionaisO lançamento de métricas de alta resolução (20 segundos) para o Amazon ECS muda o cálculo de auto scaling para cargas financeiras sensíveis à latência. Este artigo compara as quatro abordagens principais de scaling — target tracking com alta resolução, step scaling, scheduled scaling e preditivo — com trade-offs concretos, números reais e uma matriz de decisão para ambientes de produção.Abrir AWS & CloudMigração para Plataformas Stateful Cloud Native no AWS EKSMigrar workloads stateful para plataformas cloud native não é apenas uma questão de containerização — é uma série de decisões de isolamento, consistência de dados e automação operacional que determinam se a plataforma sobrevive a produção. Neste artigo, percorro a jornada de uma plataforma financeira que saiu de VMs gerenciadas manualmente para um ambiente EKS multitenant com operadores Kubernetes, armazenamento persistente gerenciado e observabilidade de ponta a ponta.Abrir Architecture Studies· 4
Decisão (ADR)ADR: EKS Provisioned Control Plane e HPA Concurrency 40xO EKS Provisioned Control Plane agora processa objetos HPA com até 40x mais concorrência que o padrão Kubernetes, eliminando um gargalo silencioso em clusters com centenas de workloads. Neste registro de decisão arquitetural, analiso o contexto que torna essa mudança relevante, as opções que existiam antes dela, e as consequências operacionais que arquitetos precisam endereçar agora.Abrir Design Doc / RFCDesign Doc: EKS Multi-Tenant em Escala — Karpenter, Isolamento e CustoEste documento descreve a arquitetura de uma plataforma EKS multi-tenant para dezenas de equipes, cobrindo isolamento de workloads via namespaces, network policies e RBAC, autoscaling e consolidação com Karpenter usando Spot, e alocação de custo por tenant via Kubecost. O objetivo é operar com segurança, previsibilidade de custo e eficiência de infraestrutura sem sacrificar a autonomia das equipes.Abrir Post-mortemOpenAI (2024): como um novo serviço de telemetria derrubou o control plane do KubernetesEm dezembro de 2024, a OpenAI implantou um novo agente de telemetria em toda a sua frota Kubernetes simultaneamente. A sobrecarga resultante nos API servers cascateou para uma indisponibilidade global do ChatGPT, da API e do Sora por várias horas — e o próprio control plane saturado impediu o rollback. Uma análise de como a separação entre control plane e data plane, rollouts graduais e desacoplamento de observabilidade não eram opcionais.Abrir Post-mortemDatadog (2023): como um patch de segurança do systemd derrubou 5 regiões simultaneamenteEm março de 2023, uma atualização automática de segurança do systemd-networkd reiniciou o subsistema de rede em dezenas de milhares de nós Kubernetes do Datadog ao mesmo tempo, cortando a conectividade gerenciada pelo Cilium em múltiplas regiões. O incidente expôs os riscos de auto-updates de SO sem controle de blast radius, a dependência crítica de CNI plugins no plano de dados e a ausência de isolamento regional em pipelines de atualização.Abrir