eks
13 conteúdos publicados sobre este assunto.
Artigos· 7
IA & AgentesTreino e inferência na mesma GPU: quatro formas de partilhar 10 mil aceleradoresO China Merchants Bank venceu o CNCF End User Case Study Contest ao colocar treino, fine-tuning e inferência num único plano de controle Kubernetes sobre quase 10 mil aceleradores heterogêneos: utilização média de 35% para mais de 60% e custo por milhão de tokens cortado em mais de 60%. Analiso o que faz esse número acontecer — fila com quota, autoscaling por métrica, virtualização de GPU e cache de dados — e comparo quatro formas de reproduzi-lo na AWS, com a matriz de decisão que eu usaria num banco.Abrir IA & AgentesCold start de LLM no HyperPod: de 27 minutos a segundos com model cachingO SageMaker HyperPod passou a pré-carregar pesos de modelo em NVMe local e imagens de contêiner nos nós, com cerca de 60% de scale-out mais rápido em modelos de 57 a 145 GB. Conto a migração de um endpoint de análise de documentos passo a passo — do baseline de 27 minutos até o primeiro token à reescrita da política de autoscaling que só existia para conviver com o cold start.Abrir AWS & CloudAWS Network Firewall como Forward Proxy: Análise Técnica do PreviewA AWS reintroduziu o forward proxy como funcionalidade nativa do Network Firewall, unificando políticas de segurança entre os modos transparent e explicit proxy sob um único recurso. Esta análise examina o que mudou em relação ao preview de novembro de 2025, onde a funcionalidade genuinamente agrega valor em ambientes financeiros e onde os riscos operacionais ainda pedem cautela.Abrir AWS & CloudEC2 G7 e NVIDIA Blackwell: Arquitetura de Inferência GPU para ProduçãoAs instâncias EC2 G7, aceleradas pelas GPUs NVIDIA RTX PRO 4500 Blackwell Server Edition, representam um salto geracional que vai muito além de números de benchmark. Nesta análise, examino os mecanismos reais de comunicação GPU-to-GPU, os padrões de falha em clusters multi-nó e as decisões de arquitetura que separam um deployment de inferência funcional de um sistema financeiro-grade tolerante a falhas.Abrir IA & AgentesAgentic RAG na AWS: Comparativo de Arquiteturas para Ambientes FinanceirosAgentic RAG deixou de ser experimento de laboratório e passou a ser requisito de plataforma em ambientes financeiros que exigem rastreabilidade, controle de custo e latência previsível. Neste artigo, comparo quatro abordagens arquiteturais concretas na AWS, com trade-offs reais, números plausíveis e uma recomendação sem rodeios.Abrir Dados & PlataformasObservabilidade ML no EKS: Logs, Métricas e Rastreamento em Bake-offWorkloads de ML no EKS geram volumes de telemetria que expõem as limitações de qualquer pipeline de observabilidade não projetado para esse perfil. Neste artigo, comparo quatro abordagens de coleta e roteamento de logs e métricas, com foco em custo real, latência de diagnóstico e adequação a ambientes financeiros regulados.Abrir AWS & CloudMigração para Plataformas Stateful Cloud Native no AWS EKSMigrar workloads stateful para plataformas cloud native não é apenas uma questão de containerização — é uma série de decisões de isolamento, consistência de dados e automação operacional que determinam se a plataforma sobrevive a produção. Neste artigo, percorro a jornada de uma plataforma financeira que saiu de VMs gerenciadas manualmente para um ambiente EKS multitenant com operadores Kubernetes, armazenamento persistente gerenciado e observabilidade de ponta a ponta.Abrir Architecture Studies· 6
Decisão (ADR)ADR: EKS Provisioned Control Plane e HPA Concurrency 40xO EKS Provisioned Control Plane agora processa objetos HPA com até 40x mais concorrência que o padrão Kubernetes, eliminando um gargalo silencioso em clusters com centenas de workloads. Neste registro de decisão arquitetural, analiso o contexto que torna essa mudança relevante, as opções que existiam antes dela, e as consequências operacionais que arquitetos precisam endereçar agora.Abrir Decisão (ADR)ADR: Migrando Workloads Financeiros para EC2 R8i no Tokyo e FrankfurtA disponibilidade das instâncias EC2 R8in, R8ib, R8idn e R8idb em Tokyo, Frankfurt e Irlanda abre uma janela de decisão real para arquiteturas financeiras que dependem de latência de rede sub-milissegundo, throughput EBS extremo e conformidade de residência de dados. Este ADR documenta o raciocínio por trás da adoção — ou não — dessas instâncias em workloads de grau financeiro.Abrir Decisão (ADR)EC2 G7e: Decisão de Arquitetura para Inferência de Vídeo GenerativoAs instâncias EC2 G7e chegam com GPUs NVIDIA L40S e prometem redefinir o custo por frame em workloads de inferência de vídeo generativo. Neste registro de decisão de arquitetura, avalio as forças que tornam essa escolha não trivial, os padrões de falha que já vi em produção e a configuração que eu adotaria em um ambiente financeiro-grade.Abrir Design Doc / RFCDesign Doc: EKS Multi-Tenant em Escala — Karpenter, Isolamento e CustoEste documento descreve a arquitetura de uma plataforma EKS multi-tenant para dezenas de equipes, cobrindo isolamento de workloads via namespaces, network policies e RBAC, autoscaling e consolidação com Karpenter usando Spot, e alocação de custo por tenant via Kubecost. O objetivo é operar com segurança, previsibilidade de custo e eficiência de infraestrutura sem sacrificar a autonomia das equipes.Abrir Decisão (ADR)ADR: LLM Auto-Hospedado (EKS + vLLM) vs API Gerenciada (Bedrock)Este ADR avalia a decisão entre hospedar modelos de linguagem em infraestrutura própria com EKS e vLLM versus consumir modelos via Amazon Bedrock. A análise cobre custo por token, carga operacional de MLOps, cold start, residência de dados e ponto de break-even por volume de tokens.Abrir PlaybookPlaybook: Onde Rodar IA na AWS — Lambda vs Fargate vs ECS/EKS (GPU)Escolher o compute errado para workloads de IA na AWS é o erro mais caro que equipes cometem ao escalar de protótipo para produção. Este playbook mapeia Lambda, Fargate, ECS/EKS+GPU e Bedrock contra os eixos que realmente importam — duração, GPU, padrão de tráfego e custo por token — e entrega uma árvore de decisão acionável para cada cenário.Abrir