finops
29 conteúdos publicados sobre este assunto.
Artigos· 22
IA & AgentesTreino e inferência na mesma GPU: quatro formas de partilhar 10 mil aceleradoresO China Merchants Bank venceu o CNCF End User Case Study Contest ao colocar treino, fine-tuning e inferência num único plano de controle Kubernetes sobre quase 10 mil aceleradores heterogêneos: utilização média de 35% para mais de 60% e custo por milhão de tokens cortado em mais de 60%. Analiso o que faz esse número acontecer — fila com quota, autoscaling por métrica, virtualização de GPU e cache de dados — e comparo quatro formas de reproduzi-lo na AWS, com a matriz de decisão que eu usaria num banco.Abrir AWS & CloudLoop recursivo no Lambda: quatro guardrails comparados no Sovereign CloudA detecção de loop recursivo do Lambda chegou ao European Sovereign Cloud em 10 de setembro de 2026. Ela corta a cadeia em ~16 invocações, mas só entre Lambda, SQS, SNS e S3, e o aviso pode levar 3,5 horas. Comparo quatro guardrails — detecção nativa, separação estrutural, teto de concorrência e contador de saltos na aplicação — e digo quando cada um basta.Abrir IA & AgentesGPT-6 Astra no Bedrock: o endpoint decide o que você auditaA GA do GPT-6 Astra no Amazon Bedrock, em 8 de setembro de 2026, trouxe 1.050.000 tokens de contexto e uma bifurcação de arquitetura: o modelo é servido por `bedrock-runtime` e por `bedrock-mantle`, e cada endpoint recusa algo que o outro entrega. Analiso o que cada caminho custa em dinheiro, em quota e em rastro auditável — e por que, para carga regulada no Brasil, a conversa começa e termina em residência de dados.Abrir IA & AgentesFable 5.1 no Bedrock: retenção de dados virou decisão de arquiteturaClaude Fable 5.1 chegou ao Bedrock em 1º de setembro de 2026 com 1M de contexto e uma condição que nenhum modelo anterior da Anthropic tinha: você precisa autorizar explicitamente a retenção de prompts e saídas por até 30 dias dentro da AWS. Isso não é uma caixinha de consentimento — é uma configuração de conta com raio de alcance organizacional, que colide com o SCP de zero data retention que a maioria dos ambientes regulados já tem escrito.Abrir IA & AgentesRAG sobre ServiceNow: o conector que apaga o user criteriaO conector nativo de ServiceNow do Amazon Bedrock Managed Knowledge Base chegou em 4 de setembro de 2026 e tira semanas de pipeline artesanal do caminho. Ele também instrui você a usar uma conta de serviço com knowledge_admin, que ignora o user criteria por knowledge base — e o conector não ingere ACL de documento. Este é o retro do piloto em que essas duas linhas de documentação se encontraram.Abrir AWS & CloudAMI com contrato: anatomia do novo bloqueio de tipos no EC2Em 4 de setembro de 2026 o EC2 passou a aceitar `InstanceTypeSpecification` no AMI: duas listas, avaliadas no `RunInstances`, que bloqueiam o lançamento em tipo incompatível. O padrão move a compatibilidade do chamador para o artefato — e traz junto uma armadilha que quase ninguém vai ver antes de sangrar: a especificação casa strings, não capacidades de hardware.Abrir AWS & CloudDaemon crítico ou não-crítico: o contrato de falha do ECSEm 3 de setembro de 2026 a AWS passou a permitir declarar um ECS Managed Daemon como não-crítico, e com isso transformou uma decisão que antes era implícita em um parâmetro versionado. O que está em jogo não é o daemon: é o contrato de falha entre um agente transversal e a instância que o hospeda. Este teardown dissseca a anatomia do padrão, a regra de decisão que uso para classificar cada agente e o que se paga — em churn, em ponto cego e em conta — ao classificar errado.Abrir AWS & CloudSnapStart em container: o bake-off contra concorrência provisionadaA AWS liberou SnapStart para funções empacotadas como imagem de container, prometendo partida sub-segundo em artefatos de até 10 GB. Coloquei a novidade lado a lado com concorrência provisionada, com o .zip e com um serviço sempre ligado no Fargate, usando os preços publicados e os limites da documentação. A conclusão não é sobre latência: é sobre onde o seu pipeline passa a pagar aluguel.Abrir AWS & CloudApps no Amazon Quick vs. App Studio vs. build próprioA AWS liberou no dia 1º de setembro de 2026 a construção de aplicações internas por linguagem natural dentro do Amazon Quick. A pergunta de arquitetura não é se funciona — é qual das quatro rotas disponíveis suporta o app depois que ele vira parte do fechamento mensal. Comparo assento vs. hora-usuário, propagação de identidade e custo de saída.Abrir IA & AgentesClaude Fable 5.1 na AWS: o modelo que exige histórico imutávelO Fable 5.1 chegou ao Bedrock em 1º de setembro de 2026 com o mesmo preço de entrada e saída do Fable 5, mas com leitura de cache a um quarto do custo. O que ninguém colocou no anúncio é que ele troca flexibilidade de orquestração por qualidade de raciocínio: tool_choice forçado morreu e editar o histórico passa a ser erro. Avaliei o que isso significa para quem opera agentes de longa duração dentro do perímetro AWS.Abrir Arquitetura de SoluçõesMigrar séries temporais para Timestream for InfluxDBA expansão regional de Amazon Timestream for InfluxDB em 31 de agosto de 2026 muda a conversa de adoção para equipes que precisam manter dados operacionais próximos aos usuários e às regras locais. Eu trataria isso como uma oportunidade de modernização controlada, não como uma simples troca de endpoint.Abrir IA & AgentesPRM por User Agent: atribuição melhor, governança ainda necessáriaA expansão do Partner Revenue Measurement por User Agent é pequena na implementação e relevante na leitura econômica de soluções SaaS e ISV na AWS. Eu gosto do movimento, mas trataria isso como telemetria de atribuição, não como sistema financeiro primário.Abrir AWS & CloudMWAA com Airflow 3.3.1: estado, linguagem e disciplina operacionalEu vejo o suporte do Amazon MWAA ao Apache Airflow 3.3.1 como uma evolução importante para pipelines que não cabem mais no modelo puramente stateless. O ganho real está em estado durável, particionamento de assets e melhor ergonomia de operação; o risco está em tratar recursos experimentais como plataforma corporativa madura cedo demais.Abrir Dados & PlataformasAmazon Connect compact mode: densidade operacional com cautelaO compact mode dos dashboards do Amazon Connect Customer parece pequeno, mas toca um ponto central de operações críticas: reduzir o tempo entre anomalia, percepção e ação. Eu o vejo como uma melhoria útil de cockpit operacional, desde que não vire substituto para alertas, SLOs, automação e desenho cuidadoso de métricas.Abrir AWS & CloudCloudWatch Alarm Warm-Up: Fim do Ruído de Startup em Pipelines CI/CDO CloudWatch agora suporta períodos de warm-up para alarmes, resolvendo um problema clássico de ruído operacional em deploys automatizados. A feature parece simples, mas tem implicações sérias para SLOs, on-call fatigue e design de pipelines em ambientes financeiros. Neste artigo, analiso o mecanismo, os trade-offs reais e como integrar isso de forma responsável em stacks de produção.Abrir IA & AgentesFinOps para IA Generativa: Dissecando o Padrão de Custo Bedrock no CUR 2.0Com a disponibilização de metadados padronizados do Bedrock no AWS Data Exports, a atribuição de custos de IA generativa deixa de depender de parsing frágil de campos livres e passa a ter estrutura nativa no CUR 2.0. Neste artigo, disseço a anatomia desse padrão, os cenários onde ele resolve o problema de verdade e as armadilhas que ainda persistem quando a governança de IA não está alinhada ao pipeline de FinOps.Abrir Dados & PlataformasNova York suspende novos data centers acima de 50 MWA governadora Kathy Hochul assinou uma ordem que pausa por até um ano novos data centers de 50 MW ou mais, enquanto o estado faz um estudo ambiental. A medida mira a pressão da IA sobre a rede elétrica, o consumo de água e o repasse de custos à população — e sinaliza um risco regulatório novo para quem projeta cargas de nuvem e IA.Abrir IA & AgentesIaC para Plataformas de IA: Terraform e SageMaker Unified StudioO suporte oficial ao Terraform para o SageMaker Unified Studio fecha uma lacuna crítica: plataformas de IA agora podem ser provisionadas com o mesmo rigor de IaC que redes e bancos de dados. Neste artigo, disseço o padrão, sua anatomia modular, quando ele resolve o problema certo e quando ele esconde dívida técnica perigosa.Abrir IA & AgentesAWS FinOps Agent: Arquitetura, Mecanismos e Trade-offs em ProduçãoO AWS FinOps Agent, anunciado em preview no AWS Summit New York 2026, representa uma mudança de paradigma: de dashboards reativos para agentes autônomos que investigam anomalias de custo, geram recomendações e executam ações em sistemas externos como Jira e Slack. Neste artigo, disseço a arquitetura interna do agente, os modos de falha que ninguém menciona, e os trade-offs que qualquer equipe de engenharia financeira precisa entender antes de colocá-lo em produção.Abrir Segurança & ResiliênciaAWS WAF e Monetização de Tráfego de Bots de IA: Análise TécnicaO AWS WAF ganhou capacidade nativa de identificar e rotear tráfego originado por bots de IA — uma mudança que transforma uma ferramenta defensiva em um ponto de controle de receita. Neste artigo, analiso o que a funcionalidade entrega de fato, onde ela falha e como integrá-la com segurança em arquiteturas financeiras.Abrir Dados & PlataformasCustom Lens para Plataformas de Dados: Anatomia de um PadrãoO AWS Well-Architected Custom Lens é frequentemente tratado como um artefato de documentação — mas quando aplicado a plataformas de dados corporativas, ele se torna um mecanismo de governança operacional com dentes reais. Neste artigo, desmonto a anatomia do padrão, exponho suas falhas de adoção mais comuns e proponho um design de referência que conecta revisões de lens a pipelines de remediação automatizados.Abrir Segurança & ResiliênciaUma Organização ou Várias? O Postmortem que Ninguém Quer EscreverA decisão entre uma única AWS Organization e múltiplas organizações parece estratégica no papel, mas se torna operacional no pior momento possível — durante um incidente. Este artigo reconstrói o padrão de falha mais comum que observo em ambientes financeiros e propõe remediações concretas baseadas nos pilares do AWS Well-Architected.Abrir Architecture Studies· 5
Decisão (ADR)ADR: S/4HANA em Hong Kong — X2idn chegou, migrar agora ou esperar X8i?Em 11 de setembro de 2026 a AWS habilitou as instâncias X2idn em Asia Pacific (Hong Kong). Para um core financeiro em S/4HANA que não pode sair da região, é a primeira instância Nitro de 2 TiB certificada para HANA produtivo ali — 49% mais SAPS e 5,7× mais banda de EBS que o x1.32xlarge. Este ADR registra por que eu migro agora, aceitando uma segunda migração para X8i quando ela chegar.Abrir Decisão (ADR)Web Search do Bedrock no GovCloud: um ADR sobre grounding reguladoEm 2 de setembro de 2026 a AWS levou o tool server-side Web Search do Amazon Bedrock para o GovCloud (US-West). Escrevi este ADR porque a decisão real não é "usar ou não busca web" — é escolher em que modo de recuperação você opera, e o default do parâmetro `external_web_access` empurra times regulados exatamente para o lado errado, com HTTP 200 e sem erro visível.Abrir PlaybookPlaybook: 5 Mudanças em Arquitetura de IA — e o que fazer com cada umaO que era avançado em 2025 virou default em 2026: o gargalo saiu do prompt, agentes foram para produção gerenciada, MCP padronizou ferramentas, segurança virou multicamadas e FinOps de token entrou na pauta. Este playbook mapeia cada mudança com o que fazer de concreto — para quem constrói sistemas, não demos.Abrir Guia / Deep DiveAgentes de IA por Dentro (3/3): Agentes em Produção na AWS com Bedrock AgentCoreA terceira e última parte da série desce o elevador até o andar técnico: como colocar um agente de IA em produção na AWS usando o Amazon Bedrock AgentCore. Cobrimos o mapa completo dos componentes (Runtime, Gateway, Memory, Identity, Observability), a escolha de modelo por custo/latência/raciocínio, segurança com guardrails e isolamento de sessão, e FinOps para manter o custo real abaixo de poucos dólares por mês.Abrir PlaybookPlaybook: FinOps de GenAI — cortar o custo de um agente sem perder qualidadeAgentes de GenAI em produção acumulam custo em lugares que os dashboards padrão não mostram: tokens de entrada inflados, loops sem critério de parada, retries silenciosos e modelos caros em tarefas triviais. Este playbook apresenta as seis alavancas de otimização — com ordem de execução, tabela de impacto e os anti-padrões que transformam economia em regressão de qualidade.Abrir