observability
35 conteúdos publicados sobre este assunto.
Artigos· 25
Dados & PlataformasMediaLive sem timecode: o que o Video Aligned Locking muda na redundânciaO MediaLive passou a sincronizar pipelines por assinatura visual dos frames, sem depender de timecode embutido — exatamente a peça que faltava para fontes SRT/RTMP de campo e para canais single-pipeline ligados entre regiões. Disseco o padrão: o problema que ele resolve, a anatomia dos modos e métodos de locking, as regras de frame rate e de input que derrubam a sincronização em silêncio, e as três métricas que precisam de alarme antes de ir para produção.Abrir Dados & PlataformasCapacidade por tipo de trabalho no Amazon Connect: o que muda de fatoO Amazon Connect passou a permitir concorrência por tipo de trabalho dentro dos canais Task e Email, e não mais só por canal. O ganho operacional é concreto em filas de alta variância — disputa, KYC, backoffice regulatório. O preço é uma taxonomia nova para governar e um modo de falha que não grita: contato com workload type sem linha correspondente no routing profile fica na fila para sempre.Abrir AWS & CloudDaemon crítico ou não-crítico: o contrato de falha do ECSEm 3 de setembro de 2026 a AWS passou a permitir declarar um ECS Managed Daemon como não-crítico, e com isso transformou uma decisão que antes era implícita em um parâmetro versionado. O que está em jogo não é o daemon: é o contrato de falha entre um agente transversal e a instância que o hospeda. Este teardown dissseca a anatomia do padrão, a regra de decisão que uso para classificar cada agente e o que se paga — em churn, em ponto cego e em conta — ao classificar errado.Abrir AWS & CloudSnapStart em container: o bake-off contra concorrência provisionadaA AWS liberou SnapStart para funções empacotadas como imagem de container, prometendo partida sub-segundo em artefatos de até 10 GB. Coloquei a novidade lado a lado com concorrência provisionada, com o .zip e com um serviço sempre ligado no Fargate, usando os preços publicados e os limites da documentação. A conclusão não é sobre latência: é sobre onde o seu pipeline passa a pagar aluguel.Abrir Arquitetura de SoluçõesMigrar séries temporais para Timestream for InfluxDBA expansão regional de Amazon Timestream for InfluxDB em 31 de agosto de 2026 muda a conversa de adoção para equipes que precisam manter dados operacionais próximos aos usuários e às regras locais. Eu trataria isso como uma oportunidade de modernização controlada, não como uma simples troca de endpoint.Abrir Dados & PlataformasMediaTailor Analytics: console, BI ou lakehouse?O dashboard de analytics do AWS Elemental MediaTailor muda a primeira linha de investigação para publishers que operam SSAI em múltiplas regiões. Eu o vejo como uma excelente camada operacional, mas não como substituto automático para BI, reconciliação financeira ou observabilidade de engenharia.Abrir Dados & PlataformasAmazon Connect compact mode: densidade operacional com cautelaO compact mode dos dashboards do Amazon Connect Customer parece pequeno, mas toca um ponto central de operações críticas: reduzir o tempo entre anomalia, percepção e ação. Eu o vejo como uma melhoria útil de cockpit operacional, desde que não vire substituto para alertas, SLOs, automação e desenho cuidadoso de métricas.Abrir AWS & CloudCloudWatch Alarm Warm-Up: Fim do Ruído de Startup em Pipelines CI/CDO CloudWatch agora suporta períodos de warm-up para alarmes, resolvendo um problema clássico de ruído operacional em deploys automatizados. A feature parece simples, mas tem implicações sérias para SLOs, on-call fatigue e design de pipelines em ambientes financeiros. Neste artigo, analiso o mecanismo, os trade-offs reais e como integrar isso de forma responsável em stacks de produção.Abrir Segurança & ResiliênciaRedirecionamento de Mídia VDI no Amazon Connect: Como Realmente FuncionaO suporte do Amazon Connect a Azure Virtual Desktop e Windows 365 via Microsoft Multimedia Redirection parece simples na superfície, mas esconde uma cadeia de decisões de roteamento de mídia com implicações sérias para latência, segurança e conformidade. Neste artigo, desmonto o mecanismo camada por camada, exponho os modos de falha que a documentação não menciona e ofereço um modelo de design para ambientes financeiros de alta exigência.Abrir Segurança & ResiliênciaAmazon Managed Grafana FedRAMP High: Observabilidade em Ambientes ReguladosO Amazon Managed Grafana alcançou autorização FedRAMP High nas regiões AWS GovCloud (US-East) e (US-West), desbloqueando observabilidade gerenciada para agências federais e setores com requisitos de conformidade rigorosos. Neste artigo, analiso o que essa autorização realmente significa em termos de arquitetura, os padrões de design que ela habilita e os anti-padrões que ainda persistem mesmo com o serviço autorizado.Abrir Dados & PlataformasCloudWatch Logs Intelligent Tiering: Guia de Campo para Ambientes FinanceirosO CloudWatch Logs Intelligent Tiering chegou em julho de 2026 prometendo reduzir custos de retenção de logs sem overhead operacional — mas para ambientes financeiros com requisitos de auditoria, a história é mais nuançada. Neste field note, analiso os três tiers, os limiares de transição automática e onde essa feature realmente entrega valor versus onde ela pode criar surpresas desagradáveis.Abrir Dados & PlataformasAdmin Shell no GameLift Streams: acesso seguro sem SSH em sessões ao vivoO Amazon GameLift Streams agora oferece acesso de terminal seguro a sessões ativas via SSM Session Manager, sem SSH, sem portas abertas e sem credenciais de infraestrutura. Esse mecanismo tem implicações arquiteturais sérias para equipes que operam plataformas de streaming em escala — especialmente no que tange a auditoria, blast radius e controle de acesso efêmero. Neste artigo, analiso como o recurso funciona internamente, onde ele pode falhar e como integrá-lo com segurança em ambientes financeiramente críticos.Abrir Dados & PlataformasTag Enrichment no CloudWatch Logs vs. Abordagens AlternativasO CloudWatch Logs agora enriquece eventos de log com resource tags na ingestão, sem custo adicional e sem mudanças na instrumentação. Mas isso substitui pipelines de enriquecimento customizados, abordagens OpenTelemetry ou soluções como Datadog? Faço aqui uma análise honesta de trade-offs para quem opera sistemas financeiros em AWS.Abrir IA & AgentesAmazon Bedrock AgentCore Harness: Da Ideia ao Agente de ProduçãoO AgentCore Harness chegou ao GA em junho de 2026 como uma abstração gerenciada que colapsa o plano de controle de agentes LLM em dois chamadas de API. Neste artigo, analiso como o harness funciona internamente, onde ele falha, e o que arquitetos de sistemas financeiros precisam entender antes de colocá-lo em produção.Abrir AWS & CloudIngestão Gerenciada de Syslog no CloudWatch: Anatomia de um PadrãoO CloudWatch Logs agora aceita syslog diretamente via endpoint de VPC — sem agentes, com parsing automático de RFC 5424, RFC 3164 e Cisco FTD/ASA. Isso muda o padrão de coleta de logs para dispositivos de rede e servidores Linux em ambientes regulados. Neste artigo, desmonto a anatomia do padrão, seus limites reais e os anti-padrões que já vi queimar equipes em produção.Abrir IA & AgentesAmazon Bedrock AgentCore: Otimização Contínua de Agentes em ProduçãoO Amazon Bedrock AgentCore introduz um loop de melhoria contínua que transforma traces de produção em diagnósticos acionáveis, recomendações fundamentadas em dados e validação estatística via testes A/B. Para arquitetos de sistemas financeiros e plataformas de alto risco, isso representa a primeira tentativa séria da AWS de fechar o gap entre observabilidade de agentes e operação confiável em produção.Abrir AWS & CloudECS Auto Scaling: Métricas de Alta Resolução vs. Abordagens TradicionaisO lançamento de métricas de alta resolução (20 segundos) para o Amazon ECS muda o cálculo de auto scaling para cargas financeiras sensíveis à latência. Este artigo compara as quatro abordagens principais de scaling — target tracking com alta resolução, step scaling, scheduled scaling e preditivo — com trade-offs concretos, números reais e uma matriz de decisão para ambientes de produção.Abrir AWS & CloudStreaming de Respostas com Lambda: Precificação em Tempo RealLambda response streaming muda fundamentalmente o contrato de execução serverless ao permitir que bytes sejam enviados ao cliente antes que a função termine — o que tem implicações profundas para motores de precificação em tempo real. Nesta análise, desmonto o mecanismo interno, os modos de falha que a documentação não enfatiza, e as decisões de arquitetura que separam um protótipo de um sistema financeiro em produção.Abrir IA & AgentesAWS FinOps Agent: Arquitetura, Mecanismos e Trade-offs em ProduçãoO AWS FinOps Agent, anunciado em preview no AWS Summit New York 2026, representa uma mudança de paradigma: de dashboards reativos para agentes autônomos que investigam anomalias de custo, geram recomendações e executam ações em sistemas externos como Jira e Slack. Neste artigo, disseço a arquitetura interna do agente, os modos de falha que ninguém menciona, e os trade-offs que qualquer equipe de engenharia financeira precisa entender antes de colocá-lo em produção.Abrir IA & AgentesObservabilidade de LLMs em Produção: Do GPU à Qualidade da RespostaColocar um LLM em produção no SageMaker é a parte fácil. O difícil é saber, em tempo real, se ele está respondendo bem, consumindo GPU de forma eficiente e custando o que você planejou. Este artigo detalha a stack de observabilidade que eu construiria hoje para inferência LLM financeira-grade.Abrir IA & AgentesAvaliação de Agentes como Disciplina de EngenhariaA avaliação de agentes de IA deixou de ser um exercício ad hoc de prompt engineering e tornou-se uma disciplina de engenharia com datasets versionados, quality gates automatizados e rastreabilidade de regressões. O Bedrock AgentCore materializa esse salto ao trazer infraestrutura gerenciada para o ciclo de vida de testes de agentes. Para arquitetos de sistemas financeiros, isso muda o contrato entre equipes de ML e engenharia de plataforma.Abrir Dados & PlataformasObservabilidade ML no EKS: Logs, Métricas e Rastreamento em Bake-offWorkloads de ML no EKS geram volumes de telemetria que expõem as limitações de qualquer pipeline de observabilidade não projetado para esse perfil. Neste artigo, comparo quatro abordagens de coleta e roteamento de logs e métricas, com foco em custo real, latência de diagnóstico e adequação a ambientes financeiros regulados.Abrir AWS & CloudCloudWatch para OTel: Desmontando o Padrão de Bridge de ObservabilidadeO padrão de bridge entre CloudWatch e OpenTelemetry resolve um problema real de fragmentação de observabilidade em ambientes multi-plataforma, mas carrega custos operacionais e armadilhas de design que raramente aparecem nos tutoriais. Neste artigo desmonto a anatomia desse padrão, quando ele faz sentido e quando ele cria mais problema do que resolve.Abrir AWS & CloudMigração para Plataformas Stateful Cloud Native no AWS EKSMigrar workloads stateful para plataformas cloud native não é apenas uma questão de containerização — é uma série de decisões de isolamento, consistência de dados e automação operacional que determinam se a plataforma sobrevive a produção. Neste artigo, percorro a jornada de uma plataforma financeira que saiu de VMs gerenciadas manualmente para um ambiente EKS multitenant com operadores Kubernetes, armazenamento persistente gerenciado e observabilidade de ponta a ponta.Abrir Arquitetura de SoluçõesComputação de Baixo Carbono com Dispositivos Reutilizados: Arquitetura Edge RealReutilizar smartphones descartados como nós de computação edge não é apenas uma aposta de sustentabilidade — é uma decisão arquitetural com implicações sérias em confiabilidade, segurança e custo operacional. Neste artigo, analiso os mecanismos reais, os modos de falha e os trade-offs de engenharia que separam um experimento de laboratório de uma plataforma de produção.Abrir Architecture Studies· 9
Decisão (ADR)Web Search do Bedrock no GovCloud: um ADR sobre grounding reguladoEm 2 de setembro de 2026 a AWS levou o tool server-side Web Search do Amazon Bedrock para o GovCloud (US-West). Escrevi este ADR porque a decisão real não é "usar ou não busca web" — é escolher em que modo de recuperação você opera, e o default do parâmetro `external_web_access` empurra times regulados exatamente para o lado errado, com HTTP 200 e sem erro visível.Abrir Decisão (ADR)ADR: Escalando Agentes em Produção com AgentCore Runtime QuotasEm julho de 2026, a AWS elevou os limites padrão do AgentCore Runtime para 5.000 sessões ativas simultâneas em us-east-1/us-west-2 e 200 interações por segundo em todas as regiões. Este ADR documenta o contexto que forçou essa decisão de design, as opções arquiteturais que considerei para sistemas agênticos em escala financeira, e as consequências operacionais que você precisa planejar antes de colocar agentes em produção.Abrir Guia / Deep DiveAgentes de IA por Dentro (3/3): Agentes em Produção na AWS com Bedrock AgentCoreA terceira e última parte da série desce o elevador até o andar técnico: como colocar um agente de IA em produção na AWS usando o Amazon Bedrock AgentCore. Cobrimos o mapa completo dos componentes (Runtime, Gateway, Memory, Identity, Observability), a escolha de modelo por custo/latência/raciocínio, segurança com guardrails e isolamento de sessão, e FinOps para manter o custo real abaixo de poucos dólares por mês.Abrir Decisão (ADR)ADR: Adotando Amazon Bedrock AgentCore em ProduçãoBedrock AgentCore promete reduzir o atrito operacional de agentes de IA em produção, mas adotar qualquer plataforma gerenciada de orquestração de agentes exige uma decisão arquitetural explícita. Neste ADR, documento as forças que me levaram a avaliar AgentCore, as alternativas consideradas e as consequências reais de cada caminho.Abrir Post-mortemCoinbase (2026): o control plane do AWS MSK que travou o tradingEm 7 de maio de 2026, um defeito no control plane do Amazon MSK impediu a reeleição automática de líderes de partição em dois clusters Kafka gerenciados da Coinbase, bloqueando silenciosamente os serviços de fee, quoting e execução de trades por horas. O incidente expõe os riscos ocultos de depender de serviços gerenciados como ponto único de coordenação — e a necessidade crítica de observabilidade profunda em infraestrutura que você não opera.Abrir Design Doc / RFCDesign Doc: Agentes em Produção com Amazon Bedrock AgentCoreEste documento descreve a arquitetura de uma plataforma de agentes de IA em produção usando Amazon Bedrock AgentCore, cobrindo runtime serverless com isolamento de sessão, governança de ferramentas via Gateway/MCP, memória de curto e longo prazo, identidade federada e observabilidade. O foco está em guardrails operacionais, teto de custo e governança de ferramentas — os problemas que realmente afundam projetos de agentes em ambientes corporativos.Abrir PlaybookPlaybook: Um Agente de IA de Produção na AWS em 7 PassosNoventa por cento dos agentes de IA morrem no notebook. Este playbook cobre os 7 passos que separam um protótipo funcional de um agente confiável em produção na AWS — do trigger ao guardrail, passando por topologia de loop, ferramentas com menor privilégio, verifier externo e orçamento de execução. Opinioso, concreto e baseado nas primitivas reais do Amazon Bedrock AgentCore.Abrir PlaybookPlaybook: do Prompt ao Pipeline — os 5 Estágios de um Agente ConfiávelUm agente não nasce confiável — ele é construído estágio a estágio, do prompt simples ao sistema operável com observabilidade, guardrails e auditoria. Este playbook mapeia cada estágio, o que você ganha, o que você arrisca, e quando parar de subir a escada. O gargalo não é o prompt; é o sistema em volta.Abrir Post-mortemDatadog (2023): como um patch de segurança do systemd derrubou 5 regiões simultaneamenteEm março de 2023, uma atualização automática de segurança do systemd-networkd reiniciou o subsistema de rede em dezenas de milhares de nós Kubernetes do Datadog ao mesmo tempo, cortando a conectividade gerenciada pelo Cilium em múltiplas regiões. O incidente expôs os riscos de auto-updates de SO sem controle de blast radius, a dependência crítica de CNI plugins no plano de dados e a ausência de isolamento regional em pipelines de atualização.Abrir