mlops
15 conteúdos publicados sobre este assunto.
Artigos· 11
IA & AgentesMigrando para Git Nativo no SageMaker Unified StudioO SageMaker Unified Studio substituiu o modelo de sync automático por controle de versão Git flexível e granular, cobrindo Query Editor, Visual ETL, Workflows e Notebooks numa experiência unificada. Para equipes em ambientes regulados, essa mudança não é cosmética — ela redefine auditabilidade, rastreabilidade de artefatos e o modelo de governança de código analítico. Neste artigo, percorro a jornada de migração, os riscos reais e as decisões de arquitetura que fazem a diferença em produção.Abrir IA & AgentesDPD no HyperPod: Prefill e Decode Disagregados em ProduçãoO SageMaker HyperPod agora suporta Disaggregated Prefill and Decode (DPD), separando as duas fases de inferência LLM em pools de GPU dedicados conectados via EFA e GPU-Direct RDMA. Essa mudança resolve um dos problemas mais persistentes em produção: um único request de contexto longo degradando a latência de token de todos os requests concorrentes. Neste artigo, analiso os trade-offs reais, os padrões de falha que você vai encontrar e um playbook para habilitar DPD em workloads financeiros de alta exigência.Abrir IA & AgentesSageMaker Unified Studio + Terraform: IaC para Plataformas de IA FinanceirasO suporte oficial ao Terraform para o SageMaker Unified Studio, lançado em julho de 2026, fecha uma lacuna crítica para equipes de plataforma que operam em ambientes financeiros regulados: a capacidade de versionar, auditar e promover domínios de IA/dados com o mesmo rigor aplicado a qualquer outro recurso de infraestrutura. Este briefing analisa o que muda na prática, onde estão os riscos reais e como posicionar essa capacidade dentro de uma estratégia de Internal Developer Platform.Abrir IA & AgentesSageMaker Unified Studio + Terraform: Retro de Incidente em IaC para IAA ausência de infraestrutura-como-código reproduzível para plataformas de IA unificadas não é um problema de conveniência — é um vetor de incidentes de governança, drift de configuração e falhas de auditoria em ambientes financeiros. O suporte ao Terraform no Amazon SageMaker Unified Studio, lançado em julho de 2026, fecha uma lacuna crítica que eu vi causar incidentes reais em múltiplos clientes enterprise. Esta retro analisa o padrão de falha, a linha do tempo típica e as mudanças de resiliência que devem seguir.Abrir IA & AgentesSageMaker Unified Studio via Terraform: Migrando para IaC em Ambientes FinanceirosO suporte a Terraform no Amazon SageMaker Unified Studio, anunciado em julho de 2026, fecha uma lacuna crítica para plataformas de dados em ambientes regulados: domínios de ML que antes exigiam ClickOps ou automação frágil via SDK agora podem ser versionados, revisados e promovidos como qualquer outro recurso de infraestrutura. Neste artigo, analiso a jornada de migração de um estado inicial baseado em console para um pipeline IaC completo, com atenção especial às armadilhas de IAM, governança de blueprints e observabilidade operacional que fazem a diferença em ambientes financeiros.Abrir IA & AgentesIaC para Plataformas de IA: Terraform e SageMaker Unified StudioO suporte oficial ao Terraform para o SageMaker Unified Studio fecha uma lacuna crítica: plataformas de IA agora podem ser provisionadas com o mesmo rigor de IaC que redes e bancos de dados. Neste artigo, disseço o padrão, sua anatomia modular, quando ele resolve o problema certo e quando ele esconde dívida técnica perigosa.Abrir IA & AgentesAmazon Bedrock AgentCore: Otimização Contínua de Agentes em ProduçãoO Amazon Bedrock AgentCore introduz um loop de melhoria contínua que transforma traces de produção em diagnósticos acionáveis, recomendações fundamentadas em dados e validação estatística via testes A/B. Para arquitetos de sistemas financeiros e plataformas de alto risco, isso representa a primeira tentativa séria da AWS de fechar o gap entre observabilidade de agentes e operação confiável em produção.Abrir IA & AgentesObservabilidade de LLMs em Produção: Do GPU à Qualidade da RespostaColocar um LLM em produção no SageMaker é a parte fácil. O difícil é saber, em tempo real, se ele está respondendo bem, consumindo GPU de forma eficiente e custando o que você planejou. Este artigo detalha a stack de observabilidade que eu construiria hoje para inferência LLM financeira-grade.Abrir IA & AgentesAvaliação de Agentes como Disciplina de EngenhariaA avaliação de agentes de IA deixou de ser um exercício ad hoc de prompt engineering e tornou-se uma disciplina de engenharia com datasets versionados, quality gates automatizados e rastreabilidade de regressões. O Bedrock AgentCore materializa esse salto ao trazer infraestrutura gerenciada para o ciclo de vida de testes de agentes. Para arquitetos de sistemas financeiros, isso muda o contrato entre equipes de ML e engenharia de plataforma.Abrir Dados & PlataformasObservabilidade ML no EKS: Logs, Métricas e Rastreamento em Bake-offWorkloads de ML no EKS geram volumes de telemetria que expõem as limitações de qualquer pipeline de observabilidade não projetado para esse perfil. Neste artigo, comparo quatro abordagens de coleta e roteamento de logs e métricas, com foco em custo real, latência de diagnóstico e adequação a ambientes financeiros regulados.Abrir Dados & PlataformasDe Pixels a Planejamento: Plataformas de Dados Geoespaciais em AWSPlataformas de Earth AI estão saindo dos laboratórios de pesquisa e entrando em decisões operacionais reais — de crédito climático a gestão de ativos de infraestrutura. Arquitetar esse pipeline na AWS exige escolhas precisas sobre ingestão de raster/vetor, particionamento geoespacial, latência de inferência e rastreabilidade de dados. Este artigo documenta as decisões que eu tomaria hoje, os antipadrões que já vi em campo e o checklist que você pode executar amanhã.Abrir Architecture Studies· 3
Design Doc / RFCDesign Doc: Suíte de Avaliação Contínua para Agentes com Bedrock AgentCoreAgentes LLM em produção degradam silenciosamente à medida que modelos, ferramentas e prompts evoluem — sem uma disciplina de avaliação contínua, regressões chegam ao usuário antes de serem detectadas. Este documento propõe uma arquitetura completa de avaliação offline e online usando Amazon Bedrock AgentCore, com datasets versionados, quality gates em CI/CD, sinais de runtime e testes adversariais sistemáticos.Abrir Design Doc / RFCDesign Doc: Observabilidade de LLMs — da GPU à Qualidade de RespostaEste documento propõe uma arquitetura de observabilidade fim a fim para plataformas de inferência LLM rodando em Amazon SageMaker AI e Amazon Bedrock, cobrindo desde métricas de hardware (GPU utilization, memória) até qualidade semântica de resposta, drift de comportamento e custo por tenant. O design integra CloudWatch, Amazon Managed Grafana, rastreamento por prompt e alarmes de regressão automáticos, com separação clara de responsabilidades entre camadas de coleta, armazenamento, avaliação e alerta.Abrir Decisão (ADR)ADR: LLM Auto-Hospedado (EKS + vLLM) vs API Gerenciada (Bedrock)Este ADR avalia a decisão entre hospedar modelos de linguagem em infraestrutura própria com EKS e vLLM versus consumir modelos via Amazon Bedrock. A análise cobre custo por token, carga operacional de MLOps, cold start, residência de dados e ponto de break-even por volume de tokens.Abrir