IA Builder na prática: os agentes executam, eu decido o que vai ao ar
Ouvir artigo
gerado ao ouvirGerado apenas no primeiro play
Com tecnologia Amazon Polly + OmniVoice
No AWS Summit São Paulo 2026 a AWS apresentou o profissional que define intenção, orquestra agentes e valida o resultado, com o AI-DLC e o Kiro resumidos em "a equipe decide em cada fase; a IA executa". Eu já trabalho assim neste site, e mostro com números onde a esteira de agentes errou em silêncio e por que validar é o trabalho.
No AWS Summit São Paulo de 3 de setembro de 2026, no São Paulo Expo, o fio que atravessou o keynote de Laura Grit e Cleber Morais foi o de um profissional que escreve menos script e passa mais tempo definindo intenção de negócio, orquestrando agentes especialistas e validando o que eles produzem. O mercado já chama esse perfil de IA Builder. Eu reconheço o desenho porque este site roda assim: mais de 110 artigos bilíngues, studies semanais e narração em voz clonada saem de uma esteira de agentes que eu orquestro e não escrevo linha a linha. A pergunta que me interessa não é se os agentes conseguem executar. É quem percebe quando eles executam errado, e quanto custa perceber tarde. Este texto é a resposta que eu tenho, com os números e com as falhas.
Três números da minha esteira
O que foi dito no palco, e o que eu consegui confirmar
O evento teve mais de 170 sessões e cerca de 18 mil participantes, segundo o relato da comunidade. Cleber Morais, diretor-geral da AWS no Brasil, abriu marcando os 15 anos da AWS no país. Laura Grit, VP e Distinguished Engineer, falou de sistemas agênticos no desenvolvimento e organizou o ciclo em três movimentos: write it right, ship it fast e keep it modern.
O Kiro apareceu no palco com uma frase que resume a proposta: "a equipe decide em cada fase; a IA executa". Ela vem do AI-DLC (AI-Driven Development Life Cycle), metodologia que Raja SP publicou no blog de DevOps da AWS em 31 de julho de 2025. O ciclo tem três fases (Inception, Construction e Operations), troca sprint por Bolt (ciclos de horas ou dias) e repete um padrão em toda atividade: a IA monta o plano, pede esclarecimento e implementa; o humano toma as decisões críticas.
Os anúncios citados no keynote foram o AWS DevOps Agent, a modernização contínua do AWS Transform, o AWS Continuum e o Web Search no Amazon Bedrock AgentCore. Vários estavam em preview e tinham sido anunciados antes, no Summit de Nova York em 17 de junho. Nas sessões, apareceu também a nova certificação AWS Certified AI Business Strategist (AIB-C01).
Uma ressalva honesta: o rótulo IA Builder eu encontrei no relato da DP6 ("a AWS está chamando de IA Builder"), não numa página oficial da AWS. A agenda oficial do evento não usa o termo. Trato o rótulo como enquadramento útil, não como produto ou cargo com definição publicada. O que tem definição publicada é o AI-DLC, e é nele que eu me apoio daqui em diante.
A frase que importa é a segunda metade
"A IA executa" é a metade que vende. "A equipe decide em cada fase" é a metade que dá trabalho, porque decidir exige um critério escrito antes, e validar exige evidência depois. Em sistema financeiro isso não é cerimônia: o portão de aprovação é o ponto em que alguém assina, e assinatura sem critério vira carimbo.
A AWS desenhou o Kiro em cima dessa ideia. Uma spec no Kiro gera três arquivos, requirements.md, design.md e tasks.md, e entre cada fase há um ponto de aprovação humana antes de seguir. O repositório aberto do AI-DLC, awslabs/aidlc-workflows, foi mais longe: na versão 2.10.0, sob licença MIT-0, ele descreve 5 fases e 33 estágios, 14 agentes (11 especialistas de domínio, 2 revisores e um compositor adaptativo) e uma trilha de auditoria de 112 eventos. O workflow seleciona o caminho a partir do pedido, pergunta o que falta decidir e para nos portões de aprovação antes de avançar.
O detalhe que mais me chamou atenção está na lista de ferramentas suportadas: Claude Code, Kiro CLI, Kiro IDE, Codex CLI, Cursor, opencode e GitHub Copilot. Duas delas são exatamente as que rodam a minha esteira. Isso diz uma coisa importante sobre o modelo IA Builder: o método é o desenho dos portões, não a ferramenta. Dá para trocar o executor sem trocar o processo, desde que o processo esteja escrito em algum lugar que não seja a cabeça de quem opera.
É aqui que a conversa sobre produtividade costuma ficar rasa. Ganho de velocidade com agentes é real e fácil de medir na entrada. O custo aparece na saída: no portão que não existia, no erro que passou porque ninguém tinha escrito o que é errado. Esse custo não é o de construir a esteira, é o de manter os portões funcionando por anos.
O número da Livelo que eu não consegui confirmar como foi repassado
O relato do evento diz que a Livelo alcançou 30% de produtividade e US$ 3,8 milhões de economia com o Kiro. O estudo de caso oficial da AWS diz outra coisa. Num programa de 3 meses com a Compass UOL, sobre um time de cerca de 240 engenheiros, 77% dos engenheiros pesquisados relataram redução média de 30% no tempo de entrega, com até 50% em algumas atividades; mais de 90% usam ativamente Amazon Q Developer e Kiro; a economia líquida estimada no primeiro ano foi de aproximadamente US$ 700 mil (cerca de R$ 3,8 milhões), com valor presente líquido projetado de US$ 2,95 milhões em 5 anos. O ganho é de Q Developer e Kiro juntos, e o Kiro entrou na fase final do programa. Não vi o slide, então não sei em que camada a moeda trocou de lugar. Sei que um número passou por dois resumos e perdeu a unidade. É exatamente o que um agente faz quando ninguém confere a fonte primária.
A esteira deste site, descrita sem verniz
Terça e sexta, às 07:10 de Brasília, um cron no meu homelab chama o gerador de artigos. Ele lê os feeds e dá nota a cada sinal pelos quatro pilares do blog: sistemas financeiros, agentes de IA em produção, resiliência e segurança, FinOps e plataformas de dados. Serviço fora do perfil perde 60 pontos, expansão regional perde 35, digest semanal perde 40. Abaixo de 20 (ARTICLE_MIN_SCORE) não vira artigo, e semana fraca termina sem publicar, de propósito. Na primeira execução com essa regra, a curadoria escolheu o caso do China Merchants Bank, com nota 96, em vez do anúncio regional que estava no topo do feed.
Todo gerador passa por uma única função, callModel. O provider padrão é o Claude Code CLI, escolhido por medição: no mesmo prompt e no mesmo sinal, o Bedrock Sonnet entregou 3.182 palavras em português e 14 blocos; o Codex, 2.252 palavras e 15 blocos, e falhou 6 vezes no artigo longo devolvendo JSON com um colchete a mais; o Claude Code, 3.186 palavras, 17 blocos, de primeira, com 8 de 8 referências respondendo 200. Codex e Bedrock continuam disponíveis por LLM_PROVIDER, sem editar código.
Antes de cada prompt entra a skill voz, que descreve como eu escrevo a partir do que já publiquei. Ela é cópia versionada no repositório, porque o cron das 07:00 não pode depender de rede nem de token do GitHub para escrever. O modelo pesquisa a web para confirmar datas, limites e preços, e o dedupe é pelo link da fonte, num índice index/signals.json fora do prefixo que o site lista como artigo. Studies saem um por quarta. A narração roda às 02:00 com a minha voz clonada numa GPU de casa, uma RTX 5050 sob WSL, com o Mac de fallback. O backend é serverless e pago por uso, com meta abaixo de US$ 5 por mês.
Essa meta explica a troca de provider. O Bedrock custou US$ 84 em 30 dias, e 85% disso (US$ 74) saiu de dois dias de jobs em lote que reenviavam contexto enorme, com 7 e 14 milhões de tokens de entrada. O gerador diário sozinho custava perto de US$ 20 por mês. Os dois CLIs rodam sobre assinatura, então o custo marginal por artigo virou zero.
O meu papel nisso: defino os pilares, a voz e os critérios de qualidade, reviso o que sai e decido o que fica. Os agentes executam.
Onde eu decido, onde o agente executa, onde o código barra
As decisões ficam escritas em arquivo; os portões determinísticos ficam entre o modelo e a produção. Nenhuma etapa depende de alguém lembrar de conferir.
- Pillars + MIN_SCORE 20 · what is worth writing
- Skill voz · versioned copy
- Review & decision · keep, fix or drop
- scoreSignal() · -60 / -35 / -40
- callModel · Claude Code default
- WebSearch + WebFetch · dates, prices, limits
- normalizeArticle · drops invalid blocks
- index/signals.json · dedupe by source link
- no-em-dash.mjs · cleans on entry
- S3 articles bucket · S3 wins by slug
- Site + newsletter · real readers
- RTX 5050 under WSL · cloned voice, 02:00
Quem faz o quê, etapa por etapa
| O que eu decido | O que o agente executa | Como eu valido | |
|---|---|---|---|
| Assunto | Pilares, pesos e nota mínima | Pontua os sinais dos feeds | --plan mostra nota, motivo e o que caiu |
| Fatos | Regra: abrir a URL antes de citar | Pesquisa, abre páginas, cita | curl em cada referência antes de publicar |
| Voz | A skill voz e o que ela proíbe | Escreve pt e en como originais | Leitura do publicado; regra global sem travessão |
| Provider | Critério de troca: medição | Gera o JSON do artigo | Mesmo prompt e sinal nos três providers |
| Publicação | Formato de bloco e índice de dedupe | Sobe para o S3 por script | normalizeArticle lança se faltar prosa ou título |
| Narração | Quando gerar e com qual voz | Renderiza MP3 na GPU de casa | Idempotente: pula objeto que já existe |
Onde a esteira errou, e por que nenhum agente avisou
Três falhas reais, todas silenciosas, todas pegas por mim e não pelo agente.
Dedupe que nunca deduplicava: o Lambda antigo de geração sondava uma chave no S3 derivada do título da fonte e gravava outra derivada do título gerado. As chaves nunca coincidiam, então candidateIsNew devolvia true sempre. A uma execução por dia, ninguém via. No dia em que rodei três invocações seguidas, saíram três artigos sobre o mesmo assunto. O agente fez o trabalho dele perfeitamente nas três vezes. O erro estava no portão, não na execução. A versão local passou a deduplicar pelo link da fonte; o Lambda ficou de fallback, com a regra do EventBridge desabilitada e o bug documentado.
Categoria errada em 86 de 123 artigos: classifyCategory() testava ai como substring solta, sem fronteira de palavra, e era a primeira regra. "available", "domain" e "maintain" casavam. Artigo sobre SAP HANA no EC2 e sobre DocumentDB saiu marcado como ai-agents. Corrigi trocando a primeira regra que casa por contagem de ocorrências, com o título pesando 3 vezes o resumo, e um script idempotente reclassificou 64 artigos. Ninguém percebeu artigo por artigo. Percebi olhando a distribuição do acervo inteiro.
O travessão: a skill voz foi extraída do meu texto publicado e mediu perto de 85 travessões por artigo, tratando isso como ritmo meu. Só que boa parte daquele texto tinha sido escrito junto com modelos, e o travessão virou assinatura de texto gerado. Brasileiro não escreve assim. Em 3 de outubro de 2026 a regra virou código: um módulo único que limpa na entrada, aplicado a 150 arquivos commitados e aos 110 artigos no S3, com varredura das 465 URLs do sitemap terminando em zero ocorrências. Pedir no prompt não bastava; o modelo devolvia o travessão mesmo assim.
Há falhas menores no mesmo padrão. O primeiro artigo gerado pelo Codex publicou [object Object] no rótulo das referências, porque o modelo devolveu objeto bilíngue num campo de texto puro. O artigo longo quebrava com um colchete a mais até eu passar a exigir um schema de saída.
A lição dura: nenhuma dessas falhas gerou erro. Todas passaram pela validação que existia. Validar não é ler o resultado com atenção. É desenhar a verificação que teria pego o erro antes de ele existir.
Como eu valido, na prática
- 1
Escreva o critério antes de pedir a execução
Pilares, pesos e
MIN_SCOREexistem em código antes de o agente escolher qualquer assunto. Se o critério só existe na minha cabeça, a aprovação vira gosto do dia, e gosto não se audita. - 2
Ponha um portão determinístico entre o modelo e a produção
normalizeArticledescarta bloco desconhecido e lança se faltar prosa ou título; o schema de saída barra JSON malformado. O modelo pode errar à vontade antes desse ponto; depois dele, não. - 3
Confira a fonte primária, não o resumo
O caso da Livelo mostra o motivo: o número trocou de moeda em dois resumos. Toda referência é aberta com
curlantes de entrar no texto, e número que não fecha com a fonte oficial sai ou vem com ressalva. - 4
Meça antes de trocar de executor
Troquei de provider com o mesmo prompt e o mesmo sinal nos três, contando palavras, blocos, falhas de parse e referências em 200. Reputação de modelo não entra na planilha.
- 5
Audite o acervo, não só o item do dia
Os 86 artigos na categoria errada só apareceram numa contagem do acervo inteiro. Erro sistemático é invisível na unidade e óbvio no histograma.
- 6
Saiba o que o fallback não tem
O Lambda de fallback não recebe a skill
voze carrega o dedupe quebrado. Está documentado e com a regra desabilitada. Religou, confira a voz antes de publicar.
Os anúncios, pela lente de quem opera
Cada anúncio do keynote cabe no desenho "a equipe decide, a IA executa". A minha leitura é sobre onde fica o portão em cada um.
AWS DevOps Agent: em disponibilidade geral desde 31 de março de 2026, cobra US$ 0,0083 por agent-second em investigações, avaliações e tarefas de SRE sob demanda, o que dá cerca de US$ 29,88 por hora de agente. O trial de 2 meses inclui, em cada mês, até 10 agent spaces e 20 horas de investigação, e não há cobrança com o agente ocioso. A revisão de prontidão de release entrou em preview em junho. Cobrança por segundo significa que investigação longa custa; o portão que me importa num ambiente financeiro é outro: o que o agente pode alterar. Leitura ampla, escrita só pelo fluxo de mudança que já existe.
AWS Transform, modernização contínua: em preview, varre repositórios contra baselines configuráveis e abre pull request de correção. Quem aprova o PR é a pergunta inteira. Um PR por dependência desatualizada em centenas de repositórios é volume que nenhum revisor humano lê com atenção; o critério de merge automático precisa existir antes do primeiro PR.
Web Search no Bedrock: disponível nos EUA, com processamento da consulta dentro de us-east-1, us-east-2 e us-west-2, sem egress de dados por padrão, para os modelos openai.gpt-5.4, 5.5 e 5.6 pela Responses API. Eu já usei a versão do AgentCore no Lambda antigo, a cerca de US$ 0,007 por consulta, por um gateway MCP criado fora do Terraform e com SigV4 escrito à mão. Aposentei quando a geração foi para um CLI com busca nativa: era uma dependência de infraestrutura sem versionamento. Para instituição brasileira regulada, a ausência de sa-east-1 na lista de processamento em região é uma conversa com o time de risco antes de ser uma conversa técnica.
AWS Certified AI Business Strategist (AIB-C01): 130 minutos, nota de 100 a 1.000 com corte em 700, quatro domínios (24%, 28%, 24% e 24%), sem código. O guia diz que o candidato trabalha ao lado de times técnicos mas não constrói soluções de IA. A AWS separou, na certificação, quem decide de quem constrói. Na minha esteira essa separação não funcionaria: quem decide precisa conseguir ler o diff, senão o portão vira carimbo.
A trilha é o produto
A trilha de auditoria de 112 eventos no AI-DLC v2 é o instinto certo, e não por compliance de fachada. Cada número deste artigo sobre a minha esteira saiu de mensagem de commit que explica por que, não o que: o custo de US$ 84, a medição dos três providers, os 86 artigos mal classificados, as 465 URLs varridas. Se eu tivesse deixado os agentes commitarem "fix category" e "update generator", eu não conseguiria reconstruir nenhuma dessas decisões três semanas depois. Em ambiente regulado, a evidência de quem aprovou o quê, com qual critério, é o que você entrega para a auditoria. O código é o que ela olha depois.
Anti-padrões que eu já paguei
- Portão humano sem critério escrito: a aprovação vira carimbo, e carimbo não pega o dedupe que nunca deduplicou.
- Confiar no resumo do resumo: o número da Livelo trocou de moeda em duas camadas; o agente reproduz qualquer camada que você der a ele.
- Validar o item e nunca o acervo: erro sistemático, como 86 de 123 na categoria errada, não aparece lendo um artigo por vez.
- Regra de estilo só no prompt: o modelo devolve o travessão mesmo pedindo que não; regra que importa vira código na entrada.
- Trocar de executor por reputação: sem o mesmo prompt e o mesmo sinal nos candidatos, você troca de modelo e descobre a regressão em produção.
- Fallback que ninguém exercita: o Lambda de reserva ainda escreve na voz antiga; religado sem conferência, publicaria fora do padrão.
Quando adotar o modelo IA Builder
Esteira de agentes com portões (IA Builder)
- Volume repetitivo com critério estável
- Troca de executor sem trocar de processo
- Trilha auditável por padrão
- Custo permanente de manter os portões
- Falha silenciosa onde o portão não existe
- Exige quem leia o diff, não só o resumo
Adote quando o critério cabe num arquivo e o erro se reverte em minutos.
Assistente na IDE, humano no comando
- Adoção barata, sem infraestrutura
- Bom em domínio que você ainda não sabe especificar
- Não escala volume
- Decisão fica na conversa, sem trilha
Use enquanto ainda está descobrindo o que é certo.
Execução humana, IA só para consulta
- Controle total onde o erro é irreversível
- Lento e caro em volume
Mantenha em movimentação financeira, IAM de produção e contrato.
Depois de 16 anos construindo plataformas financeiras, o que eu reconheci no palco do Summit não foi uma função nova. Foi o trabalho de arquiteto sem a parte de digitar. O que eu faria de novo, desde o primeiro dia: escrever o critério de cada portão antes de deixar qualquer agente publicar, e guardar o porquê de cada decisão no commit. O que eu faria diferente: teria contado o acervo inteiro na primeira semana, não no quarto mês. Os 86 artigos mal classificados estavam lá desde o começo; faltou só alguém olhar o histograma.
Veredito
O perfil IA Builder descreve bem o que já acontece com quem opera agentes em produção, e o AI-DLC dá nome e estrutura a isso. O risco é ler só a metade que vende. Use o modelo quando três condições estiverem presentes: o critério de qualidade cabe num arquivo versionado, existe um portão determinístico entre o modelo e a produção, e o erro se reverte em minutos. Foi o caso deste site: artigo errado se republica, categoria errada se reclassifica, travessão se varre. Não use, ou use só como consulta, quando o erro for irreversível ou regulado e você não conseguir escrever o critério de aprovação antes de executar: movimentação financeira, permissão de IAM em produção, contrato. Nesses casos a frase do palco continua certa, mas o "decide" precisa vir com assinatura e evidência, e isso ainda é trabalho humano. Fica a pergunta para quem já roda agentes em produção: qual foi a falha silenciosa que a sua esteira deixou passar, e qual portão você criou depois dela?
Referências
Deep dives de arquitetura, AWS, IA e mercado: direto no seu email. Grátis.
Sem spam · cancele quando quiser
Pergunte ao Fernando sobre isto
Receba uma resposta focada sobre este artigo do meu assistente de IA, baseada no meu trabalho.
Participe da conversa
Entre para comentar
Confirme seu e-mail para participar, você também recebe a newsletter. Sem senha.
Continue lendo
Inteligência de arquitetura, na sua caixa de entrada
Sinais curados e análises originais sobre AWS, IA, sistemas distribuídos e mercado: do jeito que um arquiteto de soluções lê.
- Curadoria de AWS · IA · arquitetura · mercado
- Novos estudos de arquitetura e deep-dives quando saem
- Sínteses diretas, profundidade sem ruído
- Sem spam · double opt-in · cancele quando quiser