# IA Builder na prática: os agentes executam, eu decido o que vai ao ar

No AWS Summit São Paulo 2026 a AWS apresentou o profissional que define intenção, orquestra agentes e valida o resultado, com o AI-DLC e o Kiro resumidos em "a equipe decide em cada fase; a IA executa". Eu já trabalho assim neste site, e mostro com números onde a esteira de agentes errou em silêncio e por que validar é o trabalho.

- URL: https://fernando.moretes.com/blog/ia-builder-na-pratica-os-agentes-executam-eu-decido-o-que-vai-ao-ar-aws-summit-s

- Markdown: https://fernando.moretes.com/blog/ia-builder-na-pratica-os-agentes-executam-eu-decido-o-que-vai-ao-ar-aws-summit-s/article.md?lang=pt

- Published: 2026-10-04T13:40:06.047Z

- Category: IA & Agentes

- Tags: ia-builder, ai-dlc, kiro, aws-summit, agentes-de-ia, amazon-bedrock, finops, claude-code

- Reading time: 12 min

- Source: [AWS Summit São Paulo 2026 e o novo perfil de IA Builder](https://www.dp6.com.br/blogdp6/aws-summit-2026)

---

No AWS Summit São Paulo de 3 de setembro de 2026, no São Paulo Expo, o fio que atravessou o keynote de Laura Grit e Cleber Morais foi o de um profissional que escreve menos script e passa mais tempo definindo intenção de negócio, orquestrando agentes especialistas e validando o que eles produzem. O mercado já chama esse perfil de IA Builder. Eu reconheço o desenho porque este site roda assim: mais de 110 artigos bilíngues, studies semanais e narração em voz clonada saem de uma esteira de agentes que eu orquestro e não escrevo linha a linha. A pergunta que me interessa não é se os agentes conseguem executar. É quem percebe quando eles executam errado, e quanto custa perceber tarde. Este texto é a resposta que eu tenho, com os números e com as falhas.

## Três números da minha esteira

- **US$ 84**: Bedrock em 30 dias. Contra um teto de US$ 5/mês. Foi o que tirou a geração do Bedrock.
- **86 de 123**: Artigos na categoria errada. Um regex sem fronteira de palavra. Nenhum agente reportou.
- **3.186**: Palavras pt na medição. Claude Code, contra 2.252 do Codex, no mesmo prompt e sinal.

## O que foi dito no palco, e o que eu consegui confirmar

O evento teve mais de 170 sessões e cerca de 18 mil participantes, segundo o relato da comunidade. Cleber Morais, diretor-geral da AWS no Brasil, abriu marcando os 15 anos da AWS no país. Laura Grit, VP e Distinguished Engineer, falou de sistemas agênticos no desenvolvimento e organizou o ciclo em três movimentos: *write it right*, *ship it fast* e *keep it modern*.

O Kiro apareceu no palco com uma frase que resume a proposta: **"a equipe decide em cada fase; a IA executa"**. Ela vem do AI-DLC (AI-Driven Development Life Cycle), metodologia que Raja SP publicou no blog de DevOps da AWS em 31 de julho de 2025. O ciclo tem três fases (Inception, Construction e Operations), troca sprint por *Bolt* (ciclos de horas ou dias) e repete um padrão em toda atividade: a IA monta o plano, pede esclarecimento e implementa; o humano toma as decisões críticas.

Os anúncios citados no keynote foram o AWS DevOps Agent, a modernização contínua do AWS Transform, o AWS Continuum e o Web Search no Amazon Bedrock AgentCore. Vários estavam em preview e tinham sido anunciados antes, no Summit de Nova York em 17 de junho. Nas sessões, apareceu também a nova certificação AWS Certified AI Business Strategist (`AIB-C01`).

Uma ressalva honesta: o rótulo **IA Builder** eu encontrei no relato da DP6 ("a AWS está chamando de IA Builder"), não numa página oficial da AWS. A agenda oficial do evento não usa o termo. Trato o rótulo como enquadramento útil, não como produto ou cargo com definição publicada. O que tem definição publicada é o AI-DLC, e é nele que eu me apoio daqui em diante.

## A frase que importa é a segunda metade

"A IA executa" é a metade que vende. "A equipe decide em cada fase" é a metade que dá trabalho, porque decidir exige um critério escrito antes, e validar exige evidência depois. Em sistema financeiro isso não é cerimônia: o portão de aprovação é o ponto em que alguém assina, e assinatura sem critério vira carimbo.

A AWS desenhou o Kiro em cima dessa ideia. Uma spec no Kiro gera três arquivos, `requirements.md`, `design.md` e `tasks.md`, e entre cada fase há um ponto de aprovação humana antes de seguir. O repositório aberto do AI-DLC, `awslabs/aidlc-workflows`, foi mais longe: na versão `2.10.0`, sob licença MIT-0, ele descreve 5 fases e 33 estágios, 14 agentes (11 especialistas de domínio, 2 revisores e um compositor adaptativo) e uma trilha de auditoria de 112 eventos. O workflow seleciona o caminho a partir do pedido, pergunta o que falta decidir e para nos portões de aprovação antes de avançar.

O detalhe que mais me chamou atenção está na lista de ferramentas suportadas: Claude Code, Kiro CLI, Kiro IDE, Codex CLI, Cursor, opencode e GitHub Copilot. Duas delas são exatamente as que rodam a minha esteira. Isso diz uma coisa importante sobre o modelo IA Builder: **o método é o desenho dos portões, não a ferramenta**. Dá para trocar o executor sem trocar o processo, desde que o processo esteja escrito em algum lugar que não seja a cabeça de quem opera.

É aqui que a conversa sobre produtividade costuma ficar rasa. Ganho de velocidade com agentes é real e fácil de medir na entrada. O custo aparece na saída: no portão que não existia, no erro que passou porque ninguém tinha escrito o que é errado. Esse custo não é o de construir a esteira, é o de manter os portões funcionando por anos.

> **O número da Livelo que eu não consegui confirmar como foi repassado:** O relato do evento diz que a Livelo alcançou 30% de produtividade e US$ 3,8 milhões de economia com o Kiro. O estudo de caso oficial da AWS diz outra coisa. Num programa de 3 meses com a Compass UOL, sobre um time de cerca de 240 engenheiros, 77% dos engenheiros pesquisados relataram redução média de 30% no tempo de entrega, com até 50% em algumas atividades; mais de 90% usam ativamente Amazon Q Developer e Kiro; a economia líquida estimada no primeiro ano foi de aproximadamente **US$ 700 mil (cerca de R$ 3,8 milhões)**, com valor presente líquido projetado de US$ 2,95 milhões em 5 anos. O ganho é de Q Developer e Kiro juntos, e o Kiro entrou na fase final do programa. Não vi o slide, então não sei em que camada a moeda trocou de lugar. Sei que um número passou por dois resumos e perdeu a unidade. É exatamente o que um agente faz quando ninguém confere a fonte primária.

## A esteira deste site, descrita sem verniz

Terça e sexta, às 07:10 de Brasília, um cron no meu homelab chama o gerador de artigos. Ele lê os feeds e dá nota a cada sinal pelos quatro pilares do blog: sistemas financeiros, agentes de IA em produção, resiliência e segurança, FinOps e plataformas de dados. Serviço fora do perfil perde 60 pontos, expansão regional perde 35, digest semanal perde 40. Abaixo de 20 (`ARTICLE_MIN_SCORE`) não vira artigo, e semana fraca termina sem publicar, de propósito. Na primeira execução com essa regra, a curadoria escolheu o caso do China Merchants Bank, com nota 96, em vez do anúncio regional que estava no topo do feed.

Todo gerador passa por uma única função, `callModel`. O provider padrão é o Claude Code CLI, escolhido por medição: no mesmo prompt e no mesmo sinal, o Bedrock Sonnet entregou 3.182 palavras em português e 14 blocos; o Codex, 2.252 palavras e 15 blocos, e falhou 6 vezes no artigo longo devolvendo JSON com um colchete a mais; o Claude Code, 3.186 palavras, 17 blocos, de primeira, com 8 de 8 referências respondendo 200. Codex e Bedrock continuam disponíveis por `LLM_PROVIDER`, sem editar código.

Antes de cada prompt entra a skill `voz`, que descreve como eu escrevo a partir do que já publiquei. Ela é cópia versionada no repositório, porque o cron das 07:00 não pode depender de rede nem de token do GitHub para escrever. O modelo pesquisa a web para confirmar datas, limites e preços, e o dedupe é pelo link da fonte, num índice `index/signals.json` fora do prefixo que o site lista como artigo. Studies saem um por quarta. A narração roda às 02:00 com a minha voz clonada numa GPU de casa, uma RTX 5050 sob WSL, com o Mac de fallback. O backend é serverless e pago por uso, com meta abaixo de US$ 5 por mês.

Essa meta explica a troca de provider. O Bedrock custou US$ 84 em 30 dias, e 85% disso (US$ 74) saiu de dois dias de jobs em lote que reenviavam contexto enorme, com 7 e 14 milhões de tokens de entrada. O gerador diário sozinho custava perto de US$ 20 por mês. Os dois CLIs rodam sobre assinatura, então o custo marginal por artigo virou zero.

O meu papel nisso: defino os pilares, a voz e os critérios de qualidade, reviso o que sai e decido o que fica. Os agentes executam.

## Onde eu decido, onde o agente executa, onde o código barra

As decisões ficam escritas em arquivo; os portões determinísticos ficam entre o modelo e a produção. Nenhuma etapa depende de alguém lembrar de conferir.

### 👤 Fernando: decide

- Pillars + MIN_SCORE 20 what is worth writing (user)
- Skill voz versioned copy (user)
- Review & decision keep, fix or drop (user)

### 🤖 Agents: execute

- scoreSignal() -60 / -35 / -40 (ai)
- callModel Claude Code default (ai)
- WebSearch + WebFetch dates, prices, limits (ai)

### 🔧 Deterministic gates

- normalizeArticle drops invalid blocks (security)
- index/signals.json dedupe by source link (security)
- no-em-dash.mjs cleans on entry (security)

### 🟧 AWS: serverless

- S3 articles bucket S3 wins by slug (storage)
- Site + newsletter real readers (frontend)

### 🏠 Homelab: narration

- RTX 5050 under WSL cloned voice, 02:00 (compute)

### Fluxos

- pillars -> score: critério escrito
- score -> callmodel: sinal acima de 20
- voice -> callmodel: injetada em todo prompt
- callmodel -> research: confere fatos
- callmodel -> normalize: JSON bilíngue
- normalize -> nodash: blocos válidos
- nodash -> dedupe: link novo?
- dedupe -> s3: publica e indexa
- s3 -> site: leitura
- s3 -> gpu: fila de áudio
- site -> review: leio o publicado
- review -> pillars: ajusta o critério

## Quem faz o quê, etapa por etapa
| Critério | O que eu decido | O que o agente executa | Como eu valido |
| --- | --- | --- | --- |
| Assunto | Pilares, pesos e nota mínima | Pontua os sinais dos feeds | `--plan` mostra nota, motivo e o que caiu |
| Fatos | Regra: abrir a URL antes de citar | Pesquisa, abre páginas, cita | curl em cada referência antes de publicar |
| Voz | A skill `voz` e o que ela proíbe | Escreve pt e en como originais | Leitura do publicado; regra global sem travessão |
| Provider | Critério de troca: medição | Gera o JSON do artigo | Mesmo prompt e sinal nos três providers |
| Publicação | Formato de bloco e índice de dedupe | Sobe para o S3 por script | `normalizeArticle` lança se faltar prosa ou título |
| Narração | Quando gerar e com qual voz | Renderiza MP3 na GPU de casa | Idempotente: pula objeto que já existe |

## Onde a esteira errou, e por que nenhum agente avisou

Três falhas reais, todas silenciosas, todas pegas por mim e não pelo agente.

**Dedupe que nunca deduplicava:** o Lambda antigo de geração sondava uma chave no S3 derivada do título da *fonte* e gravava outra derivada do título *gerado*. As chaves nunca coincidiam, então `candidateIsNew` devolvia `true` sempre. A uma execução por dia, ninguém via. No dia em que rodei três invocações seguidas, saíram três artigos sobre o mesmo assunto. O agente fez o trabalho dele perfeitamente nas três vezes. O erro estava no portão, não na execução. A versão local passou a deduplicar pelo link da fonte; o Lambda ficou de fallback, com a regra do EventBridge desabilitada e o bug documentado.

**Categoria errada em 86 de 123 artigos:** `classifyCategory()` testava `ai` como substring solta, sem fronteira de palavra, e era a primeira regra. "available", "domain" e "maintain" casavam. Artigo sobre SAP HANA no EC2 e sobre DocumentDB saiu marcado como `ai-agents`. Corrigi trocando a primeira regra que casa por contagem de ocorrências, com o título pesando 3 vezes o resumo, e um script idempotente reclassificou 64 artigos. Ninguém percebeu artigo por artigo. Percebi olhando a distribuição do acervo inteiro.

**O travessão:** a skill `voz` foi extraída do meu texto publicado e mediu perto de 85 travessões por artigo, tratando isso como ritmo meu. Só que boa parte daquele texto tinha sido escrito junto com modelos, e o travessão virou assinatura de texto gerado. Brasileiro não escreve assim. Em 3 de outubro de 2026 a regra virou código: um módulo único que limpa na entrada, aplicado a 150 arquivos commitados e aos 110 artigos no S3, com varredura das 465 URLs do sitemap terminando em zero ocorrências. Pedir no prompt não bastava; o modelo devolvia o travessão mesmo assim.

Há falhas menores no mesmo padrão. O primeiro artigo gerado pelo Codex publicou `[object Object]` no rótulo das referências, porque o modelo devolveu objeto bilíngue num campo de texto puro. O artigo longo quebrava com um colchete a mais até eu passar a exigir um schema de saída.

A lição dura: **nenhuma dessas falhas gerou erro**. Todas passaram pela validação que existia. Validar não é ler o resultado com atenção. É desenhar a verificação que teria pego o erro antes de ele existir.

## Como eu valido, na prática

1. **Escreva o critério antes de pedir a execução**: Pilares, pesos e `MIN_SCORE` existem em código antes de o agente escolher qualquer assunto. Se o critério só existe na minha cabeça, a aprovação vira gosto do dia, e gosto não se audita.

2. **Ponha um portão determinístico entre o modelo e a produção**: `normalizeArticle` descarta bloco desconhecido e lança se faltar prosa ou título; o schema de saída barra JSON malformado. O modelo pode errar à vontade antes desse ponto; depois dele, não.

3. **Confira a fonte primária, não o resumo**: O caso da Livelo mostra o motivo: o número trocou de moeda em dois resumos. Toda referência é aberta com `curl` antes de entrar no texto, e número que não fecha com a fonte oficial sai ou vem com ressalva.

4. **Meça antes de trocar de executor**: Troquei de provider com o mesmo prompt e o mesmo sinal nos três, contando palavras, blocos, falhas de parse e referências em 200. Reputação de modelo não entra na planilha.

5. **Audite o acervo, não só o item do dia**: Os 86 artigos na categoria errada só apareceram numa contagem do acervo inteiro. Erro sistemático é invisível na unidade e óbvio no histograma.

6. **Saiba o que o fallback não tem**: O Lambda de fallback não recebe a skill `voz` e carrega o dedupe quebrado. Está documentado e com a regra desabilitada. Religou, confira a voz antes de publicar.

## Os anúncios, pela lente de quem opera

Cada anúncio do keynote cabe no desenho "a equipe decide, a IA executa". A minha leitura é sobre onde fica o portão em cada um.

**AWS DevOps Agent:** em disponibilidade geral desde 31 de março de 2026, cobra US$ 0,0083 por agent-second em investigações, avaliações e tarefas de SRE sob demanda, o que dá cerca de US$ 29,88 por hora de agente. O trial de 2 meses inclui, em cada mês, até 10 agent spaces e 20 horas de investigação, e não há cobrança com o agente ocioso. A revisão de prontidão de release entrou em preview em junho. Cobrança por segundo significa que investigação longa custa; o portão que me importa num ambiente financeiro é outro: o que o agente pode alterar. Leitura ampla, escrita só pelo fluxo de mudança que já existe.

**AWS Transform, modernização contínua:** em preview, varre repositórios contra baselines configuráveis e abre pull request de correção. Quem aprova o PR é a pergunta inteira. Um PR por dependência desatualizada em centenas de repositórios é volume que nenhum revisor humano lê com atenção; o critério de merge automático precisa existir antes do primeiro PR.

**Web Search no Bedrock:** disponível nos EUA, com processamento da consulta dentro de `us-east-1`, `us-east-2` e `us-west-2`, sem egress de dados por padrão, para os modelos `openai.gpt-5.4`, `5.5` e `5.6` pela Responses API. Eu já usei a versão do AgentCore no Lambda antigo, a cerca de US$ 0,007 por consulta, por um gateway MCP criado fora do Terraform e com SigV4 escrito à mão. Aposentei quando a geração foi para um CLI com busca nativa: era uma dependência de infraestrutura sem versionamento. Para instituição brasileira regulada, a ausência de `sa-east-1` na lista de processamento em região é uma conversa com o time de risco antes de ser uma conversa técnica.

**AWS Certified AI Business Strategist (`AIB-C01`):** 130 minutos, nota de 100 a 1.000 com corte em 700, quatro domínios (24%, 28%, 24% e 24%), sem código. O guia diz que o candidato trabalha ao lado de times técnicos mas não constrói soluções de IA. A AWS separou, na certificação, quem decide de quem constrói. Na minha esteira essa separação não funcionaria: quem decide precisa conseguir ler o diff, senão o portão vira carimbo.

> **A trilha é o produto:** A trilha de auditoria de 112 eventos no AI-DLC v2 é o instinto certo, e não por compliance de fachada. Cada número deste artigo sobre a minha esteira saiu de mensagem de commit que explica *por que*, não *o que*: o custo de US$ 84, a medição dos três providers, os 86 artigos mal classificados, as 465 URLs varridas. Se eu tivesse deixado os agentes commitarem "fix category" e "update generator", eu não conseguiria reconstruir nenhuma dessas decisões três semanas depois. Em ambiente regulado, a evidência de quem aprovou o quê, com qual critério, é o que você entrega para a auditoria. O código é o que ela olha depois.

## Anti-padrões que eu já paguei

- **Portão humano sem critério escrito**: a aprovação vira carimbo, e carimbo não pega o dedupe que nunca deduplicou.
- **Confiar no resumo do resumo**: o número da Livelo trocou de moeda em duas camadas; o agente reproduz qualquer camada que você der a ele.
- **Validar o item e nunca o acervo**: erro sistemático, como 86 de 123 na categoria errada, não aparece lendo um artigo por vez.
- **Regra de estilo só no prompt**: o modelo devolve o travessão mesmo pedindo que não; regra que importa vira código na entrada.
- **Trocar de executor por reputação**: sem o mesmo prompt e o mesmo sinal nos candidatos, você troca de modelo e descobre a regressão em produção.
- **Fallback que ninguém exercita**: o Lambda de reserva ainda escreve na voz antiga; religado sem conferência, publicaria fora do padrão.

## Quando adotar o modelo IA Builder

### Esteira de agentes com portões (IA Builder)

**Pros**
- Volume repetitivo com critério estável
- Troca de executor sem trocar de processo
- Trilha auditável por padrão

**Cons**
- Custo permanente de manter os portões
- Falha silenciosa onde o portão não existe
- Exige quem leia o diff, não só o resumo

**Verdict:** Adote quando o critério cabe num arquivo e o erro se reverte em minutos.

### Assistente na IDE, humano no comando

**Pros**
- Adoção barata, sem infraestrutura
- Bom em domínio que você ainda não sabe especificar

**Cons**
- Não escala volume
- Decisão fica na conversa, sem trilha

**Verdict:** Use enquanto ainda está descobrindo o que é certo.

### Execução humana, IA só para consulta

**Pros**
- Controle total onde o erro é irreversível

**Cons**
- Lento e caro em volume

**Verdict:** Mantenha em movimentação financeira, IAM de produção e contrato.

> **Nota do curador:** Depois de 16 anos construindo plataformas financeiras, o que eu reconheci no palco do Summit não foi uma função nova. Foi o trabalho de arquiteto sem a parte de digitar. O que eu faria de novo, desde o primeiro dia: escrever o critério de cada portão antes de deixar qualquer agente publicar, e guardar o porquê de cada decisão no commit. O que eu faria diferente: teria contado o acervo inteiro na primeira semana, não no quarto mês. Os 86 artigos mal classificados estavam lá desde o começo; faltou só alguém olhar o histograma.

## Veredito

O perfil IA Builder descreve bem o que já acontece com quem opera agentes em produção, e o AI-DLC dá nome e estrutura a isso. O risco é ler só a metade que vende. Use o modelo quando três condições estiverem presentes: o critério de qualidade cabe num arquivo versionado, existe um portão determinístico entre o modelo e a produção, e o erro se reverte em minutos. Foi o caso deste site: artigo errado se republica, categoria errada se reclassifica, travessão se varre. Não use, ou use só como consulta, quando o erro for irreversível ou regulado e você não conseguir escrever o critério de aprovação antes de executar: movimentação financeira, permissão de IAM em produção, contrato. Nesses casos a frase do palco continua certa, mas o "decide" precisa vir com assinatura e evidência, e isso ainda é trabalho humano.

Fica a pergunta para quem já roda agentes em produção: qual foi a falha silenciosa que a sua esteira deixou passar, e qual portão você criou depois dela?

**Rating:** Adote com portões

## Referências

- [Como foi o AWS Summit São Paulo 2026 (Você Certificado)](https://www.vocecertificado.com.br/como-foi-o-aws-summit-sao-paulo-2026/)
- [AI-Driven Development Life Cycle: Reimagining Software Engineering (AWS DevOps Blog)](https://aws.amazon.com/blogs/devops/ai-driven-development-life-cycle/)
- [awslabs/aidlc-workflows (GitHub)](https://github.com/awslabs/aidlc-workflows)
- [Kiro: Specs](https://kiro.dev/docs/specs/)
- [Livelo boosts productivity 30%-50% using Amazon Q Developer and Kiro (AWS case study)](https://aws.amazon.com/solutions/case-studies/livelo-compass-uol/)
- [AWS DevOps Agent pricing](https://aws.amazon.com/devops-agent/pricing/)
- [Introducing Web Search on Amazon Bedrock for foundation model grounding](https://aws.amazon.com/blogs/machine-learning/introducing-web-search-on-amazon-bedrock-for-foundation-model-grounding/)
- [AWS Certified AI Business Strategist (AIB-C01) exam guide](https://docs.aws.amazon.com/aws-certification/latest/ai-business-strategist-01/ai-business-strategist-01.html)
