gpu
4 conteúdos publicados sobre este assunto.
Architecture Studies· 3
Decisão (ADR)GPU Fracionada no ECS: Decisão de Arquitetura para Inferência de IAO Amazon ECS agora suporta agendamento de GPU fracionada em instâncias EC2 G6f, permitindo partições de até 1/8 de uma GPU NVIDIA L4 com 3 GB de memória. Para plataformas de inferência de IA em escala financeira, isso muda fundamentalmente o cálculo de custo e densidade de workload. Este ADR documenta o contexto, as opções consideradas, a decisão e as consequências operacionais reais.Abrir Decisão (ADR)ADR: LLM Auto-Hospedado (EKS + vLLM) vs API Gerenciada (Bedrock)Este ADR avalia a decisão entre hospedar modelos de linguagem em infraestrutura própria com EKS e vLLM versus consumir modelos via Amazon Bedrock. A análise cobre custo por token, carga operacional de MLOps, cold start, residência de dados e ponto de break-even por volume de tokens.Abrir PlaybookPlaybook: Onde Rodar IA na AWS — Lambda vs Fargate vs ECS/EKS (GPU)Escolher o compute errado para workloads de IA na AWS é o erro mais caro que equipes cometem ao escalar de protótipo para produção. Este playbook mapeia Lambda, Fargate, ECS/EKS+GPU e Bedrock contra os eixos que realmente importam — duração, GPU, padrão de tráfego e custo por token — e entrega uma árvore de decisão acionável para cada cenário.Abrir