Skip to content
Explorar
fernando
.moretes.com
Blog
Estudos
Cursos
E-books
Open Source
Podcast
Buscar no site
⌘K
Perguntar
PT
Loading…
Pergunte ao Fernando (IA)
Assuntos
/
sagemaker-hyperpod
sagemaker-hyperpod
3 conteúdos publicados sobre este assunto.
Artigos
· 3
IA & Agentes
Treino e inferência na mesma GPU: quatro formas de partilhar 10 mil aceleradores
O China Merchants Bank venceu o CNCF End User Case Study Contest ao colocar treino, fine-tuning e inferência num único plano de controle Kubernetes sobre quase 10 mil aceleradores heterogêneos: utilização média de 35% para mais de 60% e custo por milhão de tokens cortado em mais de 60%. Analiso o que faz esse número acontecer — fila com quota, autoscaling por métrica, virtualização de GPU e cache de dados — e comparo quatro formas de reproduzi-lo na AWS, com a matriz de decisão que eu usaria num banco.
Abrir
IA & Agentes
Cold start de LLM no HyperPod: de 27 minutos a segundos com model caching
O SageMaker HyperPod passou a pré-carregar pesos de modelo em NVMe local e imagens de contêiner nos nós, com cerca de 60% de scale-out mais rápido em modelos de 57 a 145 GB. Conto a migração de um endpoint de análise de documentos passo a passo — do baseline de 27 minutos até o primeiro token à reescrita da política de autoscaling que só existia para conviver com o cold start.
Abrir
IA & Agentes
DPD no HyperPod: Prefill e Decode Disagregados em Produção
O SageMaker HyperPod agora suporta Disaggregated Prefill and Decode (DPD), separando as duas fases de inferência LLM em pools de GPU dedicados conectados via EFA e GPU-Direct RDMA. Essa mudança resolve um dos problemas mais persistentes em produção: um único request de contexto longo degradando a latência de token de todos os requests concorrentes. Neste artigo, analiso os trade-offs reais, os padrões de falha que você vai encontrar e um playbook para habilitar DPD em workloads financeiros de alta exigência.
Abrir