O Amazon SageMaker HyperPod agora oferece suporte ao cache de modelos para inferência mais rápida, escalabilidade automática e redução de partidas a frio
O Amazon SageMaker HyperPod agora oferece suporte ao cache de modelos, uma otimização de inferência que pré-carrega pesos de modelos e imagens de contêiner nos nós do cluster para que os pods comecem em segundos, em vez de minutos.
Ao executar a inferência LLM em escala para workloads como assistentes de bate-papo, pipelines de agentes, RAG e análise de documentos, a inicialização a frio é um verdadeiro gargalo. Implantações e eventos de expansão passam a maior parte do tempo baixando imagens de contêineres e pesos de modelos. À medida que o tamanho do modelo aumenta, isso piora, com modelos grandes demorando dezenas de minutos antes de poderem atender ao tráfego.
O cache de modelos resolve isso com dois recursos independentes. O cache de pesos armazena os pesos do modelo no NVMe local para que os pods leiam do armazenamento local rápido em vez de usarem o S3 ou FSx pela rede. O cache de imagem extrai previamente a imagem do contêiner para que os pods pulem totalmente o download do ECR. Se um pod cair em um node sem um cache aquecido, ele volta a ser retirado automaticamente da fonte original, então não há risco de os pods travarem ou falharem.
Os benchmarks em modelos de 57 GB a 145 GB mostram uma expansão horizontal cerca de 60% mais rápida, e o cache de imagem reduz mais de dois minutos do tempo de extração da imagem (redução de 97%). O benefício aumenta com o tamanho do modelo, mantendo a confiabilidade do caminho de origem original.
Os clientes habilitam o armazenamento em cache de modelos por meio do HyperPod Inference Operator adicionando uma seção modelCacheConfig ao recurso InferenceEndpointConfig ou JumpStartModel. O operador lida com todo o ciclo de vida sem nenhuma configuração ou limpeza manual.
Agora, o cache de modelos está geralmente disponível em todas as regiões em que o SageMaker HyperPod está disponível. Para começar a suar, consulte a documentação do SageMaker HyperPod.