Amazon SageMaker HyperPod ahora admite el almacenamiento en caché de modelos para acelerar la inferencia, el escalado automático y reducir los arranques en frío
Amazon SageMaker HyperPod ahora admite el almacenamiento en caché de modelos, una optimización de inferencias que carga previamente los pesos de los modelos y las imágenes de los contenedores en los nodos del clúster para que los pods se inicien en segundos en lugar de minutos.
Cuando se ejecuta la inferencia de modelos de lenguaje de gran tamaño (large language models, LLM) a gran escala para cargas de trabajo como los asistentes de chat, las canalizaciones agenciales, la generación aumentada por recuperación (retrieval-augmented generation RAG) y el análisis de documentos, el arranque en frío es un verdadero cuello de botella. Los despliegues y eventos de escalado horizontal dedican la mayor parte del tiempo a descargar imágenes de contenedores y pesos de modelos. A medida que aumenta el tamaño de los modelos, esto empeora, ya que los modelos grandes tardan decenas de minutos en poder atender el tráfico.
El almacenamiento en caché de modelos resuelve este problema con dos características independientes. La caché de pesos almacena los pesos del modelo en un disco NVMe local, de modo que los pods leen desde un almacenamiento local rápido en lugar de obtenerlos de S3 o FSx por medio de la red. La caché de imágenes extrae previamente la imagen del contenedor para que los pods omitan por completo la descarga de ECR. Si un pod aterriza en un nodo sin una caché activa, vuelve a extraerse automáticamente de la fuente original, por lo que no hay riesgo de que los pods se atasquen o fallen.
Los análisis comparativos realizados en modelos de 57 GB a 145 GB muestran una escalabilidad horizontal aproximadamente un 60 % más rápida. Además, la caché de imágenes reduce el tiempo de recuperación de imágenes en más de 2 minutos (una reducción del 97 %). El beneficio aumenta con el tamaño del modelo y, al mismo tiempo, conserva la fiabilidad de la ruta de fuente original.
Los clientes habilitan el almacenamiento en caché de modelos mediante el operador de inferencia de HyperPod agregando una sección modelCacheConfig a su recurso InferenceEndpointConfig o JumpStartModel. El operador administra todo el ciclo de vida sin necesidad de realizar ninguna configuración ni limpieza manual.
El almacenamiento en caché de modelos ahora está disponible de forma general en todas las regiones en las que SageMaker HyperPod está disponible. Para empezar, consulte la documentación de SageMaker HyperPod.