Amazon SageMaker HyperPod теперь поддерживает кэширование моделей для более быстрого автомасштабирования логического вывода и сокращения количества холодных запусков
Amazon SageMaker HyperPod теперь поддерживает кэширование моделей – оптимизацию логического вывода, которая позволяет предварительно загружать веса моделей и образы контейнеров на узлы кластера, – поэтому запуск подов занимает секунды, а не минуты.
При масштабном выполнении логического вывода LLM для таких рабочих нагрузок, как чат-помощники, агентные конвейеры, RAG и анализ документов, холодный запуск становится узким местом. Развертывания и события масштабирования тратят большую часть времени на загрузку образов контейнеров и весов моделей. По мере увеличения размера модели ситуация ухудшается: для больших моделей требуется несколько десятков минут, прежде чем они смогут обслуживать трафик.
Кэширование моделей решает эту проблему с помощью двух независимых возможностей. Кэш весов сохраняет веса моделей в локальном NVMe, поэтому поды считывают их из быстрого локального хранилища, а не загружают из S3 или FSx по сети. Кэш образов предварительно загружает образ контейнера, поэтому поды полностью пропускают его загрузку из ECR. Если под попадает на узел без прогретого кэша, он автоматически возвращается к загрузке данных из исходного источника, поэтому нет риска зависания или сбоя подов.
Результаты тестов моделей объемом от 57 ГБ до 145 ГБ показали, что масштабирование ускоряется примерно на 60 %, а кэш образов сокращает время загрузки образов более чем на две минуты (на 97 %). Эффект усиливается с ростом размера модели при сохранении надежности пути к исходному источнику.
Клиенты включают кэширование моделей с помощью оператора вывода HyperPod, добавляя раздел modelCacheConfig в ресурс InferenceEndpointConfig или JumpStartModel. Оператор управляет всем жизненным циклом без ручной настройки или очистки.
Кэширование моделей теперь общедоступно во всех регионах, в которых предлагается SageMaker HyperPod. Для начала работы ознакомьтесь с документацией по SageMaker HyperPod.