Шлюз логического вывода Amazon SageMaker HyperPod для масштабируемого вывода LLM
Шлюз логического вывода Amazon SageMaker HyperPod – это встроенная в Kubernetes система маршрутизации с учетом графических процессоров, которая развертывается как единое управляемое дополнение EKS в существующей инфраструктуре SageMaker HyperPod без изменений в приложениях. Заменяя неинтеллектуальную циклическую балансировку нагрузки маршрутизацией на основе сигналов логического вывода в реальном времени, он снижает задержку получения первого токена максимум на 82 %, а значение TTFT p99 (время до получения первого токена для 99-го процентиля запросов) – на 97–98 % в сценариях со смешанным оборудованием и всплесками трафика.
Шлюз состоит из трех основных компонентов. Envoy Endpoint завершает HTTPS-трафик и предоставляет один частный адрес для каждого кластера. Маршрутизатор на основе тела считывает имя модели непосредственно из каждого входящего запроса и направляет его в правильный пул графических процессоров, что позволяет одному шлюзу обслуживать множество моделей с одного URL адреса без внесения изменений на стороне клиента. Средство выбора адресов непрерывно оценивает каждый под сервера модели в режиме реального времени по 6 сигналам на уровне логического вывода (использование кэша KV, глубина очереди, резидентность адаптера LoRA, частота попаданий в кэш префиксов, прогнозируемая задержка и выполняющиеся запросы), выбирая оптимальный под для каждого отдельного запроса.
Шлюз работает с любым сервером моделей, совместимым с OpenAI, включая vLLM и SGLang, и не требует изменения кода приложения.
Маршрутизация по кластерам сегодня доступна во всех регионах AWS, в которых поддерживается дополнение для логического вывода SageMaker HyperPod. Скоро – межкластерная и межрегиональная маршрутизация с централизованным шлюзом парка, глобальным ограничением скорости и формированием трафика с учетом уровня затрат.
Чтобы узнать больше, прочитайте блог о запуске и изучите документацию