Рекомендации по логическому выводу генеративного искусственного интеллекта для Amazon SageMaker теперь доступны в SageMaker AI Studio

Проведено: 20 авг. 2026 г.

Amazon SageMaker AI теперь предлагает Рекомендации по логическому выводу генеративного искусственного интеллекта в SageMaker AI Studio, предоставляя клиентам пошаговый путь поиска оптимальной конфигурации логического вывода для своих рабочих нагрузок с минимальным программированием и без него. Это основано на запуске в апреле 2026 года технологии на основе API, расширяющей ту же инфраструктуру оценки производительности на команды, предпочитающие визуальный рабочий процесс программному доступу.

Для развертывания моделей генеративного искусственного интеллекта в производственной среде необходимо найти правильное сочетание типа инстанса, контейнера обслуживания и стратегии оптимизации. Чтобы все исправить, обычно требуются недели ручной оценки производительности, настройки конфигурации и метода проб и ошибок, при этом нелегко определить, действительно ли окончательная настройка оптимальна. Благодаря новому интерфейсу клиенты описывают свою рабочую нагрузку и самые важные моменты, будь то задержки, пропускная способность или стоимость, а SageMaker AI сделает все остальное. Он тестирует несколько конфигураций в реальной инфраструктуре графических процессоров с использованием NVIDIA AIPerf, применяет целевые методы, такие как спекулятивное декодирование пропускной способности или настройка ядра на задержку, и выдает ранжированные готовые к работе рекомендации с измеренными данными о производительности. Команды получают проверенную конфигурацию за несколько часов, а не недель, без необходимости решать, какие методы применять и как их настроить.

Благодаря новому интерфейсу клиенты описывают свою рабочую нагрузку и самые важные моменты, будь то задержки, пропускная способность или стоимость, а SageMaker AI делает все остальное. Он тестирует несколько конфигураций в реальной инфраструктуре графических процессоров с использованием NVIDIA AIPerf, применяет целевые методы, такие как спекулятивное декодирование пропускной способности или настройка ядра на задержку, и выдает ранжированные готовые к работе рекомендации с измеренными данными о производительности. Команды получают проверенную конфигурацию за несколько часов, а не недель, без необходимости решать, какие методы применять и как их настроить.

В SageMaker AI Studio в разделе «Задания, оптимизация логического вывода» клиенты выбирают профиль использования (взаимодействие, генерация, суммирование или настройка), затем – цель оптимизации (минимизация задержек, максимизация пропускной способности или минимизация затрат), а затем – модель из JumpStart, S3, реестра моделей или существующей модели SageMaker. Рекомендации ранжируются по TTFT, задержкам между токенами, пропускной способности и стоимости. Их можно визуально сравнить перед развертыванием на адресе реального времени SageMaker непосредственно из Studio.

Дополнительная плата за составление рекомендаций не взимается. К заданиям по оптимизации и адресам, выделенным в ходе оценки производительности, применяется стандартная оплата за вычислительные ресурсы. Эта возможность доступна в следующих регионах: Восток США (Огайо, Северная Вирджиния), Запад США (Орегон), Европа (Ирландия, Франкфурт), Азиатско-Тихоокеанский регион (Сингапур, Токио). Дополнительные сведения см. в публикации в блоге или в документацию.