Модели LocateAnything-3B, Qwen-AgentWorld-35B-A3B и Qwen3.5-122B-A10B теперь доступны в Amazon SageMaker JumpStart
Модели LocateAnything-3B от NVIDIA, а также Qwen-AgentWorld-35B-A3B и Qwen3.5-122B-A10B от Qwen теперь доступны в Amazon SageMaker JumpStart, что расширяет портфель базовых моделей, доступных клиентам AWS. Эти три модели предоставляют специализированные возможности, в том числе визуальную привязку объектов, имитацию агентской среды и крупномасштабные мультимодальные логические рассуждения, позволяя клиентам развертывать высокопроизводительные и масштабируемые ИИ-решения на базе инфраструктуры AWS.
Специализированные возможности этих моделей предназначены для решения различных задач корпоративного ИИ.
Модель LocateAnything-3B оптимизирована для быстрого и качественного выявления расположения и визуальной привязки объектов на изображениях при получении инструкций на естественном языке. В ней используется метод параллельного декодирования рамки (Parallel Box Decoding, PBD), при котором на изображении декодируются ограничивающие прямоугольники и точки как атомарные единицы за один проход. При этом сохраняется геометрическая связность и за счет значительного параллелизма ускоряется работа. Модель обеспечивает высокоточное определение расположения объектов, обнаружение в условиях высокой плотности и точечную локализацию в самых разных предметных областях, подходя как для задач корпоративной аналитики, так и физического искусственного интеллекта.
Модель Qwen-AgentWorld-35B-A3B превосходно имитирует агентские среды в семи областях взаимодействия: вызов инструментов, поиск, терминалы, разработка программного обеспечения, Android, Интернет и ОС. Это первая в мире языковая модель, охватывающая все эти семь областей и позволяющая прогнозировать последующие состояния сред на основе истории действий и взаимодействия агентов посредством длинной цепочки логических рассуждений. Она была обучена на более чем 10 миллионах траекторий взаимодействия в реальном мире.
Модель Qwen3.5-122B-A10B обеспечивает высокопроизводительные возможности мультимодальных логических рассуждений и эффективность, пригодную для производственных сред. Она поддерживает в совокупности 122 млрд параметров с активацией только 10 млрд на каждый токен, а ее гибридная архитектура объединяет сети Gated Delta Networks с частичной «Смесью экспертов» (256 экспертов). Благодаря встроенному контекстному окну в 262 тыс. токенов и минимальной задержке модель показывает отличные результаты в логических рассуждениях, написании кода, работе агентов и визуальном распознавании.
Используя SageMaker JumpStart, клиенты могут развернуть любую из этих моделей всего несколькими щелчками мыши для своих примеров использования искусственного интеллекта.
Чтобы начать работу с этими моделями, откройте каталог моделей SageMaker JumpStart в консоли SageMaker или воспользуйтесь пакетом средств разработки ПО (SDK) SageMaker для Python, чтобы развернуть модели в своем аккаунте AWS. Подробные инструкции о развертывании и использовании базовых моделей в SageMaker JumpStart см. в документации Amazon SageMaker JumpStart.