La recomendación de inferencia de IA generativa para Amazon SageMaker ya está disponible en SageMaker AI Studio

Publicado en: 20 de ago de 2026

Amazon SageMaker AI ahora ofrece recomendaciones de inferencia de IA generativa en SageMaker AI Studio, lo que brinda a los clientes una ruta guiada, con poco código y sin código para encontrar la mejor configuración de inferencia para su carga de trabajo. Esto se basa en el lanzamiento basado en API en abril de 2026, y amplía la misma infraestructura de evaluación comparativa a los equipos que prefieren un flujo de trabajo visual en lugar de un acceso mediante programación.

La implementación de modelos de IA generativa en producción requiere encontrar la combinación correcta de tipo de instancia, contenedor de servicio y estrategia de optimización. Hacer esto correctamente suele implicar semanas de evaluación comparativa manual, ajuste de la configuración y prueba y error, sin una forma fácil de saber si la configuración final es realmente óptima. Con la nueva experiencia, los clientes describen su carga de trabajo y lo que más les importa, ya sea la latencia, el rendimiento o el costo, y SageMaker AI se encarga del resto. Compara múltiples configuraciones en una infraestructura de GPU real usando NVIDIA AIPerf, aplica técnicas alineadas con los objetivos, como la decodificación especulativa para el rendimiento o el ajuste del kernel para la latencia, y devuelve recomendaciones clasificadas y listas para la producción con datos de rendimiento medidos. Los equipos obtienen una configuración validada en horas en lugar de semanas, sin necesidad de decidir qué técnicas aplicar ni cómo configurarlas.

Con la nueva experiencia, los clientes describen su carga de trabajo y lo que más les importa, ya sea la latencia, el rendimiento o el costo, y SageMaker AI se encarga del resto. Compara múltiples configuraciones en una infraestructura de GPU real usando NVIDIA AIPerf, aplica técnicas alineadas con los objetivos, como la decodificación especulativa para el rendimiento o el ajuste del kernel para la latencia, y devuelve recomendaciones clasificadas y listas para la producción con datos de rendimiento medidos. Los equipos obtienen una configuración validada en horas en lugar de semanas, sin necesidad de decidir qué técnicas aplicar ni cómo configurarlas.

En SageMaker AI Studio, en Trabajos, optimización de inferencias, los clientes seleccionan un perfil de caso de uso (interactuar, generar, resumir o personalizar), eligen un objetivo de optimización (minimizar la latencia, maximizar el rendimiento o minimizar el costo) y eligen su modelo de JumpStart, S3, registro de modelos o un modelo de SageMaker existente. Las recomendaciones se clasifican según el TTFT, la latencia entre tokens, el rendimiento y el costo, y se pueden comparar visualmente antes de implementarlas en un punto de conexión en tiempo real de SageMaker directamente desde Studio.

La generación de recomendaciones no conlleva ningún costo adicional. Los costos informáticos estándar se aplican a los trabajos de optimización y a los puntos de conexión aprovisionados durante la evaluación comparativa. Esta capacidad está disponible en las regiones de AWS este de EE. UU. (norte de Virginia), oeste de EE. UU. (Oregón), este de EE. UU. (Ohio), Europa (Irlanda), Europa (Fráncfort), Asia-Pacífico (Singapur) y Asia-Pacífico (Tokio). Para obtener más información, visite la publicación del blog o la documentación.