Recomendação de inferência de IA generativa do Amazon SageMaker agora disponível no SageMaker AI Studio
O Amazon SageMaker AI agora oferece recomendações de inferência para IA generativa no SageMaker AI Studio, proporcionando aos clientes um caminho guiado, low-code ou no-code, para encontrar a melhor configuração de inferência para suas workloads. Isso se baseia no lançamento via API de abril de 2026, estendendo a mesma infraestrutura de benchmarking para equipes que preferem um fluxo de trabalho visual em vez de acesso programático.
Implantar modelos de IA generativa em produção exige encontrar a combinação ideal de tipo de instância, contêiner de atendimento e estratégia de otimização. Acertar essa combinação normalmente envolve semanas de testes manuais, ajustes de configuração e tentativa e erro, sem uma forma simples de saber se a configuração final é realmente a ideal. Com a nova experiência, os clientes descrevem sua workload e o que mais importa — seja latência, throughput ou custo — e o SageMaker AI faz o restante. Ele avalia diversas configurações em infraestrutura real de GPU usando o NVIDIA AIPerf, aplica técnicas alinhadas ao objetivo — como speculative decoding para throughput ou ajustes de kernel para latência — e retorna recomendações classificadas, prontas para produção, acompanhadas de dados de performance mensurados. As equipes chegam a uma configuração validada em horas, em vez de semanas, sem precisar decidir quais técnicas aplicar ou como configurá‑las.
Com a nova experiência, os clientes descrevem sua workload e o que mais importa — seja latência, throughput ou custo — e o SageMaker AI faz o restante. Ele avalia diversas configurações em infraestrutura real de GPU usando o NVIDIA AIPerf, aplica técnicas alinhadas ao objetivo — como speculative decoding para throughput ou ajustes de kernel para latência — e retorna recomendações classificadas, prontas para produção, acompanhadas de dados de performance mensurados. As equipes chegam a uma configuração validada em horas, em vez de semanas, sem precisar decidir quais técnicas aplicar ou como configurá‑las.
No SageMaker AI Studio, em Trabalhos > Otimização de inferência, os clientes selecionam um perfil de caso de uso (Interagir, Gerar, Resumir ou Custom), escolhem um objetivo de otimização (minimizar latência, maximizar throughput ou minimizar custo) e selecionam seu modelo a partir do JumpStart, S3, Catálogo de Modelos ou de um modelo existente no SageMaker. As recomendações são classificadas por TTFT, latência entre tokens, throughput e custo, e podem ser comparadas visualmente antes da implantação em um endpoint em tempo real do SageMaker diretamente pelo Studio.
Não há custo adicional para gerar recomendações. Os custos padrão de computação se aplicam aos trabalhos de otimização e aos endpoints provisionados durante o processo de benchmarking. Esse recurso está disponível nas regiões Leste dos EUA (Norte da Virgínia), Oeste dos EUA (Oregon), Leste dos EUA (Ohio), Europa (Irlanda), Europa (Frankfurt), Ásia-Pacífico (Singapura) e Ásia-Pacífico (Tóquio). Para saber mais, acesse a publicação do blog ou a documentação.