O AWS Neuron 2.32 apresenta programação NKI expandida, kernels de treinamento MXFP8 e coletivos de tamanho variável para Trn2 e Trn
O AWS Neuron 2.32.0 já está disponível, apresentando o NKI 0.6.0 com uma instrução Top-K no dispositivo, um `all-gather `de comprimento variável para kernels cujas classificações contêm tensores de tamanhos diferentes e novas construções de loop para iteração dependente de dados.
Esta versão também apresenta 13 novos kernels da Biblioteca NKI para treinamento e atenção esparsa em Mistura de Especialistas (MoE), e uma nova habilidade de desenvolvimento de agentes de neurônios que transporta modelos tipo transformadores para o plugin vLLM Neuron. Os kernels da Biblioteca NKI abrangem a codificação de contexto para a atenção latente esparsa de várias cabeças do DeepSeek-v3.2, a atenção MXFP8 para a etapa de decodificação e uma passagem para frente e para trás do MXFP8 correspondente que permite que as camadas MoE em bloco sejam treinadas de ponta a ponta no MXFP8, com implementações de referência do PyTorch para 22 kernels adicionais.
O Neuron Runtime adiciona coletivos all-gather, reduce-scatter e tudo-para-tudo de tamanho variável em Trn2 e Trn3, permitindo que cada classificação contribua ou receba um número diferente de elementos. O plugin vLLM Neuron passa para o vLLM 0.24.0 e está incluído em todas as AMIs e contêineres de aprendizado profundo do Neuron. O Neuron Compiler adiciona controle explícito sobre a compilação de números inteiros de 64 bits, e o Neuron Explorer adiciona a utilização da CPU do host por núcleo ao System Trace Viewer.
O AWS Neuron está disponível em todas as regiões da AWS que oferecem as instâncias Trn1, Trn2, Trn3, Inf2 e Inf1 do Amazon EC2. Para obter mais informações sobre a disponibilidade regional, consulte a Tabela de regiões da AWS.
Para começar a usá-lo, consulte os seguintes recursos: