AWS Neuron 2.32 introduit une programmation NKI étendue, des noyaux de formation MXFP8 et des collectifs de taille variable pour Trn2 et Trn
AWS Neuron 2.32.0 est désormais disponible, introduisant NKI 0.6.0 avec une instruction top-K intégrée à l’appareil, une fonction « all-gather » de longueur variable pour les noyaux dont les rangs contiennent des tenseurs de tailles différentes, et de nouvelles structures de boucle pour l’itération en fonction des données.
Cette version introduit également 13 nouveaux noyaux de bibliothèque NKI destinés à l’entraînement aux modèles mixtes d’experts (MoE) et à une attention limitée, ainsi qu’une nouvelle compétence Neuron Agentic Development, qui permet de transférer les modèles de transformeurs vers le plug-in vLLM Neuron. Les noyaux de la bibliothèque NKI couvrent l’encodage contextuel pour DeepSeek-v3.2, une attention latente multi-têtes clairsemée, une attention MXFP8 pour l’étape de décodage et une passe MXFP8 correspondante vers l’avant et vers l’arrière, qui permet aux couches MoE par blocs de s’entraîner de bout en bout en MXFP8, avec des implémentations de référence PyTorch pour 22 noyaux supplémentaires.
Le Neuron Runtime ajoute des collectifs de taille variable à rassemblement, à dispersion réduite et à diffusion universelle sur Trn2 et Trn3, permettant à chaque rang de contribuer ou de recevoir un nombre différent d’éléments. Le plug-in vLLM Neuron passe à vLLM 0.24.0 et est inclus dans toutes les AMI Neuron Deep Learning et tous les conteneurs Deep Learning. Le compilateur Neuron ajoute un contrôle explicite sur la compilation d’entiers 64 bits, et l’Explorateur Neuron ajoute l’utilisation du CPU hôte par cœur au System Trace Viewer.
AWS Neuron est disponible dans toutes les Régions AWS où les instances Amazon EC2 Trn1, Trn2, Trn3, Inf2 et Inf1 sont disponibles. Pour en savoir plus sur la disponibilité régionale, consultez le tableau des régions AWS.
Pour commencer, consultez les ressources suivantes :