AWS Neuron 2.32 führt erweiterte NKI-Programmierung, MXFP8-Trainingskernel und Kollektive mit variabler Größe für Trn2 und Trn ein
AWS Neuron 2.32.0 ist jetzt verfügbar und führt NKI 0.6.0 mit einem Top-K-Befehl auf dem Gerät, einem „all-gather“ mit variabler Länge für Kernel ein, deren Ränge unterschiedlich große Tensoren enthalten, und neuen Loop-Konstrukten für datenabhängige Iterationen.
Diese Version enthält außerdem 13 neue NKI Library-Kernel für Mixture of Experts (MoE)-Training und spärliche Aufmerksamkeit sowie eine neue Neuron Agentic Development-Fähigkeit, die Transformer-Modelle auf das vLLM Neuron-Plugin portiert. Die Kernel der NKI Library decken die Kontextkodierung für DeepSeek-v3.2 spärliche latente Mehrkopf-Aufmerksamkeit ab, die MXFP8-Aufmerksamkeit für den Decodierungsschritt und einen passenden MXFP8-Vorwärts- und Rückwärtspass, mit dem blockweise MoE-Ebenen in MXFP8 von Ende zu Ende trainieren können, mit PyTorch-Referenzimplementierungen für 22 zusätzliche Kernel.
Die Neuron Runtime fügt auf Trn2 und Trn3 All-Gather-, Reduce-Scatter- und All-to-All-Kollektive variabler Größe hinzu, sodass jeder Rang eine andere Anzahl von Elementen beitragen oder erhalten kann. Das vLLM Neuron-Plugin wechselt zu vLLM 0.24.0 und ist in allen Neuron Deep Learning AMIs und Deep Learning-Containern enthalten. Der Neuron Compiler bietet eine explizite Kontrolle über die 64-Bit-Integer-Kompilierung, und Neuron Explorer fügt dem System Trace Viewer die CPU-Auslastung pro Kern des Hosts hinzu.
AWS Neuron ist in allen AWS-Regionen verfügbar, in denen Amazon-EC2-Trn1-, -Trn2-, -Trn3-, -Inf2- und -Inf1-Instances verfügbar sind. Informationen zur regionalen Verfügbarkeit finden Sie in der Tabelle der AWS-Regionen.
Für die ersten Schritte empfehlen wir die folgenden Ressourcen: