AWS Neuron 2.32에 확장된 NKI 프로그래밍, MXFP8 훈련 커널, Trn2 및 Trn용 가변 크기 집합 통신 도입
AWS Neuron 2.32.0이 출시되었습니다. 이번 버전에는 온디바이스 top-K 명령을 지원하는 NKI 0.6.0, 랭크마다 텐서 크기가 서로 다른 커널을 위한 가변 길이 `all-gather`, 데이터 종속적 반복을 위한 새로운 루프 구문이 도입되었습니다.
이번 릴리스에는 전문가 혼합(MoE) 훈련과 희소 어텐션을 위한 13개의 새로운 NKI Library 커널, 트랜스포머 모델을 vLLM Neuron 플러그인으로 포팅하는 새로운 Neuron Agentic Development 스킬도 도입되었습니다. NKI 라이브러리 커널은 DeepSeek-V3.2 희소 멀티헤드 잠재 어텐션을 위한 컨텍스트 인코딩, 디코딩 단계를 위한 MXFP8 어텐션, MXFP8에서 엔드 투 엔드 블록 단위 MoE 계층 훈련이 가능하도록 매칭된 MXFP8 순방향 및 역방향 패스를 보장하며 22개 추가 커널에 대한 PyTorch 참조 구현도 포함되어 있습니다.
Neuron Runtime은 Trn2와 Trn3에 가변 크기 all-gather, reduce-scatter, all-to-all 집합 통신을 추가하므로 각 랭크가 서로 다른 개수의 요소를 제공하거나 받을 수 있습니다. vLLM Neuron 플러그인은 vLLM 0.24.0으로 이동하며, 모든 Neuron Deep Learning AMI 및 Deep Learning Containers에 포함됩니다. Neuron Compiler는 64비트 정수 컴파일에 대한 명시적 제어를 추가하고, Neuron Explorer는 System Trace Viewer에 코어당 호스트 CPU 사용률을 추가합니다.
AWS Neuron은 Amazon EC2 Trn1, Trn2, Trn3, Inf2, Inf1 인스턴스가 제공되는 모든 AWS 리전에서 사용할 수 있습니다. 리전별 AWS PrivateLink 사용 가능 여부는 AWS 리전 표에서 자세히 알아볼 수 있습니다.
시작하려면 다음 리소스를 참조하세요.