고급 융합 커널로 MoE 학습 처리량 높이기

Originally published at: 고급 융합 커널로 MoE 학습 처리량 높이기 - NVIDIA Technical Blog

전문가 혼합(MoE, Mixture-of-Experts) 모델은 현대의 대규모 AI 시스템에서 빠르게 핵심 구성 요소로 자리 잡았습니다. MoE는 토큰마다 파라미터의 일부만 활성화하면서도 모델 용량을 크게 키울 수 있어 폭넓게 채택되고 있으며, 실용적인 연산 예산 안에서 성능을 확장하는 데 비할 데 없는 접근 방식을 제공합니다. 모델 규모가 계속 커짐에 따라, 이러한 블록을 최적화하는 일은 학습 처리량을 극대화하는 데 매우…