Originally published at: NVIDIA Exemplar Cloud: AI 인프라의 최고 성능을 이끌어내기 위한 제언 - NVIDIA Technical Blog
동일한 NVIDIA H100, GB200 NVL72 또는 GB300 NVL72 시스템으로 구성된 두 AI 컴퓨팅 클러스터라 할지라도, 실제 현장에서는 학습 처리량에서 큰 차이가 나는 경우가 있습니다. 동일한 워크로드, 동일한 모델, 동일한 글로벌 배치 크기로 실행하더라도, 파트너 배포 환경과 NVIDIA 레퍼런스 아키텍처 간에 8%~12%의 성능 격차가 발생하는 사례를 자주 접하게 됩니다. 원인은 대개 커널, 하이퍼바이저, BIOS, NVIDIA Collective…