Originally published at: NAVER Cloud가 NVIDIA Megatron Bridge로 멀티모달 사전 학습을 가속하는 방법 - NVIDIA Technical Blog
HyperCLOVA X는 한국어와 한국 문화에 특화된 NAVER Cloud의 foundation model 제품군으로, LLM과 멀티모달 모델을 아우릅니다. NAVER는 vision encoder에서 출발해 VLM(vision-language model)과 같은 멀티모달 LLM을 처음부터 직접 개발하고 있습니다. 이 글에서는 VLM이 대량의 멀티모달 토큰으로부터 핵심 능력을 습득하는 단계인 멀티모달 사전 학습(multimodal pretraining, MMPT)에 NVIDIA Megatron Bridge를 활용한 경험을 공유합니다. NVIDIA Megatron Bridge와 그 전신인 NeMo를…