Originally published at: AI 추론 지연 시간을 줄이기 위한 Speculative Decoding 소개 - NVIDIA Technical Blog
거대 언어 모델(LLM)로 텍스트를 생성할 때는 구조적인 한계로 인해 성능을 제대로 끌어내기 어려운 경우가 많습니다. GPU는 뛰어난 연산 성능을 갖추고 있지만, 오토리그레시브 방식 특성상 토큰을 하나씩 순차적으로 생성해야 하다 보니 대부분의 자원이 놀게 됩니다. 매 토큰마다 전체 모델을 다시 실행하고, 가중치를 불러오며, 메모리까지 동기화해야 해서 지연은 커지고 하드웨어 활용도는 낮아집니다. 이런 비효율적인 반복은 시스템 전체…