Originally published at: NVIDIA Nemotron 3 Ultra, 장기 실행 에이전트를 위한 더 빠르고 효율적인 추론 지원 - NVIDIA Technical Blog
단순한 단일 턴 챗봇이 복잡한 워크플로우를 완수하기 위해 추론하고, 맥락을 유지하고, 도구를 사용하며 여러 턴에 걸쳐 효율적으로 실행되는 장기 실행 에이전트로 진화하고 있습니다. 그러나 이러한 멀티 에이전트 워크플로우는 토큰 수를 빠르게 증가시킵니다. 에이전트는 계획을 세우고, 도구를 호출하고, 서브 에이전트를 실행하고, 정보를 수신한 뒤 기록, 출력, 추론 단계를 지속적으로 모델에 다시 전달합니다. 작업이 길어질수록 이러한 지속적인…