# NVIDIA TensorRT-LLM Enhancements Deliver Massive Large Language Model Speedups on NVIDIA H200

**URL:** https://forums.developer.nvidia.com/t/nvidia-tensorrt-llm-enhancements-deliver-massive-large-language-model-speedups-on-nvidia-h200/275005
**Category:** Technical Blog
**Created:** [December 5, 2023, 1:11am UTC](https://forums.developer.nvidia.com/t/nvidia-tensorrt-llm-enhancements-deliver-massive-large-language-model-speedups-on-nvidia-h200/275005 "2023-12-05T01:11:43Z")
**Posts on this page:** 1
**Page:** 1

<div class="post-metadata">

### Author: ![jwitsoe](https://sea2.discourse-cdn.com/nvidia/user_avatar/forums.developer.nvidia.com/jwitsoe/32/16591_2.png) [@jwitsoe](https://forums.developer.nvidia.com/u/jwitsoe)
#### Post date: [December 5, 2023, 1:11am UTC](https://forums.developer.nvidia.com/t/nvidia-tensorrt-llm-enhancements-deliver-massive-large-language-model-speedups-on-nvidia-h200/275005/1 "2023-12-05T01:11:43Z")

</div>

Originally published at: [NVIDIA TensorRT-LLM Enhancements Deliver Massive Large Language Model Speedups on NVIDIA H200 | NVIDIA Technical Blog](https://developer.nvidia.com/blog/nvidia-tensorrt-llm-enhancements-deliver-massive-large-language-model-speedups-on-nvidia-h200/)  
   
Large language models (LLMs) have seen dramatic growth over the last year, and the challenge of delivering great user experiences depends on both high-compute throughput as well as large amounts of high-bandwidth memory. NVIDIA TensorRT-LLM provides optimizations for both peak throughput and memory optimization, delivering massive improvements in LLM inference performance.&nbsp; The latest TensorRT-LLM enhancements…
