# Deepseek 4.1 Flash

**URL:** <https://forums.developer.nvidia.com/t/deepseek-4-1-flash/382896>\
**Category:** DGX Station / GB300 / GB200\
**Tags:** deepseek\
**Created:** [September 10, 2026, 1:02pm UTC](https://forums.developer.nvidia.com/t/deepseek-4-1-flash/382896 "2026-09-10T13:02:18Z")\
**Posts on this page:** 2\
**Page:** 1

<div class="post-metadata">

**Author:** ![james.meadlock](https://developer.download.nvidia.com/images/forums/profile-default-devtalk-84.png) [@james.meadlock](https://forums.developer.nvidia.com/u/james.meadlock)\
**Post date:** [September 10, 2026, 1:02pm UTC](https://forums.developer.nvidia.com/t/deepseek-4-1-flash/382896/1 "2026-09-10T13:02:18Z")

</div>

1st run 3tok/sec  
Working on optimization

> **[GB300 DeepSeek Flash 4.1 Testing](https://al-engr.com/gb300-deepseek-flash-41-testing.html)**
>
> First boot of DeepSeek-V4.1-Flash on one DGX Station GB300: Engram tables pinned in Grace RAM, 15 of 40 expert layers offloaded, server bound at 07:04 CDT. Correct answers, tool calls work, 3.3 tok/s decode. Proof of fit, not a daily lane yet.

---

<div class="post-metadata">

**Author:** ![james.meadlock](https://developer.download.nvidia.com/images/forums/profile-default-devtalk-84.png) [@james.meadlock](https://forums.developer.nvidia.com/u/james.meadlock)\
**Post date:** [September 18, 2026, 3:34pm UTC](https://forums.developer.nvidia.com/t/deepseek-4-1-flash/382896/2 "2026-09-18T15:34:09Z")

</div>

Update

> **[recipes/recipes/dgx-station-gb300/deepseek-v4.1-flash-vllm-uva-dspark at main...](https://t.co/a3qNf8dNVw)**
>
> Hardware-pinned, verified recipes for serving large open-weight LLMs. Every number has a method. - J-M-Recipes/recipes

Updated; pinning experts; **single-stream prose 89.3 → 153.1 tok/s (+71%)**, eight streams 308 → 701, **sixteen streams 414 → 809** , shell 160 → 250, code 154 → 214, structured 123 → 208. KV 4.75 GiB (was 4.89)
