I am a new user of dgx spark and currently not familiar with the performance of dgx spark. Through search engines, I learned about the project maintained by eugr in the community, thank you very much.
However, after reading the documentation, I still don’t know how to use it, or maybe I am using it incorrectly. I want to test the model Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF using the following startup command:
``
./launch-cluster.sh --solo exec \
vllm serve \
Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF \
--port 8000 --host 0.0.0.0 \
--gpu-memory-utilization 0.7
``
But it returns an error and cannot start. The error is as follows:
``
Loading configuration from .env file...
Loaded .env variables: DOTENV_HF_TOKEN
Solo mode enabled. Skipping node detection.
Head Node: 127.0.0.1
Worker Nodes:
Container Name: vllm_node
Image Name: vllm-node
Action: exec
Starting Head Node on 127.0.0.1...
745701357e795a548674784d97a8d3dfa0af9d5934df0367c0cc503e3f068c42
Executing command: vllm serve Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF --port 8000 --host 0.0.0.0 --gpu-memory-utilization 0.7 --load-format fastsafetensors
(APIServer pid=29) INFO 04-07 07:54:22 [utils.py:299]
(APIServer pid=29) INFO 04-07 07:54:22 [utils.py:299] █ █ █▄ ▄█
(APIServer pid=29) INFO 04-07 07:54:22 [utils.py:299] ▄▄ ▄█ █ █ █ ▀▄▀ █ version 0.19.1rc1.dev36+g9a528260e.d20260405
(APIServer pid=29) INFO 04-07 07:54:22 [utils.py:299] █▄█▀ █ █ █ █ model Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF
(APIServer pid=29) INFO 04-07 07:54:22 [utils.py:299] ▀▀ ▀▀▀▀▀ ▀▀▀▀▀ ▀ ▀
(APIServer pid=29) INFO 04-07 07:54:22 [utils.py:299]
(APIServer pid=29) INFO 04-07 07:54:22 [utils.py:233] non-default args: {'model_tag': 'Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF', 'host': '0.0.0.0', 'model': 'Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF', 'load_format': 'fastsafetensors', 'gpu_memory_utilization': 0.7}
(APIServer pid=29) WARNING 04-07 07:54:22 [envs.py:1783] Unknown vLLM environment variable detected: VLLM_BASE_DIR
(APIServer pid=29) INFO 04-07 07:54:28 [model.py:554] Resolved architecture: Qwen3_5ForConditionalGeneration
(APIServer pid=29) INFO 04-07 07:54:28 [model.py:1684] Using max model len 262144
(APIServer pid=29) INFO 04-07 07:54:29 [vllm.py:799] Asynchronous scheduling is enabled.
(APIServer pid=29) INFO 04-07 07:54:29 [kernel.py:199] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['native'])
(APIServer pid=29) Traceback (most recent call last):
(APIServer pid=29) File "/usr/local/bin/vllm", line 10, in <module>
(APIServer pid=29) sys.exit(main())
(APIServer pid=29) ^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/entrypoints/cli/main.py", line 75, in main
(APIServer pid=29) args.dispatch_function(args)
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/entrypoints/cli/serve.py", line 122, in cmd
(APIServer pid=29) uvloop.run(run_server(args))
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/uvloop/__init__.py", line 96, in run
(APIServer pid=29) return __asyncio.run(
(APIServer pid=29) ^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/lib/python3.12/asyncio/runners.py", line 194, in run
(APIServer pid=29) return runner.run(main)
(APIServer pid=29) ^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/lib/python3.12/asyncio/runners.py", line 118, in run
(APIServer pid=29) return self._loop.run_until_complete(task)
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "uvloop/loop.pyx", line 1518, in uvloop.loop.Loop.run_until_complete
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/uvloop/__init__.py", line 48, in wrapper
(APIServer pid=29) return await main
(APIServer pid=29) ^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/entrypoints/openai/api_server.py", line 684, in run_server
(APIServer pid=29) await run_server_worker(listen_address, sock, args, **uvicorn_kwargs)
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/entrypoints/openai/api_server.py", line 698, in run_server_worker
(APIServer pid=29) async with build_async_engine_client(
(APIServer pid=29) File "/usr/lib/python3.12/contextlib.py", line 210, in __aenter__
(APIServer pid=29) return await anext(self.gen)
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/entrypoints/openai/api_server.py", line 100, in build_async_engine_client
(APIServer pid=29) async with build_async_engine_client_from_engine_args(
(APIServer pid=29) File "/usr/lib/python3.12/contextlib.py", line 210, in __aenter__
(APIServer pid=29) return await anext(self.gen)
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/entrypoints/openai/api_server.py", line 136, in build_async_engine_client_from_engine_args
(APIServer pid=29) async_llm = AsyncLLM.from_vllm_config(
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/v1/engine/async_llm.py", line 225, in from_vllm_config
(APIServer pid=29) return cls(
(APIServer pid=29) ^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/v1/engine/async_llm.py", line 135, in __init__
(APIServer pid=29) self.renderer = renderer = renderer_from_config(self.vllm_config)
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/renderers/registry.py", line 83, in renderer_from_config
(APIServer pid=29) tokenizer = cached_tokenizer_from_config(model_config, **kwargs)
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/tokenizers/registry.py", line 227, in cached_tokenizer_from_config
(APIServer pid=29) return cached_get_tokenizer(
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/tokenizers/registry.py", line 210, in get_tokenizer
(APIServer pid=29) tokenizer = tokenizer_cls_.from_pretrained(tokenizer_name, *args, **kwargs)
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/vllm/tokenizers/hf.py", line 85, in from_pretrained
(APIServer pid=29) tokenizer = AutoTokenizer.from_pretrained(
(APIServer pid=29) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/transformers/models/auto/tokenization_auto.py", line 1172, in from_pretrained
(APIServer pid=29) tokenizer_class_py, tokenizer_class_fast = TOKENIZER_MAPPING[type(config)]
(APIServer pid=29) ~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^
(APIServer pid=29) File "/usr/local/lib/python3.12/dist-packages/transformers/models/auto/auto_factory.py", line 804, in __getitem__
(APIServer pid=29) model_type = self._reverse_config_mapping[key.__name__]
(APIServer pid=29) ~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^
(APIServer pid=29) KeyError: 'Qwen3_5Config'
Stopping cluster...
Stopping head node (127.0.0.1)...
Cluster stopped.
``
I have downloaded the model using ./hf-download.sh Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF and confirmed it exists locally. Where did I go wrong? This should not be a bug, so I did not ask on GitHub.
I wonder if anyone can help me solve this problem.thanks.