Text Generation
Transformers
Safetensors
English
Chinese
glm5_next
image-text-to-text
conversational
Eval Results
fp8
Instructions to use zai-org/GLM-5.3-Flash with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use zai-org/GLM-5.3-Flash with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="zai-org/GLM-5.3-Flash") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("zai-org/GLM-5.3-Flash") model = AutoModelForMultimodalLM.from_pretrained("zai-org/GLM-5.3-Flash", device_map="auto") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Inference
- HuggingChat
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use zai-org/GLM-5.3-Flash with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "zai-org/GLM-5.3-Flash" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "zai-org/GLM-5.3-Flash", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/zai-org/GLM-5.3-Flash
- SGLang
How to use zai-org/GLM-5.3-Flash with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "zai-org/GLM-5.3-Flash" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "zai-org/GLM-5.3-Flash", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "zai-org/GLM-5.3-Flash" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "zai-org/GLM-5.3-Flash", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use zai-org/GLM-5.3-Flash with Docker Model Runner:
docker model run hf.co/zai-org/GLM-5.3-Flash
vLLM crash: "pe_dim must be 64 for fp8_ds_mla" on RTX PRO 6000 Blackwell.
#19
by NferKarn - opened
Full Error
Worker_TP0_EP0 pid=1125) INFO 08-26 17:54:39 [cuda.py:532] Using FLASHINFER_MLA_SPARSE_SM120 attention backend out of potential backends: ['FLASHINFER_MLA_SPARSE_SM120'].
(Worker_TP0_EP0 pid=1125) INFO 08-26 17:54:39 [mla_attention.py:475] Using fp8_ds_mla KV cache format for FLASHINFER_MLA_SPARSE_SM120 backend.
...
...
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] RuntimeError: Worker failed with error 'concat_and_cache_mla, /workspace/csrc/libtorch_stable/cache_kernels.cu:866, pe_dim must be 64 for fp8_ds_mla', please check the stack trace above for the root cause
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] raise RuntimeError(
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/executor/multiproc_executor.py", line 420, in get_response
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] response = self.aggregate(self.get_response())
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/executor/multiproc_executor.py", line 102, in _wait_for_response
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] raise self._exception
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/lib/python3.12/concurrent/futures/_base.py", line 401, in __get_result
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] return self.__get_result()
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/lib/python3.12/concurrent/futures/_base.py", line 449, in result
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] return super().result()
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/executor/multiproc_executor.py", line 98, in result
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] return future if non_block else future.result()
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/executor/multiproc_executor.py", line 431, in collective_rpc
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] return self.collective_rpc("determine_available_memory")
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/executor/abstract.py", line 147, in determine_available_memory
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] available_gpu_memory = self.model_executor.determine_available_memory()
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/engine/core.py", line 294, in _initialize_kv_caches
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] return func(*args, **kwargs)
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/tracing/otel.py", line 178, in sync_wrapper
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] kv_cache_config = self._initialize_kv_caches(vllm_config)
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/engine/core.py", line 144, in __init__
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] super().__init__(
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/engine/core.py", line 1082, in __init__
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] return func(*args, **kwargs)
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/tracing/otel.py", line 178, in sync_wrapper
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] engine_core = EngineCoreProc(*args, engine_index=dp_rank, **kwargs)
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/engine/core.py", line 1324, in run_engine_core
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] Traceback (most recent call last):
2026-08-26 22:27:28.883
(EngineCore pid=951) ERROR 08-26 16:57:28 [core.py:1355] EngineCore failed to start.
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033]
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] RuntimeError: concat_and_cache_mla, /workspace/csrc/libtorch_stable/cache_kernels.cu:866, pe_dim must be 64 for fp8_ds_mla
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._op(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/_ops.py", line 1279, in __call__
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] torch.ops._C_cache_ops.concat_and_cache_mla(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/_custom_ops.py", line 2788, in concat_and_cache_mla
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ops.concat_and_cache_mla(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/attention/backend.py", line 1131, in do_kv_cache_update
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] attn_layer.impl.do_kv_cache_update( # type: ignore[attr-defined]
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/layers/attention/mla_attention.py", line 1218, in unified_mla_kv_cache_update
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._op(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/_ops.py", line 1279, in __call__
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] kv_cache_dummy_dep = torch.ops.vllm.unified_mla_kv_cache_update(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/layers/attention/mla_attention.py", line 701, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] attn_out = self.mla_attn(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/layers/mla.py", line 234, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self.mla_attn(positions, hidden_states)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/models/glm5next/nvidia/attention.py", line 624, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] x = self.self_attn(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/models/glm5next/nvidia/model.py", line 476, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] hidden_states, residual, post, comb = layer(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/models/glm5next/nvidia/model.py", line 707, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] hidden_states = self.language_model.model(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/models/glm4_1v.py", line 2327, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] model_output = model(**model_inputs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/cudagraph_utils.py", line 690, in forward_fn
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] forward_fn(CUDAGraphMode.NONE)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/cudagraph_utils.py", line 339, in capture
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/utils/_contextlib.py", line 124, in decorate_context
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] CudaGraphManager.capture(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/cudagraph_utils.py", line 429, in profile_memory
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/utils/_contextlib.py", line 124, in decorate_context
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return super().profile_memory(create_forward_fn)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/cudagraph_utils.py", line 608, in profile_memory
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] estimates = manager.profile_memory(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/model_runner.py", line 929, in profile_cudagraph_memory
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/utils/_contextlib.py", line 124, in decorate_context
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] cudagraph_memory_estimate = self.model_runner.profile_cudagraph_memory()
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu_worker.py", line 518, in determine_available_memory
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/utils/_contextlib.py", line 124, in decorate_context
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] output = func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/executor/multiproc_executor.py", line 1025, in worker_busy_loop
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] Traceback (most recent call last):
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] RuntimeError: concat_and_cache_mla, /workspace/csrc/libtorch_stable/cache_kernels.cu:866, pe_dim must be 64 for fp8_ds_mla
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._op(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/_ops.py", line 1279, in __call__
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] torch.ops._C_cache_ops.concat_and_cache_mla(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/_custom_ops.py", line 2788, in concat_and_cache_mla
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ops.concat_and_cache_mla(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/attention/backend.py", line 1131, in do_kv_cache_update
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] attn_layer.impl.do_kv_cache_update( # type: ignore[attr-defined]
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/layers/attention/mla_attention.py", line 1218, in unified_mla_kv_cache_update
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._op(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/_ops.py", line 1279, in __call__
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] kv_cache_dummy_dep = torch.ops.vllm.unified_mla_kv_cache_update(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/layers/attention/mla_attention.py", line 701, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] attn_out = self.mla_attn(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/layers/mla.py", line 234, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self.mla_attn(positions, hidden_states)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/models/glm5next/nvidia/attention.py", line 624, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] x = self.self_attn(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/models/glm5next/nvidia/model.py", line 476, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] hidden_states, residual, post, comb = layer(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/models/glm5next/nvidia/model.py", line 707, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] hidden_states = self.language_model.model(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/models/glm4_1v.py", line 2327, in forward
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return forward_call(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1789, in _call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return self._call_impl(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] model_output = model(**model_inputs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/cudagraph_utils.py", line 690, in forward_fn
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] forward_fn(CUDAGraphMode.NONE)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/cudagraph_utils.py", line 339, in capture
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/utils/_contextlib.py", line 124, in decorate_context
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] CudaGraphManager.capture(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/cudagraph_utils.py", line 429, in profile_memory
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/utils/_contextlib.py", line 124, in decorate_context
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return super().profile_memory(create_forward_fn)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/cudagraph_utils.py", line 608, in profile_memory
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] estimates = manager.profile_memory(
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu/model_runner.py", line 929, in profile_cudagraph_memory
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/utils/_contextlib.py", line 124, in decorate_context
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] cudagraph_memory_estimate = self.model_runner.profile_cudagraph_memory()
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/worker/gpu_worker.py", line 518, in determine_available_memory
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] return func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/torch/utils/_contextlib.py", line 124, in decorate_context
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] ^^^^^^^^^^^^^^^^^^^^^
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] output = func(*args, **kwargs)
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] File "/usr/local/lib/python3.12/dist-packages/vllm/v1/executor/multiproc_executor.py", line 1025, in worker_busy_loop
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] Traceback (most recent call last):
2026-08-26 22:27:28.881
(Worker_TP0_EP0 pid=1329) ERROR 08-26 16:57:28 [multiproc_executor.py:1033] WorkerProc hit an exception.
Hardware / environment
- GPUs: 4× NVIDIA RTX 6000 Pro Blackwell (Server Edition), SM120
- Model:
zai-org/GLM-5.3-Flash(default native FP8 checkpoint) - vLLM image: vllm/vllm-openai:glm53-flash
What I tried
- Removed
--kv-cache-dtype fp8(and set it toauto) → same error. - Forcing bfloat16 throws
Worker_TP3_EP3 pid=1759) ERROR 08-26 17:59:09 [multiproc_executor.py:927] ValueError: No valid attention backend found for cuda with AttentionSelectorConfig(head_size=512, dtype=torch.bfloat16, kv_cache_dtype=bfloat16, block_size=None, use_mla=True, has_sink=False, use_sparse=True, use_mm_prefix=False, use_per_head_quant_scales=False, attn_type=AttentionType.DECODER, has_sliding_window=False, use_non_causal=False, use_batch_invariant=False, use_kv_connector=True, use_adaptive_verification=False, use_pcp=False). Reasons: {TRITON_MLA: [sparse not supported], FLASHINFER_MLA_SPARSE_SM120: [kv_cache_dtype not supported, kv_cache_dtype not supported]}
Args
--served-model-name GLM-5.3-Flash
--max-num-batched-tokens 16384
--max-num-seqs 256
--max-model-len 262144
--enable-expert-parallel
--tensor-parallel-size 4
--enable-auto-tool-choice
--tool-call-parser glm47
--reasoning-parser glm45
--enable-cumem-allocator
--kv-transfer-config '{"kv_connector":"SimpleCPUOffloadConnector","kv_role":"kv_both","kv_connector_extra_config":{"cpu_bytes_to_use_per_rank":137438953472,"lazy_offload":false}}'
--api-server-count 1
--async-scheduling
--scheduling-policy priority
+1 running into same issue, 4x blackwell.
I made a quick/dirty fix here, https://github.com/cmc/vllm/tree/glm53-sm120-bf16-fallback // https://github.com/cmc/vllm/pull/1
This patched version loads now on my blackwells, not perfect/kernel/cuda fix, but it works and is super fast :)
111 ~ 123 tokens/s