Optimized SGLang for Qwen3.8 Flash-Next NVFP4 on 1x RTX PRO 6000: 171 tok/s, 524K, and HiCache/NIXL
#5 opened 40 minutes ago
by
jpezzulli
Field notes from a 2x DGX Spark (GB10) deployment of this quant — wedge recovery, firewall deadlock, MTP acceptance data
#4 opened about 13 hours ago
by
randomllama
Degeneration Loop when calling tool (PDF/Image)
1
#3 opened 1 day ago
by
dangnsh
Startup issues with vllm-openai:qwen38-flash-next
4
#2 opened 2 days ago
by
1anH
Tooooo BIG for a single node DGX Spark :(
9
#1 opened 2 days ago
by
realbazso