This website requires JavaScript.
Explore
Help
Register
Sign In
TBNilles
/
qwen3.5-122B-A10B-on-spark
Watch
1
Star
0
Fork
0
Code
Issues
Pull Requests
Actions
Packages
Projects
Releases
Wiki
Activity
Files
7dd6a74d388f80e96146bd633de9f3f9e5081621
qwen3.5-122B-A10B-on-spark
/
runtime
T
History
ent
7dd6a74d38
tune defaults for max context + KV depth: gpu-mem 0.89 (reserve ~14GB), ctx 262144, max-num-seqs 1, decouple max-batched-tokens (8192)
2026-06-24 13:18:32 +10:00
..
mtp_serve.sh
tune defaults for max context + KV depth: gpu-mem 0.89 (reserve ~14GB), ctx 262144, max-num-seqs 1, decouple max-batched-tokens (8192)
2026-06-24 13:18:32 +10:00
patch_fla_shmem.py
qwen3.5-122B-A10B on DGX Spark: vLLM + DFlash + dense-bandwidth stack, one-shot installer
2026-06-24 13:02:35 +10:00
patch_inc_hybrid.py
qwen3.5-122B-A10B on DGX Spark: vLLM + DFlash + dense-bandwidth stack, one-shot installer
2026-06-24 13:02:35 +10:00
patch_int8_lmhead_v3.py
qwen3.5-122B-A10B on DGX Spark: vLLM + DFlash + dense-bandwidth stack, one-shot installer
2026-06-24 13:02:35 +10:00
patch_unify2.py
qwen3.5-122B-A10B on DGX Spark: vLLM + DFlash + dense-bandwidth stack, one-shot installer
2026-06-24 13:02:35 +10:00
serve.sh
tune defaults for max context + KV depth: gpu-mem 0.89 (reserve ~14GB), ctx 262144, max-num-seqs 1, decouple max-batched-tokens (8192)
2026-06-24 13:18:32 +10:00