default max-num-seqs=4 (>=2 with headroom; ~5 fit full native ctx each)

This commit is contained in:
ent
2026-06-24 13:21:52 +10:00
parent 7dd6a74d38
commit 6797a9f6dd
4 changed files with 5 additions and 5 deletions
+1 -1
View File
@@ -9,7 +9,7 @@ BACKEND="${2:-flash_attn}"
MODEL="${MODEL:-Intel/Qwen3.5-122B-A10B-int4-AutoRound}"
MAX_MODEL_LEN="${MAX_MODEL_LEN:-262144}"
GPU_MEM="${GPU_MEM:-0.89}"
MAX_NUM_SEQS="${MAX_NUM_SEQS:-1}"
MAX_NUM_SEQS="${MAX_NUM_SEQS:-4}"
MAX_BATCHED_TOKENS="${MAX_BATCHED_TOKENS:-8192}"
PORT="${PORT:-8000}"
echo "[mtp] qwen3_5_mtp — backend=$BACKEND, num_speculative_tokens=$NSPEC, model=$MODEL"