Skip to content

Commit 35ceff9

Browse files
committed
max-num-seqs only for DP_ATTENTION=true
1 parent 286ca82 commit 35ceff9

1 file changed

Lines changed: 3 additions & 2 deletions

File tree

benchmarks/single_node/fixed_seq_len/dsv4_fp4_b200_vllm.sh

Lines changed: 3 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -46,13 +46,14 @@ MOE_ARGS=()
4646
EPLB_ARGS=()
4747
PREFILL_SCHEDULE_ARGS=()
4848
DEP_COMPILE_ARGS=()
49-
DEP_MAX_NUM_SEQS=$CONC
49+
DEP_SEQS_ARGS=()
5050
if [ "${DP_ATTENTION}" = "true" ]; then
5151
MOE_ARGS=(--moe-backend deep_gemm_mega_moe)
5252
EPLB_ARGS=(--enable-eplb --eplb-config '{"communicator":"torch_nccl", "use_async": false}')
5353
PREFILL_SCHEDULE_ARGS=(--prefill-schedule-interval 16)
5454
GMU_ARGS=(--gpu-memory-utilization 0.94)
5555
DEP_MAX_NUM_SEQS=$(( 2 * CONC / TP ))
56+
DEP_SEQS_ARGS=(--max-num-seqs "$DEP_MAX_NUM_SEQS")
5657
# Build cudagraph capture sizes: 1, 2, 3, ..., DEP_MAX_NUM_SEQS
5758
CUDA_GRAPH_CAPTURE_SIZES=""
5859
s=1
@@ -104,7 +105,7 @@ vllm serve "$MODEL" --host 0.0.0.0 --port "$PORT" \
104105
--tool-call-parser deepseek_v4 \
105106
--enable-auto-tool-choice \
106107
--reasoning-parser deepseek_v4 \
107-
--max-num-seqs "$DEP_MAX_NUM_SEQS" \
108+
"${DEP_SEQS_ARGS[@]}" \
108109
--max-model-len "$SERVE_MAX_MODEL_LEN" \
109110
--max-num-batched-tokens "$MAX_NUM_BATCHED_TOKENS" > "$SERVER_LOG" 2>&1 &
110111

0 commit comments

Comments
 (0)