Skip to content

Commit 286ca82

Browse files
committed
revert attention-backend, set image to vllm/vllm-openai:v0.26.0
1 parent 1848869 commit 286ca82

2 files changed

Lines changed: 1 addition & 2 deletions

File tree

benchmarks/single_node/fixed_seq_len/dsv4_fp4_b200_vllm.sh

Lines changed: 0 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -100,7 +100,6 @@ vllm serve "$MODEL" --host 0.0.0.0 --port "$PORT" \
100100
"${PREFILL_SCHEDULE_ARGS[@]}" \
101101
"${DEP_COMPILE_ARGS[@]}" \
102102
--attention_config.use_fp4_indexer_cache=True \
103-
--attention-backend FLASHMLA_SPARSE_DSV4 \
104103
--tokenizer-mode deepseek_v4 \
105104
--tool-call-parser deepseek_v4 \
106105
--enable-auto-tool-choice \

configs/nvidia-master.yaml

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -929,7 +929,7 @@ dsv4-fp4-b200-sglang:
929929
- { tp: 8, ep: 8, dp-attn: true, conc-start: 256, conc-end: 1024 }
930930

931931
dsv4-fp4-b200-vllm:
932-
image: vllm/vllm-openai:nightly-700d39b55813fce6fe5339b334beb55d2a39f598
932+
image: vllm/vllm-openai:v0.26.0
933933
model: deepseek-ai/DeepSeek-V4-Pro
934934
model-prefix: dsv4
935935
runner: cluster:b200-dgxc

0 commit comments

Comments
 (0)