Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
@@ -0,0 +1,143 @@
# Qwen3.5 FP8 GB200 disaggregated MTP 1P1D TP4/TP4 topology.

name: "qwen3.5-fp8-gb200-mtp-8k1k-1p1d-tp4-tp4"

sbatch_directives:
mem: "0"

dynamo:
hash: 46520ca59afe992fb5ef61b3197b2316f8df9b2b
install: true

frontend:
type: dynamo
enable_multiple_frontends: true
num_additional_frontends: 1
nginx_container: nginx

model:
path: "qwen3.5-fp8"
container: "lmsysorg/sglang:v0.5.14-cu130@sha256:5027e95bf6ec536856b1b52a91d1f35ff5c564ab83e8a94758a169ff09bb8df3"
precision: "fp8"

resources:
gpu_type: "gb200"
gpus_per_node: 4
prefill_nodes: 1
decode_nodes: 1
prefill_workers: 1
decode_workers: 1

backend:
type: sglang

prefill_environment:
SGLANG_JIT_DEEPGEMM_PRECOMPILE: "0"
SGLANG_ENABLE_SPEC_V2: "1"
NO_COLOR: "1"
TORCH_DISTRIBUTED_DEFAULT_TIMEOUT: "3600"
TORCH_NCCL_WATCHDOG_TIMEOUT_SEC: "3600"
TORCH_NCCL_HEARTBEAT_TIMEOUT_SEC: "3600"
PYTHONUNBUFFERED: "1"
NCCL_MNNVL_ENABLE: "1"
NCCL_CUMEM_ENABLE: "1"
MC_FORCE_MNNVL: "1"
SGLANG_DG_CACHE_DIR: "/configs/deepgemm-cache"
FLASHINFER_WORKSPACE_BASE: "/configs/flashinfer-cache"
SGLANG_DISAGGREGATION_HEARTBEAT_MAX_FAILURE: "100000"
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
SGLANG_MOONCAKE_CUSTOM_MEM_POOL: "True"
SGLANG_USE_MESSAGE_QUEUE_BROADCASTER: "0"
SGLANG_DISABLE_TP_MEMORY_INBALANCE_CHECK: "1"
SGLANG_HEALTH_STARTING_OK: "1"
SGLANG_ENABLE_HEALTH_ENDPOINT_GENERATION: "0"

decode_environment:
SGLANG_JIT_DEEPGEMM_PRECOMPILE: "0"
SGLANG_ENABLE_SPEC_V2: "1"
NO_COLOR: "1"
TORCH_DISTRIBUTED_DEFAULT_TIMEOUT: "3600"
TORCH_NCCL_WATCHDOG_TIMEOUT_SEC: "3600"
TORCH_NCCL_HEARTBEAT_TIMEOUT_SEC: "3600"
PYTHONUNBUFFERED: "1"
NCCL_MNNVL_ENABLE: "1"
NCCL_CUMEM_ENABLE: "1"
MC_FORCE_MNNVL: "1"
MC_TE_METRIC: "true"
SGLANG_DG_CACHE_DIR: "/configs/deepgemm-cache"
FLASHINFER_WORKSPACE_BASE: "/configs/flashinfer-cache"
SGLANG_DISAGGREGATION_HEARTBEAT_MAX_FAILURE: "100000"
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
SGLANG_DECODE_BOOTSTRAP_TIMEOUT: "1000"
SGLANG_HACK_SEQ_BOOTSTRAP_ROOM: "1"
SGLANG_MOONCAKE_CUSTOM_MEM_POOL: "True"
SGLANG_USE_MESSAGE_QUEUE_BROADCASTER: "0"
SGLANG_DISABLE_TP_MEMORY_INBALANCE_CHECK: "1"
SGLANG_HEALTH_CHECK_TIMEOUT: "1800"
SGLANG_HEALTH_STARTING_OK: "1"
SGLANG_ENABLE_HEALTH_ENDPOINT_GENERATION: "0"

sglang_config:
prefill:
served-model-name: "Qwen/Qwen3.5-397B-A17B-FP8"
model-path: "/model/"
quantization: "fp8"
kv-cache-dtype: "fp8_e4m3"
trust-remote-code: true
attention-backend: "trtllm_mha"
tensor-parallel-size: 4
mamba-scheduler-strategy: "no_buffer"
mamba-track-interval: 2048
mamba-ssm-dtype: "bfloat16"
moe-runner-backend: "flashinfer_trtllm"
disable-radix-cache: true
max-running-requests: 1024
mem-fraction-static: 0.8
chunked-prefill-size: 16384
max-prefill-tokens: 16384
context-length: 16384
cuda-graph-max-bs: 1024
decode-log-interval: 1
stream-interval: 50
disaggregation-mode: "prefill"

decode:
served-model-name: "Qwen/Qwen3.5-397B-A17B-FP8"
model-path: "/model/"
quantization: "fp8"
kv-cache-dtype: "fp8_e4m3"
trust-remote-code: true
attention-backend: "trtllm_mha"
tensor-parallel-size: 4
mamba-scheduler-strategy: "no_buffer"
mamba-track-interval: 128
mamba-ssm-dtype: "bfloat16"
max-mamba-cache-size: 256
moe-runner-backend: "flashinfer_trtllm"

speculative-algorithm: "EAGLE"
speculative-num-steps: 3
speculative-eagle-topk: 1
speculative-num-draft-tokens: 4

disable-radix-cache: true
max-running-requests: 128
mem-fraction-static: 0.8
chunked-prefill-size: 16384
max-prefill-tokens: 16384
context-length: 16384
cuda-graph-max-bs: 1024
decode-log-interval: 1
stream-interval: 50
disaggregation-mode: "decode"

benchmark:
type: "sa-bench"
isl: 8192
osl: 1024
req_rate: "inf"
random_range_ratio: 0.8
concurrencies: "1x2x8"
use_chat_template: true
Original file line number Diff line number Diff line change
@@ -0,0 +1,157 @@
# Qwen3.5 FP8 GB200 disaggregated MTP 1P1D TEP8/TEP8 points.

name: "qwen3.5-fp8-gb200-mtp-8k1k-1p1d-tep8-tep8"

sbatch_directives:
mem: "0"

dynamo:
hash: 46520ca59afe992fb5ef61b3197b2316f8df9b2b
install: true

frontend:
type: dynamo
enable_multiple_frontends: true
num_additional_frontends: 1
nginx_container: nginx

model:
path: "qwen3.5-fp8"
container: "lmsysorg/sglang:v0.5.14-cu130@sha256:5027e95bf6ec536856b1b52a91d1f35ff5c564ab83e8a94758a169ff09bb8df3"
precision: "fp8"

resources:
gpu_type: "gb200"
gpus_per_node: 4
prefill_nodes: 2
decode_nodes: 2
prefill_workers: 1
decode_workers: 1

backend:
type: sglang

prefill_environment:
SGLANG_JIT_DEEPGEMM_PRECOMPILE: "0"
SGLANG_ENABLE_SPEC_V2: "1"
NO_COLOR: "1"
TORCH_DISTRIBUTED_DEFAULT_TIMEOUT: "3600"
TORCH_NCCL_WATCHDOG_TIMEOUT_SEC: "3600"
TORCH_NCCL_HEARTBEAT_TIMEOUT_SEC: "3600"
PYTHONUNBUFFERED: "1"
NCCL_MNNVL_ENABLE: "1"
NCCL_CUMEM_ENABLE: "1"
MC_FORCE_MNNVL: "1"
SGLANG_DG_CACHE_DIR: "/configs/deepgemm-cache"
FLASHINFER_WORKSPACE_BASE: "/configs/flashinfer-cache"
SGLANG_DISAGGREGATION_HEARTBEAT_MAX_FAILURE: "100000"
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
SGLANG_MOONCAKE_CUSTOM_MEM_POOL: "True"
SGLANG_USE_MESSAGE_QUEUE_BROADCASTER: "0"
SGLANG_DISABLE_TP_MEMORY_INBALANCE_CHECK: "1"
SGLANG_HEALTH_STARTING_OK: "1"
SGLANG_ENABLE_HEALTH_ENDPOINT_GENERATION: "0"

decode_environment:
SGLANG_JIT_DEEPGEMM_PRECOMPILE: "0"
SGLANG_ENABLE_SPEC_V2: "1"
NO_COLOR: "1"
TORCH_DISTRIBUTED_DEFAULT_TIMEOUT: "3600"
TORCH_NCCL_WATCHDOG_TIMEOUT_SEC: "3600"
TORCH_NCCL_HEARTBEAT_TIMEOUT_SEC: "3600"
PYTHONUNBUFFERED: "1"
NCCL_MNNVL_ENABLE: "1"
NCCL_CUMEM_ENABLE: "1"
MC_FORCE_MNNVL: "1"
MC_TE_METRIC: "true"
SGLANG_DG_CACHE_DIR: "/configs/deepgemm-cache"
FLASHINFER_WORKSPACE_BASE: "/configs/flashinfer-cache"
SGLANG_DISAGGREGATION_HEARTBEAT_MAX_FAILURE: "100000"
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
SGLANG_DECODE_BOOTSTRAP_TIMEOUT: "1000"
SGLANG_HACK_SEQ_BOOTSTRAP_ROOM: "1"
SGLANG_MOONCAKE_CUSTOM_MEM_POOL: "True"
SGLANG_USE_MESSAGE_QUEUE_BROADCASTER: "0"
SGLANG_DISABLE_TP_MEMORY_INBALANCE_CHECK: "1"
SGLANG_HEALTH_CHECK_TIMEOUT: "1800"
SGLANG_HEALTH_STARTING_OK: "1"
SGLANG_ENABLE_HEALTH_ENDPOINT_GENERATION: "0"

sglang_config:
prefill:
served-model-name: "Qwen/Qwen3.5-397B-A17B-FP8"
model-path: "/model/"
random-seed: 42
quantization: "fp8"
kv-cache-dtype: "fp8_e4m3"
trust-remote-code: true
attention-backend: "trtllm_mha"
tensor-parallel-size: 8
data-parallel-size: 1
expert-parallel-size: 8
mamba-scheduler-strategy: "no_buffer"
mamba-track-interval: 2048
mamba-ssm-dtype: "bfloat16"
moe-runner-backend: "flashinfer_trtllm"
disable-radix-cache: true
max-running-requests: 1024
mem-fraction-static: 0.8
max-total-tokens: 128000
chunked-prefill-size: 16384
max-prefill-tokens: 16384
context-length: 9236
cuda-graph-max-bs: 320
scheduler-recv-interval: 10
decode-log-interval: 50
stream-interval: 50
disaggregation-mode: "prefill"
disaggregation-transfer-backend: "mooncake"

decode:
served-model-name: "Qwen/Qwen3.5-397B-A17B-FP8"
model-path: "/model/"
random-seed: 42
quantization: "fp8"
kv-cache-dtype: "fp8_e4m3"
trust-remote-code: true
attention-backend: "trtllm_mha"
tensor-parallel-size: 8
data-parallel-size: 1
expert-parallel-size: 8
mamba-scheduler-strategy: "no_buffer"
mamba-track-interval: 128
mamba-ssm-dtype: "bfloat16"
max-mamba-cache-size: 1024
moe-runner-backend: "flashinfer_trtllm"

speculative-algorithm: "EAGLE"
speculative-num-steps: 3
speculative-eagle-topk: 1
speculative-num-draft-tokens: 4

disable-radix-cache: true
max-running-requests: 1024
mem-fraction-static: 0.8
max-total-tokens: 2200000
chunked-prefill-size: 4096
max-prefill-tokens: 16384
context-length: 9236
cuda-graph-max-bs: 320
scheduler-recv-interval: 10
decode-log-interval: 50
stream-interval: 50
disaggregation-mode: "decode"
disaggregation-transfer-backend: "mooncake"

benchmark:
type: "sa-bench"
isl: 8192
osl: 1024
req_rate: "inf"
num_prompts_mult: 20
num_warmup_mult: 2
random_range_ratio: 0.8
concurrencies: "32x48x80"
use_chat_template: true
Loading