From 2f9f8f97d3249a40c35be4a44d3e5be2c659263d Mon Sep 17 00:00:00 2001 From: Faradawn Yang <73060648+faradawn@users.noreply.github.com> Date: Fri, 24 Jul 2026 14:32:29 -0700 Subject: [PATCH 1/2] Add --attention_config.indexer_kv_dtype fp8 to MiniMax-M3 NVFP4 variant Signed-off-by: Faradawn Yang <73060648+faradawn@users.noreply.github.com> --- models/MiniMaxAI/MiniMax-M3.yaml | 2 ++ 1 file changed, 2 insertions(+) diff --git a/models/MiniMaxAI/MiniMax-M3.yaml b/models/MiniMaxAI/MiniMax-M3.yaml index 72829a2b..61beeb61 100644 --- a/models/MiniMaxAI/MiniMax-M3.yaml +++ b/models/MiniMaxAI/MiniMax-M3.yaml @@ -152,6 +152,8 @@ variants: description: "NVIDIA-quantized NVFP4 weights (ModelOpt) for Blackwell (B200/B300) — native FP4 tensor cores, ~half the VRAM of MXFP8." extra_args: - "--trust-remote-code" + - "--attention_config.indexer_kv_dtype" + - "fp8" extra_env: VLLM_FLOAT32_MATMUL_PRECISION: "high" mxfp4: From 406b2539e6e047d7798acdf8af2b6f36a639fbf0 Mon Sep 17 00:00:00 2001 From: Faradawn Yang <73060648+faradawn@users.noreply.github.com> Date: Mon, 27 Jul 2026 15:33:42 -0700 Subject: [PATCH 2/2] Add --attention_config.indexer_kv_dtype fp8 to MiniMax-M3 MXFP8 variant Signed-off-by: Faradawn Yang <73060648+faradawn@users.noreply.github.com> --- models/MiniMaxAI/MiniMax-M3.yaml | 3 +++ 1 file changed, 3 insertions(+) diff --git a/models/MiniMaxAI/MiniMax-M3.yaml b/models/MiniMaxAI/MiniMax-M3.yaml index 61beeb61..8c20bfc4 100644 --- a/models/MiniMaxAI/MiniMax-M3.yaml +++ b/models/MiniMaxAI/MiniMax-M3.yaml @@ -112,6 +112,9 @@ variants: # comfortably, ~4 GPUs for weights alone on Blackwell (B200/B300) or AMD MI350X/MI355X (gfx950)). vram_minimum_gb: 513 description: "NVIDIA-quantized MXFP8 weights — Blackwell (B200/B300) for native MX tensor cores, and AMD CDNA4 (MI350X/MI355X, gfx950) for native MXFP8 Matrix Cores." + extra_args: + - "--attention_config.indexer_kv_dtype" + - "fp8" hardware_overrides: h100: # 8x H100 80GB (640 GB node) fits the ~513 GB MXFP8 weights but not the