From 6336ca054fa33b64247f9199fd37e7119c5a3785 Mon Sep 17 00:00:00 2001 From: Tarun Kumar Date: Mon, 29 Jun 2026 16:43:55 +0530 Subject: [PATCH] Add Gemma4 and Nemotron-ultra model to H200 Signed-off-by: Tarun Kumar --- workloads/gemma_4_31b_it_h200.yaml | 46 ++++++++++++++++++++++++++ workloads/nemotron_3_super_5_h200.yaml | 14 ++++++++ 2 files changed, 60 insertions(+) create mode 100644 workloads/gemma_4_31b_it_h200.yaml diff --git a/workloads/gemma_4_31b_it_h200.yaml b/workloads/gemma_4_31b_it_h200.yaml new file mode 100644 index 0000000..5a931aa --- /dev/null +++ b/workloads/gemma_4_31b_it_h200.yaml @@ -0,0 +1,46 @@ +# Gemma4 31B (FP8) on H200 (8xH200, TP=1) +name: gemma_4_31b_it_h200 +gpu: H200 +num_gpus: 8 +nightly: true + +vllm: + model: RedHatAI/gemma-4-31B-it-FP8-dynamic + serve_args: >- + --tensor-parallel-size 1 + --kv-cache-dtype fp8 + --tool-call-parser gemma4 + --reasoning-parser gemma4 + --enable-auto-tool-choice + +lm_eval: + model_args: + tokenized_requests: false + tokenizer_backend: null + timeout: 6000 + tasks: + - name: gsm8k + num_fewshot: 5 + model_args: + num_concurrent: 64 + max_length: 32768 + max_gen_toks: 8192 + +bfcl: + test_categories: + - simple_python + - multiple + - parallel + - parallel_multiple + - multi_turn + num_threads: 16 + +vllm_bench: + configs: + - name: 8k-in-1k-out-conc-128 + backend: openai + dataset: random + input_len: 8192 + output_len: 1024 + num_prompts: 512 + max_concurrency: 128 diff --git a/workloads/nemotron_3_super_5_h200.yaml b/workloads/nemotron_3_super_5_h200.yaml index ff76e83..5633585 100644 --- a/workloads/nemotron_3_super_5_h200.yaml +++ b/workloads/nemotron_3_super_5_h200.yaml @@ -15,6 +15,9 @@ vllm: --speculative-config.method mtp --speculative-config.num_speculative_tokens 5 --trust-remote-code + --enable-auto-tool-choice + --tool-call-parser qwen3_coder + --reasoning-parser nemotron_v3 lm_eval: model_args: @@ -29,6 +32,17 @@ lm_eval: max_length: 32768 max_gen_toks: 8192 +bfcl: + test_categories: + - simple_python + - multiple + - parallel + - parallel_multiple + - multi_turn + num_threads: 16 + max_test_cases: + multi_turn: 240 + vllm_bench: configs: - name: 8k-in-1k-out-conc-128