-
Notifications
You must be signed in to change notification settings - Fork 282
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
[Bug]: Default memory config cannot boot a 256K-vocab model on v5e-1: the [512]-bucket structured_decode program has no room left to load
bugSomething isn't workingSomething isn't workingStatus: Open.#3360 In vllm-project/tpu-inference;[Bug]: TPU GDN batched decode hangs when padded request metadata is narrower than decode_tile_size
bugSomething isn't workingSomething isn't workingStatus: Open.#3356 In vllm-project/tpu-inference;- Status: Open.#3350 In vllm-project/tpu-inference;
[Bug]: tpu_raiden dependency is missing in v0.25.0
bugSomething isn't workingSomething isn't workingStatus: Open.#3285 In vllm-project/tpu-inference;- Status: Open.#3225 In vllm-project/tpu-inference;
- Status: Open.#3164 In vllm-project/tpu-inference;
- Status: Open.#3127 In vllm-project/tpu-inference;
[Bug]: kv_cache_dtype=fp8 silently allocates bf16 on v5e (RPA v3) while logging that fp8 is active
bugSomething isn't workingSomething isn't workingStatus: Open.#3126 In vllm-project/tpu-inference;[Bug]: BATCHED_RPA_KERNEL does not work with speculative decoding
bugSomething isn't workingSomething isn't workingStatus: Open.#3095 In vllm-project/tpu-inference;- Status: Open.#3081 In vllm-project/tpu-inference;
- Status: Open.#3077 In vllm-project/tpu-inference;
- Status: Open.#3076 In vllm-project/tpu-inference;