Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
1 change: 0 additions & 1 deletion src/mcore_bridge/model/gpts/glm4.py
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
# Copyright (c) ModelScope Contributors. All rights reserved.
from megatron.core.dist_checkpointing.mapping import ShardedStateDict
from megatron.core.extensions.transformer_engine import TENorm
from megatron.core.transformer import transformer_layer
from megatron.core.transformer.attention import SelfAttention
from megatron.core.transformer.mlp import MLP, apply_swiglu_sharded_factory
from megatron.core.transformer.spec_utils import build_module
Expand Down
2 changes: 2 additions & 0 deletions src/mcore_bridge/model/gpts/qwen3_next.py
Original file line number Diff line number Diff line change
Expand Up @@ -81,6 +81,8 @@ def __init__(self, config: ModelConfig, hidden_size: int, eps: float = 1e-5):
self.eps = eps
# Initialize weight to zeros (Zero-Centered), matching HuggingFace Qwen3NextRMSNorm
self.weight = torch.nn.Parameter(torch.zeros(hidden_size))
# Mark weight for SP gradient AllReduce across TP domain (consistent with TENorm/MCoreRMSNorm)
setattr(self.weight, 'sequence_parallel', config.sequence_parallel)

def _norm(self, x):
return x * torch.rsqrt(x.pow(2).mean(-1, keepdim=True) + self.eps)
Expand Down
Loading