Cosmos 3 · OmniMoT ▸ MoT 主干 ▸ 单层展开
主干里第 i 层的内部。两条模态通路——理解 _und(蓝)与
生成 moe_gen(绿)——各自持有 norm / projection / MLP 权重,
并行流过整层;唯一发生跨模态交互的地方是共享注意力——而且是单向的:gen 读 und,und 读不到 gen。
norm 是 pre-norm 结构,两处残差(attention 后、MLP 后)分别在各通路内相加。
_und 生成通路 moe_gen 共享算子 RMSNorm pre-norm ⊕ 残差相加 decoder_sparse_step 层):两侧换成 Qwen3VLMoeTextSparseMoeBlock —— router → top-k experts → 加权合并,附 load-balance 辅助损失(LBL metadata);gen tower 可开 noisy gating。MLP 前先 unpad,避免 padding token 造成 expert 失衡。
Qwen3VLMoeTextSparseMoeBlock gen_only 快路径:自回归推理时跳过 und 通路,und 的 K/V 从 cache 读取。 gen_only