Skip to content

Attention Residuals

Status: completed

Authors: Kimi Team(Guangyu Chen、Yu Zhang、Jianlin Su 等 36 名作者)

Venue / Year: Technical Report / arXiv 2026

Affiliations: 论文仅署名 Kimi Team;官方仓库位于 MoonshotAI 组织下,正文未逐一披露作者机构

Links: arXiv | PDF | Official GitHub

Tags: [[large-language-models]] [[transformers]] [[residual-connections]] [[depth-routing]] [[attention]] [[scaling-laws]] [[mixture-of-experts]] [[systems-optimization]]

One-Sentence Summary

Attention Residuals(AttnRes)把 Transformer 中固定的逐层残差累加改造成沿网络深度进行的、由内容决定权重的 softmax\operatorname{softmax} 注意力;其 Block AttnRes 版本以块级表示压缩跨层历史,在 Kimi Linear MoE 上显示出稳定的验证损失和下游任务收益,但训练数据、完整实现、评测方差与独立复现仍然缺失。

论文故事线与章节任务

整体故事: 标准 PreNorm 残差连接既是梯度高速通道,也是一个隐含的“深度聚合器”。后一个角色长期使用固定单位权重,导致隐藏状态随深度累加、单层更新相对被稀释。作者把“时间维上的 RNN 被注意力替代”类比到“深度维上的残差递归”,让每层按输入内容从所有早期层输出中检索信息。Full AttnRes 表达力最好但保存和通信所有层输出的代价较高,因此作者提出 Block AttnRes,以约 8 个块作为工程折中,并通过缓存、两阶段计算和在线 softmax\operatorname{softmax} 将其扩展到 48B 总参数、3B 激活参数的 MoE 预训练。

章节任务完成情况
Motivation把残差连接重解释为深度聚合,并指出固定累加的限制问题定义清晰;幅值增长的理论刻画较粗
AttnRes给出 Full 与 Block 两种深度注意力形式公式与伪代码足以理解方法
Infrastructure解决大规模训练通信、推理访存和长上下文缓存理论 I/O 分析充分;实测配置披露不足
Experiments用缩放律、48B 模型、消融和架构搜索验证收益结果一致;数据、随机方差和跨架构外推不足
Discussions建立时间—深度对偶与结构化深度混合矩阵视角有启发性,但不是严格的性能保证
Related Work与归一化、多流残差和密集跨层连接定位覆盖较新,方法差异基本准确

Problem

Core Challenge

PreNorm Transformer 的标准残差更新为

hl=hl1+fl1(hl1). \bm{h}_{l}=\bm{h}_{l-1}+f_{l-1}(\bm{h}_{l-1}).

展开后得到

hl=h1+i=1l1fi(hi). \bm{h}_{l}=\bm{h}_1+\sum_{i=1}^{l-1}f_i(\bm{h}_i).

因此,残差连接不只负责保留恒等梯度路径,也规定了跨深度的信息融合方式:所有早期层输出都以固定权重 1 被累加。作者认为这带来三个问题:

  1. 不能选择性访问: 当前层只能接收混合后的 hl1\bm{h}_{l-1},不能主动增强某个早期层、压低另一个早期层。
  2. 聚合不可逆: 一旦不同层输出被压入同一个残差流,后续层很难恢复单个来源。
  3. PreNorm dilution: 主残差流幅值随深度增长,而每个子层看到的是归一化后的固定尺度输入;更深层必须产生更大的输出才能保持相对影响。

Motivation

论文的关键观察是“时间—深度对偶”:

  • RNN 在时间维把所有过去压缩进单一状态;
  • 标准残差在深度维也把所有早期计算压缩进单一状态;
  • Transformer 用注意力替代时间递归后获得选择性访问;
  • 那么深度维也可以用注意力替代固定残差递归。

这个动机同时具有概念价值工程价值。概念上,它挑战了“残差连接只是梯度高速通道”的单一理解;工程上,若深层模型能更有效利用每一层,就可能降低达到同等损失所需的训练算力。

需要注意,论文把隐藏状态“幅值按 O(L)O(L) 增长”写得较笼统。对于相关性不同的随机层输出,向量范数、均方幅值和最坏情况累加的标度并不相同。本文的核心经验现象——深层输出幅值快速上升、层贡献相对稀释——由图 5 支持,但 O(L)O(L) 不应被理解成对任意 PreNorm 网络都成立的严格定理。

Previous Work Gaps

  • ReZero、LayerScale、DeepNorm、Highway: 修改相邻层递推的缩放或门控,但当前层仍只看一个压缩后的前驱状态。
  • Hyper-Connections / mHC: 把残差流扩展为多个流并学习混合矩阵,增加状态秩,但仍以递推方式传递。
  • DenseFormer: 能访问多个早期层,但跨层系数是训练后固定的标量,不随 token 内容改变。
  • MUDDFormer: 已经提供位置相关、输入相关的多流密集连接,表达力强,但结构和投影更重。
  • MRLA、DDL: 可从线性注意力或门控递推角度解释,仍受低秩或递推状态约束。

AttnRes 的精确定位是:用每层一个 dd 维伪查询,对早期层输出做 token-wise 的深度 softmax\operatorname{softmax} 检索;权重的内容依赖性来自输入相关的 key,默认 query 本身是训练后固定的层参数。

Method

Task Formulation

对单个 token,设网络共有 LL 个子层,每个 self-attention 或 MLP 都单独计为一层。hlRd\bm{h}_l \in \mathbb{R}^d 是第 ll 层输入,h1\bm{h}_1 是 token embedding,flf_l 是第 ll 层变换。AttnRes 学习如下深度混合:

hl=α0lh1+i=1l1αilfi(hi),i=0l1αil=1. \bm{h}_{l}=\alpha_{0\to l}\bm{h}_1+\sum_{i=1}^{l-1}\alpha_{i\to l}f_i(\bm{h}_i), \qquad \sum_{i=0}^{l-1}\alpha_{i\to l}=1.

Full Attention Residuals

定义来源表示

vi={h1,i=0,fi(hi),1il1,ki=vi. \bm{v}_i= \begin{cases} \bm{h}_1, & i=0,\\ f_i(\bm{h}_i), & 1\leq i\leq l-1, \end{cases} \qquad \bm{k}_i=\bm{v}_i.

ll 层只增加一个可学习伪查询 ql=wlRd\bm{q}_l=\bm{w}_l\in\mathbb{R}^d。深度权重为

αil=exp ⁣(wlRMSNorm(ki))j=0l1exp ⁣(wlRMSNorm(kj)). \alpha_{i\to l} = \frac{\exp\!\left(\bm{w}_l^\top\operatorname{RMSNorm}(\bm{k}_i)\right)} {\sum_{j=0}^{l-1}\exp\!\left(\bm{w}_l^\top\operatorname{RMSNorm}(\bm{k}_j)\right)}.

最终输入为

hl=i=0l1αilvi. \bm{h}_{l}=\sum_{i=0}^{l-1}\alpha_{i\to l}\bm{v}_i.

RMSNorm 只作用于 key,而 value 保留原始幅值。这样可以防止“大幅值来源仅凭尺度获得更高注意力分数”,但不同 value 的幅值仍会直接影响聚合结果。

Block Attention Residuals

Full AttnRes 对每层保留所有早期层输出。Block AttnRes 把 LL 层划分为 NN 个块,每块约含 S=L/NS=L/N 层,并在块内继续使用普通求和:

bn=jBnfj(hj). \bm{b}_n=\sum_{j\in\mathcal{B}_n}f_j(\bm{h}_j).

块内前 ii 层的部分和记为 bni\bm{b}_n^i。第 nn 个块的首层在 [b0,b1,,bn1][\bm{b}_0,\bm{b}_1,\ldots,\bm{b}_{n-1}] 上做注意力,其中 b0=h1\bm{b}_0=\bm{h}_1;块内后续层还加入当前块部分和 bni1\bm{b}_n^{i-1}。这保留了:

  • 跨块的选择性检索;
  • 块内的低成本残差累加;
  • embedding 作为独立、始终可访问的来源。

N=LN=L 时恢复 Full AttnRes;当 N=1N=1 时接近普通残差,但 embedding 被单独隔离为一个来源。论文经验上发现固定约 8 个块能保留 Full AttnRes 的大部分收益。

Architecture

论文在 Kimi Linear 上验证。Kimi Linear 是 MoE Transformer:

  • Kimi Delta Attention(KDA)与 Multi-Head Latent Attention(MLA)按 3:1 交替;
  • 每个 attention 子层之后接一个 MoE 前馈子层;
  • 结构遵循 Moonlight / DeepSeek-V3 风格;
  • AttnRes 不改变深度、隐藏维度、专家路由和 MLP 结构。
组件输入输出可学习量作用
Layer transform flf_lhlRd\bm{h}_l\in\mathbb{R}^d子层输出 vl\bm{v}_l原模型参数执行 attention 或 MLP
AttnRes key norm历史来源 vi\bm{v}_i归一化 key每层一个 RMSNorm消除 key 幅值对 logits 的直接偏置
Pseudo-query层编号 llwlRd\bm{w}_l\in\mathbb{R}^d每层一个向量定义该层偏好的深度来源
Depth softmaxquery 与历史 keys每 token 的 αil\alpha_{i\to l}无额外参数在深度来源之间竞争分配概率
Block accumulator块内子层输出bn\bm{b}_nbni\bm{b}_n^i把每块压缩为一个表示

重要细节:

  • 每个 attention 子层和 MLP 子层都有独立伪查询,因此一个 Transformer block 含两次深度检索。
  • 伪查询必须零初始化。此时 logits 全为 0,初始权重是均匀分布。
  • 均匀分布得到的是早期来源的平均,不是标准残差的单位权重求和。所以“drop-in replacement”指接口和训练架构易替换,并不表示初始化时与标准残差函数等价,也不表示可以无损改造已有 checkpoint。
  • 默认 query 不依赖 token;权重之所以依赖内容,是因为 keys 来自当前样本的层输出。

Forward, Training and Inference

以 Block AttnRes 的一个 Transformer block 为例:

  1. 维护已完成的块表示列表 [b0,,bn1][\bm{b}_0,\ldots,\bm{b}_{n-1}] 和当前块部分和 bni\bm{b}_n^i
  2. 在 attention 子层之前,用该子层伪查询对已完成块与当前部分和做深度注意力,得到输入 hl\bm{h}_l
  3. 执行原模型的 attention norm 和 attention,把输出加入当前块部分和。
  4. 在 MLP 子层之前,用另一组伪查询和 RMSNorm 再做一次深度注意力。
  5. 执行 MLP,并把输出加入部分和。
  6. 到达块边界后,把部分和冻结为新的 bn\bm{b}_n,供后续块检索。
  7. 最终输出层聚合全部块表示。

训练中的反向传播仍由自动微分完成。与标准残差相比,梯度不仅沿子层计算传播,也通过 αil\alpha_{i\to l} 对不同深度来源重新分配。由于 softmax\operatorname{softmax} 概率质量存在竞争,一个来源权重增加会压低其他来源权重。

Infrastructure Design

PP 个物理 stage、每个 stage 有 VV 个 virtual stage 的交错流水线中,若每个物理 stage 平均产生 NpN_p 个块表示,朴素通信量为

Commnaive=PV(PV1)2Npd. \operatorname{Comm}_{\mathrm{naive}}=\frac{PV(PV-1)}{2}N_p d.

缓存早先 virtual stage 已收到的块后,通信量变为

Commcached=P(P1)2Npd+(V1)P2Npd. \operatorname{Comm}_{\mathrm{cached}}=\frac{P(P-1)}{2}N_p d+(V-1)P^2N_p d.

峰值单次传输从依赖 PVPV 降为依赖 PP。论文报告无 pipeline parallelism 时训练额外开销很小,有 pipeline parallelism 时端到端额外开销低于 4%。

推理时,默认伪查询与当前 hidden state 解耦,因此同一块内 SS 个子层的 query 可提前批处理:

  1. Phase 1: 所有 query 一次性访问已完成块的 KV,批量计算 inter-block attention。
  2. Phase 2: 子层顺序处理当前块部分和,并用 online softmax\operatorname{softmax} 精确合并 inter-block 与 intra-block 结果。

论文给出的典型配置为 L=128L=128N=8N=8S=16S=16

机制每 token、每层残差机制 I/O
Standard Residual3d3d
mHC,m=4m=434d34d
Full AttnRes,两阶段24d24d
Block AttnRes,两阶段5.5d5.5d

论文报告典型推理负载下延迟额外开销低于 2%。长上下文 prefill 时,块表示沿 sequence 维做 tensor-parallel sharding;128K 上下文、8 个块的总缓存由约 15 GB 降至 8 卡时每卡约 1.9 GB,结合 16K chunk 后每卡低于 0.3 GB。

这里存在一个需要澄清的复杂度表述:方法章节称 Block AttnRes 的“计算从 O(L2)O(L^2) 降到 O(N2)O(N^2)”,但若统计全部 LL 个子层、每层最多访问 NN 个块,更自然的总算术量是 O(LNd)O(LNd);论文在 Related Work 中也写成 O(LN)O(LN)O(N2)O(N^2) 只在隐去每块 S=L/NS=L/N 个层或按块归一化时成立,正文记号不够一致。

Evidence

Scaling-Law Results

作者训练五个 MoE 规模,每个规模比较 PreNorm baseline、Block AttnRes(约 8 块)和 Full AttnRes。所有同规模变体使用由 baseline 选择的相同超参数,context length 为 8192。

激活参数量TokensBaselineBlock AttnResFull AttnResmHC(-lite)
194M38.7B1.9311.9091.8991.906
241M45.4B1.8951.8751.8741.869
296M62.1B1.8291.8091.8041.807
436M87.9B1.7661.7461.7371.747
528M119.0B1.7191.6931.6921.694

拟合曲线为

Lbase=1.891C0.057,Lblock=1.870C0.058,Lfull=1.865C0.057. \mathcal{L}_{\mathrm{base}}=1.891C^{-0.057}, \qquad \mathcal{L}_{\mathrm{block}}=1.870C^{-0.058}, \qquad \mathcal{L}_{\mathrm{full}}=1.865C^{-0.057}.

三条曲线斜率几乎相同,主要区别是 AttnRes 的截距更低。作者据此估计,在 5.6 PFLOP/s-days 附近,Block AttnRes 达到 baseline 需要约 1.25×1.25\times 训练算力才能达到的损失。

这项证据的强项是五个规模上方向完全一致;弱项是“1.25×1.25\times”来自只有五个点、约一个数量级算力范围内的幂律拟合,而且 baseline 达到相同损失所需的算力超出其最大实测点,因此包含外推,不应等同于直接进行了一次 1.25×1.25\times 算力对照训练。

48B / 3B Activated Model

最终模型配置:

  • 27 个 Transformer blocks,即 54 个 attention / MLP 子层;
  • 256 个 routed experts,每 token 激活 8 个,另有 1 个 shared expert;
  • 48B 总参数,3B 激活参数;
  • Block AttnRes 每 6 个子层为一块,共 9 个块;
  • 加上 embedding,共 10 个深度来源;
  • 先训练 1T tokens,再用约 400B 高质量 tokens 做 mid-training;
  • context length 先为 4096,之后继续扩展到 32K;
  • Muon 优化器、WSD 学习率计划、全局 batch size 8M tokens。

Downstream Results

类别BenchmarkBaselineAttnRes差值
GeneralMMLU73.574.6+1.1
GeneralMMLU-Pro Hard52.252.20.0
GeneralGPQA-Diamond36.944.4+7.5
GeneralBBH76.378.0+1.7
GeneralARC-Challenge64.665.7+1.1
GeneralHellaSwag83.283.4+0.2
GeneralTriviaQA69.971.8+1.9
Math & CodeGSM8K81.782.4+0.7
Math & CodeMGSM64.966.1+1.2
Math & CodeMath53.557.1+3.6
Math & CodeCMath84.785.1+0.4
Math & CodeHumanEval59.162.2+3.1
Math & CodeMBPP72.073.9+1.9
ChineseCMMLU82.082.9+0.9
ChineseC-Eval79.682.5+2.9

结果方向很整齐:15 个任务中 14 个提升、1 个持平。GPQA-Diamond、Math、HumanEval 和 C-Eval 的增幅较明显,符合作者“组合推理更受益于跨深度检索”的解释。

但该解释仍是相关性推断。论文没有报告不同随机种子的均值和方差、benchmark 置信区间、对“推理任务收益更大”的统计分组检验,也没有通过干预特定深度路由证明早期信息检索导致了推理提升。最稳妥的结论是:AttnRes 在这次 1.4T-token 配对训练中对所有报告任务非劣,并在若干推理任务上有较大绝对增益。

Ablation Results

消融使用缩放实验中的 16-block 模型,超参数与算力预算相同。

VariantValidation Loss相对 Full AttnRes
Baseline PreNorm1.766+0.029
DenseFormer1.767+0.030
mHC1.747+0.010
Full AttnRes1.7370
Full + input-dependent query1.731-0.006
Full + input-independent mixing1.749+0.012
Full + sigmoid1.741+0.004
Full without RMSNorm1.743+0.006
Sliding window,W=1+8W=1+81.764+0.027
Block,S=4S=41.746+0.009
Block + 16 heads1.752+0.015
Block without RMSNorm1.750+0.013

消融支持五个设计判断:

  1. 远距离访问有用: 只看最近 8 层的 sliding window 几乎退回 baseline。
  2. 输入相关权重有用: 静态 mixing 明显弱于 Full AttnRes。
  3. 竞争归一化有用: softmax\operatorname{softmax} 优于逐项 sigmoid\operatorname{sigmoid}
  4. key 归一化有用: 去掉 RMSNorm 会稳定退化。
  5. 单头深度混合足够: 16 头版本更差,说明按通道组分离深度路由在该设置下没有收益。

同时,input-dependent query 达到全表最好损失 1.731,说明默认静态伪查询并不是表达力最优,而是为了批量计算和低访存主动牺牲了性能。这是论文最重要的系统—建模折中之一。

Block Size and Architecture Sweep

在 32 个子层的消融模型上,Block AttnRes 随块变细而变好:

Block Size SS近似块数 NNLoss
3211.757
1621.753
841.748
481.746
2161.746
132,Full1.737

S=4S=4S=2S=2 几乎相同,支持“约 8 个块是好折中”;但 Full 仍有额外 0.009 loss 优势,不能说块压缩无损。

作者还在固定约 6.5×10196.5\times10^{19} FLOPs 和约 2.3×1082.3\times10^8 激活参数下,扫描 25 个深度—宽度—头数配置。AttnRes 在全部 25 个点上优于 baseline,幅度为 0.019 到 0.063。

  • baseline 最优点:dmodel/Lb60d_{\mathrm{model}}/L_b\approx60,loss 1.847;
  • AttnRes 最优点:dmodel/Lb45d_{\mathrm{model}}/L_b\approx45,loss 1.802;
  • 两者都偏好 H/Lb0.3H/L_b\approx0.3

固定参数预算时,更低的 dmodel/Lbd_{\mathrm{model}}/L_b 对应更深、更窄的网络。这是“AttnRes 更会利用深度”的直接经验支持。不过更深模型的串行推理延迟更高,论文也明确不把此结果直接解释为部署建议。

Training Dynamics

图 5 比较 1T-token 阶段末期:

  • baseline 最后一个 block 的输出幅值约 12.15,Block AttnRes 约 1.91;
  • baseline 输出幅值总体随深度单调上升;
  • Block AttnRes 在每个块内上升、到块边界后重置,形成有界周期模式;
  • baseline 最早 block 的梯度量级约 2.47×1052.47\times10^{-5},后层多数低一个数量级;
  • Block AttnRes 的梯度在深度上更均匀,但仍有明显块边界结构。

这些图很好地证明“AttnRes 改变了幅值和梯度分布”,但还不能单独证明这种分布变化就是性能提升的因果机制。

Claims to Evidence Mapping

Claim类型支撑证据强度风险
AttnRes 在各规模上降低验证损失Empirical五个模型规模,所有点方向一致仅 Kimi Linear 风格 MoE;没有 seed 方差
Block AttnRes 约等价于 1.25×1.25\times baseline 算力Model-based empirical五点幂律拟合依赖拟合并外推到最大 baseline 实测范围之外
约 8 个块保留大部分 Full 收益Empiricalblock-size sweep;大规模差距缩至 0.001只覆盖特定深度与 Kimi 架构
内容相关的深度选择是关键Empirical静态 mixing 1.749 vs Full 1.737;DenseFormer 1.767中强比较方法实现与调参预算披露不充分
AttnRes 缓解 PreNorm dilutionEmpirical / mechanistic输出幅值有界、梯度更均匀现象强、因果中等没有把动力学变化与性能做干预关联
更适合组合推理Empirical interpretationGPQA、Math、HumanEval 增益较大无多次实验与任务分组显著性
训练额外开销低于 4%Systems empirical正文报告弱到中未给硬件、并行配置、序列长度和测量误差
推理延迟额外开销低于 2%Systems empirical正文报告 + I/O 推导弱到中“typical workloads”未定义,无完整 latency 表
Full / Block 是深度 softmax attentionAnalytical明确公式与结构化矩阵解释重参数化视角不自动带来泛化保证
AttnRes 是可扩展的 drop-in replacementEngineering48B / 3B 激活、1.4T tokens 训练中强未证明 checkpoint 后装兼容;完整实现未公开

Experimental Design Assessment

数据与训练语料

论文只说明沿用 Kimi Linear 的 1.4T-token recipe:1T-token WSD 预训练、约 400B 高质量 token 的 mid-training;缩放实验使用 38.7B 到 119.0B tokens;最终模型从 4096 上下文继续扩展到 32K。

未披露语料组成、语言比例、时间截止点、去重与质量过滤、训练/验证集构造、400B “高质量”数据的定义,以及下游 benchmark 与预训练语料的去污染流程。

这使得架构配对比较仍有一定内部有效性——只要 baseline 与 AttnRes 确实使用同一数据流——但外部研究者无法审计数据泄漏,也无法复现绝对分数。

Baseline Fairness

有利因素:

  • 同规模变体共享训练 tokens、模型尺寸和 baseline 选出的超参数;
  • 作者没有为 AttnRes 单独重调学习率,比较对 baseline 偏保守;
  • 覆盖标准 PreNorm、DenseFormer、mHC、mHC-lite、sliding-window 和多个内部变体;
  • 架构 sweep 在固定 FLOPs 和激活参数下进行。

仍需质疑:

  • DenseFormer、mHC 的实现来源、调参搜索空间和最佳 checkpoint 选择规则未交代;
  • mHC 与 AttnRes 的系统 I/O 对比没有同硬件、同 kernel 的端到端实测表;
  • 48B 主实验只比较 baseline 与 Block AttnRes,没有 Full AttnRes、mHC 或 MUDDFormer 的同尺度结果;
  • 默认 AttnRes 需要零初始化,说明优化对初始化敏感,但没有完整初始化敏感性曲线。

Missing Experiments

  1. 在中小规模上报告至少 3 个随机种子和误差条。
  2. 在标准 dense Transformer、Llama 风格模型、不同 MoE 路由或视觉 Transformer 上测试。
  3. 在 48B 规模加入 mHC / mHC-lite、DenseFormer 或 MUDDFormer。
  4. 真正训练一条 1.25×1.25\times compute baseline,而不只依赖幂律拟合。
  5. 明确 GPU、并行度、batch、context、decode 长度和 kernel 版本,报告吞吐、延迟和显存。
  6. 固定、打乱或删除高权重来源,验证 attention weight 是否对应实际因果贡献。
  7. 测试把已有 PreNorm checkpoint 改造为 AttnRes 所需的适配成本。
  8. 检查不同 token 类型、语言、任务和训练阶段下的路由稳定性。
  9. 检查极深模型、很少块、异常长上下文和分布外数据的失败模式。

Theoretical and Mathematical Assessment

本文没有给出收敛定理或泛化界。理论贡献主要是三个结构化解释:

  1. 标准残差展开后等价于深度维全 1 的下三角 mixing matrix。
  2. Highway、(m)HC 等递推可以用低 semiseparable rank 的深度矩阵表示。
  3. Full AttnRes 允许输入相关的稠密深度 mixing matrix,Block AttnRes 的有效秩位于粗粒度块数和完整层数之间。

这个统一视角有较强的研究启发性,因为它把“残差拓扑设计”转化为“深度序列建模”。但文中关于 rank、表达力和训练效果之间的联系主要是解释性陈述,没有形成“更高 rank 必然带来更好损失”的定理。

Key Assumptions

  • 网络深度远小于序列长度,因此深度注意力的二次复杂度可接受;在普通数十到数百层 LLM 上合理。
  • 约 8 个块能跨规模复用;实验支持到 528M 激活参数和 48B 总参数,但未证明对更深或不同架构成立。
  • 静态伪查询足以捕获层级偏好;消融显示输入相关 query 更强,默认设计是工程折中。
  • softmax 凸组合不会损坏标准残差的优化优势;大规模训练成功是有力经验证据,但没有恒等映射或梯度下界的理论保证。
  • Block 内使用求和、Block 间使用归一化权重,意味着模型同时存在两种尺度机制;RMSNorm 只归一化 keys,不归一化 values。

Formula and Reference Checks

核心 Full / Block 公式与官方伪代码相符。引用键检查中,正文使用的 73 个 citation key 在 main.bib 中全部存在。

两个值得作者澄清的点:

  1. 复杂度记号不一致: 方法段的 O(N2)O(N^2) 与全文其他位置的 O(LN)O(LN) 需要统一。
  2. 两阶段算法统计量定义略含混: AttnWithStats 返回的 o\bm{o}mm\ell 是未归一化 numerator 还是已归一化 attention output,伪代码中第一层又写 o(1)/(1)\bm{o}^{(1)}/\ell^{(1)}。从 online softmax\operatorname{softmax} 合并式看,o\bm{o} 应是按局部最大值缩放后的未归一化 numerator;接口名称和注释应明确。

Contribution and Incrementality

创新类型

  • [x] 概念创新: 把残差聚合系统化为深度注意力问题。
  • [ ] 严格理论创新: 没有新的收敛或泛化定理。
  • [x] 方法创新: Full / Block AttnRes。
  • [x] 经验创新: 从小规模缩放律到 48B MoE 的一致验证。
  • [x] 工程创新: 跨 stage 缓存、两阶段计算、online softmax 合并和 sequence sharding。

与最近竞品的增量

方法深度来源权重类型主要优势相对 AttnRes 的局限或优势
DenseFormer多个早期层learned-static极简、参数少不随 token 内容变化;本文消融中无收益
Hyper-Connections多个并行流dynamic recurrence扩展残差状态秩不直接检索单个历史层
mHC受约束的多流dynamic recurrence稳定、已考虑系统实现典型 I/O 更高;恒等映射动机更明确
MUDDFormer多层、Q/K/V/residual 多流input-dependent表达力强,公开实现与模型更完整结构和投影更重;本文没有同尺度直接比较
SiameseNormPreNorm / PostNorm 双流fixed topology处理稳定性—表达力冲突不提供任意历史层检索
AttnRes所有层或块级历史key-dependent softmax简单、可解释为深度检索、系统折中完整完整训练实现和跨架构验证缺失

AttnRes 不是第一个跨层连接,也不是第一个动态跨层加权方法。它真正的新意是把单个静态伪查询、输入相关 keys 和对深度来源的标准 softmax\operatorname{softmax} 组合得非常干净。这种设计比 MUDDFormer 更简洁,比 DenseFormer 更动态,比多流 Hyper-Connections 更接近显式检索。

Innovation Score: 7.5/10

这是一个高质量的架构级贡献:核心公式简单、问题定位准确、缩放结果一致,而且作者没有停在小模型原型,而是解决了 pipeline 和 inference 的实际障碍。扣分主要因为相关方向已经有 DenseFormer、MUDDFormer、HC/mHC 等强邻居,且本文没有公开足以独立复现 48B 结果的实现和训练数据。

Critical Assessment

Strengths

  1. 问题重构非常有品味。 把残差流从“加法捷径”提升为“深度聚合机制”,打开新的设计空间。
  2. 方法极简。 默认每层只增加一个 RMSNorm 和一个 dd 维伪查询,参数开销可忽略。
  3. Full—Block—Systems 叙事完整。 不只提出昂贵的全连接版本,而是正面处理训练通信、推理 I/O 和长上下文缓存。
  4. 缩放证据方向一致。 五个规模、25 个架构点、多个消融都没有出现收益反转。
  5. 消融有辨识力。 静态 mixing、sigmoid、无 RMSNorm、sliding window、多头等对照分别回答了不同设计问题。
  6. 大规模配对实验有价值。 48B / 3B 激活模型在全部 15 个任务上非劣,减少“只在 toy setup 有效”的疑虑。
  7. 诚实呈现工程折中。 input-dependent query 更强但更慢、Full 更强但更贵,论文没有掩盖这些结果。

Major Issues

1. 可复现性不足

截至检查时,官方 GitHub 只有 README、论文 PDF 和三张图片,没有可执行训练代码、模型配置、kernel、checkpoint、数据配方、评测脚本或开源许可证。README 中的 Python 只是与论文一致的伪代码,不能验证分布式训练、online softmax、显存和延迟主张。对于一篇强调“practical at scale”的系统—架构论文,这是最重要的缺口。

2. 统计不确定性没有量化

所有预训练结果都以单点给出,没有 seed 方差、置信区间或 checkpoint 波动。0.001 到 0.01 loss 差异在大规模预训练中可能有意义,但读者无法判断训练噪声大小。HellaSwag +0.2、CMath +0.4 等小幅收益尤其需要误差估计。

3. 外部有效性受限

所有主要实验都基于 Kimi Linear 风格 MoE。没有标准 dense Transformer、其他 attention 架构、视觉模型或公开数据集上的完整预训练。结论“AttnRes 是通用 drop-in replacement”目前强于证据范围。

4. 系统开销主张缺少可审计 benchmark

“训练低于 4%”“推理低于 2%”很吸引人,但论文未给出硬件、并行拓扑、batch size、prefill/decode 配置、吞吐量、kernel 版本或测量方差。I/O 推导支持趋势,却不能替代端到端实测表。

5. 机制解释仍是观察性证据

深度 attention map 显示对 embedding、近邻和远层的结构化权重,但权重大小不等于因果重要性。2026 年后续工作 When Does Routing Become Interpretable? 也指出,在 Block AttnRes 上平均路由质量与干预后的因果贡献可能分离。因此,“可视化出了路由”应视为候选机制假设,而不是机制证明。

Significant Concerns

  1. 1.25×1.25\times compute advantage”需要降调表达: 它是缩放曲线估计,不是直接对照。
  2. “drop-in”含义需要限定: 方法适合从头训练时替换残差模块;论文没有证明可直接改造已有 checkpoint。
  3. 初始函数不等价: 零 query 初始化得到均匀平均而非标准残差求和。
  4. 比较范围不完整: 48B 上没有 mHC、MUDDFormer 或 Full AttnRes。
  5. 数据污染无法审计: 私有预训练和 mid-training 数据使 downstream 绝对分数难以独立解释。

Minor Issues

  • “幅值按 O(L)O(L) 增长”需要明确指范数、平方范数还是最坏情况。
  • Block 计算复杂度在不同章节写为 O(N2)O(N^2)O(LN)O(LN),应统一。
  • 论文把 attention 与 MLP 都叫 layer,同时又用 Transformer block,读者容易混淆 LLLbL_b
  • 伪代码没有展示 query 零初始化、最终输出层聚合和 online softmax kernel 细节。
  • 没有报告参数增量的绝对数字;虽可从每层 dd 维 query 推断为很小,但应直接列出。

Reviewer Recommendation

Recommendation: Accept with Major Reproducibility Revisions

如果按顶级会议架构论文的标准,我倾向于 7/10,Weak Accept / Accept;如果代码与系统结果是强制审查项,则会降为 Major Revision

接受理由:

  • 研究问题重要且长期被低估;
  • 方法足够简单、可推广,并有明确理论视角;
  • 小规模缩放、大规模训练、消融和架构搜索证据彼此一致;
  • 系统设计显示作者确实解决了真实扩展问题。

必须补强的事项:

  1. 发布可运行实现、配置、kernel 和至少一个公开 checkpoint;
  2. 在中小模型上补多 seed 方差;
  3. 给出完整系统 benchmark;
  4. 在公开数据和至少一种 dense Transformer 上验证;
  5. 1.25×1.25\times 算力优势、drop-in 和机制解释收窄措辞。

Field Position

残差连接研究正在从“调缩放系数和归一化位置”转向“设计深度方向的信息拓扑”:

  1. 缩放 / 归一化路线: DeepNorm、HybridNorm、SiameseNorm;
  2. 多流状态路线: Hyper-Connections、mHC、DDL;
  3. 显式跨层访问路线: DenseFormer、MUDDFormer、MRLA、AttnRes。

AttnRes 位于第三条路线,并借助结构化矩阵视角与第二条路线建立统一解释。它最可能产生的长期影响,不一定是“所有模型都直接采用当前 Block AttnRes”,而是促使基础模型架构把深度路由视为与 token attention、MoE routing 同等级的设计轴。

一句话定位:

AttnRes 是把固定残差流改造成 token-wise 深度检索的架构贡献;相对 DenseFormer 更动态,相对 MUDDFormer 更简洁,相对 mHC 更显式地访问历史深度,但公开复现生态明显落后。

Research Direction and Outlook

科学与工程价值

问题具有持续价值。只要 Transformer 仍通过几十到数百个串行子层计算,如何避免深度信息被单一路径压缩就不会消失。即使未来主架构改变,深度路由也可迁移到 SSM、混合 recurrent-attention 网络或多阶段视觉模型。

Scalability

有利因素:

  • 参数增量随 LdLd 线性增长且非常小;
  • Block 数可固定,使保存历史不随深度线性恶化;
  • 静态 query 允许提前批处理和 online softmax;
  • 可与 MoE、KDA、MLA 共存。

瓶颈:

  • 更细粒度深度检索仍增加 HBM 访问和跨 stage 通信;
  • 深度变大时,固定 8 块可能压缩过度;
  • input-dependent query 性能更强,却破坏推理批处理优势;
  • 更深、更窄的最优结构会增加串行 latency。

Follow-Up Questions

  1. 低成本动态 query: 用低秩、分组或滞后 hidden state 生成 query,争取接近 1.731 的损失而保留批处理。
  2. 自适应分块: 让块边界由训练动态或路由熵决定,而非固定层数。
  3. 因果路由学习: 用干预损失或稀疏约束让 attention mass 更接近真实贡献。
  4. checkpoint surgery: 研究从标准 PreNorm 权重平滑迁移到 AttnRes 的初始化与短程适配。
  5. 跨模态深度路由: 在 ViT、DiT、语音和科学模型中验证是否同样缓解有效深度不足。
  6. 与 mHC / SiameseNorm 组合: Block AttnRes 负责远程检索,多流或双流结构负责局部恒等路径与稳定性。
  7. 路由稀疏化: top-kk 深度来源可能进一步降低访存,但需要避免路由塌缩。

Personal Follow-Up Decision

  • [x] 非常值得:计划复现或改进
  • [ ] 值得参考:思想有用,但不会直接做后续
  • [ ] 了解即可
  • [ ] 值得避免

优先级建议是:先在公开 300M 到 1B dense 模型上做严格多 seed 复现,再研究低成本 input-dependent query。直接追求 48B 复现的成本过高,而且在官方代码缺失时不利于定位差异来源。

Reusable Ideas

  1. 把深度当成可检索轴: 适用于任何大量串联模块的网络。
  2. 静态 query + 动态 key: 在保持内容相关权重的同时,允许提前批处理 query。
  3. 块级压缩历史:LL 个来源压缩到固定 NN 个来源,是精度—系统成本的通用折中。
  4. 只归一化 keys: 消除注意力打分的尺度偏置,同时保留 values 的原始表示。
  5. online softmax 合并: 将可并行的远程部分与必须串行的局部部分精确合并。
  6. 从动力学诊断架构: 同时观察 loss、层输出幅值和梯度深度分布,比只看最终 benchmark 更能解释训练行为。
  7. 固定算力的深宽搜索:dmodel/Lbd_{\mathrm{model}}/L_bH/LbH/L_b 检验新连接机制是否改变最优架构形状。

Code Verification

官方仓库状态

检查对象:MoonshotAI/Attention-Residuals

仓库当前包含 README、论文 PDF、overview / scaling-law / training-dynamics 图片,以及 README 中的 PyTorch-style pseudocode。

仓库当前不包含可执行实现、训练与评测脚本、配置和依赖锁定、checkpoint、模型权重链接、自动化测试或开源许可证。

Claims to Code Mapping

Claim论文描述仓库可见内容验证状态
Block AttnRes 公式对 blocks + partial block 做 RMSNorm-key softmax attentionREADME 伪代码与论文图 2 一致部分验证
每层静态伪查询proj.weight.squeeze() 作为 query伪代码一致部分验证
attention 与 MLP 前各做一次深度聚合forward 中两次 block_attn_res伪代码一致部分验证
伪查询零初始化论文实验章节明确要求README 伪代码未显示初始化未找到实现
9 blocks / 54 layers 的最终配置论文正文报告无配置文件未找到实现
Muon、WSD、8M-token batch论文正文报告无训练脚本未找到实现
pipeline cache论文系统章节描述无分布式实现无法验证
两阶段推理与 online softmax论文算法描述无 kernel / runtime 实现无法验证
训练额外开销低于 4%论文报告无 benchmark 脚本或日志无法验证
推理延迟额外开销低于 2%论文报告无 benchmark 脚本或日志无法验证
48B / 3B 模型下游结果论文表 3无 checkpoint 和评测输出无法验证

Implementation Quality

不能对真实实现的模块化、数值稳定性、错误处理或测试覆盖做评价,因为官方仓库尚未发布实现。伪代码简洁且与数学定义基本一致,但省略了生产实现最关键的部分:

  • 混合精度下的 online softmax 稳定性;
  • pipeline cache 生命周期;
  • activation checkpointing;
  • tensor-parallel sequence sharding;
  • block boundary 的边界条件;
  • query 零初始化;
  • 最终输出聚合;
  • kernel fusion 与性能测量。

Reproducibility Verdict

当前为低可复现性。 论文层面的算法理解是可复现的,第三方可以依据公式重写一个简化版;但论文主张的 48B 训练收益、低于 4% 训练开销、低于 2% 推理开销和 1.4T-token 下游结果都无法从官方仓库独立复核。

Final Research Taste Assessment

text
创新性 (Novelty):  ★★★★☆ (4.2/5)
  - 深度注意力的表述简洁、有概念穿透力;相关跨层方法已存在,但组合方式新颖。

严谨性 (Rigor):   ★★★☆☆ (3.4/5)
  - 消融和缩放证据扎实;缺少多 seed、公开数据、完整系统测量和可执行代码。

影响力 (Impact):  ★★★★☆ (4.1/5)
  - 很可能推动“深度路由”成为基础模型架构的新设计轴;能否广泛采用取决于独立复现和硬件实现。

最终一句话

这篇论文通过对历史层输出执行 token-wise 深度 softmax\operatorname{softmax},把标准残差连接升级为可学习的跨层检索;它相对静态跨层加权更灵活、相对多流残差更直观,并在 Kimi Linear MoE 上展示了稳定缩放收益,但尚未用公开实现、跨架构实验和统计误差把“漂亮而可信的内部结果”提升为“已被社区验证的通用结论”。

Advisor-Level Action

  • [x] 鼓励继续深化并优先做公开复现
  • [x] 值得作为顶级会议架构论文认真对待
  • [ ] 现阶段直接接受其所有效率和机制结论
  • [ ] 因缺陷而放弃该方向

Static research notes built with VitePress and KaTeX.