Theme
Attention Residuals
One-Sentence Summary
Attention Residuals(AttnRes)把 Transformer 中固定的逐层残差累加改造成沿网络深度进行的、由内容决定权重的
论文故事线与章节任务
整体故事: 标准 PreNorm 残差连接既是梯度高速通道,也是一个隐含的“深度聚合器”。后一个角色长期使用固定单位权重,导致隐藏状态随深度累加、单层更新相对被稀释。作者把“时间维上的 RNN 被注意力替代”类比到“深度维上的残差递归”,让每层按输入内容从所有早期层输出中检索信息。Full AttnRes 表达力最好但保存和通信所有层输出的代价较高,因此作者提出 Block AttnRes,以约 8 个块作为工程折中,并通过缓存、两阶段计算和在线
| 章节 | 任务 | 完成情况 |
|---|---|---|
| Motivation | 把残差连接重解释为深度聚合,并指出固定累加的限制 | 问题定义清晰;幅值增长的理论刻画较粗 |
| AttnRes | 给出 Full 与 Block 两种深度注意力形式 | 公式与伪代码足以理解方法 |
| Infrastructure | 解决大规模训练通信、推理访存和长上下文缓存 | 理论 I/O 分析充分;实测配置披露不足 |
| Experiments | 用缩放律、48B 模型、消融和架构搜索验证收益 | 结果一致;数据、随机方差和跨架构外推不足 |
| Discussions | 建立时间—深度对偶与结构化深度混合矩阵视角 | 有启发性,但不是严格的性能保证 |
| Related Work | 与归一化、多流残差和密集跨层连接定位 | 覆盖较新,方法差异基本准确 |
Problem
Core Challenge
PreNorm Transformer 的标准残差更新为
展开后得到
因此,残差连接不只负责保留恒等梯度路径,也规定了跨深度的信息融合方式:所有早期层输出都以固定权重 1 被累加。作者认为这带来三个问题:
- 不能选择性访问: 当前层只能接收混合后的
,不能主动增强某个早期层、压低另一个早期层。 - 聚合不可逆: 一旦不同层输出被压入同一个残差流,后续层很难恢复单个来源。
- PreNorm dilution: 主残差流幅值随深度增长,而每个子层看到的是归一化后的固定尺度输入;更深层必须产生更大的输出才能保持相对影响。
Motivation
论文的关键观察是“时间—深度对偶”:
- RNN 在时间维把所有过去压缩进单一状态;
- 标准残差在深度维也把所有早期计算压缩进单一状态;
- Transformer 用注意力替代时间递归后获得选择性访问;
- 那么深度维也可以用注意力替代固定残差递归。
这个动机同时具有概念价值和工程价值。概念上,它挑战了“残差连接只是梯度高速通道”的单一理解;工程上,若深层模型能更有效利用每一层,就可能降低达到同等损失所需的训练算力。
需要注意,论文把隐藏状态“幅值按
Previous Work Gaps
- ReZero、LayerScale、DeepNorm、Highway: 修改相邻层递推的缩放或门控,但当前层仍只看一个压缩后的前驱状态。
- Hyper-Connections / mHC: 把残差流扩展为多个流并学习混合矩阵,增加状态秩,但仍以递推方式传递。
- DenseFormer: 能访问多个早期层,但跨层系数是训练后固定的标量,不随 token 内容改变。
- MUDDFormer: 已经提供位置相关、输入相关的多流密集连接,表达力强,但结构和投影更重。
- MRLA、DDL: 可从线性注意力或门控递推角度解释,仍受低秩或递推状态约束。
AttnRes 的精确定位是:用每层一个
Method
Task Formulation
对单个 token,设网络共有
Full Attention Residuals
定义来源表示
第
最终输入为
RMSNorm 只作用于 key,而 value 保留原始幅值。这样可以防止“大幅值来源仅凭尺度获得更高注意力分数”,但不同 value 的幅值仍会直接影响聚合结果。
Block Attention Residuals
Full AttnRes 对每层保留所有早期层输出。Block AttnRes 把
块内前
- 跨块的选择性检索;
- 块内的低成本残差累加;
- embedding 作为独立、始终可访问的来源。
当
Architecture
论文在 Kimi Linear 上验证。Kimi Linear 是 MoE Transformer:
- Kimi Delta Attention(KDA)与 Multi-Head Latent Attention(MLA)按 3:1 交替;
- 每个 attention 子层之后接一个 MoE 前馈子层;
- 结构遵循 Moonlight / DeepSeek-V3 风格;
- AttnRes 不改变深度、隐藏维度、专家路由和 MLP 结构。
| 组件 | 输入 | 输出 | 可学习量 | 作用 |
|---|---|---|---|---|
| Layer transform | 子层输出 | 原模型参数 | 执行 attention 或 MLP | |
| AttnRes key norm | 历史来源 | 归一化 key | 每层一个 RMSNorm | 消除 key 幅值对 logits 的直接偏置 |
| Pseudo-query | 层编号 | 每层一个向量 | 定义该层偏好的深度来源 | |
| Depth softmax | query 与历史 keys | 每 token 的 | 无额外参数 | 在深度来源之间竞争分配概率 |
| Block accumulator | 块内子层输出 | 无 | 把每块压缩为一个表示 |
重要细节:
- 每个 attention 子层和 MLP 子层都有独立伪查询,因此一个 Transformer block 含两次深度检索。
- 伪查询必须零初始化。此时 logits 全为 0,初始权重是均匀分布。
- 均匀分布得到的是早期来源的平均,不是标准残差的单位权重求和。所以“drop-in replacement”指接口和训练架构易替换,并不表示初始化时与标准残差函数等价,也不表示可以无损改造已有 checkpoint。
- 默认 query 不依赖 token;权重之所以依赖内容,是因为 keys 来自当前样本的层输出。
Forward, Training and Inference
以 Block AttnRes 的一个 Transformer block 为例:
- 维护已完成的块表示列表
和当前块部分和 。 - 在 attention 子层之前,用该子层伪查询对已完成块与当前部分和做深度注意力,得到输入
。 - 执行原模型的 attention norm 和 attention,把输出加入当前块部分和。
- 在 MLP 子层之前,用另一组伪查询和 RMSNorm 再做一次深度注意力。
- 执行 MLP,并把输出加入部分和。
- 到达块边界后,把部分和冻结为新的
,供后续块检索。 - 最终输出层聚合全部块表示。
训练中的反向传播仍由自动微分完成。与标准残差相比,梯度不仅沿子层计算传播,也通过
Infrastructure Design
在
缓存早先 virtual stage 已收到的块后,通信量变为
峰值单次传输从依赖
推理时,默认伪查询与当前 hidden state 解耦,因此同一块内
- Phase 1: 所有 query 一次性访问已完成块的 KV,批量计算 inter-block attention。
- Phase 2: 子层顺序处理当前块部分和,并用 online
精确合并 inter-block 与 intra-block 结果。
论文给出的典型配置为
| 机制 | 每 token、每层残差机制 I/O |
|---|---|
| Standard Residual | |
| mHC, | 约 |
| Full AttnRes,两阶段 | |
| Block AttnRes,两阶段 |
论文报告典型推理负载下延迟额外开销低于 2%。长上下文 prefill 时,块表示沿 sequence 维做 tensor-parallel sharding;128K 上下文、8 个块的总缓存由约 15 GB 降至 8 卡时每卡约 1.9 GB,结合 16K chunk 后每卡低于 0.3 GB。
这里存在一个需要澄清的复杂度表述:方法章节称 Block AttnRes 的“计算从
Evidence
Scaling-Law Results
作者训练五个 MoE 规模,每个规模比较 PreNorm baseline、Block AttnRes(约 8 块)和 Full AttnRes。所有同规模变体使用由 baseline 选择的相同超参数,context length 为 8192。
| 激活参数量 | Tokens | Baseline | Block AttnRes | Full AttnRes | mHC(-lite) |
|---|---|---|---|---|---|
| 194M | 38.7B | 1.931 | 1.909 | 1.899 | 1.906 |
| 241M | 45.4B | 1.895 | 1.875 | 1.874 | 1.869 |
| 296M | 62.1B | 1.829 | 1.809 | 1.804 | 1.807 |
| 436M | 87.9B | 1.766 | 1.746 | 1.737 | 1.747 |
| 528M | 119.0B | 1.719 | 1.693 | 1.692 | 1.694 |
拟合曲线为
三条曲线斜率几乎相同,主要区别是 AttnRes 的截距更低。作者据此估计,在 5.6 PFLOP/s-days 附近,Block AttnRes 达到 baseline 需要约
这项证据的强项是五个规模上方向完全一致;弱项是“
48B / 3B Activated Model
最终模型配置:
- 27 个 Transformer blocks,即 54 个 attention / MLP 子层;
- 256 个 routed experts,每 token 激活 8 个,另有 1 个 shared expert;
- 48B 总参数,3B 激活参数;
- Block AttnRes 每 6 个子层为一块,共 9 个块;
- 加上 embedding,共 10 个深度来源;
- 先训练 1T tokens,再用约 400B 高质量 tokens 做 mid-training;
- context length 先为 4096,之后继续扩展到 32K;
- Muon 优化器、WSD 学习率计划、全局 batch size 8M tokens。
Downstream Results
| 类别 | Benchmark | Baseline | AttnRes | 差值 |
|---|---|---|---|---|
| General | MMLU | 73.5 | 74.6 | +1.1 |
| General | MMLU-Pro Hard | 52.2 | 52.2 | 0.0 |
| General | GPQA-Diamond | 36.9 | 44.4 | +7.5 |
| General | BBH | 76.3 | 78.0 | +1.7 |
| General | ARC-Challenge | 64.6 | 65.7 | +1.1 |
| General | HellaSwag | 83.2 | 83.4 | +0.2 |
| General | TriviaQA | 69.9 | 71.8 | +1.9 |
| Math & Code | GSM8K | 81.7 | 82.4 | +0.7 |
| Math & Code | MGSM | 64.9 | 66.1 | +1.2 |
| Math & Code | Math | 53.5 | 57.1 | +3.6 |
| Math & Code | CMath | 84.7 | 85.1 | +0.4 |
| Math & Code | HumanEval | 59.1 | 62.2 | +3.1 |
| Math & Code | MBPP | 72.0 | 73.9 | +1.9 |
| Chinese | CMMLU | 82.0 | 82.9 | +0.9 |
| Chinese | C-Eval | 79.6 | 82.5 | +2.9 |
结果方向很整齐:15 个任务中 14 个提升、1 个持平。GPQA-Diamond、Math、HumanEval 和 C-Eval 的增幅较明显,符合作者“组合推理更受益于跨深度检索”的解释。
但该解释仍是相关性推断。论文没有报告不同随机种子的均值和方差、benchmark 置信区间、对“推理任务收益更大”的统计分组检验,也没有通过干预特定深度路由证明早期信息检索导致了推理提升。最稳妥的结论是:AttnRes 在这次 1.4T-token 配对训练中对所有报告任务非劣,并在若干推理任务上有较大绝对增益。
Ablation Results
消融使用缩放实验中的 16-block 模型,超参数与算力预算相同。
| Variant | Validation Loss | 相对 Full AttnRes |
|---|---|---|
| Baseline PreNorm | 1.766 | +0.029 |
| DenseFormer | 1.767 | +0.030 |
| mHC | 1.747 | +0.010 |
| Full AttnRes | 1.737 | 0 |
| Full + input-dependent query | 1.731 | -0.006 |
| Full + input-independent mixing | 1.749 | +0.012 |
| Full + sigmoid | 1.741 | +0.004 |
| Full without RMSNorm | 1.743 | +0.006 |
| Sliding window, | 1.764 | +0.027 |
| Block, | 1.746 | +0.009 |
| Block + 16 heads | 1.752 | +0.015 |
| Block without RMSNorm | 1.750 | +0.013 |
消融支持五个设计判断:
- 远距离访问有用: 只看最近 8 层的 sliding window 几乎退回 baseline。
- 输入相关权重有用: 静态 mixing 明显弱于 Full AttnRes。
- 竞争归一化有用:
优于逐项 。 - key 归一化有用: 去掉 RMSNorm 会稳定退化。
- 单头深度混合足够: 16 头版本更差,说明按通道组分离深度路由在该设置下没有收益。
同时,input-dependent query 达到全表最好损失 1.731,说明默认静态伪查询并不是表达力最优,而是为了批量计算和低访存主动牺牲了性能。这是论文最重要的系统—建模折中之一。
Block Size and Architecture Sweep
在 32 个子层的消融模型上,Block AttnRes 随块变细而变好:
| Block Size | 近似块数 | Loss |
|---|---|---|
| 32 | 1 | 1.757 |
| 16 | 2 | 1.753 |
| 8 | 4 | 1.748 |
| 4 | 8 | 1.746 |
| 2 | 16 | 1.746 |
| 1 | 32,Full | 1.737 |
作者还在固定约
- baseline 最优点:
,loss 1.847; - AttnRes 最优点:
,loss 1.802; - 两者都偏好
。
固定参数预算时,更低的
Training Dynamics
图 5 比较 1T-token 阶段末期:
- baseline 最后一个 block 的输出幅值约 12.15,Block AttnRes 约 1.91;
- baseline 输出幅值总体随深度单调上升;
- Block AttnRes 在每个块内上升、到块边界后重置,形成有界周期模式;
- baseline 最早 block 的梯度量级约
,后层多数低一个数量级; - Block AttnRes 的梯度在深度上更均匀,但仍有明显块边界结构。
这些图很好地证明“AttnRes 改变了幅值和梯度分布”,但还不能单独证明这种分布变化就是性能提升的因果机制。
Claims to Evidence Mapping
| Claim | 类型 | 支撑证据 | 强度 | 风险 |
|---|---|---|---|---|
| AttnRes 在各规模上降低验证损失 | Empirical | 五个模型规模,所有点方向一致 | 强 | 仅 Kimi Linear 风格 MoE;没有 seed 方差 |
| Block AttnRes 约等价于 | Model-based empirical | 五点幂律拟合 | 中 | 依赖拟合并外推到最大 baseline 实测范围之外 |
| 约 8 个块保留大部分 Full 收益 | Empirical | block-size sweep;大规模差距缩至 0.001 | 强 | 只覆盖特定深度与 Kimi 架构 |
| 内容相关的深度选择是关键 | Empirical | 静态 mixing 1.749 vs Full 1.737;DenseFormer 1.767 | 中强 | 比较方法实现与调参预算披露不充分 |
| AttnRes 缓解 PreNorm dilution | Empirical / mechanistic | 输出幅值有界、梯度更均匀 | 现象强、因果中等 | 没有把动力学变化与性能做干预关联 |
| 更适合组合推理 | Empirical interpretation | GPQA、Math、HumanEval 增益较大 | 中 | 无多次实验与任务分组显著性 |
| 训练额外开销低于 4% | Systems empirical | 正文报告 | 弱到中 | 未给硬件、并行配置、序列长度和测量误差 |
| 推理延迟额外开销低于 2% | Systems empirical | 正文报告 + I/O 推导 | 弱到中 | “typical workloads”未定义,无完整 latency 表 |
| Full / Block 是深度 softmax attention | Analytical | 明确公式与结构化矩阵解释 | 强 | 重参数化视角不自动带来泛化保证 |
| AttnRes 是可扩展的 drop-in replacement | Engineering | 48B / 3B 激活、1.4T tokens 训练 | 中强 | 未证明 checkpoint 后装兼容;完整实现未公开 |
Experimental Design Assessment
数据与训练语料
论文只说明沿用 Kimi Linear 的 1.4T-token recipe:1T-token WSD 预训练、约 400B 高质量 token 的 mid-training;缩放实验使用 38.7B 到 119.0B tokens;最终模型从 4096 上下文继续扩展到 32K。
未披露语料组成、语言比例、时间截止点、去重与质量过滤、训练/验证集构造、400B “高质量”数据的定义,以及下游 benchmark 与预训练语料的去污染流程。
这使得架构配对比较仍有一定内部有效性——只要 baseline 与 AttnRes 确实使用同一数据流——但外部研究者无法审计数据泄漏,也无法复现绝对分数。
Baseline Fairness
有利因素:
- 同规模变体共享训练 tokens、模型尺寸和 baseline 选出的超参数;
- 作者没有为 AttnRes 单独重调学习率,比较对 baseline 偏保守;
- 覆盖标准 PreNorm、DenseFormer、mHC、mHC-lite、sliding-window 和多个内部变体;
- 架构 sweep 在固定 FLOPs 和激活参数下进行。
仍需质疑:
- DenseFormer、mHC 的实现来源、调参搜索空间和最佳 checkpoint 选择规则未交代;
- mHC 与 AttnRes 的系统 I/O 对比没有同硬件、同 kernel 的端到端实测表;
- 48B 主实验只比较 baseline 与 Block AttnRes,没有 Full AttnRes、mHC 或 MUDDFormer 的同尺度结果;
- 默认 AttnRes 需要零初始化,说明优化对初始化敏感,但没有完整初始化敏感性曲线。
Missing Experiments
- 在中小规模上报告至少 3 个随机种子和误差条。
- 在标准 dense Transformer、Llama 风格模型、不同 MoE 路由或视觉 Transformer 上测试。
- 在 48B 规模加入 mHC / mHC-lite、DenseFormer 或 MUDDFormer。
- 真正训练一条
compute baseline,而不只依赖幂律拟合。 - 明确 GPU、并行度、batch、context、decode 长度和 kernel 版本,报告吞吐、延迟和显存。
- 固定、打乱或删除高权重来源,验证 attention weight 是否对应实际因果贡献。
- 测试把已有 PreNorm checkpoint 改造为 AttnRes 所需的适配成本。
- 检查不同 token 类型、语言、任务和训练阶段下的路由稳定性。
- 检查极深模型、很少块、异常长上下文和分布外数据的失败模式。
Theoretical and Mathematical Assessment
本文没有给出收敛定理或泛化界。理论贡献主要是三个结构化解释:
- 标准残差展开后等价于深度维全 1 的下三角 mixing matrix。
- Highway、(m)HC 等递推可以用低 semiseparable rank 的深度矩阵表示。
- Full AttnRes 允许输入相关的稠密深度 mixing matrix,Block AttnRes 的有效秩位于粗粒度块数和完整层数之间。
这个统一视角有较强的研究启发性,因为它把“残差拓扑设计”转化为“深度序列建模”。但文中关于 rank、表达力和训练效果之间的联系主要是解释性陈述,没有形成“更高 rank 必然带来更好损失”的定理。
Key Assumptions
- 网络深度远小于序列长度,因此深度注意力的二次复杂度可接受;在普通数十到数百层 LLM 上合理。
- 约 8 个块能跨规模复用;实验支持到 528M 激活参数和 48B 总参数,但未证明对更深或不同架构成立。
- 静态伪查询足以捕获层级偏好;消融显示输入相关 query 更强,默认设计是工程折中。
- softmax 凸组合不会损坏标准残差的优化优势;大规模训练成功是有力经验证据,但没有恒等映射或梯度下界的理论保证。
- Block 内使用求和、Block 间使用归一化权重,意味着模型同时存在两种尺度机制;RMSNorm 只归一化 keys,不归一化 values。
Formula and Reference Checks
核心 Full / Block 公式与官方伪代码相符。引用键检查中,正文使用的 73 个 citation key 在 main.bib 中全部存在。
两个值得作者澄清的点:
- 复杂度记号不一致: 方法段的
与全文其他位置的 需要统一。 - 两阶段算法统计量定义略含混:
AttnWithStats返回的、 、 是未归一化 numerator 还是已归一化 attention output,伪代码中第一层又写 。从 online 合并式看, 应是按局部最大值缩放后的未归一化 numerator;接口名称和注释应明确。
Contribution and Incrementality
创新类型
- [x] 概念创新: 把残差聚合系统化为深度注意力问题。
- [ ] 严格理论创新: 没有新的收敛或泛化定理。
- [x] 方法创新: Full / Block AttnRes。
- [x] 经验创新: 从小规模缩放律到 48B MoE 的一致验证。
- [x] 工程创新: 跨 stage 缓存、两阶段计算、online softmax 合并和 sequence sharding。
与最近竞品的增量
| 方法 | 深度来源 | 权重类型 | 主要优势 | 相对 AttnRes 的局限或优势 |
|---|---|---|---|---|
| DenseFormer | 多个早期层 | learned-static | 极简、参数少 | 不随 token 内容变化;本文消融中无收益 |
| Hyper-Connections | 多个并行流 | dynamic recurrence | 扩展残差状态秩 | 不直接检索单个历史层 |
| mHC | 受约束的多流 | dynamic recurrence | 稳定、已考虑系统实现 | 典型 I/O 更高;恒等映射动机更明确 |
| MUDDFormer | 多层、Q/K/V/residual 多流 | input-dependent | 表达力强,公开实现与模型更完整 | 结构和投影更重;本文没有同尺度直接比较 |
| SiameseNorm | PreNorm / PostNorm 双流 | fixed topology | 处理稳定性—表达力冲突 | 不提供任意历史层检索 |
| AttnRes | 所有层或块级历史 | key-dependent softmax | 简单、可解释为深度检索、系统折中完整 | 完整训练实现和跨架构验证缺失 |
AttnRes 不是第一个跨层连接,也不是第一个动态跨层加权方法。它真正的新意是把单个静态伪查询、输入相关 keys 和对深度来源的标准
Innovation Score: 7.5/10
这是一个高质量的架构级贡献:核心公式简单、问题定位准确、缩放结果一致,而且作者没有停在小模型原型,而是解决了 pipeline 和 inference 的实际障碍。扣分主要因为相关方向已经有 DenseFormer、MUDDFormer、HC/mHC 等强邻居,且本文没有公开足以独立复现 48B 结果的实现和训练数据。
Critical Assessment
Strengths
- 问题重构非常有品味。 把残差流从“加法捷径”提升为“深度聚合机制”,打开新的设计空间。
- 方法极简。 默认每层只增加一个 RMSNorm 和一个
维伪查询,参数开销可忽略。 - Full—Block—Systems 叙事完整。 不只提出昂贵的全连接版本,而是正面处理训练通信、推理 I/O 和长上下文缓存。
- 缩放证据方向一致。 五个规模、25 个架构点、多个消融都没有出现收益反转。
- 消融有辨识力。 静态 mixing、sigmoid、无 RMSNorm、sliding window、多头等对照分别回答了不同设计问题。
- 大规模配对实验有价值。 48B / 3B 激活模型在全部 15 个任务上非劣,减少“只在 toy setup 有效”的疑虑。
- 诚实呈现工程折中。 input-dependent query 更强但更慢、Full 更强但更贵,论文没有掩盖这些结果。
Major Issues
1. 可复现性不足
截至检查时,官方 GitHub 只有 README、论文 PDF 和三张图片,没有可执行训练代码、模型配置、kernel、checkpoint、数据配方、评测脚本或开源许可证。README 中的 Python 只是与论文一致的伪代码,不能验证分布式训练、online softmax、显存和延迟主张。对于一篇强调“practical at scale”的系统—架构论文,这是最重要的缺口。
2. 统计不确定性没有量化
所有预训练结果都以单点给出,没有 seed 方差、置信区间或 checkpoint 波动。0.001 到 0.01 loss 差异在大规模预训练中可能有意义,但读者无法判断训练噪声大小。HellaSwag +0.2、CMath +0.4 等小幅收益尤其需要误差估计。
3. 外部有效性受限
所有主要实验都基于 Kimi Linear 风格 MoE。没有标准 dense Transformer、其他 attention 架构、视觉模型或公开数据集上的完整预训练。结论“AttnRes 是通用 drop-in replacement”目前强于证据范围。
4. 系统开销主张缺少可审计 benchmark
“训练低于 4%”“推理低于 2%”很吸引人,但论文未给出硬件、并行拓扑、batch size、prefill/decode 配置、吞吐量、kernel 版本或测量方差。I/O 推导支持趋势,却不能替代端到端实测表。
5. 机制解释仍是观察性证据
深度 attention map 显示对 embedding、近邻和远层的结构化权重,但权重大小不等于因果重要性。2026 年后续工作 When Does Routing Become Interpretable? 也指出,在 Block AttnRes 上平均路由质量与干预后的因果贡献可能分离。因此,“可视化出了路由”应视为候选机制假设,而不是机制证明。
Significant Concerns
- “
compute advantage”需要降调表达: 它是缩放曲线估计,不是直接对照。 - “drop-in”含义需要限定: 方法适合从头训练时替换残差模块;论文没有证明可直接改造已有 checkpoint。
- 初始函数不等价: 零 query 初始化得到均匀平均而非标准残差求和。
- 比较范围不完整: 48B 上没有 mHC、MUDDFormer 或 Full AttnRes。
- 数据污染无法审计: 私有预训练和 mid-training 数据使 downstream 绝对分数难以独立解释。
Minor Issues
- “幅值按
增长”需要明确指范数、平方范数还是最坏情况。 - Block 计算复杂度在不同章节写为
与 ,应统一。 - 论文把 attention 与 MLP 都叫 layer,同时又用 Transformer block,读者容易混淆
与 。 - 伪代码没有展示 query 零初始化、最终输出层聚合和 online softmax kernel 细节。
- 没有报告参数增量的绝对数字;虽可从每层
维 query 推断为很小,但应直接列出。
Reviewer Recommendation
Recommendation: Accept with Major Reproducibility Revisions
如果按顶级会议架构论文的标准,我倾向于 7/10,Weak Accept / Accept;如果代码与系统结果是强制审查项,则会降为 Major Revision。
接受理由:
- 研究问题重要且长期被低估;
- 方法足够简单、可推广,并有明确理论视角;
- 小规模缩放、大规模训练、消融和架构搜索证据彼此一致;
- 系统设计显示作者确实解决了真实扩展问题。
必须补强的事项:
- 发布可运行实现、配置、kernel 和至少一个公开 checkpoint;
- 在中小模型上补多 seed 方差;
- 给出完整系统 benchmark;
- 在公开数据和至少一种 dense Transformer 上验证;
- 对
算力优势、drop-in 和机制解释收窄措辞。
Field Position
残差连接研究正在从“调缩放系数和归一化位置”转向“设计深度方向的信息拓扑”:
- 缩放 / 归一化路线: DeepNorm、HybridNorm、SiameseNorm;
- 多流状态路线: Hyper-Connections、mHC、DDL;
- 显式跨层访问路线: DenseFormer、MUDDFormer、MRLA、AttnRes。
AttnRes 位于第三条路线,并借助结构化矩阵视角与第二条路线建立统一解释。它最可能产生的长期影响,不一定是“所有模型都直接采用当前 Block AttnRes”,而是促使基础模型架构把深度路由视为与 token attention、MoE routing 同等级的设计轴。
一句话定位:
AttnRes 是把固定残差流改造成 token-wise 深度检索的架构贡献;相对 DenseFormer 更动态,相对 MUDDFormer 更简洁,相对 mHC 更显式地访问历史深度,但公开复现生态明显落后。
Research Direction and Outlook
科学与工程价值
问题具有持续价值。只要 Transformer 仍通过几十到数百个串行子层计算,如何避免深度信息被单一路径压缩就不会消失。即使未来主架构改变,深度路由也可迁移到 SSM、混合 recurrent-attention 网络或多阶段视觉模型。
Scalability
有利因素:
- 参数增量随
线性增长且非常小; - Block 数可固定,使保存历史不随深度线性恶化;
- 静态 query 允许提前批处理和 online softmax;
- 可与 MoE、KDA、MLA 共存。
瓶颈:
- 更细粒度深度检索仍增加 HBM 访问和跨 stage 通信;
- 深度变大时,固定 8 块可能压缩过度;
- input-dependent query 性能更强,却破坏推理批处理优势;
- 更深、更窄的最优结构会增加串行 latency。
Follow-Up Questions
- 低成本动态 query: 用低秩、分组或滞后 hidden state 生成 query,争取接近 1.731 的损失而保留批处理。
- 自适应分块: 让块边界由训练动态或路由熵决定,而非固定层数。
- 因果路由学习: 用干预损失或稀疏约束让 attention mass 更接近真实贡献。
- checkpoint surgery: 研究从标准 PreNorm 权重平滑迁移到 AttnRes 的初始化与短程适配。
- 跨模态深度路由: 在 ViT、DiT、语音和科学模型中验证是否同样缓解有效深度不足。
- 与 mHC / SiameseNorm 组合: Block AttnRes 负责远程检索,多流或双流结构负责局部恒等路径与稳定性。
- 路由稀疏化: top-
深度来源可能进一步降低访存,但需要避免路由塌缩。
Personal Follow-Up Decision
- [x] 非常值得:计划复现或改进
- [ ] 值得参考:思想有用,但不会直接做后续
- [ ] 了解即可
- [ ] 值得避免
优先级建议是:先在公开 300M 到 1B dense 模型上做严格多 seed 复现,再研究低成本 input-dependent query。直接追求 48B 复现的成本过高,而且在官方代码缺失时不利于定位差异来源。
Reusable Ideas
- 把深度当成可检索轴: 适用于任何大量串联模块的网络。
- 静态 query + 动态 key: 在保持内容相关权重的同时,允许提前批处理 query。
- 块级压缩历史: 把
个来源压缩到固定 个来源,是精度—系统成本的通用折中。 - 只归一化 keys: 消除注意力打分的尺度偏置,同时保留 values 的原始表示。
- online softmax 合并: 将可并行的远程部分与必须串行的局部部分精确合并。
- 从动力学诊断架构: 同时观察 loss、层输出幅值和梯度深度分布,比只看最终 benchmark 更能解释训练行为。
- 固定算力的深宽搜索: 用
和 检验新连接机制是否改变最优架构形状。
Code Verification
官方仓库状态
检查对象:MoonshotAI/Attention-Residuals。
仓库当前包含 README、论文 PDF、overview / scaling-law / training-dynamics 图片,以及 README 中的 PyTorch-style pseudocode。
仓库当前不包含可执行实现、训练与评测脚本、配置和依赖锁定、checkpoint、模型权重链接、自动化测试或开源许可证。
Claims to Code Mapping
| Claim | 论文描述 | 仓库可见内容 | 验证状态 |
|---|---|---|---|
| Block AttnRes 公式 | 对 blocks + partial block 做 RMSNorm-key softmax attention | README 伪代码与论文图 2 一致 | 部分验证 |
| 每层静态伪查询 | proj.weight.squeeze() 作为 query | 伪代码一致 | 部分验证 |
| attention 与 MLP 前各做一次深度聚合 | forward 中两次 block_attn_res | 伪代码一致 | 部分验证 |
| 伪查询零初始化 | 论文实验章节明确要求 | README 伪代码未显示初始化 | 未找到实现 |
| 9 blocks / 54 layers 的最终配置 | 论文正文报告 | 无配置文件 | 未找到实现 |
| Muon、WSD、8M-token batch | 论文正文报告 | 无训练脚本 | 未找到实现 |
| pipeline cache | 论文系统章节描述 | 无分布式实现 | 无法验证 |
| 两阶段推理与 online softmax | 论文算法描述 | 无 kernel / runtime 实现 | 无法验证 |
| 训练额外开销低于 4% | 论文报告 | 无 benchmark 脚本或日志 | 无法验证 |
| 推理延迟额外开销低于 2% | 论文报告 | 无 benchmark 脚本或日志 | 无法验证 |
| 48B / 3B 模型下游结果 | 论文表 3 | 无 checkpoint 和评测输出 | 无法验证 |
Implementation Quality
不能对真实实现的模块化、数值稳定性、错误处理或测试覆盖做评价,因为官方仓库尚未发布实现。伪代码简洁且与数学定义基本一致,但省略了生产实现最关键的部分:
- 混合精度下的 online softmax 稳定性;
- pipeline cache 生命周期;
- activation checkpointing;
- tensor-parallel sequence sharding;
- block boundary 的边界条件;
- query 零初始化;
- 最终输出聚合;
- kernel fusion 与性能测量。
Reproducibility Verdict
当前为低可复现性。 论文层面的算法理解是可复现的,第三方可以依据公式重写一个简化版;但论文主张的 48B 训练收益、低于 4% 训练开销、低于 2% 推理开销和 1.4T-token 下游结果都无法从官方仓库独立复核。
Final Research Taste Assessment
text
创新性 (Novelty): ★★★★☆ (4.2/5)
- 深度注意力的表述简洁、有概念穿透力;相关跨层方法已存在,但组合方式新颖。
严谨性 (Rigor): ★★★☆☆ (3.4/5)
- 消融和缩放证据扎实;缺少多 seed、公开数据、完整系统测量和可执行代码。
影响力 (Impact): ★★★★☆ (4.1/5)
- 很可能推动“深度路由”成为基础模型架构的新设计轴;能否广泛采用取决于独立复现和硬件实现。最终一句话
这篇论文通过对历史层输出执行 token-wise 深度
Advisor-Level Action
- [x] 鼓励继续深化并优先做公开复现
- [x] 值得作为顶级会议架构论文认真对待
- [ ] 现阶段直接接受其所有效率和机制结论
- [ ] 因缺陷而放弃该方向