Skip to content

Residual Connections Harm Generative Representation Learning

Xiao Zhang, Ruoxi Jiang, William Gao, Rebecca Willett, Michael Maire. CVPR 2026, pp. 39669–39679. arXiv:2404.10947.

论文:arXiv · CVPR Open Access · 代码 · ICLR 2025 评审记录

一句话结论

这篇论文发现:在 MAE、U-ViT 和 SiT 这类具有生成式训练目标的视觉 Transformer 中,把恒等残差支路从固定系数 11 改成随深度线性衰减的系数,往往能显著提高线性探测、KNN、扩散 FID 与谱分割指标;但现有证据更适合支持“某些生成式视觉 Transformer 的单位恒等捷径会妨碍中间特征学习”,还不足以支撑标题中不加限定的“残差连接伤害生成式表征学习”。

总体评价

这是一篇“现象很有价值、改动极简单、机制解释尚未闭环”的论文。

  • 最强之处:只缩放恒等支路,就把 MAE 的 ImageNet-1K 线性探测从 67.8%67.8\% 提到 72.7%72.7\%,KNN 从 27.4%27.4\% 提到 63.9%63.9\%;在 SiT-XL/2 上,400K steps 的 FID 从 16.516.5 降到 11.811.8。现象幅度大,且跨重建模型与扩散模型复现。
  • 最关键的科学价值:论文提醒我们,残差连接并非只有“优化更容易”这一面。恒等通路也可能允许信息绕过需要学习的变换,使生成目标可以完成,却没有迫使每层产生适合判别任务的表示。
  • 最大的问题:论文把“低秩特征”“绕过学习”与性能提升串成因果故事,但实验主体仍是相关性证据。方法同时引入 U-Net 式长跳连、零初始化和衰减恒等支路,且不同任务上的最佳衰减不一致。
  • 标题判断:标题很抓眼球,也确实比证据范围更宽。更准确的标题会是 Decaying Identity Shortcuts Improves Representations in Generative Vision Transformers

我的综合评分是 Weak Accept,约 6.5/106.5/10:结果值得发表,结论需要收窄。

版本与投稿轨迹

这篇文章的演化本身很说明问题。

版本时间标题或主要变化
arXiv v12024-04-16Residual Connections Harm Self-Supervised Abstract Feature Learning;主要是 MAE,线性探测约从 67.3%67.3\% 提到 72.3%72.3\%
arXiv v22024-06-20标题收窄到 MAE;表中 MAE 线性探测为 67.8%67.8\%,方法为 72.7%72.7\%
arXiv v32024-10-12改为当前标题,加入扩散模型实验;稿件采用 ICLR 2025 格式
arXiv v42025-01-31加入 KNN、深度与宽度实验等;源码/HTML 留有 ICML 稿件痕迹
arXiv v52026-05-25CVPR 2026 camera-ready,加入 SiT-XL/2 与理论附录

公开材料能够确认的是:该工作投稿 ICLR 2025 后被拒,最终被 CVPR 2026 接收。v4 的 ICML 标记以及 v5 源码中遗留的 NeurIPS 样式文件只能说明稿件曾为相应模板准备过,不能单凭这些痕迹断言它真的完成了对应投稿或被拒

另外,CVPR 页面与 BibTeX 把 Rebecca Willett 拼为 “Willet”,arXiv 作者列表则为 “Willett”;这里采用作者本人常用的后者。

1. 论文究竟在问什么?

标准前馈网络写作

xl+1=fθl(xl), x_{l+1}=f_{\theta_l}(x_l),

残差网络则写作

xl+1=xl+fθl(xl). x_{l+1}=x_l+f_{\theta_l}(x_l).

恒等支路让梯度和信息直接跨层传播,是深网络可训练性的核心设计。但作者观察到一个反常现象:在 MAE 这类生成式自监督模型里,最终重建效果可以很好,编码器的判别表示却不一定好。以 ViT-B MAE 为例,微调准确率很高,但线性探测和 KNN 明显落后于 DINO 一类判别式自监督方法。

论文的假说是:单位系数的恒等捷径太强,模型可以依靠原始 token 一路“直通”,只让残差分支学习修补生成任务所需的局部细节;这样有利于优化和重建,却减弱了中间层主动形成抽象表示的压力。

需要注意,这个假说包含三层不同强度的命题:

  1. 单位恒等捷径会保存更多输入特征;
  2. 保存过强会让残差分支学得更少;
  3. 残差分支学得更少是线性探测较差的原因。

论文对第 1 点有直接结构依据,对第 2、3 点主要提供有效秩和下游性能的相关性,而非干预式因果证明。

2. 核心方法:衰减恒等捷径

作者把残差块改为

xl+1=αlxl+fθl(xl), x_{l+1}=\alpha_l x_l+f_{\theta_l}(x_l),

其中恒等支路系数随深度线性减小:

αl=1δαl,δα=1αminL,l{1,,L}. \alpha_l=1-\delta_{\alpha}l, \qquad \delta_{\alpha}=\frac{1-\alpha_{\min}}{L}, \qquad l\in\{1,\ldots,L\}.

因此第一层系数略小于 11,最后一层为 αL=αmin\alpha_L=\alpha_{\min}。展开递推可得

xL=(i=1Lαi)x0+l=1L(i=l+1Lαi)fθl(xl). x_L= \left(\prod_{i=1}^{L}\alpha_i\right)x_0 + \sum_{l=1}^{L} \left(\prod_{i=l+1}^{L}\alpha_i\right) f_{\theta_l}(x_l).

这个式子比“每层只乘了 0.61.00.6\sim1.0”更重要:原始输入的直接通路受到的是乘法累计衰减,而不是单次衰减。作者把

αeff=i=1Lαi \alpha_{\mathrm{eff}} =\prod_{i=1}^{L}\alpha_i

称为有效恒等系数,并声称表现好的配置大多落在

103αeff<102 10^{-3}\leq \alpha_{\mathrm{eff}}<10^{-2}

附近。

2.1 累计衰减的精确形式

c=1αminc=1-\alpha_{\min},则

αl=1clL. \alpha_l=1-\frac{cl}{L}.

论文定义下的 LL 项乘积可以写成 Gamma 函数:

αeff=l=1L(1clL)=(cL)LΓ(L/c)Γ(L/cL). \alpha_{\mathrm{eff}} =\prod_{l=1}^{L}\left(1-\frac{cl}{L}\right) =\left(\frac{c}{L}\right)^L \frac{\Gamma(L/c)}{\Gamma(L/c-L)}.

LL 较大时,取对数并用黎曼和近似:

logαeff=l=1Llog(1clL)L01log(1ct)dt=Lαmin1αminlogαmin1αmin. \begin{aligned} \log \alpha_{\mathrm{eff}} &=\sum_{l=1}^{L}\log\left(1-\frac{cl}{L}\right) \\ &\approx L\int_0^1\log(1-ct)\,\mathrm{d}t \\ &=L\frac{\alpha_{\min}-1-\alpha_{\min}\log\alpha_{\min}} {1-\alpha_{\min}}. \end{aligned}

所以即使 αmin\alpha_{\min} 看起来并不小,原始直通分量也会随深度近似指数下降。这也解释了为什么深度变化后必须重新理解同一个 αmin\alpha_{\min} 的实际强度。

2.2 对梯度通路的影响

单块 Jacobian 为

Jl=xl+1xl=αlI+fθl(xl)xl. J_l=\frac{\partial x_{l+1}}{\partial x_l} =\alpha_l I+\frac{\partial f_{\theta_l}(x_l)}{\partial x_l}.

跨层 Jacobian 则为

xLx0=l=1L(αlI+Jfl). \frac{\partial x_L}{\partial x_0} =\prod_{l=1}^{L} \left(\alpha_l I+J_{f_l}\right).

标准残差把每层的恒等项固定为 II,而本文把它缩为 αlI\alpha_l I。这确实抑制了纯恒等梯度路径,但也可能损害优化稳定性。作者用 U-Net 式长跳连与残差分支零初始化来补偿,而这意味着最终系统并不是单一变量实验。

3. 一个必须指出的公式—代码不一致

论文把编码器深度记为 LL,公式对 LL 个 block 分配 LLαl\alpha_l。但官方 ViT 代码实际上为每个 block 的 Attention 和 MLP 两个子层分别分配系数:

python
decays = 1 - np.linspace(0, 1, 2 * depth) * (1 - min_decay)

因此深度为 DD 的 ViT 实际使用 2D2D 个衰减残差,而非论文公式表面上的 DD 个。按论文 DD 项公式与代码 2D2D 项调度分别计算:

配置论文 DD 项乘积代码 2D2D 项乘积
D=12,αmin=0.6D=12,\alpha_{\min}=0.64.68×1024.68\times10^{-2}3.58×1033.58\times10^{-3}
D=12,αmin=0.7D=12,\alpha_{\min}=0.71.12×1011.12\times10^{-1}1.76×1021.76\times10^{-2}
D=18,αmin=0.7D=18,\alpha_{\min}=0.74.08×1024.08\times10^{-2}2.36×1032.36\times10^{-3}
D=24,αmin=0.7D=24,\alpha_{\min}=0.71.49×1021.49\times10^{-2}3.15×1043.15\times10^{-4}
D=24,αmin=0.8D=24,\alpha_{\min}=0.86.79×1026.79\times10^{-2}5.74×1035.74\times10^{-3}

论文宣称的最佳区间 10310210^{-3}\sim10^{-2}代码的 2D2D 项定义更相符。读者若只照正文,以每个 Transformer block 一个系数复现,很可能得到明显不同的有效衰减。正文还在 x0x_0l=1Ll=1\ldots L 和层数 LL 的使用上存在轻微索引歧义。

4. MAE 中的具体结构

4.1 数据流与维度

ViT-B/16 的主要数据流是:

RB×3×224×224RB×196×768RB×49×768, \mathbb{R}^{B\times3\times224\times224} \rightarrow \mathbb{R}^{B\times196\times768} \rightarrow \mathbb{R}^{B\times49\times768},

其中 75%75\% patch 被掩码,只保留 49 个可见 patch;加上 CLS token 后,编码器序列长度为 50。编码器含 12 个 Transformer block,代码在 Attention 与 MLP 子层各使用一次衰减,因此共有 24 个系数。

编码器第 2,4,6,8,10,122,4,6,8,10,12 个 block 的输出被保存为 6 级 skip features。8 层 MAE decoder 不再只接收最后一层 latent,而是从完整位置查询出发,通过 SkipLayer 逐级融合编码器特征。

对于每个长跳连,代码先在被遮挡位置填入可学习 mask token,再把 768 维编码器特征与 512 维 decoder 特征拼接:

[henc;hdec]R1280, [h_{\mathrm{enc}};h_{\mathrm{dec}}] \in\mathbb{R}^{1280},

然后经两层 MLP 映射回 512 维。每个 SkipLayer

1280×512+512+512×512+512=919,296 1280\times512+512+512\times512+512=919{,}296

个参数,6 个共 5,515,7765{,}515{,}776 个参数。因此:衰减系数本身不增加参数,但完整方法并非零参数开销。

4.2 重建损失

decoder 输出每个 patch 的像素预测

y^RB×196×(1623)=RB×196×768. \hat y\in\mathbb{R}^{B\times196\times(16^2\cdot3)} =\mathbb{R}^{B\times196\times768}.

训练仍采用标准 MAE 的 masked patch MSE:

LMAE=i=1Nmiy^iyi22i=1Nmi, \mathcal{L}_{\mathrm{MAE}} =\frac{\sum_{i=1}^{N}m_i \lVert \hat y_i-y_i\rVert_2^2} {\sum_{i=1}^{N}m_i},

其中 mi=1m_i=1 表示 patch ii 被遮挡。若启用 normalized pixel loss,则每个 patch 先按自身均值和方差标准化。

4.3 为什么要加 U-Net 式长跳连?

衰减短残差后,浅层局部信息不容易自然流到 decoder。作者于是显式把多层 encoder features 送到 decoder:短捷径负责抑制“躺平”的恒等流,长捷径负责保住重建所需的细节。

这是一种合理的工程配套,但也制造了因果混杂。消融显示:

  • 标准 MAE:76.5%76.5\%
  • 线性衰减到 0.60.6,但没有 U-Net:61.5%61.5\%
  • 线性衰减到 0.60.6,加 U-Net:83.6%83.6\%

因此论文证明的不是“只衰减残差就会变好”,而是“衰减短捷径并用长捷径重新分配信息流可以变好”。

4.4 零初始化

代码把 Attention 输出投影和 MLP 第二层等残差分支出口初始化为零。训练开始时近似有

xl+1αlxl, x_{l+1}\approx\alpha_l x_l,

随后残差分支逐渐学会补偿。这个设计可降低初始训练不稳定,但它也改变了与标准 MAE 的比较条件。论文消融了恒等与残差支路的缩放,却没有把所有初始化因素完全正交拆开。

5. 扩散模型中的实现

论文先在 U-ViT 上验证,再扩展到 SiT-XL/2。SiT 的图像经 VAE 编码:

RB×3×256×256RB×4×32×32. \mathbb{R}^{B\times3\times256\times256} \rightarrow \mathbb{R}^{B\times4\times32\times32}.

使用 2×22\times2 patch 后得到 16×16=25616\times16=256 个 token,每个 token 投影到 1152 维。28 个 Transformer block 被分为 14 层 encoder 和 14 层 decoder,并由对称长跳连连接;同样,Attention 和 MLP 各有一个残差系数,所以代码调度 56 个衰减值。

每个 SiT skip 是一个 115211521152\rightarrow1152 线性层,14 个合计

14(11522+1152)=18,595,584 14(1152^2+1152)=18{,}595{,}584

个参数。时间步和类别条件通过 adaLN-Zero 注入。论文没有重新推导 SiT 的 flow-matching / diffusion 目标,而是沿用基线设置,因此这部分在数学上依赖 SiT 原论文。

推理阶段不需要额外调节 αl\alpha_l:训练和采样使用同一组固定系数。论文报告的是无 classifier-free guidance 的 FID,但复现实验仍需要核对 VAE、采样器、步数和评估实现,不能只看网络结构。

6. “低秩表示”解释及其数学问题

作者认为,生成式模型应把输入压到一个更紧凑、低秩的流形;强恒等连接则保留太多不相关方向。论文用奇异值分布定义

pi=σijσj, p_i=\frac{\sigma_i}{\sum_j\sigma_j},

并把

ρ(A)=ipilogpi \rho(A)=-\sum_i p_i\log p_i

称为 effective rank。

这里有一个明确的术语/公式错误:Roy 与 Vetterli 的标准 effective rank 是谱熵的指数

erank(A)=exp(ipilogpi), \mathrm{erank}(A) =\exp\left(-\sum_i p_i\log p_i\right),

而论文写出的 ρ(A)\rho(A) 实际是 spectral entropy。因为指数函数单调,这个错误不会改变样本间的排序和相关性方向,但会改变数值尺度,也使“秩”的解释不够严谨。

此外还有三个问题:

  1. 正文对究竟在 token、样本还是通道维度构造矩阵/协方差描述不够精确;
  2. 官方仓库没有找到生成有效秩图的脚本,难以从代码核验预处理与聚合方式;
  3. 低秩并非普遍等价于好表征。秩为 1 也可能是完全坍塌,而 DINO 等对比/自蒸馏方法恰恰可能保持较高秩却有很强的语义性。

所以更谨慎的结论是:在作者测试的 MAE 配置中,衰减捷径、较低谱熵与更高线性探测相关;“低秩是提升原因”尚未被证明。

7. 主要实验结果

7.1 ImageNet-1K 表征学习

方法Fine-tuneLinear probeKNN
MoCo-v383.276.766.6
DINO83.378.276.1
Data2Vec84.268.033.2
I-JEPA72.9
CAE83.870.451.4
Latent MIM83.072.050.1
MAE83.667.827.4
本文方法82.972.763.9

解读:

  • 线性探测 +4.9+4.9 个百分点、KNN +36.5+36.5 个百分点,说明改动确实显著改善了冻结特征的直接可用性;
  • 微调从 83.6%83.6\% 降到 82.9%82.9\%,说明它不是“全方位优于 MAE”;
  • 与 DINO 的 78.2%78.2\% 线性探测和 76.1%76.1\% KNN 相比仍有明显差距。因此“弥合生成式与判别式表征鸿沟”只完成了一部分。

正文有一处把 MAE 线性探测写成 67.3%67.3\%,而主表为 67.8%67.8\%;应以表格及后续版本为准。

7.2 深度、宽度与衰减强度

ImageNet-100 线性探测结果:

宽度 / 深度αmin=0.6\alpha_{\min}=0.60.70.70.80.80.90.91.01.0
384 / 1278.578.175.273.569.2
768 / 1283.681.879.879.276.5
1024 / 1283.282.582.179.378.0
768 / 1883.585.084.481.879.2
1024 / 2484.386.084.584.381.4

趋势支持“越深的网络需要更大的 αmin\alpha_{\min}”:因为层数越多,乘积衰减越强。但这里有一个重要的结果呈现问题。ICLR rebuttal 的附表显示,深度 24、αmin=0.7\alpha_{\min}=0.7最后层线性探测是 82.4%82.4\%,而 86.0%86.0\% 是从各层中挑出的最好结果,出现在第 19 层。CVPR 终稿保留 86.0%86.0\%,却在主表中删除了层索引。若其他格子或基线使用最后层,这会引入选择偏差,也会削弱围绕最终层 αeff\alpha_{\mathrm{eff}} 的解释。

7.3 关键消融

设计ImageNet-100 线性探测
x+f(x)x+f(x)76.5
x+0.5f(x)x+\sqrt{0.5}f(x)76.9
0.5(x+f(x))\sqrt{0.5}(x+f(x))82.6
只衰减 Attention 恒等支路79.3
只衰减 MLP 恒等支路80.6
两者都衰减83.6
线性调度,αmin=0.6\alpha_{\min}=0.683.6
余弦调度,αmin=0.6\alpha_{\min}=0.682.8
线性调度,αmin=0.7\alpha_{\min}=0.781.8
余弦调度,αmin=0.7\alpha_{\min}=0.782.9
可学习系数79.5

0.5(x+f(x))\sqrt{0.5}(x+f(x)) 的改善表明,整体尺度与优化动力学可能也是机制的一部分,并不能把全部效果都解释为“只削弱恒等信息”。可学习系数表现较弱,也说明未经正则化的学习动力学可能把系数重新推回容易优化、但不利于表征的区域。

7.4 U-ViT:表征与生成质量

数据集 / 任务指标α=1.0\alpha=1.00.80.80.70.70.60.6
CIFAR-100,无条件LP62.4763.5866.8664.63
CIFAR-100,无条件FID14.3411.658.9911.71
ImageNet-100,无条件LP72.874.576.175.8
ImageNet-100,无条件FID44.4040.9641.1743.51
ImageNet-100,类别条件FID6.935.755.114.98
ImageNet-1K,类别条件FID7.656.235.344.90

最有意思的是:在 CIFAR-100 上表征和 FID 同时于 0.70.7 最优,但在 ImageNet-100 无条件生成中,LP 最优是 0.70.7,FID 最优是 0.80.8。因此“更好的生成必然来自更好的表示”不是严格单调关系。

7.5 SiT-XL/2

训练步数模型FIDIS
200K原始 SiT,无 U-Net25.2
200KU-Net,α=1.0\alpha=1.022.757.3
200KU-Net,α=0.8\alpha=0.814.279.7
400K原始 SiT,无 U-Net17.2
400KU-Net,α=1.0\alpha=1.016.574.8
400KU-Net,α=0.8\alpha=0.811.891.8

这组结果证明方法并不只对小模型有效。但基线、U-Net 与衰减同时变化,最公平的核心差值应看同为 U-Net 的 22.714.222.7\rightarrow14.216.511.816.5\rightarrow11.8,而不是只拿原始 SiT 对比最终系统。正文把 “400K steps” 误写成过 “400 steps”。

7.6 其他任务

  • COCO 无监督谱分割 mIoU:标准 MAE 为 4.104.10,本文为 10.4110.41。这支持特征空间更有结构,但绝对值仍低。
  • 一个修改版监督 ResNet 的小规模 ImageNet 子集实验:α=0.7\alpha=0.794.4%94.4\%,基线为 93.6%93.6\%。设置描述较模糊,不足以把结论推广到一般监督残差网络。

8. 论点—证据对应关系

论文论点支持证据判断
单位恒等捷径会伤害 MAE 冻结表征大幅 LP/KNN 提升,多种衰减消融较强支持
现象可推广到生成模型U-ViT 与 SiT 的 FID、IS 改善中等到较强支持
原因是特征被压到更低秩流形谱熵/“有效秩”与性能相关相关性支持,非因果
最佳超参可由 αeff\alpha_{\mathrm{eff}} 统一解释深度实验与经验区间部分支持;公式/代码定义不一致
方法弥合生成式与判别式表征鸿沟MAE 接近 I-JEPA,但仍落后 DINO只部分实现
残差连接一般会伤害生成式表征学习主要覆盖三类视觉 Transformer标题过度外推

9. 优点

  1. 问题选得好:把大家默认正确的残差连接拆开审视,且抓住生成目标与语义表征之间的冲突。
  2. 干预非常简洁:核心改动只有恒等系数调度,便于迁移和消融。
  3. 效果大而一致:MAE 的 KNN、U-ViT 的 LP/FID、SiT 的 FID/IS 均有明显收益,不像随机波动。
  4. 后期版本补强明显:从早期单一 MAE 结果扩展到深度/宽度、KNN、U-ViT、SiT 和理论分析,说明作者认真回应了评审。
  5. 提出了实用设计原则:短残差可衰减,跨尺度或跨编码器—解码器的长跳连负责保存必要信息。

10. 局限与潜在问题

10.1 标题和因果结论都过宽

实验对象是 MAE、U-ViT、SiT 和一个较弱的 ResNet 补充实验。没有覆盖 autoregressive image model、VQ-VAE、LLM、视频生成器或现代大规模自监督体系。“Residual Connections Harm …” 容易被读成残差连接本身有害,但真正被干预的是单位恒等短捷径的强度与信息路由

10.2 方法不是纯粹的一行修改

衰减单独使用会让 MAE 从 76.5%76.5\% 掉到 61.5%61.5\%,必须依赖 U-Net skip 才到 83.6%83.6\%。加上零初始化、额外融合层和不同的解码路径后,方法是一个结构组合,而不是没有代价的 scalar trick。

10.3 低秩机制未被因果验证

缺少“固定 rank 改 shortcut”或“固定 shortcut 主动操纵 rank”的实验;也没有表示各向同性、类间/类内谱、CKA、信息保真度等补充测量。有效秩公式还少了指数。

10.4 最优层选择不透明

深度 24 的 86.0%86.0\% 来自第 19 层而不是最终层。若报告 best-layer probe,就应对所有模型统一扫描并明确标注;若研究最终输出,就不应把中间层最大值混入同一表格。

10.5 统计报告不足

主表普遍没有多随机种子均值、标准差或置信区间。收益很大时不太可能完全由噪声造成,但超参排序和若干小幅提升仍需误差条。

10.6 可复现性仍不完整

仓库包含 MAE 与 SiT 主代码,但没有 U-ViT、KNN、rank、COCO 谱分割、监督 ResNet 的完整复现脚本,也没有本文训练好的 checkpoint 或自动化测试。README 还引用了仓库中不存在的 environment.yml

11. ICLR 2025 评审意见与后续修补

公开评审中,四位 reviewer 的最终分数大致为 6,5,5,66,5,5,6,但 meta-review 仍给出 Reject。反复出现的疑问包括:

  • 表征实验几乎只围绕 MAE,缺少更广模型;
  • fine-tune 性能下降,且线性结果仍不如 DINOv2/DINO;
  • α\alpha 如何选择、是否随深度和宽度扩展;
  • U-Net、随机深度、分支缩放等是否构成混杂;
  • 低秩解释和 per-layer probing 不够充分。

作者在 rebuttal 与后续版本补了 KNN、深度/宽度、余弦/可学习调度、更多扩散实验,并最终加入 SiT-XL/2。这些工作确实提升了论文完整度。不过,BEiT、stochastic depth、silhouette score 等 rebuttal 中提到的若干实验没有进入最终 CVPR 正文或公开代码;DINO 对比、fine-tune 下降、最优层选择和机制因果性仍未完全解决。

这也解释了为什么它能在多轮打磨后进入 CVPR 2026:最初像一个有趣的 MAE trick,最终版本形成了跨重建与扩散模型的一致经验现象;但接收并不等于原始宏大标题被完全证明。

12. 我希望补做的实验

  1. 严格 2×22\times2 因子实验:标准/衰减短残差 ×\times 有/无 U-Net 长跳连,并控制参数量、初始化与 decoder 信息入口。
  2. 统一的 per-layer probe:所有深度、所有 α\alpha、所有 baseline 都报告每层曲线、最终层与 best layer,避免选择性报告。
  3. 因果 rank 实验:用谱正则、低秩瓶颈或 whitening 独立操纵谱熵,测试 rank 是否中介 shortcut 对下游性能的作用。
  4. 梯度与路径测量:记录每层 fl(xl)/xl\lVert f_l(x_l)\rVert/\lVert x_l\rVert、Jacobian 谱、shortcut/residual 梯度占比和 path norm。
  5. 与现代残差参数化比较:ReZero、LayerScale、DeepNorm、stochastic depth、gated residual、Hyper-Connections;统一 FLOPs 与参数量。
  6. 更广生成范式:autoregressive image Transformer、VQ tokenizer、视频扩散、潜空间自编码器和文本生成模型。
  7. 完整生成评估:报告 precision/recall、density/coverage、训练稳定性与多 seed FID,而非只看单个 FID。
  8. 训练后可消融性:训练结束后把 αl\alpha_l 改回 1 或逐层移除,区分“优化轨迹塑形”与“推理时结构”效应。

13. 代码核查

核对官方仓库当前版本后,可确认核心调度、MAE U-Net skip、SiT-XL/2 结构和零初始化都与终稿大方向一致,但存在以下值得复现者注意的细节:

  • MAE 代码实际每个 block 使用两个 decay,正文没有把这一点写清楚;
  • forward_decoder 接收最终 latent 参数,却从 decoder CLS、位置查询和多层 skip 重建,最终 latent 本身没有作为普通 token 序列直接进入 decoder;
  • 论文主实验写 800 epochs、总 batch 1024、最大学习率 6×1046\times10^{-4}、AdamW、weight decay 0.05、40-epoch warmup、4 张 A40、约 200 小时;
  • 仓库 MAE 启动脚本使用 8 GPU、每卡 batch 256、gradient accumulation 4,即有效 batch 8192,并按 base LR 缩放到约 4.8×1034.8\times10^{-3},且默认示例为 αmin=0.7\alpha_{\min}=0.7,与主表的 0.60.6 不一致;
  • 参数解析器默认 400 epochs,而论文主实验为 800 epochs;
  • 虽设置随机种子,仍启用 cudnn.benchmark = True,不能保证完全确定性;
  • SiT README 的多行命令在 --data-path 行后缺反斜杠,会让后续 --min-sigma 行不能按预期接入同一命令。

这些并不推翻结果,但意味着“clone 后按 README 一键复现主表”目前并不成立。

14. 与相关研究的关系

  • ResNet / Pre-Norm Transformer:传统目标是让深网更易优化;本文提醒强恒等路径可能产生表示学习副作用。
  • MAE / Data2Vec / I-JEPA:都在研究生成或预测目标如何形成语义特征。本文改变的不是目标,而是信息路径。
  • DINO 类方法:仍是“高质量冻结表征”的强对照,且表明好的语义表示不必以更低谱熵为必要条件。
  • Low-Rank Simplicity Bias / RankMe:为谱结构与泛化的联系提供背景,但没有直接证明本文的 shortcut 因果链。
  • LayerScale、ReZero、DeepNorm、gated residual:同样调整残差分支或恒等分支的尺度,主要服务于稳定优化;本文将重点转向生成式表征。
  • Hyper-Connections:进一步扩展残差流宽度和路径组合,说明“残差拓扑本身是可设计对象”已经成为一条更宽的研究线。
  • REPA:用外部表征对齐加速和改善扩散模型;与本文形成有趣对照——REPA 改监督信号,本文改信息路由。

本文最独特的贡献并不是首次缩放残差,而是把“恒等捷径强度—表示谱结构—生成质量/线性可分性”明确连起来,并以跨 MAE 与 diffusion 的实验把它变成一个值得后续验证的研究问题。

15. 科学品味评分

维度评分(满分 5)理由
Novelty3.5标量缩放并不新,但问题视角与跨生成任务现象有新意
Rigor2.8实验量足够,然而机制、统计、best-layer 报告和公式/代码一致性不足
Impact3.7改动简单、收益大,可能影响生成 Transformer 的残差设计

16. 最终判断

我相信论文发现了一个真实、可复现且值得重视的现象:在依赖生成目标训练的视觉 Transformer 中,单位恒等短捷径可能过度保留输入,使冻结表征不够抽象;逐层衰减短捷径,再用长跳连保存重建信息,是一个有效的结构策略。

我不完全相信的部分是它的强机制叙事:低谱熵未被证明是原因,衰减也并非独立生效,且实验范围远不足以判定所有 residual connection 都“有害”。因此,这篇论文应被读作一项有力的架构经验发现和研究假说,而不是对残差网络的普遍否定。

如果只记住一句话:问题不在“有没有残差”,而在“哪些信息应该通过哪一种残差路径,以多大的强度跨越多少层”。

参考链接

Static research notes built with VitePress and KaTeX.