Theme
Residual Connections Harm Generative Representation Learning
Xiao Zhang, Ruoxi Jiang, William Gao, Rebecca Willett, Michael Maire. CVPR 2026, pp. 39669–39679. arXiv:2404.10947.
论文:arXiv · CVPR Open Access · 代码 · ICLR 2025 评审记录
一句话结论
这篇论文发现:在 MAE、U-ViT 和 SiT 这类具有生成式训练目标的视觉 Transformer 中,把恒等残差支路从固定系数
总体评价
这是一篇“现象很有价值、改动极简单、机制解释尚未闭环”的论文。
- 最强之处:只缩放恒等支路,就把 MAE 的 ImageNet-1K 线性探测从
提到 ,KNN 从 提到 ;在 SiT-XL/2 上,400K steps 的 FID 从 降到 。现象幅度大,且跨重建模型与扩散模型复现。 - 最关键的科学价值:论文提醒我们,残差连接并非只有“优化更容易”这一面。恒等通路也可能允许信息绕过需要学习的变换,使生成目标可以完成,却没有迫使每层产生适合判别任务的表示。
- 最大的问题:论文把“低秩特征”“绕过学习”与性能提升串成因果故事,但实验主体仍是相关性证据。方法同时引入 U-Net 式长跳连、零初始化和衰减恒等支路,且不同任务上的最佳衰减不一致。
- 标题判断:标题很抓眼球,也确实比证据范围更宽。更准确的标题会是 Decaying Identity Shortcuts Improves Representations in Generative Vision Transformers。
我的综合评分是 Weak Accept,约
版本与投稿轨迹
这篇文章的演化本身很说明问题。
| 版本 | 时间 | 标题或主要变化 |
|---|---|---|
| arXiv v1 | 2024-04-16 | Residual Connections Harm Self-Supervised Abstract Feature Learning;主要是 MAE,线性探测约从 |
| arXiv v2 | 2024-06-20 | 标题收窄到 MAE;表中 MAE 线性探测为 |
| arXiv v3 | 2024-10-12 | 改为当前标题,加入扩散模型实验;稿件采用 ICLR 2025 格式 |
| arXiv v4 | 2025-01-31 | 加入 KNN、深度与宽度实验等;源码/HTML 留有 ICML 稿件痕迹 |
| arXiv v5 | 2026-05-25 | CVPR 2026 camera-ready,加入 SiT-XL/2 与理论附录 |
公开材料能够确认的是:该工作投稿 ICLR 2025 后被拒,最终被 CVPR 2026 接收。v4 的 ICML 标记以及 v5 源码中遗留的 NeurIPS 样式文件只能说明稿件曾为相应模板准备过,不能单凭这些痕迹断言它真的完成了对应投稿或被拒。
另外,CVPR 页面与 BibTeX 把 Rebecca Willett 拼为 “Willet”,arXiv 作者列表则为 “Willett”;这里采用作者本人常用的后者。
1. 论文究竟在问什么?
标准前馈网络写作
残差网络则写作
恒等支路让梯度和信息直接跨层传播,是深网络可训练性的核心设计。但作者观察到一个反常现象:在 MAE 这类生成式自监督模型里,最终重建效果可以很好,编码器的判别表示却不一定好。以 ViT-B MAE 为例,微调准确率很高,但线性探测和 KNN 明显落后于 DINO 一类判别式自监督方法。
论文的假说是:单位系数的恒等捷径太强,模型可以依靠原始 token 一路“直通”,只让残差分支学习修补生成任务所需的局部细节;这样有利于优化和重建,却减弱了中间层主动形成抽象表示的压力。
需要注意,这个假说包含三层不同强度的命题:
- 单位恒等捷径会保存更多输入特征;
- 保存过强会让残差分支学得更少;
- 残差分支学得更少是线性探测较差的原因。
论文对第 1 点有直接结构依据,对第 2、3 点主要提供有效秩和下游性能的相关性,而非干预式因果证明。
2. 核心方法:衰减恒等捷径
作者把残差块改为
其中恒等支路系数随深度线性减小:
因此第一层系数略小于
这个式子比“每层只乘了
称为有效恒等系数,并声称表现好的配置大多落在
附近。
2.1 累计衰减的精确形式
令
论文定义下的
当
所以即使
2.2 对梯度通路的影响
单块 Jacobian 为
跨层 Jacobian 则为
标准残差把每层的恒等项固定为
3. 一个必须指出的公式—代码不一致
论文把编码器深度记为
python
decays = 1 - np.linspace(0, 1, 2 * depth) * (1 - min_decay)因此深度为
| 配置 | 论文 | 代码 |
|---|---|---|
论文宣称的最佳区间
4. MAE 中的具体结构
4.1 数据流与维度
ViT-B/16 的主要数据流是:
其中
编码器第 SkipLayer 逐级融合编码器特征。
对于每个长跳连,代码先在被遮挡位置填入可学习 mask token,再把 768 维编码器特征与 512 维 decoder 特征拼接:
然后经两层 MLP 映射回 512 维。每个 SkipLayer 有
个参数,6 个共
4.2 重建损失
decoder 输出每个 patch 的像素预测
训练仍采用标准 MAE 的 masked patch MSE:
其中
4.3 为什么要加 U-Net 式长跳连?
衰减短残差后,浅层局部信息不容易自然流到 decoder。作者于是显式把多层 encoder features 送到 decoder:短捷径负责抑制“躺平”的恒等流,长捷径负责保住重建所需的细节。
这是一种合理的工程配套,但也制造了因果混杂。消融显示:
- 标准 MAE:
; - 线性衰减到
,但没有 U-Net: ; - 线性衰减到
,加 U-Net: 。
因此论文证明的不是“只衰减残差就会变好”,而是“衰减短捷径并用长捷径重新分配信息流可以变好”。
4.4 零初始化
代码把 Attention 输出投影和 MLP 第二层等残差分支出口初始化为零。训练开始时近似有
随后残差分支逐渐学会补偿。这个设计可降低初始训练不稳定,但它也改变了与标准 MAE 的比较条件。论文消融了恒等与残差支路的缩放,却没有把所有初始化因素完全正交拆开。
5. 扩散模型中的实现
论文先在 U-ViT 上验证,再扩展到 SiT-XL/2。SiT 的图像经 VAE 编码:
使用
每个 SiT skip 是一个
个参数。时间步和类别条件通过 adaLN-Zero 注入。论文没有重新推导 SiT 的 flow-matching / diffusion 目标,而是沿用基线设置,因此这部分在数学上依赖 SiT 原论文。
推理阶段不需要额外调节
6. “低秩表示”解释及其数学问题
作者认为,生成式模型应把输入压到一个更紧凑、低秩的流形;强恒等连接则保留太多不相关方向。论文用奇异值分布定义
并把
称为 effective rank。
这里有一个明确的术语/公式错误:Roy 与 Vetterli 的标准 effective rank 是谱熵的指数
而论文写出的
此外还有三个问题:
- 正文对究竟在 token、样本还是通道维度构造矩阵/协方差描述不够精确;
- 官方仓库没有找到生成有效秩图的脚本,难以从代码核验预处理与聚合方式;
- 低秩并非普遍等价于好表征。秩为 1 也可能是完全坍塌,而 DINO 等对比/自蒸馏方法恰恰可能保持较高秩却有很强的语义性。
所以更谨慎的结论是:在作者测试的 MAE 配置中,衰减捷径、较低谱熵与更高线性探测相关;“低秩是提升原因”尚未被证明。
7. 主要实验结果
7.1 ImageNet-1K 表征学习
| 方法 | Fine-tune | Linear probe | KNN |
|---|---|---|---|
| MoCo-v3 | 83.2 | 76.7 | 66.6 |
| DINO | 83.3 | 78.2 | 76.1 |
| Data2Vec | 84.2 | 68.0 | 33.2 |
| I-JEPA | – | 72.9 | – |
| CAE | 83.8 | 70.4 | 51.4 |
| Latent MIM | 83.0 | 72.0 | 50.1 |
| MAE | 83.6 | 67.8 | 27.4 |
| 本文方法 | 82.9 | 72.7 | 63.9 |
解读:
- 线性探测
个百分点、KNN 个百分点,说明改动确实显著改善了冻结特征的直接可用性; - 微调从
降到 ,说明它不是“全方位优于 MAE”; - 与 DINO 的
线性探测和 KNN 相比仍有明显差距。因此“弥合生成式与判别式表征鸿沟”只完成了一部分。
正文有一处把 MAE 线性探测写成
7.2 深度、宽度与衰减强度
ImageNet-100 线性探测结果:
| 宽度 / 深度 | |||||
|---|---|---|---|---|---|
| 384 / 12 | 78.5 | 78.1 | 75.2 | 73.5 | 69.2 |
| 768 / 12 | 83.6 | 81.8 | 79.8 | 79.2 | 76.5 |
| 1024 / 12 | 83.2 | 82.5 | 82.1 | 79.3 | 78.0 |
| 768 / 18 | 83.5 | 85.0 | 84.4 | 81.8 | 79.2 |
| 1024 / 24 | 84.3 | 86.0 | 84.5 | 84.3 | 81.4 |
趋势支持“越深的网络需要更大的
7.3 关键消融
| 设计 | ImageNet-100 线性探测 |
|---|---|
| 76.5 | |
| 76.9 | |
| 82.6 | |
| 只衰减 Attention 恒等支路 | 79.3 |
| 只衰减 MLP 恒等支路 | 80.6 |
| 两者都衰减 | 83.6 |
| 线性调度, | 83.6 |
| 余弦调度, | 82.8 |
| 线性调度, | 81.8 |
| 余弦调度, | 82.9 |
| 可学习系数 | 79.5 |
7.4 U-ViT:表征与生成质量
| 数据集 / 任务 | 指标 | ||||
|---|---|---|---|---|---|
| CIFAR-100,无条件 | LP | 62.47 | 63.58 | 66.86 | 64.63 |
| CIFAR-100,无条件 | FID | 14.34 | 11.65 | 8.99 | 11.71 |
| ImageNet-100,无条件 | LP | 72.8 | 74.5 | 76.1 | 75.8 |
| ImageNet-100,无条件 | FID | 44.40 | 40.96 | 41.17 | 43.51 |
| ImageNet-100,类别条件 | FID | 6.93 | 5.75 | 5.11 | 4.98 |
| ImageNet-1K,类别条件 | FID | 7.65 | 6.23 | 5.34 | 4.90 |
最有意思的是:在 CIFAR-100 上表征和 FID 同时于
7.5 SiT-XL/2
| 训练步数 | 模型 | FID | IS |
|---|---|---|---|
| 200K | 原始 SiT,无 U-Net | 25.2 | – |
| 200K | U-Net, | 22.7 | 57.3 |
| 200K | U-Net, | 14.2 | 79.7 |
| 400K | 原始 SiT,无 U-Net | 17.2 | – |
| 400K | U-Net, | 16.5 | 74.8 |
| 400K | U-Net, | 11.8 | 91.8 |
这组结果证明方法并不只对小模型有效。但基线、U-Net 与衰减同时变化,最公平的核心差值应看同为 U-Net 的
7.6 其他任务
- COCO 无监督谱分割 mIoU:标准 MAE 为
,本文为 。这支持特征空间更有结构,但绝对值仍低。 - 一个修改版监督 ResNet 的小规模 ImageNet 子集实验:
为 ,基线为 。设置描述较模糊,不足以把结论推广到一般监督残差网络。
8. 论点—证据对应关系
| 论文论点 | 支持证据 | 判断 |
|---|---|---|
| 单位恒等捷径会伤害 MAE 冻结表征 | 大幅 LP/KNN 提升,多种衰减消融 | 较强支持 |
| 现象可推广到生成模型 | U-ViT 与 SiT 的 FID、IS 改善 | 中等到较强支持 |
| 原因是特征被压到更低秩流形 | 谱熵/“有效秩”与性能相关 | 相关性支持,非因果 |
| 最佳超参可由 | 深度实验与经验区间 | 部分支持;公式/代码定义不一致 |
| 方法弥合生成式与判别式表征鸿沟 | MAE 接近 I-JEPA,但仍落后 DINO | 只部分实现 |
| 残差连接一般会伤害生成式表征学习 | 主要覆盖三类视觉 Transformer | 标题过度外推 |
9. 优点
- 问题选得好:把大家默认正确的残差连接拆开审视,且抓住生成目标与语义表征之间的冲突。
- 干预非常简洁:核心改动只有恒等系数调度,便于迁移和消融。
- 效果大而一致:MAE 的 KNN、U-ViT 的 LP/FID、SiT 的 FID/IS 均有明显收益,不像随机波动。
- 后期版本补强明显:从早期单一 MAE 结果扩展到深度/宽度、KNN、U-ViT、SiT 和理论分析,说明作者认真回应了评审。
- 提出了实用设计原则:短残差可衰减,跨尺度或跨编码器—解码器的长跳连负责保存必要信息。
10. 局限与潜在问题
10.1 标题和因果结论都过宽
实验对象是 MAE、U-ViT、SiT 和一个较弱的 ResNet 补充实验。没有覆盖 autoregressive image model、VQ-VAE、LLM、视频生成器或现代大规模自监督体系。“Residual Connections Harm …” 容易被读成残差连接本身有害,但真正被干预的是单位恒等短捷径的强度与信息路由。
10.2 方法不是纯粹的一行修改
衰减单独使用会让 MAE 从
10.3 低秩机制未被因果验证
缺少“固定 rank 改 shortcut”或“固定 shortcut 主动操纵 rank”的实验;也没有表示各向同性、类间/类内谱、CKA、信息保真度等补充测量。有效秩公式还少了指数。
10.4 最优层选择不透明
深度 24 的
10.5 统计报告不足
主表普遍没有多随机种子均值、标准差或置信区间。收益很大时不太可能完全由噪声造成,但超参排序和若干小幅提升仍需误差条。
10.6 可复现性仍不完整
仓库包含 MAE 与 SiT 主代码,但没有 U-ViT、KNN、rank、COCO 谱分割、监督 ResNet 的完整复现脚本,也没有本文训练好的 checkpoint 或自动化测试。README 还引用了仓库中不存在的 environment.yml。
11. ICLR 2025 评审意见与后续修补
公开评审中,四位 reviewer 的最终分数大致为
- 表征实验几乎只围绕 MAE,缺少更广模型;
- fine-tune 性能下降,且线性结果仍不如 DINOv2/DINO;
如何选择、是否随深度和宽度扩展; - U-Net、随机深度、分支缩放等是否构成混杂;
- 低秩解释和 per-layer probing 不够充分。
作者在 rebuttal 与后续版本补了 KNN、深度/宽度、余弦/可学习调度、更多扩散实验,并最终加入 SiT-XL/2。这些工作确实提升了论文完整度。不过,BEiT、stochastic depth、silhouette score 等 rebuttal 中提到的若干实验没有进入最终 CVPR 正文或公开代码;DINO 对比、fine-tune 下降、最优层选择和机制因果性仍未完全解决。
这也解释了为什么它能在多轮打磨后进入 CVPR 2026:最初像一个有趣的 MAE trick,最终版本形成了跨重建与扩散模型的一致经验现象;但接收并不等于原始宏大标题被完全证明。
12. 我希望补做的实验
- 严格
因子实验:标准/衰减短残差 有/无 U-Net 长跳连,并控制参数量、初始化与 decoder 信息入口。 - 统一的 per-layer probe:所有深度、所有
、所有 baseline 都报告每层曲线、最终层与 best layer,避免选择性报告。 - 因果 rank 实验:用谱正则、低秩瓶颈或 whitening 独立操纵谱熵,测试 rank 是否中介 shortcut 对下游性能的作用。
- 梯度与路径测量:记录每层
、Jacobian 谱、shortcut/residual 梯度占比和 path norm。 - 与现代残差参数化比较:ReZero、LayerScale、DeepNorm、stochastic depth、gated residual、Hyper-Connections;统一 FLOPs 与参数量。
- 更广生成范式:autoregressive image Transformer、VQ tokenizer、视频扩散、潜空间自编码器和文本生成模型。
- 完整生成评估:报告 precision/recall、density/coverage、训练稳定性与多 seed FID,而非只看单个 FID。
- 训练后可消融性:训练结束后把
改回 1 或逐层移除,区分“优化轨迹塑形”与“推理时结构”效应。
13. 代码核查
核对官方仓库当前版本后,可确认核心调度、MAE U-Net skip、SiT-XL/2 结构和零初始化都与终稿大方向一致,但存在以下值得复现者注意的细节:
- MAE 代码实际每个 block 使用两个 decay,正文没有把这一点写清楚;
forward_decoder接收最终 latent 参数,却从 decoder CLS、位置查询和多层 skip 重建,最终 latent 本身没有作为普通 token 序列直接进入 decoder;- 论文主实验写 800 epochs、总 batch 1024、最大学习率
、AdamW、weight decay 0.05、40-epoch warmup、4 张 A40、约 200 小时; - 仓库 MAE 启动脚本使用 8 GPU、每卡 batch 256、gradient accumulation 4,即有效 batch 8192,并按 base LR 缩放到约
,且默认示例为 ,与主表的 不一致; - 参数解析器默认 400 epochs,而论文主实验为 800 epochs;
- 虽设置随机种子,仍启用
cudnn.benchmark = True,不能保证完全确定性; - SiT README 的多行命令在
--data-path行后缺反斜杠,会让后续--min-sigma行不能按预期接入同一命令。
这些并不推翻结果,但意味着“clone 后按 README 一键复现主表”目前并不成立。
14. 与相关研究的关系
- ResNet / Pre-Norm Transformer:传统目标是让深网更易优化;本文提醒强恒等路径可能产生表示学习副作用。
- MAE / Data2Vec / I-JEPA:都在研究生成或预测目标如何形成语义特征。本文改变的不是目标,而是信息路径。
- DINO 类方法:仍是“高质量冻结表征”的强对照,且表明好的语义表示不必以更低谱熵为必要条件。
- Low-Rank Simplicity Bias / RankMe:为谱结构与泛化的联系提供背景,但没有直接证明本文的 shortcut 因果链。
- LayerScale、ReZero、DeepNorm、gated residual:同样调整残差分支或恒等分支的尺度,主要服务于稳定优化;本文将重点转向生成式表征。
- Hyper-Connections:进一步扩展残差流宽度和路径组合,说明“残差拓扑本身是可设计对象”已经成为一条更宽的研究线。
- REPA:用外部表征对齐加速和改善扩散模型;与本文形成有趣对照——REPA 改监督信号,本文改信息路由。
本文最独特的贡献并不是首次缩放残差,而是把“恒等捷径强度—表示谱结构—生成质量/线性可分性”明确连起来,并以跨 MAE 与 diffusion 的实验把它变成一个值得后续验证的研究问题。
15. 科学品味评分
| 维度 | 评分(满分 5) | 理由 |
|---|---|---|
| Novelty | 3.5 | 标量缩放并不新,但问题视角与跨生成任务现象有新意 |
| Rigor | 2.8 | 实验量足够,然而机制、统计、best-layer 报告和公式/代码一致性不足 |
| Impact | 3.7 | 改动简单、收益大,可能影响生成 Transformer 的残差设计 |
16. 最终判断
我相信论文发现了一个真实、可复现且值得重视的现象:在依赖生成目标训练的视觉 Transformer 中,单位恒等短捷径可能过度保留输入,使冻结表征不够抽象;逐层衰减短捷径,再用长跳连保存重建信息,是一个有效的结构策略。
我不完全相信的部分是它的强机制叙事:低谱熵未被证明是原因,衰减也并非独立生效,且实验范围远不足以判定所有 residual connection 都“有害”。因此,这篇论文应被读作一项有力的架构经验发现和研究假说,而不是对残差网络的普遍否定。
如果只记住一句话:问题不在“有没有残差”,而在“哪些信息应该通过哪一种残差路径,以多大的强度跨越多少层”。