Skip to content

Mean Flows for One-step Generative Modeling

Status: completed

Authors: Zhengyang Geng, Mingyang Deng, Xingjian Bai, J. Zico Kolter, Kaiming He

Venue / Year: NeurIPS 2025 Main Conference, Oral

Affiliations: Carnegie Mellon University (CMU), Massachusetts Institute of Technology (MIT)

Links: arXiv | NeurIPS Proceedings | OpenReview | Official Code

Tags: [[generative modeling]], [[flow matching]], [[one-step generation]], [[consistency models]], [[Jacobian-vector product]], [[Diffusion Transformer]], [[classifier-free guidance]]

本分析以 NeurIPS 2025 最终版、arXiv v1 TeX 源码、完整 OpenReview 讨论和官方 JAX 仓库为依据。论文主体结果来自最终论文;rebuttal 新增结果与后续工作会明确标注,不与正式正文混写。官方代码核验基于提交 d70cb55d298ee03c53bf6da67bec281082e4e2d9(检查日期:2026-07-31)。

One-Sentence Summary

MeanFlow 不再让网络预测 ODE 轨迹上的瞬时速度,而是预测任意区间上的平均速度;它把平均速度定义对终点时间求导,得到一个可用单次 JVP 训练的恒等式,从而在不蒸馏生成网络的前提下实现 ImageNet 256×256256\times256 上 FID 3.43 的 1-NFE 生成。

论文主线与章节任务

论文的逻辑可以压缩为四步:

  1. Flow Matching 学的是瞬时速度,推理时仍需数值积分;一步 Euler 法对弯曲的边际流轨迹误差很大。
  2. 若直接学习区间平均速度,则一个网络输出已经代表整段位移,不再需要在推理时近似积分。
  3. 真实平均速度包含不可直接计算的积分;对位移恒等式求导后,可将它改写为只依赖瞬时速度和平均速度导数的 MeanFlow Identity。
  4. 用 JVP 计算总导数、用 stop-gradient 构造回归目标,再把固定 CFG 直接吸收到训练目标中,最终保持 1-NFE 推理。
章节任务完成情况
Introduction / Related Work建立一步生成动机,并与 CM、CTM、Flow Map Matching、Shortcut、IMM 区分最终版比 arXiv v1 更完整,但原创性边界仍有争议
Background定义条件速度、边际速度与 ODE 采样清楚
Mean Flows定义平均速度并推导 MeanFlow Identity恒等式正确,边界条件需要正则性假设
Training用 JVP 和 stop-gradient 建立可训练目标实现简洁;条件速度替换的证明未进入正文
Guidance把固定 CFG 场视为新的 ground-truth field可实现 1-NFE,但牺牲测试时 guidance 灵活性
ExperimentsImageNet、CIFAR-10、消融、缩放结果强;统计、成本和多指标报告不足
Appendix配置、鲁棒损失、充分性、JVP 开销关键细节较全,但配置表存在内部不一致

1. Problem

1.1 核心问题

给定易采样先验 ppriorp_{\mathrm{prior}} 和数据分布 pdatap_{\mathrm{data}},生成模型希望学习一个连续流,把

z1=ε,εpprior z_1=\varepsilon,\qquad \varepsilon\sim p_{\mathrm{prior}}

输运到

z0=x,xpdata. z_0=x,\qquad x\sim p_{\mathrm{data}}.

标准 Flow Matching 学习 ODE 的瞬时速度场:

dztdt=v(zt,t). \frac{\mathrm{d}z_t}{\mathrm{d}t}=v(z_t,t).

推理时需要计算:

zr=ztrtv(zτ,τ)dτ. z_r = z_t-\int_r^t v(z_\tau,\tau)\,\mathrm{d}\tau.

即使条件路径被选为直线,边际化后的速度场一般仍会产生弯曲轨迹。因此,单次 Euler 近似

zrzt(tr)v(zt,t) z_r\approx z_t-(t-r)v(z_t,t)

会把区间起点处的切向量误当成整段割线,误差正是一步生成质量差的核心来源之一。

1.2 Motivation 评价

这是一个同时具有科学和工程价值的问题:

  • 科学上,它追问“ODE 的哪个可学习量最适合粗粒度积分”,而不只是继续设计更好的离散 solver。
  • 工程上,1-NFE 把多次串行网络调用压成一次前向传播,直接减少采样延迟。
  • 方法论上,它试图摆脱 teacher distillation、离散时间 curriculum 和额外 consistency pair construction。

动机有说服力。最有品味的地方不是“平均速度”这个词本身,而是意识到:若目标就是一步跨越整个区间,那么网络输出应对齐区间积分,而不应对齐局部切线。

1.3 论文的主要 Claims

  1. MeanFlow Identity 是平均速度定义的必要且充分表述。
  2. 该恒等式可通过一次 JVP 构造无需积分的训练目标。
  3. MeanFlow 可以从头训练,不需要生成 teacher、蒸馏或离散时间 curriculum。
  4. 固定 CFG 可以被吸收到训练目标中,使推理仍保持 1-NFE。
  5. 在 ImageNet 256×256256\times256 上,MF-XL/2 达到 1-NFE FID 3.43;2-NFE 的长训模型达到 2.20。
  6. 方法随模型规模和训练时间扩展,并在 CIFAR-10 上具有竞争力。

2. Mathematical Formulation

2.1 符号、方向和维度

论文采用从数据端 t=0t=0 到噪声端 t=1t=1 的时间方向,采样则从 t=1t=1 反向走到 t=0t=0

符号含义维度
xx数据样本或其 VAE latentRd\mathbb{R}^d
ε\varepsilon先验噪声Rd\mathbb{R}^d
ztz_t时间 tt 的插值状态Rd\mathbb{R}^d
r,tr,t区间端点,默认 0rt10\leq r\leq t\leq1标量
vtv_t给定样本对 (x,ε)(x,\varepsilon) 的条件瞬时速度Rd\mathbb{R}^d
v(zt,t)v(z_t,t)对所有可能样本对边际化后的瞬时速度Rd\mathbb{R}^d
u(zt,r,t)u(z_t,r,t)ttrr 的平均速度Rd\mathbb{R}^d
zu\partial_z uuu 关于状态的 JacobianRd×d\mathbb{R}^{d\times d}
tu,ru\partial_t u,\partial_r u对两个时间变量的偏导Rd\mathbb{R}^d
h=trh=t-r区间长度标量

2.2 Flow Matching 基础

论文从一般插值路径开始:

zt=atx+btε. z_t=a_t x+b_t\varepsilon.

对时间求导:

vtdztdt=atx+btε. v_t \triangleq \frac{\mathrm{d}z_t}{\mathrm{d}t} = a_t'x+b_t'\varepsilon.

默认采用线性 OT 路径:

at=1t,bt=t, a_t=1-t,\qquad b_t=t,

因此

zt=(1t)x+tε,vt=εx. z_t=(1-t)x+t\varepsilon, \qquad v_t=\varepsilon-x.

vtv_t 是样本条件速度。同一个 ztz_t 可能来自多个 (x,ε)(x,\varepsilon) 对,真正决定边际概率流的速度为条件期望:

v(zt,t)E ⁣[vtzt]. v(z_t,t) \triangleq \mathbb{E}\!\left[v_t\mid z_t\right].

理想 Flow Matching 目标为:

LFM(θ)=Et,ztvθ(zt,t)v(zt,t)22. \mathcal{L}_{\mathrm{FM}}(\theta) = \mathbb{E}_{t,z_t} \left\| v_\theta(z_t,t)-v(z_t,t) \right\|_2^2.

由于边际速度不可直接计算,实际使用 conditional Flow Matching:

LCFM(θ)=Et,x,εvθ(zt,t)vt22. \mathcal{L}_{\mathrm{CFM}}(\theta) = \mathbb{E}_{t,x,\varepsilon} \left\| v_\theta(z_t,t)-v_t \right\|_2^2.

平方损失下有

E[vtzt]=v(zt,t), \mathbb{E}[v_t\mid z_t]=v(z_t,t),

所以两者具有相同的回归函数和参数梯度期望。

2.3 平均速度的定义

MeanFlow 定义区间 [r,t][r,t] 上的平均速度:

u(zt,r,t)1trrtv(zτ,τ)dτ. u(z_t,r,t) \triangleq \frac{1}{t-r} \int_r^t v(z_\tau,\tau)\,\mathrm{d}\tau.

它与位移的关系是:

(tr)u(zt,r,t)=rtv(zτ,τ)dτ=ztzr. (t-r)u(z_t,r,t) = \int_r^t v(z_\tau,\tau)\,\mathrm{d}\tau = z_t-z_r.

因此:

zr=zt(tr)u(zt,r,t). z_r=z_t-(t-r)u(z_t,r,t).

rtr\rightarrow tvv 连续时:

limrtu(zt,r,t)=v(zt,t). \lim_{r\rightarrow t}u(z_t,r,t)=v(z_t,t).

对任意 r<s<tr<s<t,积分可加性给出:

(tr)u(zt,r,t)=(ts)u(zt,s,t)+(sr)u(zs,r,s). (t-r)u(z_t,r,t) = (t-s)u(z_t,s,t) + (s-r)u(z_s,r,s).

这就是“大步位移等于两段小步位移”的天然 consistency。它是 ground-truth field 的性质,而不是额外加在网络输出上的启发式约束。

2.4 MeanFlow Identity 的完整推导

从位移形式开始:

(tr)u(zt,r,t)=rtv(zτ,τ)dτ. (t-r)u(z_t,r,t) = \int_r^t v(z_\tau,\tau)\,\mathrm{d}\tau.

固定 rr,沿真实轨迹对 tt 求全导数。左侧用乘积法则:

ddt[(tr)u(zt,r,t)]=u(zt,r,t)+(tr)ddtu(zt,r,t). \frac{\mathrm{d}}{\mathrm{d}t} \left[ (t-r)u(z_t,r,t) \right] = u(z_t,r,t) + (t-r)\frac{\mathrm{d}}{\mathrm{d}t}u(z_t,r,t).

右侧用微积分基本定理:

ddtrtv(zτ,τ)dτ=v(zt,t). \frac{\mathrm{d}}{\mathrm{d}t} \int_r^t v(z_\tau,\tau)\,\mathrm{d}\tau = v(z_t,t).

于是得到:

u(zt,r,t)+(tr)ddtu(zt,r,t)=v(zt,t). u(z_t,r,t) + (t-r)\frac{\mathrm{d}}{\mathrm{d}t}u(z_t,r,t) = v(z_t,t).

整理后即 MeanFlow Identity:

u(zt,r,t)=v(zt,t)(tr)ddtu(zt,r,t) \boxed{ u(z_t,r,t) = v(z_t,t) - (t-r)\frac{\mathrm{d}}{\mathrm{d}t}u(z_t,r,t) }

若下界也依赖 tt,则不能令 dr/dt=0\mathrm{d}r/\mathrm{d}t=0;Leibniz 公式会多出:

ddtr(t)tv(zτ,τ)dτ=v(zt,t)v(zr,r)drdt. \frac{\mathrm{d}}{\mathrm{d}t} \int_{r(t)}^t v(z_\tau,\tau)\,\mathrm{d}\tau = v(z_t,t) - v(z_r,r)\frac{\mathrm{d}r}{\mathrm{d}t}.

论文训练时把 rrtt 视为独立坐标,并在求 tt 方向导数时固定 rr,所以其推导内部一致。

2.5 总导数与 JVP

因为 uu 同时依赖 zt,r,tz_t,r,t,总导数是:

dudt=(zu)dztdt+rudrdt+tudtdt. \frac{\mathrm{d}u}{\mathrm{d}t} = (\partial_z u)\frac{\mathrm{d}z_t}{\mathrm{d}t} + \partial_r u\frac{\mathrm{d}r}{\mathrm{d}t} + \partial_t u\frac{\mathrm{d}t}{\mathrm{d}t}.

代入

dztdt=v(zt,t),drdt=0,dtdt=1, \frac{\mathrm{d}z_t}{\mathrm{d}t}=v(z_t,t), \qquad \frac{\mathrm{d}r}{\mathrm{d}t}=0, \qquad \frac{\mathrm{d}t}{\mathrm{d}t}=1,

得到:

dudt=(zu)v(zt,t)+tu \boxed{ \frac{\mathrm{d}u}{\mathrm{d}t} = (\partial_z u)v(z_t,t)+\partial_t u }

这正是函数

u:Rd×R×RRd u:\mathbb{R}^d\times\mathbb{R}\times\mathbb{R} \rightarrow \mathbb{R}^d

在切向量

(v,0,1) \left(v,0,1\right)

上的 Jacobian-vector product:

JVP[u;(v,0,1)]=(zu)v+tu. \mathrm{JVP} \left[ u; (v,0,1) \right] = (\partial_z u)v+\partial_t u.

论文正文偶尔把这一项写成 vzuv\partial_z u。若采用列向量和标准 Jacobian 约定,更清楚的写法应是 (zu)v(\partial_z u)v;官方 jax.jvp 实现采用的就是标准 JVP,因此这是记号方向问题,不是代码中的矩阵运算错误。

2.6 从恒等式到训练目标

用网络 uθu_\theta 参数化平均速度,先定义基于边际速度的目标:

utgtmarg=v(zt,t)(tr)[(zuθ)v(zt,t)+tuθ]. u_{\mathrm{tgt}}^{\mathrm{marg}} = v(z_t,t) - (t-r) \left[ (\partial_z u_\theta)v(z_t,t) + \partial_t u_\theta \right].

训练损失为:

LMF(θ)=Euθ(zt,r,t)sg(utgtmarg)22, \mathcal{L}_{\mathrm{MF}}(\theta) = \mathbb{E} \left\| u_\theta(z_t,r,t) - \mathrm{sg} \left( u_{\mathrm{tgt}}^{\mathrm{marg}} \right) \right\|_2^2,

其中 sg\mathrm{sg} 是 stop-gradient。

实际训练将边际速度替换为条件速度:

utgt=vt(tr)[(zuθ)vt+tuθ] \boxed{ u_{\mathrm{tgt}} = v_t - (t-r) \left[ (\partial_z u_\theta)v_t + \partial_t u_\theta \right] }

默认

vt=εx. v_t=\varepsilon-x.

r=tr=t 时,区间项消失:

utgt=vt, u_{\mathrm{tgt}}=v_t,

目标退化为标准 conditional Flow Matching。因此训练混合 r=tr=trtr\neq t 样本,可以理解为同时学习局部速度边界和跨区间传播。

2.7 条件速度替换何时严格成立

这是论文最需要仔细检查的数学点。

h=tr,Jθ=zuθ,bθ=tuθ, h=t-r, \qquad J_\theta=\partial_z u_\theta, \qquad b_\theta=\partial_t u_\theta,

并定义对速度 vv 仿射的目标映射:

Gθ(v)=vh(Jθv+bθ)=(IhJθ)vhbθ. G_\theta(v) = v-h(J_\theta v+b_\theta) = (I-hJ_\theta)v-hb_\theta.

在平方损失和 stop-gradient 下:

θLcond=2E[(θuθ)(uθGθ(vt))]. \nabla_\theta\mathcal{L}_{\mathrm{cond}} = 2\, \mathbb{E} \left[ (\partial_\theta u_\theta)^\top \left( u_\theta-G_\theta(v_t) \right) \right].

给定 ztz_t 后,由于 GθG_\thetavtv_t 是仿射函数:

E[Gθ(vt)zt]=Gθ(E[vtzt])=Gθ(v(zt,t)). \mathbb{E} \left[ G_\theta(v_t)\mid z_t \right] = G_\theta \left( \mathbb{E}[v_t\mid z_t] \right) = G_\theta(v(z_t,t)).

再用全期望公式可得:

θLcond=θLmarg. \nabla_\theta\mathcal{L}_{\mathrm{cond}} = \nabla_\theta\mathcal{L}_{\mathrm{marg}}.

因此,OpenReview rebuttal 中补充的等价性论证是成立的,但依赖三个关键条件:

  1. 外层是平方损失;
  2. target 分支使用 stop-gradient;
  3. target 对条件速度保持仿射。

原论文最终版没有把这段证明纳入正文。更重要的是,最佳实验使用自适应样本权重,权重本身依赖样本误差,此时

E[w(vt)Gθ(vt)zt]E[w(vt)zt]Gθ(v(zt,t)) \mathbb{E} \left[ w(v_t)G_\theta(v_t)\mid z_t \right] \neq \mathbb{E}[w(v_t)\mid z_t]\, G_\theta(v(z_t,t))

通常不成立。也就是说,论文关于条件/边际目标等价的干净证明直接覆盖标准 L2 目标,却不能自动覆盖最佳配置的自适应加权目标。

2.8 Adaptive Weighting 的真实优化含义

定义残差:

Δ=uθutgt. \Delta = u_\theta-u_{\mathrm{tgt}}.

论文先讨论 powered L2:

Lγ=Δ22γ. \mathcal{L}_\gamma = \|\Delta\|_2^{2\gamma}.

其梯度为:

dLγdθ=γ(Δ22)γ1dΔ22dθ. \frac{\mathrm{d}\mathcal{L}_\gamma}{\mathrm{d}\theta} = \gamma \left( \|\Delta\|_2^2 \right)^{\gamma-1} \frac{\mathrm{d}\|\Delta\|_2^2}{\mathrm{d}\theta}.

p=1γ, p=1-\gamma,

实践中使用:

w=1(Δ22+c)p, w = \frac{1} { \left( \|\Delta\|_2^2+c \right)^p },

以及:

Ladapt=sg(w)Δ22. \mathcal{L}_{\mathrm{adapt}} = \mathrm{sg}(w)\|\Delta\|_2^2.

这让高误差样本的梯度被压低。p=0p=0 是普通 L2,p=0.5p=0.5 接近 Pseudo-Huber 的梯度形状;p=1p=1 时梯度近似对应

log(Δ22+c) \log \left( \|\Delta\|_2^2+c \right)

而不是普通平方损失。主实验选 p=1p=1,说明强鲁棒化是高质量结果的一部分,不应把全部性能归因于恒等式本身。

官方代码先对 latent 的所有空间和通道维求误差和:

i=j=1dΔij2, \ell_i = \sum_{j=1}^d \Delta_{ij}^2,

再使用:

isg[(i+c)p]. \frac{\ell_i} { \mathrm{sg} \left[ (\ell_i+c)^p \right] }.

代码中 c=0.01c=0.01;正文只给出示例 c=103c=10^{-3},配置表也没有报告最终精确值。

2.9 充分性证明与边界条件

令位移场:

S(zt,r,t)=(tr)u(zt,r,t). S(z_t,r,t) = (t-r)u(z_t,r,t).

MeanFlow Identity 等价于:

dSdt=v(zt,t). \frac{\mathrm{d}S}{\mathrm{d}t}=v(z_t,t).

积分后一般只能得到:

S(zt,r,t)+C1=rtv(zτ,τ)dτ+C2. S(z_t,r,t)+C_1 = \int_r^t v(z_\tau,\tau)\,\mathrm{d}\tau+C_2.

t=rt=r 处:

S(zr,r,r)=0,rrv(zτ,τ)dτ=0, S(z_r,r,r)=0, \qquad \int_r^r v(z_\tau,\tau)\,\mathrm{d}\tau=0,

C1=C2C_1=C_2,从而恢复平均速度定义。

这一证明隐含 uutrt\rightarrow r 时有限或足够正则,否则 (tr)u(t-r)u 未必趋于零。对有限参数、连续激活的普通神经网络,这通常是合理建模假设,但论文没有显式陈述。

3. Architecture

3.1 端到端数据流

ImageNet 主实验的数据流是:

[B,256,256,3]pretrained VAE[B,32,32,4]MeanFlow DiT[B,32,32,4]VAE decoder[B,256,256,3]. [B,256,256,3] \xrightarrow{\mathrm{pretrained\ VAE}} [B,32,32,4] \xrightarrow{\mathrm{MeanFlow\ DiT}} [B,32,32,4] \xrightarrow{\mathrm{VAE\ decoder}} [B,256,256,3].

生成网络本身从随机初始化训练,但 VAE tokenizer 是预训练的。因此“trained from scratch”准确含义是“MeanFlow/DiT 不从生成 teacher 或预训练生成 backbone 初始化”,而不是整条像素生成管线的每个参数都从零训练。

3.2 DiT Backbone

论文保持 DiT block 不变,只修改时间条件和训练目标。

模块输入与输出具体设计
Patch embedding[B,32,32,4][B,N,D][B,32,32,4]\rightarrow[B,N,D]主模型 patch 2×22\times2N=256N=256;消融 B/4 的 N=64N=64
Spatial position[N,D][N,D]固定二维 sine-cosine embedding
tt embedding[B][B,D][B]\rightarrow[B,D]Fourier/sinusoidal embedding 后接两层 MLP
h=trh=t-r embedding[B][B,D][B]\rightarrow[B,D]tt 独立的同构 embedder
Class embedding[B][B,D][B]\rightarrow[B,D]1000 类外加 null class
Condition fusion[B,D][B,D]c=et+eh+eyc=e_t+e_h+e_y
Transformer blocks[B,N,D][B,N,D][B,N,D]\rightarrow[B,N,D]Multi-head self-attention、MLP、adaLN-Zero、残差连接
Final layer[B,N,D][B,32,32,4][B,N,D]\rightarrow[B,32,32,4]adaLN 调制、线性投影、unpatchify

每个 DiT block 为:

x=x+gattnAttn(LN(x)(1+sattn)+battn), x' = x + g_{\mathrm{attn}} \odot \mathrm{Attn} \left( \mathrm{LN}(x)\odot(1+s_{\mathrm{attn}}) +b_{\mathrm{attn}} \right),
x=x+gmlpMLP(LN(x)(1+smlp)+bmlp). x'' = x' + g_{\mathrm{mlp}} \odot \mathrm{MLP} \left( \mathrm{LN}(x')\odot(1+s_{\mathrm{mlp}}) +b_{\mathrm{mlp}} \right).

六组调制量

(battn,sattn,gattn,bmlp,smlp,gmlp) (b_{\mathrm{attn}},s_{\mathrm{attn}},g_{\mathrm{attn}}, b_{\mathrm{mlp}},s_{\mathrm{mlp}},g_{\mathrm{mlp}})

由条件 cc 经过 SiLU 和线性层生成。调制线性层与输出层使用零初始化,因此网络从近似恒等残差块开始;普通线性层采用 Xavier uniform。主实验 dropout 为 0,LayerNorm 的 affine 参数关闭,数值稳定项为 10610^{-6}

3.3 模型规模

模型深度Hidden dimHeadsPatch论文结果中的参数量
MF-B/212768122×22\times2131M
MF-M/2161024162×22\times2308M
MF-L/2241024162×22\times2459M
MF-XL/2281152162×22\times2676M

附录配置表把 M/2 写成 497.8M,与 Figure 1、Table 2 的 308M 以及官方模型定义不一致,应视为排版错误。该表还把 L/2 和 XL/2 都写成 119 GFLOPs;按标准 DiT 配置和不同深度/宽度,两者不应相同,这是第二处配置表内部可疑项。

4. Training and Inference

4.1 无 Guidance 的前向与训练

每个 batch 的训练流程是:

  1. 取 VAE latent xRB×32×32×4x\in\mathbb{R}^{B\times32\times32\times4}
  2. 分别从时间分布采样 ttrr,交换次序使 trt\geq r
  3. 对 75% 的样本令 r=tr=t,所以 rtr\neq t 的比例为 25%。
  4. 采样 εN(0,I)\varepsilon\sim\mathcal{N}(0,I)
  5. 构造 zt=(1t)x+tεz_t=(1-t)x+t\varepsilonvt=εxv_t=\varepsilon-x
  6. 计算
(uθ,u˙θ)=JVP[uθ;(vt,0,1)]. (u_\theta,\dot{u}_\theta) = \mathrm{JVP} \left[ u_\theta; (v_t,0,1) \right].
  1. 构造停止梯度的 target:
utgt=sg[vt(tr)u˙θ]. u_{\mathrm{tgt}} = \mathrm{sg} \left[ v_t-(t-r)\dot{u}_\theta \right].
  1. 计算自适应加权损失,反向传播到 uθu_\theta 的预测分支。
  2. 用 Adam 更新参数,并维护 EMA 权重用于采样。

4.2 时间采样

最佳 ImageNet 配置使用 logit-normal:

ξN(0.4,1.02),s=σ(ξ). \xi\sim\mathcal{N}(-0.4,1.0^2), \qquad s=\sigma(\xi).

ttrr 先独立采样,再排序。消融显示:

时间采样1-NFE FID,B/4 80 epochs
Uniform(0,1)(0,1)65.90
LogitNormal(0.2,1.0)(-0.2,1.0)63.83
LogitNormal(0.2,1.2)(-0.2,1.2)64.72
LogitNormal(0.4,1.0)(-0.4,1.0)61.06
LogitNormal(0.4,1.2)(-0.4,1.2)61.79

4.3 固定 CFG 被吸收到训练目标

标准 CFG 定义:

vcfg(zt,tc)=ωv(zt,tc)+(1ω)v(zt,t). v^{\mathrm{cfg}}(z_t,t\mid c) = \omega v(z_t,t\mid c) + (1-\omega)v(z_t,t).

MeanFlow 对这个新速度场定义平均速度 ucfgu^{\mathrm{cfg}},并用边界关系:

ucfg(zt,t,t)=vcfg(zt,t). u^{\mathrm{cfg}}(z_t,t,t) = v^{\mathrm{cfg}}(z_t,t).

由于对类别取期望后:

Ec[vcfg(zt,tc)]=v(zt,t), \mathbb{E}_c \left[ v^{\mathrm{cfg}}(z_t,t\mid c) \right] = v(z_t,t),

可将指导速度改写为:

vcfg(zt,tc)=ωv(zt,tc)+(1ω)ucfg(zt,t,t). v^{\mathrm{cfg}}(z_t,t\mid c) = \omega v(z_t,t\mid c) + (1-\omega)u^{\mathrm{cfg}}(z_t,t,t).

实际训练用样本条件速度替代第一项:

v~t=ωvt+(1ω)uθcfg(zt,t,t). \widetilde{v}_t = \omega v_t + (1-\omega) u_\theta^{\mathrm{cfg}}(z_t,t,t).

再构造:

utgt=v~t(tr)[(zuθcfg)v~t+tuθcfg]. u_{\mathrm{tgt}} = \widetilde{v}_t - (t-r) \left[ (\partial_z u_\theta^{\mathrm{cfg}})\widetilde{v}_t + \partial_t u_\theta^{\mathrm{cfg}} \right].

训练时以 10% 概率丢弃 class condition。推理时直接调用条件网络一次,不再额外计算 unconditional branch,所以仍为 1-NFE。

4.4 改进的 CFG 混合

附录进一步引入 κ\kappa

v~t=ω(εx)+κuθcfg(zt,t,tc)+(1ωκ)uθcfg(zt,t,t). \widetilde{v}_t = \omega(\varepsilon-x) + \kappa u_\theta^{\mathrm{cfg}}(z_t,t,t\mid c) + (1-\omega-\kappa) u_\theta^{\mathrm{cfg}}(z_t,t,t).

其有效 guidance scale 为:

ω=ω1κ. \omega' = \frac{\omega}{1-\kappa}.

固定 ω=2\omega'=2 时:

κ\kappa1-NFE FID
0.020.15
0.519.15
0.819.10
0.918.63
0.9519.17

这个设计的代价是 guidance 目标在训练前已固定。原版 MeanFlow 不能像标准 CFG 那样在测试时自由扫描 guidance scale;作者后续的 Improved Mean Flows 正是针对“网络依赖 target”和“固定 guidance”两点进行重构。

4.5 推理

一步推理只需:

z1=εN(0,I), z_1=\varepsilon\sim\mathcal{N}(0,I),
z0=z1uθ(z1,0,1) \boxed{ z_0 = z_1-u_\theta(z_1,0,1) }

若使用 KK 步,将 1=t0>t1>>tK=01=t_0>t_1>\cdots>t_K=0,每一步为:

zti+1=zti(titi+1)uθ(zti,ti+1,ti). z_{t_{i+1}} = z_{t_i} - (t_i-t_{i+1}) u_\theta \left( z_{t_i},t_{i+1},t_i \right).

论文没有在最终版中完整报告 2-NFE 和 4-NFE 的时间节点选择。OpenReview rebuttal 额外报告 4-NFE FID 1.89,但该数值未进入最终 proceedings,故只能视为作者回复中的补充证据。

5. Claims to Evidence

Claim类型证据强度主要风险
平均速度适合一步生成概念 / 数学Eq. 3、Eq. 12 的精确位移关系前提是网络能准确回归大区间平均场
MeanFlow Identity 与平均速度定义等价理论Eq. 4-8;Appendix B.3中强需要正则性和边界条件;只证明 ground-truth field
条件速度可替代边际速度理论OpenReview rebuttal 的梯度等价推导最终论文缺证明;自适应权重下不再直接成立
正确 JVP 是关键实证Table 1b:正确切向 FID 61.06,错误切向 137.96-329.22这是破坏性 sanity check,不是独立机制证明
rtr\neq t 训练使一步生成成立实证Table 1a:FM 328.91,25% MeanFlow 61.06B/4、单一数据集和训练预算
CFG 可保持 1-NFE数学 / 实证Eq. 13-21;Table 1f、Table 5guidance 固定在训练时;额外训练计算未完整分解
1-NFE 达到 FID 3.43实证Table 2,MF-XL/2,ImageNet 50K单次报告、无方差、无公开 XL 配置或 checkpoint
优于此前 from-scratch 1-NFE flow/diffusion实证3.43 vs Shortcut 10.60、iCT 34.24训练预算和方法细节并非完全统一
2-NFE 接近多步模型实证MF-XL/2+ 2.20 vs DiT 2.27、SiT 2.06MF-XL/2+ 训练 1000 epochs;比较方训练预算不同
可扩展实证B/M/L/XL 的 FID 6.17/5.01/3.84/3.43中强仅 ImageNet、四个规模、没有 scaling law 拟合
训练开销很小系统v4-8 TPU:0.045 vs 0.052 sec/iter,约 16%仅 B/4、单一硬件;无端到端资源曲线
无需预训练口径DiT 从随机初始化,无 teacher中强仍依赖预训练 VAE;应理解为“生成网络无预训练”

6. Experiments

6.1 数据与评估

数据集任务表示空间模型指标
ImageNet-1K256×256256\times256 class-conditional generation预训练 VAE 的 32×32×432\times32\times4 latentDiT B/M/L/XLFID-50K
CIFAR-1032×3232\times32 unconditional generationPixel space约 55M U-NetFID-50K

ImageNet 训练使用随机水平翻转和 ADM 风格中心裁剪。latent dataset 缓存 VAE posterior 的均值与标准差,训练时重新采样 latent。CIFAR-10 采用水平翻转,关闭垂直翻转与旋转。

6.2 核心消融

rtr\neq t 比例

rtr\neq t 比例1-NFE FID
0%,等价 FM328.91
25%61.06
50%63.14
100%67.32

这说明只学瞬时速度无法一步生成,也说明只学跨区间目标并非最佳。25% 的跨区间样本配合 75% 的 r=tr=t 边界监督最优,表明局部速度锚点对训练稳定性仍重要。

JVP 切向

JVP tangent1-NFE FID
(v,0,1)(v,0,1)61.06
(v,0,0)(v,0,0)268.06
(v,1,0)(v,1,0)329.22
(v,1,1)(v,1,1)137.96

这组实验非常有价值:r,tr,t 只有一维,但省略 tu\partial_t u 或错误加入 ru\partial_r u 都会让模型基本失效,说明性能不是单纯来自“给 DiT 多加一个时间条件”。

时间条件形式

条件1-NFE FID
(t,r)(t,r)61.75
(t,tr)(t,t-r)61.06
(t,r,tr)(t,r,t-r)63.98
trt-r63.13

模型对参数化形式不敏感,但“当前位置 + 区间长度”最自然,也与网络实际任务最匹配。

自适应损失

pp1-NFE FID
0.0,L279.75
0.563.98
1.061.06
1.566.57
2.069.19

从 79.75 到 61.06 的差距不小。恒等式是必要的核心,但鲁棒损失对最终优化同样重要。OpenReview rebuttal 又报告:完整训练预算下 B/2 的纯 L2 FID 为 7.14,自适应权重为 6.17;这说明模型放大后差距缩小,但该结果未进入最终正文。

6.3 ImageNet 主结果

1-NFE、从头训练的 diffusion / flow 模型

方法参数量NFEFID
iCT-XL/2675M134.24
Shortcut-XL/2675M110.60
MeanFlow-B/2131M16.17
MeanFlow-M/2308M15.01
MeanFlow-L/2459M13.84
MeanFlow-XL/2676M13.43

3.43 相比 Shortcut 的 10.60 降低约 67.6%,论文称“接近 70%”成立。即使 MF-B/2 只有 131M 参数,也明显优于 675M Shortcut-XL/2。

2-NFE 与多步参考

方法NFEFID
MeanFlow-XL/222.93
MeanFlow-XL/2+22.20
DiT-XL/2250×2250\times22.27
SiT-XL/2250×2250\times22.06
SiT-XL/2 + REPA250×2250\times21.42

这里的“接近多步模型”结论合理,但需要两个限定:

  • XL/2+ 训练 1000 epochs,而普通 MeanFlow 模型为 240 epochs。
  • “相同 backbone”不等于“相同训练 compute”;论文没有把各 baseline 的总训练 FLOPs、数据遍历次数和调参预算统一。

6.4 Rebuttal 中的多指标结果

这些结果不在最终 proceedings 的主实验中,只出现在作者回复:

模型FIDISsFIDPrecisionRecall
MF-XL/2,1-NFE3.42247.506.430.780.55
MF-XL/2,2-NFE2.20269.374.780.790.60
DiT-XL/2,250×2250\times2 NFE2.27278.244.600.830.57
SiT-XL/2,250×2250\times2 NFE2.06277.504.490.830.59

它们显示 1-NFE MF 的 Recall 0.55 与多步模型接近,但 Precision 0.78 低于 0.83;2-NFE 后 Recall 提高到 0.60,Precision 仍为 0.79。由此看,MeanFlow 缩短采样步数后主要差距更像是样本精度/细节,而不是明显的 mode collapse。

6.5 CIFAR-10

方法PreconditionerNFEFID
iCTEDM12.83
ECTEDM13.60
sCTEDM12.97
IMMEDM13.20
MeanFlowNone12.92

MeanFlow 很有竞争力,但没有压倒性领先 iCT。由于 MeanFlow 不使用 EDM preconditioner,而其他方法使用,表格既展示了方法简洁性,也引入了额外差异;它不是完全单变量的 objective 对比。

6.6 统计与报告质量

主要缺口:

  1. FID 没有多 seed 均值、标准差或置信区间。
  2. 没有报告超参数搜索规模,因此无法判断 baseline 调参是否等量。
  3. 没有真实推理 latency、吞吐、功耗或峰值显存。
  4. JVP 成本只在 B/4 和 v4-8 TPU 上测量。
  5. 1-NFE 主结果的 XL 配置和 checkpoint 没有在官方仓库公开。
  6. 最终 proceedings 仍以 FID 为唯一正式主指标;rebuttal 的多指标表没有被纳入。
  7. 定性样本明确标注为 curated examples,不能当作随机样本分布的无偏展示。

7. Baseline Fairness

公平之处

  • ImageNet 的关键 1-NFE 对比尽量使用相同 DiT-XL/2 规模。
  • 将“one step”与“1-NFE”区分:IMM 一步 guidance 实际为 2 NFE。
  • 明确区分 from-scratch 方法与依赖预训练 teacher 的 distillation 方法。
  • CIFAR-10 统一使用约 55M U-Net。

不完全公平或容易误读之处

  • “从头训练”没有把预训练 VAE 的依赖写进 headline 限定。
  • 2-NFE 的 2.20 来自 1000-epoch XL/2+,而不是普通 240-epoch XL/2。
  • 与 DiT/SiT 的多步比较统一了 backbone,却没有统一总训练 compute。
  • Figure 1 横轴是训练 GFLOPs 的对数尺度,但不同工作的 FLOPs 统计口径未被充分审计。
  • 主文没有 distillation 一步模型的同表结果;论文以“目标类别不同”为理由分开讨论是合理的,但读者仍需要知道最强一步图像生成质量并不只来自 from-scratch 路线。

8. Theoretical and Mathematical Assessment

8.1 真正严谨的部分

  • 从平均速度定义到 MeanFlow Identity 的微积分推导正确。
  • JVP 切向 (v,0,1)(v,0,1) 与固定 rr 的全导数一致。
  • 平均速度直接给出区间位移,因此一步采样公式不是数值近似,而是对真实 uu 的精确关系。
  • S=(tr)uS=(t-r)uSt=r=0S|_{t=r}=0 恢复积分常数的充分性论证基本成立。
  • CFG 被视为一个新的速度场后,再对其定义平均速度,概念上自洽。

8.2 需要限定的部分

Ground-truth 恒等式不等于网络优化保证

恒等式定义了理想解应满足什么,但并没有证明非凸神经网络、stop-gradient 自举 target 和有限采样 SGD 会收敛到该解。论文从“零损失蕴含正确恒等式”跳到了“训练有效”,中间主要由实验而非优化理论支撑。

零损失论证不能直接搬到条件 target

对固定 ztz_t,不同 (x,ε)(x,\varepsilon) 可能给出不同 vtv_t,所以条件 target 存在不可约方差;网络一般不可能对每个条件样本都达到零损失。正确结论应是平方损失和 stop-gradient 下,条件目标的期望梯度与边际目标一致,而不是逐样本 target 相等。

Stop-gradient 不是纯工程技巧

论文正文主要强调 stop-gradient 避免二阶反向传播。OpenReview 讨论进一步揭示,它还是条件速度替换能保持简洁梯度等价的关键部分。如果让梯度穿过 Jθvt+tuθJ_\theta v_t+\partial_t u_\theta,target 的参数依赖会产生额外项,FM 式条件期望论证不再直接适用。

自适应权重削弱理论闭环

最佳配置 p=1p=1 使用依赖样本残差的权重。它改善优化,却使“条件速度和边际速度给出相同梯度”的仿射期望证明失效。论文没有证明该鲁棒目标仍以真实平均速度为唯一总体最优解。

与 CTM / Flow Map Matching 的边界不是非黑即白

平均速度与位移只差一个确定性尺度:

S(zt,r,t)=(tr)u(zt,r,t). S(z_t,r,t)=(t-r)u(z_t,r,t).

因此 MeanFlow 可以被看作对两时间 flow map 的速度化参数化。它的贡献仍然真实:这个参数化让乘积求导自然产生 u+(tr)u˙u+(t-r)\dot{u},形成单一 target,并允许直接输出平均速度。但将其描述成完全脱离 CTM/Flow Map Matching 的全新基础会偏强。更准确的定位是:在两时间轨迹映射谱系中,MeanFlow 找到了一个特别适合单一 JVP 回归和一步采样的参数化。

8.3 后续工作对原版理论的反向验证

作者后续的 Improved Mean Flows 明确指出原版的两个问题:

  1. 原版 target 依赖网络自身,不是标准的固定目标回归;
  2. CFG scale 在训练时固定,测试时不灵活。

iMF 将目标重写为以瞬时速度 vv 为 target、以平均速度网络构造预测的重参数化回归,并把 guidance 作为显式条件。它把 ImageNet 1-NFE FID 进一步降到 1.72。这个后续结果一方面确认原版 MeanFlow 的核心方向很强,另一方面也说明原版目标并不是最终形态。

作者后续的 Pixel MeanFlow 则移除 latent VAE,在 ImageNet 256×256256\times256 达到 1-NFE FID 2.22,直接回应了原版依赖预训练 VAE 的限制。

9. Reviewer Feedback

OpenReview 共公开 5 份 Official Review,最终评分为:

Reviewer最终评分置信度主要肯定主要问题Rebuttal 后状态
AbQD6 / Strong Accept33.43 FID、恒等式直观、无需 teacher缺 Limitations;为何选 vt=εxv_t=\varepsilon-x保持正面评分
8EtS5 / Accept5理论视角、结果与影响力条件/边际目标等价;只报 FID;成本比较大部分问题已解决,保持评分
ENCq5 / Accept4简洁、可扩展、CFG稳定性、JVP 内存、20% 成本、消融与主结果差距认为主要疑虑解决
LhKn5 / Accept4新视角、from-scratch、scalingJVP 训练开销;缺 diversity 指标接受作者补充,推荐接收
7gPv3 / Borderline Reject5单一损失、优化稳定、强结果与 continuous-time CTM / Flow Map Matching 关系不足;条件速度理论;stop-gradient;比较范围承认推导更清楚,但因原创性定位继续维持 3 分

9.1 作者回复的关键新增信息

  • 承认应加入三类限制:与多步模型仍有差距、实验只覆盖图像、依赖 VAE latent。
  • 报告 MeanFlow 相对 FM 的训练 wall-clock 增加约 20%,正式附录精测为 16%。
  • 声称编译后峰值内存可与 FM 持平。
  • 补充 IS、sFID、Precision、Recall。
  • 补充条件速度与边际速度的梯度等价推导。
  • 报告 4-NFE FID 1.89。
  • 报告 B/2 完整预算下纯 L2 FID 7.14,自适应权重 FID 6.17。
  • 明确原版 MeanFlow 的 CFG 是训练时吸收 guidance,而非测试时再做两分支 CFG sampling。

9.2 未完全解决的分歧

Reviewer 7gPv 最终接受了“在 stop-gradient 下,条件目标与边际目标梯度可对齐”的解释,但仍认为 MeanFlow 与 continuous-time CTM 在梯度结构上过于接近,原创性被夸大。Area Chair 的决定也明确记录了这个分歧,并要求最终版加强与 CTM 的关系。

最终版确实扩充了 Related Work,加入 CTM、Flow Map Matching 的两时间比较;但:

  • 条件/边际速度的完整梯度证明仍未进入论文;
  • 没有独立 Limitations section,checklist 仍回答“No”;
  • rebuttal 的多指标结果也未进入正式主文。

9.3 Meta Decision

最终决定为 Accept (Oral)。Area Chair 认为该工作兼具清楚的方法、强实验表现和基础性潜力;尽管一位评审对 CTM 关系和 idea-level novelty 保持异议,多数评审在 rebuttal 后支持接收。

10. Code Verification

10.1 Claims to Code 映射

Claim论文描述官方实现状态
线性 OT pathzt=(1t)x+tεz_t=(1-t)x+t\varepsilonmeanflow.py 完全一致完全匹配
条件速度vt=εxv_t=\varepsilon-xv = e - x完全匹配
JVP tangent(v,0,1)(v,0,1)jax.jvp(..., (v_g, 1, 0)),参数顺序是 (z,t,r)(z,t,r)完全匹配
Targetutgt=vhu˙u_{\mathrm{tgt}}=v-h\dot uu_tgt = v_g - (t-r) * du_dt完全匹配
Stop-gradienttarget 不反传jax.lax.stop_gradient(u_tgt)完全匹配
25% 的 rtr\neq t主模型默认 25%data_proportion=0.75 表示 75% 强制 r=tr=t完全匹配,但变量名不直观
Logit-normalμ=0.4,σ=1.0\mu=-0.4,\sigma=1.0P_mean=-0.4, P_std=1.0完全匹配
自适应权重p=1p=1norm_p=1.0完全匹配
稳定常数 cc正文仅举例 10310^{-3}norm_eps=0.01论文未完整报告
改进 CFGω=1,κ=0.5\omega=1,\kappa=0.5 可得有效 scale 2默认配置一致完全匹配
10% 随机 class dropout每样本 Bernoulli dropout先采样 dropout 数量,再总是丢 batch 前 NN 个样本部分匹配
DiT-B/412 层、768 hidden、12 heads模型与配置一致完全匹配
1-NFE solverzr=zt(tr)uz_r=z_t-(t-r)usolver_step 完全一致完全匹配
主结果 MF-XL/2676M、FID 3.43仓库没有 XL 训练配置或 checkpoint未能验证

10.2 Class Dropout 的实现偏差

代码先按 Bernoulli 采样:

miBernoulli(0.1), m_i\sim\mathrm{Bernoulli}(0.1),

但随后只使用总数:

Ndrop=imi, N_{\mathrm{drop}}=\sum_i m_i,

并把 batch 的前 NdropN_{\mathrm{drop}} 个样本设为 unconditional,而不是使用原始 mask mim_i

由于 dataloader 会打乱数据,长期看每个语义类别仍可能近似随机被丢弃;但单个 batch 内并非论文所说的独立随机 class dropout。这是一个真实但大概率影响有限的实现偏差。

10.3 可复现结果

官方 README 报告 B/4 的 paper / repository 对照:

配置论文 FID仓库 FID
80 epochs,无 guidance61.0960.75
80 epochs,ω=2,κ=0\omega=2,\kappa=020.1520.24
80 epochs,ω=1,κ=0.5\omega=1,\kappa=0.519.1518.70
240 epochs,ω=1,κ=0.5\omega=1,\kappa=0.5未在该对照列报告11.35

这些小模型结果高度接近,说明核心目标和评估管线可以复现。仓库提供的 B/4 checkpoint 预期 FID 约 11.4,与 240-epoch 复现值一致。

但是主 claim 的 MF-XL/2 3.43 仍不能仅凭该仓库复现,因为缺少:

  • XL/2 训练配置;
  • XL/2 checkpoint;
  • 1000-epoch XL/2+ 配置;
  • 主结果的多 seed 记录;
  • 生成主表的完整实验脚本。

10.4 实现质量

优点:

  • 核心 MeanFlow 类短小,公式到代码的映射非常直接。
  • 训练、EMA、VAE、FID、数据预处理模块分离。
  • README 给出小模型 checkpoint 和 paper/repo 数值对照。
  • 固定 seed 为 42,distributed sampler 每 epoch 更新。

不足:

  • 没有单元测试或数值 JVP/恒等式测试。
  • 依赖只放在 install.sh,多项依赖未锁定精确版本。
  • launch.sh 使用 sudo mkdir 和全目录 chmod 777,不适合作为可移植的生产脚本。
  • 主要面向 TPU;GPU 只是后续 sanity-check。
  • 没有主结果配置与 checkpoint。
  • 当前仓库后来加入 iMF/pMF 链接,但原版 MeanFlow 的 BibTeX 仍写成 arXiv 而非 NeurIPS 2025。

综合可复现性评价:核心算法高,主结果中等偏低。研究者可以复现 MeanFlow loss 和 B/4 趋势,但无法从官方仓库直接重做 3.43 的旗舰结果。

11. Contribution Positioning

11.1 创新类型

  • [x] 概念创新:把一步生成目标重述为平均速度场。
  • [x] 理论创新:推导 MeanFlow Identity 和相应 JVP 训练式。
  • [x] 方法创新:建立单一、from-scratch 的一步生成训练目标。
  • [x] 经验创新:把 1-NFE ImageNet FID 大幅推进到 3.43。
  • [ ] 架构创新:DiT block 本身没有改变。
  • [ ] 数据创新:没有新数据集。

11.2 与直接竞品的关系

方法学习对象时间参数训练依赖MeanFlow 的优势MeanFlow 的劣势
Consistency Models / sCM到数据端的一致映射常固定 r=0r=0常需预训练或 curriculum;不同版本不同两时间、单一平均速度恒等式、可直接 from scratch原创性与 continuous-time CM 有重叠
CTM两时间轨迹映射(r,t)(r,t)solver target,常含额外训练组件不需训练时 ODE simulation,目标更简洁flow-map 参数化在概念上非常接近
Flow Map Matching位移 / flow map(r,t)(r,t)多项 matching loss、时间导数平均速度参数化自然产生单一 identityS=(tr)uS=(t-r)u 显示两者只是紧密相关参数化
Shortcut Models带步长条件的速度 / shortcut两时间或步长FM 加 self-consistency不需离散 bootstrap pair 或额外 consistency lossMeanFlow 的 JVP 与固定 CFG 有自己的训练成本
IMMstochastic interpolant moments两时间自一致 moment matching1-NFE 更强,guidance 不额外增加 NFEIMM 的建模范围更偏随机插值框架
Improved MeanFlowvv-loss reparameterized by uu-pred(r,t)(r,t)单阶段 from scratchtarget 更标准、guidance 可变、FID 1.72属于后续改进,说明原版并非最终目标

11.3 创新度评分:8/10

理由:

  • 平均速度参数化极其简单,却把一个长期困难的 1-NFE 结果推进了巨大幅度。
  • 方法不是新 backbone 或工程拼装,核心公式能清楚解释为什么一步采样可行。
  • 与 CTM、Flow Map Matching 存在紧密等价结构,因此“全新基础”的宣传应降温。
  • 后续 iMF、pixel MeanFlow 和大量跨模态扩展说明该概念已经形成可持续研究线。

12. Strengths, Weaknesses, and Risks

Strengths

  1. 问题与输出量匹配得漂亮:一步生成需要区间位移,平均速度正是位移除以区间长度。
  2. 数学到代码距离短:核心实现就是一次 JVP、一个 stop-gradient target 和普通回归。
  3. 消融具有机制解释力:错误 JVP、去掉跨区间样本都会灾难性退化。
  4. 旗舰结果非常强:3.43 显著改写了 from-scratch 1-NFE diffusion/flow 的 Pareto frontier。
  5. 不依赖生成 teacher:避免了 teacher 上限、蒸馏数据和多阶段训练。
  6. 天然支持任意区间:同一网络可用于一步或少步,而不只固定映射到 t=0t=0
  7. 后续生命力强:iMF 和 pMF 都沿着原始思想继续取得明显进展。

Significant Concerns

  1. 最佳损失与理论证明不完全对齐:条件/边际梯度等价证明覆盖 stop-gradient L2,却不自动覆盖 p=1p=1 自适应权重。
  2. Target 自举依赖网络zuθ\partial_z u_\thetatuθ\partial_t u_\theta 出现在 target 中,训练是固定点式自举,不是标准监督回归。
  3. CFG 缺乏测试时自由度:guidance scale 和时间窗口是训练配置的一部分。
  4. “from scratch”口径需限定:依赖预训练 VAE tokenizer。
  5. 主结果不可由官方仓库直接重现:缺 XL 配置/checkpoint。
  6. 统计证据不足:无多 seed、误差条、显著性检验。
  7. 相关工作边界偏强:平均速度与 flow map 通过 S=(tr)uS=(t-r)u 直接互换。

Minor Issues

  • 配置表中的 M/2 参数量和 L/2 FLOPs 可疑。
  • 最终论文没有兑现 rebuttal 中承诺的独立 Limitations section。
  • 论文主表只报告 FID;多指标结果留在 rebuttal。
  • 2-NFE schedule 和主结果完整运行细节不足。
  • 官方 class dropout 实现不是逐样本独立 mask。

不属于致命缺陷的事项

没有证据表明核心 FID 结果虚假,也没有发现 MeanFlow Identity 的微积分错误。主要问题是理论适用范围、原创性定位和复现完整度,而不是方法完全不成立。

13. Missing Experiments

如果要把这项工作从“强方法论文”提升到更严谨的基础框架,最值得补的是:

  1. 在相同 backbone、相同训练 FLOPs 下比较 FM、Shortcut、CTM、Flow Map Matching、MeanFlow。
  2. 对 3.43 的 XL 结果做至少 3 个 seed,并报告 FID 方差。
  3. 分离恒等式、stop-gradient、自适应权重、r=tr=t 混合比例和 CFG target 的增益。
  4. p=0p=0p=1p=1 下验证条件/边际 target 的优化差异。
  5. 直接训练可计算边际速度的低维 toy problem,测量 uθu_\theta 对真实平均场的函数误差,而不只看最终 FID。
  6. 报告训练 FLOPs、峰值内存、推理 latency、吞吐和能耗。
  7. 随机而非 curated 的样本审查,并正式报告 Precision/Recall、sFID、FID-DINO。
  8. 在音频、视频、机器人轨迹或科学模拟上验证平均速度框架是否真正跨模态。
  9. 公开 XL/2、XL/2+ 配置和 checkpoint。
  10. 对 guidance scale 的训练时固定误差做系统敏感性分析。

14. Research Direction and Long-Term Outlook

14.1 科学价值

高。MeanFlow 把生成模型加速从“如何更快求解同一个 ODE”推进到“应该学习哪个粗粒度动力学量”。这是比 solver engineering 更基础的视角。

14.2 可扩展性

  • 对数据维度:JVP 只计算一个切向方向,不显式构造 d×dd\times d Jacobian,因此不会因 Jacobian 存储而平方爆炸。
  • 对模型规模:额外成本近似一次 input-direction forward-mode AD;论文在 B/4 上测得 16% wall-clock 增量,但更大模型仍需实测。
  • 对模态:公式不依赖图像,只需要可微连续状态和可采样 conditional velocity。
  • 对真实系统:一步网络适合低延迟应用,但误差被压进单个大跨度函数逼近问题,容量和数据覆盖会成为瓶颈。

14.3 值得跟进的研究问题

  1. 如何用标准回归目标替代网络依赖 target,同时保留 MeanFlow identity。
  2. 如何学习可连续调节的 guidance,而不是每个 scale 重训。
  3. 如何将平均速度推广到离散状态、随机动力学或非欧氏流形。
  4. 如何量化大跨度平均场的 approximation error 与模型容量之间的 scaling law。
  5. 如何同时学习局部瞬时场与多尺度平均场,使模型在 1 到多 NFE 间自适应。
  6. 能否把 MeanFlow 视为 operator learning 或 multigrid coarsening,并获得误差界。
  7. 如何在不依赖 VAE 的像素空间保持一步生成质量。

14.4 个人跟进决策

  • [x] 非常值得:作为一步生成和 coarse dynamics 的基础论文深入掌握。
  • [x] 建议复现:先复现 B/4,再优先比较 iMF,而不是只复现原版 flagship。
  • [ ] 只需了解。
  • [ ] 建议避开。

如果现在开始新项目,我会把原版 MeanFlow 当作理论起点,把 iMF 当作更强训练基线,并把“自适应权重下的条件/边际一致性”作为一个值得单独研究的理论缺口。

15. Critical Assessment

Reviewer-style Recommendation

Recommendation: Accept,接近 Strong Accept。

理由:

  • 核心概念清楚、公式简洁、实验增益巨大;
  • 1-NFE FID 3.43 对领域具有实质影响;
  • 没有依赖 teacher 或多阶段蒸馏,建立了一个可持续的新分支;
  • 理论闭环在最佳鲁棒损失下并不完整,且与 CTM/Flow Map Matching 的边界需要更克制;
  • 这些问题削弱“理论上完全原则化”的强表述,但不足以抵消方法和结果的价值。

NeurIPS 2025 最终给出 Oral 是合理决定。若在匿名评审时仅根据初稿,我会要求作者把 rebuttal 中的条件/边际梯度证明、限制和多指标结果纳入最终版;遗憾的是这些内容最终只被部分吸收。

科研品味三维评分

创新性 (Novelty):  ★★★★☆ 4.2/5
严谨性 (Rigor):   ★★★☆☆ 3.5/5
影响力 (Impact):  ★★★★★ 4.7/5

最终一句话评价

这篇论文在一步 flow-based generation 上,用“学习区间平均速度而非局部瞬时速度”这一极简重参数化取得了真正的大幅进步;它的经验影响力高于其理论完备度,而后续 iMF 与 pixel MeanFlow 已证明这不是一次性的 benchmark trick,而是一条仍在快速演化的研究路线。

16. Reusable Ideas

  1. 让网络预测任务真正需要的积分量,而不是先预测局部量再由昂贵 solver 累积。
  2. 对不可计算的积分定义求导,把 global target 转成局部信号加 JVP 的恒等式。
  3. 用边界样本锚定自举目标r=tr=t 样本把 MeanFlow 拉回普通 FM。
  4. 把 inference-time operation 提升为新的 ground-truth field:固定 CFG 被吸收进训练后可省掉测试时第二次前向。
  5. 破坏性 JVP 消融:主动使用错误切向,是验证微分结构而非额外 conditioning 在起作用的好方法。
  6. 区分“恒等式正确”与“优化目标一致”:网络依赖 target、stop-gradient 和鲁棒权重会改变理论适用范围。

Static research notes built with VitePress and KaTeX.