Skip to content

Omni-Weather:统一天气雷达生成、理解与推理

Status: completed

Title: Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation

Authors: Zhiwang Zhou, Yuandong Pu, Xuming He, Yidi Liu, Yixin Chen, Junchao Gong, Xiang Zhuang, Wanghan Xu, Qinglong Cao, Shixiang Tang, Yihao Liu, Wenlong Zhang, Lei Bai

Venue / Year: ICLR 2026 Poster;arXiv v3,2026-03-30

Affiliations: Tongji University;Shanghai AI Laboratory;Shanghai Jiao Tong University;Zhejiang University;University of Science and Technology of China;University of California, Los Angeles

Links: arXiv · OpenReview · Code · Model

Tags: [[weather]] [[radar-nowcasting]] [[multimodal-model]] [[flow-matching]] [[chain-of-thought]] [[SEVIR]] [[ICLR-2026]]

一句话结论

Omni-Weather 的真正贡献不是在每一项指标上击败专用模型,而是证明:以 Bagel-7B-MoT 为共享 Transformer 主干,将天气雷达临近预报、卫星反演、单帧理解和序列理解放进同一套多模态接口,能够获得有竞争力的综合表现,并出现一定的联合训练增益。

但论文最强的三个叙事——“端到端统一”“因果 CoT”“生成与理解均达到 SOTA”——都比现有证据更强。公开代码还暴露出方法方程与实际 latent flow matching 目标不一致、EarthFormer 的使用方式与论文图示不一致、默认训练脚本无法复现论文联合四任务设置等问题。因此,这是一篇方向感和系统整合很强、但方法刻画与复现闭环明显不足的工作。


1. 论文要解决什么问题

天气雷达研究长期分成两条相对独立的路线:

  1. 生成类任务:根据历史雷达序列预测未来雷达,或从卫星通道反演雷达;
  2. 理解类任务:识别回波位置、强度、形态和运动趋势,并生成自然语言解释或离散评分。

专用模型通常只优化一个任务。论文认为,这种分割带来两个问题:

  • 生成模型能画出未来雷达,却不能用语言解释其运动与演化;
  • 理解模型能描述雷达,却无法把语义知识反馈给像素级预测。

Omni-Weather 因而提出一个统一条件映射:

yt=Fθ(pt,xt), y_t = F_{\theta}(p_t, x_t),

其中:

  • tt 是任务索引;
  • ptp_t 是任务提示;
  • xtx_t 是输入模态;
  • yty_t 是文本或图像目标;
  • FθF_{\theta} 是共享的多模态模型。

论文覆盖四个任务:

任务输入输出任务性质
雷达临近预报过去 10 帧 VIL 雷达未来 12 帧 VIL 雷达图像序列生成
雷达反演IR069 与 IR107 卫星通道同时刻 VIL 雷达条件图像生成
雷达图像理解单帧 VIL 雷达与问题文本回答或属性评分单图理解
雷达序列理解连续 VIL 雷达与问题文本回答或属性评分时序理解

SEVIR 的时间分辨率为 5 分钟,因此 10 帧历史对应 50 分钟,12 帧预测对应未来 1 小时。

1.1 四任务的统一形式

令任务 tt 的文本提示嵌入为

Pt=τtext(pt)RNp×d, P_t = \tau_{\mathrm{text}}(p_t) \in \mathbb{R}^{N_p \times d},

输入模态 token 为

Vt=τt(xt)RNx×d, V_t = \tau_t(x_t) \in \mathbb{R}^{N_x \times d},

可选的时间条件为

Kt=κtRNk×d. K_t = \kappa_t \in \mathbb{R}^{N_k \times d}.

论文将输入写成 token 拼接:

Xt=[τtext(pt);τt(xt);κt]. X_t = \left[ \tau_{\mathrm{text}}(p_t); \tau_t(x_t); \kappa_t \right].

若某项任务没有时间条件,则 Nk=0N_k=0。共享自注意力主干产生

Ht=fθ(Xt)R(Np+Nx+Nk)×d. H_t = f_{\theta}(X_t) \in \mathbb{R}^{(N_p+N_x+N_k)\times d}.

之后按输出类型路由:

y^t={Gϕ(Ht),tTgen,Lψ(Ht),tTunder. \widehat y_t = \begin{cases} G_{\phi}(H_t), & t\in\mathcal{T}_{\mathrm{gen}},\\ L_{\psi}(H_t), & t\in\mathcal{T}_{\mathrm{under}}. \end{cases}

GϕG_{\phi} 表示图像生成分支,LψL_{\psi} 表示语言解码分支。这里的“统一”主要发生在 fθf_{\theta}:任务仍有不同输入编码器和输出头,并不是所有模态共享完全相同的参数路径。


2. 模型结构:统一在哪里,又没有统一到哪里

2.1 基座与三类视觉入口

Omni-Weather 从 Bagel-7B-MoT 初始化。其核心是一个共享 Transformer,以及与任务类型相匹配的视觉编码器:

  • 理解编码器:把雷达图像变成适合语言理解的视觉 token;
  • 生成编码器:把卫星图像或条件图像变成生成条件;
  • 雷达序列编码器:论文声称用 EarthFormer 提取历史雷达的时空条件;
  • VAE:把生成目标压缩到 latent 空间,并在推理后把 latent 解码成图像。

因此更准确的结构描述是:

text
文本提示 ─────────────────┐
理解图像 → 理解编码器 ────┤
生成条件 → 生成编码器 ────┼→ 共享 Transformer → 文本 LM 头
雷达序列 → EarthFormer ───┤                    → flow 生成头 → VAE 解码
噪声 latent ───────────────┘

这个设计的优点是共享高层语义与推理容量,代价是“统一模型”仍然依赖多套专用前端和两个不同输出机制。它更接近共享中枢的多任务系统,而不是单一编码器、单一解码器的完全同构模型。

2.2 视觉 token 数

论文称所有图像统一缩放到 256×256256\times256,并得到约 256 个视觉 token。对生成分支,这与代码中的 VAE 下采样和 latent patch 化是相容的:

  1. VAE 将空间尺寸缩小约 8 倍:

    256×25632×32; 256\times256 \longrightarrow 32\times32;
  2. latent patch size 为 2:

    Nz=322322=16×16=256. N_z = \frac{32}{2} \frac{32}{2} = 16\times16 = 256.

不过,公开联合训练配置允许理解图像边长在 378 到 980 之间,并非严格固定为 256。论文的统一输入分辨率描述至少没有完整覆盖当前代码路径。

2.3 混合专家并不等于任务完全隔离

Bagel-7B-MoT 的 MoT 可以让不同 token 类型经过不同前馈专家,但共享注意力仍允许文本、理解视觉 token 和生成 latent token 相互条件化。其潜在价值是:

shared attentioncross\mboxtask transfer, \mathrm{shared\ attention} \Rightarrow \mathrm{cross\mbox{-}task\ transfer},

而不同专家可以降低生成目标与语言目标之间的梯度冲突:

specialized FFNmodality specialization. \mathrm{specialized\ FFN} \Rightarrow \mathrm{modality\ specialization}.

论文没有报告路由利用率、专家负载、梯度相似度或表示探针,因此“为什么联合训练有效”目前主要由结果间接支持,还不是机制层面的解释。


3. 训练目标:论文方程与代码实现并不相同

这是全文最需要仔细区分的数学问题。

3.1 论文给出的目标

论文将生成任务写成输出与目标之间的均方误差,将理解任务写成自回归交叉熵:

L=tTgenλt1Ωty^tyt22+tTunderλt(k=1ntlogpψ(yt,kyt,<k,fθ(Xt))). \mathcal{L} = \sum_{t\in\mathcal{T}_{\mathrm{gen}}} \lambda_t \frac{1}{\lvert\Omega_t\rvert} \left\lVert \widehat y_t-y_t \right\rVert_2^2 {}+{} \sum_{t\in\mathcal{T}_{\mathrm{under}}} \lambda_t \left( {}-{} \sum_{k=1}^{n_t} \log p_{\psi} \left( y_{t,k} \mid y_{t,<k}, f_{\theta}(X_t) \right) \right).

其中:

  • Ωt\Omega_t 是生成目标的像素或帧索引集合;
  • ntn_t 是文本目标长度;
  • λt\lambda_t 是任务权重。

按字面理解,第一项是像素或帧空间重建误差。然而公开实现并没有直接用

y^y22 \left\lVert \widehat y-y \right\rVert_2^2

训练图像输出,而是采用 latent flow matching。

3.2 代码实际执行的 latent flow matching

令 VAE 编码后的干净目标 latent 为

z0RCz×h×w, z_0\in\mathbb{R}^{C_z\times h\times w},

高斯噪声为

εN(0,I). \varepsilon\sim\mathcal{N}(0,I).

代码先采样一个 logit-normal 时间变量:

uN(0,1),t=σ(u), u\sim\mathcal{N}(0,1), \qquad t=\sigma(u),

再用 shift 参数 s>0s>0 变换时间:

t~=st1+(s1)t. \widetilde t = \frac{s t} {1+(s-1)t}.

省略 batch 广播记号后,插值路径为

zt~=(1t~)z0+t~ε. z_{\widetilde t} = (1-\widetilde t)z_0 {}+{} \widetilde t\varepsilon.

对应的恒定目标速度是

v=zt~t~=εz0. v^{\star} = \frac{\partial z_{\widetilde t}} {\partial\widetilde t} = \varepsilon-z_0.

模型根据噪声 latent、时间和多模态条件 cc 预测速度:

v^θ=v^θ(zt~,t~,c). \widehat v_{\theta} = \widehat v_{\theta} \left( z_{\widetilde t}, \widetilde t, c \right).

实际生成损失是

LFM=1Nzi=1Nzv^θ,i(εiz0,i)22. \mathcal{L}_{\mathrm{FM}} = \frac{1}{N_z} \sum_{i=1}^{N_z} \left\lVert \widehat v_{\theta,i} {}-{} \left( \varepsilon_i-z_{0,i} \right) \right\rVert_2^2.

理解分支则使用 token 级负对数似然:

LCE=1Nyk=1Nylogpψ(yky<k,c). \mathcal{L}_{\mathrm{CE}} = {}-{} \frac{1}{N_y} \sum_{k=1}^{N_y} \log p_{\psi} \left( y_k \mid y_{<k},c \right).

当前实现把两项加权:

Limpl=wmseLFM+wceLCE, \mathcal{L}_{\mathrm{impl}} = w_{\mathrm{mse}} \mathcal{L}_{\mathrm{FM}} {}+{} w_{\mathrm{ce}} \mathcal{L}_{\mathrm{CE}},

默认

wmse=wce=1. w_{\mathrm{mse}}=w_{\mathrm{ce}}=1.

因此,论文式中的“生成 MSE”若只是对实际 velocity MSE 的高度简写,就应明确说明 yty_t 指 latent velocity 而不是天气图像;若 yty_t 确实指图像,那么方法方程与实现目标就是不同的。

3.3 推理是常微分方程离散积分

推理从高斯噪声开始:

z1N(0,I), z_1\sim\mathcal{N}(0,I),

并沿学习到的速度场反向积分到数据端。用 KK 个离散步表示:

ztk1=ztkv^θ(ztk,tk,c)Δtk. z_{t_{k-1}} = z_{t_k} {}-{} \widehat v_{\theta} \left( z_{t_k},t_k,c \right) \Delta t_k.

代码默认使用 50 步。最后通过冻结的 VAE 解码器得到图像:

y^=DVAE(z0). \widehat y = D_{\mathrm{VAE}}(z_0).

代码还使用 classifier-free guidance。若

  • vcv_c 是完整条件速度;
  • vtv_t 是仅文本条件速度;
  • vuv_u 是无条件速度;

一种与代码意图相符的双条件组合可写为:

vcfg=vu+γtext(vtvu)+γimage(vcvt), v_{\mathrm{cfg}} = v_u {}+{} \gamma_{\mathrm{text}} \left( v_t-v_u \right) {}+{} \gamma_{\mathrm{image}} \left( v_c-v_t \right),

默认文本与图像 guidance scale 分别约为 4 和 2。论文正文没有把 flow matching、采样积分与 CFG 讲清楚,这使最核心的图像生成机制必须依赖代码才能还原。


4. 临近预报路径:论文叙述与公开代码存在关键分叉

论文的概念图给出的路径是:

(x9,,x0)10 observed framesEarthFormerκOmni\mboxWeather(x^1,,x^12)12 future frames. \underbrace{ \left( x_{-9},\ldots,x_0 \right) }_{10\ \mathrm{observed\ frames}} \xrightarrow{ \mathrm{EarthFormer} } \kappa \xrightarrow{ \mathrm{Omni\mbox{-}Weather} } \underbrace{ \left( \widehat x_1,\ldots,\widehat x_{12} \right) }_{12\ \mathrm{future\ frames}}.

但公开代码实际提供两条不同路径。

4.1 路径 A:Omni-Weather 自回归预测

inference_radar.py 直接读取 10 帧历史雷达,再连续生成未来 12 帧。已经生成的帧会被追加到上下文:

x^kpθ(x9:0,x^1:k1,p). \widehat x_k \sim p_{\theta} \left( x_{-9:0}, \widehat x_{1:k-1}, p \right).

这条路径符合“输入历史、输出未来”的任务语义,但没有使用 EarthFormer。

4.2 路径 B:EarthFormer 预测结果再精炼

radar_forcastor_dataset.pyradar_forcastor_single_dataset.pyinference_forcastor_radar.py 使用的是 EarthFormer 已经预测出的 12 帧未来图像,并让 Omni-Weather 生成对应的 12 帧真值:

(x~1EF,,x~12EF)EarthFormer predictionsOmni\mboxWeather(x^1,,x^12). \underbrace{ \left( \widetilde x_1^{\mathrm{EF}}, \ldots, \widetilde x_{12}^{\mathrm{EF}} \right) }_{\mathrm{EarthFormer\ predictions}} \xrightarrow{ \mathrm{Omni\mbox{-}Weather} } \left( \widehat x_1,\ldots,\widehat x_{12} \right).

这更像一个预测后处理或级联精炼器

x^1:12=Rθ(x~1:12EF), \widehat x_{1:12} = R_{\theta} \left( \widetilde x_{1:12}^{\mathrm{EF}} \right),

而不是论文所描述的“EarthFormer 将 10 帧历史编码成时序 token”。代码中的自然语言提示甚至明确把输入称为 EarthFormer 的 prediction。

这一区别非常重要:

  • 若性能来自路径 A,应证明 Omni-Weather 自身学会了时序动力学;
  • 若性能来自路径 B,结果同时依赖 EarthFormer 的先验预测,Omni-Weather 的作用主要是校正和增强;
  • 如果训练与评测混用了两条路径,必须分别报告,不能用一个“radar sequence encoder”概念合并。

现有论文和公开仓库不足以唯一确定主表结果究竟由哪条路径产生。


5. CoT 数据与所谓“因果推理”

5.1 数据构造

论文为两类生成任务各构建约 4,000 条 CoT:

  • 4,000 条临近预报解释;
  • 4,000 条卫星到雷达反演解释。

构造过程大致为:

  1. GPT-4o 提取可观测属性;
  2. GPT-o3 根据属性与图像序列生成结构化推理;
  3. 按结构完整性、因果对齐和术语规范进行质量控制。

临近预报解释覆盖以下属性:

属性组典型内容
初态形态、最大像素等级、初始位置
运动方向、速度、旋转
结构演化单体数量、合并、分裂、形态变化
强度演化增强、减弱、峰值变化
整体组织覆盖范围、组织程度

可以把一条解释抽象为:

r=(astate,amotion,astructure,aintensity,acoverage), r = \left( a_{\mathrm{state}}, a_{\mathrm{motion}}, a_{\mathrm{structure}}, a_{\mathrm{intensity}}, a_{\mathrm{coverage}} \right),

并训练

pθ(r,yx,p)=pθ(rx,p)pθ(yr,x,p) p_{\theta}(r,y\mid x,p) = p_{\theta}(r\mid x,p) p_{\theta}(y\mid r,x,p)

所代表的“先解释、再生成”过程。严格地说,上式右侧应为乘法分解:

pθ(r,yx,p)=pθ(rx,p)pθ(yr,x,p). p_{\theta}(r,y\mid x,p) = p_{\theta}(r\mid x,p) \cdot p_{\theta}(y\mid r,x,p).

5.2 代码中的 token 顺序

CoT 数据集的序列大致是:

text
全局提示 → 帧提示 → CoT 文本 → EarthFormer 预测图像 → 真实目标图像

因此 CoT 文本在 Transformer 序列中位于条件图像之前。对于 decoder-style 因果注意力,若没有额外的双向注意力掩码设计,CoT token 不能访问其后面的输入图像 token。更值得警惕的是,单帧 CoT 数据的全局提示称任务为“给定输出 VIL 图像的 backward causal reasoning”,这暗示解释可能由结果图像反推而来。

如果解释 rr 在数据生成阶段接触了真实未来 yy,训练时学习的可能是

pθ(ry) p_{\theta}(r\mid y)

式的事后叙述,而不是部署时真正需要的

pθ(rx). p_{\theta}(r\mid x).

这会形成 outcome leakage:解释看起来合理,却未必是预测过程中的可用中间推理。

5.3 “因果”一词的证据边界

论文中的 CoT 主要描述:

  • 回波从哪里移动到哪里;
  • 强度怎样变化;
  • 单体是否合并、分裂或旋转;
  • 这些变化如何对应输出图像。

这属于结构化的时序描述与物理启发解释。论文没有给出:

  • 明确的结构因果模型;
  • 干预变量;
  • 反事实目标;
  • 可识别性条件;
  • 对中间推理进行因果干预的实验。

因此,更稳妥的名称是“weather-aware structured rationale”或“过程解释”,而不是已经得到验证的因果推理。

5.4 提示模板自身有矛盾

附录提示一处要求模型根据 10 或 12 个 LABEL 帧生成分析,并且不要推测 INPUT;同一组附加规则又要求只考虑 INPUT 帧且不要提及 LABEL。这会让数据生成者对可见信息边界产生不同理解,也使 leakage 审计更困难。

5.5 CoT 消融并不能完全识别因果效应

论文的 CoT 表如下:

CoT 微调Thinking 推理CSI-MCRPSRadarScoreLPIPSGPT-4 分数
0.3470.0232.4230.182-
0.2370.0422.0320.2134.21
0.3350.0232.6570.1637.82

缺失的关键对照是:

CoT FT=No,Thinking=No. \mathrm{CoT\ FT}=\mathrm{No}, \qquad \mathrm{Thinking}=\mathrm{No}.

所以该表不能干净估计 CoT 微调的平均处理效应。已有结果只说明:

  • 同为 CoT 微调时,thinking 提升 RadarScore、LPIPS 和解释评分;
  • 但 CSI-M 从 0.347 降到 0.335;
  • 没有 CoT 微调时直接要求 thinking,所有生成指标明显更差。

这支持“显式推理带来感知质量与阈值命中之间的权衡”,但不支持“CoT 对所有目标一致有益”。


6. 数据、任务划分与可复现性

6.1 SEVIR

SEVIR 包含 2017 至 2020 年超过 20,000 个风暴事件。每个事件约 4 小时、5 分钟一帧,覆盖 VIL 雷达和多种卫星通道。论文把原始数据归一化到 [0,255][0,255],并称统一缩放为 256×256256\times256

临近预报输入输出可写为:

xin=(x9,,x0),yout=(x1,,x12). x_{\mathrm{in}} = \left( x_{-9},\ldots,x_0 \right), \qquad y_{\mathrm{out}} = \left( x_1,\ldots,x_{12} \right).

反演任务为:

x^VIL=Fθ(xIR069,xIR107,p). \widehat x^{\mathrm{VIL}} = F_{\theta} \left( x^{\mathrm{IR069}}, x^{\mathrm{IR107}}, p \right).

只用两个红外通道意味着模型学习的是特定数据集上的条件映射,而不是从完整卫星观测恢复雷达。

6.2 RadarQA

理解任务使用 RQA-70K,覆盖:

  • 单帧属性;
  • 序列动态;
  • 累积强度;
  • 高价值天气判断;
  • 自由文本解释。

公开配置中四个理解子集的样本数为:

20,000+14,500+20,000+14,500=69,000. 20{,}000 {}+{} 14{,}500 {}+{} 20{,}000 {}+{} 14{,}500 = 69{,}000.

这与 RQA-70K 的命名大体相符。

6.3 数据计数不一致

论文称联合训练加入 20,000 条通用图文样本。代码中的 MetaQuery 注册数量为 10,000。雷达临近预报注册数量也在不同配置间出现 40,000 与 45,000 两种数值。若采样器按声明长度分配任务概率,这些差异会直接改变有效任务权重:

πt=NtjNj. \pi_t = \frac{N_t} {\sum_j N_j}.

论文没有给出最终 manifest、样本 ID、随机种子和混合采样概率,因此无法从公开材料精确重建训练分布。

6.4 划分方式

卫星反演代码按事件列表顺序取前 11,487 个事件训练,并从索引 11,488 开始测试,中间还跳过一个索引。由于没有随仓库提供生成 split 的脚本或明确事件清单,以下问题无法排除:

  • 列表顺序是否稳定;
  • 训练测试是否按时间隔离;
  • 同一风暴系统的相邻事件是否跨 split;
  • 被跳过样本是否只是边界错误。

对时空数据来说,随机或顺序划分通常不如按年份、区域和风暴事件隔离更能检验泛化。


7. 实验结果:优势是综合质量,不是全面领先

7.1 指标定义

Critical Success Index 为

CSI=TPTP+FN+FP. \mathrm{CSI} = \frac{\mathrm{TP}} {\mathrm{TP}+\mathrm{FN}+\mathrm{FP}}.

附录列出的 VIL 阈值为 16、74、133、160、181 和 219,主表只展示其中 16、74、160、181 和 219。CSI-M 是若干阈值结果的平均。它忽略 true negative,适合稀疏强回波,但会受到阈值选择影响。

SSIM 的标准形式为

SSIM(x,y)=(2μxμy+C1)(2σxy+C2)(μx2+μy2+C1)(σx2+σy2+C2). \mathrm{SSIM}(x,y) = \frac{ (2\mu_x\mu_y+C_1) (2\sigma_{xy}+C_2) }{ (\mu_x^2+\mu_y^2+C_1) (\sigma_x^2+\sigma_y^2+C_2) }.

CRPS 衡量概率预报分布 FF 与观测 yy

CRPS(F,y)=[F(z)1{zy}]2dz. \mathrm{CRPS}(F,y) = \int_{-\infty}^{\infty} \left[ F(z)-\mathbf{1}\{z\geq y\} \right]^2 \mathrm{d}z.

CRPS 越低越好;CSI、SSIM 和 RadarScore 越高越好;LPIPS 越低越好。OpenReview rebuttal 称 CRPS 使用 5 个 ensemble members,但这一关键设置没有进入当前 arXiv v3 正文。

7.2 雷达临近预报

模型CSI-M ↑RadarScore ↑CSI-P4 ↑CSI-P16 ↑CRPS ↓SSIM ↑LPIPS ↓
EarthFormer0.3891.920.4010.3870.0370.7290.322
DiffCast0.3752.430.4070.5110.0330.7390.235
CasCast0.3842.720.4140.5180.0310.7460.207
Omni-Weather0.3842.690.4270.5390.0260.7460.179
Omni-Weather-Thinking0.3532.860.4210.5420.0280.7510.166

原表还报告了 CSI-4,表头中的部分阈值命名与正文阈值清单不完全一致。最稳妥的解读是:

  • Omni-Weather 的 CSI-M 没有超过 EarthFormer;
  • 非 thinking 版本在 CRPS 上最好;
  • thinking 版本在 RadarScore、SSIM、LPIPS 和 CSI-P16 上更好;
  • thinking 使 CSI-M 从 0.384 降为 0.353。

因此它更像是改善结构、感知和强回波表达,同时牺牲平均阈值命中率,而不是对专用 nowcasting 模型的全面支配。

7.3 卫星到雷达反演

模型RadarScore ↑RMSE ↓CSI-16 ↑CSI-74 ↑CSI-160 ↑CSI-181 ↑CSI-219 ↑
UNet1.750.8210.2220.3700.1800.1530.079
ViT2.010.4450.6020.4360.1800.1310.042
WeatherGFM2.280.4360.6190.4470.2080.1570.053
Omni-Weather2.420.5140.6220.4690.2630.2210.118
Omni-Weather-Thinking2.510.5070.6210.4730.2770.2300.129

Omni-Weather 在强回波 CSI 和 RadarScore 上明显占优,但 RMSE 比 WeatherGFM 与 ViT 更差。这个组合意味着模型可能更愿意生成锐利、强烈、结构化的雷达回波,同时在逐像素平均误差上付出代价。

如果论文声称“反演指标全部最佳”,RMSE 就是直接反例。更准确的结论是:

event/structure metrics improvewhilepixel RMSE degrades. \mathrm{event/structure\ metrics\ improve} \quad\mathrm{while}\quad \mathrm{pixel\ RMSE\ degrades}.

7.4 序列理解

模型Overall ↑Dynamic ↑ROUGE-L ↑BERTScore ↑GPT-4 ↑
Claude20.79----
Gemini27.59----
GPT-549.50----
RadarQA66.1753.310.4360.8156.87
Omni-Weather61.7964.050.4460.8107.48

Omni-Weather 的动态属性、ROUGE-L 和 GPT-4 评分更好,但 Overall 比 RadarQA 低 4.38 个百分点:

61.7966.17=4.38. 61.79-66.17=-4.38.

正文中“序列理解 overall 提升约 5%”的表述与主表不符。它也并非普遍超过闭源模型的 30% 水平,因为 GPT-5 达到 49.50。

7.5 单帧理解

模型Overall ↑ROUGE-L ↑BERTScore ↑GPT-4 ↑
RadarQA61.510.5120.8096.58
Omni-Weather64.300.5430.7606.03

Omni-Weather 在总体属性准确率和 ROUGE-L 上占优,但 BERTScore 与 GPT-4 评分落后。单帧理解是论文中相对更明确的理解增益,仍然不是所有指标全面领先。

7.6 联合训练消融

训练方式Accuracy(论文成对报告)GPT-4(论文成对报告)
仅理解81.95 / 54.345.78 / 6.03
联合训练86.65 / 59.587.48 / 6.03
训练方式CSI-M(论文成对报告)RMSE(论文成对报告)
仅生成0.303 / 0.3230.590 / 19.01
联合训练0.338 / 0.3470.514 / 17.11

方向上,所有列都支持联合训练有益。但表注称数值按 Frame / Sequence 排列,主表的 GPT-4 数值却暗示 GPT-4 列可能采用 Sequence / Frame 顺序;生成列也没有逐一标明哪个数属于反演或预报。本文因此保留原始成对形式,不擅自消解歧义。论文只在每项任务随机抽取 200 个验证样本,也没有报告:

  • 多随机种子;
  • 标准差或置信区间;
  • 配对显著性检验;
  • 是否严格匹配总更新步数与单任务见样本数;
  • 表中两组并列数字与具体子任务的清晰映射。

所以该消融证明的是“在当前一次设置下观察到一致增益”,还不能建立稳定的跨任务协同规律。

7.7 序列编码器消融

编码器CSI-M ↑CSI-4 ↑CSI-16 ↑SSIM ↑PSNR ↑
VAE encoder0.23580.29120.43560.752821.42
Radar sequence encoder0.34710.40030.53900.762123.22

结果支持天气专用时序先验,但不是纯粹的 encoder architecture 对照。若所谓 radar sequence encoder 输入的是 EarthFormer 预测未来帧,它同时引入了一个强预测器的输出,提升不能全部归因于 token 编码方式。

7.8 CFG 消融

CFG scaleCSI-M ↑CSI-4 ↑CSI-16 ↑SSIM ↑PSNR ↑
10.18240.22080.33050.512317.33
20.25010.29940.42610.686619.67

CFG 明显改善条件一致性,但论文没有报告更大 scale 的曲线,也没有展示 guidance 过强时是否会损害校准、多样性或极端值可靠性。

7.9 通用图文数据混合

附录给出不同天气数据比例的结果:

生成任务数天气数据占比CSI-MCSI-4CSI-16SSIMPSNR
170%0.25010.29940.42610.686619.67
130%0.13860.17260.28590.618716.66
150%0.24780.29560.41740.682319.15
270%0.10910.13450.22740.601316.64

这张表没有清晰的 weather-only 基线,也混合改变了任务数量与采样比例。因此它不足以单独证明“通用图文数据必然提高天气泛化”,最多说明混合比例非常敏感。


8. 论文叙事逐节检查

章节它承担的叙事任务完成度
引言把生成与理解的割裂塑造成统一气象智能问题强;问题动机清楚
相关工作连接天气生成、雷达理解、统一多模态模型中;天气专用基础模型与关键基线覆盖不足
方法给出任务统一接口、共享主干和 CoT 数据中;核心生成目标和 EarthFormer 路径描述不充分
实验证明四任务可用、联合训练增益、thinking 有效中上;指标丰富,但统计与关键对照不足
结论把系统定位为天气雷达通才模型的起点合理,但泛化范围仍局限于 SEVIR/VIL

标题从早期更宽泛的 “Weather Foundation Model” 收敛为最终的 “Weather Radar Understanding and Generation”,是正确的范围校准。即便如此,“foundation”式叙事仍应受到以下边界约束:

one dataset+one core radar variable+limited task familyvalidated general weather foundation model. \mathrm{one\ dataset} {}+{} \mathrm{one\ core\ radar\ variable} {}+{} \mathrm{limited\ task\ family} \neq \mathrm{validated\ general\ weather\ foundation\ model}.

9. 主张—证据审计

论文主张直接证据判断
一个模型统一生成与理解同一 Bagel 主干覆盖四项任务基本成立,但存在专用编码器与不同输出头
联合训练带来双向增益Table 2 中生成和理解均提升有初步支持,缺少多种子、置信区间和严格预算对照
生成达到 SOTACRPS、感知指标、强阈值 CSI 很强表述过强;CSI-M 或 RMSE 并非都最佳
理解达到 SOTA单图 Overall、序列 Dynamic 和生成式评分较好混合;序列 Overall 明显低于 RadarQA
CoT 提升预测与解释thinking 改善 RadarScore、LPIPS、GPT 分数部分成立;CSI-M 下降且缺失完整二乘二对照
CoT 是因果推理属性化推理文本与定性例子不足;没有因果识别、干预或 faithfulness 验证
EarthFormer 作为序列编码器编码器消融提升代码更像预测结果精炼,任务定义尚不透明
端到端训练论文文字描述不准确;VAE 冻结,代码中的 EarthFormer 也不在联合梯度图中
对现实天气有广泛泛化SEVIR 上四任务结果不足;未证明跨区域、跨传感器、跨年份和极端事件泛化

10. OpenReview 评审与作者答辩

论文最终被 ICLR 2026 接收为 Poster。公开评审最初给出 8、6、6、4,一位 reviewer 在 rebuttal 后从 4 提升到 6。Area Chair 认为主要疑问得到足够回应。

Official Review初始分数Rebuttal 后Soundness / Presentation / Contribution主要意见
naQj883 / 3 / 3认可统一框架和强结果;要求专家验证、跨 SEVIR 泛化,并质疑通用域 VAE 是否适合气象场
dM4g462 / 2 / 3认为 foundation model 主张过宽,数据计数、token 融合和 CoT 质控不透明;答辩后上调
rnQS662 / 3 / 2追问 encoder/decoder、λt\lambda_t、CRPS ensemble、CFG、复杂度与反演 RMSE
3h1v663 / 3 / 3认可方向,但担心单一 VIL/SEVIR 范围以及 LLM 生成 CoT 缺少专家 faithfulness 验证

共读取到 4 条 Official Review,以及对应的作者答辩、reviewer follow-up、Meta Review 和 Decision;下文不是只依据摘要页或首屏内容做出的判断。

10.1 评审共识

四位评审反复提到的优点是:

  • 把生成和理解放入一个统一模型具有新颖性;
  • 实验任务多,展示了较强的系统整合能力;
  • 强回波结构、感知指标和自然语言解释有竞争力;
  • 论文方向可能推动可解释的天气预测。

反复出现的问题是:

  1. 范围过宽:单一 SEVIR/VIL 设置不足以证明广义天气基础模型;
  2. 架构描述不足:编码器、decoder、token 融合、冻结策略不清楚;
  3. 方程含糊λt\lambda_t、文本长度归一化、CRPS ensemble 数、CFG 均缺少说明;
  4. CoT 可靠性:LLM 生成解释缺少充分的气象专家验证;
  5. 基线与引用不足:评审要求讨论 DGMR、Aquilon、CLLMate 等相关工作;
  6. 计算成本缺失:没有参数量拆分、FLOPs、延迟和显存比较;
  7. 指标叙事选择性:反演 RMSE 和序列 Overall 并不支持全面 SOTA。

10.2 Rebuttal 新增了什么

作者在答辩中补充:

  • 专家对约 30 个解释进行评估,专家解释与 GPT 解释的总体分数约为 8.5 与 7.7;
  • 从约 5,500 个候选样本中保留约 4,000 个,通过率约 70%;
  • CRPS 使用 5 个 ensemble members;
  • 各任务权重 λt=1\lambda_t=1
  • 编码器与 VAE 冻结;
  • 增加 ERA5 2 米温度的初步跨模态实验;
  • 补充 DGMR 等相关基线。

这些回应解释了部分疑问,也促成评分上调。但截至 arXiv v3 和当前公开仓库,若干细节仍只存在于 rebuttal,没有形成正文中的完整、可执行复现说明。尤其是专家评估样本、评分协议、ERA5 设置与结果并未作为可审计材料发布。

10.3 接收不等于问题已经消失

从会议决策角度,Omni-Weather 的新颖性和方向价值足以支持接收。从科学记录角度,以下问题仍应保留:

  • 解释是否 faithful,而不仅是 plausible;
  • EarthFormer 到底是 encoder 还是上游 forecaster;
  • 论文主表来自哪一个数据与推理路径;
  • 训练超参数与公开脚本为何明显不同;
  • 统一模型的增益是否在跨区域、跨传感器条件下成立。

11. 公开代码审计

本节针对仓库提交 07ab4848de677e444841062000d7032fdd0178b9 进行静态核查。

11.1 训练设置对照

项目论文默认公开脚本影响
GPU8 × H200脚本可配置资源要求极高
训练步数20,000未显式设置,代码默认 500,000默认命令不对应论文训练
学习率2×1042\times10^{-4}2×1052\times10^{-5}相差 10 倍
weight decay0.05optimizer 硬编码为 0正则化不同
schedulercosine默认 constant优化轨迹不同
warmup2,0002,000一致
生成分辨率256×256256\times256生成配置相符大体一致
理解分辨率声称统一 256允许 378 至 980不一致
任务权重λt\lambda_t 未在正文明确CE 与 MSE 默认均为 1rebuttal 才说明
VAE方法看似端到端冻结不是全模型端到端

11.2 没有一条默认命令复现四任务联合训练

公开配置分开存在:

  • sat2rad_radarqa.yaml:卫星反演与理解;
  • radar_nowcast:临近预报;
  • cot_nowcast:CoT 临近预报;
  • radar_forcastor:EarthFormer 预测精炼。

默认 finetune.sh 指向 sat2rad_radarqa.yaml,没有同时包含临近预报和 CoT。也就是说,仓库提供了任务组件,但没有提供论文声称的完整四任务联合 recipe:

Djoint=DnowcastDinversionDimageQADsequenceQADCoT. \mathcal{D}_{\mathrm{joint}} = \mathcal{D}_{\mathrm{nowcast}} \cup \mathcal{D}_{\mathrm{inversion}} \cup \mathcal{D}_{\mathrm{imageQA}} \cup \mathcal{D}_{\mathrm{sequenceQA}} \cup \mathcal{D}_{\mathrm{CoT}}.

11.3 路径与环境

若干脚本硬编码 /mnt/shared-storage-user/... 数据路径。依赖文件较完整、许可证为 Apache-2.0、模型权重已公开,这些是积极因素;但仓库没有:

  • 自动下载与构造 SEVIR/RadarQA 的统一脚本;
  • 最终训练 manifest;
  • 自动化测试;
  • CI;
  • 主表的一键评测入口;
  • 论文 checkpoint 与每个表格行的精确映射。

因此当前可复现等级更接近“可阅读和二次开发的研究代码”,不是“从数据到主表的一键复现包”。

11.4 论文式、代码式与系统语义的三层错位

可以把主要错位归纳为:

paper objective:pixel MSE+text CE,code objective:latent velocity MSE+text CE,paper nowcasting path:historyEarthFormer tokensfuture,dataset code path:EarthFormer future predictionsrefined future. \begin{aligned} \mathrm{paper\ objective} &: \mathrm{pixel\ MSE} {}+{} \mathrm{text\ CE}, \\ \mathrm{code\ objective} &: \mathrm{latent\ velocity\ MSE} {}+{} \mathrm{text\ CE}, \\ \mathrm{paper\ nowcasting\ path} &: \mathrm{history} \to \mathrm{EarthFormer\ tokens} \to \mathrm{future}, \\ \mathrm{dataset\ code\ path} &: \mathrm{EarthFormer\ future\ predictions} \to \mathrm{refined\ future}. \end{aligned}

这不是文字润色层面的小误差,而是会改变模型类别、条件信息和对性能来源解释的核心问题。


12. 方法学优点

12.1 问题设定有价值

生成与理解联合起来是合理方向。真实预报系统不仅需要输出场,还需要:

  • 解释关键回波结构;
  • 暴露不确定性与演变依据;
  • 支持人机问答;
  • 让语义先验约束视觉生成。

Omni-Weather 至少把这几个目标放进了同一个可训练系统。

12.2 指标覆盖比单一 MSE 更合理

雷达场预测中,像素 RMSE 往往偏爱模糊平均。论文同时报告:

{CSI,CRPS,SSIM,LPIPS,RadarScore}, \left\{ \mathrm{CSI}, \mathrm{CRPS}, \mathrm{SSIM}, \mathrm{LPIPS}, \mathrm{RadarScore} \right\},

可以看到 thinking 模式在事件命中、结构感知和平均误差之间的权衡。这比只展示一项最有利指标更有信息量。

12.3 联合训练结果方向一致

虽然统计证据不足,Table 2 的生成与理解列都朝正向移动,至少说明共享主干没有出现明显的灾难性负迁移。

12.4 把天气属性显式写进解释

CoT taxonomy 关注移动、旋转、合并、分裂、增强和衰减,比通用“看图说话”更贴近雷达分析。即使“因果”尚未成立,这套属性结构本身也可作为可复用监督信号。


13. 主要问题

13.1 方法定义没有闭环

最重要的损失、采样和条件路径需要从代码逆向恢复。论文的数学对象没有区分:

  • 像素 yy
  • VAE latent z0z_0
  • 噪声 ε\varepsilon
  • flow time tt
  • 任务索引 tt

同一个 tt 同时容易被理解为任务索引和 flow 时间。建议使用任务索引 qq 与连续时间 τ\tau

qT,τ[0,1]. q\in\mathcal{T}, \qquad \tau\in[0,1].

13.2 “端到端”表述不准确

若 VAE 和视觉编码器冻结,EarthFormer 也不接收下游梯度,则可训练路径是:

θtrain{θall components}. \theta_{\mathrm{train}} \subsetneq \left\{ \theta_{\mathrm{all\ components}} \right\}.

这仍可称联合优化共享主干,但不能不加限定地称所有模块端到端训练。

13.3 CoT 缺少 faithfulness 实验

高 GPT-4 分数只能说明解释像正确答案。要证明解释确实参与生成,应做干预:

  1. 固定输入,交换两条 CoT;
  2. 删除方向、速度或强度字段;
  3. 对 CoT 加入相反事实;
  4. 测量输出移动方向、强回波面积和 CSI 的响应。

例如令 rr 为正确 rationale,r~\widetilde r 为反事实 rationale,定义:

Δmotion=d(y^(x,r),y)d(y^(x,r~),y). \Delta_{\mathrm{motion}} = d \left( \widehat y(x,r), y \right) {}-{} d \left( \widehat y(x,\widetilde r), y \right).

若 CoT faithful,系统性反事实应产生方向一致、可解释的性能变化,而不是几乎不影响输出。

13.4 缺少统计不确定性

对 200 个样本,报告均值而不报告置信区间很难判断小差异。例如可对配对样本 bootstrap:

Δ^(b)=1ni=1n[miA,(b)miB,(b)], \widehat\Delta^{(b)} = \frac{1}{n} \sum_{i=1}^{n} \left[ m_i^{A,(b)} {}-{} m_i^{B,(b)} \right],

再给出 2.5% 与 97.5% 分位数。对 CSI 还应按风暴事件而非帧独立重采样,以避免时序相关性导致置信区间过窄。

13.5 生成模型的概率校准没有充分展开

既然模型是随机 flow generator,就应报告:

  • 不同 ensemble size 下 CRPS 收敛;
  • reliability diagram;
  • 强回波 exceedance probability;
  • rank histogram;
  • 多样性与准确率的权衡;
  • 极端事件的 tail calibration。

仅用 5 个样本估计分布指标可能有较大 Monte Carlo 误差。

13.6 泛化范围有限

所有核心结果围绕 SEVIR。没有证明:

SEVIR{MRMS,NEXRAD,FY,Himawari,ERA5} \mathrm{SEVIR} \to \left\{ \mathrm{MRMS}, \mathrm{NEXRAD}, \mathrm{FY}, \mathrm{Himawari}, \mathrm{ERA5} \right\}

的跨区域、跨传感器或跨变量迁移。rebuttal 中的 ERA5 初步实验是好信号,但不足以支撑广泛天气基础模型结论。


14. 次要但应修复的问题

  1. 统一术语:nowcast、forecast、forcastor 在代码中混用;
  2. 明确每个 CSI 列对应的阈值,避免正文与表头不一致;
  3. 解释 Table 2 中成对数字的任务顺序和单位;
  4. 给出每个任务的训练样本数、采样概率和重复次数;
  5. 把 rebuttal 中的 λt=1\lambda_t=1、5-member CRPS、冻结策略写入正文;
  6. 报告总参数、可训练参数、FLOPs、H200 训练时长和单样本推理延迟;
  7. 提供所有评测 prompt、GPT judge 版本、温度与重试策略;
  8. 把 30 个专家评测样本、匿名评分和分歧统计公开;
  9. 修复附录 CoT prompt 对 INPUTLABEL 的冲突约束;
  10. 发布每张表对应的 checkpoint、配置文件和命令。

15. 如何把这项工作做得更扎实

15.1 建立真正可执行的统一任务规范

为每个任务定义:

Sq=(Dq,Eq,Cq,Hq,Lq,Mq), \mathcal{S}_q = \left( \mathcal{D}_q, E_q, C_q, H_q, \mathcal{L}_q, M_q \right),

其中分别表示数据、编码器、条件、输出头、损失和指标。把最终四任务配置写成唯一 manifest,并固定随机种子与数据 ID。

15.2 分开比较三种临近预报系统

必须显式报告:

  1. EarthFormer;
  2. Omni-Weather 直接预报;
  3. EarthFormer + Omni-Weather 精炼。

令性能为 M()M(\cdot),精炼器的增益才可定义为:

Δrefine=M(EarthFormer+Omni\mboxWeather)M(EarthFormer). \Delta_{\mathrm{refine}} = M \left( \mathrm{EarthFormer} {}+{} \mathrm{Omni\mbox{-}Weather} \right) {}-{} M \left( \mathrm{EarthFormer} \right).

Omni-Weather 自身的预报能力则要与相同输入历史、相同评测预算的专用模型比较。

15.3 做完整的二乘二 CoT 实验

非 thinking 推理thinking 推理
无 CoT 微调必须补充已有
有 CoT 微调已有已有

这样才能估计:

ATECoT FT,ATEThinking,Interaction. \mathrm{ATE}_{\mathrm{CoT\ FT}}, \qquad \mathrm{ATE}_{\mathrm{Thinking}}, \qquad \mathrm{Interaction}.

15.4 做跨域与时间外评测

至少应增加:

  • 2017--2019 训练、2020 测试;
  • 跨区域或跨雷达站;
  • 不同强度分位数;
  • 不同季节;
  • 独立数据集零样本与少样本适配。

15.5 对联合训练做梯度层面的分析

对任务 i,ji,j 的共享参数梯度定义余弦相似度:

ρij=θLiθLjθLi2θLj2. \rho_{ij} = \frac{ \nabla_{\theta}\mathcal{L}_i \cdot \nabla_{\theta}\mathcal{L}_j }{ \left\lVert \nabla_{\theta}\mathcal{L}_i \right\rVert_2 \left\lVert \nabla_{\theta}\mathcal{L}_j \right\rVert_2 }.

ρij>0\rho_{ij}>0,可作为任务协同的机制证据;若长期为负,则应使用 PCGrad、动态权重或更明确的专家路由。


16. 可复用的研究启发

16.1 预测与解释应是联合对象

未来模型可直接建模:

p(y,r,ux), p(y,r,u\mid x),

其中 yy 是预测场,rr 是过程解释,uu 是不确定性说明。这样解释不只是附加文本,而是与生成、概率校准共同训练的输出。

16.2 专用预报器可作为多模态模型的 proposal generator

EarthFormer 不一定只能当 encoder。更自然的系统分工是:

dynamics modelproposalmultimodal verifier/refiner. \mathrm{dynamics\ model} \to \mathrm{proposal} \to \mathrm{multimodal\ verifier/refiner}.

专用模型负责稳定动力学,通用模型负责语义约束、质量修复和解释。Omni-Weather 的代码事实上已经接近这一方向,只是论文没有把它清楚定义出来。

16.3 用可干预的结构变量替代自由文本 CoT

可以把 rationale 改成显式状态:

r=(Δx,Δy,ΔI,ΔA,ncell,ω), r = \left( \Delta x, \Delta y, \Delta I, \Delta A, n_{\mathrm{cell}}, \omega \right),

分别表示位移、强度变化、面积变化、单体数量和旋转。结构变量更容易:

  • 用算法或专家验证;
  • 做反事实干预;
  • 与输出场建立可测的对应;
  • 避免语言风格成为主要评价对象。

16.4 统一不应只看任务数量

更有说服力的统一模型需要证明:

parameter sharingsample efficiencytransfercompositionality. \mathrm{parameter\ sharing} \Rightarrow \mathrm{sample\ efficiency} \lor \mathrm{transfer} \lor \mathrm{compositionality}.

仅仅让一个模型在四个数据加载器上训练,并不自动说明它学到了统一的天气表征。


17. 直接竞品与领域定位

工作主要角色相对 Omni-Weather 的位置
EarthFormer时空预测 Transformer更纯粹的雷达序列动力学基线;Omni-Weather 还把它作为先验或上游预测器
DGMR概率雷达临近预报代表成熟的专用生成路线;论文应更完整比较概率质量与计算成本
DiffCast / CasCast扩散式或级联式临近预报在像素、结构与感知指标上与 Omni-Weather 形成直接竞争
WeatherGFM跨模态天气场生成是卫星到雷达反演的直接比较对象;Omni-Weather 强在高阈值 CSI,弱在 RMSE
RadarQA雷达图像与序列理解是理解任务最直接的领域模型;Omni-Weather 的序列 Overall 尚未超过它
Bagel-7B-MoT通用多模态理解与生成基座提供统一 token 空间和生成能力,Omni-Weather 的增量主要是天气任务化、数据与训练接口
Aquilon / CLLMate评审指出的同期气象多模态工作应在修订中明确任务覆盖、数据范围、生成能力和计算成本差异

从贡献类型看,Omni-Weather 主要是概念与系统整合创新,其次是数据构造和经验发现;它没有提出新的 Transformer 算子、flow matching 理论或可证明的因果学习方法。

Innovation Score:7 / 10。 统一问题设定有价值,四任务系统也具有明显工程新意;但核心网络、生成范式和时序先验均来自现有组件,方法增量尚未上升为新的通用建模原理。

18. 科学品味评分

维度评分理由
新颖性3.5 / 5生成与理解统一到天气雷达模型中有新意,但基础组件多来自已有模型
技术严谨性2.5 / 5结果丰富,核心损失、路径、冻结与复现设置却不够一致
实证充分性3.0 / 5四任务、多指标和多项消融是优点;缺少统计、完整对照和跨域测试
可解释性证据2.5 / 5解释质量较好,但 faithfulness 与因果性没有被验证
潜在影响3.5 / 5共享气象生成与理解是值得继续推进的系统方向
可复现性2.0 / 5代码和权重公开,但默认脚本、数据路径和论文设置不能闭环

19. 最终评价

如果以审稿时的标准评价,我会给出 Weak Accept / Major Revision 边界

  • 支持接收的原因是问题重要、系统新颖、结果覆盖广,且统一生成与理解确实展示出研究潜力;
  • 要求大修的原因是方法数学描述与实现不一致,临近预报的信息流不透明,CoT 的因果与 faithful 属性没有得到验证,复现 recipe 也不完整。

论文最可信的结论是:

一个共享多模态主干可以同时承担天气雷达生成和理解,并在若干结构、感知与语言指标上优于专用基线;联合训练可能带来正迁移。

论文目前不能充分支持的更强结论是:

该模型已经成为跨天气模态的通用基础模型,所有生成与理解任务都达到 SOTA,并通过因果 CoT 获得了可验证的机制解释。

从研究方向看,Omni-Weather 很可能比它当前的形式更重要:它把“预报场、自然语言解释和多模态条件”放在了同一张设计图上。下一步的关键不是再加更多任务名称,而是把数据因果边界、概率生成目标、专用动力学模型的角色,以及联合训练增益的机制真正做清楚。


参考与核查范围

本文对 arXiv v3 的正文、附录、公开 OpenReview 讨论和官方代码进行了交叉检查。代码审计是静态审计;由于 SEVIR/RadarQA 数据、7B 模型权重和 8 × H200 训练资源不随仓库提供,未重新训练模型或复算主表数值。


Code Verification

核查对象为官方仓库提交 07ab4848de677e444841062000d7032fdd0178b9,核查日期为 2026-07-31。

Claim论文描述代码实现状态
统一生成与理解一个 Bagel-7B-MoT 共享主干CE 与 flow matching 两类 token 在共享主干中训练部分验证
生成损失图像或帧空间 MSEVAE latent 上的 velocity MSE不一致
临近预报条件10 帧经 EarthFormer 编成时间 token一条路径完全不使用 EarthFormer;另一条读取 EarthFormer 的 12 帧未来预测不一致
四任务联合训练所有天气任务共同 SFT没有单一公开配置包含四任务与 CoT无法复现
端到端训练模型端到端训练 20k stepsVAE 冻结,级联 EarthFormer 不在下游梯度图中表述过强
优化超参数lr 2×1042\times10^{-4}、weight decay 0.05、cosine、20k默认脚本 lr 2×1052\times10^{-5}、weight decay 0、constant、默认 500k不一致
输入分辨率所有图像不超过 256×256256\times256理解配置允许 378 到 980不一致
通用数据规模MetaQuery 20kregistry 声明 10k不一致
权重与许可模型和代码公开Hugging Face 权重与 Apache-2.0 仓库可访问验证

执行的静态检查:

  1. 遍历并阅读训练入口、模型损失、数据注册、四类数据集和推理脚本;
  2. 对仓库 Python 文件执行 compileall,语法编译通过;
  3. 对论文表格、附录消融和代码默认值逐项人工比对;
  4. 未执行依赖安装、数据下载、7B 模型推理或 8 × H200 训练,因此不把静态通过等同于数值复现。

综合判断:

code availability=good,paper\mboxcode consistency=limited,end\mboxto\mboxend reproducibility=insufficient. \mathrm{code\ availability} = \mathrm{good}, \qquad \mathrm{paper\mbox{-}code\ consistency} = \mathrm{limited}, \qquad \mathrm{end\mbox{-}to\mbox{-}end\ reproducibility} = \mathrm{insufficient}.

Static research notes built with VitePress and KaTeX.