Theme
Omni-Weather:统一天气雷达生成、理解与推理
一句话结论
Omni-Weather 的真正贡献不是在每一项指标上击败专用模型,而是证明:以 Bagel-7B-MoT 为共享 Transformer 主干,将天气雷达临近预报、卫星反演、单帧理解和序列理解放进同一套多模态接口,能够获得有竞争力的综合表现,并出现一定的联合训练增益。
但论文最强的三个叙事——“端到端统一”“因果 CoT”“生成与理解均达到 SOTA”——都比现有证据更强。公开代码还暴露出方法方程与实际 latent flow matching 目标不一致、EarthFormer 的使用方式与论文图示不一致、默认训练脚本无法复现论文联合四任务设置等问题。因此,这是一篇方向感和系统整合很强、但方法刻画与复现闭环明显不足的工作。
1. 论文要解决什么问题
天气雷达研究长期分成两条相对独立的路线:
- 生成类任务:根据历史雷达序列预测未来雷达,或从卫星通道反演雷达;
- 理解类任务:识别回波位置、强度、形态和运动趋势,并生成自然语言解释或离散评分。
专用模型通常只优化一个任务。论文认为,这种分割带来两个问题:
- 生成模型能画出未来雷达,却不能用语言解释其运动与演化;
- 理解模型能描述雷达,却无法把语义知识反馈给像素级预测。
Omni-Weather 因而提出一个统一条件映射:
其中:
是任务索引; 是任务提示; 是输入模态; 是文本或图像目标; 是共享的多模态模型。
论文覆盖四个任务:
| 任务 | 输入 | 输出 | 任务性质 |
|---|---|---|---|
| 雷达临近预报 | 过去 10 帧 VIL 雷达 | 未来 12 帧 VIL 雷达 | 图像序列生成 |
| 雷达反演 | IR069 与 IR107 卫星通道 | 同时刻 VIL 雷达 | 条件图像生成 |
| 雷达图像理解 | 单帧 VIL 雷达与问题 | 文本回答或属性评分 | 单图理解 |
| 雷达序列理解 | 连续 VIL 雷达与问题 | 文本回答或属性评分 | 时序理解 |
SEVIR 的时间分辨率为 5 分钟,因此 10 帧历史对应 50 分钟,12 帧预测对应未来 1 小时。
1.1 四任务的统一形式
令任务
输入模态 token 为
可选的时间条件为
论文将输入写成 token 拼接:
若某项任务没有时间条件,则
之后按输出类型路由:
2. 模型结构:统一在哪里,又没有统一到哪里
2.1 基座与三类视觉入口
Omni-Weather 从 Bagel-7B-MoT 初始化。其核心是一个共享 Transformer,以及与任务类型相匹配的视觉编码器:
- 理解编码器:把雷达图像变成适合语言理解的视觉 token;
- 生成编码器:把卫星图像或条件图像变成生成条件;
- 雷达序列编码器:论文声称用 EarthFormer 提取历史雷达的时空条件;
- VAE:把生成目标压缩到 latent 空间,并在推理后把 latent 解码成图像。
因此更准确的结构描述是:
text
文本提示 ─────────────────┐
理解图像 → 理解编码器 ────┤
生成条件 → 生成编码器 ────┼→ 共享 Transformer → 文本 LM 头
雷达序列 → EarthFormer ───┤ → flow 生成头 → VAE 解码
噪声 latent ───────────────┘这个设计的优点是共享高层语义与推理容量,代价是“统一模型”仍然依赖多套专用前端和两个不同输出机制。它更接近共享中枢的多任务系统,而不是单一编码器、单一解码器的完全同构模型。
2.2 视觉 token 数
论文称所有图像统一缩放到
VAE 将空间尺寸缩小约 8 倍:
latent patch size 为 2:
不过,公开联合训练配置允许理解图像边长在 378 到 980 之间,并非严格固定为 256。论文的统一输入分辨率描述至少没有完整覆盖当前代码路径。
2.3 混合专家并不等于任务完全隔离
Bagel-7B-MoT 的 MoT 可以让不同 token 类型经过不同前馈专家,但共享注意力仍允许文本、理解视觉 token 和生成 latent token 相互条件化。其潜在价值是:
而不同专家可以降低生成目标与语言目标之间的梯度冲突:
论文没有报告路由利用率、专家负载、梯度相似度或表示探针,因此“为什么联合训练有效”目前主要由结果间接支持,还不是机制层面的解释。
3. 训练目标:论文方程与代码实现并不相同
这是全文最需要仔细区分的数学问题。
3.1 论文给出的目标
论文将生成任务写成输出与目标之间的均方误差,将理解任务写成自回归交叉熵:
其中:
是生成目标的像素或帧索引集合; 是文本目标长度; 是任务权重。
按字面理解,第一项是像素或帧空间重建误差。然而公开实现并没有直接用
训练图像输出,而是采用 latent flow matching。
3.2 代码实际执行的 latent flow matching
令 VAE 编码后的干净目标 latent 为
高斯噪声为
代码先采样一个 logit-normal 时间变量:
再用 shift 参数
省略 batch 广播记号后,插值路径为
对应的恒定目标速度是
模型根据噪声 latent、时间和多模态条件
实际生成损失是
理解分支则使用 token 级负对数似然:
当前实现把两项加权:
默认
因此,论文式中的“生成 MSE”若只是对实际 velocity MSE 的高度简写,就应明确说明
3.3 推理是常微分方程离散积分
推理从高斯噪声开始:
并沿学习到的速度场反向积分到数据端。用
代码默认使用 50 步。最后通过冻结的 VAE 解码器得到图像:
代码还使用 classifier-free guidance。若
是完整条件速度; 是仅文本条件速度; 是无条件速度;
一种与代码意图相符的双条件组合可写为:
默认文本与图像 guidance scale 分别约为 4 和 2。论文正文没有把 flow matching、采样积分与 CFG 讲清楚,这使最核心的图像生成机制必须依赖代码才能还原。
4. 临近预报路径:论文叙述与公开代码存在关键分叉
论文的概念图给出的路径是:
但公开代码实际提供两条不同路径。
4.1 路径 A:Omni-Weather 自回归预测
inference_radar.py 直接读取 10 帧历史雷达,再连续生成未来 12 帧。已经生成的帧会被追加到上下文:
这条路径符合“输入历史、输出未来”的任务语义,但没有使用 EarthFormer。
4.2 路径 B:EarthFormer 预测结果再精炼
radar_forcastor_dataset.py、radar_forcastor_single_dataset.py 和 inference_forcastor_radar.py 使用的是 EarthFormer 已经预测出的 12 帧未来图像,并让 Omni-Weather 生成对应的 12 帧真值:
这更像一个预测后处理或级联精炼器:
而不是论文所描述的“EarthFormer 将 10 帧历史编码成时序 token”。代码中的自然语言提示甚至明确把输入称为 EarthFormer 的 prediction。
这一区别非常重要:
- 若性能来自路径 A,应证明 Omni-Weather 自身学会了时序动力学;
- 若性能来自路径 B,结果同时依赖 EarthFormer 的先验预测,Omni-Weather 的作用主要是校正和增强;
- 如果训练与评测混用了两条路径,必须分别报告,不能用一个“radar sequence encoder”概念合并。
现有论文和公开仓库不足以唯一确定主表结果究竟由哪条路径产生。
5. CoT 数据与所谓“因果推理”
5.1 数据构造
论文为两类生成任务各构建约 4,000 条 CoT:
- 4,000 条临近预报解释;
- 4,000 条卫星到雷达反演解释。
构造过程大致为:
- GPT-4o 提取可观测属性;
- GPT-o3 根据属性与图像序列生成结构化推理;
- 按结构完整性、因果对齐和术语规范进行质量控制。
临近预报解释覆盖以下属性:
| 属性组 | 典型内容 |
|---|---|
| 初态 | 形态、最大像素等级、初始位置 |
| 运动 | 方向、速度、旋转 |
| 结构演化 | 单体数量、合并、分裂、形态变化 |
| 强度演化 | 增强、减弱、峰值变化 |
| 整体组织 | 覆盖范围、组织程度 |
可以把一条解释抽象为:
并训练
所代表的“先解释、再生成”过程。严格地说,上式右侧应为乘法分解:
5.2 代码中的 token 顺序
CoT 数据集的序列大致是:
text
全局提示 → 帧提示 → CoT 文本 → EarthFormer 预测图像 → 真实目标图像因此 CoT 文本在 Transformer 序列中位于条件图像之前。对于 decoder-style 因果注意力,若没有额外的双向注意力掩码设计,CoT token 不能访问其后面的输入图像 token。更值得警惕的是,单帧 CoT 数据的全局提示称任务为“给定输出 VIL 图像的 backward causal reasoning”,这暗示解释可能由结果图像反推而来。
如果解释
式的事后叙述,而不是部署时真正需要的
这会形成 outcome leakage:解释看起来合理,却未必是预测过程中的可用中间推理。
5.3 “因果”一词的证据边界
论文中的 CoT 主要描述:
- 回波从哪里移动到哪里;
- 强度怎样变化;
- 单体是否合并、分裂或旋转;
- 这些变化如何对应输出图像。
这属于结构化的时序描述与物理启发解释。论文没有给出:
- 明确的结构因果模型;
- 干预变量;
- 反事实目标;
- 可识别性条件;
- 对中间推理进行因果干预的实验。
因此,更稳妥的名称是“weather-aware structured rationale”或“过程解释”,而不是已经得到验证的因果推理。
5.4 提示模板自身有矛盾
附录提示一处要求模型根据 10 或 12 个 LABEL 帧生成分析,并且不要推测 INPUT;同一组附加规则又要求只考虑 INPUT 帧且不要提及 LABEL。这会让数据生成者对可见信息边界产生不同理解,也使 leakage 审计更困难。
5.5 CoT 消融并不能完全识别因果效应
论文的 CoT 表如下:
| CoT 微调 | Thinking 推理 | CSI-M | CRPS | RadarScore | LPIPS | GPT-4 分数 |
|---|---|---|---|---|---|---|
| 是 | 否 | 0.347 | 0.023 | 2.423 | 0.182 | - |
| 否 | 是 | 0.237 | 0.042 | 2.032 | 0.213 | 4.21 |
| 是 | 是 | 0.335 | 0.023 | 2.657 | 0.163 | 7.82 |
缺失的关键对照是:
所以该表不能干净估计 CoT 微调的平均处理效应。已有结果只说明:
- 同为 CoT 微调时,thinking 提升 RadarScore、LPIPS 和解释评分;
- 但 CSI-M 从 0.347 降到 0.335;
- 没有 CoT 微调时直接要求 thinking,所有生成指标明显更差。
这支持“显式推理带来感知质量与阈值命中之间的权衡”,但不支持“CoT 对所有目标一致有益”。
6. 数据、任务划分与可复现性
6.1 SEVIR
SEVIR 包含 2017 至 2020 年超过 20,000 个风暴事件。每个事件约 4 小时、5 分钟一帧,覆盖 VIL 雷达和多种卫星通道。论文把原始数据归一化到
临近预报输入输出可写为:
反演任务为:
只用两个红外通道意味着模型学习的是特定数据集上的条件映射,而不是从完整卫星观测恢复雷达。
6.2 RadarQA
理解任务使用 RQA-70K,覆盖:
- 单帧属性;
- 序列动态;
- 累积强度;
- 高价值天气判断;
- 自由文本解释。
公开配置中四个理解子集的样本数为:
这与 RQA-70K 的命名大体相符。
6.3 数据计数不一致
论文称联合训练加入 20,000 条通用图文样本。代码中的 MetaQuery 注册数量为 10,000。雷达临近预报注册数量也在不同配置间出现 40,000 与 45,000 两种数值。若采样器按声明长度分配任务概率,这些差异会直接改变有效任务权重:
论文没有给出最终 manifest、样本 ID、随机种子和混合采样概率,因此无法从公开材料精确重建训练分布。
6.4 划分方式
卫星反演代码按事件列表顺序取前 11,487 个事件训练,并从索引 11,488 开始测试,中间还跳过一个索引。由于没有随仓库提供生成 split 的脚本或明确事件清单,以下问题无法排除:
- 列表顺序是否稳定;
- 训练测试是否按时间隔离;
- 同一风暴系统的相邻事件是否跨 split;
- 被跳过样本是否只是边界错误。
对时空数据来说,随机或顺序划分通常不如按年份、区域和风暴事件隔离更能检验泛化。
7. 实验结果:优势是综合质量,不是全面领先
7.1 指标定义
Critical Success Index 为
附录列出的 VIL 阈值为 16、74、133、160、181 和 219,主表只展示其中 16、74、160、181 和 219。CSI-M 是若干阈值结果的平均。它忽略 true negative,适合稀疏强回波,但会受到阈值选择影响。
SSIM 的标准形式为
CRPS 衡量概率预报分布
CRPS 越低越好;CSI、SSIM 和 RadarScore 越高越好;LPIPS 越低越好。OpenReview rebuttal 称 CRPS 使用 5 个 ensemble members,但这一关键设置没有进入当前 arXiv v3 正文。
7.2 雷达临近预报
| 模型 | CSI-M ↑ | RadarScore ↑ | CSI-P4 ↑ | CSI-P16 ↑ | CRPS ↓ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|---|---|---|---|
| EarthFormer | 0.389 | 1.92 | 0.401 | 0.387 | 0.037 | 0.729 | 0.322 |
| DiffCast | 0.375 | 2.43 | 0.407 | 0.511 | 0.033 | 0.739 | 0.235 |
| CasCast | 0.384 | 2.72 | 0.414 | 0.518 | 0.031 | 0.746 | 0.207 |
| Omni-Weather | 0.384 | 2.69 | 0.427 | 0.539 | 0.026 | 0.746 | 0.179 |
| Omni-Weather-Thinking | 0.353 | 2.86 | 0.421 | 0.542 | 0.028 | 0.751 | 0.166 |
原表还报告了 CSI-4,表头中的部分阈值命名与正文阈值清单不完全一致。最稳妥的解读是:
- Omni-Weather 的 CSI-M 没有超过 EarthFormer;
- 非 thinking 版本在 CRPS 上最好;
- thinking 版本在 RadarScore、SSIM、LPIPS 和 CSI-P16 上更好;
- thinking 使 CSI-M 从 0.384 降为 0.353。
因此它更像是改善结构、感知和强回波表达,同时牺牲平均阈值命中率,而不是对专用 nowcasting 模型的全面支配。
7.3 卫星到雷达反演
| 模型 | RadarScore ↑ | RMSE ↓ | CSI-16 ↑ | CSI-74 ↑ | CSI-160 ↑ | CSI-181 ↑ | CSI-219 ↑ |
|---|---|---|---|---|---|---|---|
| UNet | 1.75 | 0.821 | 0.222 | 0.370 | 0.180 | 0.153 | 0.079 |
| ViT | 2.01 | 0.445 | 0.602 | 0.436 | 0.180 | 0.131 | 0.042 |
| WeatherGFM | 2.28 | 0.436 | 0.619 | 0.447 | 0.208 | 0.157 | 0.053 |
| Omni-Weather | 2.42 | 0.514 | 0.622 | 0.469 | 0.263 | 0.221 | 0.118 |
| Omni-Weather-Thinking | 2.51 | 0.507 | 0.621 | 0.473 | 0.277 | 0.230 | 0.129 |
Omni-Weather 在强回波 CSI 和 RadarScore 上明显占优,但 RMSE 比 WeatherGFM 与 ViT 更差。这个组合意味着模型可能更愿意生成锐利、强烈、结构化的雷达回波,同时在逐像素平均误差上付出代价。
如果论文声称“反演指标全部最佳”,RMSE 就是直接反例。更准确的结论是:
7.4 序列理解
| 模型 | Overall ↑ | Dynamic ↑ | ROUGE-L ↑ | BERTScore ↑ | GPT-4 ↑ |
|---|---|---|---|---|---|
| Claude | 20.79 | - | - | - | - |
| Gemini | 27.59 | - | - | - | - |
| GPT-5 | 49.50 | - | - | - | - |
| RadarQA | 66.17 | 53.31 | 0.436 | 0.815 | 6.87 |
| Omni-Weather | 61.79 | 64.05 | 0.446 | 0.810 | 7.48 |
Omni-Weather 的动态属性、ROUGE-L 和 GPT-4 评分更好,但 Overall 比 RadarQA 低 4.38 个百分点:
正文中“序列理解 overall 提升约 5%”的表述与主表不符。它也并非普遍超过闭源模型的 30% 水平,因为 GPT-5 达到 49.50。
7.5 单帧理解
| 模型 | Overall ↑ | ROUGE-L ↑ | BERTScore ↑ | GPT-4 ↑ |
|---|---|---|---|---|
| RadarQA | 61.51 | 0.512 | 0.809 | 6.58 |
| Omni-Weather | 64.30 | 0.543 | 0.760 | 6.03 |
Omni-Weather 在总体属性准确率和 ROUGE-L 上占优,但 BERTScore 与 GPT-4 评分落后。单帧理解是论文中相对更明确的理解增益,仍然不是所有指标全面领先。
7.6 联合训练消融
| 训练方式 | Accuracy(论文成对报告) | GPT-4(论文成对报告) |
|---|---|---|
| 仅理解 | 81.95 / 54.34 | 5.78 / 6.03 |
| 联合训练 | 86.65 / 59.58 | 7.48 / 6.03 |
| 训练方式 | CSI-M(论文成对报告) | RMSE(论文成对报告) |
|---|---|---|
| 仅生成 | 0.303 / 0.323 | 0.590 / 19.01 |
| 联合训练 | 0.338 / 0.347 | 0.514 / 17.11 |
方向上,所有列都支持联合训练有益。但表注称数值按 Frame / Sequence 排列,主表的 GPT-4 数值却暗示 GPT-4 列可能采用 Sequence / Frame 顺序;生成列也没有逐一标明哪个数属于反演或预报。本文因此保留原始成对形式,不擅自消解歧义。论文只在每项任务随机抽取 200 个验证样本,也没有报告:
- 多随机种子;
- 标准差或置信区间;
- 配对显著性检验;
- 是否严格匹配总更新步数与单任务见样本数;
- 表中两组并列数字与具体子任务的清晰映射。
所以该消融证明的是“在当前一次设置下观察到一致增益”,还不能建立稳定的跨任务协同规律。
7.7 序列编码器消融
| 编码器 | CSI-M ↑ | CSI-4 ↑ | CSI-16 ↑ | SSIM ↑ | PSNR ↑ |
|---|---|---|---|---|---|
| VAE encoder | 0.2358 | 0.2912 | 0.4356 | 0.7528 | 21.42 |
| Radar sequence encoder | 0.3471 | 0.4003 | 0.5390 | 0.7621 | 23.22 |
结果支持天气专用时序先验,但不是纯粹的 encoder architecture 对照。若所谓 radar sequence encoder 输入的是 EarthFormer 预测未来帧,它同时引入了一个强预测器的输出,提升不能全部归因于 token 编码方式。
7.8 CFG 消融
| CFG scale | CSI-M ↑ | CSI-4 ↑ | CSI-16 ↑ | SSIM ↑ | PSNR ↑ |
|---|---|---|---|---|---|
| 1 | 0.1824 | 0.2208 | 0.3305 | 0.5123 | 17.33 |
| 2 | 0.2501 | 0.2994 | 0.4261 | 0.6866 | 19.67 |
CFG 明显改善条件一致性,但论文没有报告更大 scale 的曲线,也没有展示 guidance 过强时是否会损害校准、多样性或极端值可靠性。
7.9 通用图文数据混合
附录给出不同天气数据比例的结果:
| 生成任务数 | 天气数据占比 | CSI-M | CSI-4 | CSI-16 | SSIM | PSNR |
|---|---|---|---|---|---|---|
| 1 | 70% | 0.2501 | 0.2994 | 0.4261 | 0.6866 | 19.67 |
| 1 | 30% | 0.1386 | 0.1726 | 0.2859 | 0.6187 | 16.66 |
| 1 | 50% | 0.2478 | 0.2956 | 0.4174 | 0.6823 | 19.15 |
| 2 | 70% | 0.1091 | 0.1345 | 0.2274 | 0.6013 | 16.64 |
这张表没有清晰的 weather-only 基线,也混合改变了任务数量与采样比例。因此它不足以单独证明“通用图文数据必然提高天气泛化”,最多说明混合比例非常敏感。
8. 论文叙事逐节检查
| 章节 | 它承担的叙事任务 | 完成度 |
|---|---|---|
| 引言 | 把生成与理解的割裂塑造成统一气象智能问题 | 强;问题动机清楚 |
| 相关工作 | 连接天气生成、雷达理解、统一多模态模型 | 中;天气专用基础模型与关键基线覆盖不足 |
| 方法 | 给出任务统一接口、共享主干和 CoT 数据 | 中;核心生成目标和 EarthFormer 路径描述不充分 |
| 实验 | 证明四任务可用、联合训练增益、thinking 有效 | 中上;指标丰富,但统计与关键对照不足 |
| 结论 | 把系统定位为天气雷达通才模型的起点 | 合理,但泛化范围仍局限于 SEVIR/VIL |
标题从早期更宽泛的 “Weather Foundation Model” 收敛为最终的 “Weather Radar Understanding and Generation”,是正确的范围校准。即便如此,“foundation”式叙事仍应受到以下边界约束:
9. 主张—证据审计
| 论文主张 | 直接证据 | 判断 |
|---|---|---|
| 一个模型统一生成与理解 | 同一 Bagel 主干覆盖四项任务 | 基本成立,但存在专用编码器与不同输出头 |
| 联合训练带来双向增益 | Table 2 中生成和理解均提升 | 有初步支持,缺少多种子、置信区间和严格预算对照 |
| 生成达到 SOTA | CRPS、感知指标、强阈值 CSI 很强 | 表述过强;CSI-M 或 RMSE 并非都最佳 |
| 理解达到 SOTA | 单图 Overall、序列 Dynamic 和生成式评分较好 | 混合;序列 Overall 明显低于 RadarQA |
| CoT 提升预测与解释 | thinking 改善 RadarScore、LPIPS、GPT 分数 | 部分成立;CSI-M 下降且缺失完整二乘二对照 |
| CoT 是因果推理 | 属性化推理文本与定性例子 | 不足;没有因果识别、干预或 faithfulness 验证 |
| EarthFormer 作为序列编码器 | 编码器消融提升 | 代码更像预测结果精炼,任务定义尚不透明 |
| 端到端训练 | 论文文字描述 | 不准确;VAE 冻结,代码中的 EarthFormer 也不在联合梯度图中 |
| 对现实天气有广泛泛化 | SEVIR 上四任务结果 | 不足;未证明跨区域、跨传感器、跨年份和极端事件泛化 |
10. OpenReview 评审与作者答辩
论文最终被 ICLR 2026 接收为 Poster。公开评审最初给出 8、6、6、4,一位 reviewer 在 rebuttal 后从 4 提升到 6。Area Chair 认为主要疑问得到足够回应。
| Official Review | 初始分数 | Rebuttal 后 | Soundness / Presentation / Contribution | 主要意见 |
|---|---|---|---|---|
| naQj | 8 | 8 | 3 / 3 / 3 | 认可统一框架和强结果;要求专家验证、跨 SEVIR 泛化,并质疑通用域 VAE 是否适合气象场 |
| dM4g | 4 | 6 | 2 / 2 / 3 | 认为 foundation model 主张过宽,数据计数、token 融合和 CoT 质控不透明;答辩后上调 |
| rnQS | 6 | 6 | 2 / 3 / 2 | 追问 encoder/decoder、 |
| 3h1v | 6 | 6 | 3 / 3 / 3 | 认可方向,但担心单一 VIL/SEVIR 范围以及 LLM 生成 CoT 缺少专家 faithfulness 验证 |
共读取到 4 条 Official Review,以及对应的作者答辩、reviewer follow-up、Meta Review 和 Decision;下文不是只依据摘要页或首屏内容做出的判断。
10.1 评审共识
四位评审反复提到的优点是:
- 把生成和理解放入一个统一模型具有新颖性;
- 实验任务多,展示了较强的系统整合能力;
- 强回波结构、感知指标和自然语言解释有竞争力;
- 论文方向可能推动可解释的天气预测。
反复出现的问题是:
- 范围过宽:单一 SEVIR/VIL 设置不足以证明广义天气基础模型;
- 架构描述不足:编码器、decoder、token 融合、冻结策略不清楚;
- 方程含糊:
、文本长度归一化、CRPS ensemble 数、CFG 均缺少说明; - CoT 可靠性:LLM 生成解释缺少充分的气象专家验证;
- 基线与引用不足:评审要求讨论 DGMR、Aquilon、CLLMate 等相关工作;
- 计算成本缺失:没有参数量拆分、FLOPs、延迟和显存比较;
- 指标叙事选择性:反演 RMSE 和序列 Overall 并不支持全面 SOTA。
10.2 Rebuttal 新增了什么
作者在答辩中补充:
- 专家对约 30 个解释进行评估,专家解释与 GPT 解释的总体分数约为 8.5 与 7.7;
- 从约 5,500 个候选样本中保留约 4,000 个,通过率约 70%;
- CRPS 使用 5 个 ensemble members;
- 各任务权重
; - 编码器与 VAE 冻结;
- 增加 ERA5 2 米温度的初步跨模态实验;
- 补充 DGMR 等相关基线。
这些回应解释了部分疑问,也促成评分上调。但截至 arXiv v3 和当前公开仓库,若干细节仍只存在于 rebuttal,没有形成正文中的完整、可执行复现说明。尤其是专家评估样本、评分协议、ERA5 设置与结果并未作为可审计材料发布。
10.3 接收不等于问题已经消失
从会议决策角度,Omni-Weather 的新颖性和方向价值足以支持接收。从科学记录角度,以下问题仍应保留:
- 解释是否 faithful,而不仅是 plausible;
- EarthFormer 到底是 encoder 还是上游 forecaster;
- 论文主表来自哪一个数据与推理路径;
- 训练超参数与公开脚本为何明显不同;
- 统一模型的增益是否在跨区域、跨传感器条件下成立。
11. 公开代码审计
本节针对仓库提交 07ab4848de677e444841062000d7032fdd0178b9 进行静态核查。
11.1 训练设置对照
| 项目 | 论文 | 默认公开脚本 | 影响 |
|---|---|---|---|
| GPU | 8 × H200 | 脚本可配置 | 资源要求极高 |
| 训练步数 | 20,000 | 未显式设置,代码默认 500,000 | 默认命令不对应论文训练 |
| 学习率 | 相差 10 倍 | ||
| weight decay | 0.05 | optimizer 硬编码为 0 | 正则化不同 |
| scheduler | cosine | 默认 constant | 优化轨迹不同 |
| warmup | 2,000 | 2,000 | 一致 |
| 生成分辨率 | 生成配置相符 | 大体一致 | |
| 理解分辨率 | 声称统一 256 | 允许 378 至 980 | 不一致 |
| 任务权重 | CE 与 MSE 默认均为 1 | rebuttal 才说明 | |
| VAE | 方法看似端到端 | 冻结 | 不是全模型端到端 |
11.2 没有一条默认命令复现四任务联合训练
公开配置分开存在:
sat2rad_radarqa.yaml:卫星反演与理解;radar_nowcast:临近预报;cot_nowcast:CoT 临近预报;radar_forcastor:EarthFormer 预测精炼。
默认 finetune.sh 指向 sat2rad_radarqa.yaml,没有同时包含临近预报和 CoT。也就是说,仓库提供了任务组件,但没有提供论文声称的完整四任务联合 recipe:
11.3 路径与环境
若干脚本硬编码 /mnt/shared-storage-user/... 数据路径。依赖文件较完整、许可证为 Apache-2.0、模型权重已公开,这些是积极因素;但仓库没有:
- 自动下载与构造 SEVIR/RadarQA 的统一脚本;
- 最终训练 manifest;
- 自动化测试;
- CI;
- 主表的一键评测入口;
- 论文 checkpoint 与每个表格行的精确映射。
因此当前可复现等级更接近“可阅读和二次开发的研究代码”,不是“从数据到主表的一键复现包”。
11.4 论文式、代码式与系统语义的三层错位
可以把主要错位归纳为:
这不是文字润色层面的小误差,而是会改变模型类别、条件信息和对性能来源解释的核心问题。
12. 方法学优点
12.1 问题设定有价值
生成与理解联合起来是合理方向。真实预报系统不仅需要输出场,还需要:
- 解释关键回波结构;
- 暴露不确定性与演变依据;
- 支持人机问答;
- 让语义先验约束视觉生成。
Omni-Weather 至少把这几个目标放进了同一个可训练系统。
12.2 指标覆盖比单一 MSE 更合理
雷达场预测中,像素 RMSE 往往偏爱模糊平均。论文同时报告:
可以看到 thinking 模式在事件命中、结构感知和平均误差之间的权衡。这比只展示一项最有利指标更有信息量。
12.3 联合训练结果方向一致
虽然统计证据不足,Table 2 的生成与理解列都朝正向移动,至少说明共享主干没有出现明显的灾难性负迁移。
12.4 把天气属性显式写进解释
CoT taxonomy 关注移动、旋转、合并、分裂、增强和衰减,比通用“看图说话”更贴近雷达分析。即使“因果”尚未成立,这套属性结构本身也可作为可复用监督信号。
13. 主要问题
13.1 方法定义没有闭环
最重要的损失、采样和条件路径需要从代码逆向恢复。论文的数学对象没有区分:
- 像素
; - VAE latent
; - 噪声
; - flow time
; - 任务索引
。
同一个
13.2 “端到端”表述不准确
若 VAE 和视觉编码器冻结,EarthFormer 也不接收下游梯度,则可训练路径是:
这仍可称联合优化共享主干,但不能不加限定地称所有模块端到端训练。
13.3 CoT 缺少 faithfulness 实验
高 GPT-4 分数只能说明解释像正确答案。要证明解释确实参与生成,应做干预:
- 固定输入,交换两条 CoT;
- 删除方向、速度或强度字段;
- 对 CoT 加入相反事实;
- 测量输出移动方向、强回波面积和 CSI 的响应。
例如令
若 CoT faithful,系统性反事实应产生方向一致、可解释的性能变化,而不是几乎不影响输出。
13.4 缺少统计不确定性
对 200 个样本,报告均值而不报告置信区间很难判断小差异。例如可对配对样本 bootstrap:
再给出 2.5% 与 97.5% 分位数。对 CSI 还应按风暴事件而非帧独立重采样,以避免时序相关性导致置信区间过窄。
13.5 生成模型的概率校准没有充分展开
既然模型是随机 flow generator,就应报告:
- 不同 ensemble size 下 CRPS 收敛;
- reliability diagram;
- 强回波 exceedance probability;
- rank histogram;
- 多样性与准确率的权衡;
- 极端事件的 tail calibration。
仅用 5 个样本估计分布指标可能有较大 Monte Carlo 误差。
13.6 泛化范围有限
所有核心结果围绕 SEVIR。没有证明:
的跨区域、跨传感器或跨变量迁移。rebuttal 中的 ERA5 初步实验是好信号,但不足以支撑广泛天气基础模型结论。
14. 次要但应修复的问题
- 统一术语:nowcast、forecast、forcastor 在代码中混用;
- 明确每个 CSI 列对应的阈值,避免正文与表头不一致;
- 解释 Table 2 中成对数字的任务顺序和单位;
- 给出每个任务的训练样本数、采样概率和重复次数;
- 把 rebuttal 中的
、5-member CRPS、冻结策略写入正文; - 报告总参数、可训练参数、FLOPs、H200 训练时长和单样本推理延迟;
- 提供所有评测 prompt、GPT judge 版本、温度与重试策略;
- 把 30 个专家评测样本、匿名评分和分歧统计公开;
- 修复附录 CoT prompt 对
INPUT与LABEL的冲突约束; - 发布每张表对应的 checkpoint、配置文件和命令。
15. 如何把这项工作做得更扎实
15.1 建立真正可执行的统一任务规范
为每个任务定义:
其中分别表示数据、编码器、条件、输出头、损失和指标。把最终四任务配置写成唯一 manifest,并固定随机种子与数据 ID。
15.2 分开比较三种临近预报系统
必须显式报告:
- EarthFormer;
- Omni-Weather 直接预报;
- EarthFormer + Omni-Weather 精炼。
令性能为
Omni-Weather 自身的预报能力则要与相同输入历史、相同评测预算的专用模型比较。
15.3 做完整的二乘二 CoT 实验
| 非 thinking 推理 | thinking 推理 | |
|---|---|---|
| 无 CoT 微调 | 必须补充 | 已有 |
| 有 CoT 微调 | 已有 | 已有 |
这样才能估计:
15.4 做跨域与时间外评测
至少应增加:
- 2017--2019 训练、2020 测试;
- 跨区域或跨雷达站;
- 不同强度分位数;
- 不同季节;
- 独立数据集零样本与少样本适配。
15.5 对联合训练做梯度层面的分析
对任务
若
16. 可复用的研究启发
16.1 预测与解释应是联合对象
未来模型可直接建模:
其中
16.2 专用预报器可作为多模态模型的 proposal generator
EarthFormer 不一定只能当 encoder。更自然的系统分工是:
专用模型负责稳定动力学,通用模型负责语义约束、质量修复和解释。Omni-Weather 的代码事实上已经接近这一方向,只是论文没有把它清楚定义出来。
16.3 用可干预的结构变量替代自由文本 CoT
可以把 rationale 改成显式状态:
分别表示位移、强度变化、面积变化、单体数量和旋转。结构变量更容易:
- 用算法或专家验证;
- 做反事实干预;
- 与输出场建立可测的对应;
- 避免语言风格成为主要评价对象。
16.4 统一不应只看任务数量
更有说服力的统一模型需要证明:
仅仅让一个模型在四个数据加载器上训练,并不自动说明它学到了统一的天气表征。
17. 直接竞品与领域定位
| 工作 | 主要角色 | 相对 Omni-Weather 的位置 |
|---|---|---|
| EarthFormer | 时空预测 Transformer | 更纯粹的雷达序列动力学基线;Omni-Weather 还把它作为先验或上游预测器 |
| DGMR | 概率雷达临近预报 | 代表成熟的专用生成路线;论文应更完整比较概率质量与计算成本 |
| DiffCast / CasCast | 扩散式或级联式临近预报 | 在像素、结构与感知指标上与 Omni-Weather 形成直接竞争 |
| WeatherGFM | 跨模态天气场生成 | 是卫星到雷达反演的直接比较对象;Omni-Weather 强在高阈值 CSI,弱在 RMSE |
| RadarQA | 雷达图像与序列理解 | 是理解任务最直接的领域模型;Omni-Weather 的序列 Overall 尚未超过它 |
| Bagel-7B-MoT | 通用多模态理解与生成基座 | 提供统一 token 空间和生成能力,Omni-Weather 的增量主要是天气任务化、数据与训练接口 |
| Aquilon / CLLMate | 评审指出的同期气象多模态工作 | 应在修订中明确任务覆盖、数据范围、生成能力和计算成本差异 |
从贡献类型看,Omni-Weather 主要是概念与系统整合创新,其次是数据构造和经验发现;它没有提出新的 Transformer 算子、flow matching 理论或可证明的因果学习方法。
Innovation Score:7 / 10。 统一问题设定有价值,四任务系统也具有明显工程新意;但核心网络、生成范式和时序先验均来自现有组件,方法增量尚未上升为新的通用建模原理。
18. 科学品味评分
| 维度 | 评分 | 理由 |
|---|---|---|
| 新颖性 | 3.5 / 5 | 生成与理解统一到天气雷达模型中有新意,但基础组件多来自已有模型 |
| 技术严谨性 | 2.5 / 5 | 结果丰富,核心损失、路径、冻结与复现设置却不够一致 |
| 实证充分性 | 3.0 / 5 | 四任务、多指标和多项消融是优点;缺少统计、完整对照和跨域测试 |
| 可解释性证据 | 2.5 / 5 | 解释质量较好,但 faithfulness 与因果性没有被验证 |
| 潜在影响 | 3.5 / 5 | 共享气象生成与理解是值得继续推进的系统方向 |
| 可复现性 | 2.0 / 5 | 代码和权重公开,但默认脚本、数据路径和论文设置不能闭环 |
19. 最终评价
如果以审稿时的标准评价,我会给出 Weak Accept / Major Revision 边界:
- 支持接收的原因是问题重要、系统新颖、结果覆盖广,且统一生成与理解确实展示出研究潜力;
- 要求大修的原因是方法数学描述与实现不一致,临近预报的信息流不透明,CoT 的因果与 faithful 属性没有得到验证,复现 recipe 也不完整。
论文最可信的结论是:
一个共享多模态主干可以同时承担天气雷达生成和理解,并在若干结构、感知与语言指标上优于专用基线;联合训练可能带来正迁移。
论文目前不能充分支持的更强结论是:
该模型已经成为跨天气模态的通用基础模型,所有生成与理解任务都达到 SOTA,并通过因果 CoT 获得了可验证的机制解释。
从研究方向看,Omni-Weather 很可能比它当前的形式更重要:它把“预报场、自然语言解释和多模态条件”放在了同一张设计图上。下一步的关键不是再加更多任务名称,而是把数据因果边界、概率生成目标、专用动力学模型的角色,以及联合训练增益的机制真正做清楚。
参考与核查范围
本文对 arXiv v3 的正文、附录、公开 OpenReview 讨论和官方代码进行了交叉检查。代码审计是静态审计;由于 SEVIR/RadarQA 数据、7B 模型权重和 8 × H200 训练资源不随仓库提供,未重新训练模型或复算主表数值。
Code Verification
核查对象为官方仓库提交 07ab4848de677e444841062000d7032fdd0178b9,核查日期为 2026-07-31。
| Claim | 论文描述 | 代码实现 | 状态 |
|---|---|---|---|
| 统一生成与理解 | 一个 Bagel-7B-MoT 共享主干 | CE 与 flow matching 两类 token 在共享主干中训练 | 部分验证 |
| 生成损失 | 图像或帧空间 MSE | VAE latent 上的 velocity MSE | 不一致 |
| 临近预报条件 | 10 帧经 EarthFormer 编成时间 token | 一条路径完全不使用 EarthFormer;另一条读取 EarthFormer 的 12 帧未来预测 | 不一致 |
| 四任务联合训练 | 所有天气任务共同 SFT | 没有单一公开配置包含四任务与 CoT | 无法复现 |
| 端到端训练 | 模型端到端训练 20k steps | VAE 冻结,级联 EarthFormer 不在下游梯度图中 | 表述过强 |
| 优化超参数 | lr | 默认脚本 lr | 不一致 |
| 输入分辨率 | 所有图像不超过 | 理解配置允许 378 到 980 | 不一致 |
| 通用数据规模 | MetaQuery 20k | registry 声明 10k | 不一致 |
| 权重与许可 | 模型和代码公开 | Hugging Face 权重与 Apache-2.0 仓库可访问 | 验证 |
执行的静态检查:
- 遍历并阅读训练入口、模型损失、数据注册、四类数据集和推理脚本;
- 对仓库 Python 文件执行
compileall,语法编译通过; - 对论文表格、附录消融和代码默认值逐项人工比对;
- 未执行依赖安装、数据下载、7B 模型推理或 8 × H200 训练,因此不把静态通过等同于数值复现。
综合判断: