Skip to content

WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

Status: completed

Authors: Zinan Zheng, Yang Liu, Nuo Chen, Juepeng Zheng, Hong Cheng, Jia Li

Venue / Year: ICML 2026;arXiv v1,2026-05-08

Affiliations: HKUST (Guangzhou), Tencent HY Foundation Model Team, CUHK, Sun Yat-Sen University, National Supercomputing Center in Shenzhen

Links: arXiv · Code · Dataset · SFT Model · RFT Model · DPO Model · ICML

Tags: [[multimodal LLM]], [[weather forecasting]], [[report generation]], [[instruction tuning]], [[ERA5]], [[rejection sampling]], [[DPO]], [[AI for science]]

一句话结论

WeatherSyn 的真正贡献是把美国国家气象局 Area Forecast Discussion 与 ERA5 热力图对齐,建立了“气象图像 \to 多日自然语言预报”的公开数据与评估流程;三阶段训练本身主要是标准的 SFT \to 拒绝采样微调 \to DPO。论文证明了领域数据微调明显优于多数通用模型,但没有证明一个只看单时刻、主要为近地面变量的 MLLM 已学会可靠的四日天气动力学;当前公开 RFT 数据还存在严重的四重重复异常,使“词汇多样性带来增益”这一核心机制无法按发布物复核。

先给判断:这篇论文最值得读什么

这不是一篇提出新视觉编码器、注意力机制或天气动力学模型的论文。其价值集中在三个层面:

  1. 任务层面:把天气 AI 从数值场预测、极端事件分类进一步推到面向公众的开放式多日文字报告。
  2. 数据层面:构建 WSInstruct,将 31 个美国城市的 ERA5 多变量热力图与专家撰写的预报讨论对齐,并把开放文本拆成 8 个气象方面、18 个离散 claim。
  3. 评估层面:不只报告 BLEU/ROUGE,而是把报告重新抽取为离散气象 claim,再计算精确率和 F1,并补充 LLM 排序与专家修正。

最需要警惕的则是:任务被 aspect-controlled prompt 显著简化;“直接从初始场预报四天”的信息是否充分没有得到论证;论文正文的若干“全面优于”“持续提升”与表格、曲线并不完全一致;公开代码和数据与论文超参数及 RFT 构造存在多处差异。

1. 问题定义:它究竟在预测什么

1.1 论文的形式化

论文把天气预报报告数据写为

D={Qtp,Itp,Rt,t+dp}, \mathcal{D} = \left\{ \mathbf{Q}_t^p,\, \mathcal{I}_t^p,\, \mathbf{R}_{t,t+d}^p \right\},

其中:

符号含义本文中的实际对象
pp空间位置一个城市或对应的 NWS 预报办公室区域
tt输入时刻ERA5 初始状态的时间戳
dd最远预报跨度最多 4 个逐日时段
Qtp\mathbf{Q}_t^p指令城市、时间、输出模板,以及每一天应讨论的气象方面
Itp\mathcal{I}_t^p多图像输入同一时刻的 12 张变量热力图
Rt,t+dp\mathbf{R}_{t,t+d}^p参考报告专家撰写并被切分、重组为逐日报告的文本
R^t,t+dp\hat{\mathbf{R}}_{t,t+d}^p模型输出条件生成的四日天气报告

论文将图像集合写为

Itp={It,1p,It,2p,,It,Nvp},Nv=12. \mathcal{I}_t^p = \left\{ \mathbf{I}_{t,1}^p,\, \mathbf{I}_{t,2}^p,\, \ldots,\, \mathbf{I}_{t,N_v}^p \right\}, \qquad N_v=12.

因此模型学习的是条件分布

pθ(Rt,t+dpItp,Qtp). p_\theta \left( \mathbf{R}_{t,t+d}^p \mid \mathcal{I}_t^p,\, \mathbf{Q}_t^p \right).

若把报告表示为长度为 LRL_R 的 token 序列 R=(r1,,rLR)\mathbf{R}=(r_1,\ldots,r_{L_R}),自回归分解为

logpθ(RI,Q)==1LRlogpθ(rr<,I,Q). \log p_\theta \left( \mathbf{R} \mid \mathcal{I},\mathbf{Q} \right) = \sum_{\ell=1}^{L_R} \log p_\theta \left( r_\ell \mid r_{<\ell},\mathcal{I},\mathbf{Q} \right).

论文没有报告每张图的固定像素尺寸、视觉 token 数或完整张量维度。公开训练脚本把图像像素预算设为从 256×28×28256\times 28\times 28512×28×28512\times 28\times 28,但这描述的是处理器允许的像素范围,不等于原始 ERA5 栅格的物理分辨率。

1.2 一个必须先澄清的概念:报告生成不等于数值天气预报

输入只含时刻 tt 的区域状态,输出却描述 ttt+dt+d 的未来。真实人类报告并不是仅凭这 12 张初始场图像写成的:预报员还会使用 NWP 多时效预报、三维大气结构、观测资料、上游系统演变和业务经验。

从统计角度看,论文实际学习的是

p(human reportsingle analyzed state,city,season,requested aspects), p \left( \mathrm{human\ report} \mid \mathrm{single\ analyzed\ state},\, \mathrm{city},\, \mathrm{season},\, \mathrm{requested\ aspects} \right),

而不是一个被物理约束的状态转移算子

xt+Δt=FΔt(xt). \mathbf{x}_{t+\Delta t} = \mathcal{F}_{\Delta t} \left( \mathbf{x}_t \right).

这一区别非常重要。WeatherSyn 可能利用了以下信号:

  • 当前天气场中的持续性和上游空间结构;
  • 城市与月份对应的气候先验;
  • 训练语料中常见的报告表达与事件共现;
  • prompt 直接给出的目标气象方面。

这些信号足以提高 claim 匹配率,却不等价于模型学会了可验证的四日大气动力学。论文附录中加入 HRES 未来场后性能进一步上升,反而支持“原始输入缺失关键未来信息”这一解释。

2. WSInstruct 数据是怎样构造的

2.1 文本来源与时间切分

原始文字来自 Iowa Environmental Mesonet 保存的 NWS Area Forecast Discussion。作者:

  1. 每个城市每天至多保留一份报告,并过滤时间上相邻的报告;
  2. 用正则表达式识别 Today、星期名等相对日期;
  3. dateparser 将其映射为绝对日期;
  4. 仅保留覆盖前四天中至少三天的报告;
  5. 用 Qwen-2.5-72B 将原报告切成逐日子报告;
  6. 用正则检查子句是否来自原文、日期是否一致,对不匹配样本人工修正。

这里的优点是保留了真实专家文本而不是让 LLM 从零合成标签。风险是时间切分本身仍由 LLM 完成;论文没有报告需要人工修正的样本比例,也没有给出切分的一致性统计。

2.2 Claim 体系

作者把报告归纳为 8 个方面、18 个类别:

AspectClaim categories
Temperaturehot/warm, cool/cold, moderate
Windstrong wind, light wind
Humiditydry air, moist air
Frontal Systemcold front, warm front
Pressure Systemhigh pressure, low pressure
Wave Patternridge, trough
Wind Flow Systemonshore flow, offshore flow
Eventprecipitation, snow, storm

Qwen-2.5-72B 根据专家定义的关键词和示例执行语义分类。作者让领域训练过的标注员修正全部 1,292 条测试报告的抽取结果,并报告抽取 F1 为 94%。这是评估管线中一个有价值的质量控制,但公开数据没有单独提供“模型原始抽取 \leftrightarrow 人工修正标签”的配对文件,因此该 94% 目前不能从发布物独立重算。

类别体系也有明显的信息压缩。例如:

  • “温度从 15C15^\circ\mathrm{C} 降到 5C5^\circ\mathrm{C}”与“略微降温”都可能只映射为 cool/cold;
  • 降水的强度、概率、位置和时间可能都被压成 precipitation;
  • front、ridge、trough 的位置和移动方向没有进入 claim;
  • 同一类别下严重错误的定量值仍可能得到 TP。

所以 claim F1 衡量的是粗粒度语义槽位是否匹配,不是完整气象事实的一致性。

2.3 Aspect-controlled prompting

每个预测日的 prompt 会显式给出:

text
<<date, weekday>> Report:
## Focus on: Temperature, Humidity

它不泄露 hot/cold、dry/moist 等具体取值,但泄露了参考报告选择讨论哪些变量。这个设计让不同模型的输出范围可比,也减少开放式报告“一方谈风、一方谈温度”造成的不可评估性。

代价是任务从“模型自主决定什么最重要”变成了“在给定槽位内生成内容”。表 3 的消融非常说明问题:

训练时 aspect control测试时 aspect control平均 aspect hit rate
0.16
0.12
0.94

因此,0.94 主要证明模型能遵循方面指令,并不能证明它能自主发现未来几天最值得报告的气象要素。对于“减轻预报员人工分析负担”的应用动机,这是一项实质性的任务简化。

2.4 图像输入与数据划分

每个样本使用 ERA5 的 12 个 single-level 变量:

  1. land-sea mask;
  2. 10 m uu 风;
  3. 10 m vv 风;
  4. 2 m 温度;
  5. 海平面气压;
  6. 海表温度;
  7. 雪深;
  8. 地面气压;
  9. 总云量;
  10. 过去 6 小时总降水;
  11. 整层水汽;
  12. 整层液态水。

ERA5 原始分辨率为 0.250.25^\circ、时间分辨率为 6 小时。作者将 UTC 转为当地时间,并把 ERA5 时刻与随后 3 小时内发布的报告对齐;同一天多份报告时选早晨版本。

数据规模为:

Split年份论文报告行数
WSInstruct / SFT2017–20216,344
WSInstruct-RFT2017–202020,412
WSInstruct-DPO20211,241
Test20221,292

年份切分是合理的,公开 JSON 中训练与测试图像路径没有重叠。与此同时,样本均来自同一国家、同一类业务文本和相近的数据处理流程;这避免了随机切分泄漏,却没有验证跨国家、跨机构写作规范或跨数据源泛化。

3. 三阶段训练:逐式拆解

3.1 Stage 1:SFT

基础模型为 Qwen3-VL-8B-Instruct。论文写出的目标是

LVLM=E(Qtp,Itp,{Rt,t+dp,i}i=1N)D[i=1Nlogpθ(Rt,t+dp,iItp,Qtp)]. \begin{aligned} \mathcal{L}_{\mathrm{VLM}} &= -\mathbb{E}_{ \left( \mathbf{Q}_t^p,\, \mathcal{I}_t^p,\, \left\{ \mathbf{R}_{t,t+d}^{p,i} \right\}_{i=1}^{N} \right) \sim\mathcal{D} } \left[ \sum_{i=1}^{N} \log p_\theta \left( \mathbf{R}_{t,t+d}^{p,i} \mid \mathcal{I}_t^p,\mathbf{Q}_t^p \right) \right]. \end{aligned}

在 SFT 阶段 N=1N=1。将自回归展开代入后,

LSFT=E(Q,I,R)D[=1LRlogpθ(rr<,I,Q)]. \begin{aligned} \mathcal{L}_{\mathrm{SFT}} &= -\mathbb{E}_{(\mathbf{Q},\mathcal{I},\mathbf{R})\sim\mathcal{D}} \left[ \sum_{\ell=1}^{L_R} \log p_\theta \left( r_\ell \mid r_{<\ell},\mathcal{I},\mathbf{Q} \right) \right]. \end{aligned}

这就是标准多模态自回归交叉熵。论文没有提出新的 backbone 模块、视觉融合层或损失;视觉编码、merger 和语言模型均来自 Qwen3-VL,并在 SFT/RFT 时全部解冻。

3.2 Stage 2:RFT

作者对 2017–2020 的每个输入用 SFT 模型采样 40 份报告:

R^(k)pθSFT(RI,Q;T=0.9,top\mboxk=50,top\mboxp=0.9),k=1,,40. \hat{\mathbf{R}}^{(k)} \sim p_{\theta_{\mathrm{SFT}}} \left( \mathbf{R} \mid \mathcal{I},\mathbf{Q} ;\, T=0.9,\, \mathrm{top}\mbox{-}k=50,\, \mathrm{top}\mbox{-}p=0.9 \right), \quad k=1,\ldots,40.

随后:

  1. 用 Qwen-2.5-72B 对每一天抽取 claim;
  2. 计算该天相对于参考报告的 F1;
  3. 只保留 step-level F1 等于 1 的子报告;
  4. 以 edit distance、TF-IDF、Jaccard 和 Sentence-BERT cosine distance 选择相对参考报告最不相似的候选;
  5. 随机拼接不同日期的候选子报告,形成多条完整报告;
  6. 从基础 Qwen3-VL-8B 重新在增强语料上微调,得到 WeatherSyn-RFT。

核心直觉是:在 claim 不变的约束下增加措辞多样性,迫使模型学习图像–气象语义,而不是背固定句式。

但该过程存在三层风险:

  • 评价器闭环:用于筛选 RFT 数据的 Qwen claim extractor 与主测试指标相同,模型可能更适应评价器的离散标签,而不是真实预报质量;
  • step 拼接破坏篇章一致性:各日子报告分别正确,不保证组合后的四日报告在天气系统演变上连贯;
  • 样本权重变化:论文公式对同一输入的 NN 个报告求和,因此拥有更多候选的输入会获得更大梯度权重;若实现把每条候选展开为独立行,同样会增加该输入出现的次数。需要匹配训练步数的重复训练 baseline 才能把“多样性收益”和“更多更新次数”分开。

3.3 Stage 3:DPO

对 2021 年每个输入,WeatherSyn-RFT 再生成 40 个候选。作者把逐日 F1 等于 1 的子报告拼成 preferred response Yw\mathcal{Y}_w,把最低 F1 子报告拼成 rejected response Yl\mathcal{Y}_l,得到 1,241 个偏好对。

x=(Itp,Qtp),πref=MRFT, x=(\mathcal{I}_t^p,\mathbf{Q}_t^p), \qquad \pi_{\mathrm{ref}}=\mathcal{M}_{\mathrm{RFT}},

论文的 DPO 目标为

LDPO(πθ,πref)=E(x,Yw,Yl)DDPO[logσ(βlogπθ(Ywx)πref(Ywx)βlogπθ(Ylx)πref(Ylx))], \begin{aligned} \mathcal{L}_{\mathrm{DPO}} \left( \pi_\theta,\pi_{\mathrm{ref}} \right) &= -\mathbb{E}_{ (x,\mathcal{Y}_w,\mathcal{Y}_l) \sim\mathcal{D}_{\mathrm{DPO}} } \Bigg[ \log \sigma \Bigg( \beta \log \frac{ \pi_\theta(\mathcal{Y}_w\mid x) }{ \pi_{\mathrm{ref}}(\mathcal{Y}_w\mid x) } \\ &\qquad\qquad\qquad -\beta \log \frac{ \pi_\theta(\mathcal{Y}_l\mid x) }{ \pi_{\mathrm{ref}}(\mathcal{Y}_l\mid x) } \Bigg) \Bigg], \end{aligned}

其中 σ(z)=1/(1+exp(z))\sigma(z)=1/(1+\exp(-z)),公开配置取 β=0.1\beta=0.1。定义

Δθ=[logπθ(Ywx)logπref(Ywx)][logπθ(Ylx)logπref(Ylx)], \begin{aligned} \Delta_\theta &= \left[ \log\pi_\theta(\mathcal{Y}_w\mid x) -\log\pi_{\mathrm{ref}}(\mathcal{Y}_w\mid x) \right] \\ &\qquad - \left[ \log\pi_\theta(\mathcal{Y}_l\mid x) -\log\pi_{\mathrm{ref}}(\mathcal{Y}_l\mid x) \right], \end{aligned}

LDPO=E[logσ(βΔθ)]. \mathcal{L}_{\mathrm{DPO}} = -\mathbb{E}\left[\log\sigma(\beta\Delta_\theta)\right].

最小化该目标会提高 preferred response 相对 reference policy 的对数似然增量,同时压低 rejected response 的相对增量。这里的“偏好”不是直接人类偏好,而是由自动 claim F1 构造的伪偏好;因此更准确的名称是 metric-derived preference optimization

3.4 训练与推理配置

Stage论文配置公开配置
SFT/RFT backboneQwen3-VL-8B匹配
SFT/RFT epoch1匹配
GPU / batch8 张 A800;每卡 2脚本按 8 卡、每卡 2,global batch 32
LLM learning rate1×1051\times10^{-5}脚本为 5×1065\times10^{-6}
merger learning rate1×1051\times10^{-5}匹配
vision learning rate2×1062\times10^{-6}匹配
DPO learning rate5×1075\times10^{-7}YAML 为 1×1061\times10^{-6}
DPO β\beta0.1匹配
DPO vision towerfrozen匹配;projector 也被冻结
inference temperature0.3匹配
maximum generated tokens400开源 WeatherSyn 推理脚本默认 600,运行脚本未覆盖

这些差异并不自动否定结果,但会阻止严格复现;作者应说明论文表格究竟使用了哪组配置。

4. 评估指标及其数学含义

4.1 Claim extractor 的全局一致性

对全部天、全部样本累计 TP、FP、FN:

Precision=TPTP+FP,Recall=TPTP+FN, \mathrm{Precision} = \frac{\sum \mathrm{TP}} {\sum \mathrm{TP}+\sum \mathrm{FP}}, \qquad \mathrm{Recall} = \frac{\sum \mathrm{TP}} {\sum \mathrm{TP}+\sum \mathrm{FN}},
F1=2PrecisionRecallPrecision+Recall. \mathrm{F1} = \frac{ 2\cdot\mathrm{Precision}\cdot\mathrm{Recall} }{ \mathrm{Precision}+\mathrm{Recall} }.

这是 micro-style 的全局聚合,会被高频类别主导。

4.2 测试集的 aspect-level 指标

对于 aspect aa 下的 claim cc

Precisiona,c=TPa,cTPa,c+FPa,c,Recalla,c=TPa,cTPa,c+FNa,c. \mathrm{Precision}_{a,c} = \frac{\mathrm{TP}_{a,c}} {\mathrm{TP}_{a,c}+\mathrm{FP}_{a,c}}, \qquad \mathrm{Recall}_{a,c} = \frac{\mathrm{TP}_{a,c}} {\mathrm{TP}_{a,c}+\mathrm{FN}_{a,c}}.

论文定义 claim 支持数

na,c=TPa,c+FNa,c, n_{a,c} = \mathrm{TP}_{a,c} +\mathrm{FN}_{a,c},

并使用逆频率权重

wa,c=1na,c,w~a,c=wa,ccawa,c. w_{a,c} = \frac{1}{n_{a,c}}, \qquad \widetilde{w}_{a,c} = \frac{w_{a,c}} {\sum_{c'\in a} w_{a,c'}}.

于是

Weighted Precisiona=caw~a,cPrecisiona,c, \mathrm{Weighted\ Precision}_a = \sum_{c\in a} \widetilde{w}_{a,c} \mathrm{Precision}_{a,c},
Weighted Recalla=caw~a,cRecalla,c, \mathrm{Weighted\ Recall}_a = \sum_{c\in a} \widetilde{w}_{a,c} \mathrm{Recall}_{a,c},
Weighted F1a=2Weighted PrecisionaWeighted RecallaWeighted Precisiona+Weighted Recalla. \mathrm{Weighted\ F1}_a = \frac{ 2\cdot \mathrm{Weighted\ Precision}_a \cdot \mathrm{Weighted\ Recall}_a }{ \mathrm{Weighted\ Precision}_a + \mathrm{Weighted\ Recall}_a }.

这里有一个术语问题:主文说指标“according to class frequency”加权,通常 weighted F1 是按 na,cn_{a,c} 正向加权;本文却按 1/na,c1/n_{a,c} 反向加权,主动放大稀有类别。因此它更接近 rare-class-balanced score,而不是标准 frequency-weighted F1。该选择可以有合理动机,但必须明确,否则分数难与其他论文直接比较。

公开评分代码还有一个更具体的问题:它只遍历参考答案中出现的 aspect。若预测额外生成了一个参考中完全不存在的 aspect,该 aspect 的 claim 不会进入 FP 统计。换言之,指标会惩罚“同一目标 aspect 内的错误类别”,却可能不惩罚“额外捏造一个方面”。Aspect-controlled prompt 缓解但没有消除这一问题。

4.3 其他评估

  • Reference-based:BLEU-1、ROUGE-L、METEOR,衡量表面重合;
  • Automatic claim-based:Qwen-2.5-72B 自动抽取;
  • Human-refined claim-based:Qwen 与 Llama-3.3-70B 抽取冲突时人工修正;
  • LLM ranking:在 144 个测试报告上,由 GPT-5、Gemini-2.5-Flash、Claude-3.7-Sonnet、DeepSeek-Chat 排序 Fact.Cons. 与 Summ.Qual.,报告 Top-1 vote rate;
  • Expert evaluation:3 位专家可参考 ground truth 修正 LLM 的 Top-1 判断。

排序优于绝对打分,但论文没有报告候选顺序随机化、重复 judge sampling、judge 间一致性或专家 inter-annotator agreement。公开脚本的候选顺序固定,因此存在位置偏差风险。

5. 主要结果:数字真正支持了什么

5.1 综合结果

MethodBLEU-1ROUGE-LMETEORAuto F1Human-refined F1LLM Fact. Top-1Expert Fact. Top-1
GPT-4.1-Mini, 2-shot0.200.150.130.490.480.010.01
GPT-5-Nano, 2-shot0.160.130.100.470.480.030.02
GPT-5.2-Thinking, 2-shot0.120.120.110.490.490.060.07
Gemini-3 Pro Preview, 2-shot0.370.280.230.600.600.240.29
Claude-3.7-Sonnet, 2-shot0.090.100.170.510.500.020.01
WeatherQA on Qwen3-VL-8B0.190.150.140.360.360.010.01
OmniEarth on Qwen3-VL-8B0.170.170.140.400.400.010.01
WeatherSyn-SFT0.430.310.250.550.540.110.11
WeatherSyn-RFT0.430.310.250.590.590.160.17
WeatherSyn-DPO0.440.320.250.590.590.330.29

可支持的结论:

  • 领域 SFT 大幅提升参考文本相似度;
  • RFT 把自动 claim F1 从 0.55 提到 0.59;
  • DPO 对 claim F1 没有继续提升,但显著提高了 LLM/专家排序中的 Top-1 比例;
  • 自动 claim 与人工修正版 F1 差异约为 0–0.01,说明粗粒度 claim extractor 在该体系内较稳定。

不能支持的强结论:

  • 论文写“WeatherSyn consistently outperforms all baseline methods across all evaluation metrics”,但 Gemini-3 Pro 的 automatic/human-refined F1 为 0.60,高于 WeatherSyn-RFT/DPO 的 0.59;
  • Expert Fact.Cons. 上 WeatherSyn-DPO 与 Gemini-3 Pro 同为 0.29,不是严格胜出;
  • DPO 并非整体提高:它主要改善排序型指标,在 aspect F1 上与 RFT 同均值,并让 humidity、frontal system、wind-flow system 等方面下降。

5.2 八个气象方面

MethodTemp.WindHumidityFrontPressureWaveWind FlowEventAverage
Gemini-3 Pro Preview0.500.630.600.480.680.600.640.690.60
WeatherSyn-SFT0.420.610.510.420.700.560.590.640.55
WeatherSyn-RFT0.430.620.630.430.700.640.720.660.59
WeatherSyn-DPO0.420.640.600.360.720.650.700.670.59

RFT 对 humidity、wave pattern、wind-flow system 的提升明显,符合“多样化文本有助于低频结构性 claim”的故事。但 WeatherSyn 并非八个方面都优于最新闭源 baseline:temperature、frontal system、event 均低于 Gemini-3 Pro。

5.3 数据量曲线并非单调

论文说“performance consistently improves as the training corpus expands”。图 4 实际显示:

  • temperature 在 2–4 条附近小幅波动,第 5 条下降;
  • humidity 在第 2 条跃升,3–4 条略降,第 5 条再升;
  • pressure system 在第 2 条达到约 0.71,之后基本平台;
  • wave pattern 在第 4 条约 0.64,第 5 条回落到约 0.59;
  • wind-flow system 近似单调提升,从约 0.55 到 0.75。

参考指标也在最多 3 条报告时达到峰值:

Maximum reports per input12345
BLEU-10.43690.43940.44260.43670.4276
ROUGE-L0.31200.31710.31750.31520.3081
METEOR0.24770.25130.25250.25080.2471

更准确的结论是:适量增加候选报告通常有帮助,但收益因 aspect 而异,并在 3–4 条后饱和或回落。

5.4 预报时效

Day 1 到 Day 4 的曲线总体下降,尤其 frontal system:

  • WeatherSyn-RFT frontal F1 从约 0.47/0.51 降至约 0.34;
  • WeatherSyn-SFT 从约 0.51 降至约 0.18;
  • event 的下降较缓;
  • temperature 并非逐日单调,RFT 在 Day 2–3 略高于 Day 1,Day 4 才明显下降。

因此“所有模型一致、单调下降”写得过强;但“更远时效更难、RFT 对 frontal/event 的衰减有缓解”基本得到曲线支持。没有误差条和多随机种子,无法判断小幅变化是否显著。

5.5 视觉输入消融

Visual inputTemp.WindHumidityFrontPressureWaveWind FlowEventAverage
Regional single-level0.430.620.630.430.700.640.720.660.59
Add pressure-level variables0.440.610.610.430.720.620.700.630.59
Add broader CONUS context0.420.590.650.410.700.610.610.630.57

增加三维 pressure-level 场没有稳定收益,扩大空间范围反而略降。可能解释包括:

  • Qwen3-VL 的视觉 token 预算被更多图像稀释;
  • 热力图并不是编码连续气象场的高效方式;
  • 报告标签与局地/单层变量相关性更直接;
  • 训练数据规模不足,模型无法学会多层、多尺度融合。

这不能推出“pressure-level 或大尺度场不重要”;更可能说明当前 MLLM 输入接口没有有效利用它们。

5.6 HRES 未来场

附录把输入替换为 HRES 的 1–4 日预报场后,多数 aspect 随可见预报时效增加而提升,3 日以后趋于平台或轻微下降。这个实验非常关键:它说明报告生成质量受益于真正的未来数值预报信息。

更合理的工程定位因此不是“取消 NWP 中间步骤”,而是:

NWP/AI forecast fields+observationsMLLM report synthesis. \mathrm{NWP/AI\ forecast\ fields} +\mathrm{observations} \longrightarrow \mathrm{MLLM\ report\ synthesis}.

让 MLLM 负责多源融合、内容选择和语言表达,比要求它从单时刻热力图隐式重建四日动力学更可信。

6. Claims \to Evidence 映射

Claim类型证据强度主要风险
提出首个通用 WFR 指令微调数据与模型数据/任务WSInstruct、代码、模型公开;相关工作对比中–强“首个”依赖检索范围;CLLMate 已有 ERA5 \to 事件文本任务
WeatherSyn 全面优于领先闭源 MLLM经验综合表和 aspect 表弱/被部分反驳Gemini-3 Pro 在平均 claim F1 及多个方面更高
RFT 的词汇多样性提高报告质量经验SFT 0.55 \to RFT 0.59;数据量消融无匹配训练步数的重复数据 baseline;公开 RFT 文件没有多样候选
DPO 进一步增强模型经验LLM/专家 Top-1 大幅提升claim F1 不升,多方面下降;偏好由同一自动指标产生
模型具有跨区域 zero-shot 泛化经验同区域半城市、南北、东西 split仍在同一国家、同一报告体系、同一年份;与闭源 2-shot 比较不等于全球 OOD
模型捕获 underlying meteorological dynamics机制性cross-city F1 和曲线无物理变量预测、守恒检验、反事实或动态 probe;可能来自气候和语言先验
更丰富的训练报告持续改善性能经验数据量曲线被部分反驳多个 aspect 和全部参考指标在 3–5 条间回落
Aspect control 解决频率偏差经验hit rate 从 0.12/0.16 到 0.94同时把开放式内容选择外包给 prompt

7. 实验设计与公平性

做得好的地方

  • 按年份分割,公开数据中未发现图像路径跨 train/test 重叠;
  • 同时报告 lexical、claim、LLM 和 expert 评价;
  • 公开 31 城市的样本量和 claim 分布;
  • 对方面控制、数据量、时效、地理区域、pressure-level、空间范围和 HRES 输入做了多种分析;
  • 闭源 baseline 使用同月份历史样本作为 2-shot 示例,至少考虑了季节相关性。

关键缺口

  1. 缺少原始 Qwen3-VL-8B baseline。 没有同 backbone 的 zero-shot/2-shot 结果,无法直接量化 WSInstruct 微调相对于基础模型的增益。
  2. 没有训练步数匹配的 RFT 对照。 RFT 数据更多,应该与“把原始 SFT 数据重复到相同步数”比较。
  3. 专业 baseline 并不等价。 WeatherQA/OmniEarth 模型只额外看 100 条 WSInstruct,数据量远小于 WeatherSyn;该比较主要证明任务数据的重要性。
  4. 无统计显著性。 没有多训练种子、bootstrap confidence interval 或 paired test。
  5. LLM judge 候选顺序固定。 没有顺序随机化与 judge 稳定性分析。
  6. 专家评估协议不够透明。 没有专家背景、独立标注流程、原始分歧率或一致性系数。
  7. 评价粒度较粗。 没有温度、降水、风速的定量误差,没有空间落区和时序边界误差,也没有严重漏报/虚警单独统计。
  8. 输入信息不充分。 单时刻的 12 张主要近地面图像与四日专家报告之间存在不可约的信息缺口。

8. 数学与理论严谨性

这篇论文没有定理或收敛证明,数学主要用于定义训练损失和评估指标。公式本身基本是标准 SFT 与 DPO,但存在以下表达问题:

  1. D\mathcal{D} 被写成一个三元组集合,却没有显式样本索引;
  2. ϕ\phi 在 DPO 公式中未在正文定义,标准记号应为 sigmoid σ\sigma
  3. β\beta 只在实现细节中给出;
  4. 多报告 SFT 对 ii 求和但不除以 NN,会使候选更多的输入权重更高;
  5. 主文把指标描述为按类别频率加权,附录和代码实际使用逆频率;
  6. aspect-level F1 是“先加权 P/R、再取调和平均”,不等于对各类 F1 的加权平均;
  7. “从初始状态直接生成四日预报”没有对应的可辨识性假设、物理约束或误差传播分析。

因此,数学没有明显的推导错误,但也没有提供超出标准微调框架的理论保证。论文最需要补的不是更复杂的证明,而是更精确的任务假设和指标定义。

9. 审稿人视角

Strengths

  • 问题真实:将多源天气信息转为公众可读报告确实耗费专家时间;
  • 数据贡献清楚,真实专家文本比纯合成报告更有价值;
  • 训练与评估流程完整,SFT、RFT、DPO 的作用有分阶段结果;
  • 多维消融比一般应用型 MLLM 论文更丰富;
  • 数据、代码和三阶段模型权重已经公开。

Major issues

  1. 核心 headline 与最新表格不一致。 “所有指标、所有方面优于所有闭源模型”被 Gemini-3 Pro 的结果直接反驳。
  2. 公开 RFT 数据无法支持论文所述的多样性机制。 详见后面的代码核验:20,412 行实际是 5,103 个不同样本各重复 4 次,同一输入的四条报告完全相同。
  3. 任务信息不充分且被 prompt 简化。 输入不含未来 NWP,prompt 却给出应讨论的方面;模型的预测能力与报告生成能力没有被分离。
  4. RFT/DPO 与主评价器形成闭环。 同一个 claim extractor/F1 参与数据筛选、偏好构造和主指标,容易造成 metric overfitting。
  5. 缺少统计可靠性。 没有 seed、误差条、显著性和 judge 一致性。

Minor issues

  • “performance consistently improves”等文字没有随新增曲线/新 baseline 更新;
  • 实现细节与公开脚本的学习率、最大生成长度不一致;
  • report、claim、aspect 的计数单位在表 1 中表达不够清楚;
  • city-level 结果把 Honolulu/Flagstaff 的差距归因于地形复杂度,但没有受控证据;
  • 数据和模型 Hugging Face 页面缺少完整 card 与许可证元数据。

Recommendation

Major Revision;若必须在 Accept/Reject 二选一中选择,我会给 Weak Reject。

理由不是任务没有价值,而是当前版本把“领域微调后在自建 claim 体系上更好”外推成“学会气象动力学且全面超过领先闭源模型”,同时公开 RFT 数据又无法复现核心多样性构造。若作者修复数据发布、重新跑匹配训练预算的 RFT 对照、修正 headline、随机化评审顺序并补充定量天气误差,我的判断可以上调到 Weak Accept。

需要说明的是:论文已经被 ICML 2026 接收;上面是基于当前论文、代码和公开数据的独立技术判断,不是会议官方意见。

10. 与相关工作的定位

工作输入/任务相比 WeatherSyn 的优势相比 WeatherSyn 的不足
WeatherQA (2024)多张天气图;强对流区域与发展潜势问答/分类严重天气推理目标清楚,含人类差距分析不是通用逐日报告生成
CLLMate (2024)ERA5 与 26,156 篇环境新闻;天气/气候事件预测规模更大,事件与影响叙事更丰富新闻与城市业务预报不同,文本对齐更噪声
OmniEarth-Bench (2025)六大地球圈层、多任务 benchmark覆盖广、专家评估维度多主要是 benchmark,不专注四日报告
Omni-Weather (2025)雷达生成、理解与因果解释将天气场生成与理解统一,更接近动态建模聚焦雷达/降水,不是常规城市综合报告
WeatherSyn (2026)12 张 ERA5 热力图与 aspect prompt;四日报告真实业务文本、开放式报告、可控生成地域单一、动力信息不足、指标闭环明显

一句话定位:WeatherSyn 是城市级天气文字产品生成的数据与训练工程贡献,而不是新的天气预报架构。它最适合作为 NWP/AI 数值预报之后的 report synthesis 模块,而不是替代 NWP。

11. 公开代码与数据核验

11.1 核验范围

2026-07-30 对官方仓库提交 e506fe9c2474b919abf4684bad2e9931e6a9db92 进行只读检查,并读取 Hugging Face 数据集版本 606cead619f69e61c1c58a878053fb04e26554d0

公开仓库包含:

  • SFT、RFT、DPO 的训练与推理脚本;
  • Qwen3-VL 全参数微调代码;
  • LLaMA-Factory DPO 配置;
  • automatic claim、BLEU/ROUGE/METEOR、LLM ranking 代码;
  • WSInstruct 数据与 SFT/RFT/DPO 三个模型权重。

对非 vendored 的 Python 源码执行语法编译检查,检查通过。没有运行 8 张 A800 的完整训练,也没有调用闭源模型重跑基准,因此下述结论是代码–论文映射与数据完整性审计,不是性能复现实验。

11.2 Claims \to Code

Claim论文描述公开实现状态
BackboneQwen3-VL-8BQwen/Qwen3-VL-8B-Instruct匹配
SFT/RFT视觉塔、merger、LLM 全部训练三者均未冻结匹配
DPO以 RFT 为 reference,冻结 visionLLaMA-Factory stage: dpo,vision/projector frozen基本匹配
DPO β\beta0.1pref_beta: 0.1匹配
SFT/RFT LLM LR1×1051\times10^{-5}5×1065\times10^{-6}不匹配
DPO LR5×1075\times10^{-7}1×1061\times10^{-6}不匹配
Inference max tokens400WeatherSyn 脚本默认 600不匹配
RFT 多样候选构造40 次采样、F1 筛选、4 种距离发布训练脚本只消费已生成 JSON,未发现完整构造脚本未公开/未找到
Claim metric逆频率加权代码确实使用 1/count1/\mathrm{count}匹配,但命名易误导
LLM judges4 个模型管线列出 4 个模型部分可用;Claude key 与映射不一致

11.3 最严重的发布数据异常:RFT 不是四条多样报告

对公开 json/rft/annotation_train_merged.json 的实际统计:

  • 总行数:20,412;
  • 不同图像集合:5,103;
  • 每个图像集合恰好出现 4 次;
  • 对同一图像集合,4 行除了 id 外,image、prompt、assistant report、daily_forecastExpected_format 完全相同;
  • 因此不同的 (input, report) 对实际只有 5,103 个,而不是 20,412 个。

这与论文“为每个输入保留多条 lexically diverse reports”的叙述冲突。存在两种可能:

  1. 论文实验使用了正确的内部多样数据,但 Hugging Face 打包时错误地把一条报告复制了四次;
  2. 实验也使用了当前文件,此时 RFT 增益可能来自重复数据带来的额外优化步数,而非词汇多样性。

现有证据不能区分两者,所以不能直接断言论文实验错误;但这是必须修复的 reproducibility blocker。

11.4 评价实现中的问题

  1. 自动 claim 评分只遍历 ground-truth aspect,预测中额外出现的其他 aspect 可能不计 FP;
  2. LLM ranking 的 appendix prompt 写 9 个候选,公开代码实际提供 11 个,system prompt 又写“eight candidate”;
  3. 候选按模型列表固定映射为 R1–R11,没有随机排列;
  4. pipeline 调用 claude-3-7-sonnet-20250219,但公开 llm_to_api 字典只有 claude-3-5-sonnet-20240620,按当前代码会触发 key error;
  5. 公开脚本没有固定 WeatherSyn 推理随机种子,且没有多次运行聚合;
  6. RFT 数据构造、人工修正过程和 expert evaluation 原始记录未发布,关键中间步骤无法审计。

11.5 可复现性结论

可审计性:中等。 模型、最终数据和主要训练/评分框架公开,优于只给论文的工作。

端到端可复现性:偏低。 超参数不一致、RFT 数据异常、数据构造脚本缺失、LLM judge 脚本不一致,会阻止从原始报告完整重建表格。

12. 最有价值的后续实验

如果要把这项工作做得更可信,我会优先做:

  1. 修复并版本化 RFT 数据,为每个输入保存候选来源、逐日 F1、四种距离和最终组合;
  2. 训练预算匹配对照:原始 SFT 数据重复 4 次 vs 4 条真正不同的报告;
  3. 信息源分解:city/time only、images only、aspect only、images + aspect,判断模型到底依赖什么;
  4. NWP-conditioned 主任务:把 HRES/GraphCast/Pangu 等未来场作为标准输入,而不是只放附录;
  5. 定量事实指标:温度趋势与数值误差、降水概率/强度、风向风速、front 位置和到达时间;
  6. 开放式 salience 评估:测试不给 aspect 时模型能否选对最重要内容;
  7. 跨分布测试:跨国家、跨预报中心、跨写作规范、极端年份;
  8. 统计检验:至少 3 个训练种子,对样本做 paired bootstrap,并报告置信区间;
  9. judge 稳健性:随机化候选顺序、多人专家盲评、报告 Krippendorff's alpha 或 Fleiss' kappa;
  10. 物理一致性 probe:检查报告是否与输入场、未来 NWP 场和基本动力学约束一致。

13. 可复用思想

  • 将开放式科学报告先投影到领域 claim ontology,再做细粒度评估;
  • 用逐时间步 rejection sampling,避免完整长报告几乎不可能全对的问题;
  • 把 lexical diversity 作为受事实约束的数据增强目标;
  • 将自动指标产生的偏好对用于 DPO,但必须用独立指标和人工评估防止闭环;
  • 对科学 MLLM,输入模态消融不仅要“多加图”,还要检查视觉 token 预算和信息密度。

14. 科研品味评分

text
创新性 (Novelty):        ★★★☆☆ (3/5)
  - WFR 数据与真实业务报告对齐有新意
  - SFT/RFT/DPO 方法本身标准,架构没有创新

严谨性 (Rigor):         ★★☆☆☆ (2/5)
  - 评估维度丰富,年份切分合理
  - headline 与表格冲突,缺少显著性,指标闭环明显
  - 公开 RFT 数据异常严重影响复现

影响力 (Impact):        ★★★☆☆ (3/5)
  - 数据集和任务可能推动天气报告生成
  - 更合理的落点是 NWP 后处理,而非替代数值预报
  - 跨国家、跨系统的真实部署价值尚未验证

Innovation Score: 5.5/10

任务与数据贡献高于方法贡献。若公开数据问题修复,并证明多样 RFT 在匹配训练预算下仍有效,可提高到 6–7 分。

个人跟进决策

  • [ ] 非常值得:直接复现并沿此方向做后续
  • [x] 值得参考:claim-based evaluation、逐日 rejection sampling 和 NWP-conditioned report generation 值得吸收
  • [ ] 了解即可
  • [ ] 值得 avoid

如果要跟进,我不会继续强化“单初始场直接写四日报告”,而会研究:

ensemble forecast fields+observations+retrieved local knowledgecalibrated report+evidence trace. \mathrm{ensemble\ forecast\ fields} +\mathrm{observations} +\mathrm{retrieved\ local\ knowledge} \longrightarrow \mathrm{calibrated\ report} +\mathrm{evidence\ trace}.

也就是让语言模型做可追溯、可校准的预报解释器,而不是隐式替代动力学预报器。

Reviewer Feedback 访问记录

论文有公开 OpenReview 投稿附件,但 2026-07-30 访问讨论树时,OpenReview 页面与 API 均被站点的动态 Challenge/网络策略拦截,未能可靠读取 Official Review、作者回复、Meta Review 与 Decision note。因此这里不能写成“没有评审”或“没有 rebuttal”,也不对评分与争议点做猜测。会议接收状态由 arXiv、ICML 页面、accepted TeX 和官方代码仓库交叉确认。

来源与核验记录

Static research notes built with VitePress and KaTeX.