Theme
WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation
一句话结论
WeatherSyn 的真正贡献是把美国国家气象局 Area Forecast Discussion 与 ERA5 热力图对齐,建立了“气象图像
先给判断:这篇论文最值得读什么
这不是一篇提出新视觉编码器、注意力机制或天气动力学模型的论文。其价值集中在三个层面:
- 任务层面:把天气 AI 从数值场预测、极端事件分类进一步推到面向公众的开放式多日文字报告。
- 数据层面:构建 WSInstruct,将 31 个美国城市的 ERA5 多变量热力图与专家撰写的预报讨论对齐,并把开放文本拆成 8 个气象方面、18 个离散 claim。
- 评估层面:不只报告 BLEU/ROUGE,而是把报告重新抽取为离散气象 claim,再计算精确率和 F1,并补充 LLM 排序与专家修正。
最需要警惕的则是:任务被 aspect-controlled prompt 显著简化;“直接从初始场预报四天”的信息是否充分没有得到论证;论文正文的若干“全面优于”“持续提升”与表格、曲线并不完全一致;公开代码和数据与论文超参数及 RFT 构造存在多处差异。
1. 问题定义:它究竟在预测什么
1.1 论文的形式化
论文把天气预报报告数据写为
其中:
| 符号 | 含义 | 本文中的实际对象 |
|---|---|---|
| 空间位置 | 一个城市或对应的 NWS 预报办公室区域 | |
| 输入时刻 | ERA5 初始状态的时间戳 | |
| 最远预报跨度 | 最多 4 个逐日时段 | |
| 指令 | 城市、时间、输出模板,以及每一天应讨论的气象方面 | |
| 多图像输入 | 同一时刻的 12 张变量热力图 | |
| 参考报告 | 专家撰写并被切分、重组为逐日报告的文本 | |
| 模型输出 | 条件生成的四日天气报告 |
论文将图像集合写为
因此模型学习的是条件分布
若把报告表示为长度为
论文没有报告每张图的固定像素尺寸、视觉 token 数或完整张量维度。公开训练脚本把图像像素预算设为从
1.2 一个必须先澄清的概念:报告生成不等于数值天气预报
输入只含时刻
从统计角度看,论文实际学习的是
而不是一个被物理约束的状态转移算子
这一区别非常重要。WeatherSyn 可能利用了以下信号:
- 当前天气场中的持续性和上游空间结构;
- 城市与月份对应的气候先验;
- 训练语料中常见的报告表达与事件共现;
- prompt 直接给出的目标气象方面。
这些信号足以提高 claim 匹配率,却不等价于模型学会了可验证的四日大气动力学。论文附录中加入 HRES 未来场后性能进一步上升,反而支持“原始输入缺失关键未来信息”这一解释。
2. WSInstruct 数据是怎样构造的
2.1 文本来源与时间切分
原始文字来自 Iowa Environmental Mesonet 保存的 NWS Area Forecast Discussion。作者:
- 每个城市每天至多保留一份报告,并过滤时间上相邻的报告;
- 用正则表达式识别 Today、星期名等相对日期;
- 用
dateparser将其映射为绝对日期; - 仅保留覆盖前四天中至少三天的报告;
- 用 Qwen-2.5-72B 将原报告切成逐日子报告;
- 用正则检查子句是否来自原文、日期是否一致,对不匹配样本人工修正。
这里的优点是保留了真实专家文本而不是让 LLM 从零合成标签。风险是时间切分本身仍由 LLM 完成;论文没有报告需要人工修正的样本比例,也没有给出切分的一致性统计。
2.2 Claim 体系
作者把报告归纳为 8 个方面、18 个类别:
| Aspect | Claim categories |
|---|---|
| Temperature | hot/warm, cool/cold, moderate |
| Wind | strong wind, light wind |
| Humidity | dry air, moist air |
| Frontal System | cold front, warm front |
| Pressure System | high pressure, low pressure |
| Wave Pattern | ridge, trough |
| Wind Flow System | onshore flow, offshore flow |
| Event | precipitation, snow, storm |
Qwen-2.5-72B 根据专家定义的关键词和示例执行语义分类。作者让领域训练过的标注员修正全部 1,292 条测试报告的抽取结果,并报告抽取 F1 为 94%。这是评估管线中一个有价值的质量控制,但公开数据没有单独提供“模型原始抽取
类别体系也有明显的信息压缩。例如:
- “温度从
降到 ”与“略微降温”都可能只映射为 cool/cold; - 降水的强度、概率、位置和时间可能都被压成 precipitation;
- front、ridge、trough 的位置和移动方向没有进入 claim;
- 同一类别下严重错误的定量值仍可能得到 TP。
所以 claim F1 衡量的是粗粒度语义槽位是否匹配,不是完整气象事实的一致性。
2.3 Aspect-controlled prompting
每个预测日的 prompt 会显式给出:
text
<<date, weekday>> Report:
## Focus on: Temperature, Humidity它不泄露 hot/cold、dry/moist 等具体取值,但泄露了参考报告选择讨论哪些变量。这个设计让不同模型的输出范围可比,也减少开放式报告“一方谈风、一方谈温度”造成的不可评估性。
代价是任务从“模型自主决定什么最重要”变成了“在给定槽位内生成内容”。表 3 的消融非常说明问题:
| 训练时 aspect control | 测试时 aspect control | 平均 aspect hit rate |
|---|---|---|
| 否 | 否 | 0.16 |
| 是 | 否 | 0.12 |
| 是 | 是 | 0.94 |
因此,0.94 主要证明模型能遵循方面指令,并不能证明它能自主发现未来几天最值得报告的气象要素。对于“减轻预报员人工分析负担”的应用动机,这是一项实质性的任务简化。
2.4 图像输入与数据划分
每个样本使用 ERA5 的 12 个 single-level 变量:
- land-sea mask;
- 10 m
风; - 10 m
风; - 2 m 温度;
- 海平面气压;
- 海表温度;
- 雪深;
- 地面气压;
- 总云量;
- 过去 6 小时总降水;
- 整层水汽;
- 整层液态水。
ERA5 原始分辨率为
数据规模为:
| Split | 年份 | 论文报告行数 |
|---|---|---|
| WSInstruct / SFT | 2017–2021 | 6,344 |
| WSInstruct-RFT | 2017–2020 | 20,412 |
| WSInstruct-DPO | 2021 | 1,241 |
| Test | 2022 | 1,292 |
年份切分是合理的,公开 JSON 中训练与测试图像路径没有重叠。与此同时,样本均来自同一国家、同一类业务文本和相近的数据处理流程;这避免了随机切分泄漏,却没有验证跨国家、跨机构写作规范或跨数据源泛化。
3. 三阶段训练:逐式拆解
3.1 Stage 1:SFT
基础模型为 Qwen3-VL-8B-Instruct。论文写出的目标是
在 SFT 阶段
这就是标准多模态自回归交叉熵。论文没有提出新的 backbone 模块、视觉融合层或损失;视觉编码、merger 和语言模型均来自 Qwen3-VL,并在 SFT/RFT 时全部解冻。
3.2 Stage 2:RFT
作者对 2017–2020 的每个输入用 SFT 模型采样 40 份报告:
随后:
- 用 Qwen-2.5-72B 对每一天抽取 claim;
- 计算该天相对于参考报告的 F1;
- 只保留 step-level F1 等于 1 的子报告;
- 以 edit distance、TF-IDF、Jaccard 和 Sentence-BERT cosine distance 选择相对参考报告最不相似的候选;
- 随机拼接不同日期的候选子报告,形成多条完整报告;
- 从基础 Qwen3-VL-8B 重新在增强语料上微调,得到 WeatherSyn-RFT。
核心直觉是:在 claim 不变的约束下增加措辞多样性,迫使模型学习图像–气象语义,而不是背固定句式。
但该过程存在三层风险:
- 评价器闭环:用于筛选 RFT 数据的 Qwen claim extractor 与主测试指标相同,模型可能更适应评价器的离散标签,而不是真实预报质量;
- step 拼接破坏篇章一致性:各日子报告分别正确,不保证组合后的四日报告在天气系统演变上连贯;
- 样本权重变化:论文公式对同一输入的
个报告求和,因此拥有更多候选的输入会获得更大梯度权重;若实现把每条候选展开为独立行,同样会增加该输入出现的次数。需要匹配训练步数的重复训练 baseline 才能把“多样性收益”和“更多更新次数”分开。
3.3 Stage 3:DPO
对 2021 年每个输入,WeatherSyn-RFT 再生成 40 个候选。作者把逐日 F1 等于 1 的子报告拼成 preferred response
令
论文的 DPO 目标为
其中
则
最小化该目标会提高 preferred response 相对 reference policy 的对数似然增量,同时压低 rejected response 的相对增量。这里的“偏好”不是直接人类偏好,而是由自动 claim F1 构造的伪偏好;因此更准确的名称是 metric-derived preference optimization。
3.4 训练与推理配置
| Stage | 论文配置 | 公开配置 |
|---|---|---|
| SFT/RFT backbone | Qwen3-VL-8B | 匹配 |
| SFT/RFT epoch | 1 | 匹配 |
| GPU / batch | 8 张 A800;每卡 2 | 脚本按 8 卡、每卡 2,global batch 32 |
| LLM learning rate | 脚本为 | |
| merger learning rate | 匹配 | |
| vision learning rate | 匹配 | |
| DPO learning rate | YAML 为 | |
| DPO | 0.1 | 匹配 |
| DPO vision tower | frozen | 匹配;projector 也被冻结 |
| inference temperature | 0.3 | 匹配 |
| maximum generated tokens | 400 | 开源 WeatherSyn 推理脚本默认 600,运行脚本未覆盖 |
这些差异并不自动否定结果,但会阻止严格复现;作者应说明论文表格究竟使用了哪组配置。
4. 评估指标及其数学含义
4.1 Claim extractor 的全局一致性
对全部天、全部样本累计 TP、FP、FN:
这是 micro-style 的全局聚合,会被高频类别主导。
4.2 测试集的 aspect-level 指标
对于 aspect
论文定义 claim 支持数
并使用逆频率权重
于是
这里有一个术语问题:主文说指标“according to class frequency”加权,通常 weighted F1 是按
公开评分代码还有一个更具体的问题:它只遍历参考答案中出现的 aspect。若预测额外生成了一个参考中完全不存在的 aspect,该 aspect 的 claim 不会进入 FP 统计。换言之,指标会惩罚“同一目标 aspect 内的错误类别”,却可能不惩罚“额外捏造一个方面”。Aspect-controlled prompt 缓解但没有消除这一问题。
4.3 其他评估
- Reference-based:BLEU-1、ROUGE-L、METEOR,衡量表面重合;
- Automatic claim-based:Qwen-2.5-72B 自动抽取;
- Human-refined claim-based:Qwen 与 Llama-3.3-70B 抽取冲突时人工修正;
- LLM ranking:在 144 个测试报告上,由 GPT-5、Gemini-2.5-Flash、Claude-3.7-Sonnet、DeepSeek-Chat 排序 Fact.Cons. 与 Summ.Qual.,报告 Top-1 vote rate;
- Expert evaluation:3 位专家可参考 ground truth 修正 LLM 的 Top-1 判断。
排序优于绝对打分,但论文没有报告候选顺序随机化、重复 judge sampling、judge 间一致性或专家 inter-annotator agreement。公开脚本的候选顺序固定,因此存在位置偏差风险。
5. 主要结果:数字真正支持了什么
5.1 综合结果
| Method | BLEU-1 | ROUGE-L | METEOR | Auto F1 | Human-refined F1 | LLM Fact. Top-1 | Expert Fact. Top-1 |
|---|---|---|---|---|---|---|---|
| GPT-4.1-Mini, 2-shot | 0.20 | 0.15 | 0.13 | 0.49 | 0.48 | 0.01 | 0.01 |
| GPT-5-Nano, 2-shot | 0.16 | 0.13 | 0.10 | 0.47 | 0.48 | 0.03 | 0.02 |
| GPT-5.2-Thinking, 2-shot | 0.12 | 0.12 | 0.11 | 0.49 | 0.49 | 0.06 | 0.07 |
| Gemini-3 Pro Preview, 2-shot | 0.37 | 0.28 | 0.23 | 0.60 | 0.60 | 0.24 | 0.29 |
| Claude-3.7-Sonnet, 2-shot | 0.09 | 0.10 | 0.17 | 0.51 | 0.50 | 0.02 | 0.01 |
| WeatherQA on Qwen3-VL-8B | 0.19 | 0.15 | 0.14 | 0.36 | 0.36 | 0.01 | 0.01 |
| OmniEarth on Qwen3-VL-8B | 0.17 | 0.17 | 0.14 | 0.40 | 0.40 | 0.01 | 0.01 |
| WeatherSyn-SFT | 0.43 | 0.31 | 0.25 | 0.55 | 0.54 | 0.11 | 0.11 |
| WeatherSyn-RFT | 0.43 | 0.31 | 0.25 | 0.59 | 0.59 | 0.16 | 0.17 |
| WeatherSyn-DPO | 0.44 | 0.32 | 0.25 | 0.59 | 0.59 | 0.33 | 0.29 |
可支持的结论:
- 领域 SFT 大幅提升参考文本相似度;
- RFT 把自动 claim F1 从 0.55 提到 0.59;
- DPO 对 claim F1 没有继续提升,但显著提高了 LLM/专家排序中的 Top-1 比例;
- 自动 claim 与人工修正版 F1 差异约为 0–0.01,说明粗粒度 claim extractor 在该体系内较稳定。
不能支持的强结论:
- 论文写“WeatherSyn consistently outperforms all baseline methods across all evaluation metrics”,但 Gemini-3 Pro 的 automatic/human-refined F1 为 0.60,高于 WeatherSyn-RFT/DPO 的 0.59;
- Expert Fact.Cons. 上 WeatherSyn-DPO 与 Gemini-3 Pro 同为 0.29,不是严格胜出;
- DPO 并非整体提高:它主要改善排序型指标,在 aspect F1 上与 RFT 同均值,并让 humidity、frontal system、wind-flow system 等方面下降。
5.2 八个气象方面
| Method | Temp. | Wind | Humidity | Front | Pressure | Wave | Wind Flow | Event | Average |
|---|---|---|---|---|---|---|---|---|---|
| Gemini-3 Pro Preview | 0.50 | 0.63 | 0.60 | 0.48 | 0.68 | 0.60 | 0.64 | 0.69 | 0.60 |
| WeatherSyn-SFT | 0.42 | 0.61 | 0.51 | 0.42 | 0.70 | 0.56 | 0.59 | 0.64 | 0.55 |
| WeatherSyn-RFT | 0.43 | 0.62 | 0.63 | 0.43 | 0.70 | 0.64 | 0.72 | 0.66 | 0.59 |
| WeatherSyn-DPO | 0.42 | 0.64 | 0.60 | 0.36 | 0.72 | 0.65 | 0.70 | 0.67 | 0.59 |
RFT 对 humidity、wave pattern、wind-flow system 的提升明显,符合“多样化文本有助于低频结构性 claim”的故事。但 WeatherSyn 并非八个方面都优于最新闭源 baseline:temperature、frontal system、event 均低于 Gemini-3 Pro。
5.3 数据量曲线并非单调
论文说“performance consistently improves as the training corpus expands”。图 4 实际显示:
- temperature 在 2–4 条附近小幅波动,第 5 条下降;
- humidity 在第 2 条跃升,3–4 条略降,第 5 条再升;
- pressure system 在第 2 条达到约 0.71,之后基本平台;
- wave pattern 在第 4 条约 0.64,第 5 条回落到约 0.59;
- wind-flow system 近似单调提升,从约 0.55 到 0.75。
参考指标也在最多 3 条报告时达到峰值:
| Maximum reports per input | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| BLEU-1 | 0.4369 | 0.4394 | 0.4426 | 0.4367 | 0.4276 |
| ROUGE-L | 0.3120 | 0.3171 | 0.3175 | 0.3152 | 0.3081 |
| METEOR | 0.2477 | 0.2513 | 0.2525 | 0.2508 | 0.2471 |
更准确的结论是:适量增加候选报告通常有帮助,但收益因 aspect 而异,并在 3–4 条后饱和或回落。
5.4 预报时效
Day 1 到 Day 4 的曲线总体下降,尤其 frontal system:
- WeatherSyn-RFT frontal F1 从约 0.47/0.51 降至约 0.34;
- WeatherSyn-SFT 从约 0.51 降至约 0.18;
- event 的下降较缓;
- temperature 并非逐日单调,RFT 在 Day 2–3 略高于 Day 1,Day 4 才明显下降。
因此“所有模型一致、单调下降”写得过强;但“更远时效更难、RFT 对 frontal/event 的衰减有缓解”基本得到曲线支持。没有误差条和多随机种子,无法判断小幅变化是否显著。
5.5 视觉输入消融
| Visual input | Temp. | Wind | Humidity | Front | Pressure | Wave | Wind Flow | Event | Average |
|---|---|---|---|---|---|---|---|---|---|
| Regional single-level | 0.43 | 0.62 | 0.63 | 0.43 | 0.70 | 0.64 | 0.72 | 0.66 | 0.59 |
| Add pressure-level variables | 0.44 | 0.61 | 0.61 | 0.43 | 0.72 | 0.62 | 0.70 | 0.63 | 0.59 |
| Add broader CONUS context | 0.42 | 0.59 | 0.65 | 0.41 | 0.70 | 0.61 | 0.61 | 0.63 | 0.57 |
增加三维 pressure-level 场没有稳定收益,扩大空间范围反而略降。可能解释包括:
- Qwen3-VL 的视觉 token 预算被更多图像稀释;
- 热力图并不是编码连续气象场的高效方式;
- 报告标签与局地/单层变量相关性更直接;
- 训练数据规模不足,模型无法学会多层、多尺度融合。
这不能推出“pressure-level 或大尺度场不重要”;更可能说明当前 MLLM 输入接口没有有效利用它们。
5.6 HRES 未来场
附录把输入替换为 HRES 的 1–4 日预报场后,多数 aspect 随可见预报时效增加而提升,3 日以后趋于平台或轻微下降。这个实验非常关键:它说明报告生成质量受益于真正的未来数值预报信息。
更合理的工程定位因此不是“取消 NWP 中间步骤”,而是:
让 MLLM 负责多源融合、内容选择和语言表达,比要求它从单时刻热力图隐式重建四日动力学更可信。
6. Claims Evidence 映射
| Claim | 类型 | 证据 | 强度 | 主要风险 |
|---|---|---|---|---|
| 提出首个通用 WFR 指令微调数据与模型 | 数据/任务 | WSInstruct、代码、模型公开;相关工作对比 | 中–强 | “首个”依赖检索范围;CLLMate 已有 ERA5 |
| WeatherSyn 全面优于领先闭源 MLLM | 经验 | 综合表和 aspect 表 | 弱/被部分反驳 | Gemini-3 Pro 在平均 claim F1 及多个方面更高 |
| RFT 的词汇多样性提高报告质量 | 经验 | SFT 0.55 | 中 | 无匹配训练步数的重复数据 baseline;公开 RFT 文件没有多样候选 |
| DPO 进一步增强模型 | 经验 | LLM/专家 Top-1 大幅提升 | 中 | claim F1 不升,多方面下降;偏好由同一自动指标产生 |
| 模型具有跨区域 zero-shot 泛化 | 经验 | 同区域半城市、南北、东西 split | 中 | 仍在同一国家、同一报告体系、同一年份;与闭源 2-shot 比较不等于全球 OOD |
| 模型捕获 underlying meteorological dynamics | 机制性 | cross-city F1 和曲线 | 弱 | 无物理变量预测、守恒检验、反事实或动态 probe;可能来自气候和语言先验 |
| 更丰富的训练报告持续改善性能 | 经验 | 数据量曲线 | 被部分反驳 | 多个 aspect 和全部参考指标在 3–5 条间回落 |
| Aspect control 解决频率偏差 | 经验 | hit rate 从 0.12/0.16 到 0.94 | 强 | 同时把开放式内容选择外包给 prompt |
7. 实验设计与公平性
做得好的地方
- 按年份分割,公开数据中未发现图像路径跨 train/test 重叠;
- 同时报告 lexical、claim、LLM 和 expert 评价;
- 公开 31 城市的样本量和 claim 分布;
- 对方面控制、数据量、时效、地理区域、pressure-level、空间范围和 HRES 输入做了多种分析;
- 闭源 baseline 使用同月份历史样本作为 2-shot 示例,至少考虑了季节相关性。
关键缺口
- 缺少原始 Qwen3-VL-8B baseline。 没有同 backbone 的 zero-shot/2-shot 结果,无法直接量化 WSInstruct 微调相对于基础模型的增益。
- 没有训练步数匹配的 RFT 对照。 RFT 数据更多,应该与“把原始 SFT 数据重复到相同步数”比较。
- 专业 baseline 并不等价。 WeatherQA/OmniEarth 模型只额外看 100 条 WSInstruct,数据量远小于 WeatherSyn;该比较主要证明任务数据的重要性。
- 无统计显著性。 没有多训练种子、bootstrap confidence interval 或 paired test。
- LLM judge 候选顺序固定。 没有顺序随机化与 judge 稳定性分析。
- 专家评估协议不够透明。 没有专家背景、独立标注流程、原始分歧率或一致性系数。
- 评价粒度较粗。 没有温度、降水、风速的定量误差,没有空间落区和时序边界误差,也没有严重漏报/虚警单独统计。
- 输入信息不充分。 单时刻的 12 张主要近地面图像与四日专家报告之间存在不可约的信息缺口。
8. 数学与理论严谨性
这篇论文没有定理或收敛证明,数学主要用于定义训练损失和评估指标。公式本身基本是标准 SFT 与 DPO,但存在以下表达问题:
被写成一个三元组集合,却没有显式样本索引; 在 DPO 公式中未在正文定义,标准记号应为 sigmoid ; 只在实现细节中给出; - 多报告 SFT 对
求和但不除以 ,会使候选更多的输入权重更高; - 主文把指标描述为按类别频率加权,附录和代码实际使用逆频率;
- aspect-level F1 是“先加权 P/R、再取调和平均”,不等于对各类 F1 的加权平均;
- “从初始状态直接生成四日预报”没有对应的可辨识性假设、物理约束或误差传播分析。
因此,数学没有明显的推导错误,但也没有提供超出标准微调框架的理论保证。论文最需要补的不是更复杂的证明,而是更精确的任务假设和指标定义。
9. 审稿人视角
Strengths
- 问题真实:将多源天气信息转为公众可读报告确实耗费专家时间;
- 数据贡献清楚,真实专家文本比纯合成报告更有价值;
- 训练与评估流程完整,SFT、RFT、DPO 的作用有分阶段结果;
- 多维消融比一般应用型 MLLM 论文更丰富;
- 数据、代码和三阶段模型权重已经公开。
Major issues
- 核心 headline 与最新表格不一致。 “所有指标、所有方面优于所有闭源模型”被 Gemini-3 Pro 的结果直接反驳。
- 公开 RFT 数据无法支持论文所述的多样性机制。 详见后面的代码核验:20,412 行实际是 5,103 个不同样本各重复 4 次,同一输入的四条报告完全相同。
- 任务信息不充分且被 prompt 简化。 输入不含未来 NWP,prompt 却给出应讨论的方面;模型的预测能力与报告生成能力没有被分离。
- RFT/DPO 与主评价器形成闭环。 同一个 claim extractor/F1 参与数据筛选、偏好构造和主指标,容易造成 metric overfitting。
- 缺少统计可靠性。 没有 seed、误差条、显著性和 judge 一致性。
Minor issues
- “performance consistently improves”等文字没有随新增曲线/新 baseline 更新;
- 实现细节与公开脚本的学习率、最大生成长度不一致;
- report、claim、aspect 的计数单位在表 1 中表达不够清楚;
- city-level 结果把 Honolulu/Flagstaff 的差距归因于地形复杂度,但没有受控证据;
- 数据和模型 Hugging Face 页面缺少完整 card 与许可证元数据。
Recommendation
Major Revision;若必须在 Accept/Reject 二选一中选择,我会给 Weak Reject。
理由不是任务没有价值,而是当前版本把“领域微调后在自建 claim 体系上更好”外推成“学会气象动力学且全面超过领先闭源模型”,同时公开 RFT 数据又无法复现核心多样性构造。若作者修复数据发布、重新跑匹配训练预算的 RFT 对照、修正 headline、随机化评审顺序并补充定量天气误差,我的判断可以上调到 Weak Accept。
需要说明的是:论文已经被 ICML 2026 接收;上面是基于当前论文、代码和公开数据的独立技术判断,不是会议官方意见。
10. 与相关工作的定位
| 工作 | 输入/任务 | 相比 WeatherSyn 的优势 | 相比 WeatherSyn 的不足 |
|---|---|---|---|
| WeatherQA (2024) | 多张天气图;强对流区域与发展潜势问答/分类 | 严重天气推理目标清楚,含人类差距分析 | 不是通用逐日报告生成 |
| CLLMate (2024) | ERA5 与 26,156 篇环境新闻;天气/气候事件预测 | 规模更大,事件与影响叙事更丰富 | 新闻与城市业务预报不同,文本对齐更噪声 |
| OmniEarth-Bench (2025) | 六大地球圈层、多任务 benchmark | 覆盖广、专家评估维度多 | 主要是 benchmark,不专注四日报告 |
| Omni-Weather (2025) | 雷达生成、理解与因果解释 | 将天气场生成与理解统一,更接近动态建模 | 聚焦雷达/降水,不是常规城市综合报告 |
| WeatherSyn (2026) | 12 张 ERA5 热力图与 aspect prompt;四日报告 | 真实业务文本、开放式报告、可控生成 | 地域单一、动力信息不足、指标闭环明显 |
一句话定位:WeatherSyn 是城市级天气文字产品生成的数据与训练工程贡献,而不是新的天气预报架构。它最适合作为 NWP/AI 数值预报之后的 report synthesis 模块,而不是替代 NWP。
11. 公开代码与数据核验
11.1 核验范围
2026-07-30 对官方仓库提交 e506fe9c2474b919abf4684bad2e9931e6a9db92 进行只读检查,并读取 Hugging Face 数据集版本 606cead619f69e61c1c58a878053fb04e26554d0。
公开仓库包含:
- SFT、RFT、DPO 的训练与推理脚本;
- Qwen3-VL 全参数微调代码;
- LLaMA-Factory DPO 配置;
- automatic claim、BLEU/ROUGE/METEOR、LLM ranking 代码;
- WSInstruct 数据与 SFT/RFT/DPO 三个模型权重。
对非 vendored 的 Python 源码执行语法编译检查,检查通过。没有运行 8 张 A800 的完整训练,也没有调用闭源模型重跑基准,因此下述结论是代码–论文映射与数据完整性审计,不是性能复现实验。
11.2 Claims Code
| Claim | 论文描述 | 公开实现 | 状态 |
|---|---|---|---|
| Backbone | Qwen3-VL-8B | Qwen/Qwen3-VL-8B-Instruct | 匹配 |
| SFT/RFT | 视觉塔、merger、LLM 全部训练 | 三者均未冻结 | 匹配 |
| DPO | 以 RFT 为 reference,冻结 vision | LLaMA-Factory stage: dpo,vision/projector frozen | 基本匹配 |
| DPO | 0.1 | pref_beta: 0.1 | 匹配 |
| SFT/RFT LLM LR | 不匹配 | ||
| DPO LR | 不匹配 | ||
| Inference max tokens | 400 | WeatherSyn 脚本默认 600 | 不匹配 |
| RFT 多样候选构造 | 40 次采样、F1 筛选、4 种距离 | 发布训练脚本只消费已生成 JSON,未发现完整构造脚本 | 未公开/未找到 |
| Claim metric | 逆频率加权 | 代码确实使用 | 匹配,但命名易误导 |
| LLM judges | 4 个模型 | 管线列出 4 个模型 | 部分可用;Claude key 与映射不一致 |
11.3 最严重的发布数据异常:RFT 不是四条多样报告
对公开 json/rft/annotation_train_merged.json 的实际统计:
- 总行数:20,412;
- 不同图像集合:5,103;
- 每个图像集合恰好出现 4 次;
- 对同一图像集合,4 行除了
id外,image、prompt、assistant report、daily_forecast、Expected_format完全相同; - 因此不同的
(input, report)对实际只有 5,103 个,而不是 20,412 个。
这与论文“为每个输入保留多条 lexically diverse reports”的叙述冲突。存在两种可能:
- 论文实验使用了正确的内部多样数据,但 Hugging Face 打包时错误地把一条报告复制了四次;
- 实验也使用了当前文件,此时 RFT 增益可能来自重复数据带来的额外优化步数,而非词汇多样性。
现有证据不能区分两者,所以不能直接断言论文实验错误;但这是必须修复的 reproducibility blocker。
11.4 评价实现中的问题
- 自动 claim 评分只遍历 ground-truth aspect,预测中额外出现的其他 aspect 可能不计 FP;
- LLM ranking 的 appendix prompt 写 9 个候选,公开代码实际提供 11 个,system prompt 又写“eight candidate”;
- 候选按模型列表固定映射为 R1–R11,没有随机排列;
- pipeline 调用
claude-3-7-sonnet-20250219,但公开llm_to_api字典只有claude-3-5-sonnet-20240620,按当前代码会触发 key error; - 公开脚本没有固定 WeatherSyn 推理随机种子,且没有多次运行聚合;
- RFT 数据构造、人工修正过程和 expert evaluation 原始记录未发布,关键中间步骤无法审计。
11.5 可复现性结论
可审计性:中等。 模型、最终数据和主要训练/评分框架公开,优于只给论文的工作。
端到端可复现性:偏低。 超参数不一致、RFT 数据异常、数据构造脚本缺失、LLM judge 脚本不一致,会阻止从原始报告完整重建表格。
12. 最有价值的后续实验
如果要把这项工作做得更可信,我会优先做:
- 修复并版本化 RFT 数据,为每个输入保存候选来源、逐日 F1、四种距离和最终组合;
- 训练预算匹配对照:原始 SFT 数据重复 4 次 vs 4 条真正不同的报告;
- 信息源分解:city/time only、images only、aspect only、images + aspect,判断模型到底依赖什么;
- NWP-conditioned 主任务:把 HRES/GraphCast/Pangu 等未来场作为标准输入,而不是只放附录;
- 定量事实指标:温度趋势与数值误差、降水概率/强度、风向风速、front 位置和到达时间;
- 开放式 salience 评估:测试不给 aspect 时模型能否选对最重要内容;
- 跨分布测试:跨国家、跨预报中心、跨写作规范、极端年份;
- 统计检验:至少 3 个训练种子,对样本做 paired bootstrap,并报告置信区间;
- judge 稳健性:随机化候选顺序、多人专家盲评、报告 Krippendorff's alpha 或 Fleiss' kappa;
- 物理一致性 probe:检查报告是否与输入场、未来 NWP 场和基本动力学约束一致。
13. 可复用思想
- 将开放式科学报告先投影到领域 claim ontology,再做细粒度评估;
- 用逐时间步 rejection sampling,避免完整长报告几乎不可能全对的问题;
- 把 lexical diversity 作为受事实约束的数据增强目标;
- 将自动指标产生的偏好对用于 DPO,但必须用独立指标和人工评估防止闭环;
- 对科学 MLLM,输入模态消融不仅要“多加图”,还要检查视觉 token 预算和信息密度。
14. 科研品味评分
text
创新性 (Novelty): ★★★☆☆ (3/5)
- WFR 数据与真实业务报告对齐有新意
- SFT/RFT/DPO 方法本身标准,架构没有创新
严谨性 (Rigor): ★★☆☆☆ (2/5)
- 评估维度丰富,年份切分合理
- headline 与表格冲突,缺少显著性,指标闭环明显
- 公开 RFT 数据异常严重影响复现
影响力 (Impact): ★★★☆☆ (3/5)
- 数据集和任务可能推动天气报告生成
- 更合理的落点是 NWP 后处理,而非替代数值预报
- 跨国家、跨系统的真实部署价值尚未验证Innovation Score: 5.5/10
任务与数据贡献高于方法贡献。若公开数据问题修复,并证明多样 RFT 在匹配训练预算下仍有效,可提高到 6–7 分。
个人跟进决策
- [ ] 非常值得:直接复现并沿此方向做后续
- [x] 值得参考:claim-based evaluation、逐日 rejection sampling 和 NWP-conditioned report generation 值得吸收
- [ ] 了解即可
- [ ] 值得 avoid
如果要跟进,我不会继续强化“单初始场直接写四日报告”,而会研究:
也就是让语言模型做可追溯、可校准的预报解释器,而不是隐式替代动力学预报器。
Reviewer Feedback 访问记录
论文有公开 OpenReview 投稿附件,但 2026-07-30 访问讨论树时,OpenReview 页面与 API 均被站点的动态 Challenge/网络策略拦截,未能可靠读取 Official Review、作者回复、Meta Review 与 Decision note。因此这里不能写成“没有评审”或“没有 rebuttal”,也不对评分与争议点做猜测。会议接收状态由 arXiv、ICML 页面、accepted TeX 和官方代码仓库交叉确认。
来源与核验记录
- arXiv 论文与 TeX source:任务、公式、表格、附录、训练与评估细节。
- WeatherSyn 官方代码:训练、推理、评估实现及本地静态核验。
- WSInstruct 数据集:公开 JSON 的样本计数、年份切分和 RFT 重复审计。
- WeatherQA:严重天气多模态推理对比。
- CLLMate:ERA5 与天气/气候事件文本预测对比。
- OmniEarth-Bench:广义 Earth MLLM benchmark 对比。
- Omni-Weather:天气生成与理解统一模型对比。