Skip to content

降尺度通用指标、数据范式与数据矩阵

1. 降尺度任务不是普通插值

设粗分辨率输入为 xLRx_{\mathrm{LR}},高分辨率参考场为 xHRx_{\mathrm{HR}},模型输出为 x^HR\hat{x}_{\mathrm{HR}}。确定性降尺度学习一个映射 fθ:xLRx^HRf_\theta:x_{\mathrm{LR}}\mapsto\hat{x}_{\mathrm{HR}};概率降尺度学习条件分布 pθ(xHRxLR)p_\theta(x_{\mathrm{HR}}\mid x_{\mathrm{LR}})。后者承认一个粗网格状态通常对应多个可能的小尺度实现。

真正有应用意义的模型不仅要降低点对点误差,还需要同时回答三个问题:粗尺度信息是否保留,小尺度统计是否可信,以及在新地区、未来气候或新传感器上是否仍然有效。

2. 数据范式

2.1 Perfect downscaling

从同一份高分辨率数据通过平均、滤波或插值构造低分辨率输入。LR 与 HR 严格配对且不存在模式偏差,因此适合比较架构的表示能力,但通常高估真实应用性能。模型可能只学会逆转已知退化,而没有学会纠正 GCM、NWP 或传感器的结构误差。

2.2 Imperfect 或 model-to-observation downscaling

粗分辨率输入和高分辨率参考来自不同系统,例如 ERA5 到雷达、GCM 到区域模式或全球预报到局地观测。该设置更接近业务,但同时混合了分辨率差、模式偏差、观测误差和时空错位。逐像素 RMSE 可能惩罚位置略有偏差但统计合理的样本。

2.3 RCM emulation

模型以高分辨率区域气候模式或对流允许模式为参考。它的价值是以较低成本复现昂贵数值模拟,而不是直接恢复真实大气。评估必须区分“逼近 RCM”与“优于 RCM 的真实性”。

2.4 Observational downscaling

目标来自雷达、卫星、站点插值或多源融合产品。观测通常更贴近现实,但并非无误差 Ground Truth;波束遮挡、地物杂波、反演误差、覆盖不均和融合算法都可能进入模型输出。

2.5 Unpaired climate correction

训练数据没有逐时刻一一对应关系时,模型学习的是分布映射。此时不能用逐像素误差单独证明有效,必须检查气候均值、趋势、边缘分布、联合分布、极端尾部、功率谱和守恒误差。

3. 确定性与空间误差

3.1 MAE、RMSE 与 bias

NN 个格点,常用定义为

MAE=1Ni=1Nx^ixi,RMSE=1Ni=1N(x^ixi)2. \mathrm{MAE}=\frac{1}{N}\sum_{i=1}^{N}\left|\hat{x}_i-x_i\right|, \qquad \mathrm{RMSE}=\sqrt{\frac{1}{N}\sum_{i=1}^{N}\left(\hat{x}_i-x_i\right)^2}.

Bias 衡量系统偏差,RMSE 对大误差更敏感。三者都不能判断纹理、谱、极端分布或 ensemble 校准。

3.2 ACC、Pearson 与空间相关

异常相关系数(ACC)通常在去除气候态后比较异常场;Pearson correlation 可能按格点、时间或空间场计算。阅读论文时必须确认聚合维度,否则同名指标不可直接比较。

3.3 SSIM 与 PSNR

PSNR 是均方误差的对数变换,依赖数据动态范围;SSIM 比较局部亮度、对比度和结构。二者源自 CV,应用于气象场时需要说明归一化和物理单位,且不能替代守恒与极端评估。

4. 降水事件指标

以命中 HH、漏报 MM、空报 FF 为基础:

POD=HH+M,FAR=FH+F,CSI=HH+M+F. \mathrm{POD}=\frac{H}{H+M}, \qquad \mathrm{FAR}=\frac{F}{H+F}, \qquad \mathrm{CSI}=\frac{H}{H+M+F}.

CSI 也称 Threat Score。ETS 进一步扣除随机命中。FSS 比较邻域内事件频率,适合处理降水位置的小幅错位。所有事件指标都依赖阈值、邻域尺度和时间累积长度。

5. 概率与 ensemble 指标

  • CRPS:比较预测累积分布与观测阶跃分布,兼顾校准和锐度。
  • Brier Score:评估阈值事件概率的均方误差。
  • Rank/PIT histogram:检验观测在预测分布中的位置是否近似均匀;U 形通常意味着 ensemble 太窄。
  • Reliability:比较预报概率和观测频率。
  • Spread–skill:检查 ensemble spread 是否随实际误差变化。
  • Coverage:统计参考值落在预测区间内的比例;必须与区间宽度一起报告。

6. 极端和分布

均值指标会掩盖稀有强事件,因此需要检查高分位数误差、return level、极值频率、tail dependence 和复合事件。由短记录估计百年重现期时不确定度很大,不能只报告拟合曲线而不报告样本长度、极值模型和置信区间。

7. 空间与频谱一致性

  • PSD/RAPSD:检查不同波数上的方差或能量;径向平均会隐藏方向性。
  • 谱斜率:判断模型是否恢复目标场的尺度律,而非仅添加无结构高频噪声。
  • RALSD:比较对数功率谱的距离,具体实现和频段必须注明。
  • Variogram:描述随空间距离增长的差异,可揭示相关长度和间歇性。
  • 空间相关长度:衡量结构尺度,但不直接证明结构位置正确。

频谱吻合是必要而非充分条件:相位随机的场也可能具有正确 PSD,却无法还原天气系统位置。

8. 物理一致性与守恒

DD 表示面积加权粗化算子,最直接的跨尺度一致性检查是

Econs=D(x^HR)xLR. \mathcal{E}_{\mathrm{cons}}= \left\|D\left(\hat{x}_{\mathrm{HR}}\right)-x_{\mathrm{LR}}\right\|.

对降水、湿度、辐射或质量变量,应使用球面面积权重和正确物理单位。粗化回代一致只保证积分或均值约束,并不保证局地动力学、能量闭合、散度关系或多变量热力学一致性。

9. CV 感知与时序指标

  • LPIPS/DISTS:比较深层特征,更接近自然图像主观感知,但其预训练特征未必适合气象场。
  • FID/KID:比较样本特征分布,强依赖特征提取器和样本量。
  • NIQE/MUSIQ:无参考自然图像质量指标,不能视为科学准确性证据。
  • tLPIPS/warping error:评估视频帧间感知一致性或运动补偿误差,但光流假设与大气形变并不等价。

Perception–distortion trade-off 表明,提高视觉锐度可能降低逐像素保真度。对科学降尺度,更危险的情况是生成“看起来真实但条件不正确”的细节,因此必须把感知指标与粗尺度一致性、概率校准、极端和频谱联合使用。

10. 跨论文数据矩阵

“Ground Truth 类型”一栏使用观测、代理 Ground Truth、RCM/CPM 模拟或 self-coarsened HR 等精确表述;不得笼统写成“高分辨率数据”。

论文LR 输入HR 输出Ground Truth 类型倍率Paired/Unpaired实际意义等级最大数据风险
Hess et al. (2022), Physically Constrained GANsCM2Mc-LPJmL 全球日降水,约 3×3.753^\circ\times3.75^\circERA5 日降水统计域,双线性重网格至同一网格未配对 ERA5 再分析统计参考,不是逐日真值1×1\times(同网格域转换)Unpaired高(真实 ESM 偏差订正;非空间超分)总量约束继承 ESM 全球偏差,且只有单一 ESM/ERA5
Chen et al. (2021), LIIFDIV2K HR 经 PyTorch bicubic;训练倍率 rU(1,4)r\sim U(1,4)原始 DIV2K/CelebAHQ RGB,测试至 30×30\timesself-coarsened HR/伪 GT2230×30\timesPaired、共址低 / Proof-of-Concept理想 bicubic 与气象 PSF、面积粗化和模式偏差不等价
Harder et al. (2023), Hard-Constrained DownscalingERA5 TCW 1282128^2 patch 平均池化为 32232^2(主 TCW4)同一 ERA5 时刻的 1282128^2 TCWself-coarsened ERA5 再分析/伪 GT;另有独立 WRF/RCM 代理验证4×4\times(另测 2216×16\times主任务严格 Paired低 / Proof-of-Concept(主任务);外部证据中约束与人工粗化同构;真实 LR–HR 若不守恒,硬层会强制错误关系
Chan et al. (2022), BasicVSR++REDS/Vimeo-90K 等 HR 视频经 4×4\times bicubic 或 σ=1.6\sigma=1.6 blur + subsample同源 4×4\times HR RGB 视频self-coarsened HR/伪 GT4×4\timesPaired、逐帧共址低 / Proof-of-Concept自然视频光流不等于大气平流;无守恒、频谱或概率输出
Yang et al. (2024), DSFNOERA5 TCW 1282128^2 平均池化至 642/32264^2/32^2同一 ERA5 时刻 1282128^2 TCWself-coarsened ERA5 再分析/伪 GT;另有 Navier–Stokes 数值解训练 2×2\times,zero-shot 4×4\timesPaired、共址低 / Proof-of-Concept(气象);PDE emulation 中有限 Fourier modes 可能抹平高频,SmCL 会复制 LR 偏差
Du et al. (2025), DTWSRFFHQ/CelebA、DIV2K/Flickr2K 等经 bicubic/合成退化;另测 RealSR单张 4/12/16×4/12/16\times HR RGB多数 self-coarsened HR/伪 GT;RealSR 相机 reference4/12/16×4/12/16\timesPaired;RealSR 近配对低 / Proof-of-Concept小波 L1L_1 不等于 PSD;HF decoder/GAN 可产生幻觉且概率未校准
Srivastava et al. (2024), STVDFV3GFS c48,约 200 km,12 通道、3-hourly、5 帧FV3GFS c384,25 km PRATEsfc,随机 10-sample 评估同一 FV3GFS fine-grid 模式模拟/代理 GT8×8\timesPaired,由 HR 同源粗化中(高分辨率模式 emulation)模式偏差被当作真值;无硬质量守恒、长 rollout 或跨观测验证
Zhang et al. (2021), BSRGANHR 经 blur、重采样、Gaussian/JPEG/camera-ISP 噪声及随机顺序,2/4×2/4\times单幅 HR RGB(BSRNet/BSRGAN)DIV2K4D self-coarsened HR/伪 GT;RealSRSet 无 GT2/4×2/4\times合成 Paired;真实集 no-reference低 / Proof-of-Concept相机退化不等于气象观测算子,GAN bubble 幻觉且无守恒/校准
Becker et al. (2026), V³Adobe240/Vid4/REDS 的 HR 经空间/时间 anti-aliased sampling连续 RGB 视频场,约 4×4\times 空间、8×8\times 时间self-coarsened HR 视频/伪 GT空间约 4×4\times、时间约 8×8\timesPaired、时空共址低 / Proof-of-Concept有限 Fourier basis 可过平滑/伪高频;无守恒、概率或真实观测退化
Mardani et al. (2025), CorrDiffERA5 25 km、hourly、36236^2、12 通道CWA RWRF/WRFDA 2 km、4482448^2、4 通道,32-member ensemble雷达同化的区域 WRF 模拟/代理 GT12.5×12.5\times同时刻 paired;非同源粗化中(RCM/同化系统 emulation)台湾单域与模式/同化偏差;无时序/守恒且概率校准不完整
Yue et al. (2023), ResShiftImageNet HR 经 RealESRGAN 退化;最近邻预上采样会议版 15-step、4×4\times HR RGB 样本ImageNet self-coarsened HR/伪 GT;RealSR 相机 reference;RealSet65 无 GT4×4\times合成 Paired;真实集 mixed/no-reference低 / Proof-of-Concept图像退化不等于气象观测算子;无守恒、PSD 或概率校准
Chen et al. (2025), FaithDiffHR 经 PASD/Real-ESRGAN 多级退化,附 LLaVA captionSDXL Euler 20-step、4×4\times HR RGB合成集 self-coarsened HR/伪 GT;真实集无 HR;OCR 有任务标签4×4\times合成 Paired;真实集 no-reference低 / Proof-of-Concept生成/文本先验可覆盖输入证据;无守恒、PSD 或概率校准
Wu et al. (2026), PS-SRYouHQ 经 RealESRGAN-style video degradation;另测真实 VideoLQHR RGB 视频,一次 base + 三次 draft + FDU合成集 self-coarsened HR/伪 GT;VideoLQ 无 GT论文数据集原生 VSR 倍率合成 Paired;真实集 no-reference低 / Proof-of-ConceptFDU 低频不等于物理守恒;draft 可幻觉且概率未校准
Hess et al. (2025), Consistency-Model DownscalingPOEM 3×3.753^\circ\times3.75^\circ 日降水;另测 GFDL/SpeedyWeatherERA5 0.75×0.93750.75^\circ\times0.9375^\circ 日降水统计域,100/103-member ensemble未配对 ERA5 再分析统计 reference4×4\times主结果 Unpaired高(跨 ESM 气候统计校正)QDM/PSD 交点启发式、无守恒/多变量,未来场可能回归历史气候态
Lopez-Gomez et al. (2025), R2-D2WUS-D3 45 km WRF intermediate,多变量 hourlyWUS-D3 9 km WRF,多变量 32-member ensemble9 km WRF 动力降尺度模拟/代理 GT5×5\times同时刻 Paired;非平均聚合高(RCM emulation / ensemble risk)跨 ESM 依赖同一 WRF manifold;单区域/情景且无守恒/时序
Xu et al. (2026), GeoFARCERRA 约 22 km/ERA5 coarse;另有 ERA5→PRISMCERRA 11 km、ERA5 finer grid 或 PRISM 0.75° reference同源 CERRA/ERA5 再分析/伪 GT;PRISM 跨产品格点 reference2/4/8×2/4/8\timesPaired;跨产品仍含配准误差低 / Proof-of-Concept(同源);中(ERA5→PRISM)地理先验可能记忆地形;无守恒/概率,低分生成核与多变量发布不完整

11. 实际意义评级

  • :输入接近实际业务资料,HR reference 独立且可信,并具有跨时间、地区或气候状态验证。
  • :任务映射明确,但 reference 是再分析或区域模式代理,或验证范围有限。
  • 低 / Proof-of-Concept:LR 主要由同一 HR 数据人工粗化,只证明模型逆转理想退化的能力。

Static research notes built with VitePress and KaTeX.