Skip to content

多尺度、多模态气象智能体数据集蓝图

面向现有 SEVIR、TornadoNet、MeteoNet、2020--2022 GridRad + 小时站点降水、WeatherBench2 和事件报告资产的统一设计。本文重点回答:如何借鉴 Zephyrus、SIREN、TerraBench 和 AgentCaster,构造一个有科学区分度、可执行、可追溯且严格防时间泄漏的数据集与 benchmark。

0. 直接结论

最不建议的方案,是把所有数据重采样到一个网格、拼成大 tensor,再随机切 train/test。这样会同时损失:

  • 全球与局地尺度差异;
  • 雷达三维结构和站点点观测特性;
  • 各源不同的采样频率、延迟和质量状态;
  • 事件报告的发布时间与版本;
  • agent 主动选择证据的研究价值。

更合适的核心对象是 bitemporal multi-view event episode

Ei=(ei,tidecision,Wi,Vi,Yi,Pi), \mathcal E_i = (e_i,t_i^{\mathrm{decision}},W_i,\mathcal V_i,\mathcal Y_i,\mathcal P_i),

其中:

  • eie_i:canonical event ID;
  • tidecisiont_i^{\mathrm{decision}}:模型必须作出判断的时刻;
  • WiW_i:历史证据窗和未来 target 窗;
  • Vi\mathcal V_i:在该决策时点已可用的多源视图;
  • Yi\mathcal Y_i:决策时不可见、事后用于评价的标签;
  • Pi\mathcal P_i:所有文件、报告、转换和工具轨迹的 provenance。

全球场、区域场、雷达、站点和文本不必每例齐全。数据集应把这种不完整性显式表示为:

mi(s){0,1}, m_i^{(s)}\in\{0,1\},

而不是插值或伪造缺失模态。

推荐的论文主线是:

在具有全球—区域—设备多尺度证据、真实缺测与来源冲突的环境中,智能体能否在严格时间权限下选择、融合和引用证据,完成从识别到预测、解释和决策的事件级天气工作流?

这比另做一个 ERA5 QA benchmark 更有区分度,也比只做雷达预测更能利用你们的资产。

1. 四篇论文分别借鉴什么

论文最值得借鉴必须修正
Zephyrus人工 task seed、模板填槽、确定性 verifier、按答案对象分型评价、报告 claim 化没有正式 split;49 模板内部相关;ERA5 单底座;缺报告发布时间和传感器不完整性
SIRENevent_id 串起 EC → SP → IA → RD;历史案例、技能和临时模型三种经验利用方式soft event alignment 未给阈值;没有 calm/hard negatives;历史库和测试事件隔离不透明;回顾性资料权限不清
TerraBenchcanonical trace、artifact ledger、hash、动态真值、document truth / execution truth、过程与结果分开评分工具栈偏差强;成本大;没有正式 split/去重;容差和 proxy 主观;公开代码与论文公式不完全一致
AgentCaster连续窗口、受限工具预算、主动取图/探空、GeoJSON 概率风险区、业务 baseline、自然空报惩罚40 天为 composition 优化、非自然基率;地面真值公式与代码不一致;SPC 不是等信息量人类对照

组合原则:

Benchmark=ZephyrusVerifierFirst+SIRENEventChains+TerraArtifacts+AgentCasterDecisionConstraints. \mathrm{Benchmark} = \mathrm{ZephyrusVerifierFirst} + \mathrm{SIRENEventChains} + \mathrm{TerraArtifacts} + \mathrm{AgentCasterDecisionConstraints}.

2. 你们现有数据的角色分工

2.1 WeatherBench2

推荐角色:

  • 全球天气背景;
  • 固定历史气候态;
  • 大尺度异常与遥相关;
  • 为数据驱动 forecast model 提供初始状态;
  • 跨区域任务的统一 coarse context;
  • 事件发生后的归因或诊断参考。

不应承担:

  • 雷达短临的局地真值替代;
  • 当时业务可用 analysis 的无条件替代;
  • 用未来 ERA5 直接回答预测题;
  • 1.51.5^\circ 或其他粗网格强行上采样成设备级证据。

所有 WeatherBench2/ERA5 视图应标:

text
role = background | climatology | initial_condition | retrospective_analysis | target
retrospective_only = true | false

预测任务中,未来再分析只能作为 target,不能出现在 evidence snapshot。

2.2 SEVIR

推荐角色:

  • 多模态强对流事件窗;
  • 雷达/卫星/闪电之间的证据选择与一致性;
  • 0--2 小时临近预测;
  • storm onset、growth、decay、track、intensity;
  • 单源缺失和跨源冲突测试。

关键风险:

  • 同一 storm 的多个滑窗或 patch 随机跨 split;
  • 事件富集不能代表自然基率;
  • VIL、卫星和闪电的时间配准与质量标志;
  • 未来帧不慎进入输入;
  • resize/normalization 丢失物理单位。

必须按原始 event/storm ID 分组,而不是按帧分组。

2.3 TornadoNet

推荐角色取决于你们持有版本的实际 schema;在未审计字段前,不预设它一定包含某种雷达或报告标签。可优先映射为:

  • tornado occurrence / non-occurrence;
  • onset、track、intensity、duration;
  • benign、near-miss、false-alarm hard negatives;
  • 龙卷风专门 challenge set;
  • 与 GridRad、站点、报告和大尺度背景的 event-level linkage。

必须核查:

  • 原始 storm/event ID;
  • 阳性和阴性定义;
  • 报告、雷达推断和模型标签是否混用;
  • 同一风暴多个 scan/patch;
  • 年份、区域、雷达站和预警发布时间;
  • 是否天然是 event-enriched 数据。

2.4 MeteoNet

推荐角色:

  • 欧洲区域雷达与站点降水;
  • 跨国家、跨雷达网络、跨单位和 QC 体系的 OOD 测试;
  • 降水场重建与站点—雷达交叉校验;
  • 传感器缺失、地形与空间代表性研究;
  • 检验模型是否只学会美国事件 taxonomy。

关键风险:

  • 站点随机切分造成空间插值泄漏;
  • 同一场降水过程跨 split;
  • UTC、本地时间、累计窗和单位差异;
  • 降水零膨胀与长尾;
  • 法国雷达网络与美国雷达产品不可直接同变量对齐。

至少提供 station-holdout、region-holdout 和 time-holdout 三种协议。

2.5 2020--2022 GridRad + 小时站点降水

推荐角色:

  • 三维强对流结构和垂直廓线;
  • 区域降水与站点 ground observation;
  • 网格—站点 representativeness;
  • radar evidence 与 surface evidence 冲突;
  • severe-event challenge episodes;
  • 与 event report 的证据链和事后验证。

关键风险:

  • 如果 GridRad 子集来自 severe event 选择,则不能估计自然事件率;
  • station precipitation 若既作为 input 又作为 target,会发生直接标签泄漏;
  • 雷达 valid time 和站点 hourly accumulation window 错位;
  • 空间插值让 nearby test station 信息渗入 train;
  • GridRad 三维体数据降成单层图会丢失主要优势。

建议同时保留:

  • native 3D volume;
  • 标准物理派生量;
  • 2D 最大反射率/回波顶高等浏览产品;
  • grid-to-station collocation table;
  • QC 与缺测掩码。

2.6 事件 report 和其他文档

推荐角色:

  • documentary truth;
  • 事件名称、灾种、时间、地点和影响;
  • 物理机制与 forecast discussion;
  • 警报、公众指引、响应和影响链;
  • claim extraction / verification;
  • 解释和证据引用任务。

每份文档必须保留:

text
source
source_record_id
raw_text
source_url_or_archive_path
valid_start / valid_end
issue_time
available_at
retrieved_at
revision_id
supersedes
language
geography
provenance_spans

报告中事后才出现的 outcome 不能在 earlier decision snapshot 中作为输入。

3. 核心数据模型

3.1 四层结构

text
Layer 0  Raw source objects
  ├─ 原始 Zarr/NetCDF/HDF5/GRIB/CSV/JSON/PDF/HTML
  └─ immutable URI + checksum + version + license

Layer 1  Normalized source views
  ├─ 统一单位、坐标元数据和时间语义
  ├─ 保留 native grid / native station / native volume
  └─ 可派生多分辨率浏览视图,但不替代原始数据

Layer 2  Canonical event graph
  ├─ event_id / parent_event_id / subevent_id
  ├─ source_record_ids
  ├─ track / geometry / time span / hazard taxonomy
  └─ match confidence + conflict set + human adjudication

Layer 3  Benchmark episodes
  ├─ decision snapshot
  ├─ allowed evidence
  ├─ hidden future targets
  ├─ task contract
  ├─ canonical trace / verifier
  └─ scoring and split group

3.2 不做“统一大网格”,做原生数据 + 可审计视图

对每个数据源保存两类对象:

  1. native object:原生投影、网格、分辨率和采样;
  2. derived view:为跨源比较创建的重采样、聚合或切片。

Derived view 必须记录:

text
parent_checksum
transform_name
transform_version
parameters
source_crs / target_crs
source_resolution / target_resolution
resampling_kernel
units_before / units_after
quality_mask
created_at

模型既可以读取 native,也可以调用工具创建 view。benchmark 不应只发布不可追溯的 PNG。

3.3 事件图而不是单个 flat event ID

天气系统常有层级:一个大尺度系统包含多个强对流单体,一个单体又产生多个报告。建议:

text
synoptic_event
  ├─ regional_episode
  │    ├─ storm_track
  │    │    ├─ hazard_occurrence
  │    │    └─ source_records[]
  │    └─ precipitation_episode
  └─ impact_episode

字段:

text
event_id
event_level
parent_event_id
hazard_family / subtype
valid_start / valid_end
geometry / track
admin_areas[]
source_record_ids[]
match_method
match_score
match_features
conflict_group_id
adjudication_status
split_group

3.4 事件匹配不能只靠“邻县或时间相近”

候选 linkage 可以综合:

s(a,b)=wtst+wgsg+whsh+wrsr+wpsp, s(a,b) = w_t s_t +w_g s_g +w_h s_h +w_r s_r +w_p s_p,

其中:

  • sts_t:时间 overlap / gap;
  • sgs_g:geometry overlap、最小距离或 track distance;
  • shs_h:hazard taxonomy compatibility;
  • srs_r:雷达对象/降水对象轨迹相似度;
  • sps_p:报告实体、地点和描述相似度。

流程:

  1. 宽松 blocking 生成候选对;
  2. 规则或模型打分;
  3. 高分自动接受、低分拒绝、中间区人工审计;
  4. 保留全部候选、特征和裁决;
  5. 对多对多情况生成 event graph,不强迫一对一。

阈值必须发布,并在双标子集报告 precision/recall 或一致性。

4. 时间权限:最关键的防泄漏设计

4.1 至少保存四个时间

字段含义
valid_time观测或预测代表的物理时刻
issue_time产品或报告发布时刻
available_at系统实际可读到该对象的最早时刻
retrieved_at你们归档该版本的时间

预测产品还要保存:

text
forecast_reference_time
lead_time
valid_time = forecast_reference_time + lead_time

4.2 Decision snapshot

对决策时刻 tdt_d,允许证据必须满足:

V(td)={x:x.available_attd}. \mathcal V(t_d) = \left\{ x: x.\mathrm{available\_at}\leq t_d \right\}.

若无法获得真实 available_at,必须:

  • availability_assumed=true
  • 给出假定延迟;
  • 单独报告严格和宽松权限结果;
  • 不把该样本称为 fully prospective replay。

4.3 报告权限分层

同一文档源按时点可有三种角色:

角色可作为 input可作为 label/reference
决策前发布的 forecast discussion可以可以辅助评价
事件中实时 warning/report仅在其 available_at 之后可以
事件后复盘/损失报告不可以用于早期预测可以用于 impact/retrospective tasks

4.4 自动泄漏测试

每个 episode 生成时运行:

text
assert all(evidence.available_at <= decision_time)
assert all(target.valid_time > context_end) for forecast tasks
assert no(target.source_record_id in evidence.source_record_ids)
assert no(post_event_report in prospective evidence)
assert split_group is event-disjoint

同时对文本做答案 span 扫描,对数值做近似命中扫描,避免 reference 数字直接出现在 prompt。

5. 推荐 benchmark 任务轨

5.1 Track A:Deterministic Fundamentals

借鉴 Zephyrus,但扩展到多源。

任务族:

  • 某区域/站点/高度层/时间窗的 min/max/mean/quantile;
  • 阈值超越面积、持续时间、首次发生时间;
  • 雷达对象位置、质心、面积、回波顶高和移动;
  • 站点与网格之间 bias、相关、代表性;
  • 多变量复合条件;
  • 气候态异常;
  • 地理名称、行政区和流域到数据掩码;
  • 数据源可用性和质量状态查询。

每个模板必须有确定性 verifier。样本填槽可以自动扩增,但 split 必须按 event/time/space 分组。

5.2 Track B:Regional Nowcasting and Forecasting

输入:历史雷达/卫星/闪电/站点 + 可选全球背景。

输出:

  • 未来降水/反射率场;
  • threshold exceedance probability;
  • storm object track;
  • onset/cessation;
  • severe/tornado occurrence;
  • 多阈值风险多边形;
  • calibrated uncertainty。

推荐 lead bins:

  • 0--30 min;
  • 30--60 min;
  • 1--2 h;
  • 2--6 h;
  • 更长 lead 只在有合适 forecast source 时设置。

WeatherBench2 只提供背景或 forecast initialization,不充当高分辨率未来真值。

5.3 Track C:Cross-Scale Evidence Routing

这是最能体现你们独特性的主任务:

agent 在全球背景、区域雷达、站点和报告之间,应该先看什么、在哪里看、看多细、何时停止?

设计:

  • 初始只给粗粒度 global context 和 event hint;
  • agent 可请求区域 crop、雷达层、站点曲线、派生指数和报告片段;
  • 设置 tool-call、像素、字节、时间或 token budget;
  • 记录每次请求的区域、变量、时段、分辨率与理由;
  • 最终输出预测、置信度、证据引用和 abstention。

对照:

  • full-information oracle;
  • fixed evidence pack;
  • random retrieval;
  • cost-matched retrieval;
  • expert-designed minimal evidence;
  • no-global / no-radar / no-station / no-report;
  • delayed/corrupted source。

这比 Zephyrus 的“工具存在/不存在”更真实,也继承 AgentCaster 的受限资源思想。

5.4 Track D:Source Health and Evidence Conflict

构造真实和可控故障:

  • 雷达缺帧、坏条带、局地遮挡、质量退化;
  • 站点 stuck value、spike、missing、累计窗错误;
  • 时间戳错位;
  • 单位错误;
  • 错误投影或区域;
  • 报告地点/时段错配;
  • 全球场与局地观测不一致;
  • hidden combination faults。

任务:

  • 判断哪个源可信;
  • 选择替代证据;
  • 给 source health score;
  • 在不确定时 abstain;
  • 比较故障前后预测和校准。

故障注入必须保留 clean parent、注入 operator、参数和 seed。

5.5 Track E:Event and Report Verification

借鉴 Zephyrus Task 49 与 TerraBench Document track。

将报告拆成原子 claim:

text
claim_id
claim_text
claim_type
time_scope
geography
variable / threshold / relation
source_span
available_at
verifier
evidence_refs
label = supported | refuted | insufficient

负样本不要只做语言否定,至少包含:

  • 数值阈值扰动;
  • 地点互换;
  • 时间窗错配;
  • 变量互换;
  • 方向反转;
  • 因果关系反转;
  • 预报和观测时态互换;
  • 真实但证据不足的 insufficient

采用三分类而不是只做 True/False,减少“缺证据被误判为错误”。

5.6 Track F:End-to-End Warning Chain

借鉴 SIREN,但对同一 event episode 提供严格 snapshot:

  1. Characterize:事件类型、物理机制、证据质量;
  2. Predict:位置、起始、严重度、路径、持续和概率;
  3. Assess:人口/设施/降水/业务影响;若缺暴露数据则只做可支持的影响代理;
  4. Decide/Communicate:警报候选、公众信息、证据和不确定性;
  5. Verify/Update:新观测到达后更新判断并解释变化。

每个 chain 同时运行:

  • Agent Chain:上游输出传给下游;
  • Oracle Upstream:下游收到正确上游状态;
  • Corrupted Upstream:定量注入错误;
  • Blocked Source:关键模态不可用。

这样才能分离本阶段能力和错误传播。

5.7 Track G:Counterfactual / Intervention

只有在拥有明确 simulator 或可控制数据生成过程时才设置:

  • 改变初始场、参数或传感器可用性;
  • baseline/intervention 使用相同模型版本、seed、边界和其余参数;
  • 输出应称为 simulator-conditioned response,而非真实世界因果效应。

如果当前没有可信 simulator,v1 可以不设真实大气反事实,只保留 source-health intervention。

6. 样本契约

推荐单 item manifest:

yaml
task_id: ...
episode_id: ...
event_id: ...
track: cross_scale_routing
subtask: probabilistic_heavy_rain_polygon
difficulty:
  data_scope: regional
  tools_required: [global_field, radar_volume, station_series]
  min_reasoning_steps: 4
  hidden_faults: 1

decision_time: ...
context_start: ...
context_end: ...
target_start: ...
target_end: ...
lead_time: ...

evidence_policy:
  allowed_sources: [...]
  max_tool_calls: 20
  max_bytes: ...
  time_filter: available_at <= decision_time

evidence_refs:
  - source_id: ...
    object_uri: ...
    checksum: ...
    valid_time: ...
    issue_time: ...
    available_at: ...
    quality: ...

question:
  instruction: ...
  event_conditions: ...
  answer_spec: ...

answer_contract:
  type: probability_geometry
  schema_version: ...
  units: ...
  thresholds: [...]

ground_truth:
  refs: [...]
  verifier_version: ...
  provenance: ...

canonical_trace:
  steps: ...
  artifacts: ...

split:
  name: hidden_test_2022
  group_id: storm_system_...
  leakage_audit: passed

7. 任务难度不能只用 Easy/Medium/Hard

建议记录可解释难度向量:

di=(ntools,nmodalities,nscales,nsteps,horizon,missingness,conflict,output_complexity). d_i= (n_{tools},n_{modalities},n_{scales},n_{steps},horizon, missingness,conflict,output\_complexity).

例如:

  • ntoolsn_{tools}:最少必要工具数;
  • nmodalitiesn_{modalities}:完成任务必须用到的模态;
  • nscalesn_{scales}:全球/区域/设备尺度数;
  • nstepsn_{steps}:canonical workflow 最少步骤;
  • horizon:预测长度;
  • missingness:关键证据缺失程度;
  • conflict:来源冲突数;
  • output_complexity:标量、列表、轨迹、场、多边形或报告。

可以再把这个向量映射为 Easy/Medium/Hard,但原始维度必须保留。

8. Sampling:自然基率集和挑战集分开

8.1 Natural-Rate Stream

目标:测 false alarm、calibration、可靠性和真实工作负载。

  • 连续时间窗;
  • 不按事件筛选;
  • 包含大量无事件和弱事件;
  • 保留真实缺测与产品延迟;
  • 输出 event/non-event 与概率;
  • 可按小时或固定决策周期定义。

8.2 Curated Challenge Set

目标:测高影响、罕见、复杂和故障情形。

  • tornado/severe outbreak;
  • 极端降水;
  • 多单体合并/分裂;
  • near-miss;
  • 高不稳定但无灾害;
  • radar/station/report disagreement;
  • source failure;
  • 跨区域 OOD。

GridRad-Severe、TornadoNet 和 SEVIR event windows 更适合这一轨。不能把挑战集的阳性比例用于 deployment calibration。

8.3 Hard negatives

负样本至少分:

  1. quiet random;
  2. same season/region;
  3. synoptically similar but no event;
  4. high radar signal but wrong hazard;
  5. strong environment but no tornado;
  6. report near-match but wrong time/location;
  7. source conflict;
  8. operational false alarm / near miss,若可获得。

9. Split 设计

9.1 最高优先级:event-group chronological split

任何属于同一 storm system、event family、track、报告集合或高度重叠窗口的样本只能进入一个 split。

text
group_id = canonical synoptic/storm event
sort by decision_time
split groups, never individual frames

9.2 2020--2022 共时数据的建议

如果 GridRad、站点、WeatherBench2 与报告在 2020--2022 年能稳定对齐,可把:

  • 2020:任务开发、verifier 开发和训练;
  • 2021:公开 validation / public test;
  • 2022:hidden test。

这只是建议协议,实施前必须审计各年份覆盖度和事件数量。若 2022 太小,应按时间块和 storm group 重划,但不能随机拆窗口。

9.3 跨数据源 OOD

  • US event sources → MeteoNet-France;
  • SEVIR-style 事件 → GridRad/TornadoNet;
  • station seen → station unseen;
  • radar/network seen → network unseen;
  • region seen → region unseen;
  • hazard seen → compositional hazard unseen。

不同数据集无需强行共享同一变量;任务 contract 可共享,source adapter 不同。

9.4 Template holdout

至少保留三种测试:

  • Instance holdout:同模板新地点/时间;
  • Template holdout:新运算图或新问题组合;
  • Workflow holdout:新工具组合和新模态路径。

只有第一种会高估泛化。

9.5 文本近重复和污染

  • 同一报告的修订版不能跨 split;
  • 同一事件的多机构转述要聚类;
  • question paraphrase 不算独立模板;
  • 对 prompt 与报告做 MinHash/embedding near-duplicate audit;
  • hidden test 的自然语言可在冻结后重新表达,但 verifier 不变。

10. 标注与真值

10.1 真值优先级

  1. 直接观测:未来雷达、站点、报告位置/时间;
  2. 确定性派生:阈值、对象、几何、统计、collocation;
  3. 规则/业务定义:风险等级、warning schema;
  4. 外部文档:document truth;
  5. 专家判断:机制、解释、行动建议;
  6. LLM 辅助:只生成候选,不作唯一真值。

10.2 Document truth 与 execution truth

报告或论文中的数字单独保存,不直接覆盖数据重建结果:

text
document_truth:
  value
  units
  source_span
  source_version

execution_truth:
  value
  units
  data_refs
  code_version
  artifacts

verification_mode: exact | approximate | structural | proxy

10.3 Expert annotation

Hard tasks 至少:

  • 两位独立标注;
  • 记录专业背景;
  • 隐藏模型身份;
  • 先独立评分再裁决;
  • 报告 raw agreement、κ\kappa 或 rank correlation;
  • 对字段、容差、event linkage 和 canonical trace 分别抽审,而不只审 item accept/reject。

11. 工具环境

11.1 推荐工具族

工具族示例
Catalog列出时点可用数据、变量、区域、分辨率和质量
Global fieldsWeatherBench2 切片、climatology、anomaly
Radarvolume/cross-section/max product/object/track/crop
Stationquery、QC、aggregation、nearby stations、collocation
Geospatialmask、bbox、admin、distance、area、reprojection
Event graphevent lookup、related records、timeline
Reportstime-filtered search、claim span、revision history
Derived diagnosticsprecipitation statistics、storm metrics、wind/thermodynamic indices
Forecastnowcast model、global forecast model、ensemble
Artifactsave/load/inspect/compare/hash

11.2 每次工具调用的日志

text
call_id
task_id
tool_name / version
arguments
requested_at
started_at / completed_at
status
error_type
bytes_read
compute_cost
observation_summary
artifact_refs
input_checksums
output_checksums

11.3 权限

  • 工具只返回 available_at <= decision_time 的对象;
  • agent 不直接访问 raw filesystem;
  • target store 与 evidence store 物理隔离;
  • 报告搜索必须经过时间过滤;
  • 任何 retrospective override 都写进 trace。

12. 评价协议

12.1 结果指标

输出指标
标量MAE/RMSE、标准化误差、relative error;零值单独处理
降水/反射率场CSI、POD、FAR、FSS、RMSE/MAE、SAL 或对象指标
概率Brier、CRPS、reliability、ECE、sharpness
事件分类precision、recall、F1、AUROC/AUPRC;自然基率集重点看 PR 与 FAR
轨迹distance error、timing error、track IoU、object association
多边形risk-band IoU、centroid distance、coverage、overprediction area
时间onset/cessation error、lead-time utility
报告 claimsupported precision、reference recall、contradiction、unsupported、insufficient handling
决策utility、miss/false-alarm cost、unsafe recommendation、abstention quality

降水和影响常为 zero-inflated,建议两阶段评分:

Score=OccurrenceScore+PositiveMagnitudeScore. \mathrm{Score} = \mathrm{OccurrenceScore} + \mathrm{PositiveMagnitudeScore}.

不要直接使用在 y=0y=0 时未定义的相对误差。

12.2 过程指标

分别报告:

  • tool selection;
  • argument correctness;
  • temporal permission compliance;
  • evidence citation correctness;
  • source-health diagnosis;
  • necessary evidence coverage;
  • unnecessary call cost;
  • tool failure recovery;
  • artifact provenance completeness;
  • final schema validity。

不要只做一个 composite score。各 component 先单独公开,再按明确权重给辅助总分,并做权重敏感性。

12.3 分层统计

至少按以下维度报告:

  • dataset/source;
  • hazard;
  • event vs quiet;
  • region;
  • season;
  • lead time;
  • source availability;
  • fault type;
  • task/template/workflow;
  • native vs derived view;
  • seen vs unseen station/radar/network。

主置信区间以 event/item 为 resampling unit,不以 frame、field 或 tool step 当独立样本。模型随机性应多次运行,数据不确定性和模型随机性分开报告。

13. QC 流水线

text
Source audit
  → schema/unit/time normalization
  → event candidate linkage
  → deterministic verifier generation
  → tool execution
  → automatic sanity checks
  → leakage audit
  → near-duplicate/group audit
  → expert review
  → canonical trace cleanup
  → frozen manifest + checksum
  → hidden test packaging

自动 sanity checks:

  • 单位/范围;
  • 坐标和 CRS;
  • monotonic time;
  • target 在 context 之后;
  • station accumulation 对齐;
  • radar/station collocation distance;
  • empty/NaN/constant field;
  • geometry valid;
  • probability range;
  • nested risk polygons;
  • answer re-execution;
  • artifact checksum;
  • source license。

14. v1 的建议范围

不要一次实现所有任务。建议先做四个互补核心轨:

v1-A:可执行原子任务

  • WeatherBench2 global background;
  • SEVIR/MeteoNet/GridRad/站点的确定性统计、阈值、对象与跨源比较;
  • 模板 + verifier;
  • 公开 dev benchmark。

v1-B:自然基率与事件挑战双轨 nowcasting

  • natural continuous windows;
  • severe/tornado/precipitation challenge episodes;
  • 未来雷达/站点作标签;
  • 概率和校准评价。

v1-C:跨尺度 evidence routing

  • global → regional → device;
  • tool budget;
  • source missing/conflict;
  • full-information oracle 与 cost-matched baselines。

v1-D:报告 claim verification + 简化 warning chain

  • claim-level supported/refuted/insufficient;
  • Characterize → Predict → Verify/Update;
  • 先不做缺少可靠 exposure data 的完整经济/人群影响。

规划规模可先以“可审计”为约束,而不是追求几十万 QA。一个合理的初始目标是:

  • 2,000--4,000 个 deterministic atomic items;
  • 800--1,500 个 event/quiet forecast episodes;
  • 200--300 个完整多阶段 chain;
  • 200 个专家双标 Hard items;
  • 500--800 个冻结 hidden-test items。

这些是工程规划目标,不是由现有数据量推导的事实;最终数量应由源覆盖审计、事件去重和专家预算决定。

15. 实施顺序

Phase 0:资产审计

对每个源输出 machine-readable report:年份、区域、变量、单位、分辨率、频率、事件 ID、质量标志、许可、文件量、缺测和与其他源的时间重叠。

Phase 1:统一 metadata,不统一像素

  • immutable object catalog;
  • checksum;
  • 四时间字段;
  • native + derived view;
  • source adapter。

Phase 2:事件图

  • 建 hazard taxonomy;
  • candidate linkage;
  • 人工审计中间置信区间;
  • 生成 split group。

Phase 3:任务工厂

  • 先写 20--30 个专家 seed templates;
  • 每个 seed 配 verifier 和单元测试;
  • 再做参数化扩增和 LLM 候选生成;
  • 自动运行、拒绝失败样本。

Phase 4:benchmark 冻结

  • event/time/template/workflow splits;
  • natural/challenge 双轨;
  • hidden test;
  • canonical traces、artifact ledger、评价脚本;
  • 数据卡和许可。

Phase 5:agent 评测

  • fixed pack;
  • tool agent;
  • full-information oracle;
  • expert minimal evidence;
  • source ablation;
  • fault intervention;
  • multi-run confidence intervals。

16. 最值得形成论文贡献的三点

16.1 Multi-scale sparse evidence benchmark

不是每个样本都拥有所有模态,agent 必须认识数据可用性并决定是否值得下钻到局地设备。

16.2 Bitemporal, event-centric leakage control

valid_timeissue_timeavailable_at 和 event-group split 作为第一等公民,解决历史气象 agent benchmark 普遍存在的回顾性泄漏。

16.3 Source reliability and evidence arbitration

不仅考“有工具时能不能答”,还考源缺测、冲突、延迟和故障时能否选择证据、校准不确定性和 abstain。

这三点与 Zephyrus、SIREN、TerraBench、AgentCaster 都有清楚差异,也能充分利用你们全球、区域、雷达、站点和报告的组合优势。

17. 最终建议

如果只能先做一条主线,我建议选择:

事件级、严格时间权限下的全球—区域—设备证据路由与可靠性 benchmark。

具体以 2020--2022 可共时对齐的 GridRad + 站点 + WeatherBench2 + report 作为主 spine;SEVIR、TornadoNet 和 MeteoNet 作为事件挑战、跨传感器和跨区域 OOD 扩展。这样既有清楚的核心数据闭环,也不会因为强行追求“所有数据完全融合”而把项目拖成不可审计的数据工程。

相关论文笔记

Static research notes built with VitePress and KaTeX.