Theme
多尺度、多模态气象智能体数据集蓝图
面向现有 SEVIR、TornadoNet、MeteoNet、2020--2022 GridRad + 小时站点降水、WeatherBench2 和事件报告资产的统一设计。本文重点回答:如何借鉴 Zephyrus、SIREN、TerraBench 和 AgentCaster,构造一个有科学区分度、可执行、可追溯且严格防时间泄漏的数据集与 benchmark。
0. 直接结论
最不建议的方案,是把所有数据重采样到一个网格、拼成大 tensor,再随机切 train/test。这样会同时损失:
- 全球与局地尺度差异;
- 雷达三维结构和站点点观测特性;
- 各源不同的采样频率、延迟和质量状态;
- 事件报告的发布时间与版本;
- agent 主动选择证据的研究价值。
更合适的核心对象是 bitemporal multi-view event episode:
其中:
:canonical event ID; :模型必须作出判断的时刻; :历史证据窗和未来 target 窗; :在该决策时点已可用的多源视图; :决策时不可见、事后用于评价的标签; :所有文件、报告、转换和工具轨迹的 provenance。
全球场、区域场、雷达、站点和文本不必每例齐全。数据集应把这种不完整性显式表示为:
而不是插值或伪造缺失模态。
推荐的论文主线是:
在具有全球—区域—设备多尺度证据、真实缺测与来源冲突的环境中,智能体能否在严格时间权限下选择、融合和引用证据,完成从识别到预测、解释和决策的事件级天气工作流?
这比另做一个 ERA5 QA benchmark 更有区分度,也比只做雷达预测更能利用你们的资产。
1. 四篇论文分别借鉴什么
| 论文 | 最值得借鉴 | 必须修正 |
|---|---|---|
| Zephyrus | 人工 task seed、模板填槽、确定性 verifier、按答案对象分型评价、报告 claim 化 | 没有正式 split;49 模板内部相关;ERA5 单底座;缺报告发布时间和传感器不完整性 |
| SIREN | event_id 串起 EC → SP → IA → RD;历史案例、技能和临时模型三种经验利用方式 | soft event alignment 未给阈值;没有 calm/hard negatives;历史库和测试事件隔离不透明;回顾性资料权限不清 |
| TerraBench | canonical trace、artifact ledger、hash、动态真值、document truth / execution truth、过程与结果分开评分 | 工具栈偏差强;成本大;没有正式 split/去重;容差和 proxy 主观;公开代码与论文公式不完全一致 |
| AgentCaster | 连续窗口、受限工具预算、主动取图/探空、GeoJSON 概率风险区、业务 baseline、自然空报惩罚 | 40 天为 composition 优化、非自然基率;地面真值公式与代码不一致;SPC 不是等信息量人类对照 |
组合原则:
2. 你们现有数据的角色分工
2.1 WeatherBench2
推荐角色:
- 全球天气背景;
- 固定历史气候态;
- 大尺度异常与遥相关;
- 为数据驱动 forecast model 提供初始状态;
- 跨区域任务的统一 coarse context;
- 事件发生后的归因或诊断参考。
不应承担:
- 雷达短临的局地真值替代;
- 当时业务可用 analysis 的无条件替代;
- 用未来 ERA5 直接回答预测题;
- 把
或其他粗网格强行上采样成设备级证据。
所有 WeatherBench2/ERA5 视图应标:
text
role = background | climatology | initial_condition | retrospective_analysis | target
retrospective_only = true | false预测任务中,未来再分析只能作为 target,不能出现在 evidence snapshot。
2.2 SEVIR
推荐角色:
- 多模态强对流事件窗;
- 雷达/卫星/闪电之间的证据选择与一致性;
- 0--2 小时临近预测;
- storm onset、growth、decay、track、intensity;
- 单源缺失和跨源冲突测试。
关键风险:
- 同一 storm 的多个滑窗或 patch 随机跨 split;
- 事件富集不能代表自然基率;
- VIL、卫星和闪电的时间配准与质量标志;
- 未来帧不慎进入输入;
- resize/normalization 丢失物理单位。
必须按原始 event/storm ID 分组,而不是按帧分组。
2.3 TornadoNet
推荐角色取决于你们持有版本的实际 schema;在未审计字段前,不预设它一定包含某种雷达或报告标签。可优先映射为:
- tornado occurrence / non-occurrence;
- onset、track、intensity、duration;
- benign、near-miss、false-alarm hard negatives;
- 龙卷风专门 challenge set;
- 与 GridRad、站点、报告和大尺度背景的 event-level linkage。
必须核查:
- 原始 storm/event ID;
- 阳性和阴性定义;
- 报告、雷达推断和模型标签是否混用;
- 同一风暴多个 scan/patch;
- 年份、区域、雷达站和预警发布时间;
- 是否天然是 event-enriched 数据。
2.4 MeteoNet
推荐角色:
- 欧洲区域雷达与站点降水;
- 跨国家、跨雷达网络、跨单位和 QC 体系的 OOD 测试;
- 降水场重建与站点—雷达交叉校验;
- 传感器缺失、地形与空间代表性研究;
- 检验模型是否只学会美国事件 taxonomy。
关键风险:
- 站点随机切分造成空间插值泄漏;
- 同一场降水过程跨 split;
- UTC、本地时间、累计窗和单位差异;
- 降水零膨胀与长尾;
- 法国雷达网络与美国雷达产品不可直接同变量对齐。
至少提供 station-holdout、region-holdout 和 time-holdout 三种协议。
2.5 2020--2022 GridRad + 小时站点降水
推荐角色:
- 三维强对流结构和垂直廓线;
- 区域降水与站点 ground observation;
- 网格—站点 representativeness;
- radar evidence 与 surface evidence 冲突;
- severe-event challenge episodes;
- 与 event report 的证据链和事后验证。
关键风险:
- 如果 GridRad 子集来自 severe event 选择,则不能估计自然事件率;
- station precipitation 若既作为 input 又作为 target,会发生直接标签泄漏;
- 雷达 valid time 和站点 hourly accumulation window 错位;
- 空间插值让 nearby test station 信息渗入 train;
- GridRad 三维体数据降成单层图会丢失主要优势。
建议同时保留:
- native 3D volume;
- 标准物理派生量;
- 2D 最大反射率/回波顶高等浏览产品;
- grid-to-station collocation table;
- QC 与缺测掩码。
2.6 事件 report 和其他文档
推荐角色:
- documentary truth;
- 事件名称、灾种、时间、地点和影响;
- 物理机制与 forecast discussion;
- 警报、公众指引、响应和影响链;
- claim extraction / verification;
- 解释和证据引用任务。
每份文档必须保留:
text
source
source_record_id
raw_text
source_url_or_archive_path
valid_start / valid_end
issue_time
available_at
retrieved_at
revision_id
supersedes
language
geography
provenance_spans报告中事后才出现的 outcome 不能在 earlier decision snapshot 中作为输入。
3. 核心数据模型
3.1 四层结构
text
Layer 0 Raw source objects
├─ 原始 Zarr/NetCDF/HDF5/GRIB/CSV/JSON/PDF/HTML
└─ immutable URI + checksum + version + license
Layer 1 Normalized source views
├─ 统一单位、坐标元数据和时间语义
├─ 保留 native grid / native station / native volume
└─ 可派生多分辨率浏览视图,但不替代原始数据
Layer 2 Canonical event graph
├─ event_id / parent_event_id / subevent_id
├─ source_record_ids
├─ track / geometry / time span / hazard taxonomy
└─ match confidence + conflict set + human adjudication
Layer 3 Benchmark episodes
├─ decision snapshot
├─ allowed evidence
├─ hidden future targets
├─ task contract
├─ canonical trace / verifier
└─ scoring and split group3.2 不做“统一大网格”,做原生数据 + 可审计视图
对每个数据源保存两类对象:
- native object:原生投影、网格、分辨率和采样;
- derived view:为跨源比较创建的重采样、聚合或切片。
Derived view 必须记录:
text
parent_checksum
transform_name
transform_version
parameters
source_crs / target_crs
source_resolution / target_resolution
resampling_kernel
units_before / units_after
quality_mask
created_at模型既可以读取 native,也可以调用工具创建 view。benchmark 不应只发布不可追溯的 PNG。
3.3 事件图而不是单个 flat event ID
天气系统常有层级:一个大尺度系统包含多个强对流单体,一个单体又产生多个报告。建议:
text
synoptic_event
├─ regional_episode
│ ├─ storm_track
│ │ ├─ hazard_occurrence
│ │ └─ source_records[]
│ └─ precipitation_episode
└─ impact_episode字段:
text
event_id
event_level
parent_event_id
hazard_family / subtype
valid_start / valid_end
geometry / track
admin_areas[]
source_record_ids[]
match_method
match_score
match_features
conflict_group_id
adjudication_status
split_group3.4 事件匹配不能只靠“邻县或时间相近”
候选 linkage 可以综合:
其中:
:时间 overlap / gap; :geometry overlap、最小距离或 track distance; :hazard taxonomy compatibility; :雷达对象/降水对象轨迹相似度; :报告实体、地点和描述相似度。
流程:
- 宽松 blocking 生成候选对;
- 规则或模型打分;
- 高分自动接受、低分拒绝、中间区人工审计;
- 保留全部候选、特征和裁决;
- 对多对多情况生成 event graph,不强迫一对一。
阈值必须发布,并在双标子集报告 precision/recall 或一致性。
4. 时间权限:最关键的防泄漏设计
4.1 至少保存四个时间
| 字段 | 含义 |
|---|---|
valid_time | 观测或预测代表的物理时刻 |
issue_time | 产品或报告发布时刻 |
available_at | 系统实际可读到该对象的最早时刻 |
retrieved_at | 你们归档该版本的时间 |
预测产品还要保存:
text
forecast_reference_time
lead_time
valid_time = forecast_reference_time + lead_time4.2 Decision snapshot
对决策时刻
若无法获得真实 available_at,必须:
- 标
availability_assumed=true; - 给出假定延迟;
- 单独报告严格和宽松权限结果;
- 不把该样本称为 fully prospective replay。
4.3 报告权限分层
同一文档源按时点可有三种角色:
| 角色 | 可作为 input | 可作为 label/reference |
|---|---|---|
| 决策前发布的 forecast discussion | 可以 | 可以辅助评价 |
| 事件中实时 warning/report | 仅在其 available_at 之后 | 可以 |
| 事件后复盘/损失报告 | 不可以用于早期预测 | 可以用于 impact/retrospective tasks |
4.4 自动泄漏测试
每个 episode 生成时运行:
text
assert all(evidence.available_at <= decision_time)
assert all(target.valid_time > context_end) for forecast tasks
assert no(target.source_record_id in evidence.source_record_ids)
assert no(post_event_report in prospective evidence)
assert split_group is event-disjoint同时对文本做答案 span 扫描,对数值做近似命中扫描,避免 reference 数字直接出现在 prompt。
5. 推荐 benchmark 任务轨
5.1 Track A:Deterministic Fundamentals
借鉴 Zephyrus,但扩展到多源。
任务族:
- 某区域/站点/高度层/时间窗的 min/max/mean/quantile;
- 阈值超越面积、持续时间、首次发生时间;
- 雷达对象位置、质心、面积、回波顶高和移动;
- 站点与网格之间 bias、相关、代表性;
- 多变量复合条件;
- 气候态异常;
- 地理名称、行政区和流域到数据掩码;
- 数据源可用性和质量状态查询。
每个模板必须有确定性 verifier。样本填槽可以自动扩增,但 split 必须按 event/time/space 分组。
5.2 Track B:Regional Nowcasting and Forecasting
输入:历史雷达/卫星/闪电/站点 + 可选全球背景。
输出:
- 未来降水/反射率场;
- threshold exceedance probability;
- storm object track;
- onset/cessation;
- severe/tornado occurrence;
- 多阈值风险多边形;
- calibrated uncertainty。
推荐 lead bins:
- 0--30 min;
- 30--60 min;
- 1--2 h;
- 2--6 h;
- 更长 lead 只在有合适 forecast source 时设置。
WeatherBench2 只提供背景或 forecast initialization,不充当高分辨率未来真值。
5.3 Track C:Cross-Scale Evidence Routing
这是最能体现你们独特性的主任务:
agent 在全球背景、区域雷达、站点和报告之间,应该先看什么、在哪里看、看多细、何时停止?
设计:
- 初始只给粗粒度 global context 和 event hint;
- agent 可请求区域 crop、雷达层、站点曲线、派生指数和报告片段;
- 设置 tool-call、像素、字节、时间或 token budget;
- 记录每次请求的区域、变量、时段、分辨率与理由;
- 最终输出预测、置信度、证据引用和 abstention。
对照:
- full-information oracle;
- fixed evidence pack;
- random retrieval;
- cost-matched retrieval;
- expert-designed minimal evidence;
- no-global / no-radar / no-station / no-report;
- delayed/corrupted source。
这比 Zephyrus 的“工具存在/不存在”更真实,也继承 AgentCaster 的受限资源思想。
5.4 Track D:Source Health and Evidence Conflict
构造真实和可控故障:
- 雷达缺帧、坏条带、局地遮挡、质量退化;
- 站点 stuck value、spike、missing、累计窗错误;
- 时间戳错位;
- 单位错误;
- 错误投影或区域;
- 报告地点/时段错配;
- 全球场与局地观测不一致;
- hidden combination faults。
任务:
- 判断哪个源可信;
- 选择替代证据;
- 给 source health score;
- 在不确定时 abstain;
- 比较故障前后预测和校准。
故障注入必须保留 clean parent、注入 operator、参数和 seed。
5.5 Track E:Event and Report Verification
借鉴 Zephyrus Task 49 与 TerraBench Document track。
将报告拆成原子 claim:
text
claim_id
claim_text
claim_type
time_scope
geography
variable / threshold / relation
source_span
available_at
verifier
evidence_refs
label = supported | refuted | insufficient负样本不要只做语言否定,至少包含:
- 数值阈值扰动;
- 地点互换;
- 时间窗错配;
- 变量互换;
- 方向反转;
- 因果关系反转;
- 预报和观测时态互换;
- 真实但证据不足的
insufficient。
采用三分类而不是只做 True/False,减少“缺证据被误判为错误”。
5.6 Track F:End-to-End Warning Chain
借鉴 SIREN,但对同一 event episode 提供严格 snapshot:
- Characterize:事件类型、物理机制、证据质量;
- Predict:位置、起始、严重度、路径、持续和概率;
- Assess:人口/设施/降水/业务影响;若缺暴露数据则只做可支持的影响代理;
- Decide/Communicate:警报候选、公众信息、证据和不确定性;
- Verify/Update:新观测到达后更新判断并解释变化。
每个 chain 同时运行:
- Agent Chain:上游输出传给下游;
- Oracle Upstream:下游收到正确上游状态;
- Corrupted Upstream:定量注入错误;
- Blocked Source:关键模态不可用。
这样才能分离本阶段能力和错误传播。
5.7 Track G:Counterfactual / Intervention
只有在拥有明确 simulator 或可控制数据生成过程时才设置:
- 改变初始场、参数或传感器可用性;
- baseline/intervention 使用相同模型版本、seed、边界和其余参数;
- 输出应称为 simulator-conditioned response,而非真实世界因果效应。
如果当前没有可信 simulator,v1 可以不设真实大气反事实,只保留 source-health intervention。
6. 样本契约
推荐单 item manifest:
yaml
task_id: ...
episode_id: ...
event_id: ...
track: cross_scale_routing
subtask: probabilistic_heavy_rain_polygon
difficulty:
data_scope: regional
tools_required: [global_field, radar_volume, station_series]
min_reasoning_steps: 4
hidden_faults: 1
decision_time: ...
context_start: ...
context_end: ...
target_start: ...
target_end: ...
lead_time: ...
evidence_policy:
allowed_sources: [...]
max_tool_calls: 20
max_bytes: ...
time_filter: available_at <= decision_time
evidence_refs:
- source_id: ...
object_uri: ...
checksum: ...
valid_time: ...
issue_time: ...
available_at: ...
quality: ...
question:
instruction: ...
event_conditions: ...
answer_spec: ...
answer_contract:
type: probability_geometry
schema_version: ...
units: ...
thresholds: [...]
ground_truth:
refs: [...]
verifier_version: ...
provenance: ...
canonical_trace:
steps: ...
artifacts: ...
split:
name: hidden_test_2022
group_id: storm_system_...
leakage_audit: passed7. 任务难度不能只用 Easy/Medium/Hard
建议记录可解释难度向量:
例如:
:最少必要工具数; :完成任务必须用到的模态; :全球/区域/设备尺度数; :canonical workflow 最少步骤; horizon:预测长度;missingness:关键证据缺失程度;conflict:来源冲突数;output_complexity:标量、列表、轨迹、场、多边形或报告。
可以再把这个向量映射为 Easy/Medium/Hard,但原始维度必须保留。
8. Sampling:自然基率集和挑战集分开
8.1 Natural-Rate Stream
目标:测 false alarm、calibration、可靠性和真实工作负载。
- 连续时间窗;
- 不按事件筛选;
- 包含大量无事件和弱事件;
- 保留真实缺测与产品延迟;
- 输出 event/non-event 与概率;
- 可按小时或固定决策周期定义。
8.2 Curated Challenge Set
目标:测高影响、罕见、复杂和故障情形。
- tornado/severe outbreak;
- 极端降水;
- 多单体合并/分裂;
- near-miss;
- 高不稳定但无灾害;
- radar/station/report disagreement;
- source failure;
- 跨区域 OOD。
GridRad-Severe、TornadoNet 和 SEVIR event windows 更适合这一轨。不能把挑战集的阳性比例用于 deployment calibration。
8.3 Hard negatives
负样本至少分:
- quiet random;
- same season/region;
- synoptically similar but no event;
- high radar signal but wrong hazard;
- strong environment but no tornado;
- report near-match but wrong time/location;
- source conflict;
- operational false alarm / near miss,若可获得。
9. Split 设计
9.1 最高优先级:event-group chronological split
任何属于同一 storm system、event family、track、报告集合或高度重叠窗口的样本只能进入一个 split。
text
group_id = canonical synoptic/storm event
sort by decision_time
split groups, never individual frames9.2 2020--2022 共时数据的建议
如果 GridRad、站点、WeatherBench2 与报告在 2020--2022 年能稳定对齐,可把:
- 2020:任务开发、verifier 开发和训练;
- 2021:公开 validation / public test;
- 2022:hidden test。
这只是建议协议,实施前必须审计各年份覆盖度和事件数量。若 2022 太小,应按时间块和 storm group 重划,但不能随机拆窗口。
9.3 跨数据源 OOD
- US event sources → MeteoNet-France;
- SEVIR-style 事件 → GridRad/TornadoNet;
- station seen → station unseen;
- radar/network seen → network unseen;
- region seen → region unseen;
- hazard seen → compositional hazard unseen。
不同数据集无需强行共享同一变量;任务 contract 可共享,source adapter 不同。
9.4 Template holdout
至少保留三种测试:
- Instance holdout:同模板新地点/时间;
- Template holdout:新运算图或新问题组合;
- Workflow holdout:新工具组合和新模态路径。
只有第一种会高估泛化。
9.5 文本近重复和污染
- 同一报告的修订版不能跨 split;
- 同一事件的多机构转述要聚类;
- question paraphrase 不算独立模板;
- 对 prompt 与报告做 MinHash/embedding near-duplicate audit;
- hidden test 的自然语言可在冻结后重新表达,但 verifier 不变。
10. 标注与真值
10.1 真值优先级
- 直接观测:未来雷达、站点、报告位置/时间;
- 确定性派生:阈值、对象、几何、统计、collocation;
- 规则/业务定义:风险等级、warning schema;
- 外部文档:document truth;
- 专家判断:机制、解释、行动建议;
- LLM 辅助:只生成候选,不作唯一真值。
10.2 Document truth 与 execution truth
报告或论文中的数字单独保存,不直接覆盖数据重建结果:
text
document_truth:
value
units
source_span
source_version
execution_truth:
value
units
data_refs
code_version
artifacts
verification_mode: exact | approximate | structural | proxy10.3 Expert annotation
Hard tasks 至少:
- 两位独立标注;
- 记录专业背景;
- 隐藏模型身份;
- 先独立评分再裁决;
- 报告 raw agreement、
或 rank correlation; - 对字段、容差、event linkage 和 canonical trace 分别抽审,而不只审 item accept/reject。
11. 工具环境
11.1 推荐工具族
| 工具族 | 示例 |
|---|---|
| Catalog | 列出时点可用数据、变量、区域、分辨率和质量 |
| Global fields | WeatherBench2 切片、climatology、anomaly |
| Radar | volume/cross-section/max product/object/track/crop |
| Station | query、QC、aggregation、nearby stations、collocation |
| Geospatial | mask、bbox、admin、distance、area、reprojection |
| Event graph | event lookup、related records、timeline |
| Reports | time-filtered search、claim span、revision history |
| Derived diagnostics | precipitation statistics、storm metrics、wind/thermodynamic indices |
| Forecast | nowcast model、global forecast model、ensemble |
| Artifact | save/load/inspect/compare/hash |
11.2 每次工具调用的日志
text
call_id
task_id
tool_name / version
arguments
requested_at
started_at / completed_at
status
error_type
bytes_read
compute_cost
observation_summary
artifact_refs
input_checksums
output_checksums11.3 权限
- 工具只返回
available_at <= decision_time的对象; - agent 不直接访问 raw filesystem;
- target store 与 evidence store 物理隔离;
- 报告搜索必须经过时间过滤;
- 任何 retrospective override 都写进 trace。
12. 评价协议
12.1 结果指标
| 输出 | 指标 |
|---|---|
| 标量 | MAE/RMSE、标准化误差、relative error;零值单独处理 |
| 降水/反射率场 | CSI、POD、FAR、FSS、RMSE/MAE、SAL 或对象指标 |
| 概率 | Brier、CRPS、reliability、ECE、sharpness |
| 事件分类 | precision、recall、F1、AUROC/AUPRC;自然基率集重点看 PR 与 FAR |
| 轨迹 | distance error、timing error、track IoU、object association |
| 多边形 | risk-band IoU、centroid distance、coverage、overprediction area |
| 时间 | onset/cessation error、lead-time utility |
| 报告 claim | supported precision、reference recall、contradiction、unsupported、insufficient handling |
| 决策 | utility、miss/false-alarm cost、unsafe recommendation、abstention quality |
降水和影响常为 zero-inflated,建议两阶段评分:
不要直接使用在
12.2 过程指标
分别报告:
- tool selection;
- argument correctness;
- temporal permission compliance;
- evidence citation correctness;
- source-health diagnosis;
- necessary evidence coverage;
- unnecessary call cost;
- tool failure recovery;
- artifact provenance completeness;
- final schema validity。
不要只做一个 composite score。各 component 先单独公开,再按明确权重给辅助总分,并做权重敏感性。
12.3 分层统计
至少按以下维度报告:
- dataset/source;
- hazard;
- event vs quiet;
- region;
- season;
- lead time;
- source availability;
- fault type;
- task/template/workflow;
- native vs derived view;
- seen vs unseen station/radar/network。
主置信区间以 event/item 为 resampling unit,不以 frame、field 或 tool step 当独立样本。模型随机性应多次运行,数据不确定性和模型随机性分开报告。
13. QC 流水线
text
Source audit
→ schema/unit/time normalization
→ event candidate linkage
→ deterministic verifier generation
→ tool execution
→ automatic sanity checks
→ leakage audit
→ near-duplicate/group audit
→ expert review
→ canonical trace cleanup
→ frozen manifest + checksum
→ hidden test packaging自动 sanity checks:
- 单位/范围;
- 坐标和 CRS;
- monotonic time;
- target 在 context 之后;
- station accumulation 对齐;
- radar/station collocation distance;
- empty/NaN/constant field;
- geometry valid;
- probability range;
- nested risk polygons;
- answer re-execution;
- artifact checksum;
- source license。
14. v1 的建议范围
不要一次实现所有任务。建议先做四个互补核心轨:
v1-A:可执行原子任务
- WeatherBench2 global background;
- SEVIR/MeteoNet/GridRad/站点的确定性统计、阈值、对象与跨源比较;
- 模板 + verifier;
- 公开 dev benchmark。
v1-B:自然基率与事件挑战双轨 nowcasting
- natural continuous windows;
- severe/tornado/precipitation challenge episodes;
- 未来雷达/站点作标签;
- 概率和校准评价。
v1-C:跨尺度 evidence routing
- global → regional → device;
- tool budget;
- source missing/conflict;
- full-information oracle 与 cost-matched baselines。
v1-D:报告 claim verification + 简化 warning chain
- claim-level supported/refuted/insufficient;
- Characterize → Predict → Verify/Update;
- 先不做缺少可靠 exposure data 的完整经济/人群影响。
规划规模可先以“可审计”为约束,而不是追求几十万 QA。一个合理的初始目标是:
- 2,000--4,000 个 deterministic atomic items;
- 800--1,500 个 event/quiet forecast episodes;
- 200--300 个完整多阶段 chain;
- 200 个专家双标 Hard items;
- 500--800 个冻结 hidden-test items。
这些是工程规划目标,不是由现有数据量推导的事实;最终数量应由源覆盖审计、事件去重和专家预算决定。
15. 实施顺序
Phase 0:资产审计
对每个源输出 machine-readable report:年份、区域、变量、单位、分辨率、频率、事件 ID、质量标志、许可、文件量、缺测和与其他源的时间重叠。
Phase 1:统一 metadata,不统一像素
- immutable object catalog;
- checksum;
- 四时间字段;
- native + derived view;
- source adapter。
Phase 2:事件图
- 建 hazard taxonomy;
- candidate linkage;
- 人工审计中间置信区间;
- 生成 split group。
Phase 3:任务工厂
- 先写 20--30 个专家 seed templates;
- 每个 seed 配 verifier 和单元测试;
- 再做参数化扩增和 LLM 候选生成;
- 自动运行、拒绝失败样本。
Phase 4:benchmark 冻结
- event/time/template/workflow splits;
- natural/challenge 双轨;
- hidden test;
- canonical traces、artifact ledger、评价脚本;
- 数据卡和许可。
Phase 5:agent 评测
- fixed pack;
- tool agent;
- full-information oracle;
- expert minimal evidence;
- source ablation;
- fault intervention;
- multi-run confidence intervals。
16. 最值得形成论文贡献的三点
16.1 Multi-scale sparse evidence benchmark
不是每个样本都拥有所有模态,agent 必须认识数据可用性并决定是否值得下钻到局地设备。
16.2 Bitemporal, event-centric leakage control
把 valid_time、issue_time、available_at 和 event-group split 作为第一等公民,解决历史气象 agent benchmark 普遍存在的回顾性泄漏。
16.3 Source reliability and evidence arbitration
不仅考“有工具时能不能答”,还考源缺测、冲突、延迟和故障时能否选择证据、校准不确定性和 abstain。
这三点与 Zephyrus、SIREN、TerraBench、AgentCaster 都有清楚差异,也能充分利用你们全球、区域、雷达、站点和报告的组合优势。
17. 最终建议
如果只能先做一条主线,我建议选择:
事件级、严格时间权限下的全球—区域—设备证据路由与可靠性 benchmark。
具体以 2020--2022 可共时对齐的 GridRad + 站点 + WeatherBench2 + report 作为主 spine;SEVIR、TornadoNet 和 MeteoNet 作为事件挑战、跨传感器和跨区域 OOD 扩展。这样既有清楚的核心数据闭环,也不会因为强行追求“所有数据完全融合”而把项目拖成不可审计的数据工程。