Skip to content

TerraBench:异构地球系统数据上的可执行智能体基准

原文题目:TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?
作者:Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani, Huy M. Le, Muhammad Umer Sheikh, Numan Saeed, Muhammad Haris Khan, Salman Khan
机构:Mohamed bin Zayed University of Artificial Intelligence;ADIA Lab
版本与时间:arXiv:2606.13148v2,2026-07-01;v1 提交于 2026-06-11
发表状态:arXiv 预印本。TeX 使用 NeurIPS 2026 Evaluations & Datasets Track 模板,但这不等于已被 NeurIPS 接收
论文与材料arXiv · PDF · 官方代码
DOI10.48550/arXiv.2606.13148
Tagsearth-science-agent agentic-benchmark tool-use scientific-ai geospatial-reasoning climate-ai ReAct benchmark-evaluation

One-Sentence Summary

TerraBench 把地球科学智能体评测从静态问答推进为可执行、可追踪、带数值容差的长程工作流:403 个任务要求智能体协调再分析资料、卫星影像、GIS、预测模型和确定性模拟器,但最强模型 Claude Sonnet 4.6 的 ToolUseScore 仅为 59.22,严格数值命中率 Hit@tol 仅为 22.88;不过,当前公开代码与论文指标公式存在实质差异,完整数据和论文级评测日志也尚未发布,因此论文结果目前不能由第三方端到端复算。

0. 先给结论

0.1 这篇论文真正解决了什么

论文的核心贡献不是新的天气基础模型,也不是新的遥感视觉编码器,而是把“地球科学智能体是否会推理”改写成一个可执行、可审计的问题:

  1. 智能体必须决定调用哪些科学工具,而不是仅生成自然语言答案;
  2. 工具参数必须正确到变量、区域、时间窗、阈值、情景设定和单位;
  3. 中间结果必须落为 NetCDF、GeoTIFF、CSV、JSON 或 PNG 等可追踪工件;
  4. 最终答案不仅要语义上合理,还必须在字段级数值容差内;
  5. 评测同时观察过程质量和结果质量,因而能识别“流程看起来像对的,但数字仍然错”的失败。

这比只评最终自然语言答案更接近真实科研工作流,也比只比较工具名序列更能暴露科学计算中的参数和数值错误。

0.2 最重要的实验事实

  • 基准包含 403 个任务、3 个 track、8 个应用域、77 个论文口径的子工具,以及约 24,500 个经核验的执行步骤;平均约为 24,500/40360.824{,}500/403\approx60.8 步/任务。
  • 792 个候选问题仅保留 403 个,保留率为 403/792=50.88%403/792=50.88\%,与论文报告的 50.9% 一致。
  • 只有 25.6% 的最终样本一次运行完成,74.4% 需要多次执行,46.4% 至少需要三次执行。
  • 最强模型 Claude Sonnet 4.6:ToolUseScore 59.22、NumScore 28.44、Hit@tol 22.88。
  • 最强开放权重结果存在“过程/结果分裂”:Gemma 4 26B-A4B 的 ToolUseScore 最高,为 41.84;Qwen3.5-35B-A3B 的 NumScore 和 Hit@tol 最高,分别为 7.49 和 5.89。
  • 所有模型中,“数值超出容差”均是最普遍的失败类别,比例从 Claude Sonnet 4.6 的 84.6% 到 Qwen3.5-9B 的 99.3%。

0.3 我的总体判断

维度判断
问题重要性高。地球科学智能体最危险的错误往往不是不会说,而是调用了错误变量、时间窗、区域或模拟设定
基准理念强。过程指标、结构化答案、数值容差和工件溯源构成了相对完整的评测闭环
数据与标注中强。筛选严格且有人审,但任务由 LLM 辅助生成,独立专家审计范围仍小
数学与统计中等。核心指标定义清晰,并做了 item-level bootstrap;但容差敏感性、模型随机性和 subgroup 统计不足
实验结论中强。足以支持“现有模型在长程地球科学工具工作流上仍不可靠”,不足以支持某个模型具有稳定、通用的地球科学推理能力
公开复现性弱。完整 403 项数据、论文评测日志和论文一致的指标实现尚未公开
创新度7.5/10。主要是基准设计、评测协议与系统整合创新,而非新的学习算法或科学模型
审稿建议Major Revision / Weak Accept(取决于完整数据和评测代码能否在审稿期公开)

1. Problem:从静态问答到可执行地球科学推理

1.1 一句话问题定义

给定一个需要跨越地球观测影像、格点物理场、GIS 上下文、预测产品或模拟器输出的问题,智能体能否规划并执行一条科学上有效、参数正确、可复查的工具链,并返回满足结构和数值容差的答案?

1.2 为什么静态 QA 不够

真实地球科学问题常同时要求:

  • 解析研究区域和时间范围;
  • 获取 ERA5、CMIP6、C3S、卫星或 OSM 数据;
  • 对齐投影、网格、时间分辨率和变量定义;
  • 计算异常、阈值、集合统计或空间叠加;
  • 运行 AquaCrop、DSSAT、CLIMADA、EnergyPlus、SUMO、UTCI 等模型;
  • 对 baseline、intervention 和 counterfactual 情景进行可比计算;
  • 保存中间工件并从工件中提取最终数值。

一个语言模型即使能写出合理解释,也可能在经纬度顺序、单位换算、变量名、时间切片或容差内数值上失败。TerraBench 的问题定位是:科学智能体的可靠性必须由执行轨迹和最终结果共同决定。

1.3 主要 claims

论文可分解出四条主要主张:

  1. TerraBench 首次在一个统一可执行接口中组合 EO 影像、格点环境数据、GIS、模拟器和文档锚定验证;
  2. TerraAgent 能把 LLM 规划与 77 个科学子工具、工件和结构化输出连接起来;
  3. 过程指标和数值结果指标之间存在显著缺口,单看工具轨迹会高估智能体能力;
  4. 当前最强前沿模型和开放模型都远未达到可靠地球科学智能体的要求。

第 2、3、4 条有直接系统和实验支持。第 1 条是较强的“first”主张,依赖作者对同期工作的分类表,证据不如数值结果硬。

2. Method:TerraAgent 与 TerraBench 的结构

2.1 整体数据流

TerraAgent 基于 ReAct 风格的循环。对问题 qq、可见上下文 cc、输出 schema S\mathcal{S} 和工具集合 T\mathcal{T},可将第 tt 步抽象为:

ht=(q,c,a<t,o<t,S), h_t=(q,c,a_{\lt t},o_{\lt t},\mathcal{S}),
atπθ(ht,T),ot=E(at),ht+1=U(ht,at,ot). a_t \sim \pi_\theta(\cdot\mid h_t,\mathcal{T}), \qquad o_t=\mathcal{E}(a_t), \qquad h_{t+1}=U(h_t,a_t,o_t).

其中 ata_t 是工具调用,oto_t 是工具观察,E\mathcal{E} 是数据服务、GIS 运算、预测模型或模拟器构成的执行环境。论文没有用这些公式训练一个新策略;它使用冻结的现有模型进行推理时编排。以上是对系统的形式化,不是论文提出的新学习目标。

执行链为:

  1. 读取问题、上下文和结构化输出契约;
  2. 解析区域、时间、变量和任务类型;
  3. 选择并串行调用工具;
  4. 观察返回值并更新计划;
  5. 将中间数据物化为带路径和元数据的工件;
  6. 必要时调用代码/数学执行服务完成轻量计算;
  7. 输出自由文本说明和机器可读的 <final_json>
  8. 评测器分别比较工具过程和最终字段。

2.2 工具与工件

论文口径的 77 个子工具分布如下:

工具组子工具数主要职责
Data I/O3读取、检查和保存科学数据
Ensemble & Verification12集合统计、校准、事件概率和预报验证
Forecast2Pangu-Weather、Aurora 等预测封装
GIS / OSM6区域解析、空间查询、叠加和路网
Computation2数学/代码辅助计算
Reanalysis / Environmental12ERA5、空气质量及环境格点数据
Satellite / EO6Sentinel-2、Google Earth Engine 与指数计算
Seasonal13C3S 季节产品、偏差订正和多模型融合
Simulation11农业、灾害、建筑、交通和健康影响模拟
Visualization8地图、叠加图和派生可视产品
Web Search2外部科学背景检索
合计77论文发布时的评测环境口径

工件中心设计要求工具返回自然语言摘要和机器可读元数据,并落盘为 NetCDF、CSV、JSON、GeoTIFF 或 PNG。模拟器还记录输入/输出路径、SHA-256、内容类型、运行日志、seed、超时和情景假设。这一点非常关键:最终数字理论上可以回溯到具体输入文件和执行步骤。

2.3 三个 benchmark tracks

Track正确性来源典型任务主要风险
Fundamentals公共数据上的确定性执行检索、聚合、阈值、遥感/GIS 叠加变量、时间窗、坐标、网格和单位错误
Simulator-Grounded显式设定下的确定性模拟输出baseline、干预、反事实、影响评估情景参数不匹配、模拟器未运行或错误复用结果
Document-Grounded Verification文献报告值与公共工具重建值的双层锚定精确、近似、结构或 proxy 重建把文献答案直接抄入;构念、单位或数据版本不一致

Document-Grounded Verification 特别区分:

  • document truth:论文或报告中真实报告的数值及位置;
  • execution truth:用公开数据和工具重新执行得到的数值;
  • verification mode:exact、approximate、structural 或 proxy。

这个设计很符合真实复现:公共数据和软件版本常无法精确复刻原文,所以“同构念、同单位、同计算逻辑”的近似重建比强制数值相等更合理。与此同时,容差和 proxy 的人工决定也引入了主观性。

2.4 四个 reasoning levels

  • Level 0:观察性 grounding,解析时空坐标、对齐数据网格并计算观察量;
  • Level 1:关联性、多模态分析和结构化比较;
  • Level 2:干预情景设定、模型调用和 baseline 对照;
  • Level 3:反事实、回顾性、长程模拟或不完全可观测下的文档重建。

Level 1--3 借用了 Pearl 的关联、干预、反事实层级,Level 0 是作者新增的执行 grounding 层。但要注意:调用确定性模拟器比较两个情景并不自动等价于识别真实世界因果效应。这里的 level 更接近任务设定中的因果深度,不是对因果可识别性的证明。

2.5 没有训练阶段

论文没有训练新的地球科学模型,也没有定义端到端损失或反向传播:

θt+1=θt. \theta_{t+1}=\theta_t.

因此本文不存在学习率、batch size、优化器、参数更新或训练集意义上的模型创新。贡献属于推理时系统编排、基准构造和评测协议。

2.6 底层数据、模型和模拟器来源

论文列出的资源族如下。它们构成工具环境,并不意味着每个 benchmark item 都同时使用全部来源。

资源族论文列举的代表来源用途
再分析与环境格点ERA5、CMIP6、空气质量和环境网格时空检索、聚合、阈值、异常和长期背景
季节产品C3S seasonal集合、校准、季节预测与多模型分析
卫星/EOSentinel-2、Google Earth Engine影像、指数、变化与 GIS 叠加
地理背景OpenStreetMap 和 GIS 图层AOI、设施、道路、暴露和空间关系
天气预报模型Pangu-Weather、Aurora wrappers预报场和 forecast-grounded workflow
农业模拟AquaCrop、DSSAT产量、生物量、蒸散、水分胁迫和物候
风险模拟CLIMADAhazard × exposure × vulnerability、风险曲线
建筑与交通EnergyPlus、SUMO能耗、峰值、不舒适小时、旅行时间和延误
健康影响UTCI、exposure-response function热应激、归因比例和病例数
文档与计算Web search、论文/报告、代码/数学执行器scientific anchor、重建与轻量计算

论文没有给完整数据清单、URL、版本、许可、时间/空间覆盖、变量、预处理、文件规模和各来源实际调用频率。TerraBench 的异构性主要由工具生态与 workflow 体现,而不是一份完整统一的数据 manifest。

3. Evaluation:保留全部数学细节

3.1 符号与对齐对象

设:

  • PallP_{\mathrm{all}}:预测轨迹中全部非 meta 工具调用;
  • PvalidP_{\mathrm{valid}}:其中满足调用要求的子集;
  • PsuccessP_{\mathrm{success}}:得到成功 observation 的子集;
  • GvalidG_{\mathrm{valid}}:ground-truth 轨迹中的有效工具调用。

预测和参考步骤通过动态规划对齐,可按工具名精确匹配,也可按工具组 relaxed matching。

3.2 过程指标

Instruction Accuracy

InstAcc=PvalidPall. \mathrm{InstAcc} = \frac{|P_{\mathrm{valid}}|}{|P_{\mathrm{all}}|}.

Tool Call Success Rate

ToolCallSuccessRate=PsuccessPall. \mathrm{ToolCallSuccessRate} = \frac{|P_{\mathrm{success}}|}{|P_{\mathrm{all}}|}.

Tool Accuracy

ToolAcc=relaxed_matchesGvalid. \mathrm{ToolAcc} = \frac{\mathrm{relaxed\_matches}}{|G_{\mathrm{valid}}|}.

这个式子更像相对于参考步骤的 relaxed recall,而不是通常同时惩罚 false positive 的 accuracy。额外调用主要需要 CategoryF1、OrderScore 和其他过程项来间接惩罚。

CategoryF1 是工具组标签多重集合上的 F1。若多重集合交集计数为 mm,预测和参考调用数分别为 np,ngn_p,n_g,则其标准展开为:

Pc=mnp,Rc=mng,CategoryF1=2PcRcPc+Rc. P_c=\frac{m}{n_p}, \qquad R_c=\frac{m}{n_g}, \qquad \mathrm{CategoryF1} = \frac{2P_cR_c}{P_c+R_c}.

ArgAcc 对已对齐的工具对,平均参数 key 的语义匹配和 value 匹配,覆盖时间窗、阈值、bounding box、变量和情景参数。论文没有给出 key/value 子分数、连续值容差和缺失参数惩罚的完整逐项公式,这是方法透明度的一个缺口。

OrderScore

OrderScore=Unique+AnyOrder+SameOrder3, \mathrm{OrderScore} = \frac{\mathrm{Unique}+\mathrm{AnyOrder}+\mathrm{SameOrder}}{3},

其中 Unique 比较工具组集合重叠,AnyOrder 比较工具组多重集合重叠,SameOrder 使用最长公共子序列刻画顺序一致性。

最终组合分数为:

ToolUseScore=0.30ToolAcc+0.15InstAcc+0.20ArgAcc+0.15CategoryF1+0.15OrderScore+0.05ToolCallSuccessRate. \begin{aligned} \mathrm{ToolUseScore}={}&0.30\,\mathrm{ToolAcc}+0.15\,\mathrm{InstAcc}+0.20\,\mathrm{ArgAcc}\\ &+0.15\,\mathrm{CategoryF1}+0.15\,\mathrm{OrderScore}+0.05\,\mathrm{ToolCallSuccessRate}. \end{aligned}

六项权重之和为 1。作者给 ToolAcc 和 ArgAcc 最大权重,因为错误工具或错误时空参数通常会使后续科学计算整体失效。

一个需要注意的内部冗余是:论文附录承认当前 metric logs 中 ToolCallSuccessRate 与 InstAcc 完全相同,因此构念验证的 logistic regression 删除了前者以避免完全共线。但官方 ToolUseScore 仍同时给二者 0.15 和 0.05 的权重,相当于让同一信号占 0.20。

3.3 数值答案指标

每个输出字段必须包含 keyvalueabs_tolrel_tolfloor_scale。对 ground truth yy 和预测 y^\hat y,定义有效容差、绝对误差和归一化误差:

λ=max(τabs,τrely,f), \lambda = \max \left( \tau_{\mathrm{abs}}, \tau_{\mathrm{rel}}|y|, f \right),
AE=y^y,n=AEλ. AE=|\hat y-y|, \qquad n=\frac{AE}{\lambda}.

其中 τabs\tau_{\mathrm{abs}} 是绝对容差,τrel\tau_{\mathrm{rel}} 是相对容差,ff 是字段级 floor scale。严格命中为:

Hit@tolfield=1{AEλ}. \mathrm{Hit@tol}_{\mathrm{field}} = \mathbf{1} \left\{ AE\leq\lambda \right\}.

连续部分信用为:

NumScorefield={1,n1,2(n1),n>1. \mathrm{NumScore}_{\mathrm{field}} = \begin{cases} 1, & n\leq 1,\\ 2^{-(n-1)}, & n\gt 1. \end{cases}

因此误差为 2λ,3λ,4λ2\lambda,3\lambda,4\lambda 时,NumScore 分别为 1/2,1/4,1/81/2,1/4,1/8。该函数在 n=1n=1 处连续,既保留“容差内满分”的硬边界,又不会让稍微越界的结果立刻归零。

多字段输出对已对齐的 ground-truth 字段取均值。key 唯一且匹配时按 key 对齐,否则退回字段顺序;缺失或无法解析的数值记 0;字符串和布尔值使用 canonical exact match,并把相同的直接匹配值同时用于 Hit@tol 和 NumScore。

这里的核心风险不是公式本身,而是 τabs\tau_{\mathrm{abs}}τrel\tau_{\mathrm{rel}}ff 由标注者逐字段设定。论文做了 ToolUseScore 权重敏感性分析,却没有报告容差敏感性分析。如果容差改变,Hit@tol 排名和“84% 以上数值失败”的结论都可能改变。

3.4 聚合、构念效度与不确定性

所有 aggregate metric 都先在 item 内聚合,再对 403 个 item 做非加权平均;工具步骤和输出字段不被当作独立样本。这是正确的层级处理。

作者定义严格成功标签:

Success=1{Hit@tol1}. \mathrm{Success} = \mathbf{1} \left\{ \mathrm{Hit@tol}\geq 1 \right\}.

因为 item 级 Hit@tol 是字段均值,所以该定义要求一个 item 的所有字段全部在容差内。用过程指标预测 Success 的 logistic regression 得到 AUC 0.803、McFadden pseudo-R2=0.160R^2=0.160,说明过程指标具有预测信号,但仍解释不了大部分结果差异。

权重敏感性实验对已发布权重做 ±0.10\pm0.10 随机扰动、截断为非负并重新归一化,重复 1,000 次。相对原排行榜的 Spearman 中位数为 0.996,最小值 0.982,所有试验均满足 ρ0.95\rho\geq0.95;首尾模型均未变化。这个结果支持模型级排序对权重不敏感,但不证明这些权重具有唯一的科学解释。

bootstrap 以 item 为单位有放回抽取 N=403N=403 个 item,重复 B=2000B=2000 次,报告 percentile 95% CI;模型比较使用配对 item 差值。它反映有限 benchmark item 的抽样不确定性,但不包含同一模型重复采样、API 版本漂移或工具服务随机性的方差。

4. Benchmark Creation:数据与标注协议

4.1 候选生成与筛选

候选池共 792 项:Fundamentals 323、Document-Grounded Verification 307、Simulator-Grounded 162。经过可行性检查、真实工具执行、多阶段核验、拒绝或大修,最终保留 403 项。

每个保留项包含:

  • Context、Use case、Subtask、Level、Question、Reference;
  • 可见的 Answer 输出契约和 <final_json> schema;
  • Instruction Prompt 形式的可执行工作流模板;
  • canonical Main_trace.json
  • 工具 observations、支持工件和结构化 ground truth。

推理时只向被测模型提供可见上下文、问题、科学 reference framing 和输出 schema;文档数值锚点、评测标签和 evaluator metadata 隐藏。

候选并非从固定题库随机采样。Appendix 描述的起点是:先围绕八个 application domains brainstorm use cases,再让 LLM 辅助做 web research 和 document extraction,寻找真实科学流程、业务情景和论文/报告中的 quantitative anchors。之后才判断是否能在现有工具环境里真实执行。

这意味着 selection pipeline 同时受到三种偏差影响:领域作者选择、网络文档可见性,以及作者工具栈的可执行性。不能把最后 403 项视为真实地球科学任务的自然分布。

4.2 样本 schema、执行 trace 与动态真值

每个 item 是一个 executable benchmark program,而不是只有 question/answer。标准字段包括:

  • Context
  • Use case
  • Subtask
  • Level
  • Question
  • Reference
  • Answer<final_json> contract;
  • Instruction Prompt

Annotation agent 按 Instruction Prompt 运行真实工具,生成:

  • canonical Main_trace.json
  • tool observations;
  • NetCDF、CSV、JSON、GeoTIFF、PNG 等 supporting artifacts;
  • number_ground_truth.json 等结构化真值。

模拟器 run 还要求 run_id、scenario 名称和描述、显式假设、seed、资源 metadata、timeout、隔离运行目录、输入输出路径、SHA-256、content type 和 runtime logs。Counterfactual item 必须用同一工具和 matched settings 连跑 baseline/intervention,只改变指定变量。

Document track 使用双层真值:

  1. document truth:原论文或报告的数字和位置;
  2. execution truth:公开工具重建得到的 construct 或 analogue;
  3. verification mode:exact、approximate、structural 或 proxy。

最终数字必须由 surviving observation、保留工件或 deterministic transform 支撑;手填数字、复制隐藏 metadata 或伪造工具调用不被接受。

4.3 候选漏斗和修订强度

按 Figure 的百分比:

Track候选数最终保留率无需修订率
Fundamentals32361.6%32.8%
Simulator-Grounded16253.1%22.2%
Document-Grounded30738.4%27.0%
Overall79250.9%28.4%

由候选数与百分比可推算最终约为 199 / 86 / 118 项,总计 403;这是按图计算的近似值,不是论文发布的机器 manifest。

Trace 修订轮数分布:

  • 1 次运行:25.6%;
  • 2 次:28.0%;
  • 3--4 次:40.4%;
  • 5 次及以上:6.0%。

因此 74.4% 的保留项经历了至少一次追加运行或修订,46.4% 至少运行三次。论文称总计约 24,500 个 verified execution steps,平均约 60.8 step/item 只是除法推断,不代表每项都近似 61 步。

4.4 人工审核的八项标准

  1. workflow fidelity;
  2. provenance 和计算证据;
  3. 隐藏答案与 evaluator 信息的 leakage control;
  4. 保留真实时间顺序和有意义的失败分支;
  5. 完整回答所有子问题;
  6. 输出 schema、字段名、单位和符号约定正确;
  7. document truth 与 execution truth 严格分离;
  8. 只做最小编辑,不新增推理、科学主张或数值。

人工投入约 117 person-days。标注阶段消耗 2,469,318,457 tokens,模型评测再消耗 820,028,249 tokens,总计约 32.89 亿 tokens。

4.5 标注一致性

作者从候选池随机抽取 50 项,由两位标注者独立做 accept/reject:原始一致率 88%,6 项分歧,Cohen's κ=0.694\kappa=0.694

标准 Cohen's kappa 为:

κ=pope1pe, \kappa = \frac{p_o-p_e}{1-p_e},

其中 pop_o 是观察一致率,pep_e 是按边际分布推得的随机一致率。论文将 0.694 称为 substantial agreement,但这个定性阈值依赖惯例。更重要的是,审计只覆盖 item 级 accept/reject,不覆盖每个工具参数、ground-truth 数值、容差和 trace step 的一致性;论文也明确说更完整的独立专家审计是未来工作。

4.6 Split、去重与泄漏控制缺口

TerraBench 把 benchmark labels、document anchors 和 evaluator metadata 从模型可见输入中隐藏,并要求 canonical trace 不伪造、不改写保留数字。这个 item 内防泄漏设计很强,但 dataset-level 控制未完整报告:

  • 没有 train/dev/test split;
  • 没有 geography、time、event、document 或 data-source holdout;
  • 没有 near-duplicate 检测算法;
  • 没有相同论文、相同 AOI、相同数据切片或相近 workflow 的 group split;
  • 没有报告网页与模型预训练语料污染;
  • 没有对每个 ground-truth 字段、容差和工具参数做独立双标。

因此 403 项适合作为冻结 evaluation set,但一旦开发者反复观察错误并调 prompt,就需要新建 hidden test。

4.7 一个源文件中的计数异常

v2 TeX 附录保留了一张被注释、不会渲染到 PDF 的草稿组成表。表内三行按单元格相加分别是 199、81、118,总和 398,但草稿行标签写成 199、86、118,并声称总计 403;各领域列总和也只有 398。因为该表未出现在正式 PDF,不能把它当成发布数据,但它说明 raw composition 表可能来自旧版本或存在 5 项版本漂移。正式发布应提供可机器检查的 manifest,以消除这个不一致。

5. Experiments:结果怎样读

5.1 主结果

下表完整保留论文 Table 2 的七个核心指标,数值均为百分制:

ModelToolAccCategoryF1ArgAccOrderScoreToolUseScoreNumScoreHit@tol
GPT-5.423.8832.9454.1033.0241.0912.299.80
GPT-5.535.3937.2239.7339.6745.0126.4521.03
Gemini 3.1 Pro Preview35.6432.1146.9142.0744.9317.0713.21
Gemini 2.5 Flash18.4624.1650.9123.9736.207.706.34
Claude Haiku 4.538.2540.2651.2546.7948.1421.1915.23
Claude Sonnet 4.654.4350.0552.2661.0259.2228.4422.88
Qwen3.5-9B baseline21.5623.5737.5325.6231.181.301.20
Qwen3-1.7B1.021.857.031.745.401.151.08
Gemma 4 E4B5.909.0029.058.5016.313.042.90
Mistral 7B Instruct v0.36.4010.9937.1910.0118.792.411.67
Llama 3.1 8B0.200.401.800.401.501.000.90
InternVL3-8B1.602.707.502.304.601.701.10
Qwen3-8B2.424.0714.903.777.972.061.33
Qwen3-VL-8B7.6712.1733.0911.3519.095.073.11
Qwen3-14B9.4013.6637.7213.3221.124.303.80
Gemma 4 26B-A4B31.8928.7443.6935.0541.844.453.67
Qwen3.5-35B-A3B30.1730.0547.2336.4639.957.495.89

5.2 三个不能混为一谈的观察

第一,流程分高不等于答案对。 Claude Sonnet 4.6 的 ToolUseScore 为 59.22,但 Hit@tol 只有 22.88。Qwen3.5-9B 更极端:过程分 31.18,严格命中仅 1.20。工具访问本身不是可靠性的充分条件。

第二,模型规模和过程能力并非单调。 Gemma 4 26B-A4B 的开放模型过程分优于 Qwen3.5-35B-A3B,但后者的最终数值分更高。这说明“会走流程”和“能把证据变成正确字段”是两个不同能力。

第三,不宜把近似排行当作显著差异。 Claude Sonnet 4.6 的回答分最高,但 GPT-5.5 的 NumScore 26.45 和 Hit@tol 21.03 很接近,论文没有给出这两个 frontier 模型的配对差值 CI。现有 bootstrap 只能强力支持 Claude 与 Qwen3.5-35B 之间的大差距。

5.3 Bootstrap 置信区间

ModelToolUseScore 95% CINumScore 95% CIHit@tol 95% CI
Claude Sonnet 4.6[57.46, 60.91][25.03, 32.08][19.23, 26.45]
Claude Haiku 4.5[46.25, 49.94][17.83, 24.50][12.24, 18.47]
GPT-5.5[42.94, 47.11][22.96, 30.02][17.34, 24.45]
Qwen3.5-35B[38.11, 41.78][5.45, 9.76][4.09, 7.89]
Qwen3.5-9B[29.29, 33.16][0.48, 2.49][0.48, 2.34]

Claude Sonnet 4.6 减 Qwen3.5-35B 的配对差值为:

  • ToolUseScore:0.1927,95% CI [0.1718, 0.2143];
  • NumScore:0.2095,95% CI [0.1716, 0.2499];
  • Hit@tol:0.1698,95% CI [0.1320, 0.2097]。

三个区间均排除 0,因此这组 frontier/open 差异在该 403 项基准上稳定。但这不是对模型总体能力的置信区间,也没有涵盖重复推理的随机性。

5.4 过程与结果相关性

NumScore 与四项过程指标的 Pearson 相关系数为:

过程指标与 NumScore 的 rr
ToolAcc0.359
OrderScore0.357
CategoryF10.328
ArgAcc0.193

全部为正但仅中低度相关。最值得注意的是 ArgAcc 的相关最低,这与“错误参数值是普遍失败类型”并不矛盾:某类错误可以非常普遍,却未必在跨模型/跨 item 的线性相关中最有区分力。但论文把“主要由 argument grounding 驱动”写得略强,因果措辞应收敛为“failure prevalence 显示参数错误广泛存在”。

5.5 Failure modes

  • Numeric Miss Beyond Tolerance:84.6%--99.3%;
  • Wrong Argument Values:69.5%--96.8%;
  • Claude Sonnet 4.6 的 Wrong Tool Selection 和 Wrong Tool Order 均为 27.5%;
  • Qwen3-14B 的上述两类均为 97.0%;
  • Wrong/Missing Answer Format:Gemini 2.5 Flash 85.1%、Qwen3.5-35B 77.2%、Qwen3.5-9B 97.0%、Qwen3-14B 92.1%。

这里的比例是“失败 item 中检测到某类失败”的分解,不应无条件解释成所有独立数值字段的错误率;一个 item 也可能同时有多个失败标签。

5.6 推理成本

论文共记录 8,216 次 timed runs,总主动执行时间约 62.8 天,平均约 11 分钟/次。代表性平均运行时间:Claude Sonnet 4.6 为 18:24,Gemini 3.1 Pro Preview 为 19:16,Qwen3.5-35B 为 18:15,Qwen3.5-9B 为 10:19;Llama 3.1 8B 仅 00:13,但极低用时主要来自过早终止和未充分调用工具。

论文报告了时间和 token,却没有报告 API 费用、GPU 能耗、失败重试成本或 accuracy-cost frontier。因此不能从结果表判断哪种模型在实际科研服务中最经济。

6. Claims → Evidence 映射

Claim类型证据强度风险
TerraBench 统一 EO、环境格点、GIS、模拟和文档验证系统/基准三个 track、工具注册表、真实执行 trace 与工件设计中强“首次”依赖作者对竞品的二元分类,缺少系统检索协议
现有模型远未可靠经验最佳 Hit@tol 22.88,数值失败 84.6% 以上强度依赖人工设定的字段容差和 failure detector
过程评测能暴露最终答案评测看不到的错误方法+经验ToolUseScore 与 Hit@tol 的大间隔;六项过程指标;failure decomposition过程 composite 含冗余项,ArgAcc 公式未完全公开
frontier 显著优于 strongest open model经验+统计Claude-Qwen3.5-35B 配对 bootstrap CI 全部排除 0强(对此比较)没有覆盖所有 frontier 近邻比较;模型版本可能漂移
403 项足以得到 robust、highly discriminative gaps统计B=2000B=2000 item bootstrap只覆盖 item 抽样,不覆盖模型随机性、工具服务和 subgroup
参数与数值 grounding 是主要瓶颈诊断Wrong Argument 69.5%--96.8%,Numeric Miss 84.6%--99.3%中强failure 标签可能重叠;相关性中 ArgAcc 仅 r=0.193r=0.193
工件中心设计提供可复现科学工作流系统文件路径、hash、日志、结构化输出完整工件和 403 项 traces 当前未公开,第三方无法验证

7. Critical Assessment

7.1 Strengths

  1. 评对了真正困难的对象。 地球科学任务的难点不是生成术语,而是执行空间、时间、变量和模型设定均正确的长链计算。
  2. 过程和结果明确解耦。 ToolUseScore、NumScore、Hit@tol 同时报出,使“看似会用工具”和“得到正确数值”无法相互替代。
  3. 数值容差比 exact string match 合理。 对连续科学量提供绝对、相对和 floor 三类尺度,并给越界近似值部分信用。
  4. 文档验证采用双层真值。 document truth 与 execution truth 的区分能避免把论文报告值伪装成独立复现。
  5. annotation trace honesty 很成熟。 保留有解释价值的失败分支,禁止人工添加新推理或改数字,这是值得复用的基准规范。
  6. 统计单位选择正确。 bootstrap 以 item 为单位,而不是把嵌套工具步骤误当独立样本。
  7. 公开承认资源消耗和局限。 论文披露 person-days、tokens、运行时间、部分 IAA,并明确完整专家审计仍是未来工作。

7.2 Major Issues

致命/接近致命:公开代码不能复现论文指标

截至 2026-07-30,官方仓库 main 最新 commit 为 edaf12f6(2026-06-04),早于 arXiv v1 和 v2。仓库中的评测实现与论文有以下实质差异:

  • compute_numscore 把 NumScore 直接设成 Hit@tol,没有实现 2(n1)2^{-(n-1)} 的部分信用;
  • 代码容差为 max(τabs,τrelmax(y,f))\max(\tau_{\mathrm{abs}},\tau_{\mathrm{rel}}\max(|y|,f)),而论文是 max(τabs,τrely,f)\max(\tau_{\mathrm{abs}},\tau_{\mathrm{rel}}|y|,f);当 y=0,τrel=0.1,f=5y=0,\tau_{\mathrm{rel}}=0.1,f=5 时,代码容差为 0.5,论文容差为 5,差一个数量级;
  • ToolAccCategoryF1ArgAcc 在当前代码中都被赋为同一个工具名 multiset F1;
  • OrderScore 当前代码只计算同位置匹配数除以参考长度,没有实现 Unique、AnyOrder、LCS 三项平均;
  • bootstrap 函数默认 200 次而非论文的 2,000 次,且 README/Makefile 引用的 scripts/run_bootstrap.py 不存在;
  • 完整 403 项数据、论文 metrics、evaluation_results、tests 和 docs 均未发布,仓库只有一个合成 minimal item。

因此,当前代码只能证明软件骨架和 mock smoke test 可运行,不能证明 Table 2 或附录统计可复现。这是决定接收前最需要修复的问题。

重要:容差决定结果,但没有容差敏感性分析

Hit@tol 最高只有 22.88 是论文最有冲击力的结果;然而 λ\lambda 完全受三类人工字段参数控制。作者手工判断容差“既不太严格也不太宽松”,但没有公开分布、标注一致性、单位检查器或统一缩放规则,也没有把容差放宽/收紧后重排榜单。ToolUse 权重敏感性做得很好,同样的严谨性也应应用到 numeric tolerance。

重要:bootstrap 没有覆盖推理随机性

当前 CI 只回答“若从这 403 个 item 重采样,均值怎样变化”。它没有回答“同一 item 重跑模型,结果怎样变化”。长程 ReAct 循环、外部 API、网络数据和失败恢复都可能有很大 run-to-run variance。至少应对分层抽样的一部分 item 做多 seed 重复,使用 item/model-run 两层 bootstrap 或混合效应模型。

重要:benchmark selection 和 annotation bias

任务由 LLM 辅助 web research、文档抽取和 trace continuation 生成,再由人筛选。只有 50.9% 候选保留,意味着最终集合强烈依赖“哪些任务能被当前工具栈完成”。这可能把 benchmark 变成 TerraAgent 工具生态的能力测试,而不是地球科学智能体的一般测试。与作者团队重叠的 ThinkGeo、OpenEarthAgent、GCA 等竞品分类也应由独立 annotator 复核。

重要:因果层级名称可能高于实际证据

Level 2/3 使用 intervention/counterfactual 语言,但很多任务本质是改变模拟器输入后比较输出。它测试情景执行,不必然测试因果识别、混杂控制、结构方程正确性或外部有效性。建议将“causal reasoning level”改成更保守的“scenario reasoning depth”,或加入真正需要因果假设辨识的任务。

7.3 Minor Issues

  • 论文没有给出 ArgAcc 的完整字段级公式和连续参数匹配规则;
  • 主文 benchmark comparison 依赖作者赋予的 yes/partial/no,没有公开判定 rubric;
  • “Numeric Miss Beyond Tolerance”在摘要中容易被读成字段错误率,实际 failure-mode 图更像 item 级多标签比例;
  • 模型 API snapshot、temperature、maximum tokens 和 provider-specific reasoning setting 不够精确;
  • 8,216 runs 明显多于 403×18=7,254403\times18=7{,}254 个模型-item 组合,附录说明有恢复和重跑,但未给每个结果选用哪次轨迹的规则;
  • 当前代码工具注册表实际暴露 97 个名字,而论文口径为 77 个子工具,缺少与论文实验 snapshot 对应的冻结 manifest;
  • 代码的 CITATION.cff 作者仍为 Placeholder,仓库版本为 alpha,release hygiene 不足。

8. Baseline 公平性与统计解释

8.1 做得好的地方

  • 相同 agent scaffold、tool interface、prompt template 和 output contract;
  • 所有模型都配置 high reasoning effort 和较高输出上限;
  • 开放模型统一在 4 张 NVIDIA RTX A6000 上通过 Ollama 托管;
  • 对 proprietary model 使用官方 API;
  • item-level 配对评测,使模型差值可做 paired bootstrap。

8.2 仍不公平或不透明的地方

  • “high reasoning effort”不是跨厂商等价设置;
  • frontier 模型的 API snapshot 没有冻结,未来同名模型可能不同;
  • 不同模型平均运行时间和重试次数差异很大,实际计算预算并不相同;
  • 部分模型可能更擅长论文作者使用的 canonical trace 风格;
  • 工具说明、prompt 和任务可能由类似 frontier 模型辅助编写,存在格式亲和性;
  • 没有 human scientist baseline、传统脚本 pipeline baseline 或 oracle-tool baseline,因此无法区分 LLM 规划错误、工具实现错误和任务本身的不可复现性。

9. 与相关工作的定位

工作主要侧重相对 TerraBench 的优势相对 TerraBench 的不足
ThinkGeo (2025)遥感工具增强 agentEO 工具任务聚焦、直接竞品缺少统一环境数据和模拟器;论文称无数值评测
OpenEarthAgent (2026)EO + GIS 可执行 agent多模态地理工具和真实查询论文表中无环境格点、模拟和结构化数值评测
Earth-Agent / Earth-Bench (ICLR 2026)EO 全景任务、量化分析更强的 EO 任务专门化与已公开会议版本不覆盖完整的环境数据、行业模拟器与文档重建组合
Zephyrus (2025)天气科学 agent、数据和模拟器气象工作流与世界模型更集中TerraBench 的跨域工具、三 track 和字段容差评测更系统
GCA (2026)GCC 气候决策支持区域决策语境与真实问题simulator coverage 和统一 benchmark 协议较弱
TerraBench跨 EO、格点、GIS、模拟和文档验证过程+结果联合评测、工件溯源、容差数值评分任务规模小、工具生态绑定强、公开复现包不完整

一句话定位:TerraBench 是地球科学 agent 方向的“可执行评测协议”贡献;它的差异不在某个单独工具,而在把多源数据、模拟、trace、artifact 和数值容差放进同一个评分体系。

10. Code Verification

10.1 检查范围

  • 官方仓库:Takerdat23/TerraBench
  • 检查 commit:edaf12f6cc4d39c163f053703439a034f0a95f8c
  • commit 时间:2026-06-04
  • Python 3.13 下 scripts/run_smoke_test.py:通过,输出 synthetic item 的 Hit@tol=1.000、ToolUseScore=1.000
  • Python package compile check:通过
  • 默认 registry:可注册 97 个工具名;这不是论文冻结的 77-tool manifest

10.2 Claims → Code 映射

Claim论文描述当前公开代码状态
TerraAgent 可运行ReAct + 科学工具 + tracefull-agent、工具注册表、prompt 和 mock runner 已存在部分匹配:真实运行依赖大量外部服务和凭据
77 个子工具论文 Table/Appendix 固定口径当前 registry 暴露 97 个名字不匹配/版本漂移
ToolAccrelaxed matches / ground-truth calls工具名 multiset F1不匹配
CategoryF1工具组 multiset F1与 ToolAcc 使用同一工具名 F1不匹配
ArgAcc对齐工具参数 key/value 匹配直接复用工具名 F1不匹配
OrderScoreUnique、AnyOrder、LCS 平均同位置匹配率不匹配
NumScore容差外指数衰减与 Hit@tol 完全相同,越界直接 0不匹配
有效容差$\max(\tau_{\mathrm{abs}},\tau_{\mathrm{rel}}y,f)$
B=2000B=2000 bootstrapitem-level percentile CI + paired differenceslibrary 默认 n=200n=200,无公开 runner,未实现论文全部 pairwise report部分/不匹配
403 项可复算完整 traces、工件、ground truth、metrics仅一个 synthetic minimal item;完整数据另行托管但未给公开下载未发布

10.3 数值反例

y=100y=100τabs=0\tau_{\mathrm{abs}}=0τrel=0.1\tau_{\mathrm{rel}}=0.1f=1f=1。论文公式给 λ=10\lambda=10

y^\hat yAE/λAE/\lambda论文 NumScore当前代码 NumScore
100011
110111
12020.50
13030.250

这不是实现细节差异,而会系统性改变 NumScore 表和模型排序。公开仓库必须发布与论文计算结果对应的 commit、完整单元测试和已保存的 item-level metric rows。

10.4 可复现性结论

当前复现性应评为 2/5

  • 加分:MIT 许可、环境文件、工具代码、prompt、schema、mock smoke test 和大量 simulator wrapper 已公开;
  • 扣分:论文数据、真实 traces、artifacts、metric logs、测试和论文一致评测器缺失;外部数据、API、模型、官方模拟器和凭据要求较高。

11. Reviewer Recommendation

11.1 推荐

Major Revision / Weak Accept,核心条件是 artifact release。

如果按 NeurIPS Evaluations & Datasets Track 的标准评审,我认可问题、基准理念、结果洞察和统计框架;“过程分远高于数值正确率”是有价值且可操作的发现。但代码与论文公式的差异、完整数据缺失和容差审计不足,会直接妨碍基准作为公共评价基础设施的可信度。

11.2 接收前必须完成

  1. 发布 403 项 manifest、问题、schema、ground truth、容差、canonical traces 和允许公开的工件;
  2. 发布计算 Table 2 的精确 commit 和 item-level metric rows;
  3. 让公开代码逐式实现论文中的 ToolUseScore、OrderScore、ArgAcc、NumScore 和 B=2000B=2000 paired bootstrap;
  4. 对 numeric tolerance 做放宽/收紧敏感性分析,并公开容差分布;
  5. 对一组分层 item 做多 seed 重复,估计 model-run variance;
  6. 给出 raw track/domain counts,修复 source 中 398/403 的草稿计数漂移;
  7. 增加 human、oracle-tool 或传统脚本 baseline,分离规划和工具实现误差。

12. Research Taste 与长期价值

12.1 三维评分

text
创新性 (Novelty):  ★★★★☆  4.0/5
严谨性 (Rigor):   ★★★☆☆  3.2/5
影响力 (Impact):  ★★★★☆  4.0/5
  • Novelty:不是首个地球科学 agent,但过程+数值+工件的统一协议具有清晰增量;
  • Rigor:公式和 item-level bootstrap 较好,但公开实现、容差审计和重复运行方差明显不足;
  • Impact:如果完整 artifact 公开,它可能成为气象、遥感、GIS 和影响模拟 agent 的重要综合测试床。

12.2 是否值得跟进

非常值得参考,但更值得跟进“评测协议”而不是照搬全部工具栈。 最可复用的研究方向有:

  1. provenance-constrained decoding:最终字段必须绑定 artifact hash 和提取位置;
  2. schema-aware numeric self-check:单位、数量级、容差和 sign convention 的自动验证;
  3. planner/executor/verifier 分离:让独立 verifier 复算关键字段,而不是让同一 agent 自我确认;
  4. counterfactual pairing:强制 baseline 与 intervention 使用相同输入、seed 和 simulator version;
  5. hierarchical uncertainty:同时建模 item sampling、agent sampling 和 tool/runtime variance;
  6. difficulty calibration:用可验证的最短工具链、参数自由度和数据异质性定义难度,而不是只用因果 level 名称。

12.3 一句话科研品味评价

这是一篇选题和基准观念都很好的系统性工作:它准确抓住了科学 agent 的核心失败不是“没有工具”,而是“不会以可核验方式协调工具并交付正确数字”;但作为评价基础设施论文,公开 artifact 和评测代码必须比普通方法论文更完整,当前版本尚未达到这一要求。

13. Reviewer Feedback 与公开讨论

截至 2026-07-30,未检索到该论文对应的公开 OpenReview forum、Official Review、Author Response、Meta Review 或 Decision。arXiv 页面只表明它是 2026 年预印本;TeX 中的 NeurIPS 2026 Evaluations & Datasets Track 模板只能说明潜在投稿格式,不能据此推断审稿状态或接收结果。

14. Personal Notes

  • 对我最有价值的观察:科学 agent benchmark 必须同时保存 question、trace、artifact、structured answer 和 tolerance;少任何一个,审计链都不完整。
  • 最值得复用的公式:字段级 λ\lambda 与连续 NumScore,但需要增加 tolerance sensitivity 和单位规范。
  • 最需要警惕的误读:ToolUseScore 59.22 不是“59.22% 的任务流程正确”,Hit@tol 22.88 也不是所有数值字段独立正确率;两者都是按 item 聚合后的不同构念。
  • 实际跟进优先级:先等待完整数据和论文一致代码发布;发布后优先复算 NumScore、检查容差分布,再讨论模型排行。

Static research notes built with VitePress and KaTeX.