Theme
TerraBench:异构地球系统数据上的可执行智能体基准
原文题目:TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?
作者:Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani, Huy M. Le, Muhammad Umer Sheikh, Numan Saeed, Muhammad Haris Khan, Salman Khan
机构:Mohamed bin Zayed University of Artificial Intelligence;ADIA Lab
版本与时间:arXiv:2606.13148v2,2026-07-01;v1 提交于 2026-06-11
发表状态:arXiv 预印本。TeX 使用 NeurIPS 2026 Evaluations & Datasets Track 模板,但这不等于已被 NeurIPS 接收
论文与材料:arXiv · PDF · 官方代码
DOI:10.48550/arXiv.2606.13148
Tags:earth-science-agent agentic-benchmark tool-use scientific-ai geospatial-reasoning climate-ai ReAct benchmark-evaluation
One-Sentence Summary
TerraBench 把地球科学智能体评测从静态问答推进为可执行、可追踪、带数值容差的长程工作流:403 个任务要求智能体协调再分析资料、卫星影像、GIS、预测模型和确定性模拟器,但最强模型 Claude Sonnet 4.6 的 ToolUseScore 仅为 59.22,严格数值命中率 Hit@tol 仅为 22.88;不过,当前公开代码与论文指标公式存在实质差异,完整数据和论文级评测日志也尚未发布,因此论文结果目前不能由第三方端到端复算。
0. 先给结论
0.1 这篇论文真正解决了什么
论文的核心贡献不是新的天气基础模型,也不是新的遥感视觉编码器,而是把“地球科学智能体是否会推理”改写成一个可执行、可审计的问题:
- 智能体必须决定调用哪些科学工具,而不是仅生成自然语言答案;
- 工具参数必须正确到变量、区域、时间窗、阈值、情景设定和单位;
- 中间结果必须落为 NetCDF、GeoTIFF、CSV、JSON 或 PNG 等可追踪工件;
- 最终答案不仅要语义上合理,还必须在字段级数值容差内;
- 评测同时观察过程质量和结果质量,因而能识别“流程看起来像对的,但数字仍然错”的失败。
这比只评最终自然语言答案更接近真实科研工作流,也比只比较工具名序列更能暴露科学计算中的参数和数值错误。
0.2 最重要的实验事实
- 基准包含 403 个任务、3 个 track、8 个应用域、77 个论文口径的子工具,以及约 24,500 个经核验的执行步骤;平均约为
步/任务。 - 792 个候选问题仅保留 403 个,保留率为
,与论文报告的 50.9% 一致。 - 只有 25.6% 的最终样本一次运行完成,74.4% 需要多次执行,46.4% 至少需要三次执行。
- 最强模型 Claude Sonnet 4.6:ToolUseScore 59.22、NumScore 28.44、Hit@tol 22.88。
- 最强开放权重结果存在“过程/结果分裂”:Gemma 4 26B-A4B 的 ToolUseScore 最高,为 41.84;Qwen3.5-35B-A3B 的 NumScore 和 Hit@tol 最高,分别为 7.49 和 5.89。
- 所有模型中,“数值超出容差”均是最普遍的失败类别,比例从 Claude Sonnet 4.6 的 84.6% 到 Qwen3.5-9B 的 99.3%。
0.3 我的总体判断
| 维度 | 判断 |
|---|---|
| 问题重要性 | 高。地球科学智能体最危险的错误往往不是不会说,而是调用了错误变量、时间窗、区域或模拟设定 |
| 基准理念 | 强。过程指标、结构化答案、数值容差和工件溯源构成了相对完整的评测闭环 |
| 数据与标注 | 中强。筛选严格且有人审,但任务由 LLM 辅助生成,独立专家审计范围仍小 |
| 数学与统计 | 中等。核心指标定义清晰,并做了 item-level bootstrap;但容差敏感性、模型随机性和 subgroup 统计不足 |
| 实验结论 | 中强。足以支持“现有模型在长程地球科学工具工作流上仍不可靠”,不足以支持某个模型具有稳定、通用的地球科学推理能力 |
| 公开复现性 | 弱。完整 403 项数据、论文评测日志和论文一致的指标实现尚未公开 |
| 创新度 | 7.5/10。主要是基准设计、评测协议与系统整合创新,而非新的学习算法或科学模型 |
| 审稿建议 | Major Revision / Weak Accept(取决于完整数据和评测代码能否在审稿期公开) |
1. Problem:从静态问答到可执行地球科学推理
1.1 一句话问题定义
给定一个需要跨越地球观测影像、格点物理场、GIS 上下文、预测产品或模拟器输出的问题,智能体能否规划并执行一条科学上有效、参数正确、可复查的工具链,并返回满足结构和数值容差的答案?
1.2 为什么静态 QA 不够
真实地球科学问题常同时要求:
- 解析研究区域和时间范围;
- 获取 ERA5、CMIP6、C3S、卫星或 OSM 数据;
- 对齐投影、网格、时间分辨率和变量定义;
- 计算异常、阈值、集合统计或空间叠加;
- 运行 AquaCrop、DSSAT、CLIMADA、EnergyPlus、SUMO、UTCI 等模型;
- 对 baseline、intervention 和 counterfactual 情景进行可比计算;
- 保存中间工件并从工件中提取最终数值。
一个语言模型即使能写出合理解释,也可能在经纬度顺序、单位换算、变量名、时间切片或容差内数值上失败。TerraBench 的问题定位是:科学智能体的可靠性必须由执行轨迹和最终结果共同决定。
1.3 主要 claims
论文可分解出四条主要主张:
- TerraBench 首次在一个统一可执行接口中组合 EO 影像、格点环境数据、GIS、模拟器和文档锚定验证;
- TerraAgent 能把 LLM 规划与 77 个科学子工具、工件和结构化输出连接起来;
- 过程指标和数值结果指标之间存在显著缺口,单看工具轨迹会高估智能体能力;
- 当前最强前沿模型和开放模型都远未达到可靠地球科学智能体的要求。
第 2、3、4 条有直接系统和实验支持。第 1 条是较强的“first”主张,依赖作者对同期工作的分类表,证据不如数值结果硬。
2. Method:TerraAgent 与 TerraBench 的结构
2.1 整体数据流
TerraAgent 基于 ReAct 风格的循环。对问题
其中
执行链为:
- 读取问题、上下文和结构化输出契约;
- 解析区域、时间、变量和任务类型;
- 选择并串行调用工具;
- 观察返回值并更新计划;
- 将中间数据物化为带路径和元数据的工件;
- 必要时调用代码/数学执行服务完成轻量计算;
- 输出自由文本说明和机器可读的
<final_json>; - 评测器分别比较工具过程和最终字段。
2.2 工具与工件
论文口径的 77 个子工具分布如下:
| 工具组 | 子工具数 | 主要职责 |
|---|---|---|
| Data I/O | 3 | 读取、检查和保存科学数据 |
| Ensemble & Verification | 12 | 集合统计、校准、事件概率和预报验证 |
| Forecast | 2 | Pangu-Weather、Aurora 等预测封装 |
| GIS / OSM | 6 | 区域解析、空间查询、叠加和路网 |
| Computation | 2 | 数学/代码辅助计算 |
| Reanalysis / Environmental | 12 | ERA5、空气质量及环境格点数据 |
| Satellite / EO | 6 | Sentinel-2、Google Earth Engine 与指数计算 |
| Seasonal | 13 | C3S 季节产品、偏差订正和多模型融合 |
| Simulation | 11 | 农业、灾害、建筑、交通和健康影响模拟 |
| Visualization | 8 | 地图、叠加图和派生可视产品 |
| Web Search | 2 | 外部科学背景检索 |
| 合计 | 77 | 论文发布时的评测环境口径 |
工件中心设计要求工具返回自然语言摘要和机器可读元数据,并落盘为 NetCDF、CSV、JSON、GeoTIFF 或 PNG。模拟器还记录输入/输出路径、SHA-256、内容类型、运行日志、seed、超时和情景假设。这一点非常关键:最终数字理论上可以回溯到具体输入文件和执行步骤。
2.3 三个 benchmark tracks
| Track | 正确性来源 | 典型任务 | 主要风险 |
|---|---|---|---|
| Fundamentals | 公共数据上的确定性执行 | 检索、聚合、阈值、遥感/GIS 叠加 | 变量、时间窗、坐标、网格和单位错误 |
| Simulator-Grounded | 显式设定下的确定性模拟输出 | baseline、干预、反事实、影响评估 | 情景参数不匹配、模拟器未运行或错误复用结果 |
| Document-Grounded Verification | 文献报告值与公共工具重建值的双层锚定 | 精确、近似、结构或 proxy 重建 | 把文献答案直接抄入;构念、单位或数据版本不一致 |
Document-Grounded Verification 特别区分:
- document truth:论文或报告中真实报告的数值及位置;
- execution truth:用公开数据和工具重新执行得到的数值;
- verification mode:exact、approximate、structural 或 proxy。
这个设计很符合真实复现:公共数据和软件版本常无法精确复刻原文,所以“同构念、同单位、同计算逻辑”的近似重建比强制数值相等更合理。与此同时,容差和 proxy 的人工决定也引入了主观性。
2.4 四个 reasoning levels
- Level 0:观察性 grounding,解析时空坐标、对齐数据网格并计算观察量;
- Level 1:关联性、多模态分析和结构化比较;
- Level 2:干预情景设定、模型调用和 baseline 对照;
- Level 3:反事实、回顾性、长程模拟或不完全可观测下的文档重建。
Level 1--3 借用了 Pearl 的关联、干预、反事实层级,Level 0 是作者新增的执行 grounding 层。但要注意:调用确定性模拟器比较两个情景并不自动等价于识别真实世界因果效应。这里的 level 更接近任务设定中的因果深度,不是对因果可识别性的证明。
2.5 没有训练阶段
论文没有训练新的地球科学模型,也没有定义端到端损失或反向传播:
因此本文不存在学习率、batch size、优化器、参数更新或训练集意义上的模型创新。贡献属于推理时系统编排、基准构造和评测协议。
2.6 底层数据、模型和模拟器来源
论文列出的资源族如下。它们构成工具环境,并不意味着每个 benchmark item 都同时使用全部来源。
| 资源族 | 论文列举的代表来源 | 用途 |
|---|---|---|
| 再分析与环境格点 | ERA5、CMIP6、空气质量和环境网格 | 时空检索、聚合、阈值、异常和长期背景 |
| 季节产品 | C3S seasonal | 集合、校准、季节预测与多模型分析 |
| 卫星/EO | Sentinel-2、Google Earth Engine | 影像、指数、变化与 GIS 叠加 |
| 地理背景 | OpenStreetMap 和 GIS 图层 | AOI、设施、道路、暴露和空间关系 |
| 天气预报模型 | Pangu-Weather、Aurora wrappers | 预报场和 forecast-grounded workflow |
| 农业模拟 | AquaCrop、DSSAT | 产量、生物量、蒸散、水分胁迫和物候 |
| 风险模拟 | CLIMADA | hazard × exposure × vulnerability、风险曲线 |
| 建筑与交通 | EnergyPlus、SUMO | 能耗、峰值、不舒适小时、旅行时间和延误 |
| 健康影响 | UTCI、exposure-response function | 热应激、归因比例和病例数 |
| 文档与计算 | Web search、论文/报告、代码/数学执行器 | scientific anchor、重建与轻量计算 |
论文没有给完整数据清单、URL、版本、许可、时间/空间覆盖、变量、预处理、文件规模和各来源实际调用频率。TerraBench 的异构性主要由工具生态与 workflow 体现,而不是一份完整统一的数据 manifest。
3. Evaluation:保留全部数学细节
3.1 符号与对齐对象
设:
:预测轨迹中全部非 meta 工具调用; :其中满足调用要求的子集; :得到成功 observation 的子集; :ground-truth 轨迹中的有效工具调用。
预测和参考步骤通过动态规划对齐,可按工具名精确匹配,也可按工具组 relaxed matching。
3.2 过程指标
Instruction Accuracy:
Tool Call Success Rate:
Tool Accuracy:
这个式子更像相对于参考步骤的 relaxed recall,而不是通常同时惩罚 false positive 的 accuracy。额外调用主要需要 CategoryF1、OrderScore 和其他过程项来间接惩罚。
CategoryF1 是工具组标签多重集合上的 F1。若多重集合交集计数为
ArgAcc 对已对齐的工具对,平均参数 key 的语义匹配和 value 匹配,覆盖时间窗、阈值、bounding box、变量和情景参数。论文没有给出 key/value 子分数、连续值容差和缺失参数惩罚的完整逐项公式,这是方法透明度的一个缺口。
OrderScore:
其中 Unique 比较工具组集合重叠,AnyOrder 比较工具组多重集合重叠,SameOrder 使用最长公共子序列刻画顺序一致性。
最终组合分数为:
六项权重之和为 1。作者给 ToolAcc 和 ArgAcc 最大权重,因为错误工具或错误时空参数通常会使后续科学计算整体失效。
一个需要注意的内部冗余是:论文附录承认当前 metric logs 中 ToolCallSuccessRate 与 InstAcc 完全相同,因此构念验证的 logistic regression 删除了前者以避免完全共线。但官方 ToolUseScore 仍同时给二者 0.15 和 0.05 的权重,相当于让同一信号占 0.20。
3.3 数值答案指标
每个输出字段必须包含 key、value、abs_tol、rel_tol 和 floor_scale。对 ground truth
其中
连续部分信用为:
因此误差为
多字段输出对已对齐的 ground-truth 字段取均值。key 唯一且匹配时按 key 对齐,否则退回字段顺序;缺失或无法解析的数值记 0;字符串和布尔值使用 canonical exact match,并把相同的直接匹配值同时用于 Hit@tol 和 NumScore。
这里的核心风险不是公式本身,而是
3.4 聚合、构念效度与不确定性
所有 aggregate metric 都先在 item 内聚合,再对 403 个 item 做非加权平均;工具步骤和输出字段不被当作独立样本。这是正确的层级处理。
作者定义严格成功标签:
因为 item 级 Hit@tol 是字段均值,所以该定义要求一个 item 的所有字段全部在容差内。用过程指标预测 Success 的 logistic regression 得到 AUC 0.803、McFadden pseudo-
权重敏感性实验对已发布权重做
bootstrap 以 item 为单位有放回抽取
4. Benchmark Creation:数据与标注协议
4.1 候选生成与筛选
候选池共 792 项:Fundamentals 323、Document-Grounded Verification 307、Simulator-Grounded 162。经过可行性检查、真实工具执行、多阶段核验、拒绝或大修,最终保留 403 项。
每个保留项包含:
- Context、Use case、Subtask、Level、Question、Reference;
- 可见的 Answer 输出契约和
<final_json>schema; - Instruction Prompt 形式的可执行工作流模板;
- canonical
Main_trace.json; - 工具 observations、支持工件和结构化 ground truth。
推理时只向被测模型提供可见上下文、问题、科学 reference framing 和输出 schema;文档数值锚点、评测标签和 evaluator metadata 隐藏。
候选并非从固定题库随机采样。Appendix 描述的起点是:先围绕八个 application domains brainstorm use cases,再让 LLM 辅助做 web research 和 document extraction,寻找真实科学流程、业务情景和论文/报告中的 quantitative anchors。之后才判断是否能在现有工具环境里真实执行。
这意味着 selection pipeline 同时受到三种偏差影响:领域作者选择、网络文档可见性,以及作者工具栈的可执行性。不能把最后 403 项视为真实地球科学任务的自然分布。
4.2 样本 schema、执行 trace 与动态真值
每个 item 是一个 executable benchmark program,而不是只有 question/answer。标准字段包括:
Context;Use case;Subtask;Level;Question;Reference;Answer和<final_json>contract;Instruction Prompt。
Annotation agent 按 Instruction Prompt 运行真实工具,生成:
- canonical
Main_trace.json; - tool observations;
- NetCDF、CSV、JSON、GeoTIFF、PNG 等 supporting artifacts;
number_ground_truth.json等结构化真值。
模拟器 run 还要求 run_id、scenario 名称和描述、显式假设、seed、资源 metadata、timeout、隔离运行目录、输入输出路径、SHA-256、content type 和 runtime logs。Counterfactual item 必须用同一工具和 matched settings 连跑 baseline/intervention,只改变指定变量。
Document track 使用双层真值:
- document truth:原论文或报告的数字和位置;
- execution truth:公开工具重建得到的 construct 或 analogue;
- verification mode:exact、approximate、structural 或 proxy。
最终数字必须由 surviving observation、保留工件或 deterministic transform 支撑;手填数字、复制隐藏 metadata 或伪造工具调用不被接受。
4.3 候选漏斗和修订强度
按 Figure 的百分比:
| Track | 候选数 | 最终保留率 | 无需修订率 |
|---|---|---|---|
| Fundamentals | 323 | 61.6% | 32.8% |
| Simulator-Grounded | 162 | 53.1% | 22.2% |
| Document-Grounded | 307 | 38.4% | 27.0% |
| Overall | 792 | 50.9% | 28.4% |
由候选数与百分比可推算最终约为 199 / 86 / 118 项,总计 403;这是按图计算的近似值,不是论文发布的机器 manifest。
Trace 修订轮数分布:
- 1 次运行:25.6%;
- 2 次:28.0%;
- 3--4 次:40.4%;
- 5 次及以上:6.0%。
因此 74.4% 的保留项经历了至少一次追加运行或修订,46.4% 至少运行三次。论文称总计约 24,500 个 verified execution steps,平均约 60.8 step/item 只是除法推断,不代表每项都近似 61 步。
4.4 人工审核的八项标准
- workflow fidelity;
- provenance 和计算证据;
- 隐藏答案与 evaluator 信息的 leakage control;
- 保留真实时间顺序和有意义的失败分支;
- 完整回答所有子问题;
- 输出 schema、字段名、单位和符号约定正确;
- document truth 与 execution truth 严格分离;
- 只做最小编辑,不新增推理、科学主张或数值。
人工投入约 117 person-days。标注阶段消耗 2,469,318,457 tokens,模型评测再消耗 820,028,249 tokens,总计约 32.89 亿 tokens。
4.5 标注一致性
作者从候选池随机抽取 50 项,由两位标注者独立做 accept/reject:原始一致率 88%,6 项分歧,Cohen's
标准 Cohen's kappa 为:
其中
4.6 Split、去重与泄漏控制缺口
TerraBench 把 benchmark labels、document anchors 和 evaluator metadata 从模型可见输入中隐藏,并要求 canonical trace 不伪造、不改写保留数字。这个 item 内防泄漏设计很强,但 dataset-level 控制未完整报告:
- 没有 train/dev/test split;
- 没有 geography、time、event、document 或 data-source holdout;
- 没有 near-duplicate 检测算法;
- 没有相同论文、相同 AOI、相同数据切片或相近 workflow 的 group split;
- 没有报告网页与模型预训练语料污染;
- 没有对每个 ground-truth 字段、容差和工具参数做独立双标。
因此 403 项适合作为冻结 evaluation set,但一旦开发者反复观察错误并调 prompt,就需要新建 hidden test。
4.7 一个源文件中的计数异常
v2 TeX 附录保留了一张被注释、不会渲染到 PDF 的草稿组成表。表内三行按单元格相加分别是 199、81、118,总和 398,但草稿行标签写成 199、86、118,并声称总计 403;各领域列总和也只有 398。因为该表未出现在正式 PDF,不能把它当成发布数据,但它说明 raw composition 表可能来自旧版本或存在 5 项版本漂移。正式发布应提供可机器检查的 manifest,以消除这个不一致。
5. Experiments:结果怎样读
5.1 主结果
下表完整保留论文 Table 2 的七个核心指标,数值均为百分制:
| Model | ToolAcc | CategoryF1 | ArgAcc | OrderScore | ToolUseScore | NumScore | Hit@tol |
|---|---|---|---|---|---|---|---|
| GPT-5.4 | 23.88 | 32.94 | 54.10 | 33.02 | 41.09 | 12.29 | 9.80 |
| GPT-5.5 | 35.39 | 37.22 | 39.73 | 39.67 | 45.01 | 26.45 | 21.03 |
| Gemini 3.1 Pro Preview | 35.64 | 32.11 | 46.91 | 42.07 | 44.93 | 17.07 | 13.21 |
| Gemini 2.5 Flash | 18.46 | 24.16 | 50.91 | 23.97 | 36.20 | 7.70 | 6.34 |
| Claude Haiku 4.5 | 38.25 | 40.26 | 51.25 | 46.79 | 48.14 | 21.19 | 15.23 |
| Claude Sonnet 4.6 | 54.43 | 50.05 | 52.26 | 61.02 | 59.22 | 28.44 | 22.88 |
| Qwen3.5-9B baseline | 21.56 | 23.57 | 37.53 | 25.62 | 31.18 | 1.30 | 1.20 |
| Qwen3-1.7B | 1.02 | 1.85 | 7.03 | 1.74 | 5.40 | 1.15 | 1.08 |
| Gemma 4 E4B | 5.90 | 9.00 | 29.05 | 8.50 | 16.31 | 3.04 | 2.90 |
| Mistral 7B Instruct v0.3 | 6.40 | 10.99 | 37.19 | 10.01 | 18.79 | 2.41 | 1.67 |
| Llama 3.1 8B | 0.20 | 0.40 | 1.80 | 0.40 | 1.50 | 1.00 | 0.90 |
| InternVL3-8B | 1.60 | 2.70 | 7.50 | 2.30 | 4.60 | 1.70 | 1.10 |
| Qwen3-8B | 2.42 | 4.07 | 14.90 | 3.77 | 7.97 | 2.06 | 1.33 |
| Qwen3-VL-8B | 7.67 | 12.17 | 33.09 | 11.35 | 19.09 | 5.07 | 3.11 |
| Qwen3-14B | 9.40 | 13.66 | 37.72 | 13.32 | 21.12 | 4.30 | 3.80 |
| Gemma 4 26B-A4B | 31.89 | 28.74 | 43.69 | 35.05 | 41.84 | 4.45 | 3.67 |
| Qwen3.5-35B-A3B | 30.17 | 30.05 | 47.23 | 36.46 | 39.95 | 7.49 | 5.89 |
5.2 三个不能混为一谈的观察
第一,流程分高不等于答案对。 Claude Sonnet 4.6 的 ToolUseScore 为 59.22,但 Hit@tol 只有 22.88。Qwen3.5-9B 更极端:过程分 31.18,严格命中仅 1.20。工具访问本身不是可靠性的充分条件。
第二,模型规模和过程能力并非单调。 Gemma 4 26B-A4B 的开放模型过程分优于 Qwen3.5-35B-A3B,但后者的最终数值分更高。这说明“会走流程”和“能把证据变成正确字段”是两个不同能力。
第三,不宜把近似排行当作显著差异。 Claude Sonnet 4.6 的回答分最高,但 GPT-5.5 的 NumScore 26.45 和 Hit@tol 21.03 很接近,论文没有给出这两个 frontier 模型的配对差值 CI。现有 bootstrap 只能强力支持 Claude 与 Qwen3.5-35B 之间的大差距。
5.3 Bootstrap 置信区间
| Model | ToolUseScore 95% CI | NumScore 95% CI | Hit@tol 95% CI |
|---|---|---|---|
| Claude Sonnet 4.6 | [57.46, 60.91] | [25.03, 32.08] | [19.23, 26.45] |
| Claude Haiku 4.5 | [46.25, 49.94] | [17.83, 24.50] | [12.24, 18.47] |
| GPT-5.5 | [42.94, 47.11] | [22.96, 30.02] | [17.34, 24.45] |
| Qwen3.5-35B | [38.11, 41.78] | [5.45, 9.76] | [4.09, 7.89] |
| Qwen3.5-9B | [29.29, 33.16] | [0.48, 2.49] | [0.48, 2.34] |
Claude Sonnet 4.6 减 Qwen3.5-35B 的配对差值为:
- ToolUseScore:0.1927,95% CI [0.1718, 0.2143];
- NumScore:0.2095,95% CI [0.1716, 0.2499];
- Hit@tol:0.1698,95% CI [0.1320, 0.2097]。
三个区间均排除 0,因此这组 frontier/open 差异在该 403 项基准上稳定。但这不是对模型总体能力的置信区间,也没有涵盖重复推理的随机性。
5.4 过程与结果相关性
NumScore 与四项过程指标的 Pearson 相关系数为:
| 过程指标 | 与 NumScore 的 |
|---|---|
| ToolAcc | 0.359 |
| OrderScore | 0.357 |
| CategoryF1 | 0.328 |
| ArgAcc | 0.193 |
全部为正但仅中低度相关。最值得注意的是 ArgAcc 的相关最低,这与“错误参数值是普遍失败类型”并不矛盾:某类错误可以非常普遍,却未必在跨模型/跨 item 的线性相关中最有区分力。但论文把“主要由 argument grounding 驱动”写得略强,因果措辞应收敛为“failure prevalence 显示参数错误广泛存在”。
5.5 Failure modes
- Numeric Miss Beyond Tolerance:84.6%--99.3%;
- Wrong Argument Values:69.5%--96.8%;
- Claude Sonnet 4.6 的 Wrong Tool Selection 和 Wrong Tool Order 均为 27.5%;
- Qwen3-14B 的上述两类均为 97.0%;
- Wrong/Missing Answer Format:Gemini 2.5 Flash 85.1%、Qwen3.5-35B 77.2%、Qwen3.5-9B 97.0%、Qwen3-14B 92.1%。
这里的比例是“失败 item 中检测到某类失败”的分解,不应无条件解释成所有独立数值字段的错误率;一个 item 也可能同时有多个失败标签。
5.6 推理成本
论文共记录 8,216 次 timed runs,总主动执行时间约 62.8 天,平均约 11 分钟/次。代表性平均运行时间:Claude Sonnet 4.6 为 18:24,Gemini 3.1 Pro Preview 为 19:16,Qwen3.5-35B 为 18:15,Qwen3.5-9B 为 10:19;Llama 3.1 8B 仅 00:13,但极低用时主要来自过早终止和未充分调用工具。
论文报告了时间和 token,却没有报告 API 费用、GPU 能耗、失败重试成本或 accuracy-cost frontier。因此不能从结果表判断哪种模型在实际科研服务中最经济。
6. Claims → Evidence 映射
| Claim | 类型 | 证据 | 强度 | 风险 |
|---|---|---|---|---|
| TerraBench 统一 EO、环境格点、GIS、模拟和文档验证 | 系统/基准 | 三个 track、工具注册表、真实执行 trace 与工件设计 | 中强 | “首次”依赖作者对竞品的二元分类,缺少系统检索协议 |
| 现有模型远未可靠 | 经验 | 最佳 Hit@tol 22.88,数值失败 84.6% 以上 | 强 | 强度依赖人工设定的字段容差和 failure detector |
| 过程评测能暴露最终答案评测看不到的错误 | 方法+经验 | ToolUseScore 与 Hit@tol 的大间隔;六项过程指标;failure decomposition | 强 | 过程 composite 含冗余项,ArgAcc 公式未完全公开 |
| frontier 显著优于 strongest open model | 经验+统计 | Claude-Qwen3.5-35B 配对 bootstrap CI 全部排除 0 | 强(对此比较) | 没有覆盖所有 frontier 近邻比较;模型版本可能漂移 |
| 403 项足以得到 robust、highly discriminative gaps | 统计 | 中 | 只覆盖 item 抽样,不覆盖模型随机性、工具服务和 subgroup | |
| 参数与数值 grounding 是主要瓶颈 | 诊断 | Wrong Argument 69.5%--96.8%,Numeric Miss 84.6%--99.3% | 中强 | failure 标签可能重叠;相关性中 ArgAcc 仅 |
| 工件中心设计提供可复现科学工作流 | 系统 | 文件路径、hash、日志、结构化输出 | 中 | 完整工件和 403 项 traces 当前未公开,第三方无法验证 |
7. Critical Assessment
7.1 Strengths
- 评对了真正困难的对象。 地球科学任务的难点不是生成术语,而是执行空间、时间、变量和模型设定均正确的长链计算。
- 过程和结果明确解耦。 ToolUseScore、NumScore、Hit@tol 同时报出,使“看似会用工具”和“得到正确数值”无法相互替代。
- 数值容差比 exact string match 合理。 对连续科学量提供绝对、相对和 floor 三类尺度,并给越界近似值部分信用。
- 文档验证采用双层真值。 document truth 与 execution truth 的区分能避免把论文报告值伪装成独立复现。
- annotation trace honesty 很成熟。 保留有解释价值的失败分支,禁止人工添加新推理或改数字,这是值得复用的基准规范。
- 统计单位选择正确。 bootstrap 以 item 为单位,而不是把嵌套工具步骤误当独立样本。
- 公开承认资源消耗和局限。 论文披露 person-days、tokens、运行时间、部分 IAA,并明确完整专家审计仍是未来工作。
7.2 Major Issues
致命/接近致命:公开代码不能复现论文指标
截至 2026-07-30,官方仓库 main 最新 commit 为 edaf12f6(2026-06-04),早于 arXiv v1 和 v2。仓库中的评测实现与论文有以下实质差异:
compute_numscore把 NumScore 直接设成 Hit@tol,没有实现的部分信用; - 代码容差为
,而论文是 ;当 时,代码容差为 0.5,论文容差为 5,差一个数量级; ToolAcc、CategoryF1、ArgAcc在当前代码中都被赋为同一个工具名 multiset F1;OrderScore当前代码只计算同位置匹配数除以参考长度,没有实现 Unique、AnyOrder、LCS 三项平均;- bootstrap 函数默认 200 次而非论文的 2,000 次,且 README/Makefile 引用的
scripts/run_bootstrap.py不存在; - 完整 403 项数据、论文 metrics、
evaluation_results、tests 和 docs 均未发布,仓库只有一个合成 minimal item。
因此,当前代码只能证明软件骨架和 mock smoke test 可运行,不能证明 Table 2 或附录统计可复现。这是决定接收前最需要修复的问题。
重要:容差决定结果,但没有容差敏感性分析
Hit@tol 最高只有 22.88 是论文最有冲击力的结果;然而
重要:bootstrap 没有覆盖推理随机性
当前 CI 只回答“若从这 403 个 item 重采样,均值怎样变化”。它没有回答“同一 item 重跑模型,结果怎样变化”。长程 ReAct 循环、外部 API、网络数据和失败恢复都可能有很大 run-to-run variance。至少应对分层抽样的一部分 item 做多 seed 重复,使用 item/model-run 两层 bootstrap 或混合效应模型。
重要:benchmark selection 和 annotation bias
任务由 LLM 辅助 web research、文档抽取和 trace continuation 生成,再由人筛选。只有 50.9% 候选保留,意味着最终集合强烈依赖“哪些任务能被当前工具栈完成”。这可能把 benchmark 变成 TerraAgent 工具生态的能力测试,而不是地球科学智能体的一般测试。与作者团队重叠的 ThinkGeo、OpenEarthAgent、GCA 等竞品分类也应由独立 annotator 复核。
重要:因果层级名称可能高于实际证据
Level 2/3 使用 intervention/counterfactual 语言,但很多任务本质是改变模拟器输入后比较输出。它测试情景执行,不必然测试因果识别、混杂控制、结构方程正确性或外部有效性。建议将“causal reasoning level”改成更保守的“scenario reasoning depth”,或加入真正需要因果假设辨识的任务。
7.3 Minor Issues
- 论文没有给出 ArgAcc 的完整字段级公式和连续参数匹配规则;
- 主文 benchmark comparison 依赖作者赋予的 yes/partial/no,没有公开判定 rubric;
- “Numeric Miss Beyond Tolerance”在摘要中容易被读成字段错误率,实际 failure-mode 图更像 item 级多标签比例;
- 模型 API snapshot、temperature、maximum tokens 和 provider-specific reasoning setting 不够精确;
- 8,216 runs 明显多于
个模型-item 组合,附录说明有恢复和重跑,但未给每个结果选用哪次轨迹的规则; - 当前代码工具注册表实际暴露 97 个名字,而论文口径为 77 个子工具,缺少与论文实验 snapshot 对应的冻结 manifest;
- 代码的
CITATION.cff作者仍为 Placeholder,仓库版本为 alpha,release hygiene 不足。
8. Baseline 公平性与统计解释
8.1 做得好的地方
- 相同 agent scaffold、tool interface、prompt template 和 output contract;
- 所有模型都配置 high reasoning effort 和较高输出上限;
- 开放模型统一在 4 张 NVIDIA RTX A6000 上通过 Ollama 托管;
- 对 proprietary model 使用官方 API;
- item-level 配对评测,使模型差值可做 paired bootstrap。
8.2 仍不公平或不透明的地方
- “high reasoning effort”不是跨厂商等价设置;
- frontier 模型的 API snapshot 没有冻结,未来同名模型可能不同;
- 不同模型平均运行时间和重试次数差异很大,实际计算预算并不相同;
- 部分模型可能更擅长论文作者使用的 canonical trace 风格;
- 工具说明、prompt 和任务可能由类似 frontier 模型辅助编写,存在格式亲和性;
- 没有 human scientist baseline、传统脚本 pipeline baseline 或 oracle-tool baseline,因此无法区分 LLM 规划错误、工具实现错误和任务本身的不可复现性。
9. 与相关工作的定位
| 工作 | 主要侧重 | 相对 TerraBench 的优势 | 相对 TerraBench 的不足 |
|---|---|---|---|
| ThinkGeo (2025) | 遥感工具增强 agent | EO 工具任务聚焦、直接竞品 | 缺少统一环境数据和模拟器;论文称无数值评测 |
| OpenEarthAgent (2026) | EO + GIS 可执行 agent | 多模态地理工具和真实查询 | 论文表中无环境格点、模拟和结构化数值评测 |
| Earth-Agent / Earth-Bench (ICLR 2026) | EO 全景任务、量化分析 | 更强的 EO 任务专门化与已公开会议版本 | 不覆盖完整的环境数据、行业模拟器与文档重建组合 |
| Zephyrus (2025) | 天气科学 agent、数据和模拟器 | 气象工作流与世界模型更集中 | TerraBench 的跨域工具、三 track 和字段容差评测更系统 |
| GCA (2026) | GCC 气候决策支持 | 区域决策语境与真实问题 | simulator coverage 和统一 benchmark 协议较弱 |
| TerraBench | 跨 EO、格点、GIS、模拟和文档验证 | 过程+结果联合评测、工件溯源、容差数值评分 | 任务规模小、工具生态绑定强、公开复现包不完整 |
一句话定位:TerraBench 是地球科学 agent 方向的“可执行评测协议”贡献;它的差异不在某个单独工具,而在把多源数据、模拟、trace、artifact 和数值容差放进同一个评分体系。
10. Code Verification
10.1 检查范围
- 官方仓库:
Takerdat23/TerraBench - 检查 commit:
edaf12f6cc4d39c163f053703439a034f0a95f8c - commit 时间:2026-06-04
- Python 3.13 下
scripts/run_smoke_test.py:通过,输出 synthetic item 的 Hit@tol=1.000、ToolUseScore=1.000 - Python package compile check:通过
- 默认 registry:可注册 97 个工具名;这不是论文冻结的 77-tool manifest
10.2 Claims → Code 映射
| Claim | 论文描述 | 当前公开代码 | 状态 |
|---|---|---|---|
| TerraAgent 可运行 | ReAct + 科学工具 + trace | full-agent、工具注册表、prompt 和 mock runner 已存在 | 部分匹配:真实运行依赖大量外部服务和凭据 |
| 77 个子工具 | 论文 Table/Appendix 固定口径 | 当前 registry 暴露 97 个名字 | 不匹配/版本漂移 |
| ToolAcc | relaxed matches / ground-truth calls | 工具名 multiset F1 | 不匹配 |
| CategoryF1 | 工具组 multiset F1 | 与 ToolAcc 使用同一工具名 F1 | 不匹配 |
| ArgAcc | 对齐工具参数 key/value 匹配 | 直接复用工具名 F1 | 不匹配 |
| OrderScore | Unique、AnyOrder、LCS 平均 | 同位置匹配率 | 不匹配 |
| NumScore | 容差外指数衰减 | 与 Hit@tol 完全相同,越界直接 0 | 不匹配 |
| 有效容差 | $\max(\tau_{\mathrm{abs}},\tau_{\mathrm{rel}} | y | ,f)$ |
| item-level percentile CI + paired differences | library 默认 | 部分/不匹配 | |
| 403 项可复算 | 完整 traces、工件、ground truth、metrics | 仅一个 synthetic minimal item;完整数据另行托管但未给公开下载 | 未发布 |
10.3 数值反例
取
| 论文 NumScore | 当前代码 NumScore | ||
|---|---|---|---|
| 100 | 0 | 1 | 1 |
| 110 | 1 | 1 | 1 |
| 120 | 2 | 0.5 | 0 |
| 130 | 3 | 0.25 | 0 |
这不是实现细节差异,而会系统性改变 NumScore 表和模型排序。公开仓库必须发布与论文计算结果对应的 commit、完整单元测试和已保存的 item-level metric rows。
10.4 可复现性结论
当前复现性应评为 2/5:
- 加分:MIT 许可、环境文件、工具代码、prompt、schema、mock smoke test 和大量 simulator wrapper 已公开;
- 扣分:论文数据、真实 traces、artifacts、metric logs、测试和论文一致评测器缺失;外部数据、API、模型、官方模拟器和凭据要求较高。
11. Reviewer Recommendation
11.1 推荐
Major Revision / Weak Accept,核心条件是 artifact release。
如果按 NeurIPS Evaluations & Datasets Track 的标准评审,我认可问题、基准理念、结果洞察和统计框架;“过程分远高于数值正确率”是有价值且可操作的发现。但代码与论文公式的差异、完整数据缺失和容差审计不足,会直接妨碍基准作为公共评价基础设施的可信度。
11.2 接收前必须完成
- 发布 403 项 manifest、问题、schema、ground truth、容差、canonical traces 和允许公开的工件;
- 发布计算 Table 2 的精确 commit 和 item-level metric rows;
- 让公开代码逐式实现论文中的 ToolUseScore、OrderScore、ArgAcc、NumScore 和
paired bootstrap; - 对 numeric tolerance 做放宽/收紧敏感性分析,并公开容差分布;
- 对一组分层 item 做多 seed 重复,估计 model-run variance;
- 给出 raw track/domain counts,修复 source 中 398/403 的草稿计数漂移;
- 增加 human、oracle-tool 或传统脚本 baseline,分离规划和工具实现误差。
12. Research Taste 与长期价值
12.1 三维评分
text
创新性 (Novelty): ★★★★☆ 4.0/5
严谨性 (Rigor): ★★★☆☆ 3.2/5
影响力 (Impact): ★★★★☆ 4.0/5- Novelty:不是首个地球科学 agent,但过程+数值+工件的统一协议具有清晰增量;
- Rigor:公式和 item-level bootstrap 较好,但公开实现、容差审计和重复运行方差明显不足;
- Impact:如果完整 artifact 公开,它可能成为气象、遥感、GIS 和影响模拟 agent 的重要综合测试床。
12.2 是否值得跟进
非常值得参考,但更值得跟进“评测协议”而不是照搬全部工具栈。 最可复用的研究方向有:
- provenance-constrained decoding:最终字段必须绑定 artifact hash 和提取位置;
- schema-aware numeric self-check:单位、数量级、容差和 sign convention 的自动验证;
- planner/executor/verifier 分离:让独立 verifier 复算关键字段,而不是让同一 agent 自我确认;
- counterfactual pairing:强制 baseline 与 intervention 使用相同输入、seed 和 simulator version;
- hierarchical uncertainty:同时建模 item sampling、agent sampling 和 tool/runtime variance;
- difficulty calibration:用可验证的最短工具链、参数自由度和数据异质性定义难度,而不是只用因果 level 名称。
12.3 一句话科研品味评价
这是一篇选题和基准观念都很好的系统性工作:它准确抓住了科学 agent 的核心失败不是“没有工具”,而是“不会以可核验方式协调工具并交付正确数字”;但作为评价基础设施论文,公开 artifact 和评测代码必须比普通方法论文更完整,当前版本尚未达到这一要求。
13. Reviewer Feedback 与公开讨论
截至 2026-07-30,未检索到该论文对应的公开 OpenReview forum、Official Review、Author Response、Meta Review 或 Decision。arXiv 页面只表明它是 2026 年预印本;TeX 中的 NeurIPS 2026 Evaluations & Datasets Track 模板只能说明潜在投稿格式,不能据此推断审稿状态或接收结果。
14. Personal Notes
- 对我最有价值的观察:科学 agent benchmark 必须同时保存 question、trace、artifact、structured answer 和 tolerance;少任何一个,审计链都不完整。
- 最值得复用的公式:字段级
与连续 NumScore,但需要增加 tolerance sensitivity 和单位规范。 - 最需要警惕的误读:ToolUseScore 59.22 不是“59.22% 的任务流程正确”,Hit@tol 22.88 也不是所有数值字段独立正确率;两者都是按 item 聚合后的不同构念。
- 实际跟进优先级:先等待完整数据和论文一致代码发布;发布后优先复算 NumScore、检查容差分布,再讨论模型排行。