Theme
EarthLink: A Self-Evolving AI Agent System for Climate Science
阅读依据:arXiv v3 的完整正文、Methods、Extended Data、Supplementary Information、官方 GitHub 仓库及其关键配置、提示词与案例代码。主体分析使用中文,保留论文中的数学定义,并补出若干论文只以文字或代码表达、但理解结论所必需的公式。代码核查日期为 2026-07-31。
One-Sentence Summary
EarthLink 把气候研究组织为“多方案规划
论文故事与核心判断
作者试图讲什么故事
论文的论证链可以压缩为五步:
- 气候研究需要发现问题、寻找数据、选择诊断、编程、检查物理合理性和形成新假说,现有 AI 多只覆盖其中一个环节。
- EarthLink 用通用 LLM 作为“大脑”,连接论文知识库、地球系统数据湖和领域工具库,把这些环节编排成完整工作流。
- 系统不是直接执行一个计划,而是生成多个研究方案,聚合最优方案,再通过代码运行、报错反馈和结果检查反复修正。
- 专家确认成功的方案和脚本会写回知识库、工具库,因此下一轮相似任务调试更少、耗时更短。
- 作者用 36 个任务、5 个 foundation model、3 次重复和若干研究复现与新发现案例,主张系统已达到“research-ready”,部分表现接近领域研究者。
其中第 2、3 步有充分的系统与案例证据;第 4 步只证明了经验复用降低成本,没有证明泛化意义上的能力增长;第 5 步的证据主要来自非盲专家评分,强度不足以支撑“自主科学家”的宽泛表述。
我的总评
- 最强贡献:把真实气候工作流中的数据、诊断代码、图像和科学解释放进一个可执行、可迭代的统一 agent 系统;案例覆盖远超普通问答 benchmark。
- 最关键概念澄清:self-evolution 是专家审核后的 plan/script 写回,模型参数
没有更新。 - 最关键方法学问题:36 个任务既用于展示、调试和经验写回,又缺少严格隔离的 unseen holdout,因此第二轮性能提升混合了记忆复用、任务熟悉和真正迁移。
- 最关键代码问题:Atlantic Niño 的特征筛选在整个 1995–2023 样本上先看目标变量,再做 rolling-origin 验证,造成非嵌套选择和未来信息泄漏;报告的相关技巧不能被解释为严格的准实时预测技巧。
- 审稿建议:若投 AI4Science 或综合高水平期刊,建议 Major Revision / Weak Reject;若定位为系统论文或资源论文,则贡献更容易成立。
1. Problem:论文究竟解决什么问题
1.1 目标对象不是单个模型,而是科研过程
输入是自然语言研究问题
其中:
是选定的研究计划; 是数据处理和诊断代码; 是数值输出; 是图像; 是科学解释与结论。
理想目标不仅是“生成看起来合理的文字”,而应同时满足:
其中
1.2 四类研究难度
论文把 36 个任务分成四级:
| Level | 数量 | 定位 | 典型任务 |
|---|---|---|---|
| L1 | 23 | 单变量或标准气候诊断 | 区域平均、偏差、趋势、EOF、ENSO 频谱 |
| L2 | 6 | 多数据、多模型或统计归因 | CMIP6 评估、ECS/TCR、最优指纹 |
| L3 | 6 | 综合研究流程或论文复现 | emergent constraint、三篇近期论文复现 |
| L4 | 1 | 开放式科学发现 | 提前 8 个月预测 Atlantic Niño |
Supplement 还描述了 Level 5,但没有实际任务。因而“从基础分析到 scientific discovery”的跨度是真实的,“覆盖完整自主科学等级”则仍是愿景。
2. EarthLink 的系统结构
2.1 三个资源库
系统把外部资源分为:
- Knowledge Library:文献、专家经验和历史研究方案;
- Data Library:CMIP6、ERA5、HadISST、GPCP、ORAS5 等地球系统数据;
- Tool Library:数据读取、统计诊断、绘图和案例脚本。
文本资源由 Qwen3 embedding 编码。若查询向量为
论文设置检索 top-
2.2 多方案规划
对问题
聚合器结合历史交互
论文实验中 MAX_PLANS=1,因此开源默认配置不能直接复现论文宣称的五方案竞争。多方案本身的价值在于降低单次 prompt 的路径依赖;但论文没有报告候选间多样性、聚合器胜率或
2.3 Recipe、代码生成与运行
计划被转成更结构化的 recipe,包括:
- 数据集、变量、时段、空间范围;
- 预处理步骤;
- 统计方法和关键阈值;
- 图表和应报告的物理量;
- 验证规则。
编码 agent 据此生成程序,运行环境返回标准输出、图像和错误。若第
调试 agent 根据错误
论文设置最多 30 轮调试、保留最近 5 条报错上下文、每个脚本最长运行 1 小时、最多 2 次完整尝试、最多保留 20 张图。编码温度为
2.4 科学诊断闭环
论文把迭代写成:
这里:
把计划和工具 转成代码; 根据反馈修改代码; 执行代码; 判定结果是否通过。
论文中结果检查最多 10 轮、图像检查最多 5 轮;当前代码分别是 5 轮和 3 轮。更严重的是,当前 result checker 的提示词明确要求只检查任务完成性、文件和结构,不验证数值与科学结论是否正确,并要求忽略模型数量不足、少数模型异常和单位不一致等情况。因此:
程序能运行、图能画出,并不等价于统计设计正确或物理解释成立。
2.5 “Self-evolution”到底更新了什么
第
系统把它写回库:
下一轮通过检索使用:
但 foundation model 参数不变:
所以更准确的名称是 expert-gated episodic memory accumulation。它确实能让相似任务减少重复调试,但与 continual learning、online parameter adaptation 或自主提出并验证新科学规律不同。论文的“evolution”依赖人工专家决定什么可以进入长期记忆,系统没有独立处理错误经验污染、冲突经验消解和分布漂移。
3. Benchmark 与专家评分
3.1 运行设置
每个任务在五个 foundation model 上运行:
- GPT-5;
- Gemini-2.5-Pro;
- Grok-4;
- Claude-Sonnet-4;
- Llama-4-Maverick。
每个“模型
三维均使用
以及跨重复、跨任务和跨专家的方差。论文主要给均值、等级图和案例,没有公开完整的逐任务、逐重复、逐专家原始评分,也没有置信区间或显著性检验。
3.2 专家人数与等级定义不一致
Results 写“由五名独立专家评估”,Methods 又说“每个任务由三名独立专家评分”。这两句可以被解释为从五人池中每题抽三人,但论文没有明确抽样、校准和冲突处理方式,也没有报告 inter-rater reliability。至少应给:
Methods 的等级划分是:
这留下
3.3 任务本身不是盲测
任务、参考方案、经验库和案例脚本处在同一个持续开发系统中。第二轮把首轮专家认可的输出写回库后,再对相同或高度相似的问题评估调试次数和耗时。于是观察到的改进可分解为:
而不是纯粹的:
一个严格设计应按气候现象、数据源和诊断族做组间隔离:在训练任务上累积经验,只在完全未见的任务族上评价第二轮,并设置“随机经验”“错误经验”“仅脚本无计划”“仅计划无脚本”等对照。
4. 数学与气候诊断细节
本节按论文中的代表任务保留其统计定义,并指出隐含假设。
4.1 面积加权与时间加权
对纬度
若存在网格面积
年平均不能简单把 12 个月等权,正确的日数加权是:
其中
4.2 CMIP6 降水综合评分
模型
相对偏差:
均方根误差:
季节循环相关系数:
论文把不同误差压到
若第
结果中排名前五为 E3SM-2-0(72.8)、IPSL-CM6A-LR(71.8)、CMCC-ESM2(71.7)、TaiESM1(71.4)、ACCESS-ESM1-5(70.5)。多数模型集中在 69–70,说明排序对
4.3 Gregory 回归、ECS 与 TCR
abrupt-
令反馈参数:
则四倍二氧化碳有效辐射强迫和两倍强迫分别为:
平衡时
若使用早期与晚期分段:
分段斜率差反映反馈随增暖状态变化。Supplement 报告 22 个模型的 ECS 平均为:
范围从 INM-CM5-0 的
TCR 来自
通常取翻倍附近若干年平均:
官方当前 ECS 代码只用 piControl 前 30 年常数均值作基线,没有处理 control drift 或逐月 climatology,而且只画全时段拟合;这与 Supplement 声称的 22 模型及早晚期拟合不完全一致。
4.4 最优指纹归因
观测温度变化向量
若内部变率协方差为
其协方差近似为:
信号在置信区间不含 0 时可称 detected;若置信区间包含 1,则模型幅度与观测一致。论文案例给出:
重建总增暖约:
观测约
而 aerosol 的置信区间包含 0。问题是论文没有充分报告协方差估计、正则化、残差一致性检验以及 ensemble uncertainty,因此数值更像自动化展示,不是完整的 detection-and-attribution 结果。
4.5 Hierarchical Emergent Constraint
设模型历史期和未来响应联合近似高斯:
观测模型为:
则未来响应条件后验均值:
后验方差:
若先做高斯分位数映射,模型值
映射到观测分布:
这一推导是清楚的,但结论依赖联合高斯、模型独立、线性稳定关系、观测误差已知和模型族能代表真实世界等强假设。CMIP 模型共享代码和参数化,独立同分布假设尤其可疑;应使用 model genealogy 权重或 leave-one-model-out 检验。
4.6 ENSO 的 Morlet 连续小波分析
对时间序列
Morlet 母小波取:
局地小波功率:
全局小波谱:
论文关注
4.7 气候情景增暖
若基准期为 1985–2014,未来期为 2050–2099,则模型
多模型平均和 spread:
论文案例给出:
| 情景 | 2050–2099 相对 1985–2014 的增暖 |
|---|---|
| SSP1-2.6 | |
| SSP2-4.5 | |
| SSP3-7.0 | |
| SSP5-8.5 |
这些数值是自动流程的 sanity check,不应被当作新的情景投影结论。
4.8 非洲增暖的 emergent constraint 失败案例
任务要求寻找历史可观测量
相关系数:
任务明确要求若
它仍应用“最强”因子并报告 constrained warming 约
5. Atlantic Niño 提前 8 个月预测
这是论文最重要、也最需要严格审查的 Level-4 案例。
5.1 预测目标与时间约束
目标为 JJA ATL3 海温异常:
要求只使用上一年 SON 或最晚 11 月可获得的 predictor,因此 lead time 约 8 个月。训练和验证区间是 1995–2023,使用 ERA5、ORAS5、GPCP、HadISST 等数据。
5.2 候选物理信号
系统筛出两个主要前兆:
- 秋季热带大西洋东西向 SLP gradient 及其 SON 到 November 的 tendency;
- 西部赤道大西洋 sea-surface height anomaly。
一个标准化线性模型可以写为:
论文还比较 random forest 和 gradient boosting:
5.3 rolling-origin 评估
对预测年
然后:
时间相关技巧 TCC:
RMSE:
论文报告:
| 方法 | TCC | RMSE |
|---|---|---|
| persistence | 约 | 未突出 |
| ENSO-only | 约 | 未突出 |
| MLR | ||
| Random Forest | ||
| Gradient Boosting |
Gradient Boosting 的 bootstrap 置信区间约为:
目标
5.4 有效样本量
预测和观测都有自相关时,相关系数的有效样本量可近似为:
这里
这正是官方实现采用的近似。当两个序列的一阶自相关同号且为正时,
5.5 物理机制
作者提出的机制链是:
这条机制在动力学上合理,也与赤道波导和 Bjerknes feedback 一致。但当前证据仍是 predictor、海洋热含量和目标之间的时序关联,没有 intervention、独立资料复核、波传播诊断或模式可预报性实验,因此不能写成已经确认的因果机制。
5.6 代码核查发现的目标泄漏
当前官方 feature_selection.py 在整个 1995–2023 数据上完成:
- predictor 与
的相关和偏相关; - 基于目标的候选筛选;
- 冗余特征剔除;
- 最终 predictor 集确定。
之后才做 rolling-origin prediction。于是验证年
严格的嵌套过程应为:
此外,部分 predictor 在全时段上先 detrend,也会把未来信息带入较早折。即使幅度不大,这也使
6. 三个论文复现案例
EarthLink 复现了三类研究:
- Geng 等关于连续 La Niña 的研究;
- Cai 等关于未来 ENSO variability 增强的研究;
- Song 等关于降雨季推迟与更热 hot season 的研究。
这些案例证明系统能:
- 找到大体正确的数据与变量;
- 生成对应 composite、trend、frequency 或 seasonal-cycle 诊断;
- 得到与原文方向一致的图形和物理解释。
但“复现成功”的证据主要是定性图像相似和专家叙述,没有逐图逐表的数值误差:
也没有统一通过阈值。更重要的是,foundation model 可能在预训练中见过论文摘要甚至正文;系统应增加发表后时间切分、隐藏方法描述和未公开研究任务,才能区分“检索并重做”与“真正从问题独立推导”。
7. 主要实验证据:什么成立,什么没有成立
7.1 有证据支持的结论
- 工作流覆盖广:36 个任务确实跨数据处理、统计诊断、图像、解释和开放研究。
- 外部记忆能降低重复成本:写回成功计划和脚本后,相似任务的 debug rounds 和 runtime 下降,方向上可信。
- 强模型整体更稳:前沿闭源模型在复杂任务上的专家评分普遍高于较弱模型,符合预期。
- 系统能产生可研究的中间产物:相比只输出语言答案,代码、图和日志更便于专家核查。
- 失败并未完全隐藏:例如 Atlantic Niño 未达到
目标、非洲 constraint 未达到 阈值,论文材料中仍可追踪。
7.2 证据不足的结论
- “self-evolving”提高通用能力:没有 unseen task-family holdout。
- 达到人类专家水平:评分不是人与 agent 在相同盲测、相同预算下的直接比较。
- 结果检查保证科学正确:代码提示词明确不做这种保证。
- 新发现已经成立:Atlantic Niño 的评估有 leakage,机制证据也仍是关联性。
- 可端到端复现论文所有数字:数据湖规模巨大且访问条件、模型版本、运行轨迹与精确环境未完整固定。
8. 论文内部一致性与可复现性问题
8.1 文稿内部
- 主文称数据湖超过
PB,当前 README 称 PB;这可能是系统增长,但需要版本化快照。 - 主文一处称超过 100 个 climate models,Supplement 一处称超过 70 个。
- Results 提到 5 位专家,Methods 说每任务 3 位专家。
- 论文规划候选数为 5,当前代码为 1。
- 论文计划检索阈值为 0.5,当前代码为 0.8。
- 论文结果与图像检查轮数为 10 和 5,当前代码为 5 和 3。
- Supplement 的 ECS 统计是 22 模型,当前 recipe 写 21 模型并省略 GFDL-ESM4。
版本演化本身不是错误,但没有 paper tag、release manifest 和 immutable configuration,读者无法知道哪一版代码对应哪一组结果。
8.2 缺失的关键 artifact
- 36 任务的机器可读输入、输出和 reference rubric;
- 5 模型
36 任务 3 重复的完整轨迹; - 每位专家的原始评分和匿名说明;
- 每次运行 token、wall time、GPU/CPU 和数据 I/O 成本;
- 失败运行、被过滤计划和被拒绝经验;
- 论文实验对应的 commit、配置、容器与模型 API snapshot。
8.3 统计报告
论文应至少报告:
或对任务分组做 block bootstrap;模型比较应使用配对任务差:
并报告:
当前图中的平均分差若没有任务级方差和评分者方差,很难判断实际差异是否稳定。
9. 与相关工作的关系
9.1 它位于什么位置
| 系统 / benchmark | 主要对象 | EarthLink 的区别 |
|---|---|---|
| ESMValTool / ILAMB | 固定、专家编写的气候评估 recipe | EarthLink 用 LLM 自动规划和生成 recipe,灵活但可靠性较弱 |
| UnivEARTH | 面向 Earth observation 的通用 agent | EarthLink 更偏气候研究诊断和 PB 级数据湖 |
| Zephyrus | agentic weather analysis | EarthLink 任务跨度更广,强调自我积累经验 |
| EWE | 极端天气 agent | EWE 更聚焦极端天气;EarthLink 覆盖 CMIP、归因和科学发现 |
| ClimateAgent / ClimAgent | 气候知识、工具调用或分析 | EarthLink 的 executable research pipeline 与经验写回更完整 |
| TerraBench | Earth-system agent benchmark | TerraBench 更强调标准化评测;EarthLink 更像系统与案例集合 |
| CMIP-Forge | CMIP 数据分析 agent | 两者都面向 CMIP workflow;EarthLink 的资源面更宽 |
EarthLink 的新颖性不在单独的 RAG、代码 agent、critic 或 memory,而在于把它们与大型气候数据、经典诊断和专家审核结合成一个真实可运行系统。这是一种系统集成创新。
9.2 论文最值得保留的研究方向
- Executable science benchmark:评分对象应是数据谱系、代码、图和结论,而不是最终文本。
- Scientific verifier:把守恒关系、单位、统计假设、样本独立性和物理范围写成机器可执行测试。
- Experience governance:研究错误经验如何进入、传播、被发现和回滚。
- Prospective evaluation:只用截止时点可获得的信息预测真正未来事件。
- Human-agent team science:把专家审核成本和纠错收益一起纳入指标。
10. Reviewer-Style Critique
10.1 Strengths
- 选择了困难且重要的问题:自动化完整气候研究流程,而非只做知识问答。
- 36 个任务横跨 CMIP6、检测归因、ENSO、emergent constraint 和开放式预测,生态覆盖罕见。
- 输出代码和图像,为核查提供了比自然语言答案更好的接口。
- 多方案、执行反馈、图像检查、资源检索和经验写回的系统设计具有实际工程价值。
- Supplement 信息量大,公开代码足以发现系统真实边界,而非只剩概念图。
- Atlantic Niño 案例提出了可检验的物理假说,即使当前证据尚不足。
10.2 Weaknesses
- self-evolution 的术语强于实际机制;它是专家门控的外部记忆增长。
- 评测集、系统开发与经验库增长没有严格隔离,无法测量 out-of-distribution generalization。
- 专家评分缺少 rubric、原始分、评分者一致性、盲法和统计不确定性。
- 当前 verifier 只保证形式与执行,不保证科学正确性。
- 论文与仓库配置明显漂移,缺少可复现实验 release。
- Atlantic Niño 的全样本特征选择和去趋势产生未来信息泄漏。
- 非洲 emergent constraint 在未满足阈值时仍输出约束结果,说明 agent 会越过关键科学停止条件。
- 研究复现主要是方向一致,缺少数值级 replication criteria。
- 没有与“专家固定 recipe + 普通代码 agent”“无经验库”“随机经验库”等强基线做完整对照。
- 缺少失败率、人工干预分钟数、API 成本和 PB 级 I/O 成本,使实际可用性难判断。
10.3 必须补的实验
- 冻结系统和资源库,在完全未见的 phenomenon/task family 上盲测。
- 发布完整任务、轨迹、评分和 paper-aligned Docker/commit。
- 用嵌套 rolling-origin 重跑 Atlantic Niño,全流程预处理只能使用训练窗口。
- 对经验写回做四项消融:plan only、code only、random memory、adversarial memory。
- 比较 1、3、5、10 个计划,在等 token 预算下报告收益。
- 让专家和 agent 在同一数据权限、时间预算和评分 rubric 下直接对比。
- 为每类气候诊断加入可执行科学单元测试。
- 对研究复现预注册关键数值及允许误差。
10.4 给作者的关键问题
- 五名专家与每题三名专家的关系是什么?如何分配和校准?
- 第二轮 self-evolution 是否使用了第一轮完全相同的问题、数据和目标?
- 36 任务中有多少在开发期间被用于 prompt 或 tool tuning?
- 当前 GitHub 哪个 commit 对应论文所有表图?
- result checker 为什么被明确要求忽略单位不一致与模型数量不足?
- Atlantic Niño feature selection 是否在每个 rolling fold 内重新执行?
- 被专家拒绝的方案和脚本是否保存?错误经验如何回滚?
- 多方案在等计算预算下相对单方案的真实收益是多少?
11. Research Taste
| 维度 | 评分 | 判断 |
|---|---|---|
| Novelty | 4/5 | 组件不新,但气候科研全流程集成和规模很有新意 |
| Rigor | 2.5/5 | 案例丰富,盲测、统计和复现协议明显不足 |
| Impact | 4/5 | 若补齐 verifier 和 benchmark,可成为重要科研基础设施 |
| Clarity | 3.5/5 | 系统故事清楚,但术语和若干配置不一致 |
| Reproducibility | 2.5/5 | 有代码和大量 supplement,但没有论文锁定版本与完整轨迹 |
综合创新性:7/10。
我欣赏这项工作的地方,是作者没有把气候科学简化成“让 LLM 回答几个问题”,而是正视数据、代码、图像和物理判断之间的闭环。最不满意的地方,也是 AI4Science 系统常见的软肋:工程演示的广度被当成了科学验证的强度。EarthLink 真正需要的下一步不是再增加更多 agent 角色,而是建立一个比生成器更苛刻的科学验证层。
12. Code Verification
核查对象:官方仓库 OpenEarthLab/EarthLink,2026-07-31 读取到的主分支提交:
text
ccd18fba919d174648b77580658039ab4e95145b与论文一致
- 主流程确实是 input guard、planning、recipe、diagnostic execution、image summary。
- coding/recipe temperature 为
。 - 最大 debug round 为 30。
- 错误上下文窗口为 5。
- 每脚本 timeout 为 1 小时。
- 最大图像数为 20。
- Atlantic Niño 的 rolling prediction 代码和多模型比较存在。
与论文不一致或值得警惕
| 项目 | 论文 | 当前代码 |
|---|---|---|
| candidate plans | 5 | 1 |
| plan retrieval threshold | 0.5 | 0.8 |
| result-check rounds | 10 | 5 |
| image-check rounds | 5 | 3 |
| ECS model count | 22 | recipe 为 21 |
其他发现:
- result checker 的提示词明确不核验科学正确性;
- ECS 代码对 piControl drift 与 seasonal baseline 的处理不足;
- Africa constraint 代码主动取消
阈值; - Atlantic Niño 在全样本上先做目标相关的特征筛选,再 rolling validation;
- 测试主要是案例脚本或 vendored ESMValTool tests,缺少针对 agent scientific contract 的系统测试;
- 仓库没有找到论文全部 36 任务、5 foundation model、3 次重复的完整原始日志;
requirements中存在重复依赖条目,环境锁定仍不充分。
因此官方代码支持“系统真实存在并能运行”的判断,但不能支持“论文所有结果可从固定版本一键复现”。
13. 最终结论
EarthLink 是一篇系统想法好、工程幅度大、科学验证仍欠火候的工作。它最有价值的贡献是把气候科研输出从语言答案提升为可执行 recipe、代码、图像和解释;它最危险的表述是把专家审核后的检索记忆增长称为 self-evolution,并进一步接近“自主科学发现”。
我会把论文结论分成三层:
- 可以接受:LLM agent 能在大型气候数据与工具环境中自动完成相当一部分标准分析,并通过经验复用降低相似任务成本。
- 需要保留:系统的平均专家评分是否真的对应 research-ready,以及不同 foundation model 的细粒度差异。
- 目前不能接受:EarthLink 已经证明通用自我进化能力,或 Atlantic Niño 案例已经构成经过严格样本外验证的新发现。
若作者修复 Atlantic Niño 泄漏、冻结 paper release、发布完整轨迹与评分,并用未见任务族验证经验迁移,这项工作很可能从“令人印象深刻的 demo platform”上升为可信的 AI-for-climate research infrastructure。