● Feed Monitor · 每天替你盯顶级英文播客

🔬 1% of Global Warming Is Fixable by Changing Altitude — John Platt, Google Fellow

Latent Space · 2026-09-23

🔬 1% of Global Warming Is Fixable by Changing Altitude — John Platt, Google Fellow
一句话摘要

Google 研究员 John Platt 用 Gemini 驱动的 ERA 系统,把科学问题改写成"打分任务",让 AI 像不知疲倦的研究生一样反复改代码,在 CDC 疫情预测竞赛中击败人类团队。

AI for ScienceGemini科研自动化Agent
结构化解读

修正 1% 变暖,只需让飞机降两层

John Platt 是 Google Fellow、Google Research 应用科学负责人。14 岁上大学,18 岁进入加州理工读博;他提出过 Platt scaling 和训练支持向量机(SVM)的 SMO 算法,还因图形技术获得过 2006 年技术奥斯卡。今天他做的事,横跨 AI、气候、遥感、实验自动化与科学发现。本期最有意思的地方,不是“AI 会不会取代科学家”,而是它已经开始把科学家的时间,从写代码和调参数,推向更难也更不能偷懒的环节:定义问题、验证结论,以及决定该去哪里找真实世界的答案。

这期回答了 7 个问题:

  1. 为什么飞机只需避开几百米高的一层空气,就可能减少大量气候影响?
  2. ERA 为什么把科学研究改写成“不断优化一个分数”的问题?
  3. 当 AI 会自己写代码、读论文和跑实验,科学家的核心工作会变成什么?
  4. 为什么更密集、更高清的卫星不一定是解决气候观测的唯一答案?
  5. AI 已经改变天气预报,为何却还没解决气候预测?
  6. 科学发现的真正瓶颈,为什么可能从推理和计算转移到实体实验室?
  7. 年轻科学家该如何既使用 AI,又不丧失形成领域直觉和判断力的能力?
1. 航空减排的低垂果实,不是换飞机而是换高度

被问到 Google 如何用 AI 做气候干预、以及 contrails,也就是飞机凝结尾迹为何会致暖时,Platt 先给了一个容易被忽略的量级:持久性凝结尾迹,大约造成全部人为全球变暖的 1%。飞机身后的白线并不都危险。很快消散的尾迹影响有限;真正麻烦的是那些停在空中、逐渐铺开的薄云。它们白天会反射部分阳光,但昼夜都能吸收地球向外散出的红外热量,再向下回辐射,像一层薄毯子。

尾迹形成依赖冰过饱和区域:那里高空水汽多到接近“结晶”,飞机排出的微小颗粒会成为凝结核。Platt 把它比作冰糖制作时的高糖水。区域往往像薄煎饼,垂直厚度只有几百米。"for every gram of water, ice or soot you put out, it's about 10 kg of water gets sucked out."(每排出一克水、冰或烟尘,大约会吸走 10 千克水。) 这相当于约 10,000:1 的放大:发动机排出一点点东西,却能牵出一大片冰晶云。

Google 的做法不是等待航空业把机队全换成新飞机,而是用卫星持续监测尾迹、预测冰过饱和区域,再把地图交给飞行规划软件。飞机通常只要下降约两个 flight levels,也就是绕开几百米高度,就能避开热点,额外燃油成本不高。这意味着航空减排有一部分可以从漫长的硬件换代,变成实时的航线调度。但边界也很清楚:并非每条尾迹都致暖,反射阳光和滞留热量的净效应仍有不确定性,优先绕开的应是那些持续时间长、暖化效应最确定的区域。

2. 编码不再是科研瓶颈,定义对的分数才是

被问到 ERA 的输入输出是什么、它和一般“让智能体写代码”的系统有何不同,Platt 说,ERA 的起点不是让人提交一段程序,而是让人先把问题讲出来。系统尝试将这段描述变成一个 Python notebook,并在里面写入评分函数:什么结果算更好,怎样给它打分。此后,底层的 Gemini 不断修改 notebook、运行实验、比较分数。用户还可以塞进已有论文,模型会先读论文,再试着复现或改写其中的方法。

ERA 不是每轮都押注当前分数最高的方案。它用 Monte Carlo research,也就是保留数百到数千个候选 notebook 的搜索框架,再用 UCB,即“置信上界”来挑下一个该改谁。大白话说,它会估计某个方案的当前成绩加上潜在上升空间,而非只盯着第一名。默认设置中,它一次扩展约 10 个叶节点:并行太多,彼此来不及学习;并行太少,搜索又太慢。

"people who use it are now spending all their time almost at the right level almost at the scientific creativity level."(使用它的人,如今几乎把全部时间都花在了正确的层级上——科学创造力的层级上。) 这意味着科研流程的重心会移动。过去,研究生可能大把时间耗在导入 CSV、接数据库、调通模拟器;现在,人更需要决定什么是“成功”,哪些约束不能碰,以及 AI 的结果是不是只是在刷分。因为评分函数常常第一天写不对,系统也会寻找漏洞。目标写偏一厘米,它能以惊人的效率朝错误方向跑一公里。

3. 观测地球未必需要完美卫星,关键是让缺陷互补

被问到 ERA 和 AI for Science 除了统计拟合还能解决什么问题时,Platt 提到卫星遥感里的一个老矛盾:重访频率、空间分辨率、光谱分辨率,通常不能同时做到最好。理想状况是每 5 分钟拍一次地球、每个像素 10 厘米、还能用高光谱细分各种气体;现实里没有这样一颗全能卫星。

以二氧化碳观测为例,有的卫星能提供准确度高、分辨率较高的窄条 CO2 测量,但覆盖并不连续;GOES 这类气象卫星几乎每 5 分钟就能成像,却像素较大,光谱设计也不是为了测 CO2。过去的思路容易变成“等一颗更强的卫星”。Platt 团队换了一个问题:能否让一颗卫星去估计另一颗卫星的结果,再把天气、长期反照率等信息一起喂给模型?

"you just ask one to estimate the other and you shovel other data in like what's the current weather"(你只要让其中一个去估计另一个,再把当前天气之类的其他数据一股脑加入。) 这叫“有信息支撑的超分辨率”。它不是凭空把一张模糊图修得更清楚,而是让不同传感器互相补短:高频低清的观测告诉你变化发生得多快,高精度窄条测量告诉你绝对值更接近哪里,天气与地表反照率提供物理背景。

这意味着环境观测的竞争,不一定只是谁先发射一颗更贵的卫星,也是谁更会把已有数据组织成互相校正的系统。但模型重建不等于直接测量。它依赖辅助数据、训练关系和模型假设的可靠性,不能被包装成真的获得了每 5 分钟、10 厘米级的完整 CO2 观测。

4. 越是 AI 能榨干效率,组织越要刻意保留无功利探索

被问到年轻人如何在 AI 时代培养能力、旧式艰苦训练是否还必要时,Platt 没有给出“把所有重复劳动都自动化”的答案。相反,他在自己的 Google 团队里明确保护 20% time:成员可以拿出一部分时间学习、试验,甚至不需要告诉他具体在做什么。这里的重点不是福利,而是给没有明确产出承诺的活动留一个合法位置。

"if you want to learn stuff, if you want to try stuff, you don't even have to tell me."(如果你想学习东西、想尝试东西,你甚至都不必告诉我。) Platt 的理由很直接:如果人的日程被眼前任务填满,所谓“玩一玩”的空间就消失了;而很多新方向在刚开始时,看上去恰恰像不务正业。组织会自然偏爱可量化的短期产出,AI 又会让这种偏好更强,因为每一小时似乎都可以被安排得更满。

他把风险比作过拟合。机器学习里的过拟合,是模型把训练集背得太熟,换一份数据就失灵。组织若把每个人都压到当前 KPI 的极限,也可能只适应眼前环境,却丧失遇到新问题时的弹性。Platt 用爬山打比方:有车可以开到山顶,但人仍该偶尔徒步,因为腿脚能力不是到达终点的副产品。

这意味着,AI 时代的管理不只是压缩流程,也要制度化保留一块暂时无法证明 ROI 的探索地带。现实边界在于,20% time 并不普遍,它直接逆着“优化和榨干一切”的文化惯性走;但没有这块余量,组织获得的可能只是更快地重复已有答案。

5. AI 已能改写天气预报,却还啃不动真正的气候预测

被问到 Google 的天气、气候建模为何都在进步,以及两者是否本质相同时,Platt 先泼了一盆冷水:天气和气候不能混成一个问题。天气是在大约 15 天内预测大气会走哪条具体轨迹,比如台风会往哪里走、何时加强。近年的跃升,主要来自 2018 年前后机器学习范式、大量数据和算力的结合;新模型已经能更早、更准确地预报热带气旋路径。

气候问的却不是“2070 年西雅图某天下不下雨”,而是长期统计规律。它必须同时处理陆地、冰层、水循环、碳通量,以及植物如何吸收和释放 CO2。更棘手的是“非平稳”:系统本身在变化。冰层融化后反射阳光的能力会变,植被的行为会变,甚至决定长期统计分布的“吸引子”——可以理解为系统通常会在何种状态附近活动的范围——都可能移动或突然换形状。

这意味着天气模型的成功,不能简单外推为“把气候模型做得更大就行”。天气有大量连续观测,且目标是相对短期的轨迹预测;气候没有 30 年后的真实数据当验证集,也不能等 30 或 50 年才发现模型过拟合。模型模拟器出现不稳定时,研究者甚至难以判断:是代码或参数写坏了,还是自然界真的正在跨过临界点。

所以,气候 AI 的难题不是单纯堆算力,而是如何把物理约束、过程模型和有限观测放进同一个系统,让它能对未知未来做可信外推。Platt 的判断很诚实:这件事还没有被解决。

6. 科学发现的终极瓶颈,可能不是推理而是实验室

在节目最后被问到,如果能用魔法移除行业里的一个瓶颈,他会选什么时,Platt 的答案不是更强的模型,而是一个“everything lab”。研究者发过去一个 JSON blob——一种结构化文本指令——实验室就能完成任何实验:制样、测量、控制仪器、收集数据,再把结果传回来。

这个愿望暴露了 ERA 一类系统的边界。它们可以读论文、写代码、搜索候选模型、优化评分函数,但基本还在计算世界里活动。"right now things like ERA, it's all computational. So someone has to gather the data."(现在像 ERA 这样的东西全是计算性的,所以总得有人去收集数据。) 科学里的 ground truth,也就是真实世界给出的可检验答案,最终仍要靠实验拿到。

现在并不是没有自动化实验室。许多专用系统已经能稳定完成特定流程,例如在固定的化学、材料或生物实验范围内运行。但 Platt 想要的是通用实验室:面对任何实验协议都能可靠执行。这本质上又回到了通用机器人问题——让实体系统理解环境、操控器材、处理异常,并在现实摩擦中保持可靠。

这意味着,算法生成假设和代码的速度越快,科学产出的上限越会被实验自动化、仪器排队、样本制备与数据采集卡住。过去一篇论文可能主要等代码跑完;未来更常见的账单,可能是模型一晚上提出几百个可测假设,而实验室一周只能验证其中几个。这个瓶颈目前没有通用解法,也因此不会被更长的上下文窗口自动抹平。

7. 未来科学家不是 AI 的旁观者,而是领域直觉与工具能力的双修者

被问到如果给正在成长中的儿子和年轻科学家建议,该如何面对 AI 改写学习路径时,Platt 提到自己刚满 21 岁的儿子:一边学 AI 和编程,一边学化学,试图成为 RNA 领域专家,同时也在使用 vibe coding,也就是用自然语言驱动模型编程的新工具。他给出的建议并不神秘,但很难只做一半:要有深厚的领域专长,也要主动去尝试所有新工具。

"develop domain expertise but also try and play I would say with all the different tools that are available."(培养领域专长,但也要去尝试、去玩转所有可用的不同工具。) 领域专长的作用,不只是记住术语。它决定你能不能看出一个模型建议是否违背常识,能不能把模糊的问题转成正确约束,也决定你知道什么结果虽然“分数高”,却不值得相信。工具能力则决定你能否把这些判断迅速变成搜索、代码、模拟与实验方案。

Platt 认为,AI 目前还替代不了人的创造力、哲学思考和严谨判断。模型会犯错,而且常常犯与人不同、甚至更诡异的错误。他援引费曼的提醒:人最容易欺骗的对象是自己。代码无论由人写还是由模型写,都需要验证、质疑和反复检查。

这意味着未来稀缺的并非单纯手写代码的速度,而是能提出有意义的问题、把世界知识写成约束、再对自己与 AI 共同产出的结论保持警惕的人。难处也在这里:许多基础劳动被自动化后,新人怎样形成“品味”和直觉?Platt 没有假装已经有答案。他只给了一个方向:偶尔不要坐车上山,仍要自己走一段。

把这 7 条放在一起看

把这 7 条放在一起,Platt 的主线并不是“AI 会替科学家多做一点事”,而是 AI 正在重新分配科学中最稀缺的环节。

“编码不再是科研瓶颈,定义对的分数才是”说的是计算端的变化:ERA 可以不知疲倦地变异代码、搜索 notebook、读取论文,但它不知道你的评分函数是不是把研究带偏了。“科学发现的终极瓶颈,可能不是推理而是实验室”则把同一个逻辑推到现实世界:即便模型一小时能生成上百个假设,真实数据仍要由仪器、样本、实验流程和人类社会的资源配置来产出。

“航空减排的低垂果实,不是换飞机而是换高度”也不只是一个气候案例。它说明 AI 最有效的介入,往往不是宣称掌握整个复杂系统,而是先找到一个足够具体、可观测、可执行的杠杆:几百米高度、一张风险地图、一次低成本绕行。“观测地球未必需要完美卫星,关键是让缺陷互补”同样如此:不是等待完美数据,而是在知道数据缺口在哪里的前提下,让不同来源彼此校正。

对读者而言,这套逻辑也适用于自己的工作。若 AI 已经能替你完成一部分检索、写作、编码或分析,真正该向上挪的,不是把日程塞得更满,而是追问三件事:我究竟在优化什么;这个结果怎样被现实检验;哪些探索不能因为暂时没有产出,就被从日程里删掉。AI 能加快答案出现的速度,但问题是否问对、约束是否写清、结论是否经得起验证,仍然要由在场的人负责。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02