● Feed Monitor · 每天替你盯顶级英文播客

Rethinking Legacy Data Infrastructure with Eon Co-Founders Ofir Ehrlich and Gonen Stein

No Priors · 2026-08-28

Rethinking Legacy Data Infrastructure with Eon Co-Founders Ofir Ehrlich and Gonen Stein
一句话摘要

Google 花 1000 万美元买下破产的 Spirit Airlines 数据,只为训练 AI 模型——数据正成为企业最值钱的资产,连破产清算都在抢。

AI数据企业安全创业
结构化解读

模型会换,数据才是企业最后的护城河

Ofir Ehrlich 与 Gonen Stein 是 Eon 的联合创始人。两人此前创办 CloudEndure,后将其出售给 AWS;CloudEndure 的能力后来成为 AWS Application Migration Service。他们做过企业级上云迁移,见过数千、数万乃至数十万台服务器如何从旧环境搬进 AWS、Azure 和 GCP。现在,他们把同一双眼睛投向 AI:企业最难迁移的不是模型,而是那些散落在备份、业务系统和旧服务器里的历史数据,以及围绕它们建立的权限、责任和恢复能力。

这期回答了 7 个问题:

  1. Google 为什么愿意花 1000 万美元购买一家破产航空公司的数据,而不是飞机?
  2. 当模型和算力都越来越可替换,什么会成为企业真正的 AI 护城河?
  3. 企业明明已经拥有大量数据,为什么 AI 团队却依然找不到可用数据?
  4. 传统 ETL、数据仓库和仪表盘,为什么不足以支撑 Agent 时代?
  5. 为什么 AI 落地正在从采购软件,变成让工程师直接进入企业改造流程?
  6. 人人都能搭 Agent 后,企业如何追踪那些不在公司网络内的“非人类员工”?
  7. 当 Agent 用合法权限误删数据,安全团队为什么也必须按“已被入侵”来设计系统?
1. 模型和算力会趋同,企业数据才是最后的护城河

被问到 Google 为何竞购 Spirit Airlines 的数据、未来是否会出现更多破产企业数据收购时,Ehrlich 先把交易的重点掰正了:Google 花 1000 万美元买的不是飞机,而是这家破产航空公司的数据。围绕这份数据,市场上不止一个 AI 公司出价;他还说,科技公司 CEO 现在经常被问同一个问题:愿不愿意卖数据。甚至有实验室正在华尔街寻找对冲基金数据,试图借此分析公司、绘制公司之间的关系。

"The most valuable thing that you have is actually your data."(你拥有的最有价值的东西,其实就是你的数据。)

为什么一份航空公司数据能比飞机更吸引人?因为训练或改进 Agent,难处不只是拿到一堆文本,而是拿到足够接近真实世界的组织运行痕迹:客户服务、内部文档、层级关系、部门协作、日常决策。公开数据集不少,真正像现实企业一样杂乱、具体、带业务后果的数据却很少。模型可以换供应商,算力可以租,很多公司也能接入同一批开源或闭源模型;但一家企业二十年积累下来的交易、服务、运营和客户历史,不会自动复制到竞争对手手里。

这意味着,AI 竞争会从“谁采购了更强的模型”,转向“谁能独占、治理并激活专有数据”。不过,数据变贵不等于可以直接打包出售或拿去训练。数据里可能有 PII,也就是可识别个人身份的信息,还可能混有财务记录和敏感业务内容。数据是金矿,但金矿里也埋着雷。

2. AI 的数据瓶颈不是采集,而是解锁已有的沉睡数据

被问到 Eon 正在为企业 AI 应用构建什么工具时,Stein 讲的不是“再建一个数据湖”,而是先找回企业已经拥有、却碰不到的数据。Eon 要跨多个 hyperscaler,也就是 AWS、Azure、GCP 这类超大规模云平台,去映射和分类数据:企业到底有什么数据,放在哪里,哪些敏感,哪些可以使用。然后,它把结构化数据和非结构化数据从不同来源接进同一层基础设施,供企业保护、恢复、查询、搜索,并在上面运行 AI 模型和 LLM。

"Customers today already have this data. It's kept in their environment in different forms but it's locked."(今天的客户其实已经拥有这些数据。它们以不同形式存放在其环境里,但被锁住了。)

“锁住”不一定是技术上没有读取权限。更常见的情况是:某个业务负责人知道系统在跑,却不知道里面有哪些数据;某台服务器连着电源,没人敢关,因为谁也说不清它承载了什么生产任务;数据团队即使找到数据,也得协调工程师、生产稳定性、安全、合规和权限审批。数据团队的任务是把数据拿出来做 AI,业务负责人背的责任却是系统别停、敏感信息别泄露、CEO 的薪酬别被误送进训练流程。双方的激励天然不同。

这意味着,企业接下来的重点未必是继续囤新数据,而是建立一层可发现、可分类、可授权的数据访问层。它要让数据团队能用数据,也要让原本负责业务系统的人知道:哪些内容被取走、为何被取走、是否留有审计记录,而且不必为了抽数把生产系统拆开重装。

3. 单用途 ETL 会被淘汰,带上下文的数据层才支持智能提问

被问到过去十年建立的数据工程和 ETL 基础设施,有多少还能在 Agent 时代存活时,Ehrlich 没有说旧工具毫无用处。他提到 DBT、Monte Carlo 等工具过去都做得很好。问题在于,它们大多服务于预先定义的任务。ETL 是“抽取、转换、加载”的缩写:把一套系统的数据取出来,按既定规则加工,再送进另一个系统。它像一条为固定菜品设计的后厨流水线,效率很高,但菜单先得写好。

他举了买咖啡的例子:Gonen 下楼刷信用卡,交易写入某个数据库;之后有人把它抽取出去处理,另一个人又在别处处理另一份数据。每一步都可能正确,但各步骤之间没有完整连接,也没有人保留“这笔交易前后发生了什么”的上下文。"You could only do with the data things you really intended to do to begin with."(过去,你只能用数据去做那些一开始就预先设想好的事。)

Agent 改变了提问方式。企业不再只问“上周销售额是多少”,还可能让系统跨客服、交易、文档和历史记录寻找此前没人想过的关联。嘉宾用两个名单打比方:一个人有纽约爱吃汉堡的人,另一个人有纽约爱吃披萨的人;过去两人不协作,就没人能问出“谁两样都爱吃”。现在,数据量还在被 Agent 推高,其中既有价值,也有噪声。

这意味着,未来的数据层要保留跨地点、跨时间、跨业务的数据上下文,而不只是铺更多管道。但“更多数据”也会带来存储、访问和 token 成本。企业不能只追求 token 最大化,而要算清每一次检索、每一次模型调用,究竟换回了什么业务结果。

4. AI 落地不再是软件部署,而是一场被紧急压缩的企业改造

被问到他们经历过的云迁移,与当下 AI 基础设施变革相比有什么不同时,Stein 先回到自己的履历:CloudEndure 曾帮助大企业把数千、数万,甚至数十万台服务器迁移到 AWS、Azure 和 GCP;被 AWS 收购后,其能力进入 Application Migration Service。这类迁移从来不只是技术活。要改系统、迁数据、排依赖,还要让一群人接受新的运维方式,因此常常需要大量技术投入和人力协调。

AI 的不同,在于企业没有耐心按原节奏走。传统大型企业的改造流程可能拖一年、两年甚至更久,但 CEO、董事会和股东都在追问 AI,企业既想从中获利,也担心不采用就落后。"You come into a large legacy enterprise, they really want to adopt AI because they have to."(你走进一家大型传统企业,会发现它们真的想采用 AI,因为它们不得不这样做。)

于是,过去更像 Palantir 服务模式的 forward deployed engineers 开始普及。这个词可以直译为“前线驻场工程师”:工程师不只远程卖软件,而是带着产品进入客户现场,理解旧系统、改造流程、把工具接进真实业务。嘉宾观察到,这种模式能压缩销售和部署周期;另一头,产品驱动增长也让团队能先自行试用基础设施和 Agent 工具,再扩展到更大的组织。

这意味着,AI 公司比拼的不只是功能表,还要比交付能力:能否让多年期的企业改造变成可推进的短周期项目。但速度会反过来制造阻力。只要企业担心系统损坏、数据泄露或 IP 外流,原本催得最急的部署就可能被按下暂停键。

5. 人人都能造 Agent,也让企业责任链几乎无法追踪

被问到 Agent 会怎样改变以人为中心构建的企业数据栈时,Ehrlich 给出的判断很直接:编码 Agent 已经开始编写世界上运行的大部分代码,而一个 Agent 还会调用另一个 Agent。原先企业安全模型的基本单位是人:某位员工、某台受管设备、某个公司网络、某组权限。现在,一个市场人员、财务人员或法务人员,也可能用 Lovable 这类工具做出应用,把公司数据放进去,再让自己的 Agent 调用外部 Agent。

麻烦不只是“非技术人员写了代码”。更难的是,这些新行动者可能不在企业网络内,不受既有 IT 流程约束,却仍在处理企业敏感数据。创建者甚至未必知道自己的 Agent 还连接了哪些工具、把什么信息发给了谁。原本能靠组织架构追责的链条,变成了人调用 Agent、Agent 调用 Agent、Agent 再连外部服务的网状结构。嘉宾认为,追踪这些非人类身份及其责任链,正在接近一项几乎不可能完成的任务。

这意味着,安全边界需要从“谁是员工、设备是否在网内”,转向持续记录所有人类与非人类行动者的数据行为、权限继承和调用关系。这里存在一个无法轻松化解的张力:禁止员工搭建 Agent,确实能少一些失控入口,但也等于关掉了许多业务人员自行解决问题的能力;完全放开,则会让 IT 和安全负责人连组织里到底多了哪些“数字员工”都说不清。

6. Agent 有合法权限也要按入侵处理,恢复能力比准入更关键

被问到企业应如何理解 AI 安全、CISO 也就是首席信息安全官应如何应对 Agent 风险时,Stein 讲了一个在 AWS 时遇到的案例。一家大型客户遭受勒索软件攻击,原本以为自己受灾难恢复服务保护,后来发现并非如此。原因不是完全没有备份,而是资源没有被正确映射、分类和打标签,最终有 60% 的环境暴露在攻击之下。这个教训促使他们在 Eon 里强调异常模式、熵变化检测,以及细粒度、快速恢复。

熵变化可以粗略理解为:数据突然呈现出异常的无序状态。勒索软件批量加密文件时,文件内容会显著改变;删除、污染或大规模改写数据时,也会留下不符合正常业务节奏的模式。过去,人们主要防范黑客盗用身份或员工误操作。现在,Agent 可能拿着完全合法的数据库权限工作,却在极短时间内删除一张表。身份是真的,权限也是真的,结果仍然是事故。

"We need to assume breach whether it's malicious or not and need to be able to handle it and act accordingly."(无论它是否恶意,我们都必须假设已经发生入侵,并具备相应的处理和应对能力。)

这意味着,CISO 的重心不能只放在准入前的审批:谁被授了什么权限。还必须假设合法身份同样会造成破坏,持续检测异常,保留可恢复副本,并能把恢复精确到受影响的对象。针对人类攻击者的检测和恢复方法仍可沿用,但 Agent 把事故速度推到极端加速:人类可能花几小时犯错,自动化系统可能在几分钟内把错误扩散完。

把这 7 条放在一起看

“模型和算力会趋同,企业数据才是最后的护城河”和“Agent 有合法权限也要按入侵处理,恢复能力比准入更关键”,表面上一个讲增长,一个讲安全,实际上指向同一件事:企业历史数据正在从备份成本、孤岛资产,变成核心生产资料。

这也解释了为什么 Google 会为 Spirit Airlines 的数据出价,为什么企业 AI 团队却常常发现数据“就在公司里但拿不到”,以及为什么单用途 ETL 不够用了。企业想激活数据,必须知道数据在哪里、意味着什么、能给谁用、与哪些业务记录相连。否则,模型接上的只是碎片;Agent 自动化的只是混乱。

但激活不是把所有数据倒进模型。第 2 条说的是先映射、分类、授权,解决“数据被锁住”;第 5 条说的是 Agent 让行动者数量暴涨,解决“到底是谁在碰数据”;第 6 条则要求系统承认一个不舒服的事实:即便权限合法,事故也会发生。因此,数据基础设施不再只是存储和搬运,而要同时承担理解上下文、控制访问、记录行为和快速恢复的职责。

放到读者自己的处境里,最该问的不是“公司有没有上最新模型”,而是更具体的几件事:关键数据到底散在哪些系统里?哪些数据可用于 AI,哪些绝不能离开原环境?谁能调用它,调用后的链条能否追到?如果一个 Agent 在合法权限下删错了东西,团队多久能发现,又能恢复到多细?这些问题答不清,数据再多也只是堆在货架上的库存;答清了,数据才可能真正变成企业能使用、也能守住的资产。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02