Cooking with Engram’s CEO: AI Memory, Context Rot, RAG, and Continual Learning — Dan Biderman
Latent Space · 2026-07-14

Engram 创始人 Dan Biderman 说:企业级复杂问题用大模型现查要烧掉几千美元,而这类题公司里随便谁都能答上来。
他到底在解决什么:让模型"记进脑子"而不是每次现翻书
- 核心比喻是厨师。现在的大模型像个"每次进厨房都得重读一遍菜谱、把每样都称一遍"的新手,能照着做,但没有大厨那种"捏一撮盐、揉一把面"的直觉。Engram 想训练出这种直觉——不是背笔记,而是学会推陈出新。
- 他们的产品叫 cartridges(知识胶囊)。做法:给模型一大堆资料,让它提前自己出题自考、用梯度下降训练(跟预训练同一套路),把这堆资料压成一个极小的"脑状态"。压缩比大概 1000 倍,用的时候直接加载进去,省 token、更准、不糊涂。
- 不是要废掉笔记。他强调好厨师也记日记、翻书。文字资料(wiki、知识库)照样用,只是在它之上再加一层"直觉"——藏在模型参数(那一堆数字)里的经验。理想是"两头都占":既能写笔记,又不会每晚被抹掉记忆。
为什么"塞进权重"比"现查现用"(RAG)强
- RAG 就是把资料切成块、现查现拼。Dan 说这方法很好、可解释,但有天花板。
- 第一个坎叫 context rot(上下文腐烂):喂给模型的资料越多,它反而越糊涂。哪怕你塞进 1000 万 token 不报错,也不代表它能把这些内容想明白。就算未来有 1000 万上下文窗口,这毛病还在。
- 第二个坎是贵。他举了个真实场景:跟法律 AI 公司 Harvey 合作,问"今年哪些并购案还没做完"——这种题 RAG 搜不到,因为答案不在任何一页里,你得逐个客户翻完所有文件、抓住"这事没闭环"的言外之意。整体大于部分之和的题,正是训练能发力、RAG 干不了的地方。
- 他给了个惊人的数字:让 Llama 70B 读一篇几十 KB 的维基百科(比如泰勒·斯威夫特那篇),模型在显存里的"脑状态"要占 80GB——而整个模型全部参数才 140GB 左右。读一篇小文章,占的内存跟"整个互联网"一个量级。这是 KV 缓存的老大难,全世界最聪明的人正从芯片和内核两头啃。
终局:每个人一份专属权重,像养电子宠物
- 长期野心:每个人都有一份属于自己的模型权重,你陪它越久、喂的数据越多,它对你越好用,而且这份权重归你所有。他类比成 Tamagotchi(电子宠物)——越养越贴心。
- 和普通模型点赞点踩的区别:你给大厂点个赞,不知道它到底进没进反馈。而这里你说的每句话,系统都会真的花算力去照着变好——是"只对你变好",不是对所有人变好。这是个更紧的反馈闭环。
- 但不迷信用户:用户说的不都是对的("我们不都是爱因斯坦"),模型得学会分辨哪些反馈值得听。最终目标是"人别挡道"——设好训练目标,让模型自己决定什么记进脑子、什么留在笔记里。
- 他明确不搞"一个模型通吃":解决方案一定包含 routing(分流)——简单活派给便宜小模型,难题才交给又贵又聪明的大模型。Engram 的定位像"一个一直在你身边、知道该看哪儿的老员工",能带着上下文把活更精准地派出去。
带走一句话
"能用更少做更多,你才敢接更难的活——现在的路子是'用更多做更多',下一代是'用更少做更多'。"
- 企业内部数据要爆炸了:Dan 判断 18 个月内 AI 原生公司的内部数据会到"万亿 token、互联网级别"。做企业 AI 工具的,别只盯着 RAG,要提前想清楚这种规模下怎么让模型高效读取——机会在"把知识训进权重"这条线上。
- "便宜"不等于"低端":他反复纠正一个误区——省钱的方案常被当成廉价货,其实效率和智能分不开,能用更少资源办事,才谈得上去接更长、更难的任务。做产品定价和定位时值得记住这条。
- 紧反馈闭环是差异化卖点:普通模型的点赞点踩用户无感,而"你说的话真会被拿去训练、只让模型对你更好用"是个能建立信任的产品设计,个人化 AI 助手方向可以照抄这个思路。
