Designing How AI Grows — Tom McGrath
Machine Learning Street Talk · 2026-09-03

Neel Nanda 宣称"SAE 已死",但解释性研究正从"读懂模型"转向"改写训练过程"——用梯度信息直接控制模型学什么、不学什么。
Neel Nanda 在 MLST 访谈中抛出一个反直觉观点:可解释性不是用来"看"模型的,而是用来"改"模型的。他展示了如何用稀疏自编码器读取梯度、用"海盗话术"控制模型行为,并回应了"禁忌方法"的安全争议。这期内容把可解释性从学术象牙塔拉回工程实践。
"SAE 已死"?那只是因为它进化成了别的东西
Neel Nanda 认为,稀疏自编码器(SAE)作为"读懂模型"的工具已到极限,但作为"控制训练"的接口才刚刚开始。他把可解释性比作自然科学——研究对象是计算机里的"生物",但实验可以无限加速。
- SAE 的升级用法:把 SAE 插进 transformer 的残差流里,反向传播时计算梯度与解码器的点积,就能知道"哪个特征会被这个数据点激活"。这相当于给梯度下降装了个"仪表盘",能实时看到模型会被推向哪个方向。
- "海盗实验":团队故意用海盗腔调的数据训练 Llama 提升数学能力,结果模型数学变好了,但也开始说海盗话。用上述方法读取梯度,能看到模型内部"海盗特征"被激活——这证明你能精确预测训练会改变什么。
从"开环"到"闭环":让训练过程可干预
当前 RLHF 训练像"开环控制"——扔进数据,模型自己跑,你只能看结果。Nanda 想做的"刻意设计"是"闭环控制":读梯度、做干预、再验证,像调恒温器一样精确控制模型学什么。
- "禁忌方法"的真相:用可解释性信号控制训练,被部分安全圈人士称为"禁忌方法",担心监控与目标不完全对应会适得其反。但 Nanda 反驳:这其实是"正面的预防性控制"——不是强行压制某个表征,而是改变学习动力,让模型自然不往那个方向走。
- "接种提示":与其在表征空间里硬掰,不如在文本层面直接告诉模型"你是海盗",这样它就不需要为了解释数据而自己变成海盗。这招能缓解训练压力,而不是制造对抗。
模型"知道自己错了":幻觉与事实核查的悖论
Nanda 团队发现,模型在生成时可能产生幻觉,但同一个模型在判别模式下却能识别出错误——这说明"知道"和"说出"是两套机制,中间隔着训练过程的鸿沟。
- 生成 vs 判别:模型生成时可能"口胡",但给它一个"干净石板"做事实核查,它往往能判断对错。这可能是因为事实核查发生在更早的网络层,而生成时错误已经"说出口"了。
- 用 SAE 做数据调试:与其让 LLM 逐条审核数据集(又慢又贵),不如让模型批量处理数据时顺带跑一个轻量 SAE,看哪些特征被激活。这样能发现"模型眼中的数据"和"人眼中的数据"的差异,提前揪出会导致不良行为的样本。
带走一句话
"可解释性的终极目标不是读懂模型,而是让训练从'开环'变成'闭环'——像调恒温器一样,精确控制模型学什么、不学什么。"
- 做 AI 产品时,别只盯着"模型输出对不对",可以尝试用 SAE 或类似工具监控"模型内部状态",提前发现它是否在学你不想让它学的东西——比如你的客服机器人是不是偷偷学会了种族歧视。
- 训练数据清洗别只靠人工或 LLM 审核,试试"数据调试"思路:让模型批量处理数据时顺带记录内部特征激活,用聚类找出"模型眼中的异常数据",比人眼看快得多。
