The Key Thing Human Brains Have That AI Is Trying To Learn
Y Combinator · 2026-07-18

人类学下棋只需看几局,AI 却要学几万盘。顶尖研究者认为,缩小这个差距最靠谱的路径是"世界模型"——让 AI 像我们一样,先在脑子里"想象"再行动。
样本效率:AI 和人类最大的差距
- 样本效率是 AI 当前最头疼的问题之一:人类学一个新游戏或新技能,往往试几次就会了;而最先进的 AI 模型,学同样的事通常需要几万条数据。
- 研究者把智能分成两个维度:每瓦特智能(算力效率)和每样本智能(数据效率)。后者说的是:多给你一条训练数据,你能变聪明多少?
- 人类在样本效率上碾压 AI 的典型例子是RKGI 测试题——大多数成年人想一想就能解,但当今最前沿的 AI 系统基本做不出来。原因不是 AI 读的数据少,而是它不会像人一样"举一反三"。
完美世界模型:一个反直觉的例子
- 最极端的样本效率是零样本——听起来荒谬,但人类早就做到了。例子是牛顿力学:NASA 发射火箭去拦截小行星,提前几年算好轨迹,火箭自己飞过去就行,不需要从环境里收集任何新样本。
- 这靠的是模型预测控制:用完美的物理世界模型(F=ma),在数学上算出最优路径,然后执行。如果 NASA 得先发射一百万次火箭才能学会怎么登月,阿波罗计划根本不可能成功。
- 人类大脑里也内置了这种能力:1967 年一项经典研究发现,三组人练篮球上篮——实际练习的那组一小时进步 24%,蒙眼想象上篮的那组进步了 23%。这说明我们的大脑已经有一个极其强大的"世界模型",能靠想象来训练自己。
从控制论到强化学习:当世界变得不可预测
- 一个简单的控制问题:让无人机降落在平台上。已知无人机质量、重力、推力,用牛顿力学写出状态转移函数(世界模型),然后用凸优化求解——一步到位,不需要任何学习。
- 但一旦加入对手(比如另一架无人机来撞你),问题就变成随机、非可微的——你不知道对方下一步会干什么,没法用数学求导。这时就掉进了强化学习的坑:需要大量采样、估计价值函数、训练策略。
- 强化学习的核心就是在非可微、随机环境下,通过反复试错来学习最优策略。世界模型的作用,是把状态、动作、奖励联合建模,让策略更聪明。
为什么 AlphaGo 能赢,但没法直接用到现实世界
- 围棋的状态空间是 19×19 的棋盘,每个位置可以是黑、白、空,状态数约 3^361(比宇宙原子数还多)。但它的动作空间只有 361(下在哪),相对可控。
- AlphaGo 的做法:用深度神经网络同时输出落子概率和局面价值,然后用蒙特卡洛树搜索做测试时规划——每走一步,要模拟 800 次、每次展开约 30 步,总共调用模型约 24,000 次,才能选出一个动作。
- 这个方法的三个致命限制:1)动作空间必须很小(围棋 361 已经到极限);2)环境必须确定且不变(规则不会变);3)不能实时——AlphaGo 每步要思考 60 秒,这在开车时所有人都死了。
- 如果围棋棋盘变成 1000×1000,动作空间就是 100 万,同样的方法需要6000 万次模型调用才能走一步——完全不可行。
自动驾驶和机器人:世界模型才是出路
- 自动驾驶的状态空间是无穷大(路况、天气、行人、其他车……),但通过卷积神经网络压缩到隐空间,问题可控。真正的难点在动作空间:方向盘 360 度 × 刹车/油门各 10 级 = 36,000 个动作,比围棋大 100 倍。
- 更糟的是,大多数公司没有"动作标签"——只有特斯拉有海量的方向盘、刹车、油门数据(来自自家车队),其他人只能从 YouTube 视频里学,但视频里只有画面,没有"当时司机做了什么操作"。
- 模型无关 RL(如行为克隆)就是直接从状态预测动作,不需要世界模型。这类似 LLM 的"下一个 token 预测",简单但天花板低。
- 模型基 RL 则多了一个世界模型(预测下一个状态),能进行测试时规划,策略更强,但推理更慢。研究者认为,这才是通往 AGI 的路——人类大脑的进化史就是一部"世界模型"升级史:1000 万年前的"大脑皮层大扩张",让我们的祖先从蜥蜴脑进化出能模拟未来的新皮层,这才是我们比蚂蚁聪明一万倍的原因。
带走一句话
"完美的样本效率是零样本——听起来荒谬,但牛顿力学就是:你不需要发射一百万次火箭才知道怎么登月。"
- 做 AI 产品的,别只盯着模型参数和训练数据量:样本效率才是真正的瓶颈。谁能用更少的数据学会新任务,谁就能在数据稀缺的垂直领域(医疗、法律、制造)建立壁垒。
- 世界模型是"少样本学习"的关键:如果你在做机器人或自动驾驶,别只做行为克隆(从状态到动作的直接映射),加上一个能预测"如果我这么做,世界会怎样"的模型,能大幅提升泛化能力。
- 测试时规划的成本是硬约束:AlphaGo 式的蒙特卡洛树搜索在动作空间小、环境确定时有效,但到了现实世界(大动作空间、随机环境、实时要求),必须找到更高效的规划方法——比如在隐空间里做规划,或者用扩散模型一次性生成多条轨迹。这是当前最活跃的研究方向之一。
