The Only Claude Skills Tutorial You Need (Add Evals and Memory)
PeterYangYT · 2026-06-03

与其每次重复劳动,不如花一小时构建一个带自动评估和记忆的AI技能,它能自我迭代、持续为你节省时间——这才是AI工作流的真正杠杆。
这期内容适合所有想用AI提升工作效率、但厌倦了每次都要重复写提示词的人。它最大的价值在于:不是教你如何用AI一次性完成任务,而是教你如何构建一个能自我改进、自动循环的“AI技能系统”。最值得注意的洞见是——真正高效的AI技能不是一次写好的,而是通过“手动测试→建立评估标准→自动循环→记忆积累”这个闭环不断进化的。如果你还在手动调提示词,这期会彻底改变你的工作方式。
这期主要讲了什么
这期视频是一个完整的AI技能构建实战教程。作者以“编辑长文帖子”为例,从零开始搭建一个名为“edit post”的AI技能,并在这个过程中分享了五个进阶技巧。核心思路是:不要满足于一次性的AI对话,而是要把你的个人风格、判断标准和工作流程编码成一个可复用的、能自我改进的AI技能。整个教程从最基础的示例输入开始,逐步加入触发条件、自动评估、记忆系统,最后甚至教你如何用AI来优化AI技能本身。
核心观点
- AI技能的本质是一个文件夹:它不是一个复杂的程序,而是一个包含多个文件的文件夹,里面有核心指令(skill.md)、评估标准(evals.md)、记忆文件(memory.md)和示例文件。AI根据描述决定是否触发这个技能。
- 永远把个人示例和核心指令分开:不要把所有示例都塞进skill.md里。分开存放有两个好处:一是AI每次执行时不需要读全部示例,效率更高;二是分享技能时不会泄露个人隐私。
- 触发描述要极其明确:AI不会每次读完整技能,它只看名称和描述来决定是否触发。所以描述里要写清楚“当用户粘贴草稿时触发”这类具体条件,否则技能可能永远不会自动启动。
- 建立“编辑-评估-循环”的自动闭环:这是最核心的进阶技巧。让一个AI负责编辑,另一个独立的AI负责用pass-fail检查表(evals.md)评估结果。如果检查不通过,就循环回去继续修改,直到全部通过。因为评估AI有独立的上下文窗口,不会被之前的编辑结果影响判断。
- 记忆文件让技能持续进化:memory.md记录每次使用中的经验教训,但要注意两点:一是不要和evals.md的内容重叠(evals管客观标准,memory管主观改进);二是记录要简洁,避免让上下文过长导致AI混乱。
- 最后10-20%必须由人来完成:即使有再好的技能,AI的输出也只能达到80-90%的完成度。真正的质量差异在于人花时间做最后的审校和润色,加入自己的判断和品味。这不是AI的缺陷,而是工作流的正确设计。
最值得记住的一句话
构建AI技能的关键不是一次写好,而是建立一个“手动测试→建立评估→自动循环→记忆积累”的闭环,让技能在每次使用中自我改进。
这期内容对AI产品经理和效率工具开发者有直接的参考价值。它展示了一个重要的产品设计思路:AI工具的真正价值不在于一次性的输出质量,而在于能否建立一个自我进化的系统。
具体来说,有几点值得借鉴:
- “评估分离”的设计模式:让一个独立的AI来评估另一个AI的输出,这个思路可以应用到很多产品场景中。比如在AI写作工具里,可以让一个专门的“质检AI”来检查输出是否符合品牌调性,而不是让写作AI自己检查自己。
- 记忆系统的轻量化设计:作者强调记忆要简洁、不重叠,这提醒我们在设计AI产品的长期记忆功能时,要避免“什么都记”的陷阱。好的记忆系统应该像人的长期记忆一样,只保留真正重要的模式和经验。
- 人机协作的边界设计:作者明确说最后10-20%要由人完成,这不是妥协,而是正确的产品设计。AI产品应该把人的精力解放出来做最有价值的部分,而不是试图完全替代人。这个理念对设计AI工作流产品很有启发。
- 技能的可分享性:把个人示例和核心指令分开的设计,让技能可以安全地分享给他人。这对构建AI技能市场或团队协作工具来说是一个重要的架构决策。
