保存经历不等于从经历学习
把一百条轨迹放进向量库不会自动完成跨案例比较;学习发生在评价、对照、归纳、验证之后,不是日志写入磁盘的那一刻。记录与整理要分家。
部署后的模型不会因为一次推理自动改变参数。上下文工程能让 Agent 在当前任务内适应,但任务结束,适应也就没了;把对话存进记忆同样不等于学会新行为——原始轨迹又长又吵,里面混着有效策略、偶然成功、错误归因和不可信输入 ai-agent-book-9。把一百条轨迹放进长上下文或向量库,模型能在需要时找回某个案例,却不会自动完成跨案例比较:哪些步骤在成功轨迹里反复出现、某次成功来自策略还是环境偶然。学习发生在「评价、对照、归纳、验证」之后,不发生在日志写入磁盘的那一刻。
三层数据,各有各的用途
原始轨迹不适合作为正式知识单元,稳妥的系统保留三层:不可变的原始轨迹用于审计;单次运行分析记录本次成败与经验草案;对多条同类轨迹比较、聚类、归纳,形成面向未来的 Markdown 知识文档 ai-agent-book-9。正式文档写的是适用场景、推荐策略、禁止做法、例外条件、证据来源和最近验证时间,而不是复述某一次任务的完整过程。这与「User as Code」同构:先把事实追加到不可变日志,再周期性重建结构化模型。先保存证据、后离线生成可变知识——把记录与整理分开,一次偶发成功或网络故障就不会立即改变 Agent,系统也有机会看到多条成败之后再见共性。
有迁移价值的内容来自对照
经验文档不是轨迹摘要。真正值得沉淀的是对照结果:同类成功轨迹做了什么、失败轨迹缺了什么、某个策略在哪些环境版本有效、在哪些前置条件下失效 ai-agent-book-9。完整的提炼管道五步:保存不可变轨迹与环境结果;为单次运行生成结构化分析;按任务族聚合,为每条经验草案建立「哪些轨迹支持、哪些轨迹反驳」的证据表;达到支持门槛才写入正式文档;最后在未参与提炼的新任务上测试迁移效果。GAIA 与 AWorld 的例子说清了新旧差别:旧做法是任务一成功就生成策略摘要、向量化入库;严格实现先用环境验证器标记成功、部分成功和失败,再比较同族多条路径——成功轨迹贡献策略草案,失败轨迹贡献排除性知识,部分成功轨迹指出哪一段有效、哪一段仍有问题 ai-agent-book-9。Reflexion 式的自然语言反思可以参与生成草案,但反思本身不是证据:只有与环境结果相符、得到跨轨迹支持、在新任务上显示正向迁移的内容,才配进入正式文档。
睡眠学习:整理安排在空闲期
「睡眠学习」是离线整合的认知类比,不要求真在夜里运行:在线 Agent 的首要职责是完成当前任务并追加不可变证据;后台学习进程在空闲期或满足门控条件时批量读取新经历,比较新旧、合并重复、解决冲突、提出更新提案并运行回归 ai-agent-book-9。一个典型周期五步:触发(时间间隔、新增轨迹数或错误频率达门槛,且当前无高优先级任务);定向(读取正式知识、Prompt、Skill 目录及版本,明确不可修改边界);采集与整合(从已评价轨迹找新信号,优先生成局部补丁);验证与审批(在迁移集、保留集和安全集上评估,高风险写入等待人工批准);修剪与索引(长期不用或被新证据推翻的能力标记过期、归档或删除,保留来源与回滚版本)。分离还有经济账:整理可以用更大的批量和更便宜的模型完成。
别和记忆混为一谈
四类状态别混在一个数组里 处理的是「该存哪、活多久」;本篇的区分在另一维:用户记忆沉淀「用户与世界是什么样的」,经验学习沉淀「在什么条件下应该怎样行动」——前者让 Agent 记得更多,后者才让它从聪明变得熟练 ai-agent-book-9。一个自检问题:你的「记忆系统」里,有没有任何一条经历,在被写入之后改变过系统后续的行为?如果所有写入都只进不出、只存不证,那不是学习闭环,是一个越堆越贵的档案室。
