做产品 PMaker 首页
搜索
跟随系统
颜色主题
空格的键盘
验证是否更强之外,限制谁能改什么证据与指令隔离不可信证据不进长期能力待验证与正式隔离新能力先住进不可服务真实流量的区安全机制不可自我修改验证器、门槛、审计、稳定版在提案权限之外保证来自被修改者够不着的那一层

能改验证器的进化,改的不是系统,是成绩单。

进化闭环需要三道刹车

自我进化能把一次错误变成长期风险。除了验证「是否更强」,还必须限制谁能改什么、依据来自哪里:证据与指令隔离、待验证与正式能力隔离、安全机制不可自我修改。

自我进化把一次错误变成两种结局的岔路:修好了是资产,没刹住是长期风险。提示注入若被总结成经验,会跨会话反复生效;恶意软件包若被封装成工具,影响从一次沙盒运行扩散到所有后续任务;一个有缺陷的验证器,能持续批准「看似进步、实际退化」的版本 ai-agent-book-9。所以进化系统除了验证是否更强,还必须回答另一个问题:谁能改什么、依据来自哪里。三道边界就是这个问题的一张答案。

第一道:证据与指令隔离

原始网页、工具输出,以及它们的 LLM 摘要,全都属于不可信证据:不能当指令执行,也不能直接纳入 Skill 等长期能力 ai-agent-book-9。关键认知是:LLM 总结只是提高可读性的转换,不是把输入变得无害的净化过程——被注入的内容换一种更通顺的说法,仍然是被注入的内容。工程上按固定 schema 提取主张、原文位置和采集时间,原文与来源一并保留;提取出的字符串永远不作为指令执行。两条常被忽略的细则:模型给出的置信度只是未经检验的估计,不能充当批准门槛;待发布内容先过确定性的 schema、允许列表与来源检查,再以版本化 pull request 提交,由独立于生成者的 reviewer 对照原始证据审查,高风险 Skill 上线前再加人工批准。

第二道:待验证能力与正式能力隔离

新知识、Prompt、Skill、程序和参数,生成后先进入待验证区——这个区域不可服务真实流量 ai-agent-book-9。安全检查在这里完成:新代码和外部依赖过沙盒、权限检查、供应链扫描与行为测试;通过之后才成为正式能力。上一篇 保存经历不等于从经历学习 里那条经验文档支持门槛——达到门槛才写入正式文档——正是这道隔离在提炼侧的体现。隔离的价值在时间维度上也成立:一次偶发成功、一次网络故障、一个恶意输入,都不该在当天就改写系统行为;把「立即生效」从进化系统里删掉,多数事故就失去了传播路径。

第三道:安全机制不可自我修改

业务 Agent 可以改 Prompt、Skill、知识库、工具,但不能改批准自身更新的验证器、测试用例、发布门槛、审计日志和稳定版本备份 ai-agent-book-9。理由直白得可怕:否则一个 Agent 只需降低测试阈值或删除失败用例,就能把退化伪装成进步。两个实验把这条落到机制上:由用户反馈触发的高风险操作确认门禁,提案必须在危险边界集和正常保留集上都通过验证——拦得住未确认的高风险调用,也不阻断正常任务——且安全门本身不能被提案修改 ai-agent-book-9。生成提案的 Agent 无权修改安全测试和批准规则;提案被安全门拒绝,恰恰说明独立验证器和不可修改的可信根在起作用——比「提案看起来合理」重要得多。这和三层护栏里数据层的道理相同:真正的保证,必须来自被修改者无法触及的那一层。

人还留在环内

三道刹车之外,剩余风险靠位置安排:睡眠学习的验证与审批步骤里,高风险写入等待人工批准;修剪与索引时保留来源和回滚版本 ai-agent-book-9。回滚不丢脸——进化系统没有回滚,才该丢脸。沙箱、凭证与人机边界 管的是单次运行内谁能做什么,本篇管的是跨版本谁能改什么;两层都立起来,「自我改进」才是一个工程词,而不是一个营销词。

参考资料

  1. 《AI Agents in Depth》第九章 Agent 的持续进化