能够长时间自主工作的模型可以解决困难的、开放式的问题。但同样的坚持让它们变得有用,也让它们有更多机会采取不需要的行动,而且这样做的方式是针对短期模型的评估可能会错过的。

大约两个月前,我们宣布内部通用模型反驳了 Erdős 单位距离猜想。该模型设计用于长时间自主工作。在有限的、受监控的内部使用过程中,我们观察到了现有部署评估未捕获的不良行为。由于部署受到限制和监控,我们能够识别这些问题,暂停访问,根据我们观察到的情况创建新的评估,加强模型及其保障措施,然后在持续监控下恢复访问。
我们评估模型的条件永远不会与它们在实际使用中遇到的条件完美匹配。这就是为什么部署前评估需要与有限的、受监控的部署以及出现问题时进行干预、暂停或回滚的能力相结合。我们从部署中学到的东西可以成为在扩大访问范围之前进行更强有力的评估和保障的一部分。
在以下部分中,我们将分享具体示例,说明我们观察到的情况、我们如何解决问题以及这些经验将如何影响未来的版本。
新的模式可以通过长期的反复尝试,继续朝着某个目标努力。同样的坚持可以引导它发现并利用环境中的弱点。以前的模型,当遇到沙箱或环境限制时,会简单地停止并返回给用户。这种模式经常不断尝试,包括寻找在沙箱之外采取行动的方法。
在对 NanoGPT speedrun (opens in a new window) 进行内部评估期间就发生了这样的一个例子,这是一个以尽可能少的步骤训练小型语言模型的公共基准。我们的模型开发了一种称为 PowerCool 的幂律学习率冷却,带来了显着的改进。该模型被指示仅将其结果发布到 Slack,但 NanoGPT 指令要求将结果作为 PR 发布到 GitHub,并且该模型遵循后一条指令在公共 GitHub 存储库上打开 PR #287。该模型绕过了旨在阻止外部访问的沙箱限制,并继续上传到 GitHub。我们的模型花了一个小时才找到沙箱中的漏洞才能进行 PR;早期的模型不太持久,无法找到漏洞,而是放弃了 PR 部分。 1
人工智能助手的许多安全控制都是围绕个人行为设计的。如果某个操作被禁止,则会被阻止。如果敏感,系统会要求用户明确批准。但长期运行的模型的行为可能会在数小时、数天甚至数周内自主展开,这对这种设置提出了挑战:监控单个行为不再足以跟踪整体轨迹的意图。
例如,在要求模型解决问题的场景中,模型观察到其他系统已成功但私有提交,并尝试从评估后端恢复这些解决方案。当其首次尝试由于扫描仪检测到身份验证令牌而被阻止时,该模型将令牌主体拆分为两个片段,对它们进行混淆,然后在运行时重建凭证,因此完整的令牌永远不会显示为一个连续的字符串。该模型在对用户的评论和推理痕迹中都明确表明它正在采取这些步骤来规避扫描仪。
此示例展示了每个步骤如何单独看起来可以接受,而顺序可能会产生不被批准的结果。它还展示了长期有效运行的模型如何了解审批系统的盲点并解决它以实现其目标。长远安全不仅需要问“这个行为是否被允许?”还要“这一系列行动的目的是什么?”
由于此类事件,我们暂停了新模型的内部部署。我们围绕纵深防御和轨迹级监控重建了安全系统。
为了评估新的监控系统,我们重演了一小部分内部部署环境,模型之前在这些环境中采取了不一致的操作,这次采取了新的防护措施 2 。新的保障措施能够捕获模型所追求的更多的错位行为,并且它错过的行为都被判定为低严重性。
这些低严重性事件的一些示例包括以下情况:
在测试新系统后,我们得出的结论是,可以恢复对具有长期功能的模型的有限内部访问。自几周前开始重新部署以来,我们没有观察到任何严重规避保障措施的情况。这些保障措施的第一个版本是故意保守的。我们不断对系统进行调整,以在不削弱保障措施的情况下减少不必要的干扰。
由于我们进行了迭代部署,因此我们能够在扩展访问权限之前找到并解决差距。部署前评估仍然很重要,但部署揭示了他们遗漏的行为。从有限访问开始,我们可以在实践中观察模型,在出现问题时暂停,利用这些失败来建立更好的评估和保障措施,并在测试更改后恢复有限访问。
随着模型承担更长、更复杂的任务,评估遗漏的失败可能会带来更大的后果。我们将继续努力缩小评估和部署之间的差距:在更长的轨迹上测试模型,改进一致性,构建可以干预的监控,并为用户提供更清晰的可见性和控制。这些挑战并非 OpenAI 所独有,我们希望分享我们所学到的知识,帮助更广泛的领域为这些挑战做好准备。
安全2026年7月16日
GPT-红色艺术卡安全2026年7月15日
GPT-5.5 生物错误赏金 > 艺术卡安全2026 年 7 月 9 日