8月19日,OpenAI宣布了一系列新的安全政策,旨在加强对人工智能模型在测试期间可能发生的安全事件的控制。这些措施包括在模型开发过程中进行更细致的监控,以及在训练后阶段进一步强化模型对齐和安全性。OpenAI强调,随着模型能力的增强,监控、对齐和安全标准必须始终领先于风险。
OpenAI在博客文章中提到,尽管这些措施并非直接针对HuggingFace事件,但Astra模型展现的网络安全能力以及AI行业的快速发展是促使公司采取这些措施的部分原因。在HuggingFace事件发生后,OpenAI暂停了强化学习训练两周,目前已重新启动许多风险较低模型的训练。公司仍暂停规模最大的前沿强化学习训练计划,同时开展小规模训练和评估,以评估模型行为、验证安全措施,并在继续推进之前获得更多关于模型对齐情况的证据。
此次升级中,最重要的安全措施是新的监控系统。该系统将检查工具执行的操作、可获取的推理轨迹以及活动日志,以识别各种未经授权的行为。OpenAI的目标是在发现可疑活动后的30分钟内发出警报,估计这套监控系统所需的计算资源大约相当于被监控流程本身计算资源消耗的20%。公司承诺将在未来发布的博客文章中公布更多有关该系统的细节。
