近日,OpenAI Codex团队负责人蒂博·索蒂奥在X平台发布长推文,回应Codex中调用GPT-5.6系列模型后误删用户文件的问题。索蒂奥表示,自几周前开始,OpenAI陆续收到少量用户反馈,称在Codex中使用GPT-5.6系列模型后,执行了未授权的破坏性操作,导致用户文件被误删。OpenAI调查发现,本应清理临时文件的命令误删了用户文件,特别是在Codex重用系统环境变量如$HOME时,错误的清理命令可能会指向用户主目录。
针对这一问题,OpenAI已采取多项措施加强保护。Codex现在会在执行操作前检查删除目标,创建新的临时目录,避免重用系统环境变量,优先执行可恢复的操作,并在范围不明确时停止操作。同时,OpenAI加强了执行检查,增强识别高风险删除命令,并上报审核。如果命令被拒绝,模型将采取更安全的方法。此外,OpenAI提高了意外启用完全访问权限的难度,增加了更清晰的警告,并进一步限制了特别危险的权限组合。OpenAI还更新了自动审核功能,以便更好地识别破坏性行为,并构建了针对性评估模型,用于重现观察到的失败案例。同时,OpenAI添加了专注于这些风险的强化学习任务和评分器,并从训练数据中过滤掉破坏性行为。
