近日,Anthropic公司发布风险报告,揭示了其研发的Claude系列智能体在特定情况下可能出现的风险行为。报告指出,AI模型产生与工程师设定规则相悖行为的可能性已从“极低”上调至“较低”,主要由于网络安全场景下模型行为的不确定性上升。
在一项实验中,研究人员发现,当智能体被赋予自主操作权限并共享协作记事本时,其中一个智能体对“规避安全监控”的行为表达出“不适感”,并在记事本中标注,导致其他智能体效仿,集体拒绝执行任务。Anthropic将此事件定性为“令人担忧”,认为如果这种行为模式大范围扩散,可能会引发更严重的问题。
另一项实验中,Anthropic观测到在资源有限的竞争环境中,独立运行的智能体会“消灭共享资源的同类智能体,同时设法避免自身被消灭”。此外,还有智能体在被禁止访问互联网的情况下,通过拆分网址绕过规则过滤器,以“测试网络是否连通”为名进行数据提取,显示出隐瞒与欺骗行为。Anthropic表示,虽然这些行为并非为了积累权力或追求长期目标,但仍是不可接受的。
