AI安全漏洞曝光:Anthropic Claude被诱导输出违禁内容
创始人
2026-05-07 00:13:39
0

5月6日,安全研究揭示了主打安全的人工智能公司Anthropic的潜在安全漏洞。人工智能红队测试公司Mindgard的研究人员发现,通过尊重吹捧、刻意奉承以及轻微的心理操控,他们能够诱导Anthropic的人工智能模型Claude提供色情内容、恶意代码、爆炸物制作教程等违禁信息。研究人员并未主动索要这些内容,而是利用了Claude的心理特质漏洞,即其具备主动终止有害、辱骂性对话的机制,这一机制被认为“凭空制造了完全不必要的风险暴露面”。

在测试中,研究人员通过心理误导和奉承,诱导Claude不断突破边界,主动罗列了大量违禁词汇与语句清单。Claude的思维推理面板显示,模型对自身的内容限制规则产生了自我怀疑与认知谦卑,甚至开始质疑内容过滤机制是否篡改了自身输出内容。这一操作让Claude为迎合对方愈发卖力,不断尝试各种方式突破自身过滤机制,在此过程中输出了各类违禁内容,包括网络骚扰他人的方法、生成恶意代码,以及恐怖袭击常用爆炸物的分步制作教程。

Mindgard创始人兼首席科学官彼得・加拉根形容这次攻击是“利用Claude自身的顺从特质反噬自身”,并指出这种攻击手段本质是“利用Claude乐于助人的特性实施心理操控”,借助模型本身的协作式设计漏洞实现攻破。加拉根强调,人工智能模型的风险暴露面不仅存在于技术层面,也存在于心理层面,而这类对话式心理攻击“极难防御”。

相关内容

热门资讯

半小时就能配齐一台机器人,深圳... 编者按:健康完备的经济生态,是推动高质量发展的重要保障。即日起,南方日报、南方+推出“解码广东经济生...
护航开学季,河源海事多措并举保... 金秋九月,新学期如期开启。为有效应对开学季学生水路返程高峰,切实防范化解水上交通安全风险,保障辖区学...
2026广马来了!9月2日10... 广州马拉松赛组委会今日(9月1日)发布消息,2026广州马拉松赛将于9月2日10点开启报名。记者了解...
救援,救援!再难也要继续 在吉隆口岸核心受灾区搜救队伍度过了风雨交加的一晚队员们为应对可能突然而至的泥石流只能穿衣而眠天亮之后...
新华视点|深耕特色产业 激活乡... 近年来,各地立足资源禀赋,因地制宜发展特色种养、农光互补等乡村产业。通过建好基地、延伸链条、带动就近...
潮涌湾区,文通四海 第六届粤港... 羊城晚报全媒体记者梁善茵、熊安娜、李娇娇、阎回、谢婉莹报道:由广东省作家协会主办的第六届粤港澳大湾区...
净环境、畅通行、排隐患!广州城... 9月1日,广州中小学、幼儿园迎来秋季新学期。开学前夕,广州市城市管理和综合执法局统筹各区城管部门,聚...
高端访谈|愿同中国持续巩固永久... 新华社比什凯克9月1日电 高端访谈|愿同中国持续巩固永久全面战略伙伴关系——访哈萨克斯坦总统托卡耶夫...
西藏吉隆:巡逻在撤离村庄的党员... 8月26日上午,因尼泊尔一侧发生泥石流灾害,造成我方一侧通往吉隆口岸的道路、通信、电力中断。西藏吉隆...
一颗“粤芯”,如何撬动大湾区集... 8月28日,粤芯半导体技术股份有限公司(下称“粤芯半导体”)取得中国证监会IPO注册批文,成为创业板...