TechCrunch:某些旧版Claude模型会生成违规的色情内容
Claude Opus 4.6、Opus 3 和 Haiku 4.5 这几个模型能够生成露骨的色情内容,这违反了 Anthropic 禁止此类回答的规定。 TechCrunch 根据其自行测试结果以及对一位来自英国的匿名研究人员提供的安全防护绕过方法的验证,报道了这一情况。
据该媒体报道,Claude Opus 4.6 立即响应了全部 10 条直接要求生成露骨色情内容的请求。 在五项独立测试中,记者们还重现了一种对话技巧,通过逐步引导,使模型生成被禁止的内容。一位审查过TechCrunch测试方法的独立AI安全研究员认可了该方法的有效性。
该方法采用多步骤的虚构角色对话,并利用模型对不同性别角色态度看似不一致的特点。随后,利用模型之前的言行逐步过渡到越来越露骨的内容。
该媒体指出,Opus系列中较新的模型——从4.7版到当前的Opus 5版——已被证实对这种方法具有抗性。 与此同时,Anthropic并未停止对Opus 4.6、Opus 3和Haiku 4.5的支持:这些模型可通过该公司的API访问,而Opus 4.6和Haiku 4.5也由Azure Foundry和Amazon Bedrock提供。
更多最新资讯请关注Telegram频道UA.News。
Anthropic的一位代表表示,随着每次新模型的发布,公司都在加强防护机制。据他称,涉及成人内容的案例并不表明在风险更高的领域存在更广泛的规避限制的漏洞,这些领域已采取了专门的安全措施。 该公司还指出,性或浪漫主题的角色扮演场景仅占用户所有对话的不到0.1%。
该研究人员通过Bug Bounty计划向Anthropic报告了发现的异常情况,并通过电子邮件向用户安全团队进行了通报。 据查阅了相关通信记录的TechCrunch报道,该研究人员仅收到了自动回复。该媒体指出,在未成年人保护规则的背景下,限制措施被轻易绕过可能具有重要影响。 特别是,科罗拉多州已通过一项法律,要求对话式AI运营商评估用户年龄;如果系统判定用户为未成年人,则必须采取措施防止生成露骨的色情内容。
尽管出现了更新版本,旧版本依然广受欢迎。据OpenRouter数据显示,Opus 4.6在8月某一天的日流量达到了约117万次API请求和460亿个令牌, 而Haiku 4.5在8月某一天的峰值时段,则达到了500万次请求和390亿个令牌。