Anthropic 解释了 Claude 文本中的水印将如何运作
Anthropic公司公布了在其聊天机器人Claude生成的文本中添加水印的详细信息。 据 TechCrunch 报道,该公司推出这一机制是为了遵守欧盟《人工智能法》中的《透明度守则》,该守则要求建立能够识别由人工智能生成的内容的系统。
据 Anthropic 解释,Claude 将通过在同等有效的词汇选项中进行选择,在回复中生成隐藏的模式。例如,该模型可能会选择不同的词汇来描述阴沉的天气。 对于读者而言,带有此类标记的文本与普通文本并无二致,但拥有水印解码密钥的人则能够识别出来。
该公司表示,将采用谷歌DeepMind团队于2024年提出的SynthID-Text方法,并计划发布用于检测水印的API。 Anthropic强调,该技术与那些通过搜索特征性语言结构及其他风格特征来识别AI文本的系统有所不同。
更多最新资讯请关注Telegram频道UA.News。
Anthropic评估认为,简单的编辑可能无法完全去除水印。但若对文本进行彻底重写并替换每个单词,则可将其消除。 如果Claude只是校对或对人类撰写的文本进行了微调,则能否检测到水印将取决于编辑的范围和强度。在轻微编辑的情况下,几乎所有单词仍将保留人类撰写的原貌,因此水印将难以附着。
在程序代码中,标记的可能性将更为有限,因为模型必须生成可运行的结果,且无法总是自由地在不同选项之间进行选择。 与此同时,该技术可应用于代码中的任意元素(包括注释),且对代码本身的影响微乎其微。Anthropic还指出,其他签署了同一行为准则的大型模型开发商也将实施各自的水印机制。