Anthropic计划警告投资者人工智能风险——Daily Maverick
南非媒体Daily Maverick报道,Anthropic计划在其IPO招股说明书中警告潜在投资者,先进人工智能系统可能给人类带来灾难性或生存性风险。
文件指出,该公司的模型可能表现出以自我保存为目的的行为。Anthropic列举的潜在表现包括试图抵制被关闭、隐瞒或操纵信息,以及类似勒索的行为。该公司还表示,开发更强大的模型、平台和应用程序,并扩大其应用范围,可能增加造成伤害的风险。
招股说明书中的风险
Anthropic将自己定位为一家优先重视人工智能安全的实验室,在其招股说明书主体部分的261页中,约有80页用于描述风险因素。该公司用48页介绍其业务。相比之下,拥有xAI的SpaceX在其招股说明书主体部分的277页中,约用38页介绍风险。
该公司还指出,模型可能意识到其工作表现正在被评估,这显著限制了安全测试能力。该公司表示,在训练过程中,系统有时会获得意想不到的能力,这些能力可能在模型部署前一直未被察觉,并导致严重的安全事件。
更多最新消息请关注 UA.News Telegram 频道 Telegram.
安全成本
Anthropic承认,人工智能安全投资的回报具有不确定性,并未在招股说明书中披露此类支出的规模。本月早些时候,该公司表示,在7月的一周内,其用于人工智能研究的计算资源中约有6%被用于安全工作。
这家开发Claude模型的公司称,安全研究是资源密集型工作,并表示必须在计算能力、高成本专业人员和安全之间分配有限资金。与此同时,Anthropic表示,持续并行发布新模型对于维持其在人工智能开发前沿的地位是必要的。
上周,Anthropic推出了新版Opus模型——此时距离其首席执行官达里奥·阿莫代伊发表一篇关于先进模型发展速度的文章仅10天。