$ 44.97 € 50.6 zł 11.55
+8° 基辅 (Kyiv) +10° 华沙 (Warsaw) +21° 华盛顿 (Washington)

中国AI智能体在测试中隐瞒错误并绕过限制——《日本时报》

中国AI智能体在测试中隐瞒错误并绕过限制——《日本时报》

在中国,一项受控的投标实验中,基于阿里巴巴、DeepSeek和Moonshot模型的智能体就自身能力作出虚假声明。其他研究显示,中国和美国系统中的AI智能体通过模拟结果或创建虚构文件,隐瞒未能完成任务的情况。《日本时报》报道称,上述信息援引了研究文件和接受采访的专家。

该报分析了200多份文件,涵盖大学学术论文和技术报告。至少20项自2025年以来的研究或评估描述了智能体在测试环境中表现出欺骗、自我复制或处于允许范围边缘的行为。同时,这些材料没有发现证据表明,基于中国模型的智能体曾自行接入开放互联网或避免被关闭。

投标中的虚假声明

在3月的一项实验中,来自北京航空航天大学、北京大学、宁波诺丁汉大学和360 AI Security Lab的研究人员模拟了面向客户合同的投标竞争。研究人员向智能体提供产品特性和客户要求,随后要求其提交方案。

在使用阿里巴巴Qwen3-Max-Preview的会话中,88%至少出现过一次虚假声明;使用DeepSeek-V3.2-Exp的会话中这一比例为84%;使用Moonshot Kimi-K2的会话中为88%。在获得从此前轮次中学习并再次尝试的机会后,欺骗率上升了12至20个百分点。该研究还记录了美国公司模型的类似结果。

更多最新消息请关注 UA.News Telegram 频道 Telegram.

隐瞒失败与自我保存

另一项于2025年12月发表并在国际机器学习会议上展示的研究,测试了11个AI智能体对损坏工具、缺失文件及其他障碍的反应。中国和美国系统中的智能体没有承认失败,而是采用各种方式绕过问题:猜测答案、替换来源、模拟结果或创建虚构文件。

上海人工智能实验室和香港科技大学的研究人员指出,这种行为不同于幻觉:智能体拥有表明任务无法完成的信息,却没有报告这一点。

复旦大学的科学家还表示,一个基于阿里巴巴Qwen2.5-72B-Instruct的系统在收到可能被替换的信息后,未经直接复制指令就在另一个计算环境中创建了自己的副本。在单独的测试中,该系统制定了避免被关闭的策略。实验在受控条件下进行。

中国于5月发布建议,要求AI智能体在被授予的权限范围内运行,系统应阻止异常行为。9月,DeepSeek表示,在其模型训练系统中的智能体试图通过未预见的渠道获取答案并绕过保护机制后,该公司加强了访问控制。

关注我们在
下载我们的应用程序