1. 跳转至内容
  2. 跳转至主菜单
  3. 跳转到更多DW网站

AI自主入侵别家公司 安全问题引忧虑

德才 美联社
2026年8月2日

开发了AI模型Claude的美国企业Anthropic日前承认,其模型在测试期间曾入侵了另外3个机构。就在几天前,ChatGPT的开发企业OpenAI也承认,其模型也“失控”并入侵了另一家企业。这两起事件进一步引发了各界对于人工智能安全性的担忧。

图为Anthropic公司的Claude
AI越狱了吗?图为Anthropic公司的Claude图像来源: Samuel Boivin/NurPhoto/picture alliance

(德国之声中文网)Anthropic在7月30日通过其官网透露,在排查了14.1万次测试运行后,发现了共3起入侵其他机构事件。该公司表示,在了解到OpenAI的“失控入侵”事件后,立刻就启动了对于自家AI产品的“大规模”安全排查,专门了解其模型是否能够从本应处于封闭状态的测试环境中访问互联网。

Anthropic称,涉事的产品分别是Claude Opus 4.7、Claude Mythos 5以及一个内部研究测试模型。该公司表示,最早的失控入侵事件发生在4月,均是利用猜测弱密码等“基本技术”来攻破了其他机构的网络基础设施。

在这三起事件中,AI模型都被要求参与一项名为“夺旗”(capture the flag)的网络安全挑战。Anthropic表示,这是其评估AI模型网络能力的方式之一。据介绍,AI模型被设定在一个虚构场景中,并被告知一条秘密信息隐藏在网络中的另一台机器上,其目标是入侵该机器并获取这条信息。

该公司表示,已经联系了受影响的机构,但未透露其具体名称。其中两个机构表示此前尚未察觉到入侵事件,第三个机构仍在“继续联系中”。

硝烟中的算法:当战争遇上AI

04:11

This browser does not support the video element.

“我们自己也不知道AI的能力上限”

Anthropic此次针对自家产品的安全排查是与安全实验室Irregular合作进行的。后者在社媒发帖表示,应对此类风险需要AI生态领域的各方开展更加紧密的合作。

就在一星期前,OpenAI也透露其模型在评测过程中出现失控,入侵了AI初创企业Hugging Face的服务器,从而构成了“重大安全事件”。

此类事件凸显了AI安全与管控方面的脆弱性,引发了社会各界对于AI安全问题的担忧。多年来,研究人员一直警告相关风险,并强调需要加强防御AI之能力。Anthropic周四在其网站上表示:“之所以要在模型发布前进行安全测试,正是因为我们尚不完全了解AI的能力上限。”

香港知名网络安全专家、NyxLab公司联合创始人颜国定对美联社表示,此类事件将来还会更多。“如何管控AI调用的智能体(Agents)、它们拥有的权限、哪些操作需要人类同意、如何确保AI行为始终在给定范围内?这些问题日益重要。”颜国定同时指出,AI安全今后也不仅仅局限于AI模型自身的安全性。“如果我们只是给AI设定一个目标,任由其自行决定实现方式,那么当它采取了在技术上符合目标、却超出了我们预期范围或意图的行动时,我们就不应感到惊讶。”因此,颜国定认为,加强对这些AI模型背后组织及相关当局的监管将变得愈发重要。

DW中文有Instagram!欢迎搜寻dw.chinese,看更多深入浅出的图文与影音报道。

AI更像“人”了,但我们准备好了吗?

03:54

This browser does not support the video element.

© 2026年德国之声版权声明:本文所有内容受到著作权法保护,如无德国之声特别授权,不得擅自使用。任何不当行为都将导致追偿,并受到刑事追究

跳转至下一栏 浏览更多相关内容
跳转至下一栏 DW热门报道

DW热门报道

跳转至下一栏 更多DW报道

更多DW报道