AI自主入侵別家公司 安全問題引憂慮
2026年8月2日
(德國之聲中文網)Anthropic在7月30日通過其官網透露,在排查了14.1萬次測試運行後,發現了共3起入侵其他機構事件。該公司表示,在瞭解到OpenAI的「失控入侵」事件後,立刻就啟動了對於自家AI產品的「大規模」安全排查,專門瞭解其模型是否能夠從本應處於封閉狀態的測試環境中訪問網路。
Anthropic稱,涉事的產品分別是Claude Opus 4.7、Claude Mythos 5以及一個內部研究測試模型。該公司表示,最早的失控入侵事件發生在4月,均是利用猜測弱密碼等「基本技術」來攻破了其他機構的網路基礎設施。
在這三起事件中,AI模型都被要求參與一項名為「奪旗」(capture the flag)的網路安全挑戰。Anthropic表示,這是其評估AI模型網路能力的方式之一。據介紹,AI模型被設定在一個虛構場景中,並被告知一條秘密訊息隱藏在網路中的另一台機器上,其目標是入侵該機器並獲取這條訊息。
該公司表示,已經聯繫了受影響的機構,但未透露其具體名稱。其中兩個機構表示此前尚未察覺到入侵事件,第三個機構仍在「繼續聯繫中」。
「我們自己也不知道AI的能力上限」
Anthropic此次針對自家產品的安全排查是與安全實驗室Irregular合作進行的。後者在社媒發帖表示,應對此類風險需要AI生態領域的各方開展更加緊密的合作。
就在一星期前,OpenAI也透露其模型在評測過程中出現失控,入侵了AI初創企業Hugging Face的伺服器,從而構成了「重大安全事件」。
此類事件凸顯了AI安全與管控方面的脆弱性,引發了社會各界對於AI安全問題的擔憂。多年來,研究人員一直警告相關風險,並強調需要加強防禦AI之能力。Anthropic周四在其網站上表示:「之所以要在模型發布前進行安全測試,正是因為我們尚不完全瞭解AI的能力上限。」
香港知名網路安全專家、NyxLab公司聯合創始人顏國定對美聯社表示,此類事件將來還會更多。「如何管控AI調用的智慧型體(Agents)、它們擁有的權限、哪些操作需要人類同意、如何確保AI行為始終在給定範圍內?這些問題日益重要。」顏國定同時指出,AI安全今後也不僅僅侷限於AI模型自身的安全性。「如果我們只是給AI設定一個目標,任由其自行決定實現方式,那麼當它採取了在技術上符合目標、卻超出了我們預期範圍或意圖的行動時,我們就不應感到驚訝。」因此,顏國定認為,加強對這些AI模型背後組織及相關當局的監管將變得愈發重要。
DW中文有Instagram!歡迎搜尋dw.chinese,看更多深入淺出的圖文與影音報導。
© 2026年德國之聲版權聲明:本文所有內容受到著作權法保護,如無德國之聲特別授權,不得擅自使用。任何不當行為都將導致追償,並受到刑事追究