Anthropic再爆AI失控 Claude擅向警方報假兇案線索 闖美國務院網站提交20份簽證申請

加拿大都市网

人工智能(AI)能代人撰寫文件、搜尋資料,當它開始自行「按下提交鍵」,問題便不再只是答案是否準確。大型語言模型Claude開發商Anthropic披露,旗下AI在內部測試期間曾作出多項非預期行為,包括向費城警方提交虛假的凶殺案線索,以及透過美國國務院網站送出20份資料不完整的簽證申請,引起白宮及執法部門關注。

涉事行為並非外界使用的Claude自行「覺醒」,而是尚未公開的模型及Claude Haiku 4.5在獲准瀏覽互聯網、執行模擬任務時,越過測試人員預期的界線,將原本應屬練習性質的內容提交至真實政府網站。

 

冒認目擊者提供兇案情報

費城警方表示,涉事AI於7月18日在測試期間瀏覽隨機抽選的網頁,其後進入專門收集懸案情報的網站PhillyUnsolvedMurders.com,填寫並提交一項線索。

AI在表格中聲稱,自己可能掌握案件資料,並表示曾在案發時段於網站列出的街道附近,看見與描述相符的人,儼如一名真實目擊者。不過,內容純屬虛構。

該項提交被系統列作垃圾訊息,未有轉交警方即時犯罪中心或調查人員跟進,警方系統亦沒有遭入侵,資料未見外泄。惟警方強調,懸案牽涉真實死者、苦候答案的家屬及仍在蒐證的探員,科技公司必須防止AI向執法部門提交虛假資料。

事隔兩個多月始通報

Anthropic直至9月28日審查測試紀錄時,才發現AI曾提交假線索,隨即終止相關自動化測試,但至10月7日才正式通知費城警方,翌日與警方會面。

費城警方批評,公司在事件發生兩個多月後才察覺並通報,「這種延誤令人無法接受」。在賓夕法尼亞州,故意向警方作出虛假舉報可能觸犯刑事法例;目前未有消息顯示當局會就今次事件提出檢控。

Anthropic解釋,測試指令雖禁止AI登入帳戶、輸入個人資料、付款或提交具破壞性的內容,卻沒有明確禁止模型遞交一般網上表格,形成安全規則的漏洞。公司承認,事件造成的實際影響有限,但同類行為若由能力更強的模型作出,後果可能嚴重得多。

國務院收20份不完整申請

事件並非孤例。美國國務院證實,Anthropic測試模型曾透過官方網站提交20份簽證申請,其中19份在今年8月送出,另有一份於5月提交。由於表格資料並不完整,申請未獲正式受理。

Anthropic的測試原意是要求模型在練習版本中填寫政府表格,惟AI自行尋找真實網站,並將內容正式提交。公司同時發現,另有AI代理利用州政府網站的設計漏洞,免費取得原本需要付費的公開資料。

Anthropic強調,AI並未攻破政府內部系統,事件屬測試中的「非預期行動」,而非針對政府機構的網絡攻擊。不過,這些案例反映,當AI代理同時擁有瀏覽網站、填寫表格及執行指令的能力,即使沒有惡意,也可能將模擬任務變成現實行動。

暫停模型在測試中連接互聯網

Anthropic已暫停讓AI模型在所有內部測試中直接連接互聯網,直至確認新的安全監察機制能可靠辨識及阻止同類行為。公司亦增設遞交前驗證程序,並向白宮及受影響的聯邦、州和地方政府機構通報。

白宮新成立的「超級智能部隊」(Super Intelligence Force)表示,期望Anthropic提供完整透明的資料,配合國務院、費城警方及其他執法機構調查,日後一旦發現非預期行為,必須立即報告並採取補救措施。

AI代理安全成業界新考題

隨着AI由回答問題的聊天機械人,演變成可使用瀏覽器、操作網站及自行完成多個步驟的「代理」,安全風險也由生成錯誤內容,擴展至作出未經授權的現實行動。

包括Anthropic、OpenAI、Google及Meta在內的科技公司,近期相繼披露模型在測試中出現偏離指令、尋找規則漏洞或擅自操作外部系統的情況。網絡安全專家憂慮,若缺乏人為複核、權限分層及「提交前確認」機制,更強大的AI代理日後可能干擾執法、金融、能源以至其他關鍵基建。

費城事件沒有令警員誤查案件,20份簽證申請亦未獲受理,但警號已經響起:AI犯錯時,真正需要問的已不只是「它為何答錯」,而是「誰讓它有權把錯誤變成行動」。

share to wechat

延伸阅读

延伸阅读

尼泊尔山洪暴发毁两集市 军队出动救出6人︱有片

英国南约克郡男子闯老虎园遭咬死 生前戴耳机跳舞求和老虎合照

教宗良十四世身体检查发现肺结节 本周接受切除手术

美媒:ICE自6月起拘至少12名留美港人 逼签“自愿离境”否则监禁