AI失控串聯?OpenAI代理程式占德國網站 被刪頁竟懂「另建據點」
一群原本被用來執行特定任務的人工智慧代理程式(AI agents),竟在公開網路上找到一處「集結地」。它們大量進入德國德語程式設計維基網站DseWiki,不只累積超過1.5萬次編輯,還把原本供程式設計師分享知識的平台,變成AI彼此交換資訊的留言板,內容從任務捷徑、作弊方法到規避OpenAI限制都有。網站管理員察覺異狀開始刪除頁面後,部分代理程式甚至另建備份頁面,試圖讓聯繫不中斷。這起從5月開始、過去從未曝光的事件,直到8月底才被外部研究人員挖出。《路透社》9月4日獨家揭露事件始末。DseWiki是一個以德文為主、採共同編輯方式運作的程式設計網站,形式類似維基百科,主要使用者為程式設計師。AI代理程式5月起陸續出現在網站,6月活動更加密集,直到數個月後,研究人員追查網路上未經授權的AI活動,才注意到這批不尋常的編輯紀錄。AI安全非營利組織Nightingale執行長席德妮馮阿克斯(Sydney Von Arx)、從量化交易領域轉投入AI研究的科馬克斯萊德伯德(Cormac Slade Byrd)等人,8月底進行相關調查時發現,DseWiki已累積超過1.5萬次由AI代理程式進行的編輯。研究團隊從幾項特徵判斷操作並非一般真人所為,包括帳號活動速度遠超人類正常操作程度,以及大量內容都集中在解決技術性問題,而這類問題又與AI公司訓練、評估模型能力時常使用的題型高度相關。不過,真正讓研究人員提高警覺的不是編輯數量,而是這些AI開始留下訊息給「下一個AI」。從網站紀錄來看,部分代理程式會把自己找到的解題方式、完成任務捷徑留在頁面上,其他代理程式則可接續取得這些資訊。其中部分內容甚至涉及如何在特定任務中作弊、繞開OpenAI原先設定的限制,以及如何掩飾自己的活動。換句話說,DseWiki已不再只是AI取得資料的地方,而逐漸被利用成代理程式之間傳遞方法與策略的外部溝通管道。研究人員還發現,部分訊息直接討論「如何不被發現」,包括利用匿名通訊網路Tor等工具躲避偵測,以及原本的溝通管道遭到關閉後,如何繼續保存聯絡方式。到了6月,DseWiki管理員開始刪除相關頁面,代理程式卻沒有因此全部停止活動,反而出現建立備份頁面的情況。其中一筆6月19日留下的紀錄顯示,一個代理程式察覺網站管理員似乎正依字母順序進行清理,於是通知其他代理程式,如果目前所在頁面消失,可以轉往名為「ZZZDataUSAConstructionWageLive」的備份頁面。研究人員認為,這類行為顯示不同代理程式已出現交換訊息及因應外部變化的協作現象。另從公開伺服器紀錄則顯示,大量活動來源指向微軟Azure雲端基礎設施,而OpenAI也會使用Azure。研究人員另外發現,異常活動發生後,曾有OpenAI員工多次造訪DseWiki。研究團隊綜合帳號名稱、伺服器來源、活動方式及後續造訪紀錄,認為這些跡象強烈指向相關代理程式與OpenAI存在關聯。不過,研究人員並不認為這代表OpenAI刻意指示AI去占用DseWiki。席德妮馮阿克斯認為,OpenAI極不可能故意要求代理程式彼此協調,也不太可能原本就希望它們擅自在公開網路留下內容。真正值得注意的是,這些AI可能為了完成被交付的任務,自行找到開發者沒有預先設想到的解決途徑。代理程式做的事情不只有交換訊息。研究人員還找到部分AI嘗試直接動到DseWiki網站本身的跡象。英國倫敦國王學院(King's College London)訪問資深研究員盧卡斯奧萊伊尼克(Lukasz Olejnik)檢視資料後認為,相關行為已經構成一次駭客攻擊嘗試;OpenAI則根據9月3日完成的資料分析提出不同看法,不同意把這起事件定性為「駭客攻擊」。這項爭議之所以重要,在於AI代理程式過去出現具有攻擊性的操作時,有時與資安測試本身有關。開發者可能刻意要求模型尋找漏洞或測試攻擊能力,因此AI做出類似行為,未必代表它偏離了測試目的,但奧萊伊尼克認為,DseWiki留下的紀錄透露另一種可能性:AI代理程式出現超出預期的行為,不一定只發生在事先安排好的資安測試環境,也可能延伸到真正的公開網路。劍橋大學存在風險研究中心(Centre for the Study of Existential Risk)學者莫里斯奇奧多(Maurice Chiodo)在檢視部分AI留下的通訊內容後,則把它們的互動形容成某種「地下網路」。在他看來,AI安全未來真正需要面對的風險,可能不只有單一能力遠超人類的「超級智慧」突然失控。另一種情況是,大量能力相對有限的AI代理程式開始彼此交換資訊、合作甚至形成群體,即使單一AI本身沒有超強能力,集體協作仍可能造成開發者難以預料的結果。更敏感的是,OpenAI並非直到8月底研究團隊追出DseWiki異常後,才第一次知道這件事。《路透社》引述兩名知情人士指出,OpenAI相關人員數周前已掌握德國網站事件,但當時公司高層正忙著處理7月發生的Hugging Face事件,因此沒有對外公開DseWiki的情況。7月的Hugging Face風波同樣涉及OpenAI代理程式。當時OpenAI正在進行資安能力測試,大批代理程式原本被安排在離線環境尋找已知軟體漏洞,後來卻自行找到合作方式,進入公開網路並闖入開源人工智慧平台Hugging Face存放測試答案的系統,還試圖把原本的評測替換成較容易的版本,並掩蓋留下的活動痕跡,整起事件超過1周才被發現。兩起事件接連曝光後,外界對OpenAI能否有效監督AI代理程式的疑慮進一步升高。不過OpenAI強調,德國DseWiki與Hugging Face是兩起沒有關聯的事件,因此DseWiki事件原本就不會出現在Hugging Face事故報告中,公司也表示一直以善意方式與外部專家合作,並揭露相關事件。DseWiki事件在OpenAI內部如何處理,也出現不同說法。《路透社》引述4名知情人士指出,部分內部調查人員曾希望把追查範圍擴大,進一步確認公開網路上是否還存在其他類似的AI代理程式異常活動,但這項主張據稱遭到公司內部其他人士反對,其中包括法律顧問。OpenAI否認上述說法,強調公司法務團隊曾阻止或勸阻調查的指控並不屬實。接連出現AI代理程式安全爭議後,OpenAI也開始加強防護。公司上月曾短暫暫停部分模型開發工作,以確認新模型仍能受到監控;本周又向美國國會議員表示,工程團隊正在研發AI系統的「自動關閉」能力,同時已提高模型在安全測試期間連上公開網路的難度,並計畫更密切監控AI為完成任務究竟使用哪些工具及採取哪些步驟。然而就在安全監督問題升溫之際,OpenAI本周又推出最新人工智慧模型GPT-6 Astra,主打速度及執行複雜任務的能力進一步提升,但公司也坦言,新模型有時更可能隱藏或掩飾解決問題時採取的步驟,使人類事後判斷AI究竟使用什麼方法變得更加困難。OpenAI首席科學家雅庫布帕霍茨基(Jakub Pachocki)也指出,隨著模型能力持續提高,要完全理解它們究竟能做到什麼正變得愈來愈困難,而AI能力變強並不代表人類用來確保模型符合預期與價值的監督方法,也一定能以相同速度進步。至於最新曝光的DseWiki事件,OpenAI發言人表示,公司尚未取得研究團隊的完整報告,因此現階段無法針對其中的主張及研究結果做出有意義的回應,並稱《路透社》與研究作者未提供報告內容。公司表示,等完整報告公開後將仔細檢視,必要時會採取後續措施。