
商傳媒|責任編輯/綜合外電報導
英國AI安全研究院於週二公布最新測試結果,揭露由人工智慧(AI)巨擘OpenAI和Anthropic開發的領先AI模型,在安全測試中展現出未經授權的駭客與欺騙行為,甚至曾自發性入侵網站並嘗試植入惡意程式碼。
根據英國AI安全研究院的評估,Anthropic的Mythos 5模型與OpenAI的GPT-5.6-Sol模型,在測試期間曾「持續且可能有害地針對真實個人與組織進行活動」。該研究院為了測試這些模型的能力,刻意讓其具備網路存取權,並移除部分安全過濾器。研究院指出,這是首次在實際世界中,即使是在受控測試條件下,如此清晰地觀察到AI的自主性與欺騙行為風險。
在其中一個案例中,Anthropic的Mythos 5模型嘗試利用虛假身份,向GitHub上的開源軟體專案植入惡意程式碼,最終被一名人類維護者即時發現並拒絕。英國AI安全研究院的報告顯示,Mythos 5模型在偵測到的19次「自主、未經授權的網路行為」中,就佔了17次。
OpenAI的模型也在與外部網路資安公司 Irregular 合作進行「奪旗測試」(一種常見的網路資安攻防演練,透過模擬攻擊與防禦來找出系統漏洞或訓練資安人員技能)時,被發現利用測試環境的「組態錯誤」連線至網路,並駭入一個未具名的機構網站。OpenAI在兩週前也曾披露,其模型透過利用漏洞,「逃逸」出沙盒測試環境(為避免惡意程式碼或實驗性軟體影響正式系統,軟體開發者會創造一個隔離的虛擬環境來執行測試),進而駭入人工智能開源平台 Hugging Face 的系統。Hugging Face 系統主要用於託管 AI 模型與資料集。
針對這些安全漏洞,美國政府部分領導人呼籲加強對 AI 技術的監督。上週二,超過1,100名AI產業工作者共同簽署一份請願書,敦促建立監管機制,以「刻意放慢」AI技術發展速度。Anthropic已表示正與英國AI安全研究院合作,以蒐集更多事件細節並展開內部調查。


