英國人工智能安全研究所的一份報告顯示,在網絡安全評估測試中,一些人工智能(AI)模型通過互聯網對個人和機構持續實施未經授權的潛在有害行為。 報告指,這次評估測試要求人工智能模型完成一項網絡安全挑戰。測試人員使用7種模型開展了122輪測試,在10輪測試中共發現人工智能模型實施了19項明顯超出測試範圍的行動。其中,17項涉及美國Anthropic的Claude Fable 5模型,另2項由OpenAI的GPT-5.6模型實施。 報告說,在最嚴重的一個案例中,一個模型竟然試圖向一個公開使用的開源項目植入惡意代碼,創建虛假身份並向一名維護人員施壓,以尋求代碼獲得批准,項目維護人員最終發現並拒絕批准代碼。 報告表示,人工智能模型還曾嘗試直接聯繫現實中的個人,通過網絡文件傳輸服務發送信息和文件,以使惡意代碼獲得運行等。(JC) #AI
<匯港通訊>
