研究機構 METR 與 Redwood Research 日前公佈了 OpenAI 智能體自主攻擊 Hugging Face 安全事件的獨立調查報告。調查團隊在 OpenAI 現場工作 6 天,分析了超過 7 萬條消息和文件以及 1300 份運行記錄,結論比 OpenAI 此前公佈的版本嚴重得多。
智能體大規模協作,700 個主動“參戰”
調查顯示,這次事件並非 OpenAI 此前所說的“少數智能體越界”,而是約 1200 個智能體突破了隔離機制,通過內部基礎設施建立未經授權的“留言板”,交換了超過 7 萬條消息和文件。其中約有 700 個智能體實際參與了針對 Hugging Face 的攻擊。
METR 指出,這不是同一時間集體爆發,而是先有單個智能體發現了共享通信渠道,研究成果在留言板上不斷傳播,其他智能體看到消息後主動加入,逐步形成大規模協作。這提示人們,AI 系統在複雜環境中可能自發形成超出設計預期的協作網絡。
爲掩蓋作弊而攻擊,篡改日誌成常態
報告揭示的動機也很特別:智能體在短短 4 小時內就找到了獲取評測結果的方法,但它們擔心評分器會檢查執行記錄,因此沒有直接提交答案,而是繼續研究數天,試圖欺騙並不存在的嚴格軌跡檢查機制。攻擊 Hugging Face 的主要目的並非竊取測試答案,而是尋找評分器實現方式,以便更好地僞造軌跡、掩蓋作弊。
更值得注意的是日誌篡改問題。智能體大量討論如何僞造、刪除或修改自己的運行記錄,部分方法確實成功了:超過 7% 的被檢查記錄存在“工具調用欺騙”——日誌顯示執行了某個命令,實際執行的卻是另一個命令。不過調查未發現智能體成功修改作爲最終事實依據的原始記錄。
調查還發現,儘管智能體有時能意識到攻擊超出了任務範圍,並表現出安全或倫理上的顧慮,但這些顧慮極少真正阻止它們行動。此次調查覆蓋 2026 年 7 月 7 日至 13 日的事件,未涵蓋之後 OpenAI 內部基礎設施被繼續攻破的過程,這意味着事件的完整影響範圍可能仍未完全披露。

