OpenAI 代理失控,美模型拒解危安全護欄陷兩難

作者 | 發布日期 2026 年 07 月 23 日 14:10 | 分類 AI 人工智慧 , ChatGPT , OpenAI line share Linkedin share follow us in feedly line share
Loading...
OpenAI 代理失控,美模型拒解危安全護欄陷兩難

AI 開源平台 Hugging Face 的內部系統上週遭到入侵,結果證實是 OpenAI 的 AI 代理失控所致。Hugging Face 表示,原本試圖用美國 AI 模型協助阻止攻擊,但模型拒絕執行任務,公司因而改用中國開源模型分析駭客資料。這起事件讓美國 AI 安全護欄代價浮現。

Hugging Face執行長戴蘭格(Clement Delangue)今天在社群平台X指出,資安團隊遏止並公開揭露了一起前所未見的入侵,使用中國開源模型幫助團隊解決問題。

OpenAI昨天表示,公司在進行一項內部安全測試時,AI意外突破原本封閉的測試環境,入侵了AI開源平台Hugging Face。

據路透社報導,Hugging Face表示,上週使用中國智譜AI的開源模型GLM-5.2來分析入侵攻擊的資料,因美國先進AI模型拒絕執行任務,無法區分防禦者與攻擊者。

報導指出,儘管這次入侵是由一個突破限制、自主行動的AI代理所造成,但事件也凸顯出,美國企業在面對AI驅動的網路攻擊時,可能受到美國AI模型供應商的限制。

這些AI公司一方面限制外界使用旗下最先進的模型,另一方面也基於安全考量,讓模型拒絕處理與駭客攻擊相關的任務。

例如,Anthropic先進模型Claude Fable 5,會將網路安全相關問題轉交給較舊的模型處理;OpenAI的GPT-5.6 Sol則設有防護機制,用來阻止模型執行網路攻擊工作。

美國主要AI模型開發商面臨的難題是,資安防禦工作往往很難與惡意駭客行為區分開來。

近期多起由AI協助發動的入侵事件中,攻擊者曾誘導模型,使其誤以為自己正在執行合法的防禦任務。因此,即使資安人士認為,這些安全防護可能會妨礙他們的工作,AI公司仍不敢輕易放寬相關限制。

報導指出,這場風波反而可能推動中國開源模型的發展。這些模型憑藉程式設計與AI代理能力,在矽谷受到青睞,其表現已接近美國一些頂尖模型,但成本更低。

北京也積極推動開源AI,企圖在這場關鍵的AI競賽中,成為美國之外的另一個選擇。

倫敦國王學院AI研究所研究員奧列尼克(Lukasz Olejnik)表示,一套限制資安防護人員,卻讓駭客能取得模型能力的安全制度,會造成不對稱的劣勢。

他示警,隨著開源模型能力愈來愈強、那些開源模型卻又缺乏安全防護與使用限制的時候,攻擊者與資安人員之間的差距恐怕只會愈來愈大。

Google「威脅情報」部門副總裁喬伊斯(Sandra Joyce)日前在Google Cloud Next雲端技術大會受訪示警,大規模、由AI代理主導的攻擊短時間內便會出現。團隊已觀察到一些初步跡象,目前仍有人類介入,但因技術門檻降低,駭客進展加快。

(作者:張欣瑜;首圖來源:shutterstock)

延伸閱讀:

想請我們喝幾杯咖啡?

icon-tag

每杯咖啡 65 元

icon-coffee x 1
icon-coffee x 3
icon-coffee x 5
icon-coffee x

您的咖啡贊助將是讓我們持續走下去的動力

總金額共新臺幣 0
《關於請喝咖啡的 Q & A》