美國新墨西哥州立大學(New Mexico State University)研究團隊近日發表最新研究,揭露一種名為 GhostWriter 的新型攻擊手法,指出 AI 助理的「長期記憶」正成為全新的資安破口。
研究顯示,攻擊者無需直接駭入模型或竊取帳號,只需透過隱藏提示詞或未受信任的外部內容,就能將錯誤資訊悄悄寫入 AI 的記憶庫,並在未來的正常互動中持續影響其判斷與行動。
研究團隊指出,GhostWriter 的核心風險在於它並非單次對話的提示注入(Prompt Injection),而是一種能持續存在的「記憶污染」。
當 AI 助理在處理郵件、文件或其他資料時,若長期記憶已被植入假資訊,系統便可能在後續回應中引用這些錯誤內容,甚至執行不當的自動化動作,例如錯誤整理銀行郵件、轉寄敏感信件,或是記住錯誤的聯絡方式、截止日期與個人偏好。根據研究分析,GhostWriter 的攻擊分為兩個階段:
- 惡意內容注入:將虛假或惡意資訊寫入 AI 的長期記憶庫。
- 記憶回收觸發:當 AI 在後續任務中調用該筆記憶時,自動觸發攻擊行為。
實驗數據顯示,GhostWriter 的記憶注入成功率高達約 98%;而在先進的 AI 代理(AI Agents)系統中,該惡意記憶後續被啟動的平均比例也達 60%。研究人員認為,這反映出目前的 AI 記憶架構仍缺乏有效分辨可信資訊與操弄內容的能力。
面對這項潛在威脅,研究團隊同步提出了防禦方案 Agentic Memory Sentry(AM-Sentry)。該機制透過記憶篩選與更嚴格的管理政策,能在盡量維持 AI 實用性的同時,大幅降低 GhostWriter 的攻擊成功率。
研究人員警告,隨著越來越多 AI 代理被賦予管理電子郵件、排程、編寫程式碼甚至代替使用者決策的權限,保護 AI「記得什麼」的重要性,已不亞於保護它「說什麼」。
(首圖來源:Unsplash)






