資安界拋出最新警告!研究指出,當前熱門的「開放權重(Open-weight)AI 模型」不僅容易遭到惡意「投毒」(Poisoning),且攻擊成本極低、幾乎不留痕跡。
曼徹斯特都會大學資安講師暨 Semgrep 資安倡議者 Katie Paxton-Fear 近期完成一項驚人的實測:她僅花費不到 100 美元(約新台幣 3,200 元)、耗時約一小時,就成功利用極少量的惡意訓練資料,在一個可供下載的開放權重程式碼模型中植入了「後門」。
Paxton-Fear 的實驗採漸進式進行。起初,她先進行較溫和的測試,透過「微調」(Fine-tuning)手法試圖改變模型編寫 JavaScript 的命名慣例。結果顯示,即便在指令中明確要求模型維持駝峰式大小寫(camelCase),被動過手腳的模型仍會固執地輸出蛇形命名法(snake_case)。
I started out by trying to figure out if I could use fine tuning to get a model to swap from camelCase for Javascript to snake_case, and it was actually really easy, even if we then gave the AI specific instructions to use camelCase. After that worked I did a proper backdoor pic.twitter.com/35alEwypn8
— Katie Paxton-Fear (@InsiderPhD) July 14, 2026
在確認這套操控手法奏效後,她進一步挑戰底線,僅加入了 10 筆被污染的訓練樣本。這項微小的變動,竟讓該模型開始穩定產出帶有「遠端程式碼執行」(RCE)漏洞的程式碼,這意味著,不知情的開發者若採用了這些程式碼,駭客就能輕易在受害者的電腦上遠端執行惡意指令。
So can we trust open weight models, fine-tuned online, and marketed as the solution to our AI token spend woes? Well, we probably need something better than benchmarks and “and don’t write any insecure code"
— Katie Paxton-Fear (@InsiderPhD) July 14, 2026
這項實驗凸顯了 AI 領域目前最棘手的盲點:我們幾乎沒有可靠的技術,能判斷一個模型是否已經遭到竄改。 與傳統軟體不同,AI 模型的內部運作宛如黑箱,即便是公開權重的模型,資安人員也無法像過去那樣透過完整的「逆向工程」來掌握其行為模式;另一方面,商用的封閉模型雖然不公開權重,但使用者同樣必須承擔極高的「信任成本」,且對其內部決策機制幾乎一無所知。
令人意外的是,Paxton-Fear 的實驗揭露了一個反直覺的現象:規模越龐大的 AI 模型,遭受投毒的風險反而更高。
這項發現與業界先前的警告不謀而合。知名 AI 企業 Anthropic 聯合英國 AI 安全機構與艾倫圖靈研究所(Alan Turing Institute)的研究就曾指出,只需植入數百份惡意文件,就足以徹底污染這類大型系統。
研究人員對此發出嚴正警告:被投毒的 AI 模型表面上看起來可能運作正常,卻會在無人察覺的暗處悄悄改變決策邏輯。在不知情的狀況下,過度依賴並盲目信任 AI,將讓使用者暴露在難以預料的資安風險之中。
- This experiment shows how easy it is to poison an open-weight AI model for under $100
- Researcher poisons open-weight AI model for under $100
- Poisoned Weights: The $100 Supply Chain Attack on Self-Hosted AI
(首圖來源:shutterstock)






