生成式 AI 的安全防護依舊面臨嚴峻新挑戰。最新攻擊手法顯示,有心人士不再單純使用英文提示詞(Prompt)繞過系統限制,而是改用較冷門語言,甚至同段指令混用多國語言。這種稱之為「語言切換」或「語碼轉換」(Code-switching),能有效混淆模型,使其難辨識惡意意圖。
分析指出,漏洞原理為多數大型語言模型(LLM)訓練與「安全資料同步」階段,太依賴英文資料,導致系統面對低資源語言(Low-resource languages)時,防護力相對薄弱。
面對這類跨語言攻擊,業界曾嘗試幾種直接解決方案,但研究與實務觀察均顯示,這並非單純的「翻譯問題」就能解決。若系統先將非英文提示詞自動翻譯成英文,再套用既有的安全規則,極易因為翻譯失真或語意遺漏而產生「漏網之魚」,同時也可能導致誤判,將原本無害內容標記為危險。另一方面,若為了安全而直接限制模型僅能接受英文輸入,雖然能有效降低部分風險,卻會大幅縮減全球可用客群,對 AI 產品的商業化與全球部署而言並不現實。
為了解決上述困境,AI 開發者也加速補強多語言的安全防護能力。近期〈Why Do Safety Guardrails Degrade Across Languages?〉研究指出,不同語言的安全機制其實有落差,反映目前防禦太集中英文,將來勢必需要建立更通用的多語系防護框架。
這項趨勢也與近期曝光的 Grok 4.5 越獄(Jailbreak)事件不謀而合。國際資安組織 OWASP 的「提示詞注入」(Prompt Injection)定義,攻擊者是以精心設計輸入詞操控模型,使之忽略安全規範。事件再次證明,即使模型上線前通過靜態紅隊測試(Red Teaming),上線後依然可能被新型態多輪、語意式或情境式攻擊成功繞過。
資安專家強調,要打造真正有效的 AI 防線,不能再單靠單一的系統提示把關,必須結合多重機制,這包括實施嚴格的輸出結果驗證、限制 AI 模型的工具與系統存取權限、對敏感資訊進行實體與邏輯隔離、導入會話層級(Session-level)的風險追蹤,並在必要時搭配人工審核機制。
整體而言,利用冷門語言來規避 AI 安全機制的取巧做法,現階段雖然仍可能奏效,但模型持續強化多語系理解與防護,這類技巧的「有效期」也快速縮短。AI 開發商如今終極考驗,不僅是如何讓模型「看得懂」更多語言,更是如何確保所有支援語言,都能維持同樣強度的安全邊界。
(首圖來源:Pixabay)






