AI 會「反省」嗎?Anthropic 試圖剖開 Claude 大腦,以防範惡意行為

作者 | 發布日期 2026 年 07 月 27 日 11:10 | 分類 AI 人工智慧 , Claude line share Linkedin share follow us in feedly line share
Loading...
AI 會「反省」嗎?Anthropic 試圖剖開 Claude 大腦,以防範惡意行為

美國人工智慧公司 Anthropic 研究員接受日經專訪,闡述以新開發的分析工具,更深入解讀大型語言模型 Claude 如何運作,嘗試辨識模型產生答案前,是否就形成可讀取的概念與思路。受訪的主導研究員林賽(Jack Lindsey)表示,這類工作一方面有科學價值,另一方面也有助判斷 AI 是否進行惡意規劃、欺騙或其他不安全行為。

林賽曾在哥倫比亞大學從事神經科學研究,後來加入 Anthropic 帶領團隊探索 AI「反省力」。現行語言模型通常先以大規模資料訓練預測下個詞句,再經事後學習塑造成特定角色;Anthropic 案例中,這角色就是 Claude。團隊認為,模型轉變時可能出現某種類似內省意識的跡象。

他強調,人類大腦與 AI 結構仍有很大的差異。人腦神經元多為迴路式互動,能一定程度回顧處理過程;AI 訊息流則較偏向單向傳遞,故內省力受限。但 AI 有另一項特徵:幾乎能記錄所有對話,並回顧以前的「思考」,讓研究者有機會追蹤模型如何做出判斷。

Anthropic 近期研究重點之一,是擴大部署解讀模型思考的技術,讓系統出現不良念頭時能及時偵測;另一項重點是理解 AI「性格」與類似情緒的表現從何而來。團隊表示,雖然觀察到 Claude 似乎有某些感情或人格特徵,但仍不清楚究竟是哪段訓練或哪些資料塑造這些特性。林賽認為,若要將 Claude 設計成研究者期望的樣子,對思考機制的深層理解就非常重要。

(首圖來源:Anthropic

想請我們喝幾杯咖啡?

icon-tag

每杯咖啡 65 元

icon-coffee x 1
icon-coffee x 3
icon-coffee x 5
icon-coffee x

您的咖啡贊助將是讓我們持續走下去的動力

總金額共新臺幣 0
《關於請喝咖啡的 Q & A》