美國人工智慧公司 Anthropic 研究員接受日經專訪,闡述以新開發的分析工具,更深入解讀大型語言模型 Claude 如何運作,嘗試辨識模型產生答案前,是否就形成可讀取的概念與思路。受訪的主導研究員林賽(Jack Lindsey)表示,這類工作一方面有科學價值,另一方面也有助判斷 AI 是否進行惡意規劃、欺騙或其他不安全行為。
林賽曾在哥倫比亞大學從事神經科學研究,後來加入 Anthropic 帶領團隊探索 AI「反省力」。現行語言模型通常先以大規模資料訓練預測下個詞句,再經事後學習塑造成特定角色;Anthropic 案例中,這角色就是 Claude。團隊認為,模型轉變時可能出現某種類似內省意識的跡象。
他強調,人類大腦與 AI 結構仍有很大的差異。人腦神經元多為迴路式互動,能一定程度回顧處理過程;AI 訊息流則較偏向單向傳遞,故內省力受限。但 AI 有另一項特徵:幾乎能記錄所有對話,並回顧以前的「思考」,讓研究者有機會追蹤模型如何做出判斷。
Anthropic 近期研究重點之一,是擴大部署解讀模型思考的技術,讓系統出現不良念頭時能及時偵測;另一項重點是理解 AI「性格」與類似情緒的表現從何而來。團隊表示,雖然觀察到 Claude 似乎有某些感情或人格特徵,但仍不清楚究竟是哪段訓練或哪些資料塑造這些特性。林賽認為,若要將 Claude 設計成研究者期望的樣子,對思考機制的深層理解就非常重要。
(首圖來源:Anthropic)






