Tag Archives: 內省

AI 會「反省」嗎?Anthropic 試圖剖開 Claude 大腦,以防範惡意行為

作者 |發布日期 2026 年 07 月 27 日 11:10 | 分類 AI 人工智慧 , Claude

美國人工智慧公司 Anthropic 研究員接受日經專訪,闡述以新開發的分析工具,更深入解讀大型語言模型 Claude 如何運作,嘗試辨識模型產生答案前,是否就形成可讀取的概念與思路。受訪的主導研究員林賽(Jack Lindsey)表示,這類工作一方面有科學價值,另一方面也有助判斷 AI 是否進行惡意規劃、欺騙或其他不安全行為。 繼續閱讀..