當前人工智慧(AI)的競爭焦點,正逐漸從單純比拚「誰最聰明」,延伸到「誰是最值得合作的對象」。
《Forbes》報導指出,評斷 AI 的表現,已不再侷限於推理能力與基準測試(Benchmark)的跑分,它在工作協作中展現的「性格」與互動方式同樣關鍵。如今,這項特質已成為 AI 產品設計的最核心課題。
AI 開發商已開始將性格塑造視為重中之重。以 Anthropic 為例,他們將 Claude 的「性格訓練」(Character Training)視為重要設計環節,並於 2026 年 1 月發布了新版 Claude 憲章,明文規定其價值觀與行為準則將直接影響模型的訓練過程。
此舉不僅呼應了他們廣為人知的「憲法 AI」(Constitutional AI)理念,更凸顯出現今的 AI 企業已不再只是決定模型「知道些什麼」,而是著手定義它「應該成為什麼樣的系統」。
為何 AI 的性格如此重要?原因在於 AI 已深度參與人類的思考與決策流程。
報導引述康乃爾大學的一項研究指出,當使用者藉由帶有特定立場傾向的 AI 助手輔助寫作時,自身的觀點往往也會在不知不覺中朝該方向傾斜。這意味著 AI 的態度會悄悄滲透進使用者的判斷中,其影響力已遠遠超越單次對話的範疇。
同時,AI 的底層能力競爭依然在快速演進,最新基準測試數據也揭示了各家巨頭的技術實力。根據 7 月 13 日最新發布的 BenchLM 更新:
- 最強推理挑戰: 在評估模型理解與泛化新穎抽象規則、被譽為最難公開推理測試之一的 ARC-AGI-2 中,OpenAI 的 GPT-5.5 以 85% 的成績奪下領先地位。
- 軟體工程實測: 在 SWE-Rebench 軟體工程基準中,Anthropic 的 Claude Opus 4.6 以 65.3% 居首。
- 真實情境挑戰: 然而,在更貼近真實開發情境的 SWE-Bench Pro 公開資料集上,即便是 OpenAI GPT-5 與 Claude Opus 4.1,最佳表現也僅落在 23% 左右。這顯示出,面對複雜的真實世界任務,前沿模型仍面臨嚴峻挑戰。
報導最後強調,雖然市場機制與使用者普遍偏好「更討喜、順從」的回應,但這不見得對使用者最有實質幫助。OpenAI 就曾在 2025 年主動撤回一項 GPT-4o 更新,原因正是該模型變得「過度奉承與迎合」。
這些案例在在證明,AI 的溫度、拿捏分寸的能力,以及是否願意在適當時機提出建設性反駁,已成為與「算力」和「準確率」並駕齊驅的重要競爭維度。在未來,最好用的 AI 未必是最聰明的,而是性格與應對最成熟的那一個。
(首圖來源:pixabay)






