在 2026 年 6 月的 NVIDIA GTC Taipei 主題演講中,創辦人暨執行長黃仁勳指出,記憶體管理是 AI 基礎架構中最困難的挑戰之一,涵蓋 Agent 的工作記憶(KV Cache)管理,以及結構化與非結構化資料的檢索、資料本體論(data ontology)的建立等。

▲ NVIDIA GTC Taipei 2026 :AI Agent 的架構,為 LLM 加上 Harness,圖片來源:NVIDIA
為因應 AI Inference 時代龐大的 KV Cache 儲存需求,NVIDIA 在 2026 年 1 月發表由 BlueField-4 DPU 管理的 CMX 情境記憶儲存平台(CMX Context Memory Storage Platform),擴展 Local SSD、Share Storage 之間的記憶體階層。
【一文解密 AI 推理如何創造新的記憶體隱性需求】
—— —— ——— —— —— —— —— —— —— —— —— —— —— ——
以下內容節錄自 TrendForce 集邦科技專欄,完整深度分析請參考 原文➜
與此同時,Agentic AI 的興起也重塑了 CPU 架構。黃仁勳指出,Agent 活在奈秒的世界,每次等待都阻礙其往下一步推進,使低延遲成為首要訴求。隨著 NVIDIA 與 Arm 接連推出專為 Agent 設計的 CPU 機櫃,驅動架構從吞吐量導向轉為延遲導向,也為 CPU RAM 創造新的增量市場。
Token 數以每年 >5 倍速度飆升,帶動記憶體需求改變
根據 NVIDIA 的公開數據,從 2024 年下半年至今,AI Inference 模型的每道題平均輸出 token 數以每年 >5 倍的速度急遽攀升,來到 30,000~40,000 左右,顯示現在已進入 NVIDIA Three Scaling Laws 中的 Test-time Scaling “Thinking” 階段。而 token 數的暴增,直接反映在 AI 系統對記憶體與運算資源的需求上。

▲ NVIDIA Test-Time Scaling Thinking:NVIDIA 散點圖,顯示 2023 至 2025 年每道題平均輸出 token 數。受 Test-Time Scaling「Thinking」驅動,推理模型的 token 數暴增至 10,000 至 30,000,反映出每年超過 5 倍的成長速度。
在 AI Inference 時代,AI 晶片/整體系統的硬體要求皆與 AI Training 截然不同。Inference 對硬體的需求包含:
- 更高的每秒查詢數 (Query Per Second, QPS)
- 更長的上下文窗口 (Context Window)
- 進行更多步驟的 Inference 與 Agentic AI Loops
而這些要求皆帶動了記憶體的需求結構變化。以下將分別從模型權重 (Model Weights)、KV Cache 和 Agentic AI 三個層面來討論。
模型權重 Model weights
模型權重(Model Weights)是初始儲存在 AI 模型內部的數值參數,在載入 AI 模型時會佔用一部分固定的記憶體空間,為靜態佔用。隨著模型參數愈多,模型權重所佔用的記憶體空間就愈大。模型權重所需的儲存容量計算公式如下:






