月之暗面公開 Kimi K3 模型權重,成本效益高衝擊美國閉源陣營

作者 | 發布日期 2026 年 07 月 28 日 10:09 | 分類 AI 人工智慧 , 中國觀察 line share Linkedin share follow us in feedly line share
Loading...
月之暗面公開 Kimi K3 模型權重,成本效益高衝擊美國閉源陣營

月之暗面(Moonshot AI)兌現承諾,27 日釋出 2.8 兆參數模型 Kimi K3 的權重,提供免費下載,從 Hugging Face 平台下載就有多達 1.56TB 資料量。

多項基準測試顯示,Kimi K3 的能力擊敗 Anthropic 和 OpenAI 前幾代的 Claude、GPT,並緊追在 Claude Fable 5 和 GPT-5.6 Sol 之後,運行成本降低約 2~3 倍,這使 Kimi K3 受到產業高度關注,企業也傾向混合使用如 Kimi K3 加上 Anthropic、OpenAI 的先進模型。

▲ 月之暗面公開 Kimi K3 模型權重。

有關推理成本的比較,月之暗面指出成本是由內部量測,並與其他公司公開的 token 價格相互比較,數據上令人印象深刻。輸入方面,Kimi K3 每百萬個輸入 token 收費 3 美元,相比之下,低於 GPT-5.6 Sol 收費 5 美元、Claude Fable 5 收費 10 美元,輸出方面收費比較也是類似情況。此外,Kimi K3 運用在編碼工具,具備 90% 快取命中率,可將成本將降低至 0.3 美元。

Kimi K3 之所以具此效率,其中一項可能原因在於,其權重採用 MXFP4、在 input activation 則採用 MXFP8,這 2 種資料類型皆屬相對低精度,因此得以在更少的 VRAM 運行。此外,Kimi K3 的 2.8 兆參數中,每一次僅有 1,042 億參數會被啟動。

值得一提的是,月之暗面在說明文件僅提及,部分編碼測試運用 NVIDIA H20 晶片運行 Kimi K3。這是一款相當低階的晶片,與受到出口管制的 Blackwell 架構晶片不同,H20 不具備對 MX 浮點類型的原生支援。

反過來說,可能意味著 Kimi K3 各項最佳化,使其特別適合在低階硬體運行。進一步推測,若將它運行在 Blackwell 架構晶片或其他原生支援 MXFP 的晶片上,或許能比各項基準測試所呈現的更具成本效益。這部分需要靜待更多官方或民間數據,才能驗證推測。

此外,Kimi K3 並未採用傳統不斷擴張的 KV 儲存機制,而是仰賴名為 Kimi Delta Attention(KDA)的固定大小狀態處理器,理論上能同時節省 VRAM 和執行時間。其混合專家(Mixture of Experts,MoE)架構特別稀疏,每一次在 896 位專家僅有 16 位會被啟動,進一步促成更低的推理成本。

整體來說,月之暗面在推理各個層面力求最佳化,以避免不必要的額外負擔,並壓低推理成本。

這對 Anthropic 和 OpenAI 而言應是壞消息,自身擁有運算晶片和資源的企業和開發者,能夠自行運用、微調 Kimi K3,以滿足各式需求。而且這款「免費」軟體,表現與目前市場上的閉源模型幾乎不相上下,運行成本卻低很多。但要注意的是,開源權重(open-weight)並不等於開源(open-source),其訓練過程和資料集依舊是月之暗面的獨門祕方。

最後,月之暗面採用專屬 Kimi K3 License 授權方式,「如果被授權人及其關聯公司在任何連續 12 個月內總收入超過 2,000 萬美元(或等值貨​​幣),則被授權人必須與月之暗面另行簽訂協議,方可將軟體或衍生作品用於任何商業用途。」

(首圖為月之暗面創辦人暨執行長楊植麟,來源:影片截圖)

延伸閱讀:

想請我們喝幾杯咖啡?

icon-tag

每杯咖啡 65 元

icon-coffee x 1
icon-coffee x 3
icon-coffee x 5
icon-coffee x

您的咖啡贊助將是讓我們持續走下去的動力

總金額共新臺幣 0
《關於請喝咖啡的 Q & A》