Colibrì 讓 7440 億參數 AI 在 25GB 記憶體筆電運行:本地跑超大模型的免費方案

Colibrì 讓 7440 億參數 AI 在 25GB 記憶體筆電運行:本地跑超大模型的免費方案

Colibrì 讓 7440 億參數 AI 在 25GB 記憶體筆電運行:本地跑超大模型的免費方案

你家筆電也能跑頂級 AI 了,只是要很有耐心

還記得以前想跑個像樣的 AI 模型,得先準備一張好幾萬塊的顯卡,或是每個月付雲端伺服器租金嗎?現在有人做出一個神奇的推論引擎 Colibrì,讓你記憶體只有 25GB 的普通電腦,也能跑 7440 億參數的超大語言模型 GLM-5.2

這不是什麼黑魔法,而是換了一個思路:與其把整頭大象塞進冰箱,不如每次只拿你需要的部位。


為什麼以前跑不了?記憶體就是最大的門檻

GLM-5.2 是什麼來頭?它是中國 AI 公司智譜 AI(Z.ai)的旗艦模型,最長能處理 100 萬個 token 的上下文(大概是一本長篇小說的長度),部分測試表現甚至超過 Claude Opus 4.7。這種等級的模型,參數量高達 7440 億個

你可以把參數想像成模型的「神經元」。神經元越多,模型越聰明,但也越吃資源。就算用最激進的壓縮技術,這種規模的模型通常還是需要 數百 GB 的記憶體或顯存——你家電腦根本裝不下。

這也是為什麼以前只有企業或研究機構能玩得起。一般使用者要嘛付錢用 API,要嘛乾脆放棄。


Colibrì 的解法:像 Spotify 串流音樂一樣載入模型

開發者 vforno 發現了 GLM-5.2 的一個關鍵設計:Mixture-of-Experts(MoE),中文可以想成「專家混合制」。

這個架構很聰明:7440 億參數聽起來很嚇人,但每次回答問題時,其實只會叫醒其中一小群「專家」來處理,真正活躍的參數大概只有 400 億個。就像醫院裡有上千名醫生,但你看感冒時,只會掛耳鼻喉科,不會把全院都叫來。

Colibrì 的做法就是把這些「專家」分開放:

  • 常駐記憶體的部分:判斷重點的注意力機制、把文字轉成數字的嵌入層,約 170 億參數,壓縮到 4bit 後約 9.9 GB,一直待在 RAM 裡
  • 放 SSD 的部分:2 萬多個專家,總共約 370 GB,平常睡在硬碟裡,需要時才叫醒

這就像你手機裡的 Spotify——歌單有幾萬首,但只會把最近常聽的幾首快取在本地,其他的串流載入。


兩層快取聰明排程,越用越順

光是「需要才載入」還不夠快,Colibrì 加了兩道保險:

第一層:LRU 快取
最近用過的專家,暫時留在 RAM 裡不趕走。如果你連續問類似的問題,這些專家就不用重新從 SSD 讀取。

第二層:學習型快取
系統會記錄你每次對話常用哪些專家,下次開機時優先把這些預載到空閒的 RAM。就像 Netflix 預載你「可能會看」的下一集。

這套機制讓冷啟動(第一次用)和熱啟動(用過一陣子後)的體驗差很多。


代價是什麼?速度換空間

天下沒有白吃的午餐。Colibrì 的妥協在 速度

開發者測試的環境是 12 核心 CPU、25GB RAM 的電腦,結果:

狀態生成速度
快取全空(冷啟動)每秒約 0.05~0.1 個 token
快取預熱後會快一些,但仍遠不及 GPU 加速

多慢?GPT-4 那種等級的服務,每秒能產幾十個字;Colibrì 冷啟動時,產一個字要 10~20 秒。問個簡單問題,可能要等好幾分鐘才看到回答。

但對某些場景來說,這個交換值得考慮:

  • 不想把資料送上雲端(處理敏感文件、公司機密)
  • 網路不穩或沒網路(偏鄉、國外旅遊、斷網環境)
  • 想完全免費、無用量上限地玩大模型
  • 只是偶爾需要,不值得付月費租 GPU

你需要什麼設備?

Colibrì 的門檻比你想的低,但還是有基本需求:

  • 作業系統:Linux,或 Windows 的 WSL2
  • 編譯器:支援 OpenMP 的 GCC
  • CPU:要有 AVX2 指令集(近幾年的 Intel/AMD 處理器都有)
  • 記憶體:16GB 以上(建議 25GB 比較舒服)
  • 硬碟370 GB 的 NVMe SSD 空間,放模型檔案

注意:完全不需要 GPU。這是純 CPU 運算的方案,也是為什麼這麼慢。

整個執行引擎只有約 1300 行 C 語言,沒有任何外部依賴——不用裝 Python、不用裝 PyTorch,編譯完直接跑。


這對台灣使用者意味著什麼?

台灣的網路環境和電價,讓「本地跑大模型」這件事變得更有吸引力:

  • 雲端 API 費用:以 GLM-5.2 等級的模型,每百萬 token 可能要價數百到上千台幣,用量大一個月輕鬆破萬
  • Colibrì 成本:一次性下載 370GB,之後電費而已(雖然 CPU 滿載跑幾小時也是錢,但比雲端租金便宜多了)

當然,這不是給趕時間的人用的。如果你是要交報告、趕提案,還是付錢用 API 比較實際。但如果你是研究人員、資安從業者、或單純想體驗「我家電腦也能跑頂級 AI」的成就感,Colibrì 開了一扇門。


現在就能試

Colibrì 已經開源在 GitHub,搜尋 JustVugg/colibri 就能找到。專案說明有詳細的編譯步驟,也有預先編譯好的模型下載連結。

要準備的東西很明確:一台記憶體夠大的電腦、一顆容量夠大的 NVMe SSD,還有——很多耐心

試試看吧,或許你家那台「好像還能再用幾年」的筆電,還有你想不到的潛力。