你家筆電也能跑頂級 AI 了,只是要很有耐心
還記得以前想跑個像樣的 AI 模型,得先準備一張好幾萬塊的顯卡,或是每個月付雲端伺服器租金嗎?現在有人做出一個神奇的推論引擎 Colibrì,讓你記憶體只有 25GB 的普通電腦,也能跑 7440 億參數的超大語言模型 GLM-5.2。
這不是什麼黑魔法,而是換了一個思路:與其把整頭大象塞進冰箱,不如每次只拿你需要的部位。
為什麼以前跑不了?記憶體就是最大的門檻
GLM-5.2 是什麼來頭?它是中國 AI 公司智譜 AI(Z.ai)的旗艦模型,最長能處理 100 萬個 token 的上下文(大概是一本長篇小說的長度),部分測試表現甚至超過 Claude Opus 4.7。這種等級的模型,參數量高達 7440 億個。
你可以把參數想像成模型的「神經元」。神經元越多,模型越聰明,但也越吃資源。就算用最激進的壓縮技術,這種規模的模型通常還是需要 數百 GB 的記憶體或顯存——你家電腦根本裝不下。
這也是為什麼以前只有企業或研究機構能玩得起。一般使用者要嘛付錢用 API,要嘛乾脆放棄。
Colibrì 的解法:像 Spotify 串流音樂一樣載入模型
開發者 vforno 發現了 GLM-5.2 的一個關鍵設計:Mixture-of-Experts(MoE),中文可以想成「專家混合制」。
這個架構很聰明:7440 億參數聽起來很嚇人,但每次回答問題時,其實只會叫醒其中一小群「專家」來處理,真正活躍的參數大概只有 400 億個。就像醫院裡有上千名醫生,但你看感冒時,只會掛耳鼻喉科,不會把全院都叫來。
Colibrì 的做法就是把這些「專家」分開放:
- 常駐記憶體的部分:判斷重點的注意力機制、把文字轉成數字的嵌入層,約 170 億參數,壓縮到 4bit 後約 9.9 GB,一直待在 RAM 裡
- 放 SSD 的部分:2 萬多個專家,總共約 370 GB,平常睡在硬碟裡,需要時才叫醒
這就像你手機裡的 Spotify——歌單有幾萬首,但只會把最近常聽的幾首快取在本地,其他的串流載入。
兩層快取聰明排程,越用越順
光是「需要才載入」還不夠快,Colibrì 加了兩道保險:
第一層:LRU 快取
最近用過的專家,暫時留在 RAM 裡不趕走。如果你連續問類似的問題,這些專家就不用重新從 SSD 讀取。
第二層:學習型快取
系統會記錄你每次對話常用哪些專家,下次開機時優先把這些預載到空閒的 RAM。就像 Netflix 預載你「可能會看」的下一集。
這套機制讓冷啟動(第一次用)和熱啟動(用過一陣子後)的體驗差很多。
代價是什麼?速度換空間
天下沒有白吃的午餐。Colibrì 的妥協在 速度。
開發者測試的環境是 12 核心 CPU、25GB RAM 的電腦,結果:
| 狀態 | 生成速度 |
|---|---|
| 快取全空(冷啟動) | 每秒約 0.05~0.1 個 token |
| 快取預熱後 | 會快一些,但仍遠不及 GPU 加速 |
多慢?GPT-4 那種等級的服務,每秒能產幾十個字;Colibrì 冷啟動時,產一個字要 10~20 秒。問個簡單問題,可能要等好幾分鐘才看到回答。
但對某些場景來說,這個交換值得考慮:
- 不想把資料送上雲端(處理敏感文件、公司機密)
- 網路不穩或沒網路(偏鄉、國外旅遊、斷網環境)
- 想完全免費、無用量上限地玩大模型
- 只是偶爾需要,不值得付月費租 GPU
你需要什麼設備?
Colibrì 的門檻比你想的低,但還是有基本需求:
- 作業系統:Linux,或 Windows 的 WSL2
- 編譯器:支援 OpenMP 的 GCC
- CPU:要有 AVX2 指令集(近幾年的 Intel/AMD 處理器都有)
- 記憶體:16GB 以上(建議 25GB 比較舒服)
- 硬碟:370 GB 的 NVMe SSD 空間,放模型檔案
注意:完全不需要 GPU。這是純 CPU 運算的方案,也是為什麼這麼慢。
整個執行引擎只有約 1300 行 C 語言,沒有任何外部依賴——不用裝 Python、不用裝 PyTorch,編譯完直接跑。
這對台灣使用者意味著什麼?
台灣的網路環境和電價,讓「本地跑大模型」這件事變得更有吸引力:
- 雲端 API 費用:以 GLM-5.2 等級的模型,每百萬 token 可能要價數百到上千台幣,用量大一個月輕鬆破萬
- Colibrì 成本:一次性下載 370GB,之後電費而已(雖然 CPU 滿載跑幾小時也是錢,但比雲端租金便宜多了)
當然,這不是給趕時間的人用的。如果你是要交報告、趕提案,還是付錢用 API 比較實際。但如果你是研究人員、資安從業者、或單純想體驗「我家電腦也能跑頂級 AI」的成就感,Colibrì 開了一扇門。
現在就能試
Colibrì 已經開源在 GitHub,搜尋 JustVugg/colibri 就能找到。專案說明有詳細的編譯步驟,也有預先編譯好的模型下載連結。
要準備的東西很明確:一台記憶體夠大的電腦、一顆容量夠大的 NVMe SSD,還有——很多耐心。
試試看吧,或許你家那台「好像還能再用幾年」的筆電,還有你想不到的潛力。