你的手機 AI 被「減肥」騙了很久
講到手機跑 AI,大家第一個想到的做法就是「量子化」——簡單說就是把原本很肥的模型硬塞進手機,像把西裝改小給小孩穿,能穿但彆扭。
DeepGrove 這次直接說:「這個思路從根本就錯了。」
他們新推出的 Maple-Preview 不是把大模型砍小,而是從設計階段就用 3 位元(Ternary)打造,讓「輕量」和「強大」不再是二選一。
數字說話:13 倍快、記憶體省超多
速度對比(同樣在 iPhone 跑)
| 模型 | 每秒輸出字元數 | 相對速度 |
|---|---|---|
| Bonsai 27B(二進位版) | 基準 | 1x |
| Maple-Preview | 13 倍 | 13x |
實測影片裡,同樣的 prompt 丟進去,Maple-Preview 已經寫完答案,Bonsai 27B 還在載入。
記憶體用量驚人地省
處理 13 萬 1000 個 token(大概是一本短篇小說的長度)時:
- Maple-Preview:7.69 GB
- 同級別模型:動輒 12-15 GB 起跳
這代表什麼?你的 iPhone 15 Pro(8GB RAM)終於能舒服地跑長篇分析了,不用擔心被系統殺掉。
為什麼它能這麼強?關鍵在「原生 3 位元」
傳統做法的問題
大多數手機 AI 是這樣做的:
- 拿一個很強的大模型(比如 700 億參數)
- 訓練完之後,把數字精度從 16 位元砍到 4 位元甚至 2 位元
- 塞進手機,祈禱效能別掉太多
DeepGrove 說這就像「先拍 4K 影片再壓成 480p」,畫質損失是遲早的事。
Maple-Preview 的做法
- 總參數 202 億,但活躍參數只有 14 億 9000 萬(MoE 架構,你可以想成「需要時才叫醒專家」)
- 從頭就用 3 位元訓練,不是後來砍的
- 執行精度和訓練精度一致,沒有「壓縮損耗」
結果:同樣是手機等級的模型,Maple-Preview 在數學推理、程式碼、長文理解都碾壓對手。
實測成績:連國際數學奧林匹亞都會寫
DeepGrove 放出的 benchmark 裡,Maple-Preview 不只贏過 Bonsai 27B,還超過:
- Qwen3.5 35B-A3B
- GPT-OSS-20B
- GLM-4.7-Flash
最誇張的是:它解得出 國際數學奧林匹亞(IMO) 等級的題目。這種難度以前要雲端大模型才碰得起,現在 iPhone 離線就能跑。
長文處理也不虛:記憶體幾乎不膨脹
很多人忽略的一個痛點:AI 記得越多,吃記憶體越兇。
Maple-Preview 在這點做了特殊優化。橫軸是處理的文字長度,縱軸是額外記憶體用量——別人的線是往上飆,Maple-Preview 幾乎平平的。
這對要讀長篇論文、整理會議紀錄、或者讓 AI 記住整本小說情節的人來說,差很多。
怎麼試?已經開源了
Maple-Preview 是 MIT License 完全開源,不用錢、不用申請、不用等審核。
下載位置:
- Hugging Face:
deepgrove/maple-preview - 官網:
deepgrove.ai/maple-preview
技術細節都在 Model Card 裡,想研究架構的人可以挖。
這對台灣人意味著什麼
- 隱私更安心:敏感資料不用上傳雲端,律師、醫生、會計師處理客戶資訊時特別有用
- 沒網路也能用:通勤隧道、山上、國外漫遊,AI 照跑
- 不用訂閱費:開源模型,省下每月幾百塊的 API 錢
當然,它還是「Preview」預覽版,正式版會更強。但現在這個版本已經夠讓你重新思考「手機到底能做多複雜的 AI 任務」。
現在就能做的事
- 打開 Hugging Face 搜尋
deepgrove/maple-preview - 用 LM Studio 或類似工具載入(需要一點技術門檻)
- 或者等一兩週,一定會有人做出一鍵安裝的 App
本地 AI 的時代真的來了,而且這次是又快又省又免費。
現在就去下載試試看吧。