DeepGrove Maple-Preview:iPhone 跑 AI 快 13 倍,記憶體只要 7.69GB

DeepGrove Maple-Preview:iPhone 跑 AI 快 13 倍,記憶體只要 7.69GB

DeepGrove Maple-Preview:iPhone 跑 AI 快 13 倍,記憶體只要 7.69GB

你的手機 AI 被「減肥」騙了很久

講到手機跑 AI,大家第一個想到的做法就是「量子化」——簡單說就是把原本很肥的模型硬塞進手機,像把西裝改小給小孩穿,能穿但彆扭。

DeepGrove 這次直接說:「這個思路從根本就錯了。」

他們新推出的 Maple-Preview 不是把大模型砍小,而是從設計階段就用 3 位元(Ternary)打造,讓「輕量」和「強大」不再是二選一。


數字說話:13 倍快、記憶體省超多

速度對比(同樣在 iPhone 跑)

模型每秒輸出字元數相對速度
Bonsai 27B(二進位版)基準1x
Maple-Preview13 倍13x

實測影片裡,同樣的 prompt 丟進去,Maple-Preview 已經寫完答案,Bonsai 27B 還在載入。

記憶體用量驚人地省

處理 13 萬 1000 個 token(大概是一本短篇小說的長度)時:

  • Maple-Preview:7.69 GB
  • 同級別模型:動輒 12-15 GB 起跳

這代表什麼?你的 iPhone 15 Pro(8GB RAM)終於能舒服地跑長篇分析了,不用擔心被系統殺掉。


為什麼它能這麼強?關鍵在「原生 3 位元」

傳統做法的問題

大多數手機 AI 是這樣做的:

  1. 拿一個很強的大模型(比如 700 億參數)
  2. 訓練完之後,把數字精度從 16 位元砍到 4 位元甚至 2 位元
  3. 塞進手機,祈禱效能別掉太多

DeepGrove 說這就像「先拍 4K 影片再壓成 480p」,畫質損失是遲早的事。

Maple-Preview 的做法

  • 總參數 202 億,但活躍參數只有 14 億 9000 萬(MoE 架構,你可以想成「需要時才叫醒專家」)
  • 從頭就用 3 位元訓練,不是後來砍的
  • 執行精度和訓練精度一致,沒有「壓縮損耗」

結果:同樣是手機等級的模型,Maple-Preview 在數學推理、程式碼、長文理解都碾壓對手。


實測成績:連國際數學奧林匹亞都會寫

DeepGrove 放出的 benchmark 裡,Maple-Preview 不只贏過 Bonsai 27B,還超過:

  • Qwen3.5 35B-A3B
  • GPT-OSS-20B
  • GLM-4.7-Flash

最誇張的是:它解得出 國際數學奧林匹亞(IMO) 等級的題目。這種難度以前要雲端大模型才碰得起,現在 iPhone 離線就能跑。


長文處理也不虛:記憶體幾乎不膨脹

很多人忽略的一個痛點:AI 記得越多,吃記憶體越兇

Maple-Preview 在這點做了特殊優化。橫軸是處理的文字長度,縱軸是額外記憶體用量——別人的線是往上飆,Maple-Preview 幾乎平平的。

這對要讀長篇論文、整理會議紀錄、或者讓 AI 記住整本小說情節的人來說,差很多。


怎麼試?已經開源了

Maple-Preview 是 MIT License 完全開源,不用錢、不用申請、不用等審核。

下載位置:

  • Hugging Face:deepgrove/maple-preview
  • 官網:deepgrove.ai/maple-preview

技術細節都在 Model Card 裡,想研究架構的人可以挖。


這對台灣人意味著什麼

  1. 隱私更安心:敏感資料不用上傳雲端,律師、醫生、會計師處理客戶資訊時特別有用
  2. 沒網路也能用:通勤隧道、山上、國外漫遊,AI 照跑
  3. 不用訂閱費:開源模型,省下每月幾百塊的 API 錢

當然,它還是「Preview」預覽版,正式版會更強。但現在這個版本已經夠讓你重新思考「手機到底能做多複雜的 AI 任務」。


現在就能做的事

  1. 打開 Hugging Face 搜尋 deepgrove/maple-preview
  2. 用 LM Studio 或類似工具載入(需要一點技術門檻)
  3. 或者等一兩週,一定會有人做出一鍵安裝的 App

本地 AI 的時代真的來了,而且這次是又快又省又免費。

現在就去下載試試看吧。