開場白
本期聲量冠軍是 Ternary-Bonsai-2-27B-gguf,官方標榜筆電就能跑 27B、檔案不到 8GB,一週下載 40.5 萬次。同集還有手機級 MiniCPM5-2B,跟 Mac mini 24GB 能跑 35B 的 LoRA:Edge0-35B-A3B-preview。三顆模型各自的硬體門檻跟隱藏但書,等一下一次講給你聽。
本期精選
1. Ternary-Bonsai-2-27B-gguf:把 27B 塞進不到 8GB 的三元量化版
- 這是什麼:這是 prism-ml 針對 Qwen3.8-27B 系列做的三元(ternary)量化 GGUF 版本,27B 參數、Apache-2.0 授權,主打把原本 53.8GB 的 F16 版本大幅瘦身。官方 model card 自述是「5.9 GB language model (down from 54 GB FP16)」。
- 能用在哪些場景:
- 接案工程師手上有客戶的機敏合約或內部文件,不能丟雲端 API,這時候用一台有獨顯的筆電離線跑 27B 級模型做摘要與問答,官方 model card 把用途明講為「privacy-sensitive and offline settings」與「laptop-local 27B agents」。
- 團隊只有一張消費級顯卡,卻想自架內部問答服務。PQ2_0 檔案只有 7.21GB,官方定位是「single-GPU and commodity-GPU serving」,不用為了跑 27B 去租 A100。
- 用 Mac 開發的工程師想要一個支援 thinking/reasoning 模式的本機 coding 助手,官方吞吐表列出 Apple M5 Pro 解碼 28.1 tok/s、M5 Max 47.0 tok/s(皆為 PQ2_0),屬於還能互動的速度區間。
- 跑得動嗎:官方 model card 列出三個檔案:PTQ1_0(dense trits)5.95GB、PQ2_0(2-bit slots)7.21GB,對照 F16 參考版 53.8GB,另有選配的 vision tower(Q8_0)0.63GB。吞吐部分 card 還列出 RTX 5090 129.9 tok/s、H100 SXM 113.9 tok/s(同樣是 PQ2_0 解碼)。要注意的是官方沒有標示最低 RAM/VRAM 下限,這塊沒有數字就不好幫忙猜。
- 本期聲量:HF 熱度 881(40.56 萬次下載、926 個讚),同家族目前另有 2 個量化/重打包版本。
- 跟同類比:作者自己的對照表把它放進同一個 Qwen3.8-27B 量化家族比較:14 項 benchmark 平均 84.78,贏過傳統 IQ2_XXS 的 72.59,只小輸給體積大三倍的 UD-Q4_K_XL(85.18),card 的說法是「far above the conventional IQ2_XXS build at less than two-thirds of its footprint」。不過第三方 MindStudio 的試用心得提到,它在視覺與創意任務表現不錯,但修 bug 跟基本 UI 程式碼生成不太穩定,成績看任務而定。
- 怎麼取得:README 給的指令是
hf download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PQ2_0.gguf --local-dir .,再用llama-cli -m ... -ngl 99 -fa on -c 32768啟動,或用ollama run hf.co/prism-ml/Ternary-Bonsai-2-27B-gguf:F16。但重要前提是 README 明寫「Stock llama.cpp will not run these files」,要跑起來得先換成 PrismML 自己的 llama.cpp fork,這個坑要先知道再動手裝。 - 連結:huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf
2. MiniCPM5-2B:小到能塞進手機的地端 agent 底座
- 這是什麼:OpenBMB 出的 2B 參數模型,Apache-2.0 授權,官方同時備好 GGUF/MLX/GPTQ/LiteRT 四種格式,明確瞄準裝置端與資源受限場景。
- 能用在哪些場景:
- App 開發者想在 Android/iOS 端內建離線助理,不想每個使用者都燒 API 費用。官方直接提供
.litertlm版本,model card 標示 LiteRT-LM 支援「Android / iOS / desktop / IoT, CPU + GPU」。 - 想自架一個常駐 agent 幫忙整理 log 或呼叫內部 API。官方把用途寫成「local assistants, coding agents, tool-use workflows」,並標示 BFCL v4 工具呼叫得分 66.6。
- 需要在單機上處理長文件(法規、會議逐字稿)但沒有顯卡預算。官方標示原生 131,072 token 長上下文,可用 GPTQ 4bit 版在低階硬體上跑。
- App 開發者想在 Android/iOS 端內建離線助理,不想每個使用者都燒 API 費用。官方直接提供
- 跑得動嗎:官方沒有標示具體 RAM/VRAM 門檻,model card 也沒有任何 tokens/s 數據。有標示的是格式選項:官方量化倉庫包含 MiniCPM5-2B-GGUF(llama.cpp/Ollama/LM Studio)、MiniCPM5-2B-MLX(Apple Silicon)、MiniCPM5-2B-GPTQ(4bit),card 對硬體的描述僅止於定位語「on-device, local deployment, and resource-constrained scenarios」。這裡只能從 2B 參數量跟四種格式反推它應該跑得動輕量裝置,實際多快官方沒給,這段算推估不算保證。
- 本期聲量:HF 熱度 338(35.72 萬次下載、1.6 千個讚),同家族目前另有 2 個量化/重打包版本。
- 跟同類比:OpenBMB 官方的比較表主張它 34 項平均 53.9,贏過 LFM2.5-2.6B(33.2)、Qwen3.5-2B(28.0)、Gemma-4-E2B-it(24.6),甚至壓過 4B 級的 Qwen3.5-4B(51.1),card 的措辭是「remains competitive with 4B-class models overall」。第三方評測站 eesel AI 與 buildfastwithai 則提醒這是 OpenBMB 自選比較集內的成績,benchmark 領先不等於生產環境可靠,建議拿自己的任務先試。
- 怎麼取得:README 的 transformers 範例是
AutoModelForCausalLM.from_pretrained("openbmb/MiniCPM5-2B", torch_dtype="auto", device_map="auto"),要開服務則官方給vllm serve openbmb/MiniCPM5-2B --port 8000,走 llama.cpp 則是llama-server -m MiniCPM5-2B-F16.gguf -a MiniCPM5-2B --port 8080。 - 連結:huggingface.co/openbmb/MiniCPM5-2B
3. Edge0-35B-A3B-preview:拿 LoRA adapter 在 Mac mini 上跑 35B
- 這是什麼:Edge0 團隊發的 LoRA/adapter 版本,基底是 35B 的 MoE 模型 Qwen3.6-35B-A3B,用 int4 量化搭配 LoRA 與 prerouter adapter,Apache-2.0 授權,官方明講後端是 MLX、目前鎖定 Apple Silicon。
- 能用在哪些場景:
- 用 Apple Silicon 開發的工程師想在本機跑 35B 級模型做多語問答。官方標示峰值活躍記憶體只要 2.9 GiB,並列出 Mac mini M4 Pro(24GB)解碼 14.9 至 17.7 tok/s 的實測表。
- 想同時服務多種任務又不想每次都重新量化。card 把用途寫成「batch serving via LoRA adapters without re-quantization」,適合要掛多組 adapter 的自架服務。
- VRAM 吃緊但硬碟夠大的邊緣部署情境。card 的定位語是「edge / on-device inference where GPU VRAM is scarce and storage is fast」,官方標示模型總容量 19.6GB。
- 跑得動嗎:官方標示得相當完整:峰值活躍記憶體 2.9 GiB(短上下文)、總儲存 19.6GB,採 4-bit(int4)搭配 LoRA 與 prerouter adapter,後端是 MLX,card 直接寫「currently targets Apple Silicon」,並警告「Long contexts grow the KV cache; use shorter contexts to keep peak memory at 3 GiB」。速度方面官方列出 Mac mini M4 Pro 24GB 解碼 14.9 至 17.7 tok/s、prefill 冷/熱啟動 113/140 tok/s。
- 本期聲量:HF 熱度 250(5.25 萬次下載、3.4 千個讚)。
- 跟同類比:值得點出的是作者只跟自己的 fp16 基底 Qwen3.6-35B-A3B 比,沒有跟其他邊緣推論方案對照:官方表格顯示 int4 版平均 79.2 分,對上 fp16 的 83.2 分,作者自述平均退化 3.9 分。另外 card 自己標明這是「early preview release」,且直言 agent 能力「currently weak」,不適合長程自主任務,這個限制是作者本人寫的,介紹時得一起帶到。
- 怎麼取得:README 要求先裝官方框架
pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]',再huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir ./Edge0-35b-a3b-preview,然後edge0 chat --name edge0-35b對話,或edge0 serve --port 8085開 OpenAI 相容 API;card 另有提供 mlx_lm 的load("Edge0/Edge0-35B-A3B-preview")走法。 - 連結:huggingface.co/Edge0/Edge0-35B-A3B-preview
結尾段落
這三顆選題有個共同點,都在想辦法把大模型塞進小記憶體:Ternary-Bonsai 靠三元量化把 27B 壓到 8GB 內,MiniCPM5-2B 直接瞄準手機格式,Edge0 則是拿 LoRA 在 Mac mini 上推 35B。如果你手上剛好有一台有獨顯的筆電、又要處理不能上雲的文件,Ternary-Bonsai-2-27B-gguf 大概是本期最值得先點進 model card 把門檻看清楚的一個。下週三再來看看又有哪些地端模型冒出頭。




























留言