Mark Ku's Blog

開場白

這週 Hugging Face 熱度榜被小米 MiMo V2.6 家族整個洗版,官方旗艦範例指令要 8 張顯卡起跳,但家族裡的 MiMo-V2.6-Distill-Qwen-9B 卻是唯一一般顯卡有機會跑起來的版本,MIT 授權,還有 llama.cpp 官方團隊親自出的 GGUF。這集另外挑了兩顆同樣能落地的模型:1.2B 就能把發票掃描轉成結構化表格的 TeleOCR,還有純 CPU 就能跑、加新分類不用重新訓練的 GLiNER2.5-Decide,等一下告訴你這三顆各自適合塞進哪種工作流。

本期精選

1. MiMo-V2.6-Distill-Qwen-9B:小米旗艦洗版週,唯一消費級顯卡跑得動的版本

  • 這是什麼: 小米 MiMo V2.6 家族的 9B 蒸餾版語言模型,以 Qwen3.5-9B 為基底蒸餾而成,MIT 授權,官方定位在 coding、visual coding 與 cybersecurity 三大應用方向。
  • 能用在哪些場景:
    • 個人開發者想要一個完全離線的 coding agent 改自己的私有 repo,程式碼不用送上任何雲端。官方 model card 把 coding 列為四大訓練領域之首,Code 資料佔比 29.9%。
    • ggml-org 出的 GGUF 版本附了 mmproj 視覺投影檔,可以直接丟截圖請它照畫面刻版型、抓 UI 問題,官方把這類任務稱為 visual coding,訓練資料裡 Visual 佔 27.4%。
    • 資安或維運團隊想在內網做終端機操作與弱點分析的半自動化演練,官方列 cybersecurity 為四大訓練領域之一(Cyber 佔 14.2%),並自評 Terminal Bench 拿到 37.1 分。
  • 跑得動嗎: 官方 model card 沒有標示 VRAM 需求,只寫可以在 llama.cpp、Ollama、LM Studio 等相容工具上瀏覽量化版本使用,列出 53 個量化選項。實際數字要看第三方量化頁面:ggml-org 的 Q8_0 版本是 9.53 GB(頁面註明含 Q8_0 mmproj 視覺編碼器),bartowski 版本則有 Q4_K_M 5.84 GB、Q5_K_M 6.88 GB、Q6_K 7.79 GB、Q8_0 9.55 GB,最小的 IQ2_M 只要 3.54 GB。bartowski 頁面給的選型原則是挑選檔案大小比你 GPU 總 VRAM 小 1 到 2 GB 的量化版本。
  • 本期聲量: HF 熱度 516,8.8k 次下載,527 個讚。
  • 跟同類比: 官方 model card 只拿自己跟基底 Qwen3.5-9B 比,宣稱 SWE Verified 61.1、SWE Pro 44.6、AutomationBench 30.3、Terminal Bench 37.1 全面領先,這些都是作者自評數字。真正的分水嶺其實是能不能自架,同期旗艦 MiMo-V2.6-Pro-RL 的 model card 自己寫是 Sparse MoE 架構、1.02T 總參數/42B 啟動,範例指令是 8 張卡的 tensor-parallel-size,一般人只能看熱鬧。
  • 怎麼取得: ggml-org 的 GGUF 頁面給的是一行指令 ollama run hf.co/ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0,或用 llama.cpp 的 llama serve -hf ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0。想自架 API 的話,官方 model card 給的指令是 sglang serve --model-path XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B --reasoning-parser mimo,另外也支援 vLLM 與 Docker。
  • 連結: XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B

2. TeleOCR:1.2B 就把發票、合約、講義轉成結構化文字

  • 這是什麼: XingChen-AGI 出品的文件解析模型,約 1.2B 參數,BF16,apache-2.0 授權,同一個框架處理文字擷取、表格解析與版面/閱讀順序還原。
  • 能用在哪些場景:
    • 行政或會計把手機拍的發票、收據、報價單批次轉成結構化表格,model card 說表格會以 OTSL 格式輸出,另外附工具能轉成 HTML table,可以直接匯入試算表或資料庫。
    • 團隊想把累積多年的 PDF 規格書、合約掃描檔轉成 markdown 灌進 RAG 知識庫,官方強調它是統一框架,同時處理文字、表格與版面還原,不用再拼好幾個工具。
    • 老師或研究生要把含數學式的講義、論文 PDF 轉成可編輯文字,model card 寫公式會輸出成 LaTeX 並用 .... 包住,不用再手動重打公式。
  • 跑得動嗎: 官方 model card 沒有標示 VRAM 或硬體門檻,只列出約 1.2B 參數與 BF16 張量型別。量化是社群路線,card 上原文致謝「Thanks to Nandraj for the GGUF conversion and llama.cpp support!」,官方另外提供 vLLM、SGLang、Docker 三種部署方式。以 1.2B 這個量級推估,量化後應該塞得進消費級顯卡,但這只是從參數量推得的判斷,官方沒有給實際數字。
  • 本期聲量: HF 熱度 526,27.8k 次下載,627 個讚。
  • 跟同類比: 作者在 model card 與論文(arXiv 2608.12898)裡說在 OmniDocBench v1.6 上贏過 pipeline 派的 MinerU 2.5 Pro、PaddleOCR-VL 1.6、GLM-OCR,以及端到端的 OvisOCR2,官方列出的分數是 Overall 96.87、Table TEDS 97.05,這些都是作者自評數字。有兩點要據實講:model card 只掛 Chinese 與 English 語言標籤,沒特別交代繁體中文支援到什麼程度;頁面也提到「We have renamed NaviDC-OCR to TeleOCR」,同名權重在 Hugging Face 上另有 StarDoc-AI 的版本,不宜斷言哪一邊是唯一官方來源。
  • 怎麼取得: model card 給的是 pip install transformers torch pillow,再用 AutoProcessor.from_pretrained(..., trust_remote_code=True) 搭配 AutoModel.from_pretrained(..., trust_remote_code=True, torch_dtype=torch.bfloat16).cuda().eval() 載入。想走純本機輕量路線,可以用 card 上連結的社群 GGUF 版本配 llama.cpp、LM Studio 或 Ollama。
  • 連結: XingChen-AGI/TeleOCR

3. GLiNER2.5-Decide:340M、純 CPU 就能跑的決策分類器

  • 這是什麼: fastino 出的小型分類模型,DeBERTa-v3-large 編碼器,340M 參數,apache-2.0 授權,一次 forward pass 同時判斷多個分類欄位,標籤在呼叫當下才傳入,不用重新訓練。
  • 能用在哪些場景:
    • 客服工單進來時一次判斷意圖、優先級與需不需要轉真人,model card 的範例就是飯店客訴,一次回傳 intent、priority、needs_human 與多標籤的 topics。
    • 當 LLM router 的前置分類器,先用 CPU 判斷這則請求該送哪個模型、走哪條流程,把昂貴的大模型呼叫留給真正需要的案子。
    • 內容或日誌的多標籤打標,因為 label set 是呼叫當下才傳入的 dict,臨時要加一個分類欄位只要改設定,不用換權重。
  • 跑得動嗎: model card 原文寫「Runs on: CPU or GPU, through gliner2」,明確支援純 CPU 執行。編碼器是 DeBERTa-v3-large、340M 參數(頁面 model size 欄位標的是 0.5B)。實際磁碟大小、延遲與吞吐量官方沒有標示,頁面完全沒有速度數字。
  • 本期聲量: HF 熱度 210,19.8k 次下載,212 個讚。
  • 跟同類比: model card 的對照表拿它跟自家 GLiNER2.5-Decide-1B(59.6%)與 JevK5(57.6%)比,這顆 340M 版以 60.2% 平均正確率勝出,測試集是 fastino/fast-decisions,17 個領域各 300 題。作者也主動劃線:「This release is not a general-purpose model. It does not reason, explain, or answer open questions」。對台灣團隊最關鍵的限制是這顆只吃英文,頁面原文寫「The suite is English. Use GLiNER2.5-multi-Decide when the input is multilingual」,中文工單要改用 287M 的多語版。
  • 怎麼取得: pip install gliner2,接著 from gliner2 import AutoExtractor、model = AutoExtractor.from_pretrained('fastino/GLiNER2.5-Decide'),再呼叫 model.classify_text(text, label_dict),label_dict 裡可以同時放多個決策欄位,並針對個別欄位設定 multi_label 與 cls_threshold。
  • 連結: fastino/GLiNER2.5-Decide

結尾段落

這期三顆模型剛好對應三種不同的地端需求:MiMo-V2.6-Distill-Qwen-9B 是唯一擠得進消費級顯卡的小米旗艦血統,TeleOCR 用 1.2B 把文件轉結構化這件事做到能打贏大模型的分數,GLiNER2.5-Decide 則證明分類任務有時候連 GPU 都不用。想先動手裝一個的話,GLiNER2.5-Decide 門檻最低,CPU 就能跑;想省顯卡又要做 coding agent,MiMo-V2.6-Distill-Qwen-9B 值得排進待辦清單。我們下集再見。

作者

Mark Ku

10 年以上的軟體工程師,做過北美電商與 AI SaaS 訂閱收費系統。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可。

站長的公司

Vibe Coding 架構規劃與陪跑

團隊已經用 AI 做出小工具,卻怕壞了沒人修、需求一變就不敢改?226 Network 幫你把程式放進 Git、密碼另外保管、排程搬上固定主機,再補上交接文件與測試。

熱門文章

View all
Mark Ku
··635

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··471

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··268

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··214

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··210

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調
Mark Ku
··209

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取