跳至主要內容
Mark Ku's Blog

開場白

google/embeddinggemma-2 只有 740M,但官方 model card 寫的是它用同一組 768 維向量,同時扛文字、圖片、影片、音訊四種模態,context window 還拉到 8,192 token。這集也會聊到一個被下載 1.5 萬次、專門把 AI 腔文章改到像真人寫的 jialinyyzz/humanizer,以及一個把 27B 壓進單張 16GB 顯卡就能跑的量化實驗 OrcaSAQ-2-Cyber-27B。手機裝得下的向量搜尋引擎到底能拿來幹嘛,等一下告訴你。

本期精選

1. google/embeddinggemma-2:手機也裝得下的多模態向量引擎

  • 這是什麼: 這不是聊天模型,是一個 embedding 模型,任務是把文字、圖片、影片、音訊都投影到同一個向量空間裡方便做檢索。740M 參數,Apache-2.0 授權,非 gated,不用申請就能下載。
  • 能用在哪些場景:
    1. 工程師把公司內部文件、會議截圖、錄音檔丟進本機向量庫做私有知識庫問答:官方 model card 標示文字、影像、影片、音訊共用同一個 768 維向量空間,context 8,192 token,所以同一套索引就能跨模態檢索,資料不用離開自己的機器。
    2. 做離線行動 App 的語意搜尋:Google 開發者部落格標示量化後在 Pixel 11 Pro 只需約 191MB(純文字權重)到 567MB(完整多模態)的 active RAM,搜尋功能可以整個做在裝置上,不用打 API。
    3. 自架 vector DB 想省儲存的人:官方說明提到用 Matryoshka Representation Learning,可把輸出向量從 768 維動態截斷到 512、256、128 維,官方標示最多 6 倍儲存縮減,索引量大的話直接反映在硬碟與記憶體成本上。
  • 跑得動嗎: 官方 model card 只寫「designed to run on consumer hardware such as mobile devices and laptops」,沒有直接給出 VRAM 數字;但精度上有明確要求:「Run inference in bfloat16 or float32. Do not use float16.」,理由是啟動值範圍超出 float16 動態範圍會產生 NaN 或劣化的向量。架構可模組化載入,270M(文字/程式碼)、440M(+視覺)、570M(+音訊)、740M(全多模態)四種組合都投影到同一向量空間。
  • 本期聲量: HF 熱度 202(364 次下載、205 個讚)。
  • 跟同類比: 跟自家前代 EmbeddingGemma 比,官方說法是 context window 拉大為 4 倍(8,192 token),並從純文字擴張到五種模態共用同一向量空間;官方 model card 列出的 MTEB 成績為多語平均 61.36、程式碼 NDCG@10 78.68、影像 64.64、影片 Hit@1 50.67、音訊 MRR@10 69.54。
  • 怎麼取得: README 給兩條路,sentence-transformers 的 SentenceTransformer("google/embeddinggemma-2"),或 transformers 的 AutoProcessor 搭配 AutoModel.from_pretrained();model card 註明部署需遵守 Gemma Prohibited Use Policy。
  • 連結: huggingface.co/google/embeddinggemma-2

2. jialinyyzz/humanizer:把 AI 腔改成人話,但數字一個都不准改

  • 這是什麼: 基底是 google/gemma-4-12B 的 12B 微調模型,中英雙語,任務非常專一,就是把 AI 寫的草稿改寫成像真人手寫的文字。權重以 GGUF、safetensors、MLX 三種格式提供,授權 Apache 2.0。
  • 能用在哪些場景:
    1. 工程師寫技術文件或週報:先讓大模型打草稿,再用本機 humanizer 把 AI 腔改掉,model card 強調的約束是「Every fact, number, unit, date, name and quotation must survive unchanged」,所以版本號、效能數據、日期不會在改寫中被動到。
    2. 稿子不能上雲端的場合:內部報告、客戶提案含敏感資訊時,用 GGUF 在自己筆電完全離線跑,README 直接給了 llama-server 的啟動指令。
    3. Mac 使用者想在 Apple Silicon 上用:README 附了 mlx_lm.convert --hf-path jialinyyzz/humanizer 的轉檔指令,model card 並標示在 Apple M 系列晶片上峰值記憶體約 6.2GB(2-bit)到 13.7GB(Q8_0)。
  • 跑得動嗎: model card 逐檔列出量化版本與記憶體需求,Q8_0(檔案 12.7GB)標「32 GB of memory or more. Recommended.」、Q6_K(10.0GB)標「16 GB of memory」、Q4_K_M(7.6GB)標「About 14 GB of memory」、Q3-QAT(5.6GB)標「12 GB of memory」、IQ2_XS-QAT(3.9GB)標「8 GB of memory, the smallest」。原始 BF16 權重約 24GB。
  • 本期聲量: HF 熱度 370(15.1k 次下載、378 個讚)。
  • 跟同類比: 作者在 Hugging Face 部落格〈We built an AI humanizer and never let it see a detector〉說明訓練全程沒有把任何 AI 偵測器當成 reward,人類側用未經加工的真人文章,AI 側則讓大模型從該篇人類文章反推出草稿。model card 標示在 Originality.ai 最嚴格設定下有 95% 的改寫被判為人類(前一版為 88%),英文改寫 420 篇中有 376 篇通過事實查核。
  • 怎麼取得: README 給 llama.cpp 的 llama-server -m humanizer-12b-Q8_0.gguf -c 8192 -np 1 -ngl 99,也列了 vllm serve "jialinyyzz/humanizer" 與 transformers 直接載入兩種方式。
  • 連結: huggingface.co/jialinyyzz/humanizer

3. orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF:27B 塞進單張 16GB 顯卡

  • 這是什麼: 27B 參數的量化模型,血緣是 Qwen/Qwen3.8-27B(經作者自己的 orcarouter/Qwen3.8-27B-Uncensored 再量化),GGUF 格式,Apache-2.0。model card 明寫定位是「local deployment · coding · tool use · reasoning · defensive red teaming · vulnerability research · authorized security testing」,也就是給授權情境下的資安研究與紅隊演練用。
  • 能用在哪些場景:
    1. 做授權滲透測試或紅隊演練的工程師在隔離環境自架助手:本機跑代表目標系統資訊不必送進雲端 API。
    2. 想在單張 16GB 顯卡上跑 27B 的人:Ollama 一行 ollama run hf.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF 就能起,model card 的 llama-cli 範例開到 32K context,可以當離線的寫程式、工具呼叫助手。
    3. 研究量化極限的人:這包是「BF16 54.7GB 壓到 15.7GB」的實際案例,model card 附了 perplexity、token agreement、KLD 等指標可以對照壓縮後的劣化程度。
  • 跑得動嗎: 單一量化檔 15.7GB(原始 BF16 為 54.7GB)。model card 表格標示 llama.cpp 峰值 VRAM 為「14.9 GB」(DFlash2 off)與「18.1 GB」(DFlash2 on),吞吐分別為 20.5 tok/s 與 27.6 tok/s;作者註明測試條件是「Single stream, greedy, measured in the official llama.cpp CUDA container」,但頁面上沒有寫測試所用的顯卡型號。
  • 本期聲量: HF 熱度 215(18.1k 次下載、415 個讚)。
  • 跟同類比: 跟一般 llama.cpp 常見的 Q4_K_M 這類人人可複現的量化不同,作者把 SAQ-2 描述為「proprietary sensitivity-aware mixed-precision quantization system」,並明講「Detailed quantization methodology, calibration strategy, precision allocation and packing techniques are not currently disclosed」,壓縮率漂亮但方法不公開。作者自己也掛了警語「This model is uncensored.」,模型衍生自 abliterated checkpoint,且「Guardrails, filtering and policy enforcement are the deployer's responsibility.」,部署前務必確認自己的使用情境屬於授權範圍。
  • 怎麼取得: README 給 llama.cpp 的 llama-cli -m ./OrcaSAQ-2-27B-Uncensored-GGUF/OrcaSAQ-2-27B-Uncensored.gguf -ngl 99 -c 32768,或 Ollama 的 ollama run hf.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF。
  • 連結: huggingface.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF

結尾段落

三個選題其實指向同一件事,模型不再只拚參數量,而是拚「怎麼塞進一般人的機器裡」,不管是 740M 的多模態 embedding、12B 的任務型微調,還是 27B 壓到 15.7GB 的量化實驗,省的都是同一塊 VRAM 跟記憶體。如果只能先裝一個來研究,jialinyyzz/humanizer 的量化階梯最完整,8GB 記憶體就能起步。下集再見。

作者

Mark Ku

10 年以上的軟體工程師,做過北美電商與 AI SaaS 訂閱收費系統。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可。

站長的公司

Vibe Coding 架構規劃與陪跑

團隊已經用 AI 做出小工具,卻怕壞了沒人修、需求一變就不敢改?226 Network 幫你把程式放進 Git、密碼另外保管、排程搬上固定主機,再補上交接文件與測試。

熱門文章

View all
Mark Ku
··634

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··471

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··267

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··214

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··210

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調
Mark Ku
··209

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取