Mark Ku's Blog

開場白

這期 Hugging Face 熱度冠軍 Contrastive-LM/CLM-v0.1-8B 不生成文字,靠打分數就讓延遲最多砍 9 倍。同場還有專攻路由審核的 LoRA interfaze-ai/lev,跟免顯卡也能跑的小模型 SupersonicLabs/Julia-1。它憑什麼撐住 52 種語言分類,等一下告訴你。

本期精選

1. Contrastive-LM/CLM-v0.1-8B:不寫字、只對候選打分的排序器

  • 這是什麼:CLM-v0.1-8B 不是用來生成文字的模型,官方說明是把兩個投影頭疊在凍結的 Qwen3-8B 上,專門對「候選項」打分數,用在重排序、動作選擇、驗證這類任務。8B 參數,Apache-2.0 授權,可自由商用。
  • 能用在哪些場景:
    • 自架 RAG 的後端工程師:向量檢索一次撈回上百段候選片段,塞進大模型前可以先用 CLM 重排序、只留前幾段;官方 README 強調 state 與 action 是分開編碼的,action 的 embedding「their embeddings are cached and reused independently」,同一批文件片段重複查詢時不用重算。
    • 在本機跑 tool-calling agent 的人:每一步要從十幾個工具裡挑一個,可以改成把候選動作丟給 CLM 打機率分數,不用再叫 LLM 生一段 JSON 出來解析;官方 model card 寫零樣本情況下「on par with Jev on computer-use, gaming and tool-calling tasks, with up to 9× lower latency」。
    • 做 coding agent 的人:拿它當驗證器,同一個問題產生多個修補方案後用來挑一個;官方標示微調成 verifier 後「SOTA on DeepSWE (81.6%) and Terminal-Bench 2.1 (87.6%), 4–6× faster than Jev」。
  • 跑得動嗎:官方未標示 VRAM 數字。GitHub README 提到要另外起一個 encoder:vllm serve Qwen/Qwen3-8B --runner pooling --max-model-len 2048,並寫「States longer than 2048 tokens are truncated. For longer states, raise both limits together...(needs more GPU memory)」;另外有 vector cache 會預留 GPU 記憶體保留 state/action embedding,官方稱重訪同一個 state 時「2.8x faster」。量化版本官方未標示,CPU 模式雖然有 --device cpu 旗標,但官方沒給任何效能說明。
  • 本期聲量:HF 熱度 543(2.4k 次下載、552 個讚),本期選題第一名。
  • 跟同類比:跟同類的 Jev 相比,官方 model card 自己的說法是賣點不是準確率而是延遲:零樣本表現與 Jev 相當,延遲最多低 9 倍,約 1k 候選時「13× faster than Jev」。架構上是把兩個投影頭疊在凍結的 Qwen3-8B 上,不是重新訓練一個大模型。以上皆為作者自述,尚未見第三方獨立複測。
  • 怎麼取得:README 寫的是 pip install contrastive-lm,先用 vLLM 把 Qwen3-8B 以 pooling 模式起在 8090 埠當編碼器,再執行 clm-serve,就會在 http://localhost:8700/ 開一個 API 供 rank、查詢使用。
  • 連結:Contrastive-LM/CLM-v0.1-8B

2. interfaze-ai/lev:200 MB 的 LoRA,接手路由與審核判斷

  • 這是什麼:lev 是掛在 Qwen3.5-4B 上的 LoRA/adapter,主檔約 200 MB,做的是路由、審核、意圖偵測這類「從候選裡選一個」的判斷任務,不是生成長文。授權 Apache-2.0。
  • 能用在哪些場景:
    • SaaS 後端做意圖路由:使用者訊息進來要決定丟給哪一條處理管線,用它一次前向傳播就能拿到各選項機率,不必等大模型吐完一段文字再解析;官方 model card 列的用途就包含「routing, moderation, intent detection, triage, grading」。
    • UGC 平台的留言審核:每天大量留言要先過一層機器判斷再送人工,官方說明它回傳的是校準過的機率(calibrated probabilities)而不是生成的解釋,方便直接設閾值分流。
    • 檢查另一個大模型的輸出:把 LLM 產生的答案配上「有沒有回答到問題」這類是非題丟進去驗;官方把「checking LLM output」明列為設計用途,並標示在 FEVER 這類主張驗證任務上得分 0.872。
  • 跑得動嗎:官方 model card 寫「for real-time use, a CUDA GPU」,並標示底模下載量約 8 GB、adapter 本身約 200 MB。量化選項官方未標示。
  • 本期聲量:HF 熱度 94(480 次下載、98 個讚),本期唯一的 LoRA/adapter 候選。
  • 跟同類比:難得的是作者自己在卡片上就認輸,標示自身在 13 個 S1Bench 子集上的 macro accuracy 是 0.689,對照 Jev 的 0.761。它賣的不是最高分,而是用 200 MB adapter 去逼近體積大得多的專用模型(同期候選 Jev-Omni 是 12B,官方標示 FP32 權重約 50 GB)。分數皆為作者自述。
  • 怎麼取得:README 給的是標準 PEFT 兩行:AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B") 之後接 PeftModel.from_pretrained(base_model, "interfaze-ai/lev");官方另外提供自家套件寫法 lev.load("interfaze-ai/lev")。授權 Apache-2.0,權重可直接下載,無需申請。
  • 連結:interfaze-ai/lev

3. SupersonicLabs/Julia-1:144.3M 參數、CPU 就能跑的多語系分類器

  • 這是什麼:Julia-1 底層是多語系的 mmBERT-small,144.3M 參數,做的是狀態/問題/選項式的分類判斷。官方標示 FP32 權重只佔 550.5 MiB,授權 Apache 2.0。
  • 能用在哪些場景:
    • 沒有獨顯的開發者:手上只有便宜 VPS 或沒有獨顯,可以把客服工單、表單自動分類直接跑在 CPU 上;官方寫「CPU inference works with the standard PyTorch installation; no native router build is needed」,不需要為了一個分類器去租 GPU。
    • 多語系產品的意圖分類:官方標示在 MASSIVE 基準的「all 52 locales」上 macro accuracy 71.50%,並列出 en-US 86.75%、pt-PT 86.25% 等單語結果,適合一套模型同時吃多國語言的客服或 App 後端。
    • 內部工具的布林閘門:官方列出 noul 模式專做布林判斷、choice 模式支援 2 到 20 個選項,可以拿來判斷「這封信要不要升級處理」這種每天跑幾萬次、用大模型太貴的小決策。
  • 跑得動嗎:官方 model card 標示「The FP32 weights occupy 550.5 MiB; allow additional memory for the tokenizer and activations.」CPU 推論用標準 PyTorch 安裝即可;要用 CUDA 則需要 BF16-capable 的 GPU。輸入上限官方寫的是 8,192 token 的 state/question/options 合計長度。
  • 本期聲量:HF 熱度 297(2.2k 次下載、305 個讚)。
  • 跟同類比:同期高聲量的決策型模型多半 8B 到 12B 起跳(像本期的 CLM-8B、Jev-Omni 12B),Julia-1 的 144.3M 差了一到兩個數量級。代價作者自己也寫明了:它「cannot reliably supply missing facts, solve algebraic equations, or carry a long chain of calculations」,而且「is not a drop-in Transformers text-classification pipeline」,得照它自己的 API 接。皆為官方卡片上的自述。
  • 怎麼取得:官方說明是下載 repo 後 python -m pip install -e ./Julia-1,再用 load_model("Julia-1", device="cpu", max_length=8192) 載入;model card 特別提醒「Download the actual weights, not a Git LFS pointer」。授權 Apache 2.0,無需申請。
  • 連結:SupersonicLabs/Julia-1

結尾段落

這三個模型有個共同點:都不是拿來聊天的通用生成模型,而是幫系統做選擇、打分數、分類這種高頻小判斷,省下每次都要叫大模型出馬的成本。如果只能先挑一個動手,CLM-v0.1-8B 的 RAG 重排序場景,大概是台灣工程師最快能接上的一塊拼圖。下集見。

作者

Mark Ku

10 年以上的軟體工程師,做過北美電商與 AI SaaS 訂閱收費系統。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可。

站長的公司

Vibe Coding 架構規劃與陪跑

團隊已經用 AI 做出小工具,卻怕壞了沒人修、需求一變就不敢改?226 Network 幫你把程式放進 Git、密碼另外保管、排程搬上固定主機,再補上交接文件與測試。

熱門文章

View all
Mark Ku
··635

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··471

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··268

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··214

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··210

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調
Mark Ku
··209

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取