跳至主要內容
Mark Ku's Blog

開場白

這週最誇張的數字是Strata用一張12GB遊戲顯卡,跑起125B參數的大模型,MIT授權還不到一個月就衝上5.9k星。同一週另外兩條地端路線也浮上檯面,Ledge.sh把Markdown筆記變成能跑指令的常駐終端機,Magnitude則是直接在你電腦上現場編譯kernel,對llama.cpp的加速幅度等一下告訴你。

本週開源好物

1. Ledge.sh:把Markdown筆記變成能跑指令的常駐終端機

  • 它是什麼:Ledge.sh讓你在平常寫的Markdown筆記裡,直接把程式碼區塊變成按一下就能執行的指令,整篇筆記共用同一個常駐shell,變數、cd、虛擬環境在多次執行之間都還保留著,不是Jupyter那種各跑各的cell。適合把平常複製貼上到終端機的操作手冊,直接變成能一鍵重跑的runbook。
  • 本週聲量:Hacker News拿下202分、88則討論,留言熱度集中在「這就是我想要的runbook」,不過GitHub repo目前只有278顆星,聲量主要來自這波HN討論。
  • 亮點功能:
    • 內建Shell、Python、Node、Ruby、PHP、TypeScript可直接跑,SQL與Redis區塊能接上你現有的資料庫,想加其他直譯器在設定裡補一行就好
    • frontmatter寫一行host:,整篇筆記的執行就轉送到該台機器的SSH上;接上Ledge Server之後筆電關機,執行中的區塊照跑不中斷,手機App能回來看進度
    • 附MCP server,跑claude mcp add ledge -- ledge mcp就能讓Claude Code讀寫搜尋你的筆記,連prompt區塊本身都是可執行的
  • 快速上手:macOS下載.dmg、Windows跑Ledge-Setup.exe(需搭配WSL)、Linux解壓後執行./installer;要在遠端機器常駐執行,就在那台機器跑curl -fsSL https://ledge.sh/server.sh | sh。裝完打開任一篇筆記,在程式碼區塊按執行,下一個區塊還讀得到上一個區塊設的變數,就代表常駐shell真的跑起來了;接了Ledge Server的話,用手機App連進去能看到正在執行的區塊,就代表伺服器端也接通了。
  • 跟同類比:跟Jupyter最大差別是它不是cell-based kernel而是一篇筆記一個常駐shell,檔案也是普通Markdown,沒有.ipynb那種diff地獄;跟Runme(另一套把Markdown程式碼區塊變成可執行runbook的工具,概念類似,但沒有常駐SSH執行、手機端與內建MCP這幾樣)相比,Ledge多了遠端常駐、手機回看與AI agent整合這塊。
  • 適合誰:手上一堆「複製貼上到終端機」操作筆記、想把SOP變成能一鍵重跑runbook的工程師。
  • 連結:ledge.sh

2. Strata:12GB遊戲顯卡也能開125B大模型

  • 它是什麼:Strata解決的是「想跑大模型但顯卡不夠大」這個老問題,它把模型權重動態分散在VRAM、系統記憶體與SSD之間(dynamic expert routing),不是傳統那種整層整層搬的offload,所以12GB VRAM也擠得進125B參數的模型;同時開出OpenAI與Anthropic兩種相容端點,現有工具鏈幾乎不用改就能接上地端模型。
  • 本週聲量:GitHub在30天內衝上5.9k星(實際5931顆),MIT授權,主要語言C++。
  • 亮點功能:
    • 94 tokens/s輸出、2650 tokens/s輸入、70GB下載量,這三個數字講的是同一件事:Qwen3.8-Flash-Next這顆125B模型,在12GB VRAM、Q2_0量化這個組合下的實測表現;70GB是權重本身的下載大小,不是要整包塞進顯卡,靠的就是前面講的VRAM/記憶體/SSD動態分散,換成IQ3_S量化則降到53 tokens/s,量化等級愈高,吃的資源愈多、速度也會跟著掉
    • 推測解碼(speculative decoding)的「猜了再驗」機制帶來1.6到1.8倍加速
    • 安裝腳本會自動偵測硬體挑合適的模型尺寸、下載權重後直接把服務拉起來,附瀏覽器介面可以聊天、看監控儀表板、調設定;支援NVIDIA RTX 20/30/40/50系與AMD RX 7900 XT/XTX、7800 XT、9070+(12GB VRAM以上),也能選擇性吃圖片輸入
  • 快速上手:Windows直接雙擊START-HERE.bat、Linux跑./setup.sh,安裝程式會自動處理剩下的事;記得先備好32GB RAM(建議64GB)與約80GB SSD空間。裝完之後用瀏覽器開http://127.0.0.1:8080,或直接curl http://127.0.0.1:8080/v1/models打一下OpenAI相容端點,看到模型列表回應就代表服務真的立起來了。
  • 跟同類比:Ollama、LM Studio的玩法是挑一個塞得進你VRAM的模型,Strata反過來是賭「把整台電腦的資源分散著硬跑一個大模型」,代價是70GB下載量加上Q2等級的量化;README也誠實寫了底層是站在llama.cpp/ggml上面,AMD的吞吐量大概比同規格NVIDIA低35%到65%。
  • 適合誰:只有一張12GB消費級顯卡、又想在本機摸到125B等級模型的人,能接受Q2量化畫質打折換取「真的跑得起來」。
  • 連結:niko1221/Strata

3. Magnitude:你的電腦現場編譯kernel,把coding agent一鍵接回本機

  • 它是什麼:Magnitude走的是另一條地端推論路線,它不像llama.cpp那樣出廠就編好一套kernel給一大類硬體用,而是在你自己的裝置上現場編譯、現場調校,再把Claude Code、Codex、Cline這類coding agent一鍵指到本機模型上。
  • 本週聲量:這篇是Launch HN,拿下194分、97則討論,GitHub累積6263顆星,Apache-2.0授權,主要語言Rust。
  • 亮點功能:
    • 官方對比llama.cpp的實測數字:Metal解碼快92%、CUDA解碼快19%,prefill則是Metal快9%、CUDA快23%;不過官方沒有公布測試機型與llama.cpp版本細節,這組數字看看就好,真正準不準建議自己的機器實測一次
    • 針對agent場景做記憶體管理,每個agent少用27%記憶體,agent停掉就釋放,多個session之間共用prefix cache,避免互相拖慢
    • Connections頁面一鍵接上Pi、OpenCode、Hermes、Codex、Claude Code、Cline,跨Apple Silicon、NVIDIA、AMD與純CPU,模型下載完之後整個流程不需要網路
  • 快速上手:到magnitude.dev/download裝桌面版(內含CLI),在Discover頁挑一個模型下載,再到Connections頁把你的coding agent一鍵指過來。接好之後回到Claude Code或Cline隨便問一句話,拔掉網路也能正常回應,就代表它真的在吃本機模型而不是雲端。
  • 跟同類比:llama.cpp、Ollama、LM Studio都是出廠就ship好預編譯kernel給廣泛硬體用,Magnitude改成逐台裝置現場tune,外加per-agent記憶體回收跟session間的prefix cache共用;跟同一週的Strata比,Strata是Windows一鍵安裝硬扛單一大模型,Magnitude偏向Mac與多平台、主打直接串coding agent。README也老實說是「針對熱門開源權重家族手工最佳化」,不是什麼模型都支援。
  • 適合誰:已經在用Claude Code、Cline這類coding agent,想把它們接到本機模型、又在意裝置本身調校效能的工程師。
  • 連結:magnitudedev/magnitude

結尾段落

這三個工具其實是同一題的三種答案,地端能不能跑起「真的夠大」的東西。Ledge.sh解決的是日常操作的苦工,Strata跟Magnitude則是兩條不同的地端推論路線,一個賭硬體分散、一個賭現場編譯。如果只能先挑一個玩,我會從Strata的12GB門檻開始,畢竟多數人手上那張遊戲顯卡真的擠得進去,下週再挖幾個好東西回來,我們下集見。

作者

Mark Ku

10 年以上的軟體工程師,做過北美電商與 AI SaaS 訂閱收費系統。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可。

熱門文章

View all
Mark Ku
··646

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··461

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··281

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··219

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取
Mark Ku
··214

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··210

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調