跳至主要內容
Mark Ku's Blog

開場白

本週開源社群最受矚目的焦點,是 Firecrawl 團隊推出的 anydoc,它能在毫秒級內將 14 種格式完美轉為 Markdown。除了這款多格式統一解析器,我們還會拆解能在本機搭建 Agent 生態系的 deepseek-harness,以及用純 C 語言在有限記憶體跑完兆級參數模型的極限優化實踐,等一下告訴你。


本週開源好物

1. anydoc:14種格式統一輸出的超高速 Markdown 解析器

  • 它是什麼: 解決在開發 RAG(檢索增強生成)、知識庫或文件匯入系統時,被 Word、PPT、PDF 轉 Markdown 折磨的痛點。它將 14 種格式(包含 .docx、.pptx、.xlsx、.odt、.rtf、.epub、.csv、.pdf 等)先解析成同一套統一的文件模型(document model),再由同一個 Markdown 序列化器輸出,確保跨格式的表格、合併儲存格在轉換後維持高度一致。
  • 本週聲量: GitHub 17.9k ★(30 天內新專案,實際累積 17,894 顆星),授權為 MIT,主要開發語言為 Rust。
  • 亮點功能:
    • 極致的處理效能:官方在 Apple M3 Max、16GB RAM 的硬體環境下,使用 100 份真實文件進行基準測試(Benchmark 數據詳見 GitHub 測試說明)。anydoc 的中位數處理時間僅 4.4ms、品質得分 81 分。相比之下,Markitdown 耗時 134.8ms/52分、Pandoc 102.1ms/38分、Docling 513.6ms/51分、Unstructured 572.9ms/63分。anydoc 在速度上快了 20 到 250 倍,且是唯一 14 種格式全數通過測試的工具。
    • 多端整合與輕量相依:Rust 核心提供 CLI(npx)、Node(@firecrawl/anydoc)、Python(firecrawl-anydoc)三種整合方式,甚至提供 WebAssembly 版本(@firecrawl/anydoc-wasm)可直接在瀏覽器前端執行。相較於傳統使用 LibreOffice headless 轉檔,它省去了安裝整包 Office 軟體相依性的麻煩。
  • 快速上手: 不用安裝,在終端機輸入一行指令直接試用:
    npx @firecrawl/anydoc report.docx -o report.md
    
    若要導入開發管線,在 Node 專案中安裝後呼叫:
    import { toMarkdown } from '@firecrawl/anydoc';
    const markdown = await toMarkdown('report.docx');
    
  • 跟同類比: 與 Markitdown、Pandoc、Docling、Unstructured 相比,那幾套工具要嘛格式覆蓋率不足(如 Pandoc 僅支援 5/14、Docling 4/14),要嘛速度慢上數十至數百倍。anydoc 同時贏在「格式覆蓋率」與「解析速度」,且無須打包龐大的 Office 運作環境。
  • 誠實雷點: 必須注意它的限制,它目前只能處理「文字型 PDF」,如果是掃描檔或需要 OCR(光學字元識別)的圖片,anydoc 無法直接處理,必須另外對接 Firecrawl Parse 等外部服務。
  • 適合誰: 適合正在開發 RAG 系統、本地知識庫,需要大量且高效率做文件預處理的後端與 AI 工程師。
  • 連結: firecrawl/anydoc

2. deepseek-harness:基於外掛架構的本機優先 Agent 骨架工廠

  • 它是什麼: 專為想自組 AI Agent 的工程師設計的開發骨架。它不是開箱即用的 coding 助理,而是一個「Agent 工廠」,讓你可以把模型、工具、工作流當成積木,隨插隨用組裝出想要的 Agent。
  • 本週聲量: GitHub 1.8k ★(註:此為本專案發佈初期之獨立星數。整個 DeepSeek 官方主倉庫與生態系在 30 天內狂捲超過 18 萬顆星,本專案為其生態系新成員,並已衍生出桌面端 18.2k★、外掛精選 11.5k★、路由套件 6.6k★ 等多個衛星專案),授權為 MIT,主要語言為 TypeScript。
  • 亮點功能:
    • 萬物皆外掛的 Cordis 架構:底層架構建構在 Cordis 之上。不論是模型適配器(model adapter)、工具註冊表(tool registry)、對話日誌(session log),甚至連核心的 agent loop 本身都是外掛,全部可以透過設定檔動態抽換。
    • 本機優先與原生桌面支援:執行 npx @deepseek-ai/dsh web 即可在本機啟動 Web UI(預設為 <http://127.0.0.1:3080>),完全 local-first,免去申請雲端服務的繁瑣步驟。此外,官方推出 DSH Desktop,將 Web UI、主機服務與外掛系統打包成 Windows (NSIS) 與 macOS (DMG) 原生安裝檔,內建外掛市集與系統列常駐,同樣採 MIT 授權且完全免費。
  • 快速上手: 想快速體驗 Web UI,可直接在終端機輸入:
    npx @deepseek-ai/dsh web
    
    並在瀏覽器打開 127.0.0.1:3080。不習慣終端機的使用者,可以直接到 GitHub 下載 DSH Desktop 安裝檔,開箱即用。
  • 跟同類比: 與 Claude Code 或 Codex 這類「拿來就能直接寫程式」的成品 Agent 不同,deepseek-harness 賣的是底層骨架。前者是給你一把調整好的工具,後者則是提供可更換槍管的槍身。
  • 誠實雷點: 官方在 README 中用大寫警告:「THERE WILL BE COMPATIBILITY-BREAKING CHANGES」。目前定位是開發者預覽版(Developer Preview),不建議直接當作正式環境的控制面,API 與設定格式隨時可能調整。
  • 適合誰: 適合想深入自訂 Agent 工作流、串接自研工具,並偏好本機部署的 AI 應用開發者。
  • 連結: deepseek-ai/deepseek-harness

3. kimi-k3-in-c:純 C 語言實現的極限記憶體優化 MoE 模型推論實踐

  • 它是什麼: 解決了在消費級硬體上跑不起兆級參數模型的痛點。它是一個純 C99 寫成、不依賴 GPU 也不需要任何框架的專案,硬是把一個 2.78 兆參數的模型塞進 8.24GB 的記憶體內執行,並在文件中把每一步的數學與記憶體算給你聽。
  • 本週聲量: GitHub 6.3k ★(30 天內新專案,實際累積 6,267 顆星),授權為 Apache-2.0,主要語言為 C。
  • 亮點功能:
    • 極致的 MoE 稀疏性與硬碟串流:核心手法是將混合專家模型(MoE)的稀疏性發揮到極致。每個 token 在每層只會啟用 896 個專家中的 16 個(僅 3.7%),剩下的 96.3% 參數完全不載入記憶體,而是保留在硬碟中,透過 LRU 快取即時串流進來。routed experts 經量化後每參數僅佔 0.53 bytes,而 dense 層打包成單一 109GB 的 trunk 檔案,在已知偏移量下使用滑動視窗(sliding window)進行 seek 讀取。
    • 硬碟 I/O 的極高要求:由於高達 96.3% 的參數依賴硬碟即時串流,硬碟讀寫速度是絕對瓶頸。強烈建議使用讀取速度至少達 5000 MB/s 的 PCIe Gen4 NVMe SSD,否則載入延遲會極為嚴重,大幅拖慢推論速度。
  • 快速上手: 不需下載 1.56TB 的完整權重即可測試編譯與基礎運行:
    git clone https://github.com/FareedKhan-dev/kimi-k3-in-c
    cd kimi-k3-in-c
    make -j
    make test
    
    測試套件自帶測試資料,兩分鐘內即可跑起來。若要進行實際的文字生成,才需要執行專案內的 download-model.sh 與 pack-trunk.sh。
  • 跟同類比: 雖然 llama.cpp 同樣做 CPU 推論,但前提是模型(即使量化後)大致上能放得進記憶體或透過 mmap 載入。本專案反其道而行,讓參數量遠超記憶體數百倍的模型也能運作,將瓶頸從記憶體容量轉移至硬碟讀寫速度。
  • 誠實雷點: 實用性極低,純屬技術展示與教科書。作者誠實公佈了推論速度:8GB 記憶體筆電需 26.5 秒/token、64GB 桌機需 19.8 秒、128GB 以上工作站需 5.6 秒。此外,執行需要 1.56TB 的 checkpoint 加上 109GB trunk,總計約 1.7TB 的硬碟空間,且目前完全不支援 macOS、Windows 或 WSL。
  • 適合誰: 適合想深入研究 MoE 底層推論工程、記憶體優化極限,以及想了解大模型如何與硬體 I/O 互動的資深系統工程師。
  • 連結: fareedkhan-dev/kimi-k3-in-c

結尾段落

我是沐妍,本週我們看見了開源界在文件解析速度、Agent 模組化架構以及極端硬體推論上的突破。如果只能挑一個本週立刻在專案中落地的工具,我個人強烈推薦 anydoc,它能幫你的 RAG 流程省下大把的預處理時間。我們下週的開源好物週報再見囉!

作者

Mark Ku

10 年以上的軟體工程師,做過北美電商與 AI SaaS 訂閱收費系統。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可。

站長的公司

Vibe Coding 架構規劃與陪跑

團隊已經用 AI 做出小工具,卻怕壞了沒人修、需求一變就不敢改?226 Network 幫你把程式放進 Git、密碼另外保管、排程搬上固定主機,再補上交接文件與測試。

熱門文章

View all
Mark Ku
··634

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··471

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··267

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··214

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··210

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調
Mark Ku
··209

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取