Skip to content
所有標籤

#self-hosted

27 篇文章
ai guide

Unsloth 完整指南:在本地微調和運行 LLM 的加速工具

Unsloth 是目前最省 VRAM、最快的本地 LLM 微調工具,訓練速度快 2 倍、VRAM 省 70%。2026 年加入 Desktop 桌面應用後,整合了推論、微調、圖片影片生成、web search 和 agent 連接,從微調庫變成完整的本地 AI 工作站。

tech guide 自架推論服務

自架推論服務導讀:什麼時候值得自己跑模型

自架推論的關鍵不在引擎多快,而在你的 GPU 使用率:一張打滿的 A100 約 $0.70 / 百萬輸出 token,使用率掉到一成就變 $7,比多數雲端 API 貴。這篇是系列導讀,把七套工具分成三層,幫你判斷該選哪一層。

tech deep-dive 自架推論服務

TensorRT-LLM:編譯換效能的 NVIDIA 專用 LLM 推論引擎

TensorRT-LLM 是 NVIDIA 的開源 LLM 推論庫(Apache 2.0),用離線編譯把模型權重與計算圖轉成最佳化的 TensorRT engine,再用自訂 CUDA kernel、in-flight batching 與多種平行化壓出硬體極限。代價是只支援 NVIDIA GPU、編譯要數十分鐘、換模型或量化就要重新 build。

tech deep-dive 自架推論服務

TGI:HuggingFace 的 LLM 推論伺服器,以及它為什麼進入維護模式

Text Generation Inference(TGI)是 HuggingFace 自家的 LLM 推論伺服器,用 Rust + Python 實作,率先在開源推論引擎裡引入 continuous batching 與 Flash Attention。2026 年 3 月 GitHub 倉庫歸檔進入維護模式,官方建議遷移到 vLLM 或 SGLang。了解 TGI 仍然重要:它定義了後繼引擎的架構基線,而且許多 HuggingFace Inference Endpoint 上的既有服務仍在跑它。

ai deep-dive

Chroma 向量資料庫完整指南:從本機 RAG 到分散式檢索

Chroma 用 collection 統一管理 embedding、文件與 metadata;本機可嵌入 Python,單機版採 HNSW,分散式版則以物件儲存、SSD 快取與 SPANN 拆分運算和儲存。

ai deep-dive

LiteLLM:從 Python SDK 到自架 AI Gateway 的多模型控制層

LiteLLM 不是模型供應商,而是一套可當 Python SDK 或自架 Proxy 使用的統一介面:把 100+ 家 LLM API 轉成一致格式,並在 Gateway 層集中處理路由、fallback、虛擬金鑰、預算與觀測。

ai deep-dive

Milvus 向量資料庫深入介紹:從 Segment、索引到分散式維運

Milvus 把即時寫入、歷史查詢、索引建置與持久化拆成可獨立擴縮的元件,適合需要大量向量、持續更新與分散式維運的檢索服務;小型專案則常會為這套架構付出過多複雜度。

ai deep-dive

R2R 深入介紹:把 Ingestion、Hybrid Search 與 RAG 包成 API

R2R 把文件匯入、hybrid search、knowledge graph、RAG、Agent 與權限包在 REST API 後面;適合已有產品前後台、只想補上 retrieval service 的團隊。

ai deep-dive

RAGFlow 深入介紹:從文件解析、Chunk 檢查到可追溯回答

RAGFlow 把文件解析、chunk 人工檢查、retrieval test、聊天與引用放在同一套平台;適合 PDF、表格與版面複雜文件,但部署重量和平台狀態都高於 Python library。

tech deep-dive 自架推論服務

Ray Serve 自架推論服務:Python 服務圖、GPU 排程與自動擴縮

Ray Serve 是建立在 Ray 上的分散式 serving layer:用 deployment 與 handle 組合 Python 服務圖,配置 CPU/GPU replica、自動擴縮與模型多工;它負責編排,不取代 vLLM 或 SGLang 的 LLM 執行引擎。

Redpanda:Kafka API 相容,不代表換 broker 可以不做驗證

Redpanda 以 C++/Seastar、thread-per-core 與每個 partition 的 Raft group 重做 Kafka-compatible event log;client 相容度高,營運與邊角語意仍須實測。

tech deep-dive

Scrapy 深入介紹:從 Engine 到 Pipeline 的自架爬蟲架構

Scrapy 把抓取流程拆成 Engine、Scheduler、Downloader、Spider、Item Pipeline 與 Middleware;適合大量、規則明確的 HTTP 頁面,也能自行控制排程、節流、重試與資料落地。

tech deep-dive 自架推論服務

SGLang 自架推論服務:RadixAttention、OpenAI API 與多 GPU 部署

SGLang 是專攻生成式模型的推論引擎:用 RadixAttention 重用共同前綴的 KV cache,提供 OpenAI 相容 API、結構化輸出與多 GPU 平行化;它解決的是高吞吐 LLM serving,不是完整的產品後端。

tech deep-dive 自架推論服務

NVIDIA Triton Inference Server:多框架模型、自動批次與推論管線

Triton Inference Server 用統一的 HTTP/gRPC 介面服務 TensorRT、ONNX、PyTorch 等模型,核心能力是 model repository、動態批次、instance group 與 ensemble;它適合異質模型平台,不是專為 LLM KV cache 打造的引擎。

tech deep-dive

Typesense 站內搜尋:把全文檢索做成可控制的產品功能

Typesense 是以即時、容錯關鍵字搜尋為核心的搜尋伺服器:用 collection schema、欄位權重、facet 與排序就能做出站內搜尋,也能自行架設或交給 Typesense Cloud;繁體中文欄位要設 locale: zh,專業詞彙則可能需要自訂斷詞。

ai guide

changedetection.io 完整指南:用 selector、通知與 Browser Steps 監控網頁

changedetection.io 是網頁變更訊號層:先縮小監控範圍、排除雜訊,再把真正的變更通知下游;它不是搜尋 API,也不該取代 crawler。

ai guide

Firecrawl 完整介紹:Scrape、Crawl、Map 與結構化抽取怎麼選

Firecrawl 把單頁抓取、網站探索、整站爬取與 JSON 抽取包成同一套 API;雲端版省下瀏覽器、proxy 與 worker 維運,自架版則換得基礎設施控制,但預設能力不等同雲端。

ai deep-dive

免費搜尋、爬取與瀏覽器 API 怎麼選:週期額度、限速、試用與自架成本

免費方案有每日或每月額度、餘額補回、持續限速與一次性試用;有些 API 沒有免費額度,必須預付或按量計費。

ai deep-dive

Meilisearch 完整介紹:索引、中文搜尋與多租戶安全

Meilisearch 適合把應用程式資料做成快速、容錯的全文搜尋;真正的導入難點不在 search API,而在索引設定、非同步 task、中文分詞、權限過濾與備份還原。

ai deep-dive

Qdrant 完整指南:Collection、Hybrid Search 與自架維運

Qdrant 的核心不是把 embedding 存進去,而是先固定 vector schema、替高頻過濾欄位建 payload index,再用 dense + sparse query、租戶邊界、snapshot 與監控把檢索做成可維運的服務。

ai guide

SearXNG 完整介紹:引擎調校、JSON API 與自架維運

SearXNG 是元搜尋引擎,不是 crawler,也沒有自己的全網索引。這篇以官方 2026.8.20 文件為準,從 Compose 安裝、settings.yml、引擎選擇與 JSON API,一路做到空結果診斷。

ai guide 搜尋與爬取實戰

自己架一套搜尋後端:SearXNG + Crawl4AI,從零到接進 Claude Code

三個元件、各做一件事:SearXNG 負責找、Crawl4AI 負責讀、一層薄薄的程式把兩者黏起來。有三個預設值不改就不會動——`formats` 預設只吐 HTML、`secret_key` 預設是 `ultrasecretkey`、limiter 開了會擋你自己的程式。另外官方安裝方式在 2026 年 3 月換過,網路上多數教學指的 searxng-docker 已經封存了。

Tavily 和 Exa 不能自己架:要怎麼自己組一套

Tavily 和 Exa 都是純雲端 API,不能自己架。能自己組的是 SearXNG(269 個上游引擎、82 個預設開啟)+ Crawl4AI(78.8k stars、Apache-2.0),現成的 Tavily 相容 wrapper 都還是幾十顆星的個人專案,不建議直接用。但 SearXNG 沒有自己的索引,而且從機房 IP 跑會被搜尋引擎打成空結果——這兩件事決定了自架划不划算。

Tailscale:agent 住在你家,不是你連回家

自架一個 24 小時跑著的 agent,等於在自己網路裡開了一個必須從外面連得到、又不能開在公網上的東西。這篇拆 Tailscale 的四個機制各自解決什麼:tailnet 解決連得到、subnet router 解決碰內網、tag 與 ACL 解決權限邊界、policy 秒級生效與 tailnet lock 解決收得回。附 2026-08 實查的定價:Personal 免費、6 個使用者、user device 無上限、50 個 tagged resource。

AEO / GEO 工具全景:輸入面、流量面、輸出面——從 isitagentready 到 aeo-radar 到 Profound

AEO/GEO 工具不是單一類別,而是三個面向:輸入面(網站有沒有準備好給 AI 讀)、流量面(AI bot 實際爬了多少)、輸出面(品牌在答案裡怎麼被提到)。這篇把三面向、從開源自架到商業 SaaS 的工具一次攤開。

ai guide OpenClaw 文件導讀

OpenClaw 文件導讀:200+ 份文件,從哪讀起?

OpenClaw 有 200+ 份文件,這篇幫你搞懂全貌、知道每塊在講什麼、依你的角色決定從哪讀起。

ai guide

Ollama 完整指南:一行指令在本地跑 LLM

Ollama 把 llama.cpp 包裝成 Docker 風格的 CLI + REST API,一行指令就能在本地跑 LLM。這篇從核心概念、安裝、API、硬體需求到 Modelfile 自訂,完整介紹這個工具適合什麼、不適合什麼。