Skip to content
所有標籤

#inference

19 篇文章
ai deep-dive 認識 AI 模型

MoE 為什麼贏:從 Ornith 到 MiniMax,2026 年前沿模型都在用的架構

2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。

ai deep-dive 認識 AI 模型

Token、Context Window、推論 vs 訓練:用 AI 模型前要知道的三件事

模型不讀字,讀 token——一個中文字通常是 1-2 個 token,一個英文字通常是 1-3 個。Context window 是模型一次能看的 token 上限。推論是用模型,訓練是教模型;你每天在做的是推論。

ai deep-dive 認識 AI 模型

量化與推論最佳化:讓 70B 模型跑在你的筆電上

70B 模型原本需要 140GB VRAM,但量化到 4-bit 只需要 ~35GB,再用 llama.cpp 的部分卸載就能在消費級硬體上跑。GGUF 格式的命名規則(Q4_K_M、Q5_K_S)告訴你精度和大小的取捨。KV cache 是長對話變慢的主因。

tech deep-dive 自架推論服務

TGI:HuggingFace 的 LLM 推論伺服器,以及它為什麼進入維護模式

Text Generation Inference(TGI)是 HuggingFace 自家的 LLM 推論伺服器,用 Rust + Python 實作,率先在開源推論引擎裡引入 continuous batching 與 Flash Attention。2026 年 3 月 GitHub 倉庫歸檔進入維護模式,官方建議遷移到 vLLM 或 SGLang。了解 TGI 仍然重要:它定義了後繼引擎的架構基線,而且許多 HuggingFace Inference Endpoint 上的既有服務仍在跑它。

ai deep-dive

Cerebras Inference:把 wafer-scale 速度放進 Agent 迴圈前,先看懂真正的瓶頸

Cerebras 的價值是把支援模型的生成階段大幅加速;但 Agent 的端到端速度仍取決於 prefill、工具 I/O、模型能力與平台相容性。

CS224N 第 13 講:Speculative Decoding 與 Test-Time Scaling

第 13 講從推論效率走到推論能力:speculative decoding 用小模型草擬、大模型驗證;on-policy distillation 處理資料漂移;長上下文與 test-time scaling 則用更多推論資源換取表現。

ai deep-dive

Fireworks AI:從 Serverless API 到客製模型部署的推論平台

Fireworks AI 把開放權重模型的試用、專用 GPU 部署與 LoRA 客製化放在同一套 API 後面;Serverless 適合低流量起步,On-demand 適合穩定高流量與自有模型,保留容量則換取企業級的容量保證。

ai deep-dive

Hugging Face 不只是模型下載站:Hub、Datasets、Spaces 與 Inference 怎麼分

Hugging Face Hub 是以版本化 repository 串起模型、資料集與應用程式的協作層;Datasets 管資料,Spaces 跑展示程式,Inference Providers 與 Endpoints 才負責代管推論。

ai deep-dive

Together AI:從 Serverless 推論到專屬端點與 Fine-tuning

Together AI 把開放權重模型的 Serverless API、專屬 GPU 端點、批次推論與 Fine-tuning 放在同一平台,適合先按 token 驗證,再在流量或客製化需求成形後升級部署。

CoreWeave:以 Kubernetes、GPU Fabric 與儲存組成的 AI 專用雲

CoreWeave 的價值不只是租 GPU,而是把 Kubernetes、GPU 網路、儲存與 inference 組成 AI infrastructure;代價是仍需平台工程與容量治理。

Nebius AI Cloud:GPU Cluster、Managed Kubernetes 與 Serverless AI 的完整平台

Nebius 同時提供 GPU VM/cluster、Kubernetes、Slurm、storage 與 Serverless AI;先選責任層級,再比較硬體與價格。

tech deep-dive 自架推論服務

Ray Serve 自架推論服務:Python 服務圖、GPU 排程與自動擴縮

Ray Serve 是建立在 Ray 上的分散式 serving layer:用 deployment 與 handle 組合 Python 服務圖,配置 CPU/GPU replica、自動擴縮與模型多工;它負責編排,不取代 vLLM 或 SGLang 的 LLM 執行引擎。

Replicate:把模型版本變成 Prediction API,而不是租一台 GPU

Replicate 以 versioned model、prediction、Cog 與 deployment 抽象 GPU;整合者要負責版本釘選、async workflow、webhook 驗證、資料保存與成本上限。

RunPod:GPU Pod 與 Serverless Endpoint 是兩種不同產品

RunPod Pod 適合互動與長駐 GPU 工作,Serverless 適合 queue-based 或 load-balanced inference;選錯會把 persistence、cold start 與重試語意混在一起。

tech deep-dive 自架推論服務

SGLang 自架推論服務:RadixAttention、OpenAI API 與多 GPU 部署

SGLang 是專攻生成式模型的推論引擎:用 RadixAttention 重用共同前綴的 KV cache,提供 OpenAI 相容 API、結構化輸出與多 GPU 平行化;它解決的是高吞吐 LLM serving,不是完整的產品後端。

tech deep-dive 自架推論服務

NVIDIA Triton Inference Server:多框架模型、自動批次與推論管線

Triton Inference Server 用統一的 HTTP/gRPC 介面服務 TensorRT、ONNX、PyTorch 等模型,核心能力是 model repository、動態批次、instance group 與 ensemble;它適合異質模型平台,不是專為 LLM KV cache 打造的引擎。

ai deep-dive AI 證照備考

成本、延遲與可用性的考點交集:六張證照從三個不同高度考同一件事

Google PMLE、AWS AIF-C01 與 AIP-C01、微軟 AI-103 與 AI-500、NVIDIA NCP-GENL 都考「怎麼讓 GenAI 應用又快又便宜又不掛」,但排起來是一道三階梯子:AIF-C01 問你知不知道成本隨 token 走,AIP-C01 與微軟兩張問你控不控得住,NCP-GENL 問你改不改得動模型與硬體。切入的高度差三層:NVIDIA 在 kernel 與量化層(Model Optimization 17% + GPU Acceleration 14% = 31%,全系列最重的單一成本延遲區塊),AWS 與微軟在應用層(快取三層、token 上限、chargeback),Google 在 MLOps 層(CPU/GPU/TPU 評估、資料平行 vs 模型平行、依吞吐量擴展服務後端)。交集是八根槓桿,但同一根在三個高度上是三種題目。本文刻意不帶任何價格與硬體規格數字——那是這個主題腐敗最快的部分。

ai deep-dive

2026 年 LLM Inference 服務商免費額度與定價:40+ 家分梯整理

個人專案、玩具 demo、做 RAG 原型,不想第一步就掏卡。整理 2026/05 還在運作的 40+ 家 LLM inference 服務商,按免費資源「是持續補充還是一次性」分梯,標註綁卡需求、模型清單、付費起價,數字全部從官方 pricing 頁驗證。中國原廠含智谱 GLM(永久免費)、豆包(每日 200 萬 tokens)、Kimi、百煉、Ollama 本地跑法一併收錄。

ai guide

Groq Console:用 LPU 推論開源模型的開發者平台

Groq Console 是 Groq 自家 LPU 晶片的開發者入口,提供 OpenAI 相容 API、Playground、免費額度,主打把 Llama、Qwen、DeepSeek 等開源模型跑出市面上最快的 token/秒。