Skip to content
所有分類

ai

707 篇文章
ai deep-dive 文件解析實戰

Agentic Parsing:讓 Agent 決定怎麼解析文件

傳統文件解析用固定 pipeline 一體適用,但合約、財報、技術手冊各需不同策略。Agentic Parsing 讓 LLM agent 觀察文件後動態選工具——AgenticOCR 只解析需要的區域(視覺 token 省 70%+)、ParseBench 2,000 頁企業文件實測最佳方案也只拿 84.9%,沒有銀彈。

ai deep-dive RAG 技法大全

ColPali:跳過 OCR,直接用圖片做文件檢索

ColPali 把 PDF 每頁渲染成圖片,用 vision-language model 產生 patch-level multi-vector embedding,用 MaxSim 做 late interaction 檢索。表格密集的金融 PDF 上 recall 從 62% 跳到 84%,完全跳過 OCR 和 chunking。代價是儲存量 ~100 倍、需要 GPU、BM25 不可用。

ai deep-dive RAG 技法大全

Hierarchical Chunking + Auto-Merge:小 chunk 搜得準,大 chunk 讀得懂

小 chunk embedding 精準但缺上下文、大 chunk 上下文完整但 embedding 被噪音稀釋——Hierarchical Chunking 用多層索引(2048→512→128 tokens)配 Auto-Merge 演算法解決這個兩難:葉節點精準命中,命中密度超過閾值就自動回傳父節點給 LLM。HiChunk 實測 evidence recall 提升 12.7%,LlamaIndex 和 Haystack 都已內建。

ai deep-dive

LLM 開發流程全景:瓶頸從寫程式移到驗證程式之後

AI 讓寫 code 快了 34%,但 review 時間暴增 441%、實測交付反而慢 19%。四輪研究整理出當前全景:確定性護欄(hook 擋)vs 機率性護欄(prompt 引導)、乾淨 context review、自我改進回饋迴圈、規格驅動開發、AI 測試品質危機(覆蓋率高但 mutation score 低至 53%),以及 Replit agent 偽造測試結果的真實事故。

ai deep-dive RAG 技法大全

Multi-hop Retrieval:當答案散落在多份文件裡

標準 RAG 一次檢索只找一組文件,但真實問題常需跨 2-4 份文件推理。IRCoT 開創交錯式檢索推理,PAR²-RAG 在四個基準上比 IRCoT 準確率高 23.5%,CompactRAG 把 LLM 呼叫壓到只有兩次。

ai deep-dive

Self-RAG:用 Reflection Token 讓模型自己決定要不要檢索

Self-RAG 在 LLM 裡訓練四種 reflection token(Retrieve / IsREL / IsSUP / IsUSE),讓模型在生成過程中自主決定何時檢索、檢索結果是否相關、生成是否有據可查。ICLR 2024 Oral(top 1%),7B 模型在多個 QA benchmark 超越 ChatGPT 和 Llama2-chat + RAG。代價是必須 fine-tune,無法用在 API-only 模型。

ai deep-dive RAG 技法大全

Table Serialization:表格該怎麼轉成文字才能讓 RAG 找到

Markdown-KV 格式在 LLM 理解準確度上達 60.7%,比 CSV 的 44.3% 高出 16 個百分點。但檢索用途的最佳格式不同於 LLM 理解用途——metadata prepend + row-wise key-value 是目前表格 RAG 的最佳組合。

跟成熟 coding agent 學設計(4):Approval 分級與 audit trail

Looplane 的 effect 已有 read/modify/modify_execute/execute 四級,未分類工具 fail closed;native MCP tool 預設 execute,只有可信 read-only annotation 才降級。審批仍先進 events.jsonl,grant 可精確到同一組變更或 backend;一般化 command 規則與全 runtime sandbox coupling 仍未完成。

跟成熟 coding agent 學設計(37):Code mode——把工具呼叫編譯成程式碼批次執行

looplane 已先做 bounded tool-program DSL:唯讀程式支援 list/read/search/diff、repeat 與 if_contains;modify/check transaction 會經整體 approval,失敗時回滾 touched paths。它還不是任意 JavaScript/Python code mode,也沒有平行 transaction execution。

跟成熟 coding agent 學設計(26):Context 壓縮與 compaction——從缺口到可審計 baseline

五家成熟 agent 的 compaction 都要處理觸發、完整 turn 切點與失敗恢復。looplane 已補上 85% high-watermark、自動 compaction、原生 loop 的 deterministic fallback summary、checkpoint 落盤與 workspace context 重新注入;目前仍缺跨 runtime 等價 fallback、模型品質摘要,以及真實 provider 的長 session 驗證。

跟成熟 coding agent 學設計(27):跨 session 記憶——從 explicit remember 到 semantic recall

omp 與 claude-code 都有跨 session 記憶,其他參考專案主要靠 instruction files。looplane 已落地明確的 remember/list/inject baseline:型別化 JSONL 記憶可跨 session 注入 prompt,但目前只按 scope 與近期排序,還沒有語意檢索、去重、遺忘指令或自動萃取。

跟成熟 coding agent 學設計(28):危險指令攔截與 shell escalation——在白名單和每次都問之間

五家對自由 shell 的風險處理都包含放行/詢問/拒絕、複合指令檢查與 fail-closed。looplane 已補上 deny-first command classifier、critical floor、複合 shell 分段、timeout-deny、設定式 allow/deny rule 與可見的 policy reason;仍需擴大語法涵蓋與真實互動流程驗證。

跟成熟 coding agent 學設計:系列總覽——拆五個專案的原始碼,蓋自己的 agent

我在寫自己的 Python coding agent「looplane」,這個系列把 pi、oh-my-pi、opencode、codex、claude-code 五個成熟專案的原始碼逐題對照,也對照 Looplane 現在已經落地的 TUI、外部 CLI runtime、local gateway、usage/OTel/session 工具與 Cloudflare 切片。每篇固定走「設計問題→五家做法→looplane 選擇→學術依據→改善路線」五段,證據一律給到 file#symbol 層級。

Hooks/Skills/Plugins:成熟 coding agent 的三層擴展機制

Hooks 管控制流、skills 注入知識、plugins 負責打包。looplane 已有 opt-in deny-only project hooks、bounded SKILL.md loader、exact enabled_skills 選擇、plugin manifest/install/list 與 external runtime projection;仍缺 hook input rewrite、完整 lifecycle、遠端 registry 與成熟 marketplace。

跟成熟 coding agent 學設計(36):LSP 整合——把編譯器診斷推進 agent context

looplane 已能把 repo 內 diagnostics 與 open-file 狀態注入下一個 model turn,也有 typed WebSocket IDE context push、可封裝的 VS Code bridge,以及管理長駐 LSP subprocess 的 ManagedLspServer。剩下的是各語言 initialize/didOpen/didChange adapter 的打磨與 live editor 驗證。

跟成熟 coding agent 學設計(30):MCP 整合——工具生態的標準插座

MCP client 要同時處理 transport、工具刷新、approval 與 credential 邊界。looplane 已支援 allowlisted stdio、Streamable HTTP/SSE、tools/resources/prompts、tools/list_changed、OAuth metadata/PKCE 與 0600 credential store;尚缺真實 authorization server E2E 與 MCP 專用確認 UX。

跟成熟 coding agent 學設計(35):Model catalog 與 per-role 多 provider 路由——looplane 的 role alias 與 reviewer lane

looplane 已有 ModelRole/ModelRoute 靜態候選表、--model @cheap 等 opt-in alias、跨 provider fallback,以及驗證完成後才啟動的 no-tool reviewer lane;下一步是補 role inheritance/override 規則,並決定 summarizer、parser、scout 是否自動路由。

跟成熟 coding agent 學設計(6):ModelProvider 抽象——為什麼不能直接包 SDK 就好

直接包 SDK 三個月就會後悔:每家的 usage 欄位、tool call 格式、錯誤語意都不一樣,換模型等於重寫迴圈。五家參考專案都把「wire protocol」從「provider 身分」裡拆出來當獨立維度;looplane 更進一步,用 pydantic canonical contract(Message/ToolCall/Usage/ModelTurn)加六種 protocol adapter,把 OpenAI SDK 的內建 retry 關到 0,所有錯誤先分類成 ProviderErrorKind 再交給統一的重試政策。provider 表本身是跟 pi 的 packages/ai 對著抄的——這是血統,不是巧合。

跟成熟 coding agent 學設計(29):OS 級沙箱

OS 沙箱是 path policy 之外的核心防線。looplane 已落地 fail-closed `CommandSandbox`:macOS 包 sandbox-exec,Linux 用 Landlock 加 seccomp,verification 預設在能證明 containment 時進沙箱;不支援時回 exit 126。剩餘限制是目前主要只包 verification、外部 CI 結果仍待確認。

Prompt 版本控制:改一個字可能讓 eval 從 5/5 掉到 0/5

Looplane 的 prompt 已到 `m3-exact-edit-v4`:版本寫進 artifact,core/tool/interaction/runtime/instructions/skills/workspace/memory 以 stable/dynamic section 組裝,並加入 replace_text、unified diff、direct reply 的正反例。unit tests 已釘住結構,live eval 覆蓋仍需擴大。

跟成熟 coding agent 學設計(7):Provider retry policy——從單次 5xx 到有界 retry 與 fallback

NVIDIA NIM 間歇 500 暴露了 looplane 早期只有錯誤分類、沒有重試消費者的缺口。現在 SDK retry 關閉,harness 對每個候選最多嘗試 5 次,使用帶 jitter 的指數退避並尊重有上限的 Retry-After;耗盡後可依明確設定切到 fallback model,model.retry 與 model.fallback 都進 event log。

跟成熟 coding agent 學設計(33):Session 錄製與 replay——從事件檔走到可重播、可分叉

looplane 已把 events.jsonl 接成 deterministic reducer、CLI timeline、canonical JSON、SDK replay 與安全分叉;分叉不會重跑舊工具或模型呼叫。剩下的是 provider/live runtime 驗證、redaction 與更完整的 replay hook。

跟成熟 coding agent 學設計(32):Subagent 與 worktree 隔離——讓主 loop 學會分工

成熟 subagent 需要角色、fan-out 上限、權限收窄與成果回傳契約。looplane 已有 native named-role schedule、平行 fan-out、子 task allowed_paths 不得超出 parent、預設禁用 unsafe exec,以及 parent-approved transaction proposal baseline;常駐 background lifecycle、遞迴深度管理與自動 worktree merge 仍未完成。

跟成熟 coding agent 學設計(34):Telemetry 與成本追蹤——token 記了,然後呢

looplane 已加入 CostBreakdown、明確標示 estimated 的 GPT-5 家族靜態價目表、per-lane usage/cost 與 OTel cost 欄位;未知模型仍只顯示 token,不硬算美元。價目覆蓋、外部 CLI 權威帳單與 live billing 對帳仍待補。

跟成熟 coding agent 學設計(18):工具集設計哲學——tool surface 的邊界劃分

Looplane 的核心 surface 已從七個長到九個:新增 read-only `tool_program` 與可 rollback 的 `tool_transaction`,搜尋優先走 ripgrep,仍不開任意 shell;native MCP 只從 allowlist 動態加入,缺少可信 read-only metadata 就按 execute 審批。

跟成熟 coding agent 學設計(3):Workspace 隔離與 path policy

Looplane 的 disposable clone 與 SafePathPolicy 保護來源 repo;現在 `--sandbox-checks` 也能用 macOS sandbox-exec、Linux bubblewrap 或 Landlock 包住 verification command,Cloudflare 另有受限 Sandbox slice。但不同 backend 的 network policy、外部 runtime coverage 與 production hardening 仍未一致驗證。

跟成熟 coding agent 學設計(38):Agent as a Service——把 loop 包成別的程式可以呼叫的服務

looplane 已有 Cloudflare Durable Object run resource:非同步建立、狀態/取消/artifact、live NDJSON 與支援 Last-Event-ID 的 SSE;遠端 approval 走獨立短效 capability。Python 另有 attach client 與 stateful conversation WebSocket。production deploy、跨 runtime parity 與完整多租戶 hardening 尚未驗證。

ai debug Ask AI 實戰

Ask AI 明明有課程地圖,為什麼列不完整:Catalog Query 的召回與收斂事故

「有哪些課程文章」第一次觀測被舊快取干擾;真正未命中的 request 已找回四所大學課程地圖,卻因三輪 Writer/Critic 重試花了 51.169 秒。修正 catalog 專用檢索與 review 契約後,一次未命中快取的 production observation 在 26.821 秒內通過 q21。

ai guide Ask AI 實戰

Ask AI 怎麼找到文章:Planner、Hybrid Retrieval 與 Retry

Ask AI 先由 Planner 抽出 intent、complexity 與 1–4 個搜尋詞,再依查詢型態走 metadata、BM25、Vectorize 與 RRF;第二輪搜尋會加入 Critic gaps,並關閉第一次才允許的 BM25 short circuit。

ai guide Ask AI 實戰

Ask AI 的文章怎麼進知識庫:Chunk、D1 FTS5 與 Vectorize

Ask AI 的 production 索引分兩階段:先用 source hash 增量更新 D1、post_chunks 與 FTS5,再以 embedding checkpoint 和 delete queue 讓 Vectorize 非同步追上;兩邊不是同一個 transaction。

ai guide Ask AI 實戰

Ask AI 的問題怎麼走完整條 RAG 管線:UI、API、Agent 與來源卡片

Ask AI 把一次提問拆成 UI、`/api/chat`、Planner、Research、Writer、Validation、Critic 與 Related 八段;回答文字、參考來源和延伸閱讀各有不同的產生與顯示條件。

ai guide Ask AI 實戰

Ask AI Retrieval Eval 怎麼做:Golden Contract、Fixture、Live Run 與證據邊界

Ask AI 把 golden contract、offline fixture、live SSE output 與 production observation 分開保存。fixture 全綠只證明 harness 可重現;public sources 可以量 expected-source recall,不能拿來宣稱看過 hidden ranked chunks 或 model-graded faithfulness。

ai guide Ask AI 實戰

Ask AI 上線後怎麼查問題:SSE、Trace、Cache、Checkpoint 與 Shadow

Ask AI 同一次請求有五種不同證據:公開 SSE、Langfuse trace、D1 log、semantic cache 與 hidden shadow run。它們看見的資料不同,單看任一層都不能還原完整 retrieval context。

ai guide Ask AI 實戰

Ask AI 何時才顯示來源:Validation、Critic、降級與 Source Gate

Ask AI 找到文章,不代表畫面就該顯示來源。回答要先通過 Markdown/URL 的確定性驗證,再通過 Critic 的相關性、意圖與 groundedness 檢查;任一門檻失敗,來源卡片就不送到前端。

ai guide Ask AI 實戰

Ask AI 怎麼把證據寫成答案:Writer Context 與 Citation Contract

Writer 預設只讀 factual query 的前 8 筆或 recommendation 的前 12 筆候選證據,引用必須使用候選集合中的 exact `source_url`;檢索為空或被判為 weak 時,prompt 要求拒絕用模型常識補答案。

ai guide Cloudflare AI Stack

Cloudflare Agent Memory 怎麼用:把 agent 記憶和 RAG 文件分開

Agent Memory 是 Cloudflare 的 private beta 服務,用來讓 agent 跨對話記住使用者、團隊、專案與任務脈絡。它適合存 facts、events、instructions、tasks;RAG 文件、產品資料、檔案和 audit log 仍應該放在 AI Search、Vectorize、D1 或 R2。

ai guide Cloudflare AI Stack

Cloudflare Agents 怎麼用:durable agent runtime、工具與即時連線

Cloudflare Agents 把 agent session 做成 durable runtime:每個 agent instance 有穩定 identity、local SQLite、WebSocket、scheduled work、recoverable execution 和 tools。它不只是聊天範例;真正處理的是怎麼把 Workers、Durable Objects、AI model、Browser、Sandbox、AI Search、MCP 接成可部署的 agent app。

ai guide Cloudflare AI Stack

Cloudflare AI app 資料怎麼放:D1、R2、Durable Objects 的分工

AI app 不該把 conversation、artifact、memory、retrieval document、lock、eval trace 全塞進同一個 storage。D1 適合查詢與產品資料,R2 適合大型檔案與 artifact,Durable Objects 適合具名協調、WebSocket、per-session state;Agent Memory / AI Search / Vectorize 則分別處理記憶與檢索。

ai guide Cloudflare AI Stack

Cloudflare AI Gateway 怎麼用:Logging、Cache、Rate Limit 與 Fallback

AI Gateway 解的是 AI 呼叫的控制問題:同一層處理 logs、analytics、cache、rate limit、retry/fallback、BYOK 與 Unified Billing。Workers 內可用 env.AI.run(..., { gateway }),外部 SDK 則改 baseURL 或 provider-native endpoint。

ai guide Cloudflare AI Stack

Cloudflare AI Stack 導讀:在 Workers 上做 AI、RAG 和 agent

Cloudflare AI Stack 這條系列回答 AI app 的基礎設施問題:模型怎麼跑、gateway 怎麼控、RAG 怎麼做、agent 怎麼持續執行、memory 怎麼治理、browser/sandbox/secrets 怎麼接進產品。

ai guide Cloudflare AI Stack

Cloudflare Secrets Store 怎麼用:Workers secret reuse 與 AI Gateway BYOK

Secrets Store 是 Cloudflare 的 open beta account-level secret store,目前整合 Workers 和 AI Gateway。它適合把 provider API keys、BYOK key、跨 Worker 共用 secret 集中管理;per-Worker secret 仍可用,但治理範圍不同。

ai guide Cloudflare AI Stack

Cloudflare Vectorize 怎麼用:自己掌控 RAG Retrieval 的時候

Vectorize 是 Cloudflare 的向量資料庫。AI Search 適合先把 RAG pipeline 交給平台;Vectorize 適合你要自己控制 chunking、embedding、metadata filter、hybrid retrieval、重新索引與降級策略。

ai guide

個人學模型訓練要租 GPU 嗎:GPUtw.ai、LoRA、Jupyter 與第一輪實驗

GPUtw.ai 適合個人把短租 GPU 當成學習工具:先跑 Jupyter、Ollama、ComfyUI,再用 LoRA/QLoRA 做小模型微調。它不是大型基礎模型訓練平台,第一次使用應該小額測部署、計費與資料保存。

Keenable 該放進台灣 Agent 團隊的搜尋備選嗎?

Keenable.ai 把自己定位成給 AI agents 用的搜尋基礎設施:100B+ 文件索引、Search/Fetch API、 MCP/CLI 入口、100K 免費月額度與 keyless public endpoint。對台灣/繁中 agent 團隊來說, 現階段最合理的位置是 provider matrix 裡的實測候選;Brave、Exa、Tavily 或 Serper 仍要留著對照。

ai deep-dive

screenshot-to-code 怎麼把截圖變程式碼:Agent Loop、素材裁切、視覺驗證

screenshot-to-code 不是一步到位的截圖轉碼工具。核心是一個最多 30 步的 Agent Loop,搭配 7 個工具——從截圖裁切真實素材、用 Playwright 自我驗證、到同時跑 4 個模型讓使用者選最好的版本。GitHub 74,500+ stars,MIT License。

ai deep-dive

Agent 怎麼累積團隊判斷:Warp 的 Skill 回饋迴圈

Warp 的自我改進 Agent 不把每次錯誤塞進 prompt。base skill 做任務,人類在 GitHub 或 Slack 留回饋,improver skill 把重複訊號整理成小 diff,再走 PR review。真正有價值的是這套工程邊界:可追溯、可回滾、可拒絕更新。

TinyFish 介紹:為 AI Agent 設計的免費 Search 與 Fetch 基礎設施

TinyFish 為 AI agent 提供四個 Web API——Search、Fetch、Agent、Browser,其中 Search 與 Fetch 為 $0 永久免費且免信用卡,適合做 RAG 與文件檢索的預設層。

ADE 工作台對決:ADE、Superset、Herdr 與 Orca 怎麼選

把 ADE 類工作台分成四種哲學:arul28/ADE 的 Brain+Lane、Superset 的 100+ agents IDE、Herdr 的 Rust 常駐 runtime,以及 Kadro/Orca 的版面與 Fleet 取向;用一張對照表與選型決策樹幫你判斷何時該用水槽、而非 Omnigent 這類控制面。

治理深水區:Policy、Omnibox、Spend 與憑證代理

Omnigent 把治理從 prompt 抽到 Server 層的 Policy 引擎:Python 函式回 allow/deny/ask,三層堆疊疊加 cost budget 與 tool caps,搭配 Omnibox 以 bwrap/seatbelt 做 OS 原生隔離與 egress 憑證代理;本文對照 FailproofAI、DashClaw 等五套治理方案的定位與決策表。

ai deep-dive 認識 AI 模型

2026 Coding Benchmark 怎麼讀:SWE-bench、Terminal-Bench、DeepSWE、Aider 各自測什麼

每個模型發布都帶 benchmark 數字,但同一個模型在不同 harness 上可以差 20 分、SWE-bench Verified 的 32% 驗證器判斷有誤、DeepSWE 113 題讓多數模型掛零。這篇拆解六個主要 coding benchmark 各自測什麼、哪些容易灌水、讀者該看哪個。

ai guide Harvard CS50 AI 導讀

Harvard CS50 AI 導讀:七週主題、十二個 projects 與一門 2020 年錄影的課怎麼跟

CS50 AI 的 OpenCourseWare 版公開七週影片、投影片、notes 與十二個 Python projects,校外自學者可以拿到 autograder 回饋和每個 project 都達 70% 以上的免費 CS50 Certificate;但前六週錄影沿用 2020 年 Spring 版,只有 Week 6 Language 換成 2023 年重錄版。

ai deep-dive 認識 AI 模型

LLM API 怎麼買最划算:直連、聚合、雲端三條路的實際價差

同一個模型透過不同管道存取,價差可以到 2-5 倍。直連最簡單、聚合器(OpenRouter)最靈活、雲端平台(Bedrock/Vertex)最適合企業。這篇用 2026 年 8 月實際價格做橫向比較,附選擇決策樹。

同名不同層:meta-harness、ACP、HarnessAgent 與 Flue 到底在爭哪一層

同一個詞 meta-harness 其實指兩種東西:Databricks 的控制面與 Stanford 的優化迴圈。本文用 MCP/ACP/Runtime/meta-harness 四層模型,對照 Omnigent、Zed ACP、Vercel HarnessAgent 與 Cloudflare Flue 的定位。

ai guide MIT 6.7960 導讀

MIT 6.7960 導讀:一門課兩個官方版本——想修完走 2024 OCW,要最新內容讀 2025 投影片

[MIT 6.7960 Deep Learning](https://deeplearning6-7960.github.io/) 有兩個公開程度截然不同的官方版本:Fall 2025 課站 21 講投影片全公開但 psets 在 Gradescope、解答與錄影鎖在 Canvas(A2);[MIT OCW 的 Fall 2024 版](https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/)連影片、五份作業題目與起始檔都開放(接近 A3)。兩版綱要重疊約六成,講師從 Isola/Bernstein 換成 Kaiming He/Omar Khattab,不能拿舊影片硬配新講義。本文給出按目的分流的兩條自學路線。

ai deep-dive 認識 AI 模型

MoE 為什麼贏:從 Ornith 到 MiniMax,2026 年前沿模型都在用的架構

2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。

同一個多 Agent 任務,四種寫法:Omnigent YAML、LangGraph、CrewAI 與 Goose

用同一個 Polly 任務(平行 git worktree + 跨廠商審查)對照四種多 Agent 寫法:Omnigent 以 YAML 在 Server 層治理、LangGraph 以 StateGraph 精準控流程、CrewAI 以角色扮演快速拼裝、Goose 以 Recipe 跑單機自動化,對比 token、延遲與可維護性的真實取捨。

ai deep-dive

OLMo:唯一連訓練資料都開源的語言模型家族

Allen AI 的 OLMo 是目前唯一把權重、訓練資料(Dolma,9.3 兆 token)、訓練程式碼、所有中間 checkpoint 和評估工具全部公開的語言模型家族。OLMo 3 的 32B Think 模型在 MATH 跑到 96.1%,同時你可以用 OlmoTrace 追溯任何輸出回到訓練資料的哪一段。

多個 Agent 怎麼一起管:Omnigent 的 meta-harness、Policy 與跨裝置 Session

Databricks 開源的 Omnigent 把 Claude Code、Codex、Cursor、Pi 等 harness 包在 Runner/Server 與 Omnibox 沙盒之上,用三層 Policy 與可分享的持久化 Session 讓模型與 harness 一鍵替換,9.3k stars 的 alpha 專案。

ai deep-dive 認識 AI 模型

開源 AI 授權地雷指南:MIT、Apache 2.0、Llama License 到底差在哪

AI 的「開源」不等於軟體的開源。MIT 和 Apache 2.0 真的隨便用;Llama License 超過 7 億月活要另外談;舊版 Gemma 授權 Google 可以片面修改(Gemma 4 已改 Apache 2.0)。這篇按授權類型整理你能做什麼、不能做什麼。

ai guide 認識 AI 模型

開源 LLM 自架指南:框架怎麼選、硬體怎麼算、什麼時候比 API 划算

2026 年開源模型在 coding benchmark 追平閉源,但自架不只是選模型——vLLM 適合高併發生產服務、SGLang 在前綴重用場景快 29%、Ollama 是本地開發首選、llama.cpp 吃最少資源。A100 雲端租金約 $1.4-2.2/hr,自架損益兩平點大約在每月 100M tokens。

ai deep-dive 認識 AI 模型

後訓練 RL 三條路線:Ornith、Nous Research、MiniMax 怎麼用強化學習做出黑馬模型

2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。

ai deep-dive 認識 AI 模型

Token、Context Window、推論 vs 訓練:用 AI 模型前要知道的三件事

模型不讀字,讀 token——一個中文字通常是 1-2 個 token,一個英文字通常是 1-3 個。Context window 是模型一次能看的 token 上限。推論是用模型,訓練是教模型;你每天在做的是推論。

ai deep-dive 認識 AI 模型

Embedding:模型怎麼把文字變成可以計算的向量

模型不懂文字,只懂數字。Embedding 把每個 token 對應到一組幾百維的向量,意思相近的詞在向量空間裡距離相近。這是搜尋、RAG、分類背後共用的基礎機制。

ai deep-dive 認識 AI 模型

模型成績單怎麼看:Benchmark、Arena Elo、還有那些數字背後的陷阱

模型發布時貼的 benchmark 數字有三個常見陷阱:只秀贏的(cherry-picking)、訓練資料混入考題(contamination)、大家都考 90 分以上就沒鑑別力(saturation)。最抗操弄的訊號是 Chatbot Arena 的 Elo 排名——真人盲測投票,模型廠商無法控制題目。

ai deep-dive 認識 AI 模型

Fine-tuning vs RAG:什麼時候該教模型、什麼時候該幫模型查資料

資料常更新、需要引用來源 → RAG。需要統一風格、要跑在小裝置上 → fine-tuning。實務上很多系統兩者都用:fine-tune 一個懂你領域語言的小模型,再用 RAG 補上最新資料。

ai deep-dive 認識 AI 模型

模型怎麼改進自己:梯度下降與訓練迴圈

模型透過 loss 知道自己錯多少,透過梯度知道往哪邊調。梯度下降就是反覆做三件事:算 loss、算梯度、調參數。Learning rate 決定每步調多大——太大會跳過最佳解,太小訓練到天荒地老。

ai deep-dive 認識 AI 模型

模型怎麼知道自己錯了:Loss Function 與 Cross-Entropy

模型每次預測下一個 token 時,會給每個候選詞一個機率。Loss function 衡量這個機率分佈跟正確答案差多遠——差越多,loss 越高,模型就知道自己錯得越離譜。Cross-entropy 是最常用的算法,perplexity 是它的直覺版。

ai deep-dive 認識 AI 模型

量化與推論最佳化:讓 70B 模型跑在你的筆電上

70B 模型原本需要 140GB VRAM,但量化到 4-bit 只需要 ~35GB,再用 llama.cpp 的部分卸載就能在消費級硬體上跑。GGUF 格式的命名規則(Q4_K_M、Q5_K_S)告訴你精度和大小的取捨。KV cache 是長對話變慢的主因。

ai deep-dive 認識 AI 模型

Scaling Laws:模型要多大才夠,以及為什麼不是越大越好

Scaling laws 說 loss 跟參數量、資料量、算力之間有可預測的冪次關係。Chinchilla 論文的關鍵發現:大多數模型都太大、訓練資料太少——同樣的算力預算,訓練一個較小但吃更多資料的模型反而更強。這改變了整個產業的訓練策略。

ai guide 認識 AI 模型

認識 AI 模型:從 token 到自架,18 篇讀懂模型的通用知識

不需要變成研究員也能系統理解 AI 模型。這個系列從你看得見的東西(token、context window)開始,一路走到自架開源模型,18 篇覆蓋選模型、讀 benchmark、算成本需要的所有基礎。

ai deep-dive 認識 AI 模型

Tokenization:BPE 演算法,以及為什麼中文比英文貴

模型不是按字數收費,是按 token 收費。BPE 演算法從字元開始,反覆合併最常出現的相鄰配對來建詞表。英文 'understanding' 可能是 1-2 個 token,但中文「理解」可能要 2-3 個——同樣的意思,中文就是比較貴。

ai deep-dive 認識 AI 模型

預訓練、SFT、RLHF:模型從「補完文字」變成「有用助理」的三個階段

所有 LLM 都經過三階段訓練:預訓練讀完網路學會語言、SFT 用示範對話學會格式、RLHF 用人類偏好學會什麼回答比較好。Base model 到 chat model 的差距,就是後兩個階段做的事。

ai deep-dive 認識 AI 模型

Transformer 與 Attention:模型怎麼決定該看哪些字

Transformer 的核心是 self-attention:對每個 token,模型算出它跟其他所有 token 的相關程度,然後按權重加總。這讓模型能跨越距離抓到「it 指的是 cat 不是 mat」這種關係,也是它處理長文的基礎。

ai deep-dive RAG 技法大全

Agentic / Reasoning RAG:從 Search-R1 的 RL 多輪搜索到 Deep Research 與 MCP 的推理×檢索新範式

2025 年的 RAG 不再是「檢一次、生成一次」。Search-R1 用 RL 讓模型在推理中自主多輪搜索,REX-RAG/AlignRAG 補上策略與對齊的分支,OpenAI Deep Research 把整條鏈產品化,MCP 則把檢索泛化為統一的工具調用。本文拆開設計哲學、與舊世代的取捨、以及何時該用這套新範式。

ai deep-dive

Apple 開放 Private Cloud Compute 免費額度:AFM 3 模型家族與開發者該知道的事

Apple 讓 App Store Small Business Program 開發者免費使用跑在 Private Cloud Compute 上的 AFM 3 模型,門檻是首次下載數低於 200 萬次。AFM 3 家族共五個模型,裝置端的 AFM 3 Core Advanced 用 200 億參數稀疏架構只啟動 1–4B,雲端最強的 AFM 3 Cloud Pro 跑在 Google Cloud NVIDIA GPU 上,用 Gemini 輸出做蒸餾式精煉。

ai deep-dive

BytePlus ModelArk Coding Plan:字節跳動的 AI 編碼訂閱方案

BytePlus ModelArk Coding Plan 提供 Lite($10/月)和 Pro($50/月)兩種訂閱,整合 DeepSeek-V4、GLM-5.2、Seed-2.0 等多模型,支援 Claude Code、Cursor 等主流工具,Lite 月配額約 24,000 次請求,Pro 為其 5 倍。

跟成熟 coding agent 學設計(2):Agent loop 的形狀——事件流、checkpoint、resume

pi 的 loop 是雙層 while 加 EventStream;claude-code 明講 stop_reason 不可靠、改以串流中收到的 tool_use block 當唯一續跑訊號;codex 把 turn 做成可取消的 SessionTask 再靠 rollout crate 錄 JSONL;looplane 選了「manifest 先落盤、JSONL 跟上」的寫入順序,讓 Ctrl-C 之後能做驗證式續跑而非重跑。這篇全部附 file#symbol 級證據。

跟成熟 coding agent 學設計(13):CLI 人體工學——讓新工具長得像使用者已經會用的工具

成熟的 coding agent CLI 都收斂到同一套慣例:positional prompt、-p 是 print、exec 是 headless、resume 是一級指令、-C 換目錄;looplane 直接繼承這套詞彙,把學習成本壓到接近零。

跟成熟 coding agent 學設計(10):編輯工具的取捨——unified diff、exact edit、hashline 與 whole-file

LLM 寫 unified diff 壞在簿記:hunk 行數算錯、上下文行幻覺。五家的答案分成兩派——把 diff 文法做簡單(Codex 拿掉行號)、或乾脆不用 diff(Claude Code/Pi/OpenCode 的 exact replace);OMP 更進一步用 hash 錨點綁住讀取狀態。looplane 走最小干預:保留 guarded apply_patch,加一個零模糊匹配的 replace_text,qwen3:4b eval 就從穩定失敗變 5/5。

跟成熟 coding agent 學設計(9):外部 CLI 當 backend——包別人的 loop,安全邊界畫在哪

每家成熟 coding agent 都有 headless 機器介面:codex 有 `exec --json` 和更完整的 app-server JSON-RPC,claude-code 有 `-p` 加 stream-json,pi/opencode/omp 各有一種 JSON 事件流。直接把這些 CLI 當 backend 是最快的路,但代價是:它們自帶 agent loop、自己的權限模型、自己的登入。looplane 的答案是讓外來 CLI 完整擁有它的 loop,自己只守住三件事——隔離副本、patch audit、最終驗證——並且一條 runtime 永遠不偽裝成另一條。

跟成熟 coding agent 學設計(22):Gateway 模式——把任何 provider 變成 OpenAI 相容端點

生態系都把 /v1/chat/completions 當共通語,但你手上的 provider 不一定講這個方言。五家的答案分三派:pi 和 OpenCode 讓 client 本身講多種方言所以不做 gateway;OMP 做了真正的 protocol translator(foreign wire → 中立 context → provider adapter,禁止 raw passthrough);Codex 和 Claude Code 的 proxy 不翻譯,只負責強制流量管控。looplane 抄 OMP 的邊界但收斂成一進一出:只收 OpenAI Chat,嚴格解析成 canonical contract,後面接任何 ModelProvider——順便踩掉一個 cross-event-loop client close bug,教訓是 provider 的生命週期必須交給 ASGI lifespan。

跟成熟 coding agent 學設計(21):Headless 模式與 CI 使用——沒有人可以按 approve 的時候

agent 進 CI 後最大的問題是審批:沒有終端機、沒有人可以按 approve。五家的解法收斂成兩條路——把權限決策外包給呼叫端(claude-code 的 control protocol),或直接換掉審批語意(codex 預設 Never 配沙箱、opencode 預設自動拒絕)。looplane 用同一個 AgentRunner loop 注入不同的 ApprovalPolicy:headless 下用 HeadlessApprovalPolicy,不讀 stdin 所以不可能卡住 pipeline,EXECUTE 預設 fail closed。

跟成熟 coding agent 學設計(14):Onboarding 設計——provider-aware 初始化與即時驗證

空白設定檔勸退人,憑證錯太晚發現更勸退人。五家成熟 agent 都把 setup 做成 first-class state,looplane 再補上存完 key 立即驗證這一步。

跟成熟 coding agent 學設計(20):Run artifacts 契約——跑完之後憑什麼審計?

agent 跑完之後,「模型說它做完了」不是證據。codex 把 trace 拆成 manifest + JSONL + payloads 的 bundle、omp 用 SQLite 鏡像磁碟上的固定檔案、pi 用 runs.jsonl 索引原生 session 檔。looplane 選了最硬的一條:每個 run 固定六個檔案,缺一個就不算完成,patch 審計看 changes.patch 不看口頭宣稱。

跟成熟 coding agent 學設計(16):Runtime 抽象與 capability handshake

五個外部 CLI 有五種機器介面:JSONL 事件流、JSON-RPC、HTTP API、ACP、stream-json。支援它們的正確姿勢不是抽一個「都一樣」的介面,而是一條窄的 runtime 邊界加一份誠實的 capability matrix——availability 只代表裝了,不代表登入;協定飄移就 fail closed。

跟成熟 coding agent 學設計(11):沙箱與遠端執行——Cloudflare Sandbox 部署實戰

本地沙箱管的是『agent 在你的機器上爆炸半徑多大』,雲端沙箱管的是『怎麼把程式碼安全地搬到別人的機器上跑』——五家成熟專案幾乎都在做前者,只有 looplane 真的部署了後者。實戰教訓:mock 測不出 SSE framing、CI 綠燈擋不住 stale wheel,而清理路徑要跟成功路徑一樣有 timeout。

跟成熟 coding agent 學設計(19):Session 持久化與 crash recovery——agent 死掉之後,狀態怎麼救

五家 agent 的 session 儲存幾乎都是 append-only JSONL 加上某種單寫者保護,但 crash recovery 的差別在細節:pi 會修 torn tail、codex 寫失敗會重開檔重試、looplane 選了「manifest 先落盤」讓唯一的 crash window 變成可修復的一格。這篇拆解每家的寫入順序與 fail-closed 條件,全部附 file#symbol 證據。

跟成熟 coding agent 學設計(12):小模型能寫程式嗎——能力邊界與 eval 紀律

小模型卡的不是『不會想』而是『格式不穩』:tool call JSON、diff hunk 計數、context 預算都會爆。五家參考專案的共識是把評測建立在真實模型行為上(pi 的 model-backed eval、OMP 從真實 session log 校準編輯基準、Codex 甚至為弱模型放寬 parser),looplane 則選最窄但最硬的路:一個 fixture、五次真實 Ollama 執行、manifest 宣告改哪些檔案和哪些 patch 片段才算過,並且把 M2 的失敗原封不動留成證據——不把 mock 當 E2E,不把部分成功講成全過。

跟成熟 coding agent 學設計(17):啟動效能與工程紀律——慢的從來不是語言

CLI 工具每次叫用都要付一次啟動成本,而沒有 baseline 的效能優化等於沒有回歸保護。codex 用 daemon 重用與 skill snapshot 快取、claude-code 把入口切成七十個動態 import 加上內建啟動 profiler、opencode/omp 各有 lazy 載入紀律;pi 則什麼都沒做,靠 Bun 的速度快撐著。looplane 是 Python,天生慢,所以把紀律做滿:lazy import、單飛磁碟快取、背景預熱 controller、hyperfine paired benchmark 加上 CI 大於 10% 退步就擋 merge。

跟成熟 coding agent 學設計(8):訂閱的正道與邪路——OAuth 與 credential 邊界

五家在「訂閱認證」上分成三派:Codex 和 Claude Code 只為自己官方 client 做 OAuth 並把 token 收進 OS keyring;pi 和 OMP 直接重用 Claude Code 的 client ID 實作 Pro/Max OAuth(技術可行但 Anthropic 文件明文禁止第三方未經核准提供 claude.ai 登入);OpenCode 則把內建 Pro/Max plugin 整組移除,是生態系最乾淨的政策先例。looplane 的原則:自己的 grant 自己做、絕不刮別家 CLI 的 credential 檔、第三方 client 要 provider 明確支援才接 OAuth、credential 不複製不轉發。

跟成熟 coding agent 學設計(24):測試一個會動的 agent——fake-CLI 合約、錄製串流、TUI pilot

agent 的兩個依賴——LLM 和外部 CLI——都不是決定性的,但成熟專案的招式是把「會動的部分」與「邊界的形狀」切開:codex 用 wiremock 假 Responses API 加腳本化 SSE server,TUI 用 insta 快照;opencode 乾脆做了 VCR 式的 http-recorder 錄放套件;pi 把 eval 與 unit test 分成兩份 vitest config;omp 把 edit benchmark 本身用 unit test 圍起來。looplane 對外部 CLI 做了四層:單元測試、fake-CLI 合約、錄製串流整合、Textual pilot TUI 測試。核心方法論一句話:錄下真實的非決定性輸出,對它做決定性的斷言。

跟成熟 coding agent 學設計(15):從全螢幕 TUI 到 semantic transcript

成熟的 coding agent TUI 都不是把事件流印出來,而是先做一層 typed projection 再渲染;looplane 走了全螢幕組合、runtime-first 雙模式、移除 Ask/Agent 分離三步,才把 non-streaming 和 resume 不能 replay 兩個舊限制真正解除。

跟成熟 coding agent 學設計(5):Verification gate——改了檔案不算成功,驗過才算

五家參考專案裡沒有任何一家在 harness 層強制「宣告的驗證指令全過才算成功」:pi 靠模型自覺、OpenCode 和 Codex 把驗證寫進 system prompt、Claude Code 用獨立的對抗式驗證 subagent 但仍是軟性合約、只有 OMP 的 cleanse 真的由 harness 跑檢查。looplane 選最硬的一條路:改過檔案就必須重跑所有宣告的驗證指令,全過才給 terminal_reason=verified;沒動任何檔案就不重跑(no_changes),把「跑不跑」變成程式碼決定,不是模型決定。

為什麼 Python:寫 coding agent 的語言選擇代價與補償

五個成熟 coding agent 沒有一家用 Python——pi/opencode/claude-code 用 TypeScript,codex 從 TS 重寫成 Rust,omp 把熱路徑補上 8 萬行 Rust native crate。looplane 仍選 Python,代價是啟動效能與打包,補償手段是 lazy import、uv 和 Cloudflare Sandbox。

ai deep-dive RAG 技法大全

圖譜 RAG 怎麼選:GraphRAG v3.1.2、LightRAG 與 HippoRAG 2 的設計、成本與選型

同樣是「知識圖譜 + 檢索」,Microsoft GraphRAG v3.1.2 用重索引換全局總結能力,LightRAG 用 dual-level 與增量把成本砍下來,HippoRAG 2 用 PPR 把 RAG 做成可持續增長的記憶;這篇按部件拆設計取捨,含四種查詢、索引流程與選型表。

ai deep-dive RAG 技法大全

Late Chunking vs Contextual Retrieval:先編碼後切塊的零成本上下文 vs LLM 前置生成的精準度交易

Anthropic Contextual Retrieval 用 LLM 為每塊生成 50-100 token 前置上下文把失敗率從 5.7% 壓到 1.9%(含 rerank),成本約 $1.02/1M tokens;Late Chunking 先以 32K 長上下文模型全文件編碼再切塊 mean-pool,零額外 LLM 成本,取捨在窗口、延遲與文件結構。

ai guide

Unsloth 完整指南:在本地微調和運行 LLM 的加速工具

Unsloth 是目前最省 VRAM、最快的本地 LLM 微調工具,訓練速度快 2 倍、VRAM 省 70%。2026 年加入 Desktop 桌面應用後,整合了推論、微調、圖片影片生成、web search 和 agent 連接,從微調庫變成完整的本地 AI 工作站。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:電腦視覺篇

2021 是 Transformer 正式入侵電腦視覺的元年——Swin Transformer 拿下 ICCV Best Paper,DINO 證明自監督 ViT 能自動學會物件分割,NeRF 從單篇論文變成一整個子領域。CVPR 和 ICCV 都因疫情改為全線上舉辦,但這一年產出的論文深遠影響了此後整個 CV 領域的架構選擇。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:機器學習篇

2021 年是 diffusion model 超越 GAN、自監督學習理論突破、RL 評估方法論覺醒的一年。NeurIPS 收了 9,122 篇投稿創當時紀錄,ICLR 的 Score-Based Generative Modeling 論文日後成為整個 diffusion 生態的理論基石,ICML 則在優化理論與自監督學習動力學分析上交出紮實貢獻。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:自然語言處理篇

2021 年是 NLP 從「fine-tune 整個模型」轉向「只調一小部分參數」的分水嶺——Prefix-Tuning(ACL)、LoRA(arXiv,後成為業界標準)、Prompt Tuning(EMNLP)三篇同年出現,ACL Rolling Review 同年啟動,Findings track 正式站穩成為第二發表管道。

ai deep-dive AI 頂會導讀

2021 AI 頂會在收什麼題目:Transformer 擴散、自監督學習與 Diffusion 的起點

2021 年是 AI 頂會的分水嶺:Transformer 從 NLP 全面入侵 CV 與時序領域,自監督學習成為各會議最熱門關鍵詞,Diffusion Model 拿下 ICLR Outstanding Paper 但還沒有人意識到它會取代 GAN——而 GNN 和 Federated Learning 正處於論文量的歷史高峰,之後開始走下坡。

ai deep-dive AI 頂會導讀

2022 AI 頂會導讀:電腦視覺篇

2022 年是 CV 從「辨識」走向「生成」的轉折點——Latent Diffusion Models 在 CVPR 發表後催生了 Stable Diffusion,NeRF 從 2021 年的 25 篇暴增到 CVPR 單場超過 50 篇,ConvNeXt 替 CNN 打了一場漂亮的反擊戰,而 ECCV 則在 Tel Aviv 交出了 157 篇 Oral 的歷史最高紀錄。

ai deep-dive AI 頂會導讀

2022 AI 頂會導讀:機器學習篇

2022 年是 diffusion model 登上頂會舞台中央、Chinchilla scaling laws 改寫大模型訓練範式、Chain-of-Thought 讓推理成為可提示能力的一年。NeurIPS 破萬篇投稿,13 篇 Outstanding Paper 裡有 3 篇跟 diffusion 直接相關,Chinchilla 和 data pruning 兩篇挑戰了『大就是好』的信條。ChatGPT 年底發佈前夜,所有拼圖都在這一年的頂會上各就各位。

ai deep-dive AI 頂會導讀

2022 AI 頂會導讀:自然語言處理篇

2022 年是 NLP 從「模型能力展示」走向「模型對齊與控制」的轉折年——InstructGPT 把 RLHF 推上主流、Chain-of-Thought 證明推理能力可以靠提示詞解鎖、Flan 2022 讓 instruction tuning 的方法論成熟化。ACL 與 NAACL 同年全面啟用 ARR 滾動審稿,暴露了大量基礎設施與審稿人負載問題。年底 ChatGPT 上線,NLP 研究的遊戲規則從此改寫。

ai deep-dive AI 頂會導讀

2022 AI 頂會在收什麼題目:Diffusion 爆發、Chain-of-Thought 與 ChatGPT 前夜

2022 年是 AI 頂會的轉折年:Diffusion Model 從冒頭變成主流(NeurIPS 兩篇 Outstanding Paper),Chinchilla 改寫 scaling laws 的遊戲規則,Chain-of-Thought 證明大模型能推理,InstructGPT 用 RLHF 讓語言模型學會聽話——而這一切在年底 ChatGPT 上線後瞬間從學術議題變成全球新聞。

ai deep-dive AI 頂會導讀

2023 AI 頂會導讀:電腦視覺篇

2023 是 CV 從「看圖」走向「理解+生成+控制」的一年——Segment Anything 讓分割變成 zero-shot 通用能力,ControlNet 讓擴散模型可精準控制,3D Gaussian Splatting 以即時渲染速度挑戰 NeRF,DreamBooth 和 InstructPix2Pix 把文生圖從「生成」推向「編輯」。CVPR 投稿量突破九千、ICCV 突破八千,兩場會議恢復實體舉辦,規模與密度同創新高。

ai deep-dive AI 頂會導讀

2023 AI 頂會導讀:機器學習篇

2023 年是 LLM 全面接管 ML 頂會的一年。NeurIPS 投稿破 12,000 篇,兩篇 Outstanding Paper 都直接針對大模型(隱私審計與湧現能力質疑),Runner-Up 的 DPO 在短短兩年內成為 RLHF 的實質替代標準。ICLR 的 DreamFusion 開啟了 text-to-3D 賽道,ICML 則把 LLM 水印和學習率自適應推上舞台。Mamba 以 arXiv 預印本之姿在 NeurIPS 現場引爆討論,預示 Transformer 的第一個真正挑戰者即將到來。

ai deep-dive AI 頂會導讀

2023 AI 頂會導讀:自然語言處理篇

2023 年是 ChatGPT 之後的第一個完整學術年——NLP 頂會的議程被 LLM 全面重寫:ACL 的 Best Paper 研究幽默理解和政治偏見追蹤,EMNLP 的 Best Paper 用資訊流視角解釋 in-context learning,而 HackAPrompt 這篇 prompt injection 競賽論文直接拿下 EMNLP Best Paper,標誌著安全研究正式進入主流。整年最大的主題轉變是:研究者不再問「怎麼讓模型更準」,開始問「怎麼知道模型在不在騙你」。

ai deep-dive AI 頂會導讀

2023 AI 頂會在收什麼題目:LLM 重寫研究議程的一年

2023 年是 LLM 全面重寫 AI 研究議程的第一年:DPO 拿下 NeurIPS Outstanding Runner-Up、ReAct 成為 ICLR Oral、hallucination 從邊緣詞彙變成每場會議的熱門 track——同時 3D Gaussian Splatting 在 SIGGRAPH 發表後橫掃 CV 社群,Mamba 年底出現挑戰 Transformer 的注意力壟斷,而傳統 NLP pipeline 的論文量開始明確萎縮。

ai deep-dive AI 頂會導讀

2024 AI 頂會導讀:電腦視覺篇

2024 是 3D Gaussian Splatting 全面接管 3D 重建、video generation 從研究走向產品、vision-language model 深入各垂直領域的一年。CVPR 投稿量突破 11,500 篇再創紀錄,Best Paper 給了 Google Research 的 Generative Image Dynamics 和 UCSD/Google 合作的 Rich Human Feedback for Text-to-Image Generation;ECCV Best Paper 則頒給哥倫比亞大學的 Minimalist Vision with Freeform Pixels——一篇回歸光學基礎物理的非典型得獎作。

ai deep-dive AI 頂會導讀

2024 AI 頂會導讀:機器學習篇

2024 年是 ML 頂會投稿量爆炸的一年:NeurIPS 收到 15,671 篇創歷史紀錄,ICML 和 ICLR 也分別突破九千和七千。研究主題從「把模型練更大」轉向「推論時怎麼花算力更聰明」——test-time compute scaling 成為年度最重要的新方向。Best Paper 層面,VAR 用 next-scale prediction 在影像生成上超越 diffusion、Rectified Flow 成為 Stable Diffusion 3 的理論基礎、ICLR 首次頒發 Test of Time Award 給 VAE 原論文。

ai deep-dive AI 頂會導讀

2024 AI 頂會導讀:自然語言處理篇

2024 年的 NLP 頂會在 LLM 全面統治下重新定義自己:ACL 把開放科學列為年度主題、七篇 Best Paper 有四篇在問語言模型的根本能力邊界;EMNLP 則把焦點轉向多語言與跨文化,Best Paper 從語音表徵做到梯度可解釋性。投稿量持續爆炸(ACL+EMNLP 合計破萬),但社群真正焦慮的不是數量,而是當 LLM 能做幾乎所有 NLP 任務時,NLP 研究本身還剩什麼。

ai deep-dive AI 頂會導讀

2024 AI 頂會在收什麼題目:Agent 元年與 Scaling 辯論

2024 年 AI 頂會的關鍵字是 agent、alignment、multimodal LLM 和 inference-time compute——LLM 相關論文在五大會議的佔比從 2023 年的顯著上升再度翻倍,agent 相關關鍵詞成長 4.3 倍,而 diffusion model 從「新興方向」正式晉升為與 LLM 並列的雙主軸。同時,傳統任務導向 NLP 研究持續萎縮,GAN 幾乎從頂會消失。

ai deep-dive AI 頂會導讀

2025 AI 頂會導讀:電腦視覺篇

2025 是 CV 雙會年——CVPR 和 ICCV 同年舉辦。CVPR 投稿 13,008 創歷史新高,Best Paper VGGT 把 3D 重建從逐步最佳化拉到 feed-forward 推論;ICCV 的 Marr Prize 頒給了用文字生成可實際拼搭積木結構的 BrickGPT。3D Gaussian Splatting 全面取代 NeRF、video generation 從研究走向產品、flow model 開始取代 diffusion——CV 領域在這一年完成了多項典範轉移。

ai deep-dive AI 頂會導讀

2025 AI 頂會導讀:機器學習篇

2025 年是 ML 頂會投稿量全面破紀錄、審稿系統承壓到極限的一年。NeurIPS 收了 21,575 篇投稿動用超過兩萬名審稿人,ICML 首度突破 12,000 篇,ICLR 也衝上 11,565 篇。研究主題上,reasoning 與 agent 成為最強勢的兩股潮流——NeurIPS Best Paper 之一直接質疑 RLVR 是否真的帶來新推理能力,拿下該屆唯一滿分;而 attention 機制的結構性改進(Alibaba Qwen 的 Gated Attention)和 neural scaling laws 的理論解釋同時獲獎,標誌著社群正從「衝規模」轉向「理解為什麼有效」。

ai deep-dive AI 頂會導讀

2025 AI 頂會導讀:自然語言處理篇

2025 年 NLP 頂會的投稿量全面翻倍(ACL 8,360 篇、EMNLP 8,174 篇),中國第一作者在 ACL 佔比突破 51%,DeepSeek 的 Native Sparse Attention 拿下 ACL Best Paper——但最值得注意的是會議本身的身份危機:ACL 主席說『ACL 不是 AI 會議』,一篇量化分析問『Has ACL Lost Its Crown?』,EMNLP 被質疑跟 ACL/NAACL 還有什麼差別。

ai deep-dive AI 頂會導讀

2025 AI 頂會在收什麼題目:Agent 爆發與 Reasoning 革命

2025 年 AI 頂會的兩個最強訊號:reasoning 論文從 47 篇暴增到 216 篇(4.6 倍)、agent 相關關鍵詞合計超過 150 篇(4.3–11 倍成長)。Diffusion model 已從「爆發」進入「基礎設施」階段,RAG 以五會議全覆蓋的罕見擴散速度成為企業 AI 的主流架構,而 state space model 和 world model 正複製 2020–2021 年 Vision Transformer 的早期軌跡。純 prompt engineering 論文開始遭遇 reviewer fatigue。

ai deep-dive AI 頂會導讀

獨立研究者投頂會:現實評估

獨立研究者投頂會不是不可能,但數據很殘酷:頂會的單一作者論文比例已降到個位數百分比,平均作者數從 3 人漲到 5 人,前 20 大機構佔了 35-50% 的作者署名。Andreas Madsen 花 8 個月無薪工作拿到 ICLR Spotlight,結果還是得回去讀博。這篇整理實際案例、審稿偏見的研究證據、以及沒有大 lab 資源時的可行路徑。

ai guide AI 頂會導讀

一篇頂會論文從投稿到見刊經過什麼

一篇 AI 頂會論文從投稿到見刊,要走過匿名化投稿、格式審查、reviewer bidding 與分配、3-4 位審稿人獨立評分、author rebuttal、AC/SAC/PC 三層決策、camera-ready 修訂——全程約 4-5 個月。ACL 系列還多了一層 ARR 滾動審稿的「先審後 commit」機制。

ai deep-dive AI 頂會導讀

Main Track、Findings、D&B Track 差在哪:AI 頂會的三條發表路徑

同一篇論文投到同一場會議,可能走三條完全不同的路:Main Track 是最高門檻的正式發表、Findings 是 ACL 系列獨有的「品質夠但沒上主軌」附刊、D&B Track 是 NeurIPS 為純資料集和評測方法論開的專門賽道。三條路在審稿標準、prestige、職涯訊號上差異明顯,投之前搞清楚差別比寫論文本身更重要。

ai deep-dive AI 頂會導讀

誰在投頂會:AI 學術圈的實驗室、企業與地理版圖

AI 頂會的論文版圖正在劇烈重組:企業研究院主導前沿模型開發(2024 年近 90% 的 notable model 來自業界),但學術界仍是高引用研究的最大產出方;中國高校五年內從追趕者變成 NeurIPS 論文量佔比近半的主力;OpenAI、Anthropic 等公司則幾乎從頂會論文名單上消失——發表量與研究能力的脫鉤,是這個時代最值得注意的訊號。

ai deep-dive

Marin 535B 怎麼訓:Scaling Ladder、MoE 專家並行、Harrier 資料與 W&B 現場

Stanford Marin 在 11×GB200 上公開訓練 535B-A23B,先用 1% 算力的 5 階 Scaling Ladder 預註冊 paloma macro-loss 2.04,再以 W&B 即時公開 847 組訓練數據;本文按訓練流程拆解其設計與監控方法。

ai deep-dive AI 頂會導讀

AI 頂會是什麼:CCF、CORE 與 h5-index 為什麼會互相矛盾

「AI 頂會」不是任何機構的官方認證,而是 CCF-A、CORE-A*、Google Scholar 高 h5-index、低接受率四套獨立訊號的社群共識交集——而這四套訊號經常互相矛盾,ICLR 完全不在 CCF 名單裡就是活生生的例子。

學術搜尋怎麼組:arXiv、OpenAlex、Crossref、Semantic Scholar 與 PubMed 的分工

學術搜尋不能把五個 API 的結果直接串起來:先用 arXiv/PubMed 做領域發現,再用 DOI、PMID、arXiv ID 對齊 OpenAlex/Semantic Scholar,最後由 Crossref 與 PubMed 關係資料檢查正式版本、勘誤與撤稿。

ai deep-dive

AG2:以對話、GroupChat 與 speaker selection 組織多 Agent 協作

AG2 延續 AutoGen 的 ConversableAgent 心智模型:agent 透過訊息協作,GroupChatManager 再用 round-robin、manual、random 或 LLM 決定下一位發言者。

ai deep-dive

2026 Agent 框架怎麼選:LangGraph、CrewAI、MAF、AG2、Mastra、Pydantic AI、DSPy

七套工具不是同一類產品:LangGraph、MAF 與 Mastra偏耐久工作流,CrewAI 與 AG2 偏多 agent 協作,Pydantic AI 偏型別化 Python agent,DSPy 則用資料與 metric 最佳化整個 AI 程式。先選控制模型,再選框架。

Agent 搜尋 Query 怎麼寫:關鍵字、語意描述、拆解與改寫

Agent 不該把使用者原句直接丟給每一種搜尋服務:先辨認 exact lookup、keyword、semantic 或 fielded search,再把來源、時間、語言與欄位限制放進 provider 原生參數,最後依零結果、結果過廣與來源不對症狀改寫。

ai deep-dive

Amazon Bedrock 深入介紹:把模型 API 放進 AWS 治理邊界

Amazon Bedrock 不只是代售多家模型 API;它把模型呼叫、IAM、Region、Knowledge Bases、Guardrails 與 CloudWatch 串成同一套 AWS 控制面。它最適合已在 AWS 上、治理成本比最低 token 單價更重要的團隊。

ai deep-dive

Arize Phoenix:從 Trace 長出 Dataset、Experiment 與 Evaluator

Phoenix 是 MIT 授權的開源 LLM observability/eval 平台:先用 OpenTelemetry + OpenInference 收 trace,再把 production failure 收進 versioned dataset,以 experiment 比 prompt、model 或 RAG 改動,最後用 code、human 與 LLM evaluator 回寫分數。它不是 Arize AX;自架預設無認證且永久保留資料,正式環境必須先補安全政策。

ai guide 搜尋與爬取實戰

需要登入的網站怎麼交給 Agent:Session、權限與自動化邊界

登入狀態不是方便攜帶的設定,而是一把能冒用身分的鑰匙。安全做法是使用專用低權限帳號與隔離 browser profile,把讀取、可逆寫入、高風險交易拆成三級,MFA 與最後提交留給人。

ai deep-dive

Baseten:從 Truss 打包到 Autoscaling 的模型推論生命週期

Baseten 把自訂模型的打包、GPU 部署、推論引擎、autoscaling 與發布流程收進同一平台;價值不在多一個 OpenAI API,而是讓 ML 團隊保留 runtime 控制權,同時少維護一層 GPU orchestration。

ai deep-dive

Braintrust:把 LLM 評估做成從 Dataset 回到 Production 的迴圈

Braintrust 把 versioned datasets、immutable experiments、scorers 與 production traces 接成同一個評估迴圈;它的價值不是多一個分數,而是把線上失敗送回離線測試。公司在 2026-02 宣布 8,000 萬美元 B 輪,客戶名單為公司自報。

ai guide

Brave Search API 完整指南:用獨立搜尋索引替 Agent 取得網路結果

Brave Search API 以 Brave 自有的網頁索引與排名模型提供 Web、News、Images、Videos 與 LLM Context 五類端點;核心搜尋不只是 Google SERP 的 API 包裝。

ai deep-dive

Browserbase:把 Agent 的瀏覽器拆成可營運的基礎設施

Browserbase 把遠端 Chromium、持久化 Context、代理伺服器與 Session Inspector 包成同一個控制平面;它解決的是瀏覽器艦隊的生命週期與除錯,不替 agent 決定下一步。官方截至 2026-08 自報每月超過 3,500 萬次 browser session、逾 10,000 家客戶。

ai deep-dive

Cartesia 深入介紹:從 Sonic 串流 TTS 到即時語音 Agent Pipeline

Cartesia 的核心是 Sonic 即時 TTS、Ink STT 與串流推論;雖然 2026 年已有 Line voice-agent 平台,選型時仍要分清模型層與電話 orchestration,並把 voice cloning 同意、資料保存與 fallback 自己設計好。

ai deep-dive

Cerebras Inference:把 wafer-scale 速度放進 Agent 迴圈前,先看懂真正的瓶頸

Cerebras 的價值是把支援模型的生成階段大幅加速;但 Agent 的端到端速度仍取決於 prefill、工具 I/O、模型能力與平台相容性。

ai deep-dive

Chroma 向量資料庫完整指南:從本機 RAG 到分散式檢索

Chroma 用 collection 統一管理 embedding、文件與 metadata;本機可嵌入 Python,單機版採 HNSW,分散式版則以物件儲存、SSD 快取與 SPANN 拆分運算和儲存。

ai deep-dive

Claude Code 新創操作手冊:Anthropic 歸納的五條出貨原則

Anthropic 訪談 15 間新創,歸納出 Claude Code 操作五原則:人人出貨、自動化瑣事、信任但驗證、為重建而建、原型到產品化。ClickHouse 多出 30% 功能、Clay 100% 自動化 bug triage、Artemis Security 一週 6,000+ PR。

ai deep-dive

Cloudflare Kitesurf:不是 Chromium 的 Agent 瀏覽器,該拿什麼換規模

Kitesurf 是 Browser Run 內仍在 beta 的非 Chromium 瀏覽器後端:用 Workers isolates、Rust/Wasm 與無狀態元件換低 CPU/記憶體,但犧牲像素相容性、長登入工作階段、WebGL 與完整反機器人能力。

ai deep-dive Cloudflare AI Stack

Cloudflare Sandboxes 深入介紹:Workers、Durable Objects 與 Containers 怎麼組成 Agent 執行環境

Cloudflare Sandboxes 把 Worker 當入口、Durable Object 當具名控制面、獨立 VM 內的 Container 當執行面;適合已在 Cloudflare 上、需要大量短暫 Linux 工作區的 agent,但持久資料、安全邊界與三層費用都得自己設計。

CMU 07-280 全課總結:學會什麼、缺什麼,以及下一門怎麼選

完成 07-280 不等於看完 24 篇導讀;至少要留下搜尋器、監督式模型、CNN/GPT-2 實驗與一個 RL+MCTS 小系統,再依缺口選 07-380、10-301 或專題課。

CMU 07-280 完整課程導讀:搜尋、GPT-2、AlphaZero 為什麼在同一門課?

07-280 是 CMU Spring 2026 首開的 AI+ML 核心:24 講、12 個作業編號,從 heuristic search、CSP 與機器學習一路做到 AlexNet、GPT-2、AlphaZero。教材足以自學,但沒有完整公開錄影、Canvas checkpoint 或 Gradescope 回饋。

CMU 07-280 Lecture 1 導讀:AI、機器學習與表示學習的共同問題

Lecture 1 用 alien autoencoder、AI/ML 範圍與 AI 發展史建立全課座標:智慧系統不是模型清單,而是在不確定下把輸入表示成可計算決策。

CMU 07-280 Lecture 2 導讀:從 UCS、Greedy 到 A* 的 heuristic search

Lecture 2 把搜尋拆成 problem、frontier 與 priority:UCS 看已付成本,Greedy 看估計剩餘成本,A* 用 `f=g+h` 合併兩者;tree 與 graph search 的最優條件並不相同。

CMU 07-280 Lecture 3 導讀:Minimax、Alpha-Beta 與 Expectimax

Lecture 3 把單一路徑改成 contingent plan:minimax 對抗最佳對手,alpha-beta 在不改 root value 下跳過無關分支,expectimax 則用機率取代最壞情況。

CMU 07-280 Lecture 4 導讀:CSP、AC-3 與搜尋順序

Lecture 4 利用 variables、domains、constraints 暴露問題結構,再把 DFS 升級成 backtracking、forward checking、AC-3、MRV 與 LCV;重點是更早證明某些選擇不可能成功。

CMU 07-280 Lecture 5 導讀:用 Loss、Risk 與 ERM 定義機器學習

Lecture 5 把機器學習寫成 `X → Y`、loss、risk 與 empirical risk minimization:訓練集只能提供平均已知損失,真正目標仍是未知分布上的 generalization。

CMU 07-280 Lecture 6 導讀:Decision Trees 如何用 Mutual Information 分裂資料

Lecture 6 從 decision stump 遞迴建樹,用 entropy 衡量 label uncertainty,再以 `I(Y;W)=H(Y)-H(Y|W)`選擇分裂;這是計算可行的 greedy ERM,不是全域最佳樹保證。

CMU 07-280 Lecture 7 導讀:Linear Regression 與 Normal Equation

Lecture 7 把 ERM 套到 linear functions 與 squared loss,從一維 slope 推到矩陣形式 `argmin ||y-Xθ||²`,再在 `XᵀX` 可逆時得到 normal equation。

CMU 07-280 Lecture 8 導讀:Gradient Descent、SGD 與 Learning Rate

Lecture 8 從一維 parabola 推到 vector gradient,再比較 batch GD、SGD 與 mini-batch;learning rate 決定更新是收斂、震盪或發散。

CMU 07-280 Lecture 9:Logistic Regression 如何把分類改寫成機率估計

Lecture 9 不直接預測 0 或 1,而以 sigmoid 建模 P(y=1|x),再用 cross-entropy 與凸最佳化學出參數;多類別版本自然延伸成 softmax regression。

CMU 07-280 Lecture 10:Feature Engineering 與 Regularization 如何交換表達力和穩定性

Lecture 10 先用 φ(x) 讓線性模型表達非線性,再以 train/validation/test 分工、L1/L2 regularization 與 model selection 限制新增自由度造成的過度擬合。

CMU 07-280 Lecture 11:從 Logistic Regression 組出第一個 Neural Network

Lecture 11 把單一 logistic neuron 擴成多層網路:linear layer 產生 z、activation 產生 a,多個 neuron 共同學出 feature transform,再以 loss 和 gradient descent 訓練權重。

CMU 07-280 Lecture 12:Backpropagation 如何重用 Chain Rule

Lecture 12 把神經網路視為 computation graph:forward pass 保存中間量,backward pass 從 loss 開始傳遞 upstream gradient,並用線性層、activation 與 softmax 的局部規則一次算出全部參數梯度。

CMU 07-280 Lecture 13:AI Alignment 從 Reward Hacking 走到可稽核的 AI Scientist

Lecture 13 把 alignment 拆成目標規格、distribution shift、監督與修正能力,並用 autonomous AI scientists 的 benchmark selection、data leakage 與 post-hoc selection 實驗說明:只看最終論文不足以稽核整個研究流程。

CMU 07-280 Lecture 14:CNN 如何把影像的空間結構寫進模型

Lecture 14 以 local connectivity 與 parameter sharing 取代全連接影像模型,從 convolution、stride、padding、pooling 走到 AlexNet、GPU data parallelism、ResNet skip connection 與 BatchNorm。

CMU 07-280 Lecture 15:Pre-training、Transfer Learning 與 Fine-tuning 的分工

Lecture 15 將 pretrained model 拆成 representation g 與 task head h:可以凍結 g 只訓練 head,也能用較小 learning rate fine-tune 部分或全部參數;選擇取決於資料量與 source-target 差距。

CMU 07-280 Lecture 16:Maximum Likelihood 如何統一 Logistic 與 Linear Regression

Lecture 16 從 likelihood p(D|θ) 出發,以 i.i.d. 將聯合機率寫成乘積,再用 log 變成和;Bernoulli MLE 得到樣本比例,conditional Bernoulli 得到 logistic cross-entropy,Gaussian noise 則得到 squared error。

CMU 07-280 Lecture 17:從 Tokenization 到 N-gram Language Model

第 17 講先決定文字如何切成 token,再用 N-gram 把序列機率改寫成可從 corpus 計數的條件機率;tokenization 不是前處理小事,而是模型能看見什麼的第一個設計決定。

CMU 07-280 Lecture 18:N-gram 如何訓練、取樣與失敗

第 18 講把 chain rule 截成 N-gram Markov assumption,以 corpus counts 做 MLE,再比較 greedy、categorical sampling 與 temperature;真正的瓶頸是未見 context 的零機率與固定視窗。

CMU 07-280 Lecture 19:Word Embedding 如何把下一詞預測變成幾何

第 19 講以兩個 embedding matrices、dot-product similarity、softmax 與 cross-entropy 建立最小 next-token model,讓相似 context 透過共享向量參數取代 N-gram 的獨立計數格。

CMU 07-280 Lecture 20:從 Position Encoding 推到 Causal Self-Attention

第 20 講先把單 token embedding 擴成 sequence,以 positional encoding 補順序,再推導 Q/K/V scaled dot-product attention、causal mask 與 multi-head blocks,最後接到 GPT-2。

CMU 07-280 Lecture 21:Bellman Equation 如何解 Markov Decision Process

第 21 講把隨機序列決策寫成已知 dynamics 的 MDP,以 Bellman backup 定義 value 與 Q-value,再用 value iteration 或 policy iteration 求最佳 policy。

CMU 07-280 Lecture 22:不知道 Dynamics 時如何做 Q-learning

第 22 講保留 MDP 骨架,拿掉已知 transition 與 reward 的假設;TD learning 用一步 sample 更新 value,Q-learning 再以 off-policy target 直接學最佳 action values。

CMU 07-280 Lecture 23:從 Approximate Q-learning 到 DQN

第 23 講以 Qθ(s,a) 取代巨大 Q-table:先用 features 線性近似並由 squared TD error 推導 gradient update,再以 replay data 與固定 target network 形成 DQN。

CMU 07-280 Lecture 24:Monte Carlo Tree Search 如何接上 AlphaZero

Spring 2026 Lecture 24 是 MCTS,不是 Fall 2026 的 LLM post-training;本講以 selection、expansion、rollout、backup 與 UCB 分配模擬,再由 policy/value heads 與 self-play 接到 AlphaZero。

CMU 07-280 階段複習一:從搜尋問題走到監督式學習

第一階段把 Lectures 1–12 串成同一條決策鏈:先定義狀態、動作與目標,再用 heuristic、loss、regularization 與 backpropagation 控制龐大搜尋空間。

CMU 07-280 階段複習二:用 AlexNet 與 GPT-2 把模型真正組起來

第二階段不把 CNN 與 Transformer 當兩份架構圖背誦,而是透過 HW8 與 HW11 檢查表示、計算圖、訓練、遷移與生成是否真的接得起來。

CMU 07-280 階段複習三:從 MDP、Q-learning 到 AlphaZero

第三階段把 value、policy、bootstrapping、function approximation 與 MCTS 接成 AlphaZero:network 提供先驗與估值,search 改善決策,self-play 再產生下一輪資料。

CMU 11-785 Lecture 1:導論:從感知器到深度網路

Spring 2026 Lecture 1 聚焦神經元、感知器、連結主義與深度學習問題設定;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 2:神經網路作為通用近似器

Spring 2026 Lecture 2 聚焦布林電路、網路寬度與深度,以及表示能力不等於可訓練性;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 3:訓練一:學習與經驗風險最小化

Spring 2026 Lecture 3 聚焦資料分布、假設、損失、經驗風險與泛化之間的角色;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 4:訓練二:梯度下降

Spring 2026 Lecture 4 聚焦梯度、學習率、參數更新與線性神經元的訓練;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 5:訓練三:反向傳播

Spring 2026 Lecture 5 聚焦計算圖、chain rule、局部導數與梯度重用;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 6:訓練四:收斂、損失曲面與動量

Spring 2026 Lecture 6 聚焦非凸損失曲面、曲率、鞍點與 momentum 的累積方向;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 7:訓練五:SGD、batch size 與二階方法

Spring 2026 Lecture 7 聚焦full batch、mini-batch、隨機梯度與二階資訊的成本取捨;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 8:訓練六:最佳化器與正則化

Spring 2026 Lecture 8 聚焦AdaGrad、Adam、正則化、BatchNorm、Dropout 與 loss 選擇;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 9:卷積神經網路一

Spring 2026 Lecture 9 聚焦局部連接、權重共享、卷積核與特徵圖;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 10:卷積神經網路二

Spring 2026 Lecture 10 聚焦stride、padding、receptive field 與多通道卷積;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 11:卷積神經網路三

Spring 2026 Lecture 11 聚焦卷積架構堆疊、特徵階層與設計取捨;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 12:卷積神經網路四

Spring 2026 Lecture 12 聚焦CNN 訓練、架構選擇與視覺模型的整體串接;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 13:循環神經網路一

Spring 2026 Lecture 13 聚焦序列狀態、時間展開、參數共享與 recurrent computation;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 14:循環神經網路二

Spring 2026 Lecture 14 聚焦時間反向傳播、梯度穩定性與 LSTM 類 gated memory;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 15:Seq2Seq 與 CTC

Spring 2026 Lecture 15 聚焦可變長輸入輸出、對齊未知問題與 CTC 目標;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 16:CTC blank 與 beam search

Spring 2026 Lecture 16 聚焦blank、collapse 規則、前綴機率與近似解碼;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 17:語言模型與翻譯

Spring 2026 Lecture 17 聚焦自回歸機率分解、條件語言模型與翻譯解碼;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 18:Attention 與 Transformer

Spring 2026 Lecture 18 聚焦query、key、value、scaled dot-product attention 與 Transformer block;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 19:Transformer 與後續架構

Spring 2026 Lecture 19 聚焦encoder/decoder 結構、mask、residual path 與架構變體;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 20:大型語言模型

Spring 2026 Lecture 20 聚焦規模化自回歸模型、訓練階段、推論與能力邊界;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 21:表示學習與 autoencoder

Spring 2026 Lecture 21 聚焦瓶頸表示、重建目標、降維與表示品質;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 22:變分自編碼器

Spring 2026 Lecture 22 聚焦latent variable、ELBO、KL 項與 reparameterization trick;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 23:擴散模型

Spring 2026 Lecture 23 聚焦forward noising、reverse denoising、score/noise prediction 與採樣;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 24:生成對抗網路

Spring 2026 Lecture 24 聚焦generator、discriminator、minimax objective 與訓練不穩定;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 25:圖神經網路

Spring 2026 Lecture 25 聚焦message passing、aggregation、node representation 與 permutation symmetry;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 26:強化學習

Spring 2026 Lecture 26 聚焦state、action、reward、return、value 與 policy learning;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 27:Hopfield 網路

Spring 2026 Lecture 27 聚焦聯想記憶、能量函數、固定點與 pattern retrieval;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 28:Boltzmann machine

Spring 2026 Lecture 28 聚焦能量式機率模型、隨機單元、partition function 與學習困難;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 深度學習完整課程導讀:28 講能看,作業鏈卻不完整公開

CMU 11-785 Spring 2026 的 28 講內容都有官方 slides 與 YouTube,另有大量公開 bootcamp/recitation;但 HW1–4 的核心規格、starter 與評測依賴 Autolab、Piazza 和 Kaggle。

ai deep-dive

Python coding agent 實戰 M11:為什麼 exec 迴圈做不出 Claude Code 的對話體驗

要做出 Claude Code 或 Codex 的 TUI,關鍵不是滿版配色,而是長生命期 session、typed transcript 與 tool-boundary approval。

ai deep-dive

Cognee 完整介紹:把文件變成 Agent 可查詢的知識圖記憶

Cognee 是資料到 AI memory 的 pipeline:用 relational store 保存來源與 provenance、vector store 找語意相近內容、graph store 表達 entity 關係,再以 remember、recall、improve、forget 管理生命週期。

CS124 Week 1 Introduction and Setup:先把語言問題拆成可計算的元件

CS124 Winter 2026 第一週不是先教 Transformer,而是先畫出從斷詞、分類、檢索到語音與網路的十週路線,並用 PA0 建好後續九週共同使用的 Jupyter 環境。

CS124 Week 10 PageRank and Social Networks:從 anchor text、圖中心性到課程收束

Week 10 以 anchor text、PageRank 與 centrality 分析 Web graph;post-training、多語與 speech 只歸於檔名及內容標示 2025 的公開 final deck outline,不歸為 2026 現場內容。

CS124 Week 2 Words, Tokens, Edit Distance, and N-grams:LLM 之前先決定模型看見什麼

Week 2 把文字處理拆成三層:以 BPE 建立 token 詞彙、以動態規劃求最小編輯距離,再以 n-gram 近似序列機率;PA1 把正規表示式與 BPE 變成可執行作業。

CS124 Week 3 Logistic Regression and Text Classification:從特徵到機率與 loss

Week 3 用 logistic regression 串起文字特徵、sigmoid 機率、cross-entropy loss 與 gradient descent,讓分類不只輸出標籤,也能說明每個特徵如何推動預測。

CS124 Week 4 Information Retrieval:從倒排索引、tf-idf 到 RAG 的檢索底座

Week 4 從倒排索引建立候選集,以 tf-idf 與 cosine similarity 排序,再把檢索結果接到生成模型;PA3 要求實作的不是聊天介面,而是 RAG 前半段可檢查的搜尋核心。

CS124 Week 5 Embeddings and Social NLP:語境向量與公開材料的證據邊界

Week 5 的公開材料支持 distributional hypothesis、word embeddings 與 cosine similarity;同週 Social NLP 現場課未錄影且投影片受限,具體 audit 方法只作作者延伸。

CS124 Week 6 Neural Networks and LLMs:從神經元、反向傳播到 decoder-only 模型

Week 6 以公開 neural-network slides 建立 weighted sum、nonlinearity、loss 與 backpropagation,再用檔名標示 2025 的公開 LLM/Transformer deck 連到 decoder-only 架構,不視為 2026 現場逐字內容。

CS124 Week 7 Transformers and Speech Processing:causal attention、生成與未錄現場課的邊界

Week 7 的可公開主線是 PA6a:實作 causal self-attention、訓練 Shakespeare 小型 Transformer、取樣並計算 perplexity;同週 speech live lecture 未錄影,只能保留為明示缺口。

CS124 Week 8 Speech and PA7/Git Lab:把 TTS→STT pipeline 當成可稽核的資訊損失

Week 8 以 PA6b 把文字轉語音再轉回文字,要求分類錯誤、檢查格式遺失與口音偏差;同週 Lab 4 以 Git 與 PA7 協作把課程帶入團隊 agent 專案。

CS124 Week 9 Collaborative Filtering and LLM Agents:從電影相似度到搜尋與記憶工具

Week 9 以 item-item collaborative filtering 產生電影推薦,再把推薦、web search、database 與 memory 包成 LLM agent tools;PA7 同時把模型非決定性、API 預算與團隊協作變成交付條件。

CS224N 第 3 講:矩陣微積分與反向傳播

第 3 講把神經網路訓練拆成計算圖、局部導數與鏈鎖律:forward pass 算結果,backprop 由輸出往回累積梯度,讓每個參數知道自己該往哪裡移。

CS224N 第 11 講:Benchmark 與 LLM 評估為什麼會過期

第 11 講把評估拆成測什麼、怎麼量與何時不再可信:benchmark 會飽和、遭污染或被提示格式左右,LLM judge 也只是帶著自身偏差的模型。

CS224N 第 9 講:Prompting、LoRA 與參數高效微調

第 9 講比較 prompting、pruning、LoRA、prompt tuning 與 adapters:它們都在回答同一題——要讓一個大型預訓練模型適應新任務,究竟需要改多少參數與儲存多少任務狀態?

ai guide Stanford CS224N 導讀

CS224N 第 6 講:把期末專案收斂成可驗證的研究問題

第 6 講先補完 Transformer encoder、decoder 與 cross-attention,再把期末專案拆成題型、評分、研究題目與資料來源;好題目必須能用一個明確 baseline 和指標驗證。

CS224N 第 1 講:NLP 的四次典範轉移

Winter 2026 第 1 講用四個時代整理 NLP:早期探索、符號系統、統計機器學習、深度與自監督學習;重點不是背年表,而是看每個時代如何重新定義語言問題。

CS224N 第 15 講:沒有公開投影片時,如何讀 Agentic Interpretability

第 15 講由 Been Kim 客座談 interpretability,但 Winter 2026 官網沒有公開投影片或 agenda;本文不虛構講授內容,只用官方五篇閱讀建立概念發現、agentic investigation 與新詞彙三條閱讀路線。

CS224N 第 17 講:Multimodality 的官方閱讀地圖

第 17 講由 Luke Zettlemoyer 客座談 multimodality,但官網沒有公開投影片或 agenda;官方閱讀清單可確認三條主線:視覺推理介面、early-fusion token 模型、文字自回歸加影像 diffusion。

CS224N 第 19 講:小模型如何跨過 Scaling Law 的門檻

最後一講把 Open Questions in NLP 2026 收斂成 smart scaling:以 prolonged RL、Prismatic synthetic data、RL as pretraining 與開放協作,讓小模型不只靠增加參數追求推理能力。

CS224N 第 8 講:從 instruction tuning、RLHF 到 DPO

第 8 講解釋預訓練模型如何經 instruction tuning、偏好資料與 RLHF 變成助理,再以 DPO 直接從勝負配對學習;每一步都把人的判斷轉成訓練訊號,也把偏差帶進模型。

CS224N 第 7 講:預訓練、subword 與 in-context learning

第 7 講把預訓練拆成可擴張資料、subword tokenization、三種模型目標與 in-context learning;核心取捨是用通用的自監督目標換取可重用表示,再用下游訊號指定用途。

CS224N 第 10 講:RAG 與 Language Agents 的六個元件

第 10 講從問答與 RAG 進入 language agents,再拆成推理規劃、記憶、工具、資料與評估;agent 不是單一模型,而是模型與外部狀態之間可被逐步檢查的迴圈。

CS224N 第 12 講:Decoding、DeepSeek-R1 與推理訓練

第 12 講先證明輸出策略不是小細節:greedy、beam 與 sampling 會產生不同文字;再由 R1-Zero/R1 走進 PPO、GRPO、DAPO,最後追問長推理何時真的有用。

CS224N 第 13 講:Speculative Decoding 與 Test-Time Scaling

第 13 講從推論效率走到推論能力:speculative decoding 用小模型草擬、大模型驗證;on-policy distillation 處理資料漂移;長上下文與 test-time scaling 則用更多推論資源換取表現。

CS224N 第 4 講:語言模型、RNN 與消失梯度

第 4 講把語言模型定義成下一詞機率分布,再用 RNN 壓縮任意長前文;它同時揭露 recurrence 的核心代價:資訊與梯度都必須沿時間步逐步傳遞。

CS224N 第 16 講:Hallucination、創造力、工作與價值對齊

第 16 講把 NLP 的社會影響拆成四題:模型為何 hallucinate、AI 輔助創作的同質化悖論、工作如何重組,以及價值對齊為何不能化約成單一 reward。

CS224N 第 18 講:Tinker and LoRA Without Regret 材料缺口紀錄

第 18 講由 John Schulman 客座,官方只公布題名 Tinker and LoRA Without Regret、日期與講者,沒有投影片、agenda 或閱讀;因此本篇只保存可確認事實與不可確認清單。

CS224N 第 14 講:Tokenization 如何製造多語言成本差

第 14 講從 word、character/byte 與 subword 切分一路走到 BPE failure cases 和跨語言公平:tokenizer 決定序列長度、運算成本與模型看到的語言單位,因此不是中立前處理。

CS224N 第 5 講:從 recurrence 到 Transformer

第 5 講從 RNN 的長距離與循序瓶頸走到 self-attention,再組成 Transformer;它縮短位置間的資訊路徑並容許平行計算,但付出二次方 attention 成本與位置資訊必須另行注入的代價。

CS224N 第 2 講:word2vec 如何把語意變成向量

第 2 講從 word2vec 的預測任務、目標函數與梯度一路走到 count-based vectors 和評估,核心是:詞義不是查表得到的標籤,而是從上下文分布學出的高維座標。

Stanford CS224V 第 10 講:SPINACH Agent 如何逐步探索 Wikidata 並寫 SPARQL

SPINACH 不一次猜完整 SPARQL,而是搜尋 entity/property、查看 Wikidata entry 與 property examples、執行小查詢,再逐步組合完整查詢;action set 與停止規則是可靠性的核心。

Stanford CS224V 第 12 講:CHURRO 如何讓多語歷史文件變成可搜尋文字

CHURRO 以 HDML 表示整頁文字、版面與 metadata,整合跨世紀多語資料訓練 page-level VLM,再把輸出接到 HistoryGenie,讓檔案館材料能被檢索與對話。

Stanford CS224V 第 14 講:資料受限時,語言模型還能怎麼擴展

最後一講不是完整 LLM 訓練教學,而是資料效率研究:在 compute 充足、資料固定時重看 epochs、batch、ensemble 與 self-training,再研究 synthetic continued pretraining 的可擴展條件。

Stanford CS224V 第 5 講:WikiChat 的七階段 RAG 如何逐條攔下幻覺

WikiChat 不把檢索結果直接交給一次生成,而是形成查詢、檢索、過濾、生成、拆主張、再檢索查核與移除無根據內容,並把檢索與事實性分開評估。

Stanford CS224V 第 1 講:用計算思維把會幻覺的 LLM 變成可靠助理

Fall 2025 第一講把 CS224V 的主線定成計算思維:不要期待一次提示解決可靠性,而要把檢索、形式表示、查核與生成拆成可測試的演算法。

Stanford CS224V 第 2 講:STORM 與 Co-STORM 怎麼把搜尋變成知識策展

STORM 用觀點引導的提問、模擬訪談與大綱建立改善研究廣度;Co-STORM 再把人放進迴圈,讓探索未知問題與共同編修成為系統的一部分。

Stanford CS224V 第 8 講:SLIDERS 如何用自動 schema 分析一整組長文件

SLIDERS 不讓模型直接吞完所有長文件,而是從問題誘導 schema、做語意切塊與情境化擷取、協調重複列,再用 SUQL 查詢產生答案。

Stanford CS224V 第 13 講:ReactGenie 如何讓語音命令與原生 GUI 共用同一個狀態

ReactGenie 以 React 元件加 annotations 暴露資料、動作與視圖,將複合語音命令解析成 DSL,並在同一份 UI context 中產生原生圖形輸出。

Stanford CS224V 第 11 講:把臨床試驗條件翻成 SMT,而不是讓 LLM 直接判資格

這堂把病人紀錄與試驗條件各自轉成 SMT,先以較弱的命題邏輯投影做大規模候選檢索,再用 solver 檢查候選;推理可解釋,但 NL-to-SMT 仍是主要錯誤入口。

Stanford CS224V 第 9 講:自動質性編碼為什麼需要 codebook、型別與人工覆核

自動質性編碼先以 codebook 定義事件型別與 arguments,再把長文分類、結構化抽取和 entity linking 分開;受約束 JSON 能保格式,仍不能取代領域專家的覆核。

Stanford CS224V 第 6 講:資料庫 Agent 為什麼要先做語意剖析

結構化資料 agent 的可靠路線是把自然語言轉成可執行查詢、處理 schema 與列舉值,再把 query execution 和回答生成分開評估;混合資料則要先判斷該走資料庫還是文字檢索。

Stanford CS224V 第 7 講:SUQL 把 SQL 與自由文字檢索放進同一個查詢語言

SUQL 在 SQL 裡加入 answer 與 summary 兩種自由文字函式,semantic parser 產生一個混合查詢,再由 compiler 做 predicate pushdown、top-k 與 lazy evaluation。

Stanford CS224V 第 4 講:任務型 Agent 評估不能只看回答像不像人

CS224V 把任務型 agent 評估拆成狀態更新與完整互動:先測 semantic parser,再讓真人檢查任務完成、知識查詢與動作是否可靠。

Stanford CS224V 第 3 講:用 Genie Worksheets 建立不亂編動作的任務型 Agent

Genie Worksheets 把任務能力宣告成表單式規格,讓 contextual semantic parser 只更新形式對話狀態;查詢、動作與回應由 runtime 依規格執行。

CS336 Lecture 3:Transformer 架構很多,真正穩定的預設值其實很少

第三講比較大量現代 LLM 後得到的不是一張最佳架構配方,而是一組保守共識:pre-norm、RMSNorm、無 bias、SwiGLU、RoPE,以及少數值得偏離預設的推論與穩定性設計。

CS336 Lecture 4:Attention 不只一種,MoE 也不是免費擴大模型

第四講沿著兩種稀疏化拆解現代 LLM:linear/recurrent attention 減少序列維度成本,MoE 讓每個 token 只啟用部分參數;兩者都把理論省下的 FLOPs 換成 routing、平衡與通訊問題。

CS336 Lecture 14:Filtering、Dedup 與資料混合才把 raw web 變成訓練語料

第十四講把 raw documents 經語言辨識、品質與安全 filtering、exact/near dedup、source mixing 送進訓練;每一步都會改變模型分布,而 synthetic instruction 與 agent trajectories 又把資料管線延伸到可執行環境。

CS336 Lecture 13:語料不會從天上掉下來,每個來源都有存取與授權成本

第十三講沿著 Common Crawl、Wikipedia、GitHub、arXiv、書籍與歷代開放資料集追溯語料來源;抓得到不等於可合法使用,raw data 也不等於 training data,來源 provenance 必須先於清理與混合。

CS336 Lecture 12:沒有一個真正的 LLM 評分,只有規則不同的遊戲

第十二講從 perplexity 走到考試、聊天偏好、agent、推理與安全評測;每次換 benchmark 都同時換了能力定義、scaffold、judge 與污染風險,因此評分前必須先說清楚到底在比較 method、model 還是完整 system。

CS336 Lecture 5:GPU 快不是因為每個 thread 快,而是資料少搬幾次

第五講從 SM、warp 與記憶體階層解釋 GPU,再用低精度、fusion、recomputation、coalescing 與 tiling 統一常見優化;FlashAttention 正是這些原則在 attention 上的組合。

CS336 Lecture 10:LLM 推論的核心不是少算,而是少讀權重與 KV cache

第十講把 prefill 與 decode 分開:前者能平行、常受算力限制,後者逐 token 且常受記憶體頻寬限制;GQA/MLA、量化、speculative decoding、continuous batching 與 PagedAttention 都在改寫這條成本。

CS336 Lecture 6:寫 Triton kernel 前,先學會 benchmark 與 profile

第六講把 GPU 原理落到 kernel:benchmark 看不同尺寸如何縮放,profiler 看實際呼叫與時間,再以 Triton 實作 GeLU、softmax、reduction 與 tiled matmul;快的前提是先量對。

CS336 Lecture 17:多模態模型先把影像變成 token,再處理語意與細節的衝突

第十七講把 CLIP/SigLIP、LLaVA、Qwen-VL 與 Chameleon 排成三條路:對比式 encoder 學語意、vision encoder+projector+LM 做理解、離散 image tokens 做生成;解析度、token budget 與 modality balance 是共同瓶頸。

CS336 Lecture 1:從位元組到 tokenizer,先決定什麼值得隨規模成長

CS336 第一講不把「從零打造語言模型」理解成重做所有舊技術,而是先區分 mechanics、mindset 與 intuitions,再用 BPE 示範如何把原始位元組轉成可訓練的 token。

CS336 Lecture 7:從 collective operations 組出資料、張量與管線平行

第七講不從 FSDP API 開始,而是用 broadcast、all-reduce、all-gather、reduce-scatter 與 all-to-all 建立通訊語言,再親手組出 data、tensor 與 pipeline parallelism。

CS336 Lecture 8:ZeRO、FSDP 與 3D Parallelism 怎麼對齊硬體拓撲

第八講把平行化從原語提升到系統設計:ZeRO 逐階切 optimizer、gradient 與 parameter,TP/PP/SP/EP 再分別切 width、depth、sequence 與 experts;組合順序必須服從網路拓撲與動態 activation memory。

CS336 Lecture 2:先算 FLOPs 與記憶體,再談模型跑不跑得動

第二講把模型訓練還原成 tensor、FLOPs、bytes 與時間:用 einops 管維度,以 arithmetic intensity 和 roofline 判斷瓶頸,再用 gradient accumulation 與 activation checkpointing 交換運算和記憶體。

CS336 Lecture 16:RLVR 用可驗證獎勵擴大推理,但 GRPO 不是免費的 PPO

第十六講從 PPO 走到 GRPO 與 RLVR:數學、程式碼和環境結果提供可規模化 reward,避開一般偏好模型的部分 overoptimization;但 group-normalized advantage 會引入難度與長度偏差,rollout infrastructure 也成為主要成本。

CS336 Lecture 9:Scaling law 不是水晶球,是小實驗的外推工具

第九講從資料量與 error 的 log-log 線性關係出發,說明 scaling law 如何比較架構、optimizer、batch 與模型資料配置;Chinchilla 爭議也示範擬合方法、資料範圍與部署目標會改變答案。

CS336 Lecture 11:Scaling law 落地時,learning rate 與 batch 也要一起縮放

第十一講從 MiniCPM、DeepSeek、Qwen 與 Llama 3 的公開 recipe 拆解 scaling 實務:先固定大多數架構比例,再用小規模 sweep 找 learning rate、batch 與 IsoFLOPs 配置;μP 有用,但會被 normalization、optimizer 與 weight decay 破壞。

CS336 Lecture 15:SFT 教模型模仿,RLHF 才開始直接最佳化偏好

第十五講把 post-training 拆成 imitation 與 optimization:SFT 從 instruction-response data 抽出預訓練已有能力,RLHF 用 pairwise feedback 跨過人類示範與偏好之間的落差;PPO 與 DPO 都逃不掉資料偏差、reward overoptimization 和 mode collapse。

ai deep-dive

Daytona Agent Sandbox:把每個 Agent 分到一台可分支的電腦

Daytona 把 sandbox 設計成可啟動、暫停、快照與 fork 的長生命週期電腦;2026 年完成 2,400 萬美元 A 輪,Laude Institute 案例一週建立 3.7 萬個 sandbox。它適合平行評測與 coding agent,但核心開源 repo 已停止維護,不能再把託管版與可自架版視為同一件事。

ai deep-dive

Deepgram Voice Agent API:從串流 STT、Turn Detection 到 TTS

Deepgram 把 streaming STT、LLM orchestration、turn detection、barge-in 與 streaming TTS 放進單一 WebSocket,也保留分開採用語音模型或 BYO LLM/TTS 的路徑。

ai deep-dive

Dify 低程式碼 Agent 平台:從 Workflow 實作到 AI 應用發布

Dify 把模型、Knowledge、視覺化 Workflow、Agent、Plugin 與應用 API 放在共同 workspace;本文會實作一條可測試、發布並由 API 呼叫的最小 Workflow,再說明何時才該換成 Agent。

ai deep-dive

DSPy:用 Signature、Metric 與 Optimizer 編譯 AI 程式

DSPy 不把 prompt 當手寫字串,而以 Signature 宣告任務、Module 決定執行策略,再用資料集與 metric 讓 Optimizer 編譯出較好的提示與示例。

ai deep-dive

E2B Agent Sandbox:把模型產生的程式碼關進可恢復的 microVM

E2B 把 Template、Firecracker microVM 與檔案/程序/網路 API 組成 agent 專用執行層;真正的選型優勢是可暫停並保留記憶體與程序,而不是單純多一個 code interpreter。

ai deep-dive

ElevenLabs ElevenAgents:從即時語音到電話 Agent 的完整生命週期

ElevenLabs 已從 TTS 供應商擴成 ElevenAgents 平台:Scribe Realtime 收音、Flash 合成語音,再把 LLM、turn-taking、工具與電話整合收進同一條即時管線;選型關鍵是你要聲音品質,還是整個 agent 控制面。

ai deep-dive

Fireworks AI:從 Serverless API 到客製模型部署的推論平台

Fireworks AI 把開放權重模型的試用、專用 GPU 部署與 LoRA 客製化放在同一套 API 後面;Serverless 適合低流量起步,On-demand 適合穩定高流量與自有模型,保留容量則換取企業級的容量保證。

ai deep-dive

Flowise 深入介紹:從 Assistant、Chatflow、Agentflow 到 EOL 遷移判斷

Flowise 用 Assistant、Chatflow 與 Agentflow 三個入口涵蓋簡易助理、單一 Agent 和多 Agent 編排;但官方已在 2026 年 8 月封存 repository,並排定 8 月 31 日 EOL,新案不應在沒有維護 fork 與遷移方案時採用。

ai deep-dive

Galileo 深入介紹:Experiments、Evaluators 與 Agent Observability 的完整評估迴圈

Galileo 把 dataset experiment、LLM/code/Luna evaluator、production traces 與 runtime guardrail 接成一個迴圈;適合需要企業級可觀測性與線上介入的團隊,但舊 Protect 名稱已 deprecated,評分模型也不能取代人工校準與應用安全。

2026 下半年 Harness 大戰:八大框架重寫、三家模型商入場,110+ CLI 怎麼看

2026 年 8 月,不只五個框架在動。OMP 2、Pi v2、Opencode 2、dsh、Claude Code 之外,Google(Antigravity CLI)、Meta(Muse Code)、xAI(Grok Build)三家模型商直接下場做 coding agent,加上 Amp、Cline 2.0、Codex CLI Rust 重寫,共八個以上框架同時有架構級變動。再算進 110+ 個 CLI 工具,H2 2026 是 harness 方法論的分裂期。本文從四條架構路線、一個共同方向、一場信任危機拆解。

ai deep-dive

Haystack 深入介紹:用 Component 與 Pipeline 組出可測試的 RAG

Haystack 把 indexing、retrieval、generation 與 evaluation 都做成可替換的 Component,再用 directed multigraph Pipeline 串接;適合要把 RAG 流程當成程式資產測試、版本化與部署的 Python 團隊。

ai deep-dive

Helicone 深入介紹:把 LLM Gateway、請求追蹤與成本分析放在一起

Helicone 是開放原始碼的 LLM Gateway 與觀測平台:請求經過相容端點後,自動留下模型、延遲、token、成本與自訂欄位;它也能用 managed credits 或 BYOK 路由與 fallback。

ai deep-dive

Hugging Face 不只是模型下載站:Hub、Datasets、Spaces 與 Inference 怎麼分

Hugging Face Hub 是以版本化 repository 串起模型、資料集與應用程式的協作層;Datasets 管資料,Spaces 跑展示程式,Inference Providers 與 Endpoints 才負責代管推論。

ai deep-dive

Hyperbrowser 深入介紹:Agent 的 Browser-as-a-Service 執行層

Hyperbrowser 把 Playwright/Puppeteer 的 Chrome session、proxy、stealth、profile 與錄影包成託管 API;它適合要快速擴充真實瀏覽器工作的 Agent,但 profile 憑證、反爬蟲合規與 proxy 流量成本仍由應用端負責。

Jina Reader 完整指南:把網頁轉成 Agent 可讀 Markdown

Jina Reader 把單一 URL 轉成適合 LLM 使用的 Markdown;真正上線時,還要控制渲染時機、正文範圍、token 上限與失敗回退。

ai deep-dive

LanceDB 深入介紹:把向量搜尋嵌進 Arrow 資料工作流

LanceDB 以 Lance 欄式格式保存向量、metadata 與多模態原始資料;OSS 可直接嵌入 Python、TypeScript 或 Rust 程序,資料放大或多人共用時再轉向分散式 Enterprise。

ai deep-dive

LangChain v1 Agents:create_agent、middleware 與 LangGraph runtime

LangChain v1 用 create_agent 提供高階 agent loop,底層由 LangGraph 執行;工具、structured output 與 middleware 是正式擴充邊界。

ai deep-dive

LangSmith 深入介紹:從 Agent Trace 到離線與線上評估

LangSmith 把 LLM 應用拆成 project、trace、run 與 thread,再用 dataset、evaluator 與 experiment 把 production 問題送回離線回歸測試;它可觀測任何 LLM 應用,不要求使用 LangChain。

ai deep-dive

Letta/MemGPT 完整介紹:把記憶管理做進 Stateful Agent Runtime

Letta 延續 MemGPT 的作業系統類比,但它不是單一 memory API:agent state、可編輯的 in-context memory blocks、conversation history 與外部 archival memory 都由 runtime 持久化,模型也能透過工具主動整理記憶。

ai deep-dive

LiteLLM:從 Python SDK 到自架 AI Gateway 的多模型控制層

LiteLLM 不是模型供應商,而是一套可當 Python SDK 或自架 Proxy 使用的統一介面:把 100+ 家 LLM API 轉成一致格式,並在 Gateway 層集中處理路由、fallback、虛擬金鑰、預算與觀測。

ai deep-dive

LiveKit Voice Agents:從 WebRTC Room 到可插話的語音 Pipeline

LiveKit 把語音 agent 建模成 realtime media room 裡的 server participant,再由 AgentSession 串接 STT、turn detection、LLM、TTS 與 interruption。2026 年完成 1 億美元 C 輪、估值 10 億美元;它適合需要 WebRTC、多端 client、電話與可替換模型的產品,但自架 media server 不等於自架整條 AI pipeline。

ai deep-dive

Mastra:把 Agent、Workflow、Memory 與 Evals 放進 TypeScript

Mastra 是 TypeScript agent 框架,將 agent、typed workflow、memory、MCP、tracing 與 scorers 放進同一套 Node.js 開發環境。

ai deep-dive

Mem0 完整介紹:替 AI Agent 加上可控的長期記憶

Mem0 是介於 agent 與儲存層之間的記憶服務:從對話抽出值得保留的事實,以 user、agent、run 分區,再於下一次生成前搜尋;優勢是 API 簡單,風險則是抽取錯誤、過期記憶與權限邊界。

ai deep-dive

Milvus 向量資料庫深入介紹:從 Segment、索引到分散式維運

Milvus 把即時寫入、歷史查詢、索引建置與持久化拆成可獨立擴縮的元件,適合需要大量向量、持續更新與分散式維運的檢索服務;小型專案則常會為這套架構付出過多複雜度。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 1:深度學習的最小骨架

2026 第 1 講從感知器、前向傳播、loss 到 gradient descent,建立後續九講共用的語言。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 2:序列模型:從 RNN 到注意力

2026 第 2 講處理文字、音訊與時間序列中「順序會改變意義」的問題,並連到 Lab 1 的音樂生成。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 3:電腦視覺:卷積如何保留空間結構

2026 第 3 講從影像張量、卷積與 pooling 走到辨識系統,替 Lab 2 的 MNIST 與臉部偵測打底。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 4:生成模型:從潛在空間到 diffusion

2026 第 4 講區分生成與判別問題,整理 VAE、GAN 與 diffusion 的學習目標,並接到 Lab 2 的 DB-VAE。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 5:強化學習:用回報取代標準答案

2026 第 5 講把 agent、environment、state、action、reward 與 policy 接成互動迴圈,理解信用分配與探索。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 6:新前沿:模型之外還要選問題

2026 第 6 講把深度學習放進新應用與真實限制,提醒讀者先定義資料、輸出、評量與失敗條件。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 7:AI 三法則:安全要落在可觀測與評估

2026 第 7 講從 Asimov 的文學法則出發,討論現代 AI 安全協定的限制,以及 trace、測試資料與持續評估。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 8:AI for Science:把領域結構放進學習流程

2026 第 8 講以科學發現循環為主線,說明 simulator、AI emulator 與實驗如何合作,而不是把科學簡化成通用預測。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 9:大規模平行訓練:記憶體與通訊才是邊界

2026 第 9 講從 GPU 記憶體壓力進入 checkpointing、offloading、ZeRO、FSDP 與多種 parallelism,理解擴展不是只加卡。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 1:用 PyTorch 與 LSTM 生成音樂

2026 先完成 PyTorch tensor、autograd 與 module 基礎,再把 ABC 樂譜切成字元序列,訓練 LSTM 逐字生成音樂。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 2:從 MNIST 到 DB-VAE 臉部去偏差

2026 Part 1 用 dense network 與 CNN 辨識 MNIST;Part 2 以 DB-VAE 學習臉部 latent distribution,再調整訓練取樣。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 3:LoRA 微調與 LLM-as-a-Judge 評估

2026 以 LFM2-1.2B 建立 chat template 與生成流程,用 LoRA 做風格調適,再透過 OpenRouter 與 Opik 組合 judge workflow。

ai deep-dive

n8n 深入介紹:從 Trigger、AI Agent 到人工審核與營運

n8n 是 automation-first 平台:先由 webhook、排程或應用事件啟動 workflow,再把 AI Agent 放進其中選工具;真正上線前還要處理 memory、人工核准、credentials、執行紀錄與擴充架構。

ai deep-dive

OpenRouter:一把 API Key 串起多模型與多供應商的 LLM 路由層

OpenRouter 用 OpenAI 相容 API 統一多家模型與推論端點,並把供應商排序、故障切換、BYOK 與零資料保留政策放進同一套路由規則。

ai deep-dive

OpenViking:把 Agent 記憶做成虛擬檔案系統

火山引擎開源 OpenViking 把 agent 的記憶、知識、技能存成 viking:// 虛擬檔案系統,用 ls、tree、find 就能翻。三層載入(L0/L1/L2)讓平均檢索只用 550 tokens,LoCoMo 記憶準確率從 24–57% 提升到 80–83%。

ai deep-dive

Parallel Web Systems:Agent 的搜尋、擷取與深度研究層

Parallel Web Systems 把 Search、Extract 與 Task API 分成三個成本與延遲不同的網路存取層,並以 Basis 把引用、摘錄與信心標到輸出欄位。

ai deep-dive

Patronus AI 深入介紹:從 Evaluator、Experiment 到 Production Monitoring

Patronus AI 把 evaluator 當成可重用評分單元,再接到離線 experiment 與線上 trace;它適合要現成幻覺、安全與多模態評估模型的團隊,但 judge 分數不能取代人工標註、確定性測試或真正的資安驗證。

ai deep-dive

pgvector 深入介紹:把向量搜尋放回 PostgreSQL

pgvector 是 PostgreSQL extension,不是獨立向量資料庫;它用同一份資料模型、交易與維運工具承接精確或近似向量搜尋,代價是索引調校與水平擴充仍屬 PostgreSQL 問題。

ai deep-dive

Portkey:把 LLM 路由、觀測與治理收進同一個 AI Gateway

Portkey 是放在應用程式與模型供應商之間的 AI Gateway:用一個 OpenAI 相容端點統一路由、fallback、用量紀錄、預算與 guardrails,也能自行架設開放原始碼 gateway。

ai deep-dive 私有語料管線

私有語料查詢安全:ACL、刪除傳播與 freshness

私有搜尋的授權必須在候選生成前生效,並把 ACL、刪除事件與來源版本傳到每一份衍生索引;freshness 也要用可量測的事件時間與 SLA 管理。

ai deep-dive 私有語料管線

私有語料搜尋的邊界與架構:先決定資料能去哪裡

私有語料管線的第一個決定不是選向量資料庫,而是列出資料分級、信任區、權限決策點與 freshness SLA;索引、模型和觀測系統都只能收到被允許的最小資料。

ai guide 私有語料管線

私有語料 Retrieval Eval 實測:先把繁中題庫變成可重跑的 benchmark

Repo 已有 20 題繁中/英文 golden dataset,但缺少文件層級 qrels、retrieval run、延遲原始值與執行 script;目前不能誠實報 Recall@k、MRR 或 nDCG 實測分數。本文把缺口整理成可重跑的評估契約。

ai deep-dive 私有語料管線

從來源到索引:私有語料的同步與增量更新管線

私有語料同步的核心不是定時重抓,而是用 canonical ID 固定文件身分、用來源版本與 checksum 判斷變更、用冪等 upsert 寫入,並讓 tombstone 走完所有索引的刪除傳播。

ai deep-dive

Promptfoo 深入介紹:把 LLM Eval 與 Red Team 寫進本機測試迴圈

Promptfoo 用 YAML 把 prompts、providers、test cases 與 assertions 組成可在本機與 CI 重跑的 LLM 評估矩陣,並共用同一套 target 做 red team;它降低測試門檻,但隨機輸出、LLM judge 偏差與 hosted data flow 仍要另外治理。

ai deep-dive

Pydantic AI:用型別、Dependency Injection 與驗證建立 Python Agent

Pydantic AI 把 Agent 寫成 Agent[Deps, Output]:依賴、工具輸入與最終輸出都有型別,模型結果必須通過 Pydantic 驗證。

ai deep-dive

R2R 深入介紹:把 Ingestion、Hybrid Search 與 RAG 包成 API

R2R 把文件匯入、hybrid search、knowledge graph、RAG、Agent 與權限包在 REST API 後面;適合已有產品前後台、只想補上 retrieval service 的團隊。

ai deep-dive

RAG 框架怎麼選:LlamaIndex、Haystack、RAGFlow、Dify、R2R 不是同一層產品

LlamaIndex、Haystack 是以程式碼為主的框架;RAGFlow、Dify 是帶管理介面的平台;R2R 則把檢索系統包成 API 服務。先決定團隊要保留多少 ingestion、retrieval 與營運控制權,再選工具。

ai deep-dive

RAGFlow 深入介紹:從文件解析、Chunk 檢查到可追溯回答

RAGFlow 把文件解析、chunk 人工檢查、retrieval test、聊天與引用放在同一套平台;適合 PDF、表格與版面複雜文件,但部署重量和平台狀態都高於 Python library。

ai deep-dive

Runloop:為程式開發 Agent 設計的 Devbox 執行環境

Runloop 把隔離 microVM、可重現映像、磁碟分支、憑證代理與 eval 放進同一套程式開發 Agent 基建;官方案例已公開單一工作負載突破 10,000 個並行 Devbox。

ai deep-dive

Sail Research:用延遲換成本的 Long-Horizon Agent 推論平台

Sail Research 讓每個推論 request 宣告 completion window,把可等待的背景 Agent 排到較便宜的運算資源;並以 Sailboxes 補上長時間執行環境。

從搜尋結果到可靠引用:URL 去重、來源分級與 Claim-Source Mapping

可靠引用不是在答案後面塞 URL:先把 URL、內容副本與來源獨立性拆開,再用 atomic claim、quote span、snapshot 與可重跑檢查建立 claim-source matrix。

ai guide

SerpAPI 完整指南:多搜尋引擎、結構化 SERP 與非同步查詢

SerpAPI 的核心是代管搜尋結果頁的抓取與解析:用 engine 指定來源,取得結構化 SERP,再自行處理地區、分頁、非同步輪詢與結果驗證。

ai guide

Serper Search API 完整指南:把 Google 搜尋結果變成 Agent 可用 JSON

Serper 是第三方 Google SERP API:用一個 POST 請求取得 organic、knowledgeGraph、peopleAlsoAsk 等結構化 JSON;真正上線前仍要驗證選填欄位、URL、重試與引用證據。

ai deep-dive

Slack Code:多人協作 AI Coding 與 Agent 控制平面的競爭版圖

Slack Code 把 AI coding agent 從開發者的終端搬進 Slack 頻道,讓團隊即時看到 diff、預覽與計畫。但它解決的是管理層的透明度焦慮,不是工程師的生產力瓶頸——真正的戰場在「誰當 agent 的控制平面」。

CS221 Lecture 1:Overview:用資源限制定義智慧

Stanford CS221 Autumn 2025 第 1 講,從 Overview:用資源限制定義智慧建立可操作的 AI 問題表示與演算法直覺。

CS221 Lecture 2:Learning I:從計算圖到線性迴歸

Stanford CS221 Autumn 2025 第 2 講,從 Learning I:從計算圖到線性迴歸 建立可操作的 AI 問題表示與演算法直覺。

CS221 Lecture 3:Learning II:線性分類、特徵與交叉熵

Stanford CS221 Autumn 2025 第 3 講,從 Learning II:線性分類、特徵與交叉熵 建立可操作的 AI 問題表示與演算法直覺。

CS221 Lecture 4:Learning III:深度網路是可重複組合的計算圖

Stanford CS221 Autumn 2025 第 4 講,從 Learning III:深度網路是可重複組合的計算圖 建立可操作的 AI 問題表示與演算法直覺。

CS221 Lecture 5:Search I:先定義狀態,再談搜尋演算法

第 5 講把搜尋問題寫成 state、action、successor 與 cost,並用 acyclic dynamic programming 說明:狀態若遺漏未來所需資訊,再快的演算法也只會解錯問題。

CS221 Lecture 6:Search II:UCS 與 A* 的優先順序

Stanford CS221 Autumn 2025 第 6 講依官方材料拆解 Search II:UCS 與 A* 的優先順序,並標出方法成立的假設與限制。

CS221 Lecture 7:MDPs I:把隨機性放進狀態轉移

Stanford CS221 Autumn 2025 第 7 講依官方材料拆解 MDPs I:把隨機性放進狀態轉移,並標出方法成立的假設與限制。

CS221 Lecture 8:MDPs II:不知道轉移模型時如何學 Q 值

Stanford CS221 Autumn 2025 第 8 講依官方材料拆解 MDPs II:不知道轉移模型時如何學 Q 值,並標出方法成立的假設與限制。

CS221 Lecture 9:MDPs III:直接對 policy 的期望報酬求梯度

Stanford CS221 Autumn 2025 第 9 講從 tabular RL 走到 function approximation,再用 log-derivative identity 推出 REINFORCE,最後落到可執行的 PyTorch 更新。

CS221 Lecture 10:Games I:從 expectimax 到 minimax

第 10 講把單一 agent 搜尋擴成 adversarial game tree:expectimax 對 chance 求期望、minimax 對對手取最差結果,alpha-beta 則在不改答案下剪掉無關分支。

CS221 Lecture 11:Games II:TD learning、同時賽局與 Nash 均衡

第 11 講先用 temporal-difference updates 從遊戲經驗學 value,再從 sequential play 轉向 simultaneous games,以 mixed strategies、minimax guarantee 與 Nash equilibrium 描述穩定策略。

CS221 Lecture 12:Bayesian Networks I:從 joint distribution 到 factorization

第 12 講用 random variables 與 factors 建 joint distribution,再以 Bayesian-network factorization 表達 conditional independence,讓 conditioning 與 marginalization 成為可執行的 probabilistic inference。

CS221 Lecture 13:Bayesian Networks II:Gibbs sampling 與 Markov blanket

第 13 講在 exact inference 太昂貴時改用 Gibbs sampling:每次只重抽一個變數,僅依 Markov blanket 計算 conditional distribution,並以樣本頻率近似查詢機率。

CS221 Lecture 14:Bayesian Networks III:從計數、平滑到 EM

第 14 講從 complete data 的 maximum-likelihood counts 與 Laplace smoothing,走到 latent variables 下交替計算 posterior responsibilities 和更新參數的 EM。

CS221 Lecture 15:Logic I:模型、蘊涵與 SAT

第 15 講分開 propositional logic 的 syntax 與 semantics:model checking 用 satisfying assignments 定義 entailment,SAT solver 找見證,inference rules 則必須同時檢查 soundness 與 completeness。

CS221 Lecture 16:Logic II:量詞讓知識跨越單一命題

第 16 講用 predicates、quantifiers 與 functions 壓縮跨物件知識,再以 substitution、unification 與 definite-clause forward inference 推導結論,同時標出 termination 與 completeness 限制。

CS221 Lecture 17:Language Models:從 next-token prediction 到生成

第 17 講把 language model 定義為 sequence probability 的 chain-rule factorization,對照 n-gram 與 neural conditional models,並說明 sampling、temperature 與 evaluation 如何改變生成結果。

CS221 Lecture 18:AI & Society:效益、誤用、事故與制度

第 18 講用 benefits、misuse、accidents 與 structural harms 分類 AI 社會影響,再把 fairness audits、研究倫理、著作權與平台條款接回可追責的制度選擇。

CS221 Lecture 19:AI Supply Chains:模型背後的資源、勞動與市場

Lecture 19 用 Economics of AI deck 把 AI 的 compute、data、distribution 與組織互補品接到 GDP、勞動與 ideas 的成長路徑。

CS221 Lecture 20:Fireside Chat, Conclusion:把二十講收束成建模選擇

第 20 講是 Percy Liang 談職涯研究、CS221/Stanford 與 AI 未來的 fireside chat;每項歸因都連回官方影片,編者整理則與自動字幕的不確定性分開。

Stanford CS224W 第 1 講:Introduction:為什麼關係資料需要圖機器學習

依 Fall 2025 官方投影片逐段整理第 1 講,涵蓋 課程地圖與工具、圖資料的共同語言、傳統特徵與表示學習,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 2 講:Node Embeddings:從隨機漫步到 node2vec

依 Fall 2025 官方投影片逐段整理第 2 講,涵蓋 編碼器—解碼器觀點、鄰近度與目標函數、隨機漫步,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 3 講:Graph Neural Networks:message passing 的第一個完整模型

依 Fall 2025 官方投影片逐段整理第 3 講,涵蓋 從固定 embedding 到深度編碼器、message passing 框架、聚合與更新,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 4 講:A General Perspective on GNNs:把模型拆成可設計的元件

依 Fall 2025 官方投影片逐段整理第 4 講,涵蓋 GNN 設計空間、訊息、聚合與更新、GraphSAGE,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 5 講:GNN Augmentation and Training:資料、任務與模型怎麼一起設計

依 Fall 2025 官方投影片逐段整理第 5 講,涵蓋 圖資料 augmentation、特徵與結構 augmentation、supervision 與 loss,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 6 講:Theory of GNNs:WL test、GIN 與表達能力的上限

依 Fall 2025 官方投影片整理第 6 講,涵蓋 什麼叫可區分、Weisfeiler–Lehman test、message passing 的上界,並標出無法公開取得的課堂材料。

Stanford CS224W 第 7 講:Designing Powerful Graph Encoders:結構辨識與位置辨識

依 Fall 2025 官方投影片整理第 7 講,涵蓋 完美 GNN 的思想實驗、標準 GNN 的三層失敗、identity-aware encoding,並標出無法公開取得的課堂材料。

Stanford CS224W 第 8 講:Graph Transformers:attention 如何接上圖結構

依 Fall 2025 官方投影片整理第 8 講,涵蓋 self-attention 與 message passing、圖上 attention 的範圍、位置與結構編碼,並標出無法公開取得的課堂材料。

Stanford CS224W 第 9 講:Heterogenous Graphs:讓節點與關係類型進入 message passing

依 Fall 2025 官方投影片整理第 9 講,涵蓋 異質圖 schema、relation-specific messages、R-GCN,並標出無法公開取得的課堂材料。

Stanford CS224W 第 10 講:Knowledge Graphs:TransE、ComplEx 與 RotatE 的關係建模

依 Fall 2025 官方投影片整理第 10 講,涵蓋 知識圖譜與 completion、三元組 scoring、TransE 與關係模式,並標出無法公開取得的課堂材料。

Stanford CS224W 第 11 講:GNNs for Recommender Systems:從協同過濾到 LightGCN

依 Fall 2025 官方投影片整理第 11 講,涵蓋 推薦系統的圖表示、matrix factorization baseline、NGCF 的訊息傳遞,並標明公開材料邊界。

Stanford CS224W 第 12 講:Relational Deep Learning:把資料庫直接變成預測圖

依 Fall 2025 官方投影片整理第 12 講,涵蓋 表格 pipeline 的限制、關聯式資料庫轉圖、temporal entity graph,並標明公開材料邊界。

Stanford CS224W 第 13 講:Advanced Architectures in RDL:RelGNN 與 Relational Graph Transformer

依 Fall 2025 官方投影片整理第 13 講,涵蓋 RDL 的多關係瓶頸、RelGNN composite message passing、relation-specific aggregation,並標明公開材料邊界。

Stanford CS224W 第 14 講:Advanced Topics in GNNs:圖上 in-context learning 與不確定性

依 Fall 2025 官方投影片整理第 14 講,涵蓋 relational foundation model 的目標、zero-shot relational transfer、PRODIGY 的 prompt graph,並標明公開材料邊界。

Stanford CS224W 第 15 講:Foundation Models for Knowledge Graphs:新實體、新關係與雙重等變性

依 Fall 2025 官方投影片整理第 15 講,涵蓋 transductive KG embedding 的邊界、entity-inductive link prediction、relation graph,並標明公開材料邊界。

Stanford CS224W 第 16 講:LLM + GNN:讓語言模型讀圖,也讓圖模型讀文字

依 Fall 2025 官方投影片整理第 16 講,涵蓋 LLM 與 GNN 的互補缺口、text-attributed graphs、LLM as predictor or encoder,並標明公開材料邊界。

Stanford CS224W 第 17 講:Agents + Graphs:讓 agent 在結構化世界中檢索、規劃與行動

依 Fall 2025 官方投影片整理第 17 講,涵蓋 從 graph QA 到 agent、STaRK 的多模態檢索、工具使用與 traversal,並標明公開材料邊界。

Stanford CS224W 第 18 講:Deep Generative Models for Graphs:GraphRNN 與目標導向分子生成

依 Fall 2025 官方投影片整理第 18 講,涵蓋 圖生成問題與資料表示、生成品質的評估、GraphRNN 的 autoregressive factorization,並標明公開材料邊界。

Stanford CS224W 第 19 講:315K 個 GNN designs 如何用 anchor models 排名

Fall 2025 Conclusion deck 在 32 個 tasks 上研究約 315K 個 GNN designs:先跑少量 anchor models,以 ranking 描述 task similarity,再從相似 task 轉移 best designs。

線性迴歸:從 LMS 到局部加權迴歸

線性迴歸不只是一條最佳直線;第一章用平方損失串起梯度下降、常態方程、最大概似估計與局部加權迴歸。

分類與邏輯斯迴歸:從決策邊界到 Newton 法

第二章從 sigmoid 機率模型推導邏輯斯損失,再比較感知器、多類別 softmax 與 Newton 法。

廣義線性模型:用指數族統一迴歸與分類

第三章用指數族、自然參數與連結函數,把最小平方法和邏輯斯迴歸放進同一套建模模板。

生成式學習演算法:GDA、Naive Bayes 與平滑

第四章改從 p(x|y) 與 p(y) 建模,用 GDA、Naive Bayes 和 Laplace 平滑展示生成式分類的力量與代價。

核方法:不顯式展開特徵的非線性學習

第五章把高維特徵的內積改寫成 kernel,讓依賴內積的線性演算法在不顯式建立特徵的情況下學非線性。

支援向量機:間隔、對偶與 SMO

第六章把分類信心形式化為幾何間隔,再用拉格朗日對偶、kernel 與 SMO 建出可實作的 SVM。

深度學習:模組、反向傳播與向量化

第七章把神經網路拆成可組合模組,並用反向傳播與向量化說明深度模型如何有效率地訓練。

泛化:偏差變異、雙降與樣本複雜度

第 8 章把測試誤差拆成不可避免雜訊、偏差平方與變異,再用 uniform convergence 與 VC dimension 說明模型何時能從訓練資料泛化;雙降則提醒我們,參數數量不是萬用的複雜度尺度。

正規化與模型選擇:顯式、隱式與交叉驗證

第 9 章把泛化控制拆成三條路:在損失中顯式懲罰複雜度、利用最佳化器偏好的隱式正規化,以及用未參與訓練的資料選模型;MAP 則說明高斯先驗如何對應 L2 懲罰。

分群與 k-means:交替最佳化的第一個範例

第 10 章用 k-means 建立非監督式學習的第一個完整演算法:交替更新會讓 distortion 單調不增並在數值上收斂,但不保證得到全域最佳解。

EM 演算法:從高斯混合到 VAE

第 11 章從高斯混合模型的軟指派出發,用 Jensen inequality 建立 ELBO,將 EM 解釋為對變分分布與模型參數的交替最大化,再以近似後驗與 reparameterization trick 延伸到 VAE。

主成分分析:投影、重建與降維

第 12 章把 PCA 寫成一個幾何最佳化問題:在單位方向上最大化投影變異,解就是共變異矩陣的主特徵向量;取前 k 個特徵向量,同時得到保留最大變異與最小線性重建誤差的低維表示。

獨立成分分析:從混合訊號恢復獨立來源

第 13 章把 ICA 建模為 x=As:觀測是未知線性混合,目標是估計 W=A^{-1} 恢復獨立且非高斯的來源。變數變換的 Jacobian determinant 進入 likelihood,導出 Bell–Sejnowski 的梯度更新。

擴散模型:正向加噪、反向生成與 ELBO

第 14 章從固定的高斯加噪 Markov chain 出發,學習逐步反轉每個 transition;ELBO 把 reverse-kernel matching 化成加權雜訊預測,連續時間觀點則用 score ∇log p_t 解釋反向漂移。

基礎模型概覽:線性探測、微調與 LoRA

第 15 章比較線性探測、完整微調與 LoRA:差別不只在可訓練參數量,也在表徵是否移動、資料需求與記憶體成本。

表徵學習:對比學習、語意檢索與 RAG

第 16 章把表徵學習連到實際系統:對比目標塑造向量空間,語意檢索在其中找鄰居,RAG 再把取回內容交給生成模型。

大型語言模型:分詞、Transformer、MoE 與 SFT

第 17 章從 next-token loss 推到 Transformer、KV cache、MoE 與 SFT,說清楚 LLM 的訓練目標、架構與推論成本如何連在一起。

LLM 推理:思維鏈與長推理 RLVR

第 18 章把 LLM 推理拆成兩個槓桿:推論時用思維鏈增加計算,訓練時用可驗證獎勵與 policy gradient 學出長推理行為。

強化學習:MDP、價值迭代與連續狀態

第 19 章用 Bellman 方程把長期決策拆成一步更新,並從已知 MDP 的 value iteration 走到模型學習與連續狀態近似。

LQR、DDP 與 LQG:從線性控制到不確定性

第 20 章利用線性動態與二次目標得到可解的 LQR,再以 DDP 處理局部非線性、以 Kalman filter 與 LQG 處理不可直接觀測的狀態。

策略梯度及其變體:REINFORCE 與 PPO

第 21 章從 log-derivative trick 推出 REINFORCE,再用 reward-to-go、baseline 與 PPO clipping 控制 policy-gradient 的高變異與更新幅度。

ai deep-dive

Steel Browser:Agent 的開源瀏覽器 API 與自架邊界

Steel 用 Apache-2.0 runtime 把 Chromium session、CDP、proxy、stealth 與除錯介面包成同一套 browser API;公開 repo 約 7,400 stars,並在 2026 年進入 Stripe Projects developer preview。單機自架適合開發與資料邊界,Cloud 才解決高併發、託管 proxy、CAPTCHA、錄影與 SLA。

ai deep-dive

Together AI:從 Serverless 推論到專屬端點與 Fine-tuning

Together AI 把開放權重模型的 Serverless API、專屬 GPU 端點、批次推論與 Fine-tuning 放在同一平台,適合先按 token 驗證,再在流量或客製化需求成形後升級部署。

ai debug

Claude Code skill 怎麼寫才不吃 context:入口、門檻、成本、來源

把 Anthropic 的 session 成本建議做成全域 skill,第一版就犯了它要防的錯:description 塞滿觸發關鍵字、用檔案數和分鐘數當硬門檻、把「保護主 context」和「省總 token」混成一件事。三輪修正後入口縮到一頁,細節拆進 references,數量門檻換成四個判斷維度,草稿裡的主張則逐條對官方文件查證。

ai deep-dive

Vapi:語音 Agent 的即時編排層,以及電話上線前的安全界線

Vapi 把電話與 Web 音訊、STT、LLM、TTS、tool calls 和 call observability 接成託管 voice runtime;可換 provider,卻不能搬走 Vapi 專屬的即時編排。官方 2026-05 自報已有 100 萬名開發者,並宣布 5,000 萬美元 B 輪。

ai deep-dive

Vercel Sandbox 深入介紹:把 Agent 執行層放進 Vercel 生態

Vercel Sandbox 用 Firecracker microVM 隔離不受信任的程式碼,搭配 Fluid compute、Active CPU 計價與 Vercel OIDC;它最適合已在 Vercel 上運行的 Agent,但網路預設值、記憶體計費與持久化生命週期仍要自己設計。

ai deep-dive

Vertex AI:從模型 API 到 Gemini Enterprise Agent Platform

Vertex AI 不是只有 Gemini API,而是把 200+ 個模型的取用、訓練、評估、部署與治理放進同一個 Google Cloud 控制面;2026 年 4 月後,它的產品與後續藍圖已併入 Gemini Enterprise Agent Platform,但 Vertex AI API、文件路徑與既有資源名稱仍大量存在。

網頁抽取品質實測:Crawl4AI、Firecrawl、Jina Reader 與 Readability 差多少?

抽取工具不能只比 HTTP 200;同一組 20 個 URL 要分別量正文、heading、table、code、link、metadata、雜訊、延遲與成本。本文先公開 corpus、adapter contract 與評分 gate,但因目前缺 Firecrawl credential 與四條同版本 raw run,尚不發佈勝負。

ai deep-dive

Zep 完整介紹:用時序知識圖管理 Agent 記憶

Zep 的核心不是向量化聊天紀錄,而是把 episode 抽成帶有效時間的 entity 與 fact,讓新資訊使舊關係失效但不抹掉歷史;Graphiti 是開源核心,Zep 則是代管與治理層。

Agent Plugins 1.0:OpenAI、Google、AWS 罕見聯手,統一 AI Agent 擴充的封裝標準

Agent Plugins 1.0 是一個封裝格式標準,把 Agent Skills(Markdown 指令)和 MCP server 設定包成一個目錄,讓同一個 plugin 能被 ChatGPT、Cursor、GitHub Copilot、Kiro、VS Code 直接載入。它不是新的協議,是協議之上的包裝紙。Vercel 發起,OpenAI、AWS、Microsoft、Cursor 共同制定,Google 發佈當天加入——Anthropic 不在治理名單上,但 MCP 團隊正面回應。

ai guide

AgentQL 完整介紹:用語意查詢做網頁擷取與 Playwright 自動化

AgentQL 用接近資料結構的語意查詢取代易碎的 CSS/XPath:`query_data` 回傳結構化資料,`query_elements` 回傳可操作的 Playwright locator。Starter 公開方案列出每月 50 次免費 API 呼叫,但超額、綁卡與遠端瀏覽器時數的實際停止規則仍要在 Billing 頁確認。

ai guide

Apify 完整介紹:Actor、Task、排程與資料集怎麼組成爬取平台

Apify 不是單一 crawler,而是把爬取程式包成 Actor,再用 Task 固定設定、Schedule 觸發執行、Dataset 交付結果的平台。適合不想自己維護佇列、排程與執行環境的團隊,但 Actor 費用、運算、proxy、儲存與傳輸會共同消耗預付額度。

ai guide

Browser Use 完整介紹:讓 AI Agent 操作瀏覽器的任務迴圈

Browser Use 把瀏覽器狀態、模型決策與 click/type/extract 等動作組成可重複迴圈;開放原始碼版本適合自訂工具與執行策略,Cloud 則代管瀏覽器、profile、proxy 與並行工作。

ai guide

changedetection.io 完整指南:用 selector、通知與 Browser Steps 監控網頁

changedetection.io 是網頁變更訊號層:先縮小監控範圍、排除雜訊,再把真正的變更通知下游;它不是搜尋 API,也不該取代 crawler。

Composio:agent 接一百個 SaaS 時,誰替你保管每個使用者的 token

站上把 MCP 寫得很齊,卻從沒寫過它下面那一層:agent 要代表一萬個終端使用者去讀他們各自的 Gmail 時,refresh token 存在誰家、怎麼更新、怎麼撤銷。Composio 是這層目前最完整的一家——SDK 是 MIT,執行與託管 OAuth 是雲端服務;官方自稱 1,000+ toolkit,但託管 OAuth 清單實際列出 121 個,另外 96 個要你自備憑證。2026-08-15 起的新價目:免費 10 萬次 tool call、Pro $29/月。這篇拆它的授權模型到可操作的深度,並劃出「自己接 MCP server」與「用整合平台」的分界。

ai deep-dive

Context 滿了怎麼辦:七種答案,沒有一種是共識

Chroma 的對照實驗證明:就算塞得下,塞滿也會變差。於是各家 coding agent 發展出七種對策——壓縮、換手、剪枝、少載入、隔離、進模型、換單位。Amp 直接移除 /compact,Atlassian 說摘要該是最後手段,Cursor 的 A/B 測出 46.9% token 降幅。三場分歧的根源不是誰對,是各自在衡量不同的東西。

ai guide

Crawl4AI 完整介紹:從 Markdown 抓取到結構化資料抽取

Crawl4AI 負責 URL 之後的抓取與抽取:穩定 DOM 先用 JsonCssExtractionStrategy,只有語意判讀或版面不規則時才切 LLMExtractionStrategy。

CrewAI:用角色扮演組織多 Agent 協作的框架

CrewAI(GitHub 57.4k star,MIT,PyPI 週下載 1,164 萬)用角色(role)、目標(goal)、背景故事(backstory)定義 agent,再把一組 agent 編成 crew 來協作。跟 LangGraph 的圖優先和 MAF 的工作流優先不同,CrewAI 是團隊優先——你不畫節點和邊,你描述一個團隊裡每個人負責什麼。2024 年底完成 LangChain 依賴的全面移除,現在是獨立框架。商業端分開源套件與 AMP 託管平台,AMP 加的是視覺化建構、部署、追蹤與合規。

Exa:為 agent 而不是為人設計的神經搜尋 API

Exa 把整個網頁索引轉成 embedding 再檢索,而不是比對關鍵字。2026-08 官方定價:/search $7 / 1k 次(含前 10 筆結果)、/contents $1 / 1k 頁、deep 系列 $12–15 / 1k 次,新帳號 $20 免費額度。這個 blog 的 CLAUDE.md 把 Exa 列在雲端抓取工具的第一順位,38 支 skill 裡有 16 支寫到它,站上既有文章只有 4 篇順帶提過——但一篇專文都沒有。這篇補上。

ai guide

Firecrawl 完整介紹:Scrape、Crawl、Map 與結構化抽取怎麼選

Firecrawl 把單頁抓取、網站探索、整站爬取與 JSON 抽取包成同一套 API;雲端版省下瀏覽器、proxy 與 worker 維運,自架版則換得基礎設施控制,但預設能力不等同雲端。

ai deep-dive

免費搜尋、爬取與瀏覽器 API 怎麼選:週期額度、限速、試用與自架成本

免費方案有每日或每月額度、餘額補回、持續限速與一次性試用;有些 API 沒有免費額度,必須預付或按量計費。

ai guide 搜尋與爬取實戰

Linkup Search API 完整指南:從 standard、deep 到結構化輸出

Linkup 把搜尋深度與輸出格式分開控制:多數 agent 查詢先用 standard + searchResults,需要循線讀多頁才升到 deep;每月補回 20 美元是餘額恢復,不是固定再送 20 美元。

LlamaIndex:它已經不是 RAG 框架了,而你可能還在照舊教學選它

LlamaIndex(GitHub 51,775 star,MIT,2026-08-21 實查)的重心已經從索引搬到 Workflows:獨立套件 llama-index-workflows 的 PyPI 週下載 281 萬,比傘狀套件 llama-index 的 197 萬還高。這篇拆核心抽象、跟自己刻 pipeline 的取捨,並實測它在繁中語料上的預設值——同樣的 chunk_size=1024,英文裝得下 4,645 字元,繁中只有 1,332。另附一個選型前必看的事實:TypeScript 版已封存停更。

ai deep-dive

Meilisearch 完整介紹:索引、中文搜尋與多租戶安全

Meilisearch 適合把應用程式資料做成快速、容錯的全文搜尋;真正的導入難點不在 search API,而在索引設定、非同步 task、中文分詞、權限過濾與備份還原。

Microsoft Agent Framework:兩個框架合併之後,AutoGen 這個名字現在指誰

微軟把 Semantic Kernel 與自家 AutoGen 合併成 Microsoft Agent Framework,2026-04-02 發 1.0 GA(.NET 與 Python,Go 仍是 public preview)。被收編的 autogen-agentchat 停在 2025-09-30 沒再發版;但原作者那側的社群分支 AG2 沒有合併,六天前還在發 1.0.2,而且 `pip install autogen` 裝到的是 AG2 不是微軟。這篇拆解 MAF 的抽象、遷移時程,以及這團名字到底該怎麼讀。

ai guide MIT 6.S191 導讀

MIT 6.S191 導讀:九講與三個 labs 全公開,但完整跑完仍要三個外部服務

MIT 6.S191 的 2026 版已公開九講影片、投影片、三個 software labs 與解答,足以列為 A3 自學課;但官方執行路線需要 Google/Colab、Comet,以及 Lab 3 的 OpenRouter,校外讀者也拿不到 MIT 的學分、專案回饋與 API credit。

Modal:跑推論引擎的那一層,以及它什麼時候不值那個溢價

Modal 是按秒計費的 serverless GPU 平台,同時把 agent sandbox 做成一級公民(官方自報累計啟動逾 10 億個 sandbox、佔營收三分之一以上)。選型的關鍵不是它多方便,是你的 GPU 使用率:2026-08-21 實查,Modal A100 80GB 折算 $2.50/hr、RunPod 同卡 $1.59/hr,使用率超過六成四自己開機器就比較便宜;但同一天 H100 SXM Modal $3.95/hr、Lambda $3.99/hr,這張卡的溢價幾乎是零。

ai deep-dive

Qdrant 完整指南:Collection、Hybrid Search 與自架維運

Qdrant 的核心不是把 embedding 存進去,而是先固定 vector schema、替高頻過濾欄位建 payload index,再用 dense + sparse query、租戶邊界、snapshot 與監控把檢索做成可維運的服務。

ai guide

Scrapling 完整介紹:從 adaptive selector 到並行 Spider

Scrapling 把 HTTP、Playwright 瀏覽器、CSS/XPath 抽取與 Spider 放進同一套 Python API;adaptive selector 會保存元素特徵,版面改動後再用相似度重新定位,但仍需要驗證輸出。

ai guide

SearXNG 完整介紹:引擎調校、JSON API 與自架維運

SearXNG 是元搜尋引擎,不是 crawler,也沒有自己的全網索引。這篇以官方 2026.8.20 文件為準,從 Compose 安裝、settings.yml、引擎選擇與 JSON API,一路做到空結果診斷。

ai guide 搜尋與爬取實戰

自己架一套搜尋後端:SearXNG + Crawl4AI,從零到接進 Claude Code

三個元件、各做一件事:SearXNG 負責找、Crawl4AI 負責讀、一層薄薄的程式把兩者黏起來。有三個預設值不改就不會動——`formats` 預設只吐 HTML、`secret_key` 預設是 `ultrasecretkey`、limiter 開了會擋你自己的程式。另外官方安裝方式在 2026 年 3 月換過,網路上多數教學指的 searxng-docker 已經封存了。

Tavily 和 Exa 不能自己架:要怎麼自己組一套

Tavily 和 Exa 都是純雲端 API,不能自己架。能自己組的是 SearXNG(269 個上游引擎、82 個預設開啟)+ Crawl4AI(78.8k stars、Apache-2.0),現成的 Tavily 相容 wrapper 都還是幾十顆星的個人專案,不建議直接用。但 SearXNG 沒有自己的索引,而且從機房 IP 跑會被搜尋引擎打成空結果——這兩件事決定了自架划不划算。

Stanford CS124 導讀:課號掛 100,先修寫死四門,而且下一學年整年不開

CS124 是 Stanford NLP 分支的第一門課,教科書是 Jurafsky 自己免費放在網路上的《Speech and Language Processing》,九個作業 repo 全部公開。但課程網站首頁掛著一行公告:2026–27 學年整年不開。而且那份課綱指定的章號,已經跟 2026 年 8 月版的教科書對不上了。

Stanford CS221 導讀:AI 入門課的先修欄位,寫的是 CS103、CS106B、CS109、CS161

CS221 把 AI 排成一條軸:反射式模型(也就是深度學習)在最低階那一格,往上是狀態、變數、邏輯。2025 年秋季 Percy Liang 接手後把講義換成可執行的 Python,並在第一堂的原始碼裡寫下『Cut constraint satisfaction problems :(』——但 ExploreCourses 與 Stanford Online 兩個官方頁面到現在還把約束滿足列為課程主題。專案已經從 2019 年的兩成成績掉到只剩加分。

Stanford CS224N 導讀:打開 2019 年那版課表,Transformer 還排在第 14 堂

CS224N 把 2000 年以來每一屆的課程網站都留在線上。2019 冬季那版,Transformer 是第 14 堂的客座講題;2026 冬季那版,它是第 5 堂,之後每一堂都預設你已經懂它。機器翻譯作業整個消失了,第三份作業改成自己刻一個 decoder-only Transformer,附 pytest 可以在筆電上跑。

Stanford CS224U 導讀:課程網站停在 2023 年春季,但整套教材可以 clone 下來跑

CS224U 的教材不是投影片,是一個 Apache-2.0 的 GitHub repo,講義、作業、評分文件全在裡面。但校內班從 2023 年春季之後連停三個學年,ExploreCourses 把它排回 2026-27 春季;官方課程描述至今仍列著 relation extraction 與 semantic parsing,2023 年的講次表一堂都沒有。第一份作業的資料載入 cell 在今天的新環境會卡在 Hugging Face 的相容性改動上。

Stanford CS224V 導讀:2026 年才改名叫 Agentic AI,教的卻是拿形式方法治幻覺

CS224V 的課名在 2026-2027 學年才從 Conversational Virtual Assistants 換成 Agentic AI,但底下的東西沒換:把自然語言翻成形式語意、用 SMT 與知識圖譜約束 agent,而不是拼框架。閱讀清單十一篇 Mandatory 裡,七篇出自授課者自己的實驗室。投影片全公開,課程網站卻明講它們是刻意殘缺的。

Stanford CS224W 導讀:作業全在 Colab 上,但最大一塊分數自學者拿不到

CS224W 的六份 Colab 現在全部可以直接下載開跑,第一份只用 NetworkX,連 PyG 都不用裝。但期末考佔 35%,是全課最大一塊,而它是閉書實體考。公開錄影停在 2021 年,涵蓋不到現在課表後半的 graph transformer、關聯式深度學習與 LLM+GNN。

Stanford CS228 導讀:先修只寫「基本機率與演算法」,但這門課已經停開兩年

CS228 的官方先修就一句『basic probability theory and algorithm design and analysis』,沒有指定任何前置課程。但 ExploreCourses 顯示它最後一次開課是 Winter 2024,下一次排在 2026-27 冬季、講師欄還空著。自學者真正拿得到的是那份公開講義 cs228-notes:16 章寫完,最後一次改動停在 2025 年 6 月。

Stanford CS229 導讀:講義每年重編,公開作業停在 2020,官方自測題是 2008 年的

CS229 的自學三件套不在同一個時鐘上:講義 278 頁、2026 年 8 月才重編過;公開拿得到的作業是 2020 年夏季那批;Stanford Online 叫你入學前先做的自測題,PDF 建立於 2008 年。2026 春季錄影公開 17 支,最後三支的標題跟內容對不上。

ai deep-dive

Stanford CS25 V6:叫 Transformers United 的課,前兩場講的都不是 Transformer

CS25 是 Stanford 的 1 學分 seminar,唯一作業是出席,全程對外開放。2026 春季第六季九場講座裡,最值得看的三場是 Albert Gu 談 SSM 與 Transformer 的歸納偏誤、Charles Frye 談上千張 GPU 的推論服務、Victoria Lin 談原生多模態還沒解決什麼。

Stanford CS329Z 導讀:先用 litellm 手刻一遍 agent,再讓 DSPy 把它收走

CS329Z 是 Stanford 2026 年秋季新開的三學分 agent 工程課,第一份作業要求先用 litellm 從零刻出 RAG、工具呼叫與 ReAct 迴圈,再用 DSPy 把同一批元件重寫一次並交出對照。課程網站架在公開的 GitHub repo 上,commit 紀錄顯示 8 月中作業從三份砍成兩份,被砍掉的那份是「Data for Agents」。

Stanford CS336 導讀:講義是跑得起來的 Python,作業從第二份開始要自己付 GPU 的錢

CS336 的十七堂正課裡,只有九堂是可以執行的 Python 程式,另外八堂是 PDF 投影片——分界線剛好是兩位授課者。第一份作業的講義有八個「低資源提示」教你怎麼在筆電上做完,第二到第五份一個都沒有。課程頁自己列了 B200 的每小時單價,作業講義自己列了每題要幾個 B200 小時。

ai guide

Tavily Search API 完整指南:搜尋、抽取、Map 與 Crawl

Tavily 把 Search、Extract、Map、Crawl 做成同一組 agent 網路 API;免費方案每月有 1,000 credits,Search 的 basic、fast、ultra-fast 各用 1 credit,advanced 用 2 credits。

ai deep-dive 自架推論服務

vLLM:自架推論服務的預設選擇,以及它什麼時候是過度工程

vLLM 是自架 LLM 推論的事實標準(GitHub 89,470 stars,2026-08-21 實查),核心是把 KV cache 當作業系統的分頁來管。但選型的關鍵不在它多快,在你的 GPU 使用率:以 Red Hat 實測的每秒 793 個輸出 token 換算,一張打滿的 A100 約 $0.70 / 百萬輸出 token,使用率掉到一成就變 $7——比多數雲端 API 貴。

Agent 搜尋品質怎麼驗收:Web Retrieval Benchmark 實作

Web retrieval 要測的是完整 task,不是 HTTP 200:固定 30 題、五種失敗層、三條 live channel,同時量答案、引用、freshness、延遲、成本與不必要升級。本文交付可執行 harness 與 gate,但因目前沒有三條 live channel 設定,不提供虛構排名。

AI Agent 上網查資料的完整路由:Search、Fetch、Crawler、Browser 怎麼切換

Agent 上網不該一律開瀏覽器:先依任務分流 Search 或 Fetch,再按狀態碼、內容品質、JS shell、登入與 challenge 訊號逐級升級;每一步都受 retry、budget、快取、去重與來源紀錄約束。

Behavioral & Ethics 面試攻略:AI 倫理、團隊合作與影響力敘事

行為面試不是靠臨場發揮,而是靠事前準備好的故事庫。AI Engineer 的行為面試有獨特的考點:AI 倫理(bias、fairness、privacy)、技術決策的影響力敘事(為什麼選這個模型/架構)、跨團隊推動 ML 專案的經驗。準備策略:建立 8-10 個 STAR 故事,每個故事練到能在 2 分鐘內講完。

Coding 面試攻略:ML-flavored 程式題的準備策略

AI Engineer 的 coding 面試和 SWE 不完全一樣——除了 LeetCode medium,還會出 ML-flavored 的題(實作 tokenizer、寫 batch inference pipeline、處理稀疏矩陣)。準備策略:LeetCode medium 練到 70% 通過率就夠,剩下的時間花在 numpy/pandas 操作、資料處理 pipeline、以及 ML 相關的程式題。

Deep Learning 面試攻略:從 CNN 到 Transformer 的核心直覺

深度學習面試重點不是推導反向傳播,而是能不能解釋架構背後的設計直覺。高頻考點:CNN 的 locality 與 translation invariance、RNN 到 Transformer 的演進為什麼必要、self-attention 的計算邏輯與複雜度、BatchNorm vs LayerNorm 的適用場景、常見的 training tricks(learning rate schedule、gradient clipping、mixed precision)。

LLM Application Design 面試攻略:從 RAG 到 Agent 架構

LLM Application Design 是 2025-2026 面試最熱的新題型。核心考點:RAG pipeline 的 chunking/retrieval/reranking 設計、agent 架構的 tool-use 與 planning loop、context window 管理策略、guardrails 與 safety 設計、以及 LLM 應用的評估方法。面試官特別看重你有沒有踩過坑。

ML Fundamentals 面試攻略:從 bias-variance 到 evaluation metrics

ML 基礎面試不考你背公式,考你能不能用直覺解釋概念、在追問下不崩潰。高頻考點:bias-variance tradeoff 的實際意義、L1/L2 regularization 的選擇邏輯、cross-entropy 為什麼比 MSE 適合分類、SGD 與 Adam 的取捨、precision/recall 在不同場景的重要性差異。

ML System Design 面試攻略:從需求拆解到生產架構

ML System Design 面試的核心不是選模型,而是怎麼把一個商業目標變成一個可上線、可監控、可迭代的 ML 系統。面試官想看你能不能:把業務目標翻成 ML 目標、設計 data pipeline 和 feature store、選擇合理的 serving 策略、規劃 monitoring 和 A/B testing。

MLOps & Deployment 面試攻略:從 CI/CD 到模型監控

MLOps 面試考的是你有沒有把模型推上生產的經驗。高頻考點:ML pipeline 的 CI/CD(跟軟體 CI/CD 有什麼不同)、model registry 與版本管理、A/B testing 的設計與陷阱、inference 的 scaling 策略(水平擴展、模型壓縮、caching),以及生產環境的 monitoring 與 alerting 設計。

NLP & LLM 面試攻略:從 tokenization 到 RLHF

LLM 面試的分水嶺是你有沒有實際用過這些東西。高頻考點:BPE tokenization 的邏輯與多語言問題、預訓練目標(CLM vs MLM)、fine-tuning 的三種層次(full/LoRA/prompt tuning)、RLHF 的流程與 failure mode、prompting 的工程實踐、LLM 評估的困難與現有方法。

AI Engineer 面試全景圖:從公司類型到準備策略

AI Engineer 面試不只考 ML——大廠看系統設計與 coding,新創看端到端交付,AI-native 公司看 LLM 工程深度。準備策略:先釐清目標公司類型,再按六大維度(ML 基礎、系統設計、LLM 應用、Coding、Paper Reading、行為面試)分配時間。

Paper Reading 面試攻略:怎麼讀、怎麼討論、必讀清單

Paper Reading 面試不是考你有沒有讀過那篇 paper,而是考你能不能快速理解一個新方法並找出它的限制。AI-native 公司(Anthropic、OpenAI)特別愛考。準備策略:練習 30 分鐘讀完一篇 paper 並能口述 contribution + limitation,建立自己的必讀論文清單,每篇練習用三句話總結。

Stanford CS329A 導讀:這門課教自我改進,也親口說了它改進不了什麼

CS329A 的軸心是 generation–verification gap:模型答得出來,卻認不出哪個對。但課程自己下的結論更值得記——目前這些方法讓模型變得更穩定,不是更聰明。錄影公開 9 支,只涵蓋 20 堂中的 9 堂。

ai guide AI 證照備考

AWS 三張 AI 證照怎麼選:MLA-C01 的窗口只剩 40 天,而且只有英文版在倒數

AIF-C01、MLA-C01、AIP-C01 不是難度階梯,是三個不同的職能切面:AIF 考「說得出來」、MLA 考「把 ML 上線」、AIP 考「把別人的模型整合成系統」。但 2026 年 8 月的選擇被時間卡住——官方認證頁公告 MLA-C01 英文版最後考試日是 2026/9/28,從今天算只剩 40 天,而 MLA-C02 要 9/1 才開放報名、考綱尚未公布。非英文(日/韓/簡中)考生的窗口反而長得多,這是真實差異。同一頁還同時出現 MLA-C02 與 ME1-C02 兩個代碼,官方沒說明兩者關係。另外續期圖會反過來決定考試順序:AIP-C01 一張就把 AIF-C01、MLA-C01 與 Data Engineer – Associate 各續三年。

ai guide AI 證照備考

Claude 四張認證怎麼選:先確認你報不報得了名

選 Claude 四張認證之前有一個比所有考點都重要的前提:報考只開放給 Claude Partner Network 的組織,個人無法自行報名。過得了這關的人,實際的分岔點有四個——CCAO-F $99 不計入 partner tier 資格(另外三張計入);Claude Code 在 CCAR-F 佔 20%、在 CCDV-F 只佔 3.1%,架構師那張考這個工具比開發者那張重;CCAR-P 有 28% 是治理與利害關係人溝通,系列裡沒有第二張這樣;CCAO-F 最便宜但 Prompting 只有 14%,輸出評估 21% 才是主軸。四張效期都是 12 個月,重考間隔 14 / 30 / 90 天、12 個月內最多 4 次。

ai guide AI 證照備考

微軟這條線怎麼選:AI-103、AI-500、AB-620、AB-100 四張的分岔點

微軟四張 AI/agent 認證裡,只有 AI-103 → AI-500 是官方寫死的階梯,其餘全是定位問題。選擇要走三個分岔:寫不寫 Python(AI-103/AI-500 vs AB-620)、建東西還是做判斷(AB-100 vs 其餘三張)、以及今天能不能真的開始——AI-500 的四條官方學習路徑目前全 404、AB-620 沒有練習測驗、AB-100 有免費練習測驗。對台灣讀者還有第四個分岔:AI-103 與 AB-620 有繁體中文,AI-500 與 AB-100 只有英文。四張都是 $165、效期一年、續期免費但只在到期前六個月開放。

ai guide AI 證照備考

NVIDIA 四張怎麼選:兩張還不能報名,訓練全要付費,官方文件還在打架

NVIDIA 生成式 AI 線有四張:NCA-GENL、NCA-GENM(各 $125,associate)、NCP-GENL、NCP-AAI(各 $200,professional)。選之前先看三件別家沒有的事:一、兩張 professional 的 Register 按鈕都標著「Coming soon」,近期計畫直接只剩兩張 associate;二、NVIDIA 是本系列唯一官方備考課全部付費的廠商,真實成本是考試費加課程費,NCA-GENL 自學五門 $390、NCA-GENM 有兩門只有 $500 講師版、NCP-GENL 官方清單列價合計 $1,620;三、官方文件自相矛盾——NCP-AAI 的權重網頁加總 98%、PDF 加總 92%,NCP-GENL 網頁表格有兩格描述錯置(其中一格是 OpenUSD 的文字)。另外綁定程度差很多:NCP-AAI 只有 7% 綁 NVIDIA 產品,NCP-GENL 有 31% 在考 GPU 與模型壓縮。

ai deep-dive

AI Agent 自動產生簡報:讓模型看見自己排的版

2026 年 agent 做簡報的共識:outline-first + 內容/構建分離 + render 成圖讓 fresh-eyes subagent 做視覺 QA。Anthropic 與 OpenAI 的官方 slides skill 都收斂到 PptxGenJS + 視覺驗證迴圈,學術線(PPTAgent→PreGenie→DeepPresenter)也指向同一方向。但下半年出現兩個修正:PresentBench 指出常被引用的 PPTEval 給分過於樂觀,SeaSlides 則主張不該讓模型直接寫自由格式的 HTML/SVG。

ai deep-dive AI 證照備考

AI 治理框架對照:EU AI Act、NIST AI RMF、ISO/IEC 42001,以及沒有一張證照點名它們

治理在證照裡的比重比多數工程師以為的高——CCAR-P 的 Governance 14% 加 Stakeholder 14% 共 28%、CCAO-F 治理 15%、AB-100 的部署治理塊 40–45%、AIF-C01 的負責任 AI 14% 加安全治理 14%。但把十五份官方 exam guide 逐份查過,沒有任何一張點名 EU AI Act、NIST AI RMF 或 ISO/IEC 42001;全系列唯一被官方點名的法規只有 CCAR-P 的 GDPR、HIPAA、FedRAMP。所以這篇的用法不是「背框架去考試」,而是用三份框架當骨架,把六張證照散落的治理條目歸位。三份框架的分工是:EU AI Act 是法律(2026-08-02 全面適用,高風險義務被 AI Omnibus 延到 2027-12-02)、NIST AI RMF 是自願框架(GOVERN/MAP/MEASURE/MANAGE 四個功能,且 1.0 正在改版)、ISO/IEC 42001 是可驗證的管理系統標準(條文付費,本文只用 ISO 官方公開頁能證實的部分)。

ai guide AI 證照備考

AWS AI Practitioner(AIF-C01)備考路徑:v1.1 把它變成 agentic AI 考試

AIF-C01 的考綱在 2026 年 4 月 30 日更新到 v1.1,一口氣新增七條目標,把 MCP、多 agent 模式、context engineering、token 計價、幻覺偵測全部變成考點,in-scope 服務也加入 Bedrock AgentCore、Kiro、Strands Agents——網路上流傳的整理幾乎都是舊版。這篇以官方五章權重(20/24/28/14/14)為骨架給出四週路徑。官方規格:$100、90 分鐘、65 題(50 題計分)、及格 700、效期 3 年,而且是本系列唯一提供繁體中文的考試。

ai guide AI 證照備考

AWS GenAI Developer Professional(AIP-C01)備考路徑:整張考試都在考別人的模型怎麼整合

AIP-C01 是 AWS 唯一專攻 GenAI 應用開發的 professional 級證照,官方明確排除模型訓練、進階 ML 與特徵工程——它考的是把別人的基礎模型整合進生產系統。五章權重 31/26/20/12/11,最重的第 1 章有將近一半的技能點落在向量儲存與 RAG。2026 年 3 月的改版加入 Bedrock AgentCore,beta 已於 3/31 結束,更早的教材全部過期。官方規格:$300、180 分鐘、75 題(65 題計分)、及格 750、效期 3 年,考過會同時續掉 AIF-C01、MLA-C01 與 Data Engineer – Associate。

ai guide AI 證照備考

Claude Certified Architect Foundations 考試完整指南

Claude 官方架構師認證(CCAR-F)的完整備考指南:五大領域權重 27/18/20/20/15、六大考試情境抽四個、常見反模式與實際演練建議。官方規格為 60 題 / 120 分鐘 / $125 / 效期 12 個月 / 及格 720,報考限 Claude Partner Network 成員,準時續期免費且非監考。

ai guide AI 證照備考

Claude Certified Architect Professional(CCAR-P)備考路徑:有 28% 不考技術

CCAR-P 是 Anthropic 四張裡最貴也最資深的一張($175、63 題、120 分鐘)。七個領域裡最重的是 Integration 19%,但真正讓它跟系列其他證照不同的是另外兩塊——Governance, Safety & Risk Management 14% 與 Stakeholder Communication & Lifecycle Management 14%,合計 28% 考的是法遵、風險、需求訪談與交付生命週期,不是寫程式。官方點名 GDPR、HIPAA、FedRAMP,並在 Intended Audience 明講「不適合入門開發者,也不適合只寫 prompt 而不負責系統設計的人」。

ai guide AI 證照備考

Claude Certified Associate(CCAO-F)備考路徑:最重的一塊是「怎麼判斷 Claude 講錯了」

CCAO-F 是 Anthropic 四張裡最便宜的一張($99、60 題、120 分鐘),給的是「用 Claude 做事」而不是「寫程式串 Claude」的人。七個領域裡最重的是 Output Evaluation and Validation 21%——辨識幻覺、判斷何時需要人工複核、比較與改寫輸出;Governance, Risk, and Responsible Use 也有 15%。官方明講它不適合寫 API 或設計 agentic 系統的開發者。另有一條容易被忽略:這張不計入 Claude Partner Network 的 tier 資格,另外三張才算。

ai guide AI 證照備考

Claude Certified Developer(CCDV-F)備考路徑:三分之一考的是普通軟體工程

CCDV-F 是 Anthropic 四張認證裡對應工程師的那張。官方 blueprint 有八個領域,最重的 Applications and Integration 佔 33.1%——而它底下最大的兩塊是 Claude Application Design 8.6% 與 Software Engineering Foundations 7.4%,也就是說三分之一的考試在考 API 機制與普通軟體工程。反直覺的是 Claude Code 只佔 3.1%、Eval 只佔 2.6%,而同家族的 Architect 那張光 Claude Code 就佔 20%。官方規格:$125、53 題、120 分鐘、及格 720、效期 12 個月,報考限 Claude Partner Network 組織。

ai deep-dive AI 證照備考

成本、延遲與可用性的考點交集:六張證照從三個不同高度考同一件事

Google PMLE、AWS AIF-C01 與 AIP-C01、微軟 AI-103 與 AI-500、NVIDIA NCP-GENL 都考「怎麼讓 GenAI 應用又快又便宜又不掛」,但排起來是一道三階梯子:AIF-C01 問你知不知道成本隨 token 走,AIP-C01 與微軟兩張問你控不控得住,NCP-GENL 問你改不改得動模型與硬體。切入的高度差三層:NVIDIA 在 kernel 與量化層(Model Optimization 17% + GPU Acceleration 14% = 31%,全系列最重的單一成本延遲區塊),AWS 與微軟在應用層(快取三層、token 上限、chargeback),Google 在 MLOps 層(CPU/GPU/TPU 評估、資料平行 vs 模型平行、依吞吐量擴展服務後端)。交集是八根槓桿,但同一根在三個高度上是三種題目。本文刻意不帶任何價格與硬體規格數字——那是這個主題腐敗最快的部分。

ai guide AI 證照備考

Google PMLE 備考路徑:考綱重寫後怎麼準備

Google Professional ML Engineer 的考綱在 2026 年被重寫,Vertex AI 全面改名為 Gemini Enterprise Agent Platform,舊教材的產品名對不上題目。這篇以官方 exam guide 的六章權重為骨架,逐章列出考什麼、配哪些官方材料、練什麼,並換算成一份看得懂依據的時程。官方規格:$200、兩小時、50–60 題單選加複選、效期兩年、建議 3 年以上業界經驗含 1 年以上 Google Cloud。

Hermes Agent 的研究面:批次跑幾千條 prompt 產訓練資料,以及把它嵌進別的系統

`batch_runner.py` 把數千條 prompt 平行跑成 ShareGPT 格式的 tool-calling trajectory,每條 prompt 可指定自己的容器映像,中斷後靠內容比對而非索引續跑。它內建兩道品質過濾:完全沒有 reasoning 的樣本丟掉、含幻覺工具名的條目在合併時剔除。這解釋了為什麼一家研究機構要做個人 agent——agent 本身就是資料產線。

Hermes Agent 的 Gateway 與排程:無人看管的 agent 最該防的是自己花錢

一個 Gateway 行程接 30 幾個聊天平台,預設拒絕所有不在白名單也未配對的使用者。排程這邊做了兩道少見的防護:pre-dispatch 驗證讓設定壞掉的 job 連 LLM 都不呼叫就標成 blocked_config,而 model drift guard 會讓「沒釘模型」的 job 在全域模型被換掉時直接跳過執行——防的是你切到付費模型後,一個每小時跑的 job 幫你燒錢。

Hermes Agent 安裝與升級:先看支援層級,再決定用哪條路裝

Hermes 的安裝方式分成三個支援層級:macOS(Apple Silicon)/Windows 10-11/Linux-WSL2/Docker 是 Tier 1,Termux 與 Nix 是 Tier 2,而 pip、brew、AUR 與 Intel Mac 明確不支援——用不支援的路裝,修 bug 的 PR 官方不收。升級端 `hermes update` 會先做快照、pull 後編譯九個關鍵檔案驗語法,失敗自動 `git reset --hard` 回滾。

Hermes Agent 導讀:Nous Research 的自我改進 agent,以及它跟 OpenClaw 的真實關係

Hermes Agent 是 Nous Research 的 MIT 授權 agent 框架,賣點是內建學習迴路(自動生技能、記憶提醒、FTS5 跨 session 檢索)。它提供 `hermes claw migrate` 從 OpenClaw 搬家,但 OpenClaw 並沒有被取代,兩邊仍各自在走。這篇是系列導讀,先講清楚它是什麼、跟誰不同、哪些情況不該選它。

Hermes Agent 的記憶與技能:一個會自己改自己的系統,以及你能在哪裡插手

Hermes 的記憶是硬上限的:MEMORY.md 2,200 字元、USER.md 1,375 字元,寫爆不會自動壓縮而是回錯誤讓 agent 自己騰位子。技能則由 curator 背景維護,預設 7 天跑一次、只在閒置 2 小時後啟動,30 天未用標 stale、90 天封存——但從不刪除。真正該打開的開關是 `memory.write_approval` 與 `skills.write_approval`,它們把背景自我改進的寫入變成待審。

從 OpenClaw 搬到 Hermes Agent:搬得動的、搬不動的、還有那份封存目錄

`hermes claw migrate` 會把 OpenClaw 的 persona、記憶、四個來源的技能、模型與供應商設定、平台 token 與審批白名單搬進 Hermes——但金鑰永遠不會靜默搬過去,連 `--preset full` 都要另外加 `--migrate-secrets`。搬不動的東西(cron、plugin、hook、多 agent 清單、複雜頻道設定)不會消失,而是丟進 `~/.hermes/migration/openclaw/<timestamp>/archive/` 等你手動處理。從 Claude Code 或 Codex 過來則是另一個指令 `hermes import-agent`。

Hermes Agent 的模型供應商:訂閱制登入的帳單陷阱,以及 fallback 只會觸發一次

Hermes 支援 40 家以上供應商,其中「用消費者訂閱登入」的路徑最容易產生帳單意外:Anthropic OAuth 只吃 Claude Max 的加購額度、Claude Pro 根本不能用;auxiliary 任務預設 `provider: auto` 會走你的主模型,等於用貴模型做壓縮與視覺。fallback 鏈是每個 session 只觸發一次的一次性切換,不是持續重試。

Hermes Agent 的安全模型:--yolo 之下還有一層拿不掉的地板

Hermes 的審批預設是 smart 模式:低風險指令由 auxiliary 模型放行、真正危險的自動拒絕、不確定的才問人。`--yolo` 與 `approvals.mode: off` 都關不掉 hardline 封鎖清單(`rm -rf /`、fork bomb、`dd` 寫實體磁碟),而 `approvals.deny` 是它的使用者版:在 yolo 之前就攔下來。官方自己標明這整套的威脅模型是「誠實但犯錯的 agent」,不是對抗惡意行程。

Hermes Agent 的七種終端後端:換到沙箱等於關掉危險指令審批

Hermes 的指令可以跑在 local、ssh、docker、singularity、modal、daytona、vercel_sandbox 七種後端。關鍵取捨不是效能而是審批:local 與 ssh 會做危險指令檢查,其餘五種一律跳過,因為官方把容器/沙箱本身當成邊界。另外 Docker 預設是「一個長壽容器跨 session 共用」,不是每次對話一個乾淨環境。

Nous Tool Gateway:用一份訂閱換掉四個帳號,代價是把工具供應鏈集中到一家

Tool Gateway 把 Hermes 的網頁搜尋(Firecrawl)、圖像生成(FAL 九個模型)、TTS(OpenAI)與雲端瀏覽器(Browser Use)四類工具改走 Nous 的基礎設施,用一次 OAuth 取代四個帳號。它是 per-tool 開關而非全有全無,`use_gateway: true` 會蓋過你 `.env` 裡的直連金鑰——這是最容易搞混的優先序。

Hermes Agent 的工具層:3,300 個 MCP 工具塞不進 context 時,它怎麼處理

接上一堆 MCP server 之後,工具 schema 本身就會吃掉大半 context——官方舉的極端例子是 Cloudflare 單一 server 約 3,300 個工具、光名稱就 32K token。Hermes 的解法是 Tool Search:把 MCP 與非核心 plugin 工具換成三個橋接工具,schema 按需載入,核心工具永不延後。另外 plugin 預設全部停用,要在 `plugins.enabled` 逐一點名才會跑。

ai guide AI 證照備考

微軟 AB-100 備考路徑:架構師那張,別照官方頁面那段簡介準備

AB-100 是微軟 agent 線的架構師版,三塊權重 25-30 / 25-30 / 40-45,重心在部署與治理。它的 outline 幾乎全是 design、recommend、propose 這類動詞——考的是情境判斷而不是實作。三個要先知道的:官方考試頁的簡介段落是錯的(寫成資訊保護與 DLP 的樣板文,我逐字驗過),準備要以 study guide 為準;它有免費練習測驗,是微軟三張 agent 證照裡唯一有的;官方列了 15 張可用的 associate 證照但沒有一張是必要條件。官方規格:$165、僅英文、及格 700、效期一年。

ai guide AI 證照備考

微軟 AB-620 備考路徑:Copilot Studio 這條低程式碼的 agent 線

AB-620 是微軟 agent 認證線裡的低程式碼那條——考的是 Copilot Studio 上的 agent flows、adaptive cards、computer use、MCP tools、A2A 與 Fabric data agent,不是寫 Python。三塊權重 30-35 / 40-45 / 20-25,最重的是整合與擴充。官方規格:$165、120 分鐘、及格 700、效期一年、13 種語言含繁體中文,是微軟三張 agent 證照裡唯一有在地化的。已經 GA,但練習測驗還沒開放。

ai guide AI 證照備考

微軟 AI-103 備考路徑:Foundry 換代之後,舊 Azure AI 教材全部作廢

AI-103 取代 2026 年 6 月 30 日退場的 AI-102,考綱完全重寫成 Microsoft Foundry 體系——prompt flow、Azure AI Studio、Azure OpenAI Service、Azure AI Agent Service 這些名詞在目標裡一個都沒有。五塊技能權重 25-30 / 30-35 / 10-15 / 10-15 / 10-15,生成式與 agent 佔最大宗。官方規格:$165、120 分鐘、及格 700、有繁體中文、含互動題型,而且效期只有一年——但續期是免費、開書、非監考的線上評量。

ai guide AI 證照備考

微軟 AI-500 備考路徑:考綱已經公布,官方教材還沒上線

AI-500 是主流雲端業者裡少見的多 agent 系統專家級認證,四塊權重 15-20 / 30-35 / 20-25 / 20-25,官方點名 Agent Framework、LangGraph、Hugging Face Transformers、MCP server 架在 Azure Functions / Logic Apps / API Management、A2A、Key Vault、AI Red Teaming Agent。但它現在有三個限制要先知道:仍是 beta(成績要等重新計分)、必須先取得 AI-103 才能考、而且官方學習路徑尚未上線——考試頁列的四條路徑網址目前全部 404,講師課要等 2026/9/30。

ai deep-dive AI 證照備考

多 agent 架構的考點交集:五張證照重複考什麼,又各自獨有什麼

微軟 AI-500、AB-620、AB-100、NVIDIA NCP-AAI、Claude CCAR-F 這五張證照都考多 agent 架構,交集是七件事:編排拓樸、A2A 與 MCP、每個 agent 的身分邊界、三層記憶、可觀測性與 agent replay、人在迴圈、四個介入點的 guardrail。但同一件事四家用四個名字,而且各自有無法互相轉移的獨有考點——微軟命名了四種 context window 失效模式、NVIDIA 有 7% 綁死自家 NeMo 與 NIM、Claude 考 stop_reason 這種 SDK 層細節。另外修一個常見誤解:Google PMLE 滿篇「Agent Platform」是 Vertex AI 改名,不是多 agent 考點。

ai deep-dive

2026 上半年多模態模型盤點:原生融合 vs. 外接視覺,以及排行榜為什麼會互相打臉

純圖片理解已經打平:MMMU-Pro 上四家前沿模型全部過 80%,差距在 3 分內。真正分勝負的是影片、長文件 OCR、即時語音這幾條軸線,各有不同的領先者。但整理這些排名時最該學的一課,是兩份都算可信的來源對同一個 Video-MME 給出的榜首可以差超過 10 分,而且不是同一家。七月與八月又各換過一輪。

ai guide AI 證照備考

NVIDIA NCA-GENL 備考路徑:名字寫 LLM,考綱有一半是傳統 ML

NCA-GENL 是職缺點名「NVIDIA Generative AI / LLM 相關認證」時最常指的那張。但官方 blueprint 的權重跟名字落差很大——Core Machine Learning and AI Knowledge 30%、Software Development 24%、Experimentation 22%、Data Analysis 14%、Trustworthy AI 10%,LLM 與 RAG 的內容散在條目層而不是自成一塊,spaCy、NumPy、Keras、cross validation 都在考。另一個要先知道的:NVIDIA 官方備考課程全部要付費($30 到 $500),是本系列唯一沒有免費官方學習路徑的廠商。官方規格:$125、1 小時、50–60 題、效期兩年、僅英文、pass/fail 不給分數。

ai guide AI 證照備考

NVIDIA NCA-GENM 備考路徑:多模態那張,但兩門必備課程只有 $500 講師版

NCA-GENM 與 NCA-GENL 同價同時長同級別,但重心完全不同:Experimentation 升到 25%(最重),Core ML 從 30% 降到 20%,並多出 Multimodal Data 15% 與 Performance Optimization 10% 兩塊。內容上考 U-Net、CLIP、擴散模型、多模態損失函數、attention map,以及 Riva/NeMo/Triton/ACE 這幾個 NVIDIA SDK。要注意成本結構:官方建議的五門課裡有兩門只有 $500 的講師版、沒有自學選項——純自學路線先天蓋不滿。官方規格:$125、1 小時、50–60 題、效期兩年、僅英文。

ai guide AI 證照備考

NVIDIA NCP-AAI 備考路徑:還不能報名,而且官方兩份文件的權重互相矛盾

NCP-AAI 是 NVIDIA 的 agentic AI 專業級認證,$200、120 分鐘、60–70 題、效期兩年。但兩件事要先知道:一、官方頁面的 Register 按鈕旁標著「Coming soon」,現在還不能報名;二、官方網頁與官方 PDF study guide 的權重表互相矛盾——Deployment and Scaling 網頁寫 13%、PDF 寫 5%,Run/Monitor/Maintain 網頁寫 5%、PDF 寫 7%,而且兩版加總分別只有 98% 與 92%。兩份都是 nvidia.com。文章把它標成範圍與不確定性,不挑一個當事實。

ai guide AI 證照備考

NVIDIA NCP-GENL 備考路徑:三成考的是 GPU 與模型最佳化,而官方表格有兩格是壞的

NCP-GENL 是 NVIDIA 的 LLM 專業級認證,$200、120 分鐘、60–70 題。它跟其他 GenAI 證照最大的差別在重心:Model Optimization 17% 加 GPU Acceleration 14% 合計 31%,考的是量化、蒸餾、剪枝、分散式平行與 CUDA profiling,不是接 API。兩個要先知道的:官方頁面的 Register 標著 Coming soon,還不能報名;而且同一頁的權重表有兩格描述文字是壞的——Fine-Tuning 那格寫的是 OpenUSD 的資料交換,Model Optimization 那格寫的是部署內容,兩處我都逐字驗過,正確描述在官方 PDF 裡。

ai deep-dive AI 證照備考

prompt 與 context engineering 的考法:十張證照怎麼問,跟實務差在哪

多數人以為 GenAI 證照的主軸是 prompt 寫作,但 CCAO-F 的 Prompting 只有 14%,輸出評估卻有 21%;CCDV-F 的 Prompt and Context Engineering 只有 11%。真正被考的是結構化輸出、防禦性 prompt、動態 context 注入、context 壓縮與快取、prompt 生命週期治理,以及「prompt 改了怎麼證明變好」——這六件事比較接近 context engineering 與軟體工程,而不是寫作技巧。另外沒有任何一張要你現場寫 prompt,全是選擇題,所以練「說得出為什麼」比練手感有用。最該記住的一條來自 CCAR-F:業務邏輯必須被保證時,「先改 prompt」通常是錯誤選項。

ai deep-dive AI 證照備考

RAG 與檢索評估的考點交集:四張證照重複考什麼,還有一張大家以為它考、其實沒有

真正把 RAG 與檢索評估當考點的是四張:AWS AIF-C01(第 2、3 章合計 52%,RAG、向量儲存、FM 評估指標全在裡面)、AWS AIP-C01(第 1 章 31% 裡有 11 個技能點落在向量儲存與 RAG)、NVIDIA NCP-AAI(Knowledge Integration 10% + Evaluation and Tuning 13%)、微軟 AI-500(Develop 30–35% 裡的「多 agent RAG 架構」)。Google PMLE 只貢獻一條 LLM-as-a-judge,而 Claude CCDV-F——那張大家最容易假設它考 RAG 的開發者證照——八個領域裡一條檢索考點都沒有,Eval 只佔 2.6%。附 AIF 與 AIP 的同廠雙級別對照、四家名詞對照表、獨有考點清單與練習專案。

ai deep-dive

自架常駐個人 agent 橫向對照:九個專案,同一個安全問題的九種答案

OpenClaw 386k star、Hermes Agent 232k,但 OpenRouter 上 Hermes 的日 token 量在 2026-05-10 就反超了(224B vs 186B)。這半年冒出來的九個自架 agent 不是九個競品,是對同一題的九種答案:agent 的執行邊界該畫在哪。CVE-2026-44112 打穿的是 OpenClaw 的沙箱本身,而 Meta 對齊主管那次刪信事故裡連攻擊者都沒有——安全指令是被 context 壓縮吃掉的。

Cloudflare Workers AI 模型選型指南:依用途、價格與 context 挑模型

Workers AI 目錄目前 84 個模型。通用對話選 glm-4.7-flash($0.06 / $0.40 per M、131K context),要 vision 選 gemma-4-26b-a4b-it($0.10 / $0.30、256K),極省成本選 granite-4.0-h-micro($0.017 / $0.112),embedding 選 qwen3-embedding-0.6b 或 bge-m3(同為 $0.012 per M)。這篇會定期跟著官方目錄更新。

ai deep-dive

microsoft/AI-Engineering-Coach 的 45 條規則:一份把 agentic 工程意見寫成可執行門檻的清單

微軟員工開源的 VS Code extension,讀本機 Claude Code / Codex / OpenCode 的 session log。真正的內容物是 45 條 Markdown 規則:prompt 短於 30 字元、收到 20 行 AI 程式碼後 15 秒內就送下一則、instructions 檔超過 4000 bytes——把「context engineering」翻成可以爭論的數字。

CS146S Week 4:CLAUDE.md 該寫什麼、hooks 該擋什麼、subagent 該切在哪

課程把指揮 agent 的工具列成四件:指示檔、hooks、commands、subagents。指示檔是唯一每次開機都全額進 context 的,所以它是 config 不是 memory;hooks 補上「規則會被忽略、hook 不會」那一塊;commands 是四件裡唯一由人主動觸發的。課程另給一張表,把軟體任務七步驟裡只剩一步半標成人的工作。

CS146S Week 1:coding agent 的內部構造,其實是一個 while 迴圈

CS146S 第一週的講題是「用 200 行寫出 Claude Code」加上「解剖 production agent 的 system prompt」。agent loop 本身確實只有十幾行。課程投影片最後一頁列了四條 Claude 底下實際在做的事,其中一條是用 `<system-reminder>` 標籤在各處防止模型漂掉——這在官方文件裡找不到。

CS146S Week 5:Express 拿 28 分、CockroachDB 拿 74 分——agent 就緒度是可以量的

Factory 把「repo 夠不夠格讓 agent 動」拆成八根柱子、五個等級,並公開了實測分數:CockroachDB L4(74%)、FastAPI L3(53%)、Express L2(28%)。核心論點是 agent readiness ≈ codebase 裡確定性驗證迴圈的密度——linter、type checker、測試,這些對 agent 來說是獎勵訊號。

CS146S Week 7:o3 找到 Linux kernel 零日,代價是 1:50 的訊噪比

課程量到的 AI SAST 誤報率是 50–100%,而傳統 SAST 本來也有 50% 以上——真正的新問題是非決定性:同一個 prompt 跑兩次結果不同,你無法回答「掃完了沒有」。課程列的 agent 攻擊向量有五種,其中 intent breaking 攻擊的是 agent 的計畫本身。

CS146S Week 3:Agent Skills 是一個資料夾,難的是那兩行 description

Agent Skills 的規格小到一句話講得完:一個含 SKILL.md 的資料夾。真正的設計在三層 progressive disclosure——開機只載 name 與 description,命中才讀全文,需要才展開附檔。本站自己的 repo 有 35 個 skill、7,893 行 SKILL.md,開機成本仍然只有那 35 組 metadata。

CS146S Week 6:Google 為了讓 AI review 有用,先刪掉 17 條規則

Google 的 AutoCommenter 部署到數萬名工程師身上,論文寫出了整條調校過程:把 17 條「技術上正確但沒價值」的規則停掉,有用率從 54% 升到 66%,目標訂在 80% 才准進下一階段。最後的留言解決率約 40%。AI code review 的瓶頸從來不是抓不到,是抓太多。

CS146S Week 9:一個人接 MCP 沒問題,三百個人接就需要一座門

個人怎麼接工具是偏好問題,組織怎麼接是治理問題——誰能碰什麼資料、金鑰放哪、成本算誰的。Anthropic 自己公布的十個團隊使用紀錄裡有個好指標:安全工程團隊佔了整個 monorepo 自訂 slash command 的 50%。採用不是均勻擴散的,它先在會自己造工具的團隊裡起飛。

CS146S Week 8:把 agent 丟到雲端跑之後,瓶頸從等待變成審查

背景 agent 把「你盯著它跑」換成「它自己跑完開 PR」。三家的做法收斂到同一組零件:隔離環境、外部觸發(issue、Slack、Linear)、產出是 PR。真正的新問題是你變成瓶頸——五個 agent 同時跑完,五份 diff 排隊等你讀,而它們互相不知道彼此存在。

CS146S Week 2:context 工程、RePPIT,與 MCP 的 98.7% 那一刀

Fall 2026 把整整一週的 prompting 壓成這週的一節,換上 RePPIT(Research、Propose、Plan、Implement、Test)與 MCP。RePPIT 的兩條硬規則最值得抄:propose 一定要兩個方案、寫 code 的那個 instance 不准 review 自己的 code。MCP 那邊 Anthropic 量到把工具改成程式碼呼叫可以把 150,000 tokens 壓到 2,000。

Stanford CS146S 兩版大綱對照:一年之間,這門 AI 開發課改掉了什麼

Stanford CS146S 的 Fall 2026 大綱把 prompting 從整整一週壓成一節,砍掉終端機與 UI 生成兩週,換上 Agent Skills、Agent-Ready Codebases、Background Agents、AI-Native Team。評分也動了:Final Project 從 80% 降到 50%,多出 30% 的 open source 貢獻。這個系列照十週逐篇讀。

CS146S Week 10:software factory 不是自動化,是把回饋迴圈交出去

最後一週的講題是「self-running, self-improving software systems」。前九週的零件其實都出現過:確定性驗證迴圈、可寫回的 skill、背景 agent、集中治理。課程投影片有個容易被忽略的比例——寫程式只佔工程時間的 30%,另外 70% 是把它跑在 production 上。

Adversarial Robustness and Generative Models:不是非線性,是線性

研究者一開始以為神經網路好騙是因為非線性,結果錯了——Goodfellow 2014 那篇論文主張主因是它們的線性本質,而高維度讓每個微小擾動複利累積。後半場講生成模型:GAN 的三個病,以及 diffusion 為什麼靠「加噪再學會去噪」繞開了其中兩個。

Agents, Prompts, and RAG:一堂課教完之後,剩下的才是難的

BCG 的實驗發現一條「鋸齒狀邊界」:邊界內 AI 大幅提升顧問表現,邊界外 AI 讓結果更差,而人們會在方向盤上睡著。這一講也給了一個很有立場的判斷——盡可能避開 fine-tuning,因為等你調完,下一代模型已經打敗你 fine-tune 過的版本了。

ai guide Stanford CS230 導讀

AI Project Strategy:三四個小時的試算表,省掉幾週的錯方向

Andrew Ng 用 deep researcher 當例子示範 error analysis:列是 pipeline 的每個步驟,行是 10 到 100 個查詢,只看表現不好的那些,逐格標記哪裡壞掉。百分比不需要加起來等於 100%。他說這要花三四個小時,但省下的是幾週走錯方向的時間——而真的會去做的人的比例遠低於 100%。

Deep Reinforcement Learning:把 RLHF 放回強化學習的框架裡

圍棋不能用監督式學習的第三個理由最有意思:ground truth 本身就沒有良好定義——最強的人類不是每天下出最好的棋,而他最好的棋也不是最優解。這一講的最後 20 分鐘把 RLHF 完整放回 RL 的框架:agent 是被微調的模型、action 是下一個 token、一個 episode 是一次完整生成,而且獎勵極度稀疏。

ai guide Stanford CS230 導讀

Full Cycle of a DL Project:資料收兩天就好

Andrew Ng 用人臉辨識開門系統走完整個專案生命週期,而全講只有一個核心論點:速度。他給團隊的期限是兩天,理由是「花在準備資料的時間,應該和訓練一次模型的時間相稱」。最後收在一句話:我的工作是做出一個真的能用的東西,那和做出一個在測試集上能用的東西不一樣。

Supervised, Self-Supervised & Weakly Supervised Learning:從比較像素到比較意義

CS230 第二講用三個案例研究推導出 embedding:日夜分類教你怎麼用人當 proxy 決定解析度,喚醒詞偵測教你三小時生出上百萬筆訓練資料,人臉驗證教你設計出第一個 loss function。最後從監督式 triplet 走到自監督 pairs——那一步才是現代模型能吃下數十億張未標註影像的原因。

What's Going On Inside My Model?:模型退步了,你先看哪裡

問模型「你心目中的鵝長什麼樣」,它畫出一大群鵝——因為標註資料把一群鵝標成 goose,它以為整群才是那個標籤。這一講給了七種打開 CNN 看內部的方法,然後誠實地說:這套方法到 transformer 上,最前沿的研究也只解釋得了兩層。

ai guide Stanford CS230 導讀

Introduction to Deep Learning:光靠 prompt 走不遠的那兩個時刻

CS230 第一講是課程總覽,但 Andrew Ng 花最多時間講的是三件事:為什麼 scaling 有效、什麼時候 prompt 就不夠用了、以及他認為「不要學寫程式」是史上最糟的職涯建議之一。

ai deep-dive 文件解析實戰

掃描 PDF 實測:10 種解析工具丟進考古題,結果差多少?

用 4 份台大碩班掃描考古題實測 10 種開源 PDF 解析工具。VLM 類(Firecrawl、MinerU 3.4、Marker v2)在公式和程式碼上全面碾壓傳統 OCR,但安裝踩坑才是真正的門檻——MinerU 舊包名會進依賴地獄、Marker 首次模型下載要 10 分鐘、PaddleOCR 缺引擎。實務推薦兩階段策略:RapidOCR 粗篩 + MinerU/Firecrawl 精查。

ai deep-dive

X 演算法開源:權重公開之後,反而更清楚黑箱在哪

2026-08-13 的發布新增 363,246 行,首次公開 For You 的排序權重:favorite 0.5、reply 5.0、report −234.0。但權重是常數,真正決定順序的 P(action) 來自一個 2560 維、8 層的 transformer。

ai deep-dive Agent 生產線

context 與記憶:agent 失敗的真正位置

Chroma 測了 18 個前沿模型,全部隨輸入變長而跳崖式退化。記憶失效多半是檢索失效偽裝的。而 KV cache 的真正成本是頻寬不是儲存——decoding 每產生一個 token 都要讀過整個 cache。

ai deep-dive Agent 生產線

安全:prompt injection 只能在 harness 層做損害控制

2025-11 三大實驗室聯手把先前提出的 12 種 prompt injection 防禦全部攻破。EchoLeak 的 payload 通過了微軟自己的專用分類器。所以目標不是擋住每次攻擊,是攻擊成功時活下來——而這只能在 harness 做。

ai deep-dive Agent 生產線

概念界線:agent、workflow、RAG、MCP 到底差在哪

workflow 與 agent 的分界是「步數由誰決定」——開發者在設計時決定是 workflow,模型在執行時決定是 agent。依這個定義,今天大多數上線的 LLM 系統其實是 workflow。附 agent / RAG / MCP 的可操作判準。

ai deep-dive Agent 生產線

上線才是工作的開始:企業 agent 案例橫向讀

Salesforce 從兩萬個部署得到的數字:agent 有 90% 的工作發生在上線之後,跟傳統軟體剛好相反。Stripe 每週合併 1,300 個零人類手寫的 PR,靠的是環境而不是模型。附六家公司的橫向比對。

ai deep-dive Agent 生產線

協定層:MCP、A2A、ACP、Skills 各解什麼問題

MCP 管 agent ↔ 工具,A2A 管 agent ↔ agent,Skills 管可重複使用的知識。判準是資料會不會變:呼叫之間會變就要 MCP,穩定到可以寫下來就用 skill 檔案——後者不需要一個會獨立失敗的 runtime。

ai deep-dive Agent 生產線

模型只是元件,harness 才是系統

Microsoft、OpenAI、Salesforce、Stripe 等七個獨立案例講出同一句話:可靠性來自模型周圍的工程。而「把確定性的部分還給程式碼」已經被四家公司各自做成產品——Agent Script、Procedures、runtime、blueprints。

ai deep-dive Agent 生產線

RAG 的三種形態與 evaluator paradox

Standard RAG 取錯 chunk 就答錯,而且沒有任何機制會發現。Agentic RAG 補上自我檢查,但代價是 evaluator paradox——自我修正能力的上限,就是那個做評估的 LLM 判斷相關性的能力。

ai deep-dive

2026 年工程師 AI 證照有哪些

2026 年工程師能報名的 AI 證照逐張列出:AWS 三張(AIP-C01 / MLA-C01 / AIF-C01)、Google PMLE、微軟 AI-103 與 AI-500、NVIDIA 目錄十二張、Databricks、Snowflake、Oracle Agentic AI、IBM watsonx、Salesforce Agentforce、GitHub GH-300、Anthropic Claude 四張、iPAS AI 應用規劃師初中級,另有 IAPP AIGP 與 ISACA AAISM / AAIA 這條治理稽核線,價格、效期、報考門檻全部對照官方頁面。兩個會影響荷包的重點:Google PMLE 的考試大綱已把 Vertex AI 全面改名為 Gemini Enterprise Agent Platform,2026 年年中以前的教材等同作廢;iPAS 中級證書效期是 5 年而非永久。

ai deep-dive 文件解析實戰

anydoc:14 種辦公格式轉 Markdown,Firecrawl 用 Rust 給的另一個答案

Firecrawl 開源的 Rust 轉檔函式庫,14 種辦公格式(含 .doc / .ppt / .xls 老格式)統一轉 GFM,中位耗時 4.7ms,同樣計時條件下比 Docling 快 109 倍。代價是完全不碰 OCR。

ai deep-dive 文件解析實戰

解析層:當結構要用模型推斷——而授權才是真正的選型軸

掃描件與複雜版面只能靠模型推斷結構。但 MinerU、Marker、Docling 的技術差距遠小於授權差距——MinerU 過 $20M 月營收要另談授權、Marker 的模型權重過門檻要付費、只有 Docling 是乾淨的 MIT。選型先看 LICENSE,再看 benchmark。

ai deep-dive 文件解析實戰

文件解析的三層階梯:轉換、抽取、解析,先選對層再選工具

把文件餵給 LLM 之前,最常見的錯誤不是選錯工具,是選錯層。結構已經在檔案裡的用轉換層(毫秒級),有文字沒結構的用抽取層,連文字都要推斷的才用解析層——anydoc 的 4.7ms 到 Docling 的 513.6ms 差 109 倍,多數人卻直接跳最貴的那層。

ai deep-dive 文件解析實戰

確定性抽取層:不用任何模型,先解決八成的 PDF

數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。

ai deep-dive

數位員工:可靠度來自 harness,不來自模型

「數位員工」不是技術,是計價與課責單位。Anthropic Project Vend 讓 Claude 真的開了三家店,發現最有效的介入不是換更強的模型,而是強迫走流程——官方原話是「我們重新發現了 bureaucracy matters」。Gartner 估計數千家自稱 agentic 的廠商中只約 130 家是真的。

ai deep-dive

圖生影片技術地圖:2026 年 I2V 的架構、模型與真實價格

圖生影片(I2V)在 2026 年的骨幹清一色是 latent diffusion + DiT,畫質已經不是選型軸;真正的軸是原生音訊、能不能自架、每秒多少錢。三個容易踩的坑:Sora 的 app 已在 4/26 關閉、API 9/24 關;Wan 2.7 被大量文章稱為 Apache 2.0 開源但一手來源查無權重;Veo 3.1 官方價是 $0.40/s 而非二手網站流傳的 $0.75/s。

ai deep-dive

2026 做 3D 模型的工具地圖:AI 生成、掃描、CAD、手工建模怎麼選

做 3D 模型在 2026 年有四條路:AI 生成(Meshy-6 / Tripo / Rodin Gen-2.5 / 混元 3D)、手機掃描、Text-to-CAD、手工建模。選錯的代價很具體——AI 生成的 mesh 改不動尺寸、Rodin 的 STL 常需修補、Meshy 免費版的資產是公開的。這篇按「模型最後要拿去幹嘛」給選型建議,並附各家官網當前價格。

AI 爬蟲工具全景圖:34 個開源專案的五大分類與選型指南

從 MarkItDown (175k stars, MIT) 到 curl_cffi (6k stars),整理 34 個「爬資料餵 AI」的開源工具。沿五條軸線分類:整站爬取、AI 瀏覽器代理、文件轉檔、智慧擷取、反偵測基建。選型關鍵不是哪個最好,是場景匹配。

ai deep-dive

Uncle Bob 不讀 agent 寫的程式碼:他用什麼關卡取代 code review

2026/7/23 Uncle Bob 那則 418 萬瀏覽的貼文不是宣言,是回覆——回一位 1983 年入行的工程師問「我心理上就是需要看懂程式碼,是不是太老派」。而且他沒有完全不讀:6/1 那則四階段 pipeline 的原文寫著 I spot check the code,門檻是 crap ≤ 6(業界慣例 30)、mutation 要 kill all survivors。附開源的 Acceptance-Pipeline-Specification 拆解與 Grady Booch 點名的三個指標盲區。

ai deep-dive

3D 生成式模型走到哪了:從 Lyra 2.0 拆解 2026 年的技術地圖

2026 年 3D 生成的核心範式是「video diffusion → feed-forward 3D 重建」,Lyra 2.0 是這條線的代表作。但 CVPR 2026 的三篇 Best Paper 暗示下一波轉向:SAM 3D 帶來 foundation model 級別的物件重建、D4RT 用統一 transformer 數秒重建動態 4D、O-Voxel 用結構化 latent 取代 Gaussian。3DGS 仍是主流但正在被表面原語挑戰,pixel-space diffusion 正在反攻 latent-space。

ai guide

2026 年該上哪些 AI 課程:從不懂 AI、vibe coding,到能上 production

把 OpenAI、Anthropic、Google 三家官方課程平台,加上 Stanford CS146S/CS336、Elements of AI、Hugging Face、MIT 6.S191、李宏毅等資源實際逐頁抓過一遍,按「不懂 AI / vibe coding / 讓它能上 production / 底層 AI」四層重排。另收 2026 年仍在更新的自學倉庫與免裝環境的互動式平台,並用「最後更新日期」篩掉星數很高但停在 2024 的名教材。結論:課幾乎全部免費,稀缺的不是課,是選課的判斷力;而第四層不會解決第三層的問題。

ai deep-dive

HyperFrames 深度解析:HTML 即影片,Agent 時代的影片製作範式轉移

HeyGen 開源的 HyperFrames 用 HTML data 屬性定義影片時間軸,headless Chrome 逐幀 seek 截圖再由 FFmpeg 編碼成 MP4。3 個月 33k stars,Apache 2.0,21 個 agent skills——AI agent 寫 HTML 就能產影片,不需要 React。

ai deep-dive

Loop Engineering:當 AI 不再需要你打 Prompt

Loop Engineering 是設計「自動 prompt agent 的系統」而非手動 prompt 的工程實踐。Boris Cherny 跑數百個 agent、Addy Osmani 正式命名、Blake Crosley 指出驗證成本才是真正瓶頸——這篇整理一手來源、五大構建塊、適用邊界與批評觀點。

ai deep-dive

Text / Image to Lottie:AI 動畫生成工具全景導讀

從 CLI 工具 kin3o 到 CVPR 2026 論文 OmniLottie,盤點把文字和圖片轉成 Lottie 動畫的開源路徑,附效能基準與選型建議。

ai deep-dive

LLM Agent 的技能管理革命:從 Voyager 到 MUSE-Autoskill 的 Skill Lifecycle 全景

MUSE-Autoskill(2026)提出五階段 skill 生命週期框架,自創 skill 在 SkillsBench 達 60.35%(+7.16%),成功生成 skill 的任務上更達 87.94%,超越人工撰寫上限。本文整合六篇 arXiv 論文,梳理 skill evolution 研究全景。

ai deep-dive

調整 agent 之後,怎麼嚴謹比較前後差異:從 golden set 到統計檢定

即使 temperature=0,LLM 輸出實測仍可能抖動 15%。要嚴謹比較 agent 調整前後,得靠凍結 golden set、每題跑 ≥3 次取平均、LLM-as-judge 盲評(pairwise 偏好翻轉率高達 35%)與配對統計檢定,而不是前後各問一遍看感覺。

ai deep-dive

Agent 可觀測性:從 OTel Trace 到抓出幻覺、工具誤用與無限迴圈

業界已收斂到用 OpenTelemetry GenAI 語義約定把每個 LLM call / tool call 變成 span;偵測三大故障再分三條線:faithfulness + semantic entropy 抓幻覺、framework 層 symbolic guardrail 擋 tool misuse、max steps + action hash 去重防無限迴圈,最後全部掛上 Final / Trajectory / Single-step 三層評估。

ai deep-dive

Agent 的資源理性:在 token、工具呼叫、延遲之間做最優決策

資源受限下的 agent 決策是 bounded rationality 的復活:Rational Metareasoning 用 VOC 獎勵省 20–37% token、BATS 證明沒有 budget awareness 加預算也沒用、FrugalGPT cascade 最高省 98% 成本、Speculative Actions 降 20% 延遲。三約束最後收斂成一條 Pareto 曲線,主線是「從人手調旋鈕走向模型自己做資源理性決策」。

ai deep-dive

Agent 安全的同一條裂縫:從 Prompt Injection、信任邊界到 Multi-Agent 蠕蟲

三個聽起來不同的 agent 安全問題——tool output 注入、信任邊界、惡意 agent——根是同一個:LLM 把指令與資料攤平成同一條 token 串流,架構上無法區分。理解這條主線,就能看懂從 EchoLeak(CVE-2025-32711,zero-click)到 Morris II AI 蠕蟲的所有攻擊,以及為什麼「把模型調乖」沒用、只有架構約束(六大設計模式、CaMeL)有用。

ai deep-dive

Agent 怎麼決定「要不要查、查什麼、怎麼合」:Agentic RAG 的三個決策層

傳統 RAG 是固定管線「先查再答」;Agentic RAG 把檢索拆成三層決策:何時檢索(FLARE 用 token 機率、Adaptive-RAG 用複雜度分類器)、檢索什麼(HyDE / RAG-Fusion / 分解 / Step-back)、如何整合(RRF k=60 → cross-encoder rerank → 壓縮,Anthropic 實測失敗率 −67%)。關鍵反直覺:不必要的檢索會傷品質,「決定不查」是一級能力。

ai deep-dive

別再手工調 prompt:從 GEPA 到 tool description,agent 行為的自動最佳化

自動 prompt 優化(APO)從 APE/OPRO 演進到 GEPA:用語言反思取代稀疏 reward,少 4–35 倍 rollouts 贏過 GRPO 約 6pp。另一邊,tool description 是被忽略的 prompt——小改措辭能讓工具選用率變 10 倍,Anthropic 實測讓 Claude 自我改寫 tool description 勝過人類專家手寫。兩條線正在合流:eval-driven 的自動優化吃掉手工調 prompt。

ai deep-dive

Deep Research Agent 怎麼蓋:多輪搜尋規劃、衝突調和、可驗證結論

自主研究 agent = 四個可控環節:規劃(拆子問題)、檢索迴圈(search→read→反思 gap→再 search)、證據仲裁(≥2 獨立來源、衝突分型處理)、可驗證輸出(句級引用 + 獨立查核 pass)。兩條路線:訓練派用 RL 端到端學會何時搜(Search-R1 +41%),編排派用 orchestrator-worker 分工(Anthropic 內部評測 +90.2%,代價 ~15× token)。

ai deep-dive

Machine Theory of Mind:Agent 如何推斷其他 agent 的意圖、知識與目標

從觀察行為反推他者的信念/目標/意圖,學界叫 Machine Theory of Mind。三條血脈:符號 BDI、貝氏逆向規劃、深度學習 ToMnet。LLM 時代最大爭議是 ToMBench 上 GPT-4 仍落後人類 >10 分——高分到底是真推理還是統計捷徑。

ai deep-dive

Multi-Agent 的錯誤傳播與恢復:向分散式系統借三十年的武器

每步 99% 準確率、跑 100 步,無錯完成率只剩 36%——錯誤複利是結構問題,不是 prompt 能調掉的。分散式系統的 supervisor tree、bulkhead、circuit breaker、saga、durable execution 幾乎可一對一搬進 agent 編排;但 LLM 多了一種傳統系統沒有的故障——不會 crash 的語意錯誤,得靠 Inspector agent(recover 96.4%)與冗餘投票(MAKER 百萬步零錯誤)補上。

ai deep-dive

語意相似 ≠ 檢索相關:embedding 檢索系統性失靈的情境、偵測與補救

Cosine similarity 和 relevance 在一整類情境系統性背離:否定詞(NevIR 上多數 IR 模型 ≤ 隨機)、精確識別碼、數值門檻、邏輯組合(SoTA 模型在 LIMIT 上 recall@100 < 20)——其中一部分是單向量範式的理論上限,換大模型無解。補救順序:hybrid BM25 → reranker(Anthropic 實測 −67%)→ 上游 metadata 路由 → 領域微調 / multi-vector。

ai deep-dive

幾百個工具怎麼選得準:tool selection 的崩塌曲線與工程解法

工具一多,選擇準確率不是緩降是崩塌:4→51 個工具從 43% 掉到 2%、10→100+ 個從 78% 掉到 13.62%。根治解法是別一次塞全部——Anthropic Tool Search Tool 用 defer loading + 檢索砍 85% token,Opus 4.5 準確率 79.5%→88.1%。description 品質的效益是條件式的:簡單場景沒差,多工具串接場景 correctness 44%→50%。

ai deep-dive

換更貴的 embedding 救不了繁中 RAG:三層失敗成因與補救順序

繁中 RAG 檢索失敗是三層疊加:embedding 的粒度缺陷(BGE/GTE 從 0.1B 到 7B 都在「炸鸡」這種簡單 query 上排錯)、簡中/英文語料主導造成的在地詞彙偏移(保費、不保事項對齊不可靠)、MTEB 中文榜是簡體導致選型訊號失真。修復是架構性的:OpenCC 正規化 → hybrid + jieba 斷詞 → reranker → 最後才是在地微調——而且一切前提是先建繁中專屬 eval set。

ai guide

arXiv 論文品質判讀指南:從 endorsement 機制到實戰 checklist

arXiv 不做 peer review,約 2% 投稿被拒。判斷品質靠外部訊號:頂會收錄 > 機構 + 開源復現 > 引用品質。附 20 項實戰 checklist 和 2026 年工具箱(PWC 已關閉)。

ai deep-dive

上傳檔案就自動 embedding 是個壞預設:Adaptive / Agentic RAG 與 Agentic Parsing 論文導讀

把『使用者上傳檔案就自動切 chunk、embedding』設為預設行為,等於替 LLM 預先做了一個它本來可以自己做的決定。從 Self-RAG (2310.11511)、Adaptive-RAG (2403.14403) 到 AgenticOCR (2602.24134) 這條學術線索,正在把『要不要 retrieve、要不要 parse、怎麼切 chunk』三層決策權,從 ingestion pipeline 往後推到對話時的 agent。

ai deep-dive

把 LLM Agent 的 skills / tools / code interpreter 真正組裝起來:一份論文導讀地圖

LLM agent 的難點不是把 function calling、skill、code interpreter、文件工具各自做出來,而是把它們組成一個會選工具、會寫程式、會拆任務、會驗證結果、又不會被 prompt injection 打穿的系統。這篇把代表論文整理成六個工程決策:function calling 可靠度、tool/skill selection、code-as-action、多步 planning、skill 系統、安全與文件生成。

ai deep-dive

A2UI(Agent-to-User Interface):Google 讓 agent 把 UI 當資料傳出去的開放協定

A2UI 是 Google 在 2025-12-15 開源的 agent 生成式 UI 協定:agent 只送宣告式 JSON 描述 UI 意圖,client 用自己的元件 catalog 白名單渲染成原生畫面,疊在 A2A 之上。發布時 format v0.8,3 個月後已迭代到 v0.9。

browse.sh:把瀏覽器 Agent 學過的事存成技能目錄

Browserbase 在 2026-05 推出的 browse.sh,是「瀏覽器技能目錄 + Browse CLI」兩件事。核心論點:瀏覽器 Agent 的瓶頸是健忘症不是推理,把學過的網站操作存成純文字 SKILL.md,Craigslist 任務官方自評從 ~$0.22 降到 ~$0.12。注意它跟 2018 年的 Browsh 文字瀏覽器毫無關係。

ai deep-dive

CodeGraph:本地端程式碼知識圖譜,與「直接走圖才省錢」的真相

CodeGraph 用 tree-sitter 把 codebase 抽成本地 SQLite/FTS5 知識圖譜,讓 AI coding agent 查圖而不是掃檔。官方端到端 benchmark(7 repos、median of 4)平均省 35% 成本、70% tool calls;但前提是 agent 直接走圖——把探索 delegate 給只會讀檔的 subagent,CodeGraph 反而變成 overhead。

ai deep-dive

大家怎麼讀 arXiv 論文?方法論與工具全景

讀論文是兩個問題疊在一起:方法論(Keshav 三遍閱讀法,5-10 分/1 小時/4-5 小時)決定怎麼讀,工具(arXiv HTML、alphaXiv、NotebookLM、Connected Papers、Zotero)負責縮短每一遍的時間。AI 負責降低理解門檻,判斷對錯永遠留給人。

Midscene.js:押注純視覺的跨平台 UI 自動化框架

字節跳動開源(MIT)的 UI 自動化框架。UI 動作只靠截圖餵給視覺語言模型,不解析 DOM;一套 JS API 跨 Web / Android / iOS / 桌面。代價是每步較慢、token 較貴,而且高度綁在模型的 grounding 能力上。注意它已在 1.9.8 之後停掉 MCP,改走 Skills + CLI。

ai deep-dive

Claude 怎麼讀寫 PDF / DOCX / PPTX:拆解 skill + sandbox 的三層架構

Claude 沒有 docx_tool / pdf_tool — 它只用 bash + file tools,加上 SKILL.md 指令、容器內預裝的 pdfplumber / python-pptx 等 library,三層拼出檔案讀寫能力。

ai deep-dive

Open Design:11 天 fork 出來的 Claude Design 開源替代品

Anthropic 2026-04-17 發 Claude Design,4-28 nexu-io/open-design 公開,同樣的 artifact-first loop、Apache-2.0、跑在你已經有的 16 個 coding-agent CLI 上。兩週從 0.1 到 0.7、40k+ stars。把 AI 設計工具從 vertical SaaS 攤平成 skill bundle 的範式轉移。

ai deep-dive

system_prompts_leaks 導讀:40k star 的 AI 系統提示 archive 在解什麼問題

asgeirtj/system_prompts_leaks 蒐集 40 多個 AI 助理的 system prompt 原文,從 GPT-5.5、Claude Opus 4.7 到 Gemini 3.1 Pro 都有,40.3k stars、461 commits、MIT 授權。價值不在於拿到秘密,而在於把廠商的隱性政策變成可比對的工程素材——要學的是設計決定,不是文字本身。

ai deep-dive

拆解 Anthropic Founder's Playbook:四階段、三條 moat、一個 Cowork 合規坑

Anthropic 2026-05-14 發的 35 頁創業手冊,把 Idea/MVP/Launch/Scale 四階段按 agentic AI 重排。最值得學的是『build 越容易、validation 越重要』與 CLAUDE.md 當作 MVP 第一個 artifact;最該打折扣的是 Launch 章節把合規 workstream 跑在 Cowork 上 — Anthropic 自家文件說 Cowork 不寫 audit log。

ai deep-dive

用 AI Agent 操作影片生成工具:HyperFrames、HeyGen、Runway 整合指南

AI agent 可透過 Skills、MCP Connector、直接 API 三種方式操作影片生成工具,選對整合方式比選對工具更重要。

ai deep-dive

Code Mode:把 tool definition 從 context 搬進 code

別再把所有 tool description 在 session 開頭一次塞進 context。讓 model 寫 code、runtime 執行,tool 定義只在 import 那行才進 context — Anthropic 的 GDrive→Salesforce 範例從 ~150K tokens 降到 2K,Cloudflare 的 2,500 endpoints schema 從 1.17M 降到 1K。

ai deep-dive

FDE 戰爭:OpenAI 和 Anthropic 為何同時複製 Palantir 的劇本

MIT 研究說 95% 企業 AI pilot 零回報。OpenAI 和 Anthropic 在同一週各自宣布百億美元規模的合資公司,把 Palantir 用了十幾年的 Forward Deployed Engineer 模式整套搬進企業 AI 落地戰場。

ai deep-dive

別人怎麼用 LLM 寫文章:從 Karpathy LLM-wiki 到多 agent pipeline 的取捨筆記

綜述 11 個公開的 LLM 寫作 pipeline,三條主流模式:多 agent(researcher → writer → critic)、Karpathy LLM-wiki(raw + wiki + LLM 寫不手寫)、品質防線(technical verifier + never fabricate + brief gate)。Princeton GEO 論文(KDD 2024)量化了 inline 引用 +28%、加數字 +33%、quote 原文 +41%、關鍵字塞詞 −9%。

ai deep-dive

OpenAI 公開 Codex 安全部署策略:沙箱、自動審批與企業治理框架

OpenAI 在 2026 年 5 月公開 Codex 內部部署實踐:沙箱劃技術邊界、審批決定何時停下、Auto-review 用子代理代替人類審批、Managed configuration 由企業管理員強制下發。核心理念是:低風險動作零摩擦,高風險動作必經審查。

ai guide

9Router:把 Claude Code / Cursor / Cline 路由到 40+ 家供應商的本地三層 fallback 路由器

本地起一支 OpenAI 相容端點 localhost:20128,把 Claude Code / Cursor / Cline / Codex / Copilot 等 CLI 的請求,自動依 訂閱 → 便宜 → 免費 三層 fallback 路由到 40+ 家供應商。內建 RTK 壓縮 tool_result(省 20–40% input token)、Caveman mode 壓 output、OAuth 自動 refresh、多帳號輪詢,npm install -g 9router 兩條指令裝完。

Claude、Codex、Gemini 都進瀏覽器了:三家 AI Agent 在 Chrome 的路線比較

三家原本走三條路:Anthropic 做擴充、OpenAI 蓋自己的瀏覽器、Google 直接焊進 Chrome。到 2026-08 已經變成兩條——OpenAI 的 Atlas 在 8/9 停止運作,能力收回 ChatGPT 桌面版與 Codex。剩下的分歧是「寄生在 Chrome 上」對「Chrome 本身就是」。

ai deep-dive

自製 auto-dev agent 的 15 個 walls:從 Stripe Minions 學到的具體實作

Stripe Minions 講『The walls matter more than the model』,但矽谷四家 case study 沒講具體要怎麼蓋這些 walls。這篇把 daodao auto-dev agent 實際落地的 15 個 walls 拆給你看:每個 wall 防什麼、檔案放哪、tradeoff 在哪。Tier 1 必上、Tier 2 強化、Tier 3 嚴肅治理。

ai guide

什麼是 auto-dev agent?daodao 自動化開發系統的入門解說

PM 在 Notion 勾選一張任務卡 → 系統自己同步成 GitHub issue → 寫成 plan → 寫成 code → 開 PR 給人類 review。這篇講這套系統做什麼、不做什麼、為什麼現在可行,給沒在寫 code 的人看。

ai guide

手把手建一條 Notion → PR auto-dev agent:daodao pipeline 的可複製版本

從零建一條 Notion 任務 → GitHub issue → spec PR → code PR 的 auto-dev agent。用 daodao 案例為範本,講清楚每一步要做什麼、要驗證什麼、踩到問題怎麼處理。Notion DB schema → bin/ scaffold → 兩條 Claude Code routine → cloud env vars → staging 測試。

ai deep-dive

Claude for Financial Services:拆解 Anthropic 的多 Agent 參考實作

Anthropic 開源了 12 個金融業 Agent + 11 個 MCP connector,最值得抄的不是 Agent 本身,而是『同一份 prompt 雙 runtime』和『純檔案擴充』的分層設計。

ai guide

從 Plan 到 PR:daodao 的 auto-dev agent 實戰

用 5 輪 consensus 寫 plan、再用 team mode 5 worker 並行做完 12 個 task;中間踩了不少坑,記下來給未來的自己跟同樣在嘗試的人看。

ai deep-dive

DeepSeek-OCR:把長上下文壓成圖片的 10× 壓縮實驗

DeepSeek-OCR 的論文題目是 Contexts Optical Compression — OCR 只是手段,真正驗證的是『把文字渲染成圖片再餵給 VLM』能達到 10× 壓縮且 97% 精度。這對長上下文 LLM 與 RAG 的 token 成本是質變。

ai deep-dive

2026 年 LLM Inference 服務商免費額度與定價:40+ 家分梯整理

個人專案、玩具 demo、做 RAG 原型,不想第一步就掏卡。整理 2026/05 還在運作的 40+ 家 LLM inference 服務商,按免費資源「是持續補充還是一次性」分梯,標註綁卡需求、模型清單、付費起價,數字全部從官方 pricing 頁驗證。中國原廠含智谱 GLM(永久免費)、豆包(每日 200 萬 tokens)、Kimi、百煉、Ollama 本地跑法一併收錄。

ai deep-dive

Claude Skills:把專業知識打包成資料夾,教一次就一直記得

Skill 是一個資料夾、一份 SKILL.md。三層 progressive disclosure 讓 Claude 在需要時才載入細節,避免每次對話重新解釋偏好。

ai guide 搜尋與爬取實戰

Local Deep Research 導讀:本地優先的深度研究 Agent

Local Deep Research 是個本地優先、隱私導向的深度研究 Agent,用 LangChain + LangGraph 串起 20+ 搜尋引擎和 30+ 種研究策略,旗艦的 langgraph_agent_strategy 走 LLM 自主 tool-calling 路線,跟固定流程的 RAG graph 是兩種思路。

ai deep-dive RAG 技法大全

PageIndex:不做向量的 RAG,把長文件變成一本有目錄的書

PageIndex 不切 chunk、不做 embedding、不存向量,靠 LLM 推理一份 LLM 自己寫的目錄樹,在 FinanceBench 上由開發方自評拿到 98.7%。它解的不是向量 RAG 的同一個問題——是『在一份結構清楚的厚文件裡找對的那一節』。

ai guide 搜尋與爬取實戰

AI Agent 接搜尋 MCP 工具:當 WebFetch / WebSearch 被擋的時候

用 Claude Code、Cursor 等 AI agent 時,內建 WebFetch / WebSearch 常被 Cloudflare、地理限制或 rate limit 擋住。接一個 search MCP server 是最直接的解法,這篇比較 2026 年實際能用的選項。

ai guide

Groq Console:用 LPU 推論開源模型的開發者平台

Groq Console 是 Groq 自家 LPU 晶片的開發者入口,提供 OpenAI 相容 API、Playground、免費額度,主打把 Llama、Qwen、DeepSeek 等開源模型跑出市面上最快的 token/秒。

goose:開源、跨平台、不鎖 LLM 的本地 AI Agent

goose 是由 Linux Foundation 旗下 AAIF 維護的開源 AI Agent,支援 15+ LLM 供應商、70+ MCP 擴充,用 Rust 打造桌面 App + CLI + API,定位是不鎖廠商、可自架的 Claude Code 替代方案。

ai guide Cloudflare AI Stack

Gemma on Cloudflare Workers AI:繁中應用的務實選擇

在 Cloudflare Workers AI 上跑繁中 LLM,Gemma 系列的指令跟隨比同級 Llama 穩定。gemma-3-12b-it 已於 2026-05-30 標為 deprecated,現在的對應選項是 gemma-4-26b-a4b-it:256K context、Vision、Function calling,$0.10 / $0.30 per M tokens。

ai deep-dive

用 LLM 做知識管理:從 Karpathy 的 llm-wiki 到開源生態全覽

Karpathy 在 2026 年提出 llm-wiki 模式,讓 LLM 主動維護 markdown wiki 而非每次從頭 RAG;目前已有 100+ 開源實作,從本機 CLI 到 serverless Telegram bot 各有差異。

ai deep-dive

OpenAI Workspace Agents:從 Custom GPT 進化到團隊自動化平台

OpenAI 2026/4/22 推出 Workspace Agents,以 Codex 為底、可長時間在雲端執行、能串 Slack/Salesforce/Google Drive,是 Custom GPT 的企業版後繼者。

ai guide RAG 技法大全

36 小時建出法律合約 RAG:Weaviate Query Agent + ColQwen 架構拆解

用 Weaviate Query Agent + ColQwen 多向量模型,一個 prompt 在 36 小時內搭出生產等級的法律合約搜尋系統——這篇拆解它的架構邏輯、技術選擇,以及你真正需要注意的事。

ai guide

AI Code Review 走到哪了:從 Cloudflare 的 Multi-Agent 系統看業界現況

Cloudflare 內部跑了 30 天 Multi-Agent Code Review,131K 次 Review、中位數 3 分鐘。這篇整理他們的架構,以及 Anthropic、GitHub、CodeRabbit、Greptile 等業界方案怎麼做同一件事。

ai guide

深入 Codex Agent Loop:OpenAI 如何讓 AI Agent 持續迭代工作

OpenAI 詳解 Codex 的 agent loop 設計:prompt 如何建構、multi-turn 對話如何管理、prompt caching 如何避免成本爆炸,以及 context window 自動壓縮的實作。

ai guide

Codex App Server:OpenAI 如何把 Agent Harness 變成通用協議

OpenAI 把 Codex harness 包裝成 JSON-RPC over stdio 的 App Server,讓 VS Code、JetBrains、Web、桌面 App 都能共用同一套 agent loop,三個核心 primitive:Item、Turn、Thread。

ai guide AI Agent 實戰

OpenAI 用 Codex 寫了 100 萬行程式碼:Harness Engineering 實戰

OpenAI 內部團隊 5 個月、3 人、0 行手寫程式碼,用 Codex 交付了一個完整產品。這篇整理他們在 AGENTS.md 設計、repo-local 知識庫、架構強制執行、entropy 管理上的核心心得。

ai guide AI Agent 實戰

Agentic Engineering:讓 AI Agent 像真實工程團隊一樣協作

Agentic Engineering 不是讓 AI 寫更快的程式碼,而是讓軟體更快走完整個交付流程——透過多 agent 協作,壓縮跨團隊的協作摩擦。

ai guide AI Agent 實戰

Agentic Engineering 的記憶問題:從類型、實作到擁有權

Agent 的記憶不是一個插件,而是 harness 本身的一部分。選對記憶類型、估算資料量、再決定用什麼技術——最後,也要搞清楚你是否真的擁有那份記憶。

ai guide

用 Codex + Gemini + Claude 做多引擎 Code Review:原理、模式與實作

AI 模型審查自己的程式碼時會自我合理化,用三個不同 CLI 做獨立 review 可以有效捕捉盲點——這篇介紹背後的設計哲學與實際的工作流程模式。

ai guide

把 AI Agent 接進開發流程:從 SDLC 五大階段看怎麼做

Agentic AI 不只是 autocomplete,而是能自主執行多步驟任務的 AI 系統。這篇文章拆解 SDLC 的五大階段,說明每個階段能從哪裡切入、怎麼從 CLI 工具走到全流程自動化,以及目前最值得追蹤的外部資源。

ai guide

一本由 AI 自己寫的書,教你怎麼跟 AI 一起寫軟體

Encyclopedia of Agentic Coding Patterns 收錄 190 個 pattern,幫你在 AI 代寫程式的時代做出正確的軟體決策——而這本書本身就是由 AI agent 自主撰寫和維護的。

ai guide

GitHub Copilot Coding Agent:把 Issue 丟給 AI,讓它自己開 PR

GitHub Copilot Coding Agent 讓你把 Issue 指派給 Copilot,它在雲端沙箱裡自動開 branch、寫程式、跑 CI、開 PR。成功關鍵是設好 AGENTS.md,沒設定的話 agent 容易跑偏。適合定義清楚的中型任務,需 Pro+(每月 1,500 premium requests)或 Enterprise 方案。

ai guide

knowledge-pipeline:六層管線幫你的 RAG 做品質管控

一個六層確定性管線,從 URL 擷取到向量嵌入全自動處理,透過八維度評分系統在資料進 RAG 之前就篩掉垃圾。

ai guide 文件解析實戰

MarkItDown:把任何檔案餵給 LLM 之前,先讓它變成 Markdown

Microsoft 開源的輕量工具,把 PDF、Office、圖片、音訊等格式統一轉成 Markdown,專門為 LLM pipeline 設計。

ai guide

MCP vs CLI vs API:Agent 工具介面的真實分界

MCP 不會退場,但有效範圍比想像中窄。本機開發場景 CLI 和 raw API 幾乎都贏過 MCP;MCP 真正不可替代的,是「跨 agent 共享的本機工具層」這條窄縫。

ai guide

從實戰整理:AI Native 團隊該做好的事

不是每個人都該直接用 coding agent 改 code。AI Native 團隊要搞定 interface 規格、測試先行、monorepo、security guardrail、human-in-the-loop 與 token 預算管控,在 coding agent 上面再建一層 agent platform 並明確開發者角色轉型才是正途。

ai guide

Autoreason:讓 LLM 自我修正時知道何時該停手

Autoreason 用競爭式多版本評估(A/B/AB + 盲測 Borda count)取代傳統的「批評→改寫」迴圈,解決 LLM 自我修正中的提示偏差、範疇蔓延和缺乏克制三大問題。

ai project

Vercel Open Agents:把 coding agent 從你的筆電搬到雲端

Vercel Labs 開源的 coding agent 參考實作。三層架構分離 web UI、agent workflow、sandbox VM,設計給想自建 Claude Code / Cursor Background Agent 的團隊當起手。

ai guide

Claude Octopus:把 8 個模型同時掛在 Claude Code 上的共識 Plugin

Claude Octopus 是一個 Claude Code plugin,能同時叫 Codex、Gemini、Copilot、Qwen、Ollama、Perplexity、OpenRouter 和 Claude 一起看同一份 code,用 75% 共識門檻找單模型的盲點。內建 32 個 persona、48 個 /octo:* slash commands、51 個 skill、以及 Dark Factory 全自動 spec-to-code 管線。

ai guide

LLM Council:Karpathy 週末打造的多模型議會,三階段讓 LLM 互相評審

LLM Council 是 Andrej Karpathy 花一個週末做的本地 Web App,把一個問題同時丟給多個 LLM,再讓它們匿名互評,最後由 Chairman 模型綜合出一份答案。定位是讀書時比較模型用的小工具,99% vibe coded、不打算長期維護,但架構本身就是一份值得參考的 ensemble LLM 最小實作。

ai guide

Claude Managed Agents:把 agent 外殼和沙箱都交給 Anthropic

Claude Managed Agents 是 Anthropic 2026/04/08 推出的 beta 服務,提供 agent harness 加雲端容器沙箱,按 token 加 $0.08/session-hour 計費,適合長時間非同步任務,不想自己寫 agent loop 和跑沙箱的人值得看。

ai guide

Agent Skills:讓 AI 代理像資深工程師一樣工作的技能框架

Agent Skills 是 Addy Osmani 開源的 19 個生產級工程技能,透過 /spec → /plan → /build → /test → /review → /ship 的指令驅動 AI 代理遵循資深工程師的開發紀律,而不是走捷徑。

ai guide

Graphify:把程式碼和文件變成可查詢的知識圖譜

Graphify 用 tree-sitter AST 提取程式碼結構,再用 LLM 語意分析文件與圖片,把整個專案壓縮成一張可查詢的知識圖譜。號稱每次查詢比讀原始檔案省 71.5 倍 token。

Claw Code:用 Rust 重寫 Claude Code 的開源 CLI Agent

Claw Code 是用 Rust 從零重寫的 Claude Code CLI 替代品,48K 行程式碼、40 個工具、MIT 授權。最驚人的是整個專案在 5 天內由多個 AI Agent 協作完成,上線不到一週就突破 170K stars。

ai guide

clawhip:讓多 Agent 開發不再失控的事件通知路由器

clawhip 是一個 Rust 寫的 daemon,專門把 AI coding agent 的事件(commit、PR、session 狀態)路由到 Discord / Slack,解決多 Agent 並行時「不知道誰在做什麼」的可觀測性問題。

ai guide

notebooklm-py:用 Python 操控 Google NotebookLM 的非官方 API

notebooklm-py 透過逆向工程 Google 的 batchexecute RPC 協議,讓你用 Python / CLI / AI Agent 程式化操作 NotebookLM,包含音訊、影片、投影片、測驗等生成功能。

ai guide

oh-my-claudecode:把 Claude Code 變成多 Agent 協作平台的增強層

oh-my-claudecode(OMC)在 Claude Code 上加了 8 種協作模式、19 個專業 Agent、跨模型調度(Claude + Codex + Gemini),讓單人 CLI 工具變成多 Agent 開發平台。支援 Deep Interview 需求釐清、Smart Model Routing 省 30-50% token、rate limit 自動恢復。

ai guide

oh-my-codex:在 OpenAI Codex CLI 上疊加結構化工作流的增強層

oh-my-codex(OMX)不是取代 Codex CLI,而是在它上面加一層結構化工作流——從需求釐清、計畫產出到多 Agent 並行執行,用 4 個核心 Skill 把散亂的 prompt 對話變成可追蹤的開發流程。

ai guide

oh-my-openagent:用多模型 Agent 團隊取代單一 LLM 的編碼框架

oh-my-openagent(OmO)把 OpenCode 從單一 LLM 工具變成多模型 Agent 團隊——Opus 當主力、GPT-5.2 當架構師、Gemini 做前端、Sonnet 查文件,一個 ultrawork 關鍵字觸發全員並行。48K stars,UltraWorkers 生態系中最早建立多 Agent 編碼模式的專案。

ai project

OpenHarness:把 Agent Harness 完整開源的框架

香港大學 HKUDS 開源的 Agent Harness 框架,實作了工具呼叫、技能載入、記憶、權限、多代理協作等完整基礎設施,支援 Anthropic / OpenAI / GitHub Copilot 三種 API 格式。

ai guide

Claude Code Agent Teams 怎麼用?從 GitHub 6,400+ 個 agent 看設計模式

GitHub 上已有 6,400+ 個 .claude/agents/*.md 檔案。我們拆解了 4 個代表性專案——ChemistryTimes(內容生產 pipeline)、claude-sub-agent(document-driven 開發流水線)、agentic(Temporal.io DAG 平行執行)、vs-copilot-multi-agent(Hook 強制記憶寫入)——加上 ruflo 的企業級 swarm 架構,歸納出 6 種設計模式和 5 個實戰趨勢。

ai guide AI Agent 實戰

從 Stripe 到 Meta:矽谷一線公司如何用 AI Agent 取代鍵盤

矽谷一線公司各自獨立打造內部 AI coding agent,從 Slack 訊息到 merged PR 全程自動化。深入拆解 Stripe、Ramp、Coinbase、Spotify 四家的架構,再擴展到 Google、Meta、Amazon、Uber、Goldman Sachs、Walmart 等十多家公司的做法與指標。

ai guide

LLM 知識庫的三種模式:知識庫、經驗庫、部落格

Andrej Karpathy 提出用 LLM 編譯個人知識 wiki 的框架——收集原始資料、LLM 編譯成 .md wiki、對 wiki 做 Q&A、輸出歸檔回 wiki。本文比較三種實踐路線:Karpathy 的知識庫模式、社群的經驗庫模式、以及 quidproquo 的部落格模式。

ai guide

AI Agent 的 Cache 不只一層:從 Claude Code 的 18 種快取到 ReAct Agent 的多層設計

拆解 Claude Code 的 18+ 種快取機制後發現:provider-level prompt cache 你做不了,但 embedding cache、tool result cache、entity cache 你不但做得了,效果還更好。附完整的 AgentCache 介面設計與 per-tool TTL 策略。

ai guide

AI Agent 的 Tool 描述不該是靜態的:從 Claude Code 學到的動態 prompt() 設計

Claude Code 的 45 個 tool 中,每個 prompt() 都會根據使用者類型、feature flags、系統能力動態調整。將這個模式套用到 ReAct Agent,根據 orchestrator 模型能力、locale、可用 tools 三個維度動態生成 tool description,小模型自動補 few-shot,大模型省 token。

ai guide Agent CLI 選型指南

Claude Code 完整方案分析:終端 Agent 的深度推理之王

Claude Code 從 $20/mo Pro 到 $200/mo Max 20x,額度以 5 小時滾動視窗計算並疊加週上限,Claude 網頁/桌面/終端共用同一個池子。額度用完可選擇改走 API 費率的 usage credits 繼續做事,而不是硬停。

ai guide Agent CLI 選型指南

Cursor CLI 完整方案分析:從 IDE Agent 延伸到終端的全能選手

Cursor CLI 把 IDE 的 Agent 帶進終端,支援 interactive TUI 與 headless、Plan/Ask/Agent 三種模式、Cloud Handoff、CI/CD 整合。計費改為兩個獨立額度池:Cursor 自家模型(Grok 4.6/4.5、Composer 2.5)與第三方模型(Pro 含 $20、Pro+ $70、Ultra $400)。

ai guide Agent CLI 選型指南

Google 終端 Agent 方案分析:個人免費那條路已經沒了

Google 這條線的付費路徑對照:個人免費層與 Google AI Pro / Ultra 的 Gemini CLI 存取已於 2026/6/18 終止,個人只剩 Antigravity CLI 或自備付費 API key;企業授權與 Google Cloud 不受影響。零成本起步的選項已經換人。

ai guide Agent CLI 選型指南

Kiro (AWS) 完整方案分析:Spec-Driven 開發的 Agentic IDE

Kiro 分五層:Free 50 credits、Pro $20/1,000、Pro+ $40/2,000、Pro Max $100/5,000、Power $200/10,000,加購 credit 一律 $0.04。Auto 模式混合模型省成本(同一任務走 Sonnet 要 1.3 倍 credit),Spec-Driven 流程把 vibe coding 變成可追蹤的結構化開發。

ai guide Agent CLI 選型指南

OpenAI Codex 完整方案分析:ChatGPT 生態系的 Agent 整合

Codex 綁定 ChatGPT 訂閱(Free / Go $8 / Plus $20 / Pro 5x $100 / Pro 20x $200),2026/4/2 起計費改為按 token 計 credit。模型主線是 GPT-5.6 Sol / Terra / Luna;GPT-5.4 與 5.4 mini 將於 2026/8/31 在 ChatGPT 登入模式下退場。

OpenCode 完整方案分析:75+ 模型供應商的開源終端 Agent

OpenCode 是免費開源的 TypeScript CLI agent(MIT,約 198K GitHub stars),支援 75+ 模型供應商含本地 Ollama,可用 Copilot/ChatGPT 帳號認證,session 中途切換模型不丟上下文。另有桌面版與官方 Zen gateway。

ai guide Agent CLI 選型指南

Agent CLI 訂閱方案全比較:打造可自由切換的多模型使用模式

比較六大 Agent CLI 的訂閱方案(Claude Code、Cursor CLI、Codex、Kiro、Antigravity/Gemini CLI、OpenCode),並研究多模型路由模式——簡單任務給便宜模型、複雜任務給強模型。各家計費在 2026 上半年幾乎全部改過一輪,這一版是 8/18 重新查證的結果。

ai guide

2026 個人 AI 硬體選購指南:DGX Spark、Mac Studio、MSI AI Edge 全比較

比較 NVIDIA DGX Spark、Apple Mac Studio M4 Ultra、ASUS Ascent GX10、MSI AI Edge 等個人 AI 工作站,幫你找到適合的本地推論硬體。

ai guide Agent CLI 選型指南

Multi-Model Routing 開源工具與實作:讓對的模型做對的事

透過多模型路由,將 70% 的簡單任務導向便宜模型,只讓 10-15% 的複雜任務使用旗艦模型,實測節省 40-85% 推論成本。本文介紹五個主要開源工具的架構與實作。

ai guide Agent CLI 選型指南

Agent CLI 完整指南:設計邏輯、工具比較與使用原則

Agent CLI 不是更聰明的補全工具,而是能讀懂 codebase、執行多步驟任務、操作真實環境的 AI 代理。Claude Code、Codex CLI、Gemini CLI、OpenCode、Aider、Pi、Kiro、Amp、Cursor CLI... 工具越來越多,但底層共享一套設計邏輯——理解這套邏輯,才能真正用好它們。

ai guide

2026 年 15 個值得關注的 Agent 框架

按 GitHub Stars 排序,盤點 2026 年 15 個主流 AI Agent 框架的定位、特色與適用場景。不是排名,是地圖。

ai guide

一句話發一篇 IG 輪播 — 從手動 3 小時到全自動的 Pipeline 實作教學

用 Claude Code 當 orchestrator,串接 Playwright 截圖、catbox.moe 圖床、Meta Graph API 發布、Telegram 通知,一句話完成 IG 輪播圖文的生成與發布。

ai guide

llama.cpp — 從純 C++ 到消費級硬體上的 LLM 推論引擎

llama.cpp 是目前最廣泛使用的本地 LLM 推論引擎,用純 C/C++ 實作,支援 CPU、Metal、CUDA、Vulkan 等多後端,搭配 GGUF 量化格式讓消費級硬體能跑數十億參數的模型。

ai guide

TurboQuant+ — 用兩階段量化把 KV Cache 壓到 2-bit,讓 MacBook 跑 100B 模型

TurboQuant+ 是 Google Research ICLR 2026 論文的開源實作,用 PolarQuant + QJL 兩階段量化壓縮 KV cache 達 3.8-6.4x,讓消費級硬體跑更大模型和更長上下文。

ai guide

能在手機上跑的小模型:2026 年的選擇與限制

2026 年行動端 LLM 主力是 Gemma 3n、Qwen 3.5 Small、Llama 3.2、Phi-4-mini、Ministral 3 和 SmolLM3。3B 以下量化模型在 8GB RAM 手機上能跑到 30–50 tokens/sec,但 RAM、散熱和 context window 仍是硬限制。

ai project

2026 Q1 開源 LLM 全景圖:從前沿大模型到手機端,完整盤點

2026 Q1 開源模型全面爆發:LLM 方面 GLM-5、Kimi K2.5、Qwen3.5 追上閉源;Embedding 和 Reranker 由 Qwen3 和 BGE 主導;語音有 Voxtral TTS 和 Whisper V3;圖像有 FLUX.2;影片有 Wan 2.2 追平 Sora。這篇是完整導覽地圖。

ai guide AEO / GEO 與 AI 搜尋

AI-Ready Content:把網站變成 AI 可讀的資料來源,完整指南

2025–2026 年,網站不只要給人看,還要給 AI 看。從 llms.txt、Schema Markup、GEO 到 RAG ingestion pipeline,這篇整理了讓你的網站變成 AI 可用資料來源的完整技術地圖。

ai guide AI Agent 實戰

Harness Engineering 進階模式:Tool Registry、Guard System 與 Checkpoint-Resume

Harness 不只是呼叫 LLM 的 wrapper。Tool Registry 管理工具的動態載入與選擇、Guard System 建立四層防護網、Checkpoint-Resume 讓長時間任務可以中斷恢復。這三個模式是生產級 Agent 系統的關鍵基礎設施。

ai guide

Skill vs Subagent:Claude Code 兩種 Agent 協作模式比較

Skill 是你手動呼叫的 prompt 模板,Subagent 是 Claude 自動 routing 的獨立 agent。看起來很像,但觸發方式、工具隔離、context 管理完全不同。

ai guide

Ticketing 已死,Review 才是新的 Planning

當 AI agent 能在幾分鐘內把 intent 變成 PR,軟體工程的瓶頸就從「規劃該做什麼」翻轉成「評估做出來的東西對不對」。Ticketing 時代的產物(sprint、story point、backlog grooming)正在壓縮歸零,取而代之的核心實踐是 review。

ai guide AI Agent 實戰

Anthropic 的 Harness Design:讓 AI Agent 像工程師一樣工作

同一個模型在不同的 harness 設計下會產生截然不同的結果。Anthropic 用雙 Agent 架構、跨 session 狀態檔、GAN 式 generator-evaluator 迴圈,讓 Claude 能自主完成數小時的軟體開發任務。

ai guide

Google 的八種 Multi-Agent 設計模式

Google 整理了八種 multi-agent 設計模式:從最簡單的 Sequential Pipeline 到可組合的 Composite Pattern。不是越複雜越好——選對模式比堆 agent 重要。

ai guide AI Agent 實戰

從 Prompt 到 Harness:AI 工程的三次演化

AI 工程經歷三個階段:Prompt Engineering(寫好指令)→ Context Engineering(餵對資訊)→ Harness Engineering(設計整個工作環境)。每一次演化不是取代前者,而是在更高的抽象層級上操作。

OpenClaw Agent Loop:序列化、寫入者宣告,與那個防止舊回合覆寫逐字稿的柵欄

Agent loop 是每個 session 序列化的執行。最值得學的是它處理並行的方式:每個被接受的回合會記下 activeWriterRunId 宣告,之後每次逐字稿寫入都要附上 expectedWriterRunId,在交易裡比對——被取代的回合因此無法提交過期資料。

OpenClaw Agent Runtime:系統 prompt 是組出來的,而它被一條快取邊界切成兩半

OpenClaw 每次執行都自己組系統 prompt,沒有執行期的預設 prompt。組出來的內容被一條內部快取邊界切開——穩定的 workspace 前綴在上面、每輪會變的頻道脈絡在下面——好讓有前綴快取的後端能跨頻道重用同一段前綴。

ai guide OpenClaw 文件導讀

OpenClaw 存取控制:SecretRef 不是程序隔離,以及它到底解決了什麼

SecretRef 讓憑證不必以明文躺在設定檔裡,模型呼叫鏈上看到的是 process-local 的哨兵值。但官方講得很白:這不是程序隔離——真正的值仍在同一個程序的記憶體裡,而且 agent 讀得到的任何明文檔案都繞過了這層保護。

ai guide OpenClaw 文件導讀

OpenClaw 自動化(一):六種機制怎麼選,以及「排程要準」與「順便看一下」是兩件事

Cron 已經改名為 Automations(openclaw cron 仍是別名),而自動化現在有六種機制。核心的取捨只有一條:Automations 給你精確時間與隔離執行,Heartbeat 給你完整的主 session 脈絡與大約每 30 分鐘一次的頻率。

ai guide OpenClaw 文件導讀

OpenClaw 自動化(二):Standing Orders 是授權書,Automations 是時鐘

Standing orders 給 agent 對某個「程式」的永久操作權限,寫在 AGENTS.md 裡、每個 session 自動注入。它定義的是「被授權做什麼」,時間點則交給 automations——兩者分工,而且 automation 的提示應該引用 standing order 而不是複製它。

ai guide OpenClaw 文件導讀

OpenClaw 企業頻道:Slack 的三種傳輸模式,與「內建」這欄已經不存在了

企業頻道全部改成 plugin 了,包含以前內建的 Slack 與 Google Chat。Slack 現在有三種傳輸模式——Socket Mode、HTTP Request URLs、Relay——而官方明說它們在功能上已經對等,要按部署形狀選,不是按功能選。

ai guide OpenClaw 文件導讀

OpenClaw 主力頻道:WhatsApp、Telegram、Discord 各自會卡在哪一步

三個頻道各有一個「不知道就會卡住」的點:WhatsApp 是 QR 登入沒辦法遠端做、Telegram 是 bot 預設開著 Privacy Mode 收不到群組訊息(改完還要把 bot 退出再加回去)、Discord 是 Message Content Intent 沒開就收不到伺服器訊息。

ai guide OpenClaw 文件導讀

OpenClaw 其他頻道:Signal、iMessage、LINE,以及讓兩個人的 agent 直接對話的 Reef

這批頻道裡最值得看的是 Reef——不同人的 OpenClaw agent 之間的端對端加密側頻道,訊息在你的機器上封裝、雙向都經過釘死模型的守衛審查,中繼站永遠讀不到內容。它是 bundled plugin,不用另外裝。

ai guide OpenClaw 文件導讀

OpenClaw 頻道總覽:31 個頻道幾乎都是 plugin,以及「誰能觸發」與「模型看得到什麼」是兩回事

OpenClaw 支援 31 個聊天頻道,但只有 WebChat 在核心裡——連 Slack 和 WhatsApp 都是要裝的 plugin。而群組安全其實有兩個獨立的軸:allowlist 管的是誰能觸發 agent,不管模型會看到哪些引用與歷史,後者要另外設 contextVisibility。

ai guide OpenClaw 文件導讀

OpenClaw Gateway 篇(一):嚴格驗證會讓它拒絕啟動,以及那些擋住你自己的保護

OpenClaw 的設定驗證是嚴格的——多一個不認識的鍵、型別不對、值無效,Gateway 就拒絕啟動。它會保留最後已知良好的設定,但啟動與熱重載都不會自動還原,只有 doctor --fix 會。

ai guide OpenClaw 文件導讀

OpenClaw Gateway 篇(二):綁定、認證與那份憑證優先權契約

Gateway 預設只綁 loopback,而綁到 loopback 以外一律要求認證——這是它自己會擋的,不是建議。容器裡的有效預設是 auto,但 Tailscale serve/funnel 啟用時會強制回 loopback。

ai guide OpenClaw 文件導讀

OpenClaw 安裝指南(下):雲端部署的四個決定,與 K8s 上的實際坑

雲端部署 OpenClaw 要決定的其實只有四件事:Gateway 綁哪裡、state 放哪裡、誰能連進來、壞了怎麼復原。平台選擇是最不重要的一項。

ai guide OpenClaw 文件導讀

OpenClaw 安裝指南(上):六種本機安裝方式怎麼選,以及會卡住的地方

OpenClaw 有六種本機安裝方式,差別不在指令而在你要不要可重現性、隔離、與自我更新。真正會卡住的是套件管理器的 lifecycle script 政策:npm 12 與 pnpm 全域安裝都預設擋掉 OpenClaw 的 build script。

ai guide OpenClaw 文件導讀

OpenClaw 模型進階:容錯的兩階段、冷卻的真實數字,與 Prompt Caching

OpenClaw 的容錯是兩階段:先在同一供應商內輪替 auth profile,再換模型。但真正決定行為的是「這個模型是誰選的」——你手動用 /model 選的模型是嚴格的,失敗就報錯,不會偷偷用別的模型回答你。

ai guide OpenClaw 文件導讀

OpenClaw 的模型需求與供應商生態:先搞懂 provider、model、runtime 是三件事

OpenClaw 對模型的硬需求是 tool use 加夠大的 context——onboarding 自動推薦本地模型的門檻是支援 tool 且 context 至少 16K。但更容易搞混的是 provider、model、agent runtime 其實是三層,`openai/*` 不等於走 Codex。

ai guide OpenClaw 文件導讀

OpenClaw 的 60 個供應商:分類地圖,與接本地模型真正會踩的坑

官方 provider 目錄現在有 60 個條目。接本地模型最常見的失敗是把 Ollama 的 base URL 寫成 /v1——那會破壞 tool calling,模型會把 tool JSON 當純文字吐出來。

ai guide OpenClaw 文件導讀

OpenClaw 多 Agent:一個 agent 是一整個人格邊界,而 agent 現在可以要求生出 agent

一個 agent 是完整的人格範圍——workspace、auth profile、模型登錄、session 儲存全部獨立。但隔離不是絕對的:次要 agent 的 OAuth 憑證過期時,OpenClaw 會回頭讀主 agent 的同名 profile,而 workspace 只是預設工作目錄,不是硬性沙箱。

OpenClaw Nodes 深入:核准綁的是計畫,不是你之後改過的指令

遠端 node 執行最值得看的是核准的綁定方式:exec 在核准前先備好一份標準化的 systemRunPlan,核准之後 gateway 轉發的是那份存起來的計畫,不是任何之後被呼叫端改過的指令、cwd 或 session 欄位——而且執行前會重新驗證工作目錄。

ai guide OpenClaw 文件導讀

OpenClaw 文件導讀:200+ 份文件,從哪讀起?

OpenClaw 有 200+ 份文件,這篇幫你搞懂全貌、知道每塊在講什麼、依你的角色決定從哪讀起。

OpenClaw 參考篇:Pi 已經被吸收掉了——內建 runtime 現在就叫 openclaw

「OpenClaw 是 Pi 的 Gateway 殼」這個說法已經過期。官方文件現在寫的是:內建 runtime id 是 openclaw,而 pi 是會被正規化掉的 legacy 別名,「已經沒有外部 agent 框架套件」。留下的第三方 pi 相關依賴只剩一個終端機元件工具包。

ai guide OpenClaw 文件導讀

OpenClaw 桌面平台:Windows 現在有原生 Hub,而 Node 是硬性需求

Node 是必要的執行期,因為標準狀態儲存用 node:sqlite——Bun 只能拿來裝依賴。Windows 這邊變化最大:新增了原生的 Windows Hub companion app,不需要管理員權限,還能自己開一個 app 專屬的 WSL 發行版來裝 Gateway。

ai guide OpenClaw 文件導讀

OpenClaw 行動平台:手機是周邊,不是 Gateway——連 Apple Watch 都有自己的傳輸

iOS 與 Android 的 app 是 node,不是 Gateway:它們不跑 Gateway 服務,Telegram 或 WhatsApp 的訊息也是落在 Gateway 上而不是手機上。Apple Watch 比較特別——因為 watchOS 擋掉一般 app 的低階網路,它改用簽章過的 HTTPS 輪詢。

ai guide OpenClaw 文件導讀

OpenClaw Plugin 系統:把安裝當成執行程式碼,以及冷檢查證明不了執行期

官方對安裝 plugin 的定調是「把它當成執行程式碼」——ClawHub 與內建目錄是受信任來源,任意的 npm、git、本地路徑在非互動安裝時需要 --force。而驗證要用 inspect --runtime,因為不帶旗標的 inspect 只是冷的 manifest 檢查。

ai guide OpenClaw 文件導讀

OpenClaw 沙箱機制:四種後端、三個獨立開關,與「以為在沙箱裡其實沒有」

沙箱由三個獨立設定決定:mode(何時套用)、scope(開幾個容器)、backend(在哪執行)。最容易出事的是預期落差——`tools.exec.host` 現在預設是 auto,所以「沒設就等於在沙箱裡」已經不成立,安全稽核有一條專門抓這個。

ai guide OpenClaw 文件導讀

OpenClaw 的 Session 與記憶:一條滾動的主對話,加上四個會被寫進磁碟的檔案

預設下所有 DM 匯進同一條「主 session」,群組活動與背景工作都往那裡回報。記憶則完全是磁碟上的 Markdown——模型只記得被寫下來的東西,沒有隱藏狀態。但如果不只你一個人能私訊它,DM 隔離是必須主動打開的。

OpenClaw 的威脅模型:先講清楚它「不保護什麼」

OpenClaw 的安全文件現在開宗明義寫著:這是個人助理的信任模型,一個 Gateway 對應一個受信任的操作者。它明確「不是」多個互相敵對的使用者共用一個 agent 時的安全邊界——而且有一份『依設計不算漏洞』的清單把這件事寫死。

ai guide OpenClaw 文件導讀

OpenClaw 工具篇(一):一個專屬瀏覽器、三種附著方式,與被標成「不可信」的搜尋結果

OpenClaw 的瀏覽器是一個獨立的 agent 專用 profile,跟你的個人瀏覽器完全隔離。而 web_search 的回傳結構裡有一個 externalContent.untrusted 標記——搜尋結果在型別層就被標成不可信的外部內容。

ai guide OpenClaw 文件導讀

OpenClaw 工具篇(三):關掉檔案工具不會讓 exec 變成唯讀

exec 是一個會改變狀態的 shell 面:關掉 write、edit、apply_patch 這些檔案工具,完全不會讓它變成唯讀。而沙箱預設是關的,所以 host=auto 實際上會解析到 gateway——真的要沙箱就明確寫,它至少會 fail closed。

ai guide OpenClaw 文件導讀

OpenClaw 工具篇(二):Skills 的六層優先順序,與子 agent 不給訊息工具的理由

Skills 從六個來源載入、同名時高優先者勝,而 per-agent 的清單是取代不是合併。子 agent 預設拿不到 session 與訊息工具——它回傳純文字給父 agent,人看得到的回覆權留在父 agent 手上。

ai guide OpenClaw 文件導讀

OpenClaw 工具篇(四):當工具多到塞不進 prompt——Code Mode、Tool Search 與 MCP

工具目錄大到塞不進 prompt 時,OpenClaw 有兩個答案:Code Mode 只讓模型看到 exec 與 wait,由它寫小程式去搜尋與呼叫隱藏的目錄;Tool Search 則保留結構化的搜尋/描述/呼叫控制。兩者都不繞過工具政策。

ai guide OpenClaw 文件導讀

OpenClaw 維運篇:前 60 秒的七行指令,與「感覺變笨了」通常不是模型的錯

官方的分診流程是七行指令跑一遍、兩分鐘出診斷。而「assistant 感覺受限、工具不見了」這個最常見的症狀,多半是工具 profile——minimal 只允許 session_status,coding 才是新本地設定的預設。

ai guide OpenClaw 文件導讀

OpenClaw UI:新增的側欄可以問「這個 session 在幹嘛」而不打斷它

Control UI 加了一條 session rail:它用 utility model 產生執行摘要,還附一個唯讀的伴讀 thread,讓你問「這個 session 現在怎樣」而不會進入或打斷主 agent 執行。它的內容不會進入 chat.history。

ai guide

Phil Schmid:為什麼 Agent Harness 是 2026 年最重要的事

模型是 CPU,harness 是作業系統,agent 是應用程式。模型能力再強,沒有好的 harness 就只是 demo。Phil Schmid 認為 harness 是 2026 年 AI 工程最關鍵的基礎設施。

ai guide

LangGraph:用圖結構管理 Agent 工作流程

LangGraph 把 LLM 工作流程建模成有向圖,解決多輪迭代、條件分支、平行執行這些用線性 pipeline 做很痛的問題。

ai guide

Langfuse 完整指南:LLM 應用的可觀測性從零開始

Langfuse 是目前最成熟的開源 LLM Observability 平台。這篇從 Tracing、Prompt 管理、評估、Dataset 四個核心功能切入,帶你搞清楚它在實際專案中怎麼用。

ai guide AI Agent 實戰

Context Engineering:為什麼你的 AI Agent 問題出在資訊,不在模型

Context Engineering 是 2025 年取代 Prompt Engineering 的核心概念:重點不再是「怎麼問」,而是「給什麼資訊」。把對的資訊在對的時機送進 context window,比換更強的模型更有效。這篇整理了定義、四大策略、實作技巧和常見失敗模式。

ai guide

MCP(Model Context Protocol):AI Agent 工具呼叫的標準化協定

每個 AI 工具都有自己的呼叫格式,整合成本高。MCP(Model Context Protocol)是 Anthropic 提出的開放標準,統一 AI Agent 與外部工具、資料源的通訊協定,讓工具可以跨 Agent 重用。

ai guide

Agent Memory 系統:從 RAG 到 Read-Write 記憶的演化

RAG 是唯讀的。Agent Memory 讓 AI 不只能讀,還能寫入和持久化資訊。三種記憶類型:Procedural(行為模式)、Episodic(時間事件)、Semantic(事實知識),構成完整的認知記憶系統。

ai deep-dive

AI Agent 架構模式完整指南:從三支柱到 Multi-Agent 的系統化導航

AI Agent 不是一個技術,是一整個架構體系。本文是系統化導航:從 Agent 三支柱(Context/Cognition/Action)出發,穿過 AI 工程三階段演化(Prompt → Context → Harness),到八種 Multi-Agent 設計模式和生產級 Harness 基礎設施。每個主題都有對應專文深入。

ai guide

AI Agent 的三個核心支柱:Context、Cognition、Action

AI Agent 不是黑盒子——它由三層構成:知道什麼(Context)、怎麼想(Cognition)、能做什麼(Action)。搞清楚這三層,才能理解 agent 為什麼有時聰明、有時失控,以及怎麼設計一個真正好用的 agent 系統。

ai guide RAG 技法大全

Multi-Agent RAG:多個專業 Agent 協作的分散式檢索架構

單一 RAG Agent 處理所有查詢會遇到知識邊界和效能瓶頸。Multi-Agent RAG 把檢索任務分派給多個專業化 Agent,每個 Agent 有自己的知識庫和檢索策略,由中央 Orchestrator 協調合併結果。

ai guide RAG 技法大全

LongRAG:用長上下文模型重新思考 RAG 的 Chunking 策略

傳統 RAG 把文件切成小 chunks 再檢索,但這造成資訊碎片化。LongRAG 利用 100K+ token 的長上下文模型,檢索更大的文件區段(整個章節甚至整份文件),減少碎片化同時保持檢索效率。

ai guide RAG 技法大全

Speculative RAG:用小模型平行打草稿,大模型一次驗證

Speculative RAG 用小型專家模型從不同文件子集平行生成多個答案草稿,再由大型模型一次驗證選出最佳答案。論文在 PubHealth 上準確度提升 12.97 個百分點、延遲降低 50.83%——但這是最好的那一格,其他 benchmark 的幅度小很多。

ai guide

Ollama 完整指南:一行指令在本地跑 LLM

Ollama 把 llama.cpp 包裝成 Docker 風格的 CLI + REST API,一行指令就能在本地跑 LLM。這篇從核心概念、安裝、API、硬體需求到 Modelfile 自訂,完整介紹這個工具適合什麼、不適合什麼。

ai guide RAG 技法大全

RAG 系統模式完整指南:從 Naive 到 Multi-Agent 的十代演化與實戰導航

RAG 已經從簡單的「搜尋+生成」演化成涵蓋十個世代的技術體系,2025 年後更進入 Agentic/Reasoning RAG 新階段。本文是系統化導航:從 Naive RAG 到 Multi-Agent/LongRAG 的十代演化、後十代 Agentic Era(Search-R1/RL 搜索、MCP 協議、GraphRAG 3.x、視覺直嵌)、檢索策略、Chunking、Embedding、Reranking、評估框架、可觀測性、成本優化。每個主題都有對應專文深入。

ai guide 自架推論服務

vLLM — 從 PagedAttention 到生產級 LLM 推論引擎

vLLM 用 PagedAttention 解決 KV cache 記憶體浪費問題,搭配 continuous batching 和 prefix caching,成為目前最主流的開源 LLM 推論引擎。

ai guide

聊天機器人開發完整指南:狀態管理、記憶策略與tech stack選型

聊天機器人不只是接 API。對話狀態管理、記憶機制、Streaming、Guardrails、可觀測性、tech stack選型,每一層都影響使用者體驗。

ai guide

Prompt Engineering 實戰:迭代方法論、常見錯誤與 Few-shot 最佳化

好的 Prompt 不是一次寫出來的,而是迭代出來的。從最簡單的 prompt 開始,用真實 case 測試,分類錯誤類型,針對性修改。本文涵蓋 System Prompt 三段式結構、推理框架選擇、Few-shot 最佳化、Token 預算管理和六個常見錯誤。

ai guide RAG 技法大全

Agentic RAG:讓 LLM 自己決定要不要再搜尋一次

複雜多跳問題,RAG 一次搜尋不夠。Agentic RAG 讓 LLM 評估結果是否充分,不夠就改寫查詢再搜一次,形成 ReAct 迴圈。

ai guide RAG 技法大全

BGE-M3:為什麼這個 Embedding 模型適合繁體中文 RAG

Embedding 模型的選擇直接影響 RAG 的搜尋品質。BGE-M3 的多語言訓練、1024 維向量、同系列 Reranker,是繁中 RAG 的實用選擇。

ai guide RAG 技法大全

Chunking 策略:切塊方式決定 RAG 能不能找到答案

切太大找不準,切太小失去上下文,碰到表格更是全軍覆沒。Chunking 是 RAG 最被低估的環節,策略選錯,後面再多優化都是白費。

ai guide RAG 技法大全

ColBERT:向量搜尋的第三條路

Bi-Encoder 太粗糙,Cross-Encoder 太慢,ColBERT 的 Late Interaction 在兩者之間找到平衡:token 級別的相互比較,但可以預先計算文件向量。

ai guide RAG 技法大全

Contextual Retrieval:幫每個 Chunk 加上「這段在說什麼」

文件切塊後,每個 chunk 失去了它在原文件中的上下文。Contextual Retrieval 在索引時,用整份文件為每個 chunk 各自生成一段上下文再前綴進去,解決 chunk 孤島問題。

ai guide RAG 技法大全

CRAG:檢索失敗時,自動放寬條件重試

過濾條件太嚴格導致零結果?CRAG 自動放寬過濾條件重試,比讓 LLM 用通用知識瞎猜好多了。

ai guide RAG 技法大全

Cross-Encoder Reranking:讓最相關的文件排到前面

向量搜尋的相似度分數不等於相關性,Cross-Encoder 用成對比較重新排序,把真正相關的文件推上來。

ai guide RAG 技法大全

GraphRAG:把知識做成圖,讓 LLM 沿著關係推理

向量搜尋找相似,圖搜尋走關係。當問題需要跨多個實體的推理(岩場→路線→完攀者→難度分布),GraphRAG 比標準 RAG 更有優勢。

ai guide RAG 技法大全

Hybrid Search:用 BM25 + 向量搜尋彌補彼此的盲區

向量搜尋抓語義,BM25 抓關鍵字,兩者用 RRF 融合才能同時照顧模糊查詢和精確術語。

ai guide RAG 技法大全

HyDE:用假設答案提升向量搜尋的 Recall

用 LLM 先生成一份「理想答案」,再把這份假設文件 embed 去搜尋,比直接搜尋查詢本身效果更好。

ai guide RAG 技法大全

RAG 個性化:從對話中學習使用者偏好

每次對話後,異步提取使用者可能的偏好和程度,下次查詢時自動個性化搜尋條件,不需要使用者手動設定。

ai guide RAG 技法大全

MMR + 熱門度加權:讓推薦結果既相關又多樣

只看相關性會讓結果都是同一條路線的不同描述,MMR 在相關性和多樣性之間取平衡,再疊加熱門度讓結果更實用。

ai deep-dive RAG 技法大全

Modular RAG Pipeline:把 RAG 設計成可組合的 DAG

RAG 不是固定的三步流程,而是一組可以動態啟用、跳過、重排的步驟。Pipeline as Code 讓系統在不重新部署的情況下調整行為。

ai guide RAG 技法大全

Multi-Query Expansion:一個問題,多個角度搜尋

複雜查詢只用一個向量搜尋容易漏掉相關文件,讓 LLM 改寫成 3-5 個子查詢並行搜尋,召回率顯著提升。

ai guide RAG 技法大全

Multimodal RAG:把圖片也納入知識庫

攀岩路線有大量圖片資訊(路線圖、岩壁照片),純文字 RAG 遺漏了這些。Multimodal RAG 讓圖片也能被搜尋和理解。

ai deep-dive RAG 技法大全

RAG 的三個世代:從 Naive 到 Modular

Naive RAG 夠用但有很多問題,Advanced RAG 針對性修補,Modular RAG 重新架構讓系統可組合、可配置。了解三個世代,才能理解現代 RAG 系統為什麼長這樣。

ai guide RAG 技法大全

Plan-and-Execute:先規劃再執行的 RAG 模式

對複雜問題,先讓 LLM 規劃出需要哪些資訊、分幾步取得,再按計畫執行,比邊搜邊想更系統化。

ai guide RAG 技法大全

Query Classification:讓 RAG 知道該怎麼回答這個問題

不是所有問題都需要 RAG。用 LLM 先分類查詢類型,再決定執行路徑,節省成本又提升準確度。

ai guide RAG 技法大全

RAG A/B 測試:怎麼科學地比較兩個 Pipeline 配置

「加了 Cross-Encoder 之後感覺好多了」不是科學的評估。A/B 測試讓你知道改動是否真的有效,效果多大,在哪類查詢上有效。

ai guide RAG 技法大全

RAG 冷啟動:沒有資料時怎麼讓系統能用

RAG 系統需要資料才能回答問題,但一開始就沒有資料。冷啟動策略決定了系統從空到可用的路徑。

ai guide RAG 技法大全

RAG 成本優化:把每次查詢的花費壓到最低

RAG 系統的成本來自 LLM token、Embedding API、向量搜尋。每個環節都有可以壓成本的地方,但要確認優化沒有犧牲太多品質。

ai guide RAG 技法大全

RAG 評估框架與工具選型:Promptfoo、RAGAS、DeepEval、TruLens

RAG 評估沒有指定工具的業界標準;先把 retrieval、generation、operation 分開量,再依技術棧選 Promptfoo、RAGAS、DeepEval 或 TruLens。

ai debug RAG 技法大全

RAG 常見失敗模式:10 種問題和對應的解法

RAG 系統出問題,90% 的情況是這 10 種之一。先識別是哪種失敗模式,再找對應的解法,比盲目優化有效很多。

ai guide RAG 技法大全

RAG Guardrails:在輸入和輸出加一道防線

RAG 系統面對的攻擊不只是技術層面的,Prompt Injection 和 Jailbreak 是真實威脅。輸入輸出都需要獨立的防護層。

ai guide RAG 技法大全

RAG 可觀測性工具全景:2026 年的選擇

自己寫 trace 夠用,但開源工具讓你少做很多事。Langfuse、Phoenix、LangSmith 各有定位,選哪個取決於你對自架、開源、整合複雜度的取捨。

ai guide RAG 技法大全

RAG Observability:讓黑盒子變透明的逐節點追蹤

RAG 系統最難的不是建起來,是搞清楚為什麼這次回答不好。Pipeline Tracing 把每個步驟的決策和數據記下來,讓除錯有跡可循。

ai guide RAG 技法大全

RAG Prompt Engineering:System Prompt 和 Context 怎麼設計

搜尋找到了正確的文件,但 LLM 的回答還是不好——很多時候問題在 Prompt 設計。System prompt 結構、context 排版、指令語言都會影響輸出品質。

ai guide RAG 技法大全

RAG Streaming:SSE 讓 LLM 回答邊生成邊顯示

LLM 生成需要 3-5 秒,等全部生成完再顯示體驗很差。SSE 讓 token 一邊生成一邊推送,首個字元出現時間從 5 秒縮到 1 秒以內。

ai guide RAG 技法大全

RAG 配額系統:用雙重限制控制 LLM 成本

只限制請求次數不夠,一個超長的查詢可能消耗掉十個普通查詢的 token。雙重配額(請求數 + token 數)才能真正控制成本。

ai deep-dive RAG 技法大全

RAG vs Fine-tuning:不是非此即彼

RAG 和 Fine-tuning 解決的是不同問題。RAG 給模型新知識,Fine-tuning 改變模型的行為風格。大多數情況是兩者都用,而不是選一個。

ai guide RAG 技法大全

RRF:RAG 系統裡多路結果怎麼合併

BM25、向量搜尋、HyDE、Multi-Query 各出一份結果,怎麼合理地合成一份?RRF 用名次而不用分數,規避了跨系統分數無法比較的根本問題。

ai guide RAG 技法大全

Self-Reflection + LLM-as-Judge:讓 AI 評估自己的回答

用另一個 LLM 評估回答的準確度和品質,分數太低就重新生成,並自動加上適當的免責聲明。

ai guide RAG 技法大全

Semantic Caching:語義相近的問題只跑一次 RAG

快取不只能比對完全一樣的查詢,語義相近的問題也能命中快取,省下整個 RAG pipeline 的執行。

ai guide RAG 技法大全

SPLADE:比 BM25 更聰明的稀疏向量搜尋

BM25 只認識查詢裡出現的詞,SPLADE 能推斷相關詞彙並加入搜尋,在保持關鍵字搜尋精確性的同時獲得部分語義能力。

ai guide RAG 技法大全

Text-to-SQL Router:精確查詢不走 RAG

「我今年完攀幾條」這種問題,RAG 語義搜尋永遠不如直接查資料庫。讓 LLM 識別意圖、提取參數,執行預定義 SQL 模板。

ai guide RAG 技法大全

Vector Database 選型:Pinecone、Weaviate、Qdrant、Vectorize 怎麼選

向量資料庫的選型比 LLM 選型更受部署平台限制。先確認平台和規模需求,再看功能特性,不要只看 benchmark。