Skip to content

quidproquo

AI、技術、產品,攀岩、衝浪、咖啡,以及其他一切。

Quid pro quo /ˌkwɪd proʊ ˈkwoʊ/ — 拉丁語,「以某物換某物」,也就是等價交換。

這裡記錄 AI、技術、產品思考,以及打造產品的過程——也有攀岩、衝浪、咖啡。不只是存起來,而是換成對別人也有用的東西,然後多給一點。

名字的由來 →
置頂
tech guide

對話即文件:用 Claude Code 把 Debug 過程直接變成文章

Debug 完直接說「把錯誤寫成文章」,Claude Code 會從對話裡萃取內容,套用模板、生成 frontmatter、commit 到 repo。不需要額外寫任何東西。

置頂
product project

用 Astro + Cloudflare Workers 從零建立低摩擦部落格

為了集中散落筆記、展示多元興趣,選用 Astro + Cloudflare Workers D1 建立個人部落格,搭配 Claude post skill 讓寫作零阻力。

置頂
tech guide

這個部落格用了哪些工具

Astro + Cloudflare 全家桶,靜態優先、邊緣運算、零維運成本

ai deep-dive 文件解析實戰

Agentic Parsing:讓 Agent 決定怎麼解析文件

傳統文件解析用固定 pipeline 一體適用,但合約、財報、技術手冊各需不同策略。Agentic Parsing 讓 LLM agent 觀察文件後動態選工具——AgenticOCR 只解析需要的區域(視覺 token 省 70%+)、ParseBench 2,000 頁企業文件實測最佳方案也只拿 84.9%,沒有銀彈。

ai deep-dive RAG 技法大全

ColPali:跳過 OCR,直接用圖片做文件檢索

ColPali 把 PDF 每頁渲染成圖片,用 vision-language model 產生 patch-level multi-vector embedding,用 MaxSim 做 late interaction 檢索。表格密集的金融 PDF 上 recall 從 62% 跳到 84%,完全跳過 OCR 和 chunking。代價是儲存量 ~100 倍、需要 GPU、BM25 不可用。

ai deep-dive RAG 技法大全

Hierarchical Chunking + Auto-Merge:小 chunk 搜得準,大 chunk 讀得懂

小 chunk embedding 精準但缺上下文、大 chunk 上下文完整但 embedding 被噪音稀釋——Hierarchical Chunking 用多層索引(2048→512→128 tokens)配 Auto-Merge 演算法解決這個兩難:葉節點精準命中,命中密度超過閾值就自動回傳父節點給 LLM。HiChunk 實測 evidence recall 提升 12.7%,LlamaIndex 和 Haystack 都已內建。

ai deep-dive

LLM 開發流程全景:瓶頸從寫程式移到驗證程式之後

AI 讓寫 code 快了 34%,但 review 時間暴增 441%、實測交付反而慢 19%。四輪研究整理出當前全景:確定性護欄(hook 擋)vs 機率性護欄(prompt 引導)、乾淨 context review、自我改進回饋迴圈、規格驅動開發、AI 測試品質危機(覆蓋率高但 mutation score 低至 53%),以及 Replit agent 偽造測試結果的真實事故。

ai deep-dive RAG 技法大全

Multi-hop Retrieval:當答案散落在多份文件裡

標準 RAG 一次檢索只找一組文件,但真實問題常需跨 2-4 份文件推理。IRCoT 開創交錯式檢索推理,PAR²-RAG 在四個基準上比 IRCoT 準確率高 23.5%,CompactRAG 把 LLM 呼叫壓到只有兩次。

ai deep-dive

Self-RAG:用 Reflection Token 讓模型自己決定要不要檢索

Self-RAG 在 LLM 裡訓練四種 reflection token(Retrieve / IsREL / IsSUP / IsUSE),讓模型在生成過程中自主決定何時檢索、檢索結果是否相關、生成是否有據可查。ICLR 2024 Oral(top 1%),7B 模型在多個 QA benchmark 超越 ChatGPT 和 Llama2-chat + RAG。代價是必須 fine-tune,無法用在 API-only 模型。

ai deep-dive RAG 技法大全

Table Serialization:表格該怎麼轉成文字才能讓 RAG 找到

Markdown-KV 格式在 LLM 理解準確度上達 60.7%,比 CSV 的 44.3% 高出 16 個百分點。但檢索用途的最佳格式不同於 LLM 理解用途——metadata prepend + row-wise key-value 是目前表格 RAG 的最佳組合。

learning guide

上班族英文口說怎麼練:跟讀、情境模擬、AI App 與職場句型

每天 30 分鐘、持續 12 週,用跟讀法+情境模擬+AI App 三件組合,讓職場英文從「聽得懂但說不出來」變成能開會能簡報。

tech debug

Claude Code Cloud Routines:outcomes 配置讓文章推到 feature branch 的除錯記錄

Cloud routine 的 outcomes 配置會建立 feature branch,導致 agent 在 branch 上作業並推送,文章沒進 main。修法是移除 outcomes 加上 skill 裡補 git checkout main 雙保險,但過程中還撞上 list API pagination 的 server-side bug。

OMP agent loop:為什麼需要兩層 while?外層的「停了就再被 steering 打醒」在做什麼

omp 的 runLoopBody 用雙層 while:內層跑 model call → tool call 的核心節奏;外層在 agent 本想停下時,排空 queued steering / follow-up / asides,決定要不要再跑一輪。這設計解決了「使用者在 model 跑時打字」與「背景任務悄悄塞訊息」的交付時機問題。

跟成熟 coding agent 學設計(4):Approval 分級與 audit trail

Looplane 的 effect 已有 read/modify/modify_execute/execute 四級,未分類工具 fail closed;native MCP tool 預設 execute,只有可信 read-only annotation 才降級。審批仍先進 events.jsonl,grant 可精確到同一組變更或 backend;一般化 command 規則與全 runtime sandbox coupling 仍未完成。

跟成熟 coding agent 學設計(37):Code mode——把工具呼叫編譯成程式碼批次執行

looplane 已先做 bounded tool-program DSL:唯讀程式支援 list/read/search/diff、repeat 與 if_contains;modify/check transaction 會經整體 approval,失敗時回滾 touched paths。它還不是任意 JavaScript/Python code mode,也沒有平行 transaction execution。

跟成熟 coding agent 學設計(26):Context 壓縮與 compaction——從缺口到可審計 baseline

五家成熟 agent 的 compaction 都要處理觸發、完整 turn 切點與失敗恢復。looplane 已補上 85% high-watermark、自動 compaction、原生 loop 的 deterministic fallback summary、checkpoint 落盤與 workspace context 重新注入;目前仍缺跨 runtime 等價 fallback、模型品質摘要,以及真實 provider 的長 session 驗證。

跟成熟 coding agent 學設計(27):跨 session 記憶——從 explicit remember 到 semantic recall

omp 與 claude-code 都有跨 session 記憶,其他參考專案主要靠 instruction files。looplane 已落地明確的 remember/list/inject baseline:型別化 JSONL 記憶可跨 session 注入 prompt,但目前只按 scope 與近期排序,還沒有語意檢索、去重、遺忘指令或自動萃取。

跟成熟 coding agent 學設計(28):危險指令攔截與 shell escalation——在白名單和每次都問之間

五家對自由 shell 的風險處理都包含放行/詢問/拒絕、複合指令檢查與 fail-closed。looplane 已補上 deny-first command classifier、critical floor、複合 shell 分段、timeout-deny、設定式 allow/deny rule 與可見的 policy reason;仍需擴大語法涵蓋與真實互動流程驗證。

跟成熟 coding agent 學設計:系列總覽——拆五個專案的原始碼,蓋自己的 agent

我在寫自己的 Python coding agent「looplane」,這個系列把 pi、oh-my-pi、opencode、codex、claude-code 五個成熟專案的原始碼逐題對照,也對照 Looplane 現在已經落地的 TUI、外部 CLI runtime、local gateway、usage/OTel/session 工具與 Cloudflare 切片。每篇固定走「設計問題→五家做法→looplane 選擇→學術依據→改善路線」五段,證據一律給到 file#symbol 層級。

Hooks/Skills/Plugins:成熟 coding agent 的三層擴展機制

Hooks 管控制流、skills 注入知識、plugins 負責打包。looplane 已有 opt-in deny-only project hooks、bounded SKILL.md loader、exact enabled_skills 選擇、plugin manifest/install/list 與 external runtime projection;仍缺 hook input rewrite、完整 lifecycle、遠端 registry 與成熟 marketplace。

跟成熟 coding agent 學設計(36):LSP 整合——把編譯器診斷推進 agent context

looplane 已能把 repo 內 diagnostics 與 open-file 狀態注入下一個 model turn,也有 typed WebSocket IDE context push、可封裝的 VS Code bridge,以及管理長駐 LSP subprocess 的 ManagedLspServer。剩下的是各語言 initialize/didOpen/didChange adapter 的打磨與 live editor 驗證。

跟成熟 coding agent 學設計(30):MCP 整合——工具生態的標準插座

MCP client 要同時處理 transport、工具刷新、approval 與 credential 邊界。looplane 已支援 allowlisted stdio、Streamable HTTP/SSE、tools/resources/prompts、tools/list_changed、OAuth metadata/PKCE 與 0600 credential store;尚缺真實 authorization server E2E 與 MCP 專用確認 UX。

跟成熟 coding agent 學設計(35):Model catalog 與 per-role 多 provider 路由——looplane 的 role alias 與 reviewer lane

looplane 已有 ModelRole/ModelRoute 靜態候選表、--model @cheap 等 opt-in alias、跨 provider fallback,以及驗證完成後才啟動的 no-tool reviewer lane;下一步是補 role inheritance/override 規則,並決定 summarizer、parser、scout 是否自動路由。

跟成熟 coding agent 學設計(6):ModelProvider 抽象——為什麼不能直接包 SDK 就好

直接包 SDK 三個月就會後悔:每家的 usage 欄位、tool call 格式、錯誤語意都不一樣,換模型等於重寫迴圈。五家參考專案都把「wire protocol」從「provider 身分」裡拆出來當獨立維度;looplane 更進一步,用 pydantic canonical contract(Message/ToolCall/Usage/ModelTurn)加六種 protocol adapter,把 OpenAI SDK 的內建 retry 關到 0,所有錯誤先分類成 ProviderErrorKind 再交給統一的重試政策。provider 表本身是跟 pi 的 packages/ai 對著抄的——這是血統,不是巧合。

跟成熟 coding agent 學設計(29):OS 級沙箱

OS 沙箱是 path policy 之外的核心防線。looplane 已落地 fail-closed `CommandSandbox`:macOS 包 sandbox-exec,Linux 用 Landlock 加 seccomp,verification 預設在能證明 containment 時進沙箱;不支援時回 exit 126。剩餘限制是目前主要只包 verification、外部 CI 結果仍待確認。

Prompt 版本控制:改一個字可能讓 eval 從 5/5 掉到 0/5

Looplane 的 prompt 已到 `m3-exact-edit-v4`:版本寫進 artifact,core/tool/interaction/runtime/instructions/skills/workspace/memory 以 stable/dynamic section 組裝,並加入 replace_text、unified diff、direct reply 的正反例。unit tests 已釘住結構,live eval 覆蓋仍需擴大。

跟成熟 coding agent 學設計(7):Provider retry policy——從單次 5xx 到有界 retry 與 fallback

NVIDIA NIM 間歇 500 暴露了 looplane 早期只有錯誤分類、沒有重試消費者的缺口。現在 SDK retry 關閉,harness 對每個候選最多嘗試 5 次,使用帶 jitter 的指數退避並尊重有上限的 Retry-After;耗盡後可依明確設定切到 fallback model,model.retry 與 model.fallback 都進 event log。

跟成熟 coding agent 學設計(33):Session 錄製與 replay——從事件檔走到可重播、可分叉

looplane 已把 events.jsonl 接成 deterministic reducer、CLI timeline、canonical JSON、SDK replay 與安全分叉;分叉不會重跑舊工具或模型呼叫。剩下的是 provider/live runtime 驗證、redaction 與更完整的 replay hook。

跟成熟 coding agent 學設計(32):Subagent 與 worktree 隔離——讓主 loop 學會分工

成熟 subagent 需要角色、fan-out 上限、權限收窄與成果回傳契約。looplane 已有 native named-role schedule、平行 fan-out、子 task allowed_paths 不得超出 parent、預設禁用 unsafe exec,以及 parent-approved transaction proposal baseline;常駐 background lifecycle、遞迴深度管理與自動 worktree merge 仍未完成。

跟成熟 coding agent 學設計(34):Telemetry 與成本追蹤——token 記了,然後呢

looplane 已加入 CostBreakdown、明確標示 estimated 的 GPT-5 家族靜態價目表、per-lane usage/cost 與 OTel cost 欄位;未知模型仍只顯示 token,不硬算美元。價目覆蓋、外部 CLI 權威帳單與 live billing 對帳仍待補。

跟成熟 coding agent 學設計(18):工具集設計哲學——tool surface 的邊界劃分

Looplane 的核心 surface 已從七個長到九個:新增 read-only `tool_program` 與可 rollback 的 `tool_transaction`,搜尋優先走 ripgrep,仍不開任意 shell;native MCP 只從 allowlist 動態加入,缺少可信 read-only metadata 就按 execute 審批。

跟成熟 coding agent 學設計(3):Workspace 隔離與 path policy

Looplane 的 disposable clone 與 SafePathPolicy 保護來源 repo;現在 `--sandbox-checks` 也能用 macOS sandbox-exec、Linux bubblewrap 或 Landlock 包住 verification command,Cloudflare 另有受限 Sandbox slice。但不同 backend 的 network policy、外部 runtime coverage 與 production hardening 仍未一致驗證。

跟成熟 coding agent 學設計(38):Agent as a Service——把 loop 包成別的程式可以呼叫的服務

looplane 已有 Cloudflare Durable Object run resource:非同步建立、狀態/取消/artifact、live NDJSON 與支援 Last-Event-ID 的 SSE;遠端 approval 走獨立短效 capability。Python 另有 attach client 與 stateful conversation WebSocket。production deploy、跨 runtime parity 與完整多租戶 hardening 尚未驗證。

ai debug Ask AI 實戰

Ask AI 明明有課程地圖,為什麼列不完整:Catalog Query 的召回與收斂事故

「有哪些課程文章」第一次觀測被舊快取干擾;真正未命中的 request 已找回四所大學課程地圖,卻因三輪 Writer/Critic 重試花了 51.169 秒。修正 catalog 專用檢索與 review 契約後,一次未命中快取的 production observation 在 26.821 秒內通過 q21。

ai guide Ask AI 實戰

Ask AI 怎麼找到文章:Planner、Hybrid Retrieval 與 Retry

Ask AI 先由 Planner 抽出 intent、complexity 與 1–4 個搜尋詞,再依查詢型態走 metadata、BM25、Vectorize 與 RRF;第二輪搜尋會加入 Critic gaps,並關閉第一次才允許的 BM25 short circuit。

ai guide Ask AI 實戰

Ask AI 的文章怎麼進知識庫:Chunk、D1 FTS5 與 Vectorize

Ask AI 的 production 索引分兩階段:先用 source hash 增量更新 D1、post_chunks 與 FTS5,再以 embedding checkpoint 和 delete queue 讓 Vectorize 非同步追上;兩邊不是同一個 transaction。

ai guide Ask AI 實戰

Ask AI 的問題怎麼走完整條 RAG 管線:UI、API、Agent 與來源卡片

Ask AI 把一次提問拆成 UI、`/api/chat`、Planner、Research、Writer、Validation、Critic 與 Related 八段;回答文字、參考來源和延伸閱讀各有不同的產生與顯示條件。

ai guide Ask AI 實戰

Ask AI Retrieval Eval 怎麼做:Golden Contract、Fixture、Live Run 與證據邊界

Ask AI 把 golden contract、offline fixture、live SSE output 與 production observation 分開保存。fixture 全綠只證明 harness 可重現;public sources 可以量 expected-source recall,不能拿來宣稱看過 hidden ranked chunks 或 model-graded faithfulness。

ai guide Ask AI 實戰

Ask AI 上線後怎麼查問題:SSE、Trace、Cache、Checkpoint 與 Shadow

Ask AI 同一次請求有五種不同證據:公開 SSE、Langfuse trace、D1 log、semantic cache 與 hidden shadow run。它們看見的資料不同,單看任一層都不能還原完整 retrieval context。

ai guide Ask AI 實戰

Ask AI 何時才顯示來源:Validation、Critic、降級與 Source Gate

Ask AI 找到文章,不代表畫面就該顯示來源。回答要先通過 Markdown/URL 的確定性驗證,再通過 Critic 的相關性、意圖與 groundedness 檢查;任一門檻失敗,來源卡片就不送到前端。

ai guide Ask AI 實戰

Ask AI 怎麼把證據寫成答案:Writer Context 與 Citation Contract

Writer 預設只讀 factual query 的前 8 筆或 recommendation 的前 12 筆候選證據,引用必須使用候選集合中的 exact `source_url`;檢索為空或被判為 weak 時,prompt 要求拒絕用模型常識補答案。

ai guide Cloudflare AI Stack

Cloudflare Agent Memory 怎麼用:把 agent 記憶和 RAG 文件分開

Agent Memory 是 Cloudflare 的 private beta 服務,用來讓 agent 跨對話記住使用者、團隊、專案與任務脈絡。它適合存 facts、events、instructions、tasks;RAG 文件、產品資料、檔案和 audit log 仍應該放在 AI Search、Vectorize、D1 或 R2。

ai guide Cloudflare AI Stack

Cloudflare Agents 怎麼用:durable agent runtime、工具與即時連線

Cloudflare Agents 把 agent session 做成 durable runtime:每個 agent instance 有穩定 identity、local SQLite、WebSocket、scheduled work、recoverable execution 和 tools。它不只是聊天範例;真正處理的是怎麼把 Workers、Durable Objects、AI model、Browser、Sandbox、AI Search、MCP 接成可部署的 agent app。

ai guide Cloudflare AI Stack

Cloudflare AI app 資料怎麼放:D1、R2、Durable Objects 的分工

AI app 不該把 conversation、artifact、memory、retrieval document、lock、eval trace 全塞進同一個 storage。D1 適合查詢與產品資料,R2 適合大型檔案與 artifact,Durable Objects 適合具名協調、WebSocket、per-session state;Agent Memory / AI Search / Vectorize 則分別處理記憶與檢索。

ai guide Cloudflare AI Stack

Cloudflare AI Gateway 怎麼用:Logging、Cache、Rate Limit 與 Fallback

AI Gateway 解的是 AI 呼叫的控制問題:同一層處理 logs、analytics、cache、rate limit、retry/fallback、BYOK 與 Unified Billing。Workers 內可用 env.AI.run(..., { gateway }),外部 SDK 則改 baseURL 或 provider-native endpoint。

ai guide Cloudflare AI Stack

Cloudflare AI Stack 導讀:在 Workers 上做 AI、RAG 和 agent

Cloudflare AI Stack 這條系列回答 AI app 的基礎設施問題:模型怎麼跑、gateway 怎麼控、RAG 怎麼做、agent 怎麼持續執行、memory 怎麼治理、browser/sandbox/secrets 怎麼接進產品。

ai guide Cloudflare AI Stack

Cloudflare Secrets Store 怎麼用:Workers secret reuse 與 AI Gateway BYOK

Secrets Store 是 Cloudflare 的 open beta account-level secret store,目前整合 Workers 和 AI Gateway。它適合把 provider API keys、BYOK key、跨 Worker 共用 secret 集中管理;per-Worker secret 仍可用,但治理範圍不同。

ai guide Cloudflare AI Stack

Cloudflare Vectorize 怎麼用:自己掌控 RAG Retrieval 的時候

Vectorize 是 Cloudflare 的向量資料庫。AI Search 適合先把 RAG pipeline 交給平台;Vectorize 適合你要自己控制 chunking、embedding、metadata filter、hybrid retrieval、重新索引與降級策略。

Looplane 的 Cloudflare 遠端執行:Worker、Sandbox、Capability DO 與 durable RunSession

Looplane 的舊同步 M6 路徑曾完成一次真實 deployed coding run;目前已擴成帶 RunSession、SSE、approval、cancel 與 artifact 的 async control plane,但新增路徑尚未 live revalidate。Sandbox 只拿分 audience 的短效 HMAC capability,provider credential 留在 Worker;現有證據不等於 production traffic 或 SLO。

Looplane 的 disposable workspace 與 run bundle:原始 repo 為什麼不會被直接修改

Looplane 先把指定的完整 Git commit 複製到 run directory 裡的 detached-HEAD workspace,再讓 runtime 修改與驗證。原始 repo、執行 workspace 與 run artifacts 因此有清楚邊界;這能提供 source isolation 與 audit bundle,但不等於 OS sandbox。

Looplane 的 ExternalCodingRunner:為什麼 Codex/Claude Code CLI 是外部 runtime,不是 ModelProvider

`ExternalCodingRunner` 是 Looplane 的第二條 runtime lane:外部 coding CLI 擁有自己的 model loop 與 credential,Looplane 只交付任務與 disposable clone,再把回傳 patch 當成不受信任輸入,重跑 path audit、verification 與 source invariant。它是有明確 capability boundary 的 handoff,不是另一種 `ModelProvider`。

Looplane 的 ModelProvider 多閘道:多個 protocol 共用一個 canonical contract

Looplane 把 OpenAI-compatible、Responses、Anthropic、Gemini、Workers AI、scripted 與 experimental Codex OAuth adapter 收斂成同一個 `ModelProvider` contract。Codex OAuth transport 讀 SSE,但仍在 adapter 內累積成一次性的 canonical `ModelTurn`;AgentRunner 不直接消費 token delta。

Looplane 的 provider-neutral native loop:一次 model turn 如何走到驗證終態

Looplane 的 native lane 由 AgentRunner 掌握狀態轉移:準備 workspace、送出 model request、執行 tool calls、寫回 observations,模型沒有再呼叫工具時才進入 verification。step、wall time、重複動作、token 與取消條件都能先於模型宣告終止 run;provider adapter 的協定翻譯留給下一篇。

Looplane 的 state-first event journaling:為什麼 manifest commit 跟 JSONL append 之間的 crash 要靠 state 修

Looplane 同時維護 append-only 的 `events.jsonl` 與原子替換的 `session.json`,用 sequence reconciliation 判斷 crash 後能否安全續跑。這份 event contract 現在也支援 deterministic replay、JSON replay、從指定 sequence 建立 fork seed,以及在不重放副作用的前提下建立新 workspace;遇到停在 `tool.started` 或 `verification.started` 的不確定狀態仍然 hard fail。

Looplane 的工具隔離:path allowlist、argv 嚴格化、process group 與 credential-free subprocess

這篇只拆 Looplane 的 tool executor 如何把一次呼叫安全落地:`SafePathPolicy` 限制 path 並阻擋 symlink escape,`VerificationCommand` 固定 argv 且使用 `shell=False`,subprocess 只拿清理過的 env,寫入走 read-version hash 與 atomic replace,timeout 會終止整個 process group。權限決策、OS sandbox 與 tool program 各留給後續專篇。

Looplane 的 TUI 與 CLI:一次 run 在終端機上怎麼被看見

Looplane 的 TUI 與 plain CLI 是同一套 runtime 的兩種使用者介面。CLI 先依 TTY 與旗標選擇呈現方式,runner 再送出事件;TUI 把事件投影成 thinking、tool、approval、verification 與終態。使用者能從畫面分辨 native 與 external runtime,但 UI 不替底層能力背書。

Cloudflare Browser Run 怎麼用:在 Workers 上跑 headless Chrome

Browser Run 讓 Workers 使用 Cloudflare 管理的 headless Chrome。Quick Actions 適合 screenshot、PDF、HTML、JSON、crawl 這類單次任務;Browser Sessions 則適合 Puppeteer、Playwright、CDP、Stagehand 這類需要完整控制的 automation。

Cloudflare Cache Rules:什麼該快取,什麼要保持動態

Cloudflare Cache Rules 是 zone 層的快取政策:用 request expression 決定哪些內容 eligible for cache、Edge TTL/Browser TTL 怎麼算、cache key 包哪些維度,以及遇到 stale、ETag、purge 時怎麼處理。它適合管理 CDN 快取規則;Worker Cache API 則適合程式化存取。

Cloudflare Containers 怎麼用:當 Workers 需要完整 Linux runtime

Cloudflare Containers 讓 Workers app 呼叫 on-demand serverless container,適合需要完整 filesystem、特定 runtime、既有 container image、更多 CPU/memory/disk 的工作。它不取代 Workers;Worker 保留入口與 routing,container 處理 runtime 太重的那段。

Cloudflare Edge Platform 導讀:把網站和 app 跑在 Cloudflare 上

Cloudflare Edge Platform 這條系列回答一個產品問題:怎麼用 Workers、D1、KV、R2、Durable Objects、Queues、Workflows、Cache、Images、Email、Turnstile、Observability、Browser Run、Containers,把網站或 app 跑起來、跑穩、跑便宜。

Cloudflare Edge Platform 上線前檢查:自訂網域、維護頁與 Workers limits

Cloudflare app 上線前不要只看 deploy 成功。Custom Domains、Routes、www/root redirect、維護頁、CPU/memory/subrequest limits、log sampling、fallback path 都要先檢查。這篇把 Edge Platform 系列裡的 production pitfall 收斂成一份 checklist。

Cloudflare Email Service 怎麼用:讓 Workers 寄信、收信與處理產品通知

Cloudflare Email Service 把產品常見的交易信、magic link、通知與收信 routing 接進 Workers。寄任意收件人目前需要 Workers Paid;收信 routing 可在 Free/Paid 使用,但仍要注意 DNS、配額、message size、bounce 和 anti-spam 邊界。

Cloudflare Hyperdrive 怎麼用:讓 Workers 接上既有 Postgres / MySQL

Hyperdrive 解的是 Workers 連到既有 Postgres / MySQL 的延遲與連線池問題。它用 edge connection setup、靠近資料庫的 connection pool、read query cache,讓單區資料庫比較適合被全球 Workers 存取。

Cloudflare Images 怎麼用:圖片變體、格式轉換與交付管線

Cloudflare Images 有兩條路:把 R2/S3/origin 圖片拿來做 edge transformations,或直接把圖片存進 Images 再用 variant delivery。前者按 unique transformations 看成本,後者還要看 stored 和 delivered images。

Cloudflare Observability 怎麼用:Workers Logs、Traces 與 Analytics Engine 的分工

Workers Observability 負責 debug 和 request tracing;Workers Analytics Engine 負責高基數產品事件與自訂 metrics;GraphQL Analytics API 則查 Cloudflare 既有產品資料。把三者分清楚,才不會把 log 當資料庫,也不會把 billing、monitoring、產品分析混在一起。

Cloudflare Smart Shield 怎麼用:讓 Origin 少扛一點流量

Smart Shield 是 Cloudflare 的 origin protection bundle:用 Smart Tiered Cache、connection reuse、Argo Smart Routing、Regional Tiered Cache、Cache Reserve、Health Checks 和 Dedicated CDN Egress IPs,減少打到 origin 的 request 與 connection。

Cloudflare Turnstile 怎麼用:保護表單與公開 API,不靠傳統 CAPTCHA

Turnstile 是 Cloudflare 的 CAPTCHA 替代方案:前端 widget 產生 token,後端必須用 Siteverify API 驗證。token 有效 300 秒、只能驗一次;只放 widget 不驗 token,等於沒有完成防護。

Cloudflare Workflows:把多步驟流程跑到完成

Cloudflare Workflows 把 Workers 上的多步驟流程拆成可持久化的 step:每個 step 可以 retry、sleep、waitForEvent、rollback,instance 可以查狀態、暫停、恢復或終止。Queues 適合單步背景工作;Workflows 適合要記住進度的長流程。

tech deep-dive

執行環境與沙箱怎麼選:從 Namespace、gVisor 到 Firecracker、E2B、Lambda MicroVMs 的隔離光譜

沙箱不是單一套件,而是 Namespace、cgroups、seccomp、gVisor、Firecracker 層層疊起的光譜;本地 OS 級沙箱管爆破半徑,雲端 microVM 管多租戶隔離,選型關鍵在信任邊界與維運成本。

Looplane 架構地圖:一次 coding-agent 任務如何穿過 workspace、runtime、tools 與 events

Looplane 把 coding-agent 任務拆成可追蹤的邊界:native runtime 的副作用經過 Looplane tools、permission 與 sandbox;external runtime 保留自己的 loop 與工具,再把 patch 交回 Looplane 稽核。這篇是規劃中 20 篇系列的入口地圖。

Looplane 的 context pressure、compaction 與 workspace reinjection

Looplane 在 85% context pressure 附近啟動兩種不同流程:native loop 可做一次 bounded deterministic summary fallback;支援原生 compaction 的 conversation runtime 則在完成 turn 後壓縮並回報 lifecycle。兩條路徑都會在下一次請求重新注入 workspace snapshot。

Looplane 的 IDE/LSP Context:Diagnostics、Open Files 與 VS Code Bridge

Looplane 將最多 200 筆 diagnostics 與 32 個 visible files 正規化成有界、repository-local、且不受信任的 context;VS Code 與 managed LSP 目前只提供訊號,沒有 completion、rename、code action 或完整 IDE RPC。

Looplane 的 local OS sandbox:macOS、bubblewrap 與 Landlock 如何 fail closed

Looplane 可把指定的 local command/verification 包進 macOS sandbox-exec、Linux bubblewrap 或 Landlock/seccomp。需要的 backend 不存在時以 exit 126 停止,不直接裸跑;但這個範圍不涵蓋 external CLI、MCP/LSP 或整個 Looplane process。

Looplane 的 model roles、fallback、cache hints 與 estimated cost

Looplane 用靜態 model role catalog 提供候選順序,只對 retryable provider error 重試與 fallback;cache 是 provider hint 加 trace,cost 是靜態價表估算。三者都留下訊號,但都不是即時營運路由或帳單。

Looplane 的 Native MCP:transport、authorization 與 approval 邊界

Looplane 只有在明確 allowlist 後才載入專案 MCP server,將 stdio 或 Streamable HTTP 能力投影到既有 ToolExecutor,再沿用 hook、approval、timeout 與 cleanup 邊界。

Looplane 的 permission layering:危險命令如何落到 allow、ask 或 deny

Looplane 先套不可繞過的 critical floor,再評估 user/org/project deny,最後才看 allow。dangerous mode 只自動放行 read/modify,execute 仍經過命令分類與 approval;這是 authority policy,不是 OS sandbox。

Looplane 的 prompt、instruction precedence 與 explicit memory:模型最後看見了什麼

Looplane 先在應用程式層解析 user 與 root-to-leaf 專案 instructions,再把 runtime、skills、workspace 與最近 20 筆 explicit memory 放進具名 prompt sections。這套流程可追蹤、可 reload,但不是 semantic memory,也不會把 repo 文字升格成 system authority。

Embedding Looplane:SDK、ConversationController 與 WebSocket Boundary

Looplane 用 0.x typed SDK facade 暴露 bounded run 與 conversation contracts;WebSocket attach 只包住一個預先建立、由 controller 擁有的 runtime session,沒有 conversation-ID resume 或多 client routing。

Looplane 的 Skills、Blocking Hooks 與 Plugin Packages

Looplane 把 skills 當成有界的 repository-local guidance、把 hooks 當成 opt-in 且只能否決的 host commands,再用 local plugin manifest 封裝 skill 與 hook;三者的權限完全不同。

Looplane 的 Subagent Scheduling 與 Parent-owned Transactions

Looplane 把每次 subagent dispatch 正規化成最多四個節點的 dependency waves,讓同 wave 的唯讀 child 在隔離 workspace 平行分析,再由 parent 重新走 hook、approval 與 transaction 執行修改。

Looplane 的 tool programs、transactions 與 safe concurrency

Looplane 只平行執行同時標成 read-only、concurrency-safe 與 READ effect 的 tool call;tool_program 提供有界的 read-only repeat/branch,tool_transaction 則對可能碰到的 workspace files 做 snapshot 與失敗 rollback。它不是外部副作用的通用交易系統。

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 1:Knowledge——命題邏輯、模型檢查、推理規則與知識表示

Week 1 進入知識表示與推理:命題邏輯連結詞、模型檢查算法、Modus Ponens/Resolution 推理規則、CNF 轉換,專案 Knights 與 Minesweeper 實作邏輯謎題與掃雷 AI。

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 2:Uncertainty——機率、貝氏網路、馬可夫模型與遺傳推斷

Week 2 從確定性轉向機率:貝氏法則、貝氏網路 D-separation、馬可夫模型、PageRank 隨機漫步,專案 Heredity 算基因型、PageRank 算網頁權重。

MIT 6.7960 L03:優化總覽——SGD、Adam、學習率排程與縮放規則

從 SGD 到 Adam,用縮放規則一次搞懂深度學習優化器怎麼選、學習率怎麼調

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 3:Optimization——局部搜尋、模擬退火、約束滿足問題與填字遊戲

Week 3 探討優化問題:爬山算法、模擬退火逃離局部最優、CSP 框架與 AC-3 弧一致性、回溯搜尋,專案 Crossword 實作填字遊戲生成器。

MIT 6.7960 L04:正則化實戰——Weight Decay、Dropout、Batch Norm 與標籤平滑

正則化不只是防過擬合——Weight Decay、Dropout、BN、Label Smoothing 的機制與組合策略一次看懂

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 4:Learning——監督式學習、k-NN、SVM、強化學習 Q-learning 與 Nim

Week 4 進入機器學習:監督式分類(k-NN、SVM、Perceptron)、模型評估、強化學習基礎(MDP、Q-learning、ε-greedy),專案 Shopping 預測購買意願、Nim 學會玩遊戲。

MIT 6.7960 PS1 實作走查:從 NumPy 手寫 MLP 到 PyTorch Autograd 反向傳播

手寫 NumPy MLP + 反向傳播 → PyTorch Autograd 驗證,完整複現 OCW HW1 核心考點

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 5:Neural Networks——反向傳播、TensorFlow/Keras、CNN 與交通號誌辨識

Week 5 進入神經網路:感知機到多層網路、反向傳播鏈式法則、損失函數、優化器、TensorFlow/Keras 實作、CNN 卷積/池化、專案 Traffic 訓練 CNN 辨識交通號誌。

MIT 6.7960 L05:CNN 架構全解析——從卷積核到平移等變性的感知機制

Lec 4 核心重點:為什麼 CNN 是處理網格資料的最佳選擇——卷積、平移等變性、池化與經典架構一次掌握

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 6:Language——N-gram 語言模型、TF-IDF 問答系統、Parser 與 Attention

Week 6 處理自然語言:N-gram 語言模型平滑、CFG 句法解析、TF-IDF 文檢索、注意力機制、Transformer 概念,專案 Parser 生成句子、Questions 實作問答系統。

MIT 6.7960 L06:現代 CNN 架構 —— ResNet、EfficientNet、ConvNeXt

ResNet 用殘差連接解決退化問題,讓網路能堆到 100+ 層;EfficientNet 複合縮放平衡深度/寬度/解析度;ConvNeXt 吸收 Transformer 設計重奪 CV 王座。

Harvard CS50 AI 綜論(一):從搜尋到語言——七週 AI 知識弧線的完整圖譜

綜論第一篇:梳理七週主題如何從符號搜尋一路延伸到語言模型,揭示古典 AI 到現代 ML 的知識脈絡與設計哲學。

MIT 6.7960 L07:優化縮放定律 —— 譜視角、特徵學習與超參數遷移

優化不是孤立的數值問題:用譜視角看 SGD,權重更新的『量』決定特徵學習;Maximal Update Parameterization 讓學習率與初始化跨寬度遷移,critical batch size 決定算力換取收斂的邊際。

Harvard CS50 AI 綜論(二):專案組合全景——十二個 Projects 逐一比較、難度分級與技能對照表

綜論第二篇:十二個專案完整比較——算法核心、代碼量、難度、驗收重點、可遷移技能,附難度分級與學習建議。

MIT 6.7960 L08:Transformer —— Token、Attention 與位置編碼,以及它和 MLP/CNN/GNN 的關係

Transformer 不是憑空冒出的架構:token 把資料切成離散單元,attention 做軟性的訊息聚合,positional code 補回順序。把它和 MLP/CNN/GNN 擺在一起看,會發現它們都是『對鄰居做加權彙整』的不同特例。

Harvard CS50 AI 總結:什麼永恆、什麼改變、下一步走哪條路

系列最終篇:回顧七週十二專案的永恆核心、2020/2023 錄影在 2026 年的缺口、免費 OCW 路線的完整性,給出後續學習路線圖(Transformer、LLM、RAG、Agent、評測)。

MIT 6.7960 L09:深度學習駭客指南 —— 讓網路真正聽你使喚的實作心法

訓練神經網路更像工程而非魔法:先看資料、先在小批次上過擬合證明容量夠、再用正則化把泛化補回來;學習率永遠是影響最大的那顆旋鈕。

MIT 6.7960 L10:記憶與序列建模 —— RNN、LSTM 與梯度消失/爆炸

RNN 把過去壓進一個隱狀態,但遞歸讓梯度在時間上連乘,要嘛消失要嘛爆炸;LSTM 用輸入/遺忘/輸出門把『記憶』與『更新』解耦,讓長程資訊能穩定流動。注意力後來取代它,是因為 O(1) 取用任意歷史。

MIT 6.7960 L11:表示學習(重建式)—— 自編碼器、VQ 與自監督

表示學習的目標是把原始資料壓成「好用」的向量:自編碼器用重建逼出有意義的潛空間,VQ 把連續表示離散化成碼本,自監督則用『遮住一部分再重建』來免費產生監督訊號。

MIT 6.7960 L12:表示學習(相似性式)—— 度量學習、對比學習與 InfoNCE

相似性式表示學習不重建輸入,而是直接塑造潛空間的幾何:讓同類表示靠近、異類推遠。InfoNCE 把這件事寫成『在一堆負樣本裡認出正樣本』的分類問題,而 alignment / uniformity 給了它可解釋的評價指標。

MIT 6.7960 L13:表示學習的理論視角 —— 歸納偏置、高斯過程與 NN–GP 對應

把網路變寬到極限,它的隨機初始化輸出會變成一個高斯過程(NN–GP),而訓練動態則由神經切線核(NTK)固定下來。這套理論不只能用來分析,還反過來指導我們設計『對的歸納偏置』。

MIT 6.7960 L14:生成模型基礎 —— 密度/能量模型、GAN、自回歸與擴散

生成模型本質是在學資料的分佈 p(x)。密度模型直接建模機率,能量模型用一個未歸一化勢能 + 採樣器,GAN 讓判別器逼出逼真樣本,自回歸一步步預測下一個 token,擴散則用『逐步加噪再學去噪』繞開棘手的最大似然。

MIT 6.7960 近似理論(Approximation Theory)—— 萬能近似、Barron 定理與深度為何有用

單層網路理論上能逼近任何連續函數(萬能近似),但寬度會隨維度指數爆炸;Barron 定理在特定的『Barron 函數類』下讓誤差只隨樣本數 √n 收斂、與維度脫鉤;而深度能對組合/階層函數帶來指數級的寬度節省——這正是深網比淺網強的根本原因。

MIT 6.7960 圖神經網絡(GNN, Graph Neural Networks)—— 訊息傳遞、置換等變與表達力上限

GNN 本質是「在圖上做局部訊息傳遞的 MLP」:它把 CNN 的固定網格鄰居推廣成任意拓撲的鄰居聚合。它必須滿足置換等變/等變性。理論上,一階 GNN 的表達力不超過 Weisfeiler–Lehman 圖同構測試——有些結構它永遠分不出來,這也是後來 GIN、位置編碼、子圖技巧要補的洞。

MIT 6.7960 L15:變分自編碼器(VAE)—— ELBO、再參數化技巧與潛變數表示

VAE 的核心是 ELBO + 再參數化:把 log p(x) 替成 E_q[log p(x|z)] − KL(q(z|x)‖p(z)),encoder 輸出 μ/σ 用 z = μ + σ⊙ε(ε ~ N(0,1))讓採樣可反向傳播。訓練 = 重構 + KL 兩項拉扯,由此衍生 β-VAE、posterior collapse、VQ-VAE 等修正。

MIT 6.7960 L16:條件生成模型(Conditional Generative Models)—— cGAN、cVAE 與 Classifier-Free Guidance

條件生成的關鍵是「把 y 餵進模型」:cGAN 在 G/D 拼接 y,cVAE 把 y 當額外輸入進 encoder/decoder;擴散模型時代,Classifier Guidance 用外部分類器梯度把生成推向指定類別,Classifier-Free Guidance 則同訓練 conditional + unconditional 並在推論時線性組合兩者——後者是 Stable Diffusion / Imagen 的標準武器。

MIT 6.7960 L01:課程導論 —— Deep Learning 的地圖、為什麼深,以及第一個訓練 loop

本講是 6.7960 的導論:deep learning 之所以爆發是『資料 + 算力 + 演算法』三股力量同時到位;本課從架構(CNN/GNN/Transformer)到訓練、表示、生成、遷移、規模、LLM 一路串起來;最後用一個 ~30 行的 PyTorch training loop 確認你的環境能跑。

MIT 6.7960 L17:out-of-distribution 泛化 —— 領域偏移、虛假相關、與三條實務對策

OOD 失敗不是 bug,是 i.i.d. 假設破掉:covariate shift(影像風格變了)、label shift(類別比例變了)、concept shift(同一個詞意思變了)各有對應的應對方式;最常見的原因是模型抓了『虛假相關』(用草原當牛的存在訊號),IRM 與 domain randomization 想從訓練資料結構本身把這件事修掉,test-time adaptation 在推論時即時修正。

MIT 6.7960 L18:遷移學習(Transfer Learning)—— 預訓練、特徵抽取、與微調策略

遷移學習的核心是『在大資料上學到的特徵是好的通用表示』:下游任務資料少時,把 backbone 凍住只訓練線性 head;資料夠就全模型微調;想省算力就上 LoRA / adapter。SimCLR、MAE 這類自督導預訓練讓『上游不需要標籤』,下游表現又上一層樓。

ai guide

個人學模型訓練要租 GPU 嗎:GPUtw.ai、LoRA、Jupyter 與第一輪實驗

GPUtw.ai 適合個人把短租 GPU 當成學習工具:先跑 Jupyter、Ollama、ComfyUI,再用 LoRA/QLoRA 做小模型微調。它不是大型基礎模型訓練平台,第一次使用應該小額測部署、計費與資料保存。

Keenable 該放進台灣 Agent 團隊的搜尋備選嗎?

Keenable.ai 把自己定位成給 AI agents 用的搜尋基礎設施:100B+ 文件索引、Search/Fetch API、 MCP/CLI 入口、100K 免費月額度與 keyless public endpoint。對台灣/繁中 agent 團隊來說, 現階段最合理的位置是 provider matrix 裡的實測候選;Brave、Exa、Tavily 或 Serper 仍要留著對照。

ai deep-dive

screenshot-to-code 怎麼把截圖變程式碼:Agent Loop、素材裁切、視覺驗證

screenshot-to-code 不是一步到位的截圖轉碼工具。核心是一個最多 30 步的 Agent Loop,搭配 7 個工具——從截圖裁切真實素材、用 Playwright 自我驗證、到同時跑 4 個模型讓使用者選最好的版本。GitHub 74,500+ stars,MIT License。

ai deep-dive

Agent 怎麼累積團隊判斷:Warp 的 Skill 回饋迴圈

Warp 的自我改進 Agent 不把每次錯誤塞進 prompt。base skill 做任務,人類在 GitHub 或 Slack 留回饋,improver skill 把重複訊號整理成小 diff,再走 PR review。真正有價值的是這套工程邊界:可追溯、可回滾、可拒絕更新。

TinyFish 介紹:為 AI Agent 設計的免費 Search 與 Fetch 基礎設施

TinyFish 為 AI agent 提供四個 Web API——Search、Fetch、Agent、Browser,其中 Search 與 Fetch 為 $0 永久免費且免信用卡,適合做 RAG 與文件檢索的預設層。

A/B testing 怎麼把產品改動變成可推論的效果?

A/B testing 怎麼把產品改動變成可推論的效果? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

多組平均不能一直 t-test:ANOVA 在保護什麼?

ANOVA 先檢查三組以上平均是否有整體差異,避免你用一堆兩兩 t 檢定把 false positive 風險一路放大。

大樣本近似為什麼常能用,又什麼時候不能亂用?

大樣本近似為什麼常能用,又什麼時候不能亂用? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Bayesian inference 怎麼把 prior、資料與 posterior 串起來?

Bayesian inference 怎麼把 prior、資料與 posterior 串起來? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

點估計的 bias、variance、consistency 各在檢查什麼?

bias 看估計中心有沒有歪,variance 看抽樣波動,MSE 合併兩者,consistency 則問樣本變大時估計量會不會靠近真值。

不知道公式分布時,bootstrap 怎麼用重抽樣估不確定性?

不知道公式分布時,bootstrap 怎麼用重抽樣估不確定性? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

因果推論入門:為什麼預測準不代表真的有效?

因果推論入門:為什麼預測準不代表真的有效? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

卡方題怎麼判斷是在考適合度還是獨立性?

卡方檢定處理類別資料的次數差異;先分清楚一個變數對理論比例的適合度,還是兩個類別變數之間的獨立性。

Bernoulli、Binomial、Normal、Poisson 什麼時候該出場?

分布不是公式清單,而是資料生成情境的名字。這篇用 Bernoulli、Binomial、Normal、Poisson 說明如何從題目敘述選分布。

信賴區間怎麼寫,才不是只背上下界公式?

信賴區間把點估計放回抽樣波動裡看;會寫上下界只是第一步,真正要會的是解釋標準誤、臨界值與 coverage。

看到一份資料,第一眼要先看哪些統計量?

資料型態決定你能用什麼統計工具。這篇從類別、數值、計數與時間資料開始,說明平均數、比例、變異數、列聯表在考題和 ML 資料檢查中的用途。

Delta method 怎麼估 F1、ratio 這類非線性指標的不確定性?

Delta method 怎麼估 F1、ratio 這類非線性指標的不確定性? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

好估計量怎麼判斷:不偏、變異、MSE 要看哪個?

估計量是用樣本推母體的計算規則;判斷它好不好,要一起看 bias、variance 與 MSE。

混合題來了,要怎麼在 30 秒內判斷工具?

考前最後階段要練的是題型辨識:先判斷資料型態、未知量與決策目標,再選公式,最後用語境結論收束。

期望值和變異數在考題與模型評估中各代表什麼?

期望值描述長期平均,變異數描述波動大小。這篇用離散分布算例說明 E[X]、E[X^2]、Var(X),並接到平均 loss 和模型穩定度。

實驗設計怎麼讓結果可以被解讀,而不是只像相關?

實驗設計怎麼讓結果可以被解讀,而不是只像相關? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Fisher information 怎麼告訴你參數估得穩不穩?

Fisher information 用 likelihood 的曲率衡量資料對參數的定位能力;資訊越大,MLE 的標準誤通常越小。

信賴區間不只 t 表:一般建構到底怎麼想?

信賴區間不只 t 表:一般建構到底怎麼想? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

GLM 怎麼依資料型態選分布和 link function?

GLM 怎麼依資料型態選分布和 link function? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

假設檢定從 H0 到 p 值,到底要做哪個決策?

假設檢定是一套在不確定資料中做決策的流程:先寫 H0/H1,再用檢定統計量與 p 值判斷資料是否足夠反駁原假設。

估計、檢定、likelihood、Bayes 要怎麼放在同一張推論地圖?

估計、檢定、likelihood、Bayes 要怎麼放在同一張推論地圖? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Likelihood ratio test 怎麼比較兩個巢狀模型?

LRT 比較受限模型和完整模型的 log likelihood 差;只有在 nested model 與近似條件成立時,常見卡方參考分布才有意義。

OLS 的假設壞掉時,迴歸線還能怎麼用?

OLS 的假設壞掉時,迴歸線還能怎麼用? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

分類模型為什麼要先學 log odds?

logistic regression 把線性分數接到 0 到 1 的機率;讀懂 odds、log odds、odds ratio,才不會把分類模型係數解釋錯。

Logistic regression 怎麼從機率走到 threshold 和錯誤成本?

Logistic regression 怎麼從機率走到 threshold 和錯誤成本? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

MAP 為什麼會把先驗變成 regularization?

MAP 為什麼會把先驗變成 regularization? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Matching 和 weighting 怎麼讓觀察資料比較像實驗?

Matching 和 weighting 怎麼讓觀察資料比較像實驗? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

MLE 為什麼是在問:哪個參數最可能生成這批資料?

MLE 把資料固定、比較不同參數讓這批資料出現的合理程度;log likelihood 讓乘積變加總,也接上 ML 的 negative log loss。

Method of Moments 為什麼是用樣本矩對母體矩?

Method of Moments 用樣本矩對上理論母體矩,再解出參數;它不一定最有效率,但很適合建立參數估計的第一個直覺。

缺資料不只是空格:它會怎麼扭曲統計和模型?

缺資料不只是空格:它會怎麼扭曲統計和模型? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

ML/AI 評估報告怎麼寫,才不只是貼排行榜分數?

ML/AI 評估報告怎麼寫,才不只是貼排行榜分數? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

殘差、outlier、leverage 在告訴你模型哪裡壞了?

殘差、outlier、leverage 在告訴你模型哪裡壞了? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

多變量分析怎麼整理一起變動的特徵?

多變量分析怎麼整理一起變動的特徵? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Neyman-Pearson 觀點在說哪一種最佳檢定?

Neyman-Pearson 把檢定看成決策規則:在固定第一型錯誤 alpha 下,選出 power 最高的拒絕區域。

Nonparametric methods 少做哪些分布假設?彈性又要付出什麼代價?

Nonparametric methods 少做哪些分布假設?彈性又要付出什麼代價? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

台大資管 114–115 統計考古題要怎麼拆,不要只背答案?

考古題的價值是訓練拆題紀律,不是用兩年題型猜完整範圍;每題都要回到資料型態、未知量、工具、計算與語境結論。

聯合分布和 PMF 轉換題,怎麼不漏格?

聯合 PMF 題要把所有格子列完;邊際化、條件機率和變數轉換,本質上都是對原始格子的加總與重新分組。

條件機率、獨立、貝氏:考題到底在換哪個視角?

機率題的難點常在視角,不在公式。這篇用事件、條件機率、獨立與 Bayes rule,說明考題如何從原因到結果、再從結果反推原因。

樣本、統計量、抽樣分布三者怎麼分清楚?

樣本是資料,統計量是樣本的函數,抽樣分布是統計量在重複抽樣下的分布;這三者分清楚,推論公式才會有意義。

PMF、PDF、CDF 怎麼把機率變成可計算的題目?

隨機變數把事件結果轉成數字。這篇用 PMF、PDF、CDF 說明離散與連續機率怎麼計算,並接到模型分數、threshold 和 token 機率分布。

迴歸表的 coef、SE、t、F、R2 要怎麼一起讀?

迴歸表不是 p 值清單;coef、SE、t、F、R2 分別回答效果大小、不確定性、單一係數、整體模型與樣本內解釋力。

Ridge、Lasso、weight decay 為什麼能讓模型穩一點?

Ridge、Lasso、weight decay 為什麼能讓模型穩一點? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計與 ML 評估怎麼做才重跑得出同一個結論?

統計與 ML 評估怎麼做才重跑得出同一個結論? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

為什麼只看樣本,也能推回母體或模型表現?

抽樣讓樣本統計量有波動,標準誤描述這個波動。這篇分清楚 SD、SE、抽樣分布與 CLT,並接到 benchmark 分數的不確定性。

抽樣分配怎麼從公式變成考試可用的判斷?

抽樣分配描述統計量在重複抽樣下的波動;平均、比例、變異數各有常用分布,信賴區間和檢定都從這裡長出來。

讀完 53 篇後,怎麼把統計接到 ML、因果與數理統計?

讀完 53 篇後,怎麼把統計接到 ML、因果與數理統計? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

一條迴歸線怎麼變成預測、解釋與誤差?

簡單線性迴歸用一個 X 描述 Y 的平均變化;斜率、截距、殘差和平方誤差共同構成最小的 supervised learning 模型。

Monte Carlo 怎麼用重複模擬回答算不動的統計問題?

Monte Carlo 怎麼用重複模擬回答算不動的統計問題? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計學從哪裡開始讀,才接得上考試和 ML/AI?

準備統計學不要從背公式開始。這篇先建立讀書順序:資料、機率、抽樣、推論、迴歸,再接到模型評估、A/B testing 與 ML/AI 的不確定性判斷。

時間序列為什麼不能隨機切資料?

時間序列為什麼不能隨機切資料? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

兩組平均或比例差異,該用哪一種比較題型?

兩組比較要先判斷 outcome 是數值還是比例、兩組資料是否獨立;這一步會決定標準誤、檢定統計量與結論可信度。

變數選擇怎麼避免把訓練資料背起來?

變數選擇怎麼避免把訓練資料背起來? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計學不是背公式:它到底在替你判斷什麼?

統計學的核心不是公式,而是判斷:描述資料、估計未知量、比較差異、檢查關聯,最後在不確定性下做決策。

Cloudflare AI Search 怎麼用:資料來源、混合檢索與 Workers 綁定的完整解析

前身 AutoRAG 的託管搜尋原語:丟文件進內建儲存或綁 R2/網站,自動走 Markdown 轉換、切分與向量加 BM25 索引,透過 hybrid 加 RRF 加 rerank 檢索,並以 namespace 與 instance 兩種綁定或 REST 與 MCP 在 Worker 與 Agent 內查詢。

tech deep-dive

GPUtw.ai 是什麼:台灣在地 GPU 雲端、短租算力與研究者工作流

GPUtw.ai 是台灣在地的短租 GPU 雲端,核心不是最大規模的算力,而是台灣機房、預付點數、Jupyter/ComfyUI/Ollama/vLLM 範本、Vault 與團隊帳務。公開資料足夠做服務介紹,還不足以當正式採購或 production 背書。

tech debug Ask AI 實戰

問「我想找入門的ai課程」卻回 0 筆?RAG 中文分詞與資料鏈路脫節除錯實戰

在 Ask AI 輸入「我想找入門的ai課程」顯示搜尋文章 0 筆並觸發拒答,底部的延伸閱讀卻精準推薦相關文章。第一輪修正中文斷詞、LIKE fallback 與 Vectorize 資料鏈路;第二輪再補漢字+數字短詞、文章 metadata 檢索,以及只在 Validation/Critic 通過後顯示來源。

Harvard CS181 HW0:開學前先做這 4 題,卡哪題就先補哪裡

HW0 用四題檢查 CS181 的先修:矩陣 y=Xw 的可解條件、目標函數的微分與優化、機率推理,以及用 Python 實作 OLS。做不順的地方就是開學後要優先補的缺口。

Harvard CS181 HW1:冰芯溫度迴歸— 先掌握線性、核、神經網路三條路徑

HW1 以 800k 年冰芯溫度資料做線性迴歸、核迴歸與簡易神經網路,先掌握三種模型的訓練與驗證方法,為接下來的分類與深度學習鋪路。

Harvard CS181 Machine Learning 導讀總覽:2026 七份作業怎麼跟?四年版本一次看懂

CS181 2026 以 hw0–6 七份作業為週節拍、無當期錄影但 A3 可自學;2025 多 practical、2024 雙期中、2023 單授 Weiwei Pan。看懂四年沿革後,從 HW0 體檢先修再逐週跟最穩。

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 0:Search——從 DFS、BFS、A* 到 Minimax 與 Alpha-Beta 剪枝

Week 0 以搜尋算法為起點,涵蓋 BFS 最短路徑、Minimax 對弈、Alpha-Beta 剪枝優化,附 Degrees 與 Tic-Tac-Toe 兩專案完整實作。

tech deep-dive

手機遙控 Claude Code 怎麼選:Moshi 的 SSH 直連終端機、moshi-hook 與定價

Moshi 是一款 iOS/Android 終端機 app(另有免費的 Moshi Desktop 網頁版),透過 SSH/Mosh 直連你自己的機器遙控 Claude Code、Codex 等 coding agent;免費版就是完整終端機,Pro($7.99/mo 起)解鎖 Mosh 斷線續傳、tmux 深度整合與 diff viewer。

ADE 工作台對決:ADE、Superset、Herdr 與 Orca 怎麼選

把 ADE 類工作台分成四種哲學:arul28/ADE 的 Brain+Lane、Superset 的 100+ agents IDE、Herdr 的 Rust 常駐 runtime,以及 Kadro/Orca 的版面與 Fleet 取向;用一張對照表與選型決策樹幫你判斷何時該用水槽、而非 Omnigent 這類控制面。

治理深水區:Policy、Omnibox、Spend 與憑證代理

Omnigent 把治理從 prompt 抽到 Server 層的 Policy 引擎:Python 函式回 allow/deny/ask,三層堆疊疊加 cost budget 與 tool caps,搭配 Omnibox 以 bwrap/seatbelt 做 OS 原生隔離與 egress 憑證代理;本文對照 FailproofAI、DashClaw 等五套治理方案的定位與決策表。

ai deep-dive 認識 AI 模型

2026 Coding Benchmark 怎麼讀:SWE-bench、Terminal-Bench、DeepSWE、Aider 各自測什麼

每個模型發布都帶 benchmark 數字,但同一個模型在不同 harness 上可以差 20 分、SWE-bench Verified 的 32% 驗證器判斷有誤、DeepSWE 113 題讓多數模型掛零。這篇拆解六個主要 coding benchmark 各自測什麼、哪些容易灌水、讀者該看哪個。

ai guide Harvard CS50 AI 導讀

Harvard CS50 AI 導讀:七週主題、十二個 projects 與一門 2020 年錄影的課怎麼跟

CS50 AI 的 OpenCourseWare 版公開七週影片、投影片、notes 與十二個 Python projects,校外自學者可以拿到 autograder 回饋和每個 project 都達 70% 以上的免費 CS50 Certificate;但前六週錄影沿用 2020 年 Spring 版,只有 Week 6 Language 換成 2023 年重錄版。

ai deep-dive 認識 AI 模型

LLM API 怎麼買最划算:直連、聚合、雲端三條路的實際價差

同一個模型透過不同管道存取,價差可以到 2-5 倍。直連最簡單、聚合器(OpenRouter)最靈活、雲端平台(Bedrock/Vertex)最適合企業。這篇用 2026 年 8 月實際價格做橫向比較,附選擇決策樹。

同名不同層:meta-harness、ACP、HarnessAgent 與 Flue 到底在爭哪一層

同一個詞 meta-harness 其實指兩種東西:Databricks 的控制面與 Stanford 的優化迴圈。本文用 MCP/ACP/Runtime/meta-harness 四層模型,對照 Omnigent、Zed ACP、Vercel HarnessAgent 與 Cloudflare Flue 的定位。

ai guide MIT 6.7960 導讀

MIT 6.7960 導讀:一門課兩個官方版本——想修完走 2024 OCW,要最新內容讀 2025 投影片

[MIT 6.7960 Deep Learning](https://deeplearning6-7960.github.io/) 有兩個公開程度截然不同的官方版本:Fall 2025 課站 21 講投影片全公開但 psets 在 Gradescope、解答與錄影鎖在 Canvas(A2);[MIT OCW 的 Fall 2024 版](https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/)連影片、五份作業題目與起始檔都開放(接近 A3)。兩版綱要重疊約六成,講師從 Isola/Bernstein 換成 Kaiming He/Omar Khattab,不能拿舊影片硬配新講義。本文給出按目的分流的兩條自學路線。

ai deep-dive 認識 AI 模型

MoE 為什麼贏:從 Ornith 到 MiniMax,2026 年前沿模型都在用的架構

2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。

同一個多 Agent 任務,四種寫法:Omnigent YAML、LangGraph、CrewAI 與 Goose

用同一個 Polly 任務(平行 git worktree + 跨廠商審查)對照四種多 Agent 寫法:Omnigent 以 YAML 在 Server 層治理、LangGraph 以 StateGraph 精準控流程、CrewAI 以角色扮演快速拼裝、Goose 以 Recipe 跑單機自動化,對比 token、延遲與可維護性的真實取捨。

ai deep-dive

OLMo:唯一連訓練資料都開源的語言模型家族

Allen AI 的 OLMo 是目前唯一把權重、訓練資料(Dolma,9.3 兆 token)、訓練程式碼、所有中間 checkpoint 和評估工具全部公開的語言模型家族。OLMo 3 的 32B Think 模型在 MATH 跑到 96.1%,同時你可以用 OlmoTrace 追溯任何輸出回到訓練資料的哪一段。

多個 Agent 怎麼一起管:Omnigent 的 meta-harness、Policy 與跨裝置 Session

Databricks 開源的 Omnigent 把 Claude Code、Codex、Cursor、Pi 等 harness 包在 Runner/Server 與 Omnibox 沙盒之上,用三層 Policy 與可分享的持久化 Session 讓模型與 harness 一鍵替換,9.3k stars 的 alpha 專案。

ai deep-dive 認識 AI 模型

開源 AI 授權地雷指南:MIT、Apache 2.0、Llama License 到底差在哪

AI 的「開源」不等於軟體的開源。MIT 和 Apache 2.0 真的隨便用;Llama License 超過 7 億月活要另外談;舊版 Gemma 授權 Google 可以片面修改(Gemma 4 已改 Apache 2.0)。這篇按授權類型整理你能做什麼、不能做什麼。

ai guide 認識 AI 模型

開源 LLM 自架指南:框架怎麼選、硬體怎麼算、什麼時候比 API 划算

2026 年開源模型在 coding benchmark 追平閉源,但自架不只是選模型——vLLM 適合高併發生產服務、SGLang 在前綴重用場景快 29%、Ollama 是本地開發首選、llama.cpp 吃最少資源。A100 雲端租金約 $1.4-2.2/hr,自架損益兩平點大約在每月 100M tokens。

ai deep-dive 認識 AI 模型

後訓練 RL 三條路線:Ornith、Nous Research、MiniMax 怎麼用強化學習做出黑馬模型

2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。

ai deep-dive 認識 AI 模型

Token、Context Window、推論 vs 訓練:用 AI 模型前要知道的三件事

模型不讀字,讀 token——一個中文字通常是 1-2 個 token,一個英文字通常是 1-3 個。Context window 是模型一次能看的 token 上限。推論是用模型,訓練是教模型;你每天在做的是推論。

ai deep-dive 認識 AI 模型

Embedding:模型怎麼把文字變成可以計算的向量

模型不懂文字,只懂數字。Embedding 把每個 token 對應到一組幾百維的向量,意思相近的詞在向量空間裡距離相近。這是搜尋、RAG、分類背後共用的基礎機制。

ai deep-dive 認識 AI 模型

模型成績單怎麼看:Benchmark、Arena Elo、還有那些數字背後的陷阱

模型發布時貼的 benchmark 數字有三個常見陷阱:只秀贏的(cherry-picking)、訓練資料混入考題(contamination)、大家都考 90 分以上就沒鑑別力(saturation)。最抗操弄的訊號是 Chatbot Arena 的 Elo 排名——真人盲測投票,模型廠商無法控制題目。

ai deep-dive 認識 AI 模型

Fine-tuning vs RAG:什麼時候該教模型、什麼時候該幫模型查資料

資料常更新、需要引用來源 → RAG。需要統一風格、要跑在小裝置上 → fine-tuning。實務上很多系統兩者都用:fine-tune 一個懂你領域語言的小模型,再用 RAG 補上最新資料。

ai deep-dive 認識 AI 模型

模型怎麼改進自己:梯度下降與訓練迴圈

模型透過 loss 知道自己錯多少,透過梯度知道往哪邊調。梯度下降就是反覆做三件事:算 loss、算梯度、調參數。Learning rate 決定每步調多大——太大會跳過最佳解,太小訓練到天荒地老。

ai deep-dive 認識 AI 模型

模型怎麼知道自己錯了:Loss Function 與 Cross-Entropy

模型每次預測下一個 token 時,會給每個候選詞一個機率。Loss function 衡量這個機率分佈跟正確答案差多遠——差越多,loss 越高,模型就知道自己錯得越離譜。Cross-entropy 是最常用的算法,perplexity 是它的直覺版。

ai deep-dive 認識 AI 模型

量化與推論最佳化:讓 70B 模型跑在你的筆電上

70B 模型原本需要 140GB VRAM,但量化到 4-bit 只需要 ~35GB,再用 llama.cpp 的部分卸載就能在消費級硬體上跑。GGUF 格式的命名規則(Q4_K_M、Q5_K_S)告訴你精度和大小的取捨。KV cache 是長對話變慢的主因。

ai deep-dive 認識 AI 模型

Scaling Laws:模型要多大才夠,以及為什麼不是越大越好

Scaling laws 說 loss 跟參數量、資料量、算力之間有可預測的冪次關係。Chinchilla 論文的關鍵發現:大多數模型都太大、訓練資料太少——同樣的算力預算,訓練一個較小但吃更多資料的模型反而更強。這改變了整個產業的訓練策略。

ai guide 認識 AI 模型

認識 AI 模型:從 token 到自架,18 篇讀懂模型的通用知識

不需要變成研究員也能系統理解 AI 模型。這個系列從你看得見的東西(token、context window)開始,一路走到自架開源模型,18 篇覆蓋選模型、讀 benchmark、算成本需要的所有基礎。

ai deep-dive 認識 AI 模型

Tokenization:BPE 演算法,以及為什麼中文比英文貴

模型不是按字數收費,是按 token 收費。BPE 演算法從字元開始,反覆合併最常出現的相鄰配對來建詞表。英文 'understanding' 可能是 1-2 個 token,但中文「理解」可能要 2-3 個——同樣的意思,中文就是比較貴。

ai deep-dive 認識 AI 模型

預訓練、SFT、RLHF:模型從「補完文字」變成「有用助理」的三個階段

所有 LLM 都經過三階段訓練:預訓練讀完網路學會語言、SFT 用示範對話學會格式、RLHF 用人類偏好學會什麼回答比較好。Base model 到 chat model 的差距,就是後兩個階段做的事。

ai deep-dive 認識 AI 模型

Transformer 與 Attention:模型怎麼決定該看哪些字

Transformer 的核心是 self-attention:對每個 token,模型算出它跟其他所有 token 的相關程度,然後按權重加總。這讓模型能跨越距離抓到「it 指的是 cat 不是 mat」這種關係,也是它處理長文的基礎。

Ahead of AI:一位學者用月更深度文做到 20 萬訂閱的反直覺路線

計算生物學博士、前威斯康辛大學統計系教授 Sebastian Raschka,2022 年在 Substack 創辦 Ahead of AI,用月更長文拆解 LLM 論文與架構,四年做到 20 萬+訂閱。他刻意不接贊助、不追日更,靠書籍和付費訂閱變現,證明低頻高深度在 AI 電子報紅海裡也能走出一條路。

ByteByteGo:從自費出書到百萬訂閱的系統設計帝國

前 Twitter / Apple / Zynga 工程師 Alex Xu 2020 年自費出版《System Design Interview》,一本書打進 Amazon 暢銷榜;2022 年與前 Discord 工程師 Sahn Lam 聯手推出 Substack 電子報,首月即破 2.6 萬訂閱,兩年半達百萬。從書到電子報、YouTube、付費平台,ByteByteGo 2024 年營收 $3.5M,團隊從兩人擴張到 26 人——全程零外部融資。

Daily Dose of Data Science:從被迫放棄碩士到 20 萬訂閱的技術電子報之路

IIT 畢業的前 Mastercard AI 工程師 Avi Chawla,因家庭因素取消赴美碩士後,在 Substack 用「每天 150 字圖文」切入 Data Science 電子報,5 個月破萬訂閱、收入超過全職,四年做到 20 萬+訂閱與付費課程平台。

Dense Discovery:403 期不追成長的設計師週刊

德國出生、墨爾本定居的設計師 Kai Brach,從獨立印刷雜誌 Offscreen 延伸出每週策展電子報 Dense Discovery,八年 403 期、36,000 訂閱者、63% 開信率——刻意不追規模,用一個主贊助版位 $649 起加 Friends 付費社群養活自己,證明「夠用就好」也是一種商業模式。

Lenny's Newsletter:從 Airbnb 產品主管到 PM 圈最有影響力的個人電子報

Airbnb 前產品主管 Lenny Rachitsky 2019 年離職後開始在 Medium 寫文,一篇七年心得爆紅後轉戰 Substack,靠「每篇 50+ 輪修改」的品質偏執做到 120 萬訂閱、Podcast 50 萬 YouTube 訂閱、4 萬人 Slack 社群,全程不請一個正職員工。

Morning Brew:從密西根大學宿舍到 $75M 收購的商業新聞帝國

Alex Lieberman 在密西根大學宿舍寫了一份叫 Market Corner 的 PDF,用聊天口吻重寫華爾街日報式的商業新聞。五年後 Morning Brew 做到 400 萬訂閱、年營收 $13M,被 Insider Inc. 以 $75M 收購。轉介計畫巔峰時貢獻 75% 新增訂閱,是電子報史上最成功的成長引擎之一。

Not Boring:當寫作本身就是 Deal Flow

前投行人、創業公司 VP Packy McCormick,2020 年 COVID 封城期間把社交俱樂部轉型為商業分析電子報 Not Boring,兩年內做到 8 萬訂閱、$1M 年營收,並從 $8M 基金一路做到三支基金、200+ 投資——寫作本身就是 deal flow。

一個人的媒體公司:電子報創業的十個案例與四條路線

從 Stratechery 2014 年證明「一個人寫分析文可以養活自己」到 TLDR 2024 年做到 $10M+ 年營收,十個電子報創業案例拆解出四條變現路線、三種內容模式,以及一個共通規律:格式選擇決定天花板。

The Pragmatic Engineer:從 Uber 支付系統主管到 Substack 第一名科技電子報

Gergely Orosz 在 Uber 管了六年支付系統、經歷疫情裁員後離職,用六年部落格累積的寫作聲量在 Substack 創刊 The Pragmatic Engineer。四個月登上科技類第一、三年半突破百萬訂閱,年營收 $1.5M+——全靠讀者付費,零廣告零贊助。

Stratechery:在台北證明「一個人寫分析文可以養活自己」的付費電子報先驅

Ben Thompson 在台北的公寓裡用三層訂閱制開始全職寫 Stratechery,十年後做到 4 萬+付費訂閱、年營收 $5M+,並發展出 Aggregation Theory 這個影響整個科技業的分析框架。Substack 的種子輪 pitch 就是「Stratechery-in-a-box」——他不只是第一個證明模式的人,他本身就是這個模式的原型。

The Hustle:從熱狗攤到被 HubSpot 收購的商業媒體帝國

Sam Parr 從納許維爾的熱狗攤起步,靠文案功力和病毒式內容把 The Hustle 在五年內從零做到 150 萬+訂閱,再以八位數價格賣給 HubSpot——買方要的不是內容,是讀者名單背後的 SaaS 漏斗。

TLDR:從父母地下室的 Side Project 到年營收八位數的純廣告電子報帝國

耶魯數學經濟系畢業、Jane Street 量化交易員出身的 Dan Ni,因罕見疾病離開華爾街,在密蘇里父母家地下室用每天 50 美元廣告預算啟動 TLDR 電子報。八年後做到 13 個垂直版本、720 萬訂閱者、22 名全遠端員工、年營收破八位數——全部來自廣告,不收讀者一毛錢。

tech deep-dive AI 模型家族

FLUX——Stable Diffusion 原班人馬出走後造出的圖像模型家族,從 12B 到 Self-Flow 世界模型

FLUX 是 Black Forest Labs 的圖像模型家族——2024 年 8 月由 Stability AI 的 Stable Diffusion 原班人馬創立後首發,12B rectified flow transformer 一戰成名;兩年後家族已長成五層:klein 4B($0.014 起、家族新一代唯一的 Apache 2.0)/9B、pro($0.03)、flex($0.05)、max($0.07、可即時搜尋網路 grounding),外加 32B 開放權重的 dev;2026 年 8 月更用 FLUX 3 把影片+同步音訊+機器人動作收進同一個 Self-Flow 架構。這篇追蹤從 FLUX.1 到 FLUX 3 的演化、授權三層制與選型建議。

tech deep-dive AI 模型家族

語音與音訊模型家族——Whisper 從開源改寫 ASR 到 ElevenLabs 收編語音 API,一條 ASR 一條 TTS 的四年演化

語音模型分兩條線:ASR 線由 Whisper 主導——2022/09 以 MIT 開源 1.55B 模型把轉錄成本打到趨近於零,v2→v3→turbo(decoder 32 層砍到 4 層)之後 OpenAI 轉閉源推 gpt-4o-transcribe;TTS 線則是 ElevenLabs 用品質與生態從新創做到 $11B 估值、$500M ARR,開源陣營靠 Kokoro(82M、Apache 2.0)與 Chatterbox 守住自架陣地。即時對話已被 speech-to-speech 的 Realtime API 重寫遊戲規則。

tech deep-dive AI 模型家族

影片生成模型家族——Sora 退場、Veo 3.1/Kling 3.0/Gen-4.5 三強割據的兩年軍備競賽

2024 年 2 月 Sora 預覽震撼業界,兩年半後格局翻轉:OpenAI 於 2026 年 4 月關閉 Sora 消費者 App、API 排定 9 月 24 日退役;Veo 3.1 以原生音訊與 Flow 工具鏈成為敘事首選;快手 Kling 3.0 轉型統一多模態、年化營收 2.4 億美元;Runway Gen-4.5 曾登頂 Artificial Analysis 榜(2025-11 快照)、靠企業工作流站穩專業市場。這篇以家族×世代時間線拆解四大家的演化、規格定價對照與選型建議。

tech debug Ask AI 實戰

搜尋只回 10 筆的解法:Cloudflare D1 FTS5 與 Hybrid Search 中文召回實戰

查「認證」只有 10 筆,149 篇裡 41 篇命中被漏掉:D1 FTS5 的 unicode61 對 2 字中文失效、本地 chunks_fts 0 筆、加上硬上限 12 的共同結果;用 LIKE fallback 與拆字 OR 先把召回補回來,再補 trigram 重建與分頁。

tech deep-dive AI 模型家族

MiniMax:聊天機器人公司做出的 Coding 模型,性價比碾壓閉源

MiniMax 從消費級聊天 App 起家,M2.5 在 SWE-bench Verified 拿 80.2% 但 API 價格只有 Claude Opus 的 1/10-1/20;M3(456B 總量 / 45.9B 啟用)是首個在 SWE-bench Pro 突破 59% 的開源權重模型,還有 1M context。

tech deep-dive AI 模型家族

Nous Research:從研究社群到開源 AI 生態系的反叛者

Nous Research 不預訓練,只做 fine-tuning 和 RL——Hermes 4 在 MATH-500 拿 96.3%,NousCoder-14B 只用 24K 樣本就把 Qwen3-14B 的 coding 能力拉高 7%。但真正的護城河是 Hermes Agent 框架:236K GitHub stars,全球第 19 名,3,000 位貢獻者。

tech deep-dive AI 模型家族

Ornith:小團隊用自我改進 RL 做出的開源 Coding 黑馬

DeepReinforce 用 self-improvement RL 訓練的 Ornith 1.5 家族:397B 旗艦在 SWE-bench Verified 拿 86.0 追平 Claude Opus 4.8,35B-A3B 每 token 只啟用 3B 參數卻在同量級 coding benchmark 全面領先,9B 版本可以跑在手機上。MIT 授權、完全開源。

Claude Code 多 session 怎麼管:Agent View、dispatch、狀態監控與跨 session 傳訊

`claude agents` 一個畫面列出所有背景 session,把 Needs input、Ready for review、Working、Completed 等狀態排在一起管理,Space 鍵偷看、Enter 接手。搭配 cross-session messaging(ListAgents/SendMessage,v2.1.224+),session 之間還能自己互傳訊息;同機傳訊走本機 socket,不經 Anthropic 伺服器。

Claude Code 的 .claude 目錄導覽:settings、rules、skills 到 auto memory 各檔職責

Claude Code 的設定分散在專案 `.claude/` 與家目錄 `~/.claude/` 兩層,共 20 多個檔案位置。關鍵分野只有兩條:settings 是跨層合併的強制設定,CLAUDE.md 和 rules 是串接進 context 的指引;committed、gitignored、Claude 自寫三種身分各不相同。

PR 審查怎麼交給 Claude Code:multi-agent 分析、REVIEW.md 與 ultrareview

GitHub PR 審查設定好後,由一隊 agent 依 repo 觸發模式審查,平均 20 分鐘、每則約 15–25 美元,findings 以 inline comments 貼在問題行上;改動夠大時用 /code-review ultra 開雲端深審,5–10 分鐘回報每條都經獨立驗證的 bug,單次約 5–25 美元、Pro/Max 有 3 次免費。

Claude Code 成本怎麼管:token 追蹤、模型選擇、effort 與團隊用量

Claude Code 成本隨 context 大小累積:企業部署平均每位開發者每個活躍日約 $13、每月 $150–250。本文整理 /usage 與 /insights 追蹤、六種省 token 手段,以及「該用哪個模型」的系統性答案:provider-dependent model aliases、effort levels、fast mode(Opus 5/4.8 每 MTok $10/$50)與 advisor 工具。

Claude Code 設定了卻沒生效怎麼診斷:/context、/doctor、/mcp 與錯誤對照

CLAUDE.md 寫了沒被遵守、hook 不觸發、MCP server 沒出現,多半是檔案沒載入、載錯位置或被另一層設定覆蓋。本文整理 /context、/memory、/skills、/doctor、/mcp 等診斷入口各看什麼、safe mode 二分法,以及六條高頻錯誤訊息的對照表。

Claude Code 開發環境怎麼統一:devcontainer.json、CI 一致性與團隊 rollout

在 `.devcontainer/devcontainer.json` 加一行 Anthropic 官方 Dev Container Feature(`ghcr.io/anthropics/devcontainer-features/claude-code:1.0`),三步驟——寫設定、rebuild 容器、跑 `claude` 登入——就能讓團隊每個人的 Claude Code 跑在同一份容器定義裡;同一份定義也能餵給 GitHub Codespaces 和 CI,rollout 五步可落地。

Claude Code 怎麼編排大量 subagents:Dynamic Workflows、ultracode 與可重跑腳本

Dynamic workflows 讓 Claude 把多代理編排寫成 JavaScript 腳本、交給 runtime 在背景執行,單次最多 1,000 個 agent、可存成 /<name> 指令重跑。本文拆解觸發方式、儲存流程、codebase audit/大遷移/交叉查證研究三種場景,以及與 Agent Teams 的分工和成本陷阱。

Claude Code 怎麼運作:agentic loop、內建工具與兩道安全防線

Claude Code 的核心是一個 agentic loop:蒐集 context、採取行動、驗證結果,循環直到任務完成。本文拆解它的五大類內建工具、模型與 harness 的分工,以及 checkpoints 和 permission modes 兩道安全防線,作為整個系列的閱讀地圖。

Claude Code 多代理怎麼選:subagents、agent view、agent teams、dynamic workflows

官方文件把 Claude Code 的平行工作分成 4 種方式:subagents 在同一個 session 內委派、agent view 讓你自己盯多個背景 session、agent teams 由 lead 協調一群工人、dynamic workflows 用腳本跑大量 subagent 交叉驗證;檔案衝突一律靠 worktree 隔離。本文附官方比較表中譯與三題決策指引。

Claude Code 怎麼上雲:Claude Code on the web、--cloud/--teleport 與手機接手

Claude Code on the web 把任務丟到雲端環境執行,預設是 Anthropic 託管 VM,也可由組織路由到 self-hosted environment:GitHub 授權後從瀏覽器或手機派工,`--cloud` 從終端機開雲端 session,`--teleport` 把雲端 session 拉回本地續作。目前是 Pro/Max/Team 的 research preview,不另收運算費用但共享帳號 rate limit。

讓 Claude Code 自主到什麼程度:permission modes、auto mode 分類器與 allow/deny rules

Claude Code 共有六個 permission mode,日常主要在 Manual、Accept edits、Plan、Auto 四個之間用 Shift+Tab 切換;Pro/Max/Team 的互動終端機與 VS Code session 在條件符合時預設進入 auto mode,由背景分類模型審查多數動作,預設攔下 force push、`curl | bash`、production deploy 等風險操作。本文講四個模式的取捨、permission rules 的寫法,以及組織層的 trust config。

Prompt caching 怎麼左右 Claude Code 的速度與帳單:prefix 匹配、快取作廢時機與命中率

Claude Code 的 prompt caching 靠 prefix 完全匹配運作:命中時重讀計費約為標準 input 的 10%,但換模型、改 effort、開 fast mode、連斷 MCP server、整工具 deny 都會讓下一輪整段重算。TTL 預設五分鐘,訂閱方案的主對話與少數 helper requests 用一小時。

Claude Code sessions 怎麼管理:--continue、--resume、/branch 與 JSONL 檔

Claude Code 把每個 session 逐行寫進 ~/.claude/projects/ 底下的 JSONL 檔,預設保留 30 天。本文拆解 --continue 與 --resume 的差異、session 命名規則、/branch 分岔語意,以及 transcript 匯出與清理的設定。

Claude Code 裝不起來、登不進去怎麼排:PATH、安裝來源、proxy、OAuth callback

安裝與登入問題照五步排:驗 PATH(macOS/Linux 用 echo $PATH,Windows 用 PATH 查詢)、確認只剩一份安裝、測 downloads.claude.ai 是否回 200、OAuth callback 失敗就貼 login code 或改用 claude auth login,最後用 claude doctor 收尾。

Claude Code 執行期問題怎麼解:CPU 記憶體、session hang、auto-compact thrashing、表格與搜尋失效

執行期問題五類解法:記憶體偏高用 /compact 加 /heapdump 診斷;hang 了按 Ctrl+C 再 claude --resume 復原;大型表格改寫檔案不要硬看終端輸出;autocompact thrashing 用分段讀檔或 /compact 指定焦點脫離迴圈;搜尋失效裝系統 ripgrep 並設 USE_BUILTIN_RIPGREP=0。

ai deep-dive RAG 技法大全

Agentic / Reasoning RAG:從 Search-R1 的 RL 多輪搜索到 Deep Research 與 MCP 的推理×檢索新範式

2025 年的 RAG 不再是「檢一次、生成一次」。Search-R1 用 RL 讓模型在推理中自主多輪搜索,REX-RAG/AlignRAG 補上策略與對齊的分支,OpenAI Deep Research 把整條鏈產品化,MCP 則把檢索泛化為統一的工具調用。本文拆開設計哲學、與舊世代的取捨、以及何時該用這套新範式。

ai deep-dive

Apple 開放 Private Cloud Compute 免費額度:AFM 3 模型家族與開發者該知道的事

Apple 讓 App Store Small Business Program 開發者免費使用跑在 Private Cloud Compute 上的 AFM 3 模型,門檻是首次下載數低於 200 萬次。AFM 3 家族共五個模型,裝置端的 AFM 3 Core Advanced 用 200 億參數稀疏架構只啟動 1–4B,雲端最強的 AFM 3 Cloud Pro 跑在 Google Cloud NVIDIA GPU 上,用 Gemini 輸出做蒸餾式精煉。

ai deep-dive

BytePlus ModelArk Coding Plan:字節跳動的 AI 編碼訂閱方案

BytePlus ModelArk Coding Plan 提供 Lite($10/月)和 Pro($50/月)兩種訂閱,整合 DeepSeek-V4、GLM-5.2、Seed-2.0 等多模型,支援 Claude Code、Cursor 等主流工具,Lite 月配額約 24,000 次請求,Pro 為其 5 倍。

跟成熟 coding agent 學設計(2):Agent loop 的形狀——事件流、checkpoint、resume

pi 的 loop 是雙層 while 加 EventStream;claude-code 明講 stop_reason 不可靠、改以串流中收到的 tool_use block 當唯一續跑訊號;codex 把 turn 做成可取消的 SessionTask 再靠 rollout crate 錄 JSONL;looplane 選了「manifest 先落盤、JSONL 跟上」的寫入順序,讓 Ctrl-C 之後能做驗證式續跑而非重跑。這篇全部附 file#symbol 級證據。

跟成熟 coding agent 學設計(13):CLI 人體工學——讓新工具長得像使用者已經會用的工具

成熟的 coding agent CLI 都收斂到同一套慣例:positional prompt、-p 是 print、exec 是 headless、resume 是一級指令、-C 換目錄;looplane 直接繼承這套詞彙,把學習成本壓到接近零。

跟成熟 coding agent 學設計(10):編輯工具的取捨——unified diff、exact edit、hashline 與 whole-file

LLM 寫 unified diff 壞在簿記:hunk 行數算錯、上下文行幻覺。五家的答案分成兩派——把 diff 文法做簡單(Codex 拿掉行號)、或乾脆不用 diff(Claude Code/Pi/OpenCode 的 exact replace);OMP 更進一步用 hash 錨點綁住讀取狀態。looplane 走最小干預:保留 guarded apply_patch,加一個零模糊匹配的 replace_text,qwen3:4b eval 就從穩定失敗變 5/5。

跟成熟 coding agent 學設計(9):外部 CLI 當 backend——包別人的 loop,安全邊界畫在哪

每家成熟 coding agent 都有 headless 機器介面:codex 有 `exec --json` 和更完整的 app-server JSON-RPC,claude-code 有 `-p` 加 stream-json,pi/opencode/omp 各有一種 JSON 事件流。直接把這些 CLI 當 backend 是最快的路,但代價是:它們自帶 agent loop、自己的權限模型、自己的登入。looplane 的答案是讓外來 CLI 完整擁有它的 loop,自己只守住三件事——隔離副本、patch audit、最終驗證——並且一條 runtime 永遠不偽裝成另一條。

跟成熟 coding agent 學設計(22):Gateway 模式——把任何 provider 變成 OpenAI 相容端點

生態系都把 /v1/chat/completions 當共通語,但你手上的 provider 不一定講這個方言。五家的答案分三派:pi 和 OpenCode 讓 client 本身講多種方言所以不做 gateway;OMP 做了真正的 protocol translator(foreign wire → 中立 context → provider adapter,禁止 raw passthrough);Codex 和 Claude Code 的 proxy 不翻譯,只負責強制流量管控。looplane 抄 OMP 的邊界但收斂成一進一出:只收 OpenAI Chat,嚴格解析成 canonical contract,後面接任何 ModelProvider——順便踩掉一個 cross-event-loop client close bug,教訓是 provider 的生命週期必須交給 ASGI lifespan。

跟成熟 coding agent 學設計(21):Headless 模式與 CI 使用——沒有人可以按 approve 的時候

agent 進 CI 後最大的問題是審批:沒有終端機、沒有人可以按 approve。五家的解法收斂成兩條路——把權限決策外包給呼叫端(claude-code 的 control protocol),或直接換掉審批語意(codex 預設 Never 配沙箱、opencode 預設自動拒絕)。looplane 用同一個 AgentRunner loop 注入不同的 ApprovalPolicy:headless 下用 HeadlessApprovalPolicy,不讀 stdin 所以不可能卡住 pipeline,EXECUTE 預設 fail closed。

跟成熟 coding agent 學設計(14):Onboarding 設計——provider-aware 初始化與即時驗證

空白設定檔勸退人,憑證錯太晚發現更勸退人。五家成熟 agent 都把 setup 做成 first-class state,looplane 再補上存完 key 立即驗證這一步。

跟成熟 coding agent 學設計(20):Run artifacts 契約——跑完之後憑什麼審計?

agent 跑完之後,「模型說它做完了」不是證據。codex 把 trace 拆成 manifest + JSONL + payloads 的 bundle、omp 用 SQLite 鏡像磁碟上的固定檔案、pi 用 runs.jsonl 索引原生 session 檔。looplane 選了最硬的一條:每個 run 固定六個檔案,缺一個就不算完成,patch 審計看 changes.patch 不看口頭宣稱。

跟成熟 coding agent 學設計(16):Runtime 抽象與 capability handshake

五個外部 CLI 有五種機器介面:JSONL 事件流、JSON-RPC、HTTP API、ACP、stream-json。支援它們的正確姿勢不是抽一個「都一樣」的介面,而是一條窄的 runtime 邊界加一份誠實的 capability matrix——availability 只代表裝了,不代表登入;協定飄移就 fail closed。

跟成熟 coding agent 學設計(11):沙箱與遠端執行——Cloudflare Sandbox 部署實戰

本地沙箱管的是『agent 在你的機器上爆炸半徑多大』,雲端沙箱管的是『怎麼把程式碼安全地搬到別人的機器上跑』——五家成熟專案幾乎都在做前者,只有 looplane 真的部署了後者。實戰教訓:mock 測不出 SSE framing、CI 綠燈擋不住 stale wheel,而清理路徑要跟成功路徑一樣有 timeout。

跟成熟 coding agent 學設計(19):Session 持久化與 crash recovery——agent 死掉之後,狀態怎麼救

五家 agent 的 session 儲存幾乎都是 append-only JSONL 加上某種單寫者保護,但 crash recovery 的差別在細節:pi 會修 torn tail、codex 寫失敗會重開檔重試、looplane 選了「manifest 先落盤」讓唯一的 crash window 變成可修復的一格。這篇拆解每家的寫入順序與 fail-closed 條件,全部附 file#symbol 證據。

跟成熟 coding agent 學設計(12):小模型能寫程式嗎——能力邊界與 eval 紀律

小模型卡的不是『不會想』而是『格式不穩』:tool call JSON、diff hunk 計數、context 預算都會爆。五家參考專案的共識是把評測建立在真實模型行為上(pi 的 model-backed eval、OMP 從真實 session log 校準編輯基準、Codex 甚至為弱模型放寬 parser),looplane 則選最窄但最硬的路:一個 fixture、五次真實 Ollama 執行、manifest 宣告改哪些檔案和哪些 patch 片段才算過,並且把 M2 的失敗原封不動留成證據——不把 mock 當 E2E,不把部分成功講成全過。

跟成熟 coding agent 學設計(17):啟動效能與工程紀律——慢的從來不是語言

CLI 工具每次叫用都要付一次啟動成本,而沒有 baseline 的效能優化等於沒有回歸保護。codex 用 daemon 重用與 skill snapshot 快取、claude-code 把入口切成七十個動態 import 加上內建啟動 profiler、opencode/omp 各有 lazy 載入紀律;pi 則什麼都沒做,靠 Bun 的速度快撐著。looplane 是 Python,天生慢,所以把紀律做滿:lazy import、單飛磁碟快取、背景預熱 controller、hyperfine paired benchmark 加上 CI 大於 10% 退步就擋 merge。

跟成熟 coding agent 學設計(8):訂閱的正道與邪路——OAuth 與 credential 邊界

五家在「訂閱認證」上分成三派:Codex 和 Claude Code 只為自己官方 client 做 OAuth 並把 token 收進 OS keyring;pi 和 OMP 直接重用 Claude Code 的 client ID 實作 Pro/Max OAuth(技術可行但 Anthropic 文件明文禁止第三方未經核准提供 claude.ai 登入);OpenCode 則把內建 Pro/Max plugin 整組移除,是生態系最乾淨的政策先例。looplane 的原則:自己的 grant 自己做、絕不刮別家 CLI 的 credential 檔、第三方 client 要 provider 明確支援才接 OAuth、credential 不複製不轉發。

跟成熟 coding agent 學設計(24):測試一個會動的 agent——fake-CLI 合約、錄製串流、TUI pilot

agent 的兩個依賴——LLM 和外部 CLI——都不是決定性的,但成熟專案的招式是把「會動的部分」與「邊界的形狀」切開:codex 用 wiremock 假 Responses API 加腳本化 SSE server,TUI 用 insta 快照;opencode 乾脆做了 VCR 式的 http-recorder 錄放套件;pi 把 eval 與 unit test 分成兩份 vitest config;omp 把 edit benchmark 本身用 unit test 圍起來。looplane 對外部 CLI 做了四層:單元測試、fake-CLI 合約、錄製串流整合、Textual pilot TUI 測試。核心方法論一句話:錄下真實的非決定性輸出,對它做決定性的斷言。

跟成熟 coding agent 學設計(15):從全螢幕 TUI 到 semantic transcript

成熟的 coding agent TUI 都不是把事件流印出來,而是先做一層 typed projection 再渲染;looplane 走了全螢幕組合、runtime-first 雙模式、移除 Ask/Agent 分離三步,才把 non-streaming 和 resume 不能 replay 兩個舊限制真正解除。

跟成熟 coding agent 學設計(5):Verification gate——改了檔案不算成功,驗過才算

五家參考專案裡沒有任何一家在 harness 層強制「宣告的驗證指令全過才算成功」:pi 靠模型自覺、OpenCode 和 Codex 把驗證寫進 system prompt、Claude Code 用獨立的對抗式驗證 subagent 但仍是軟性合約、只有 OMP 的 cleanse 真的由 harness 跑檢查。looplane 選最硬的一條路:改過檔案就必須重跑所有宣告的驗證指令,全過才給 terminal_reason=verified;沒動任何檔案就不重跑(no_changes),把「跑不跑」變成程式碼決定,不是模型決定。

為什麼 Python:寫 coding agent 的語言選擇代價與補償

五個成熟 coding agent 沒有一家用 Python——pi/opencode/claude-code 用 TypeScript,codex 從 TS 重寫成 Rust,omp 把熱路徑補上 8 萬行 Rust native crate。looplane 仍選 Python,代價是啟動效能與打包,補償手段是 lazy import、uv 和 Cloudflare Sandbox。

ai deep-dive RAG 技法大全

圖譜 RAG 怎麼選:GraphRAG v3.1.2、LightRAG 與 HippoRAG 2 的設計、成本與選型

同樣是「知識圖譜 + 檢索」,Microsoft GraphRAG v3.1.2 用重索引換全局總結能力,LightRAG 用 dual-level 與增量把成本砍下來,HippoRAG 2 用 PPR 把 RAG 做成可持續增長的記憶;這篇按部件拆設計取捨,含四種查詢、索引流程與選型表。

ai deep-dive RAG 技法大全

Late Chunking vs Contextual Retrieval:先編碼後切塊的零成本上下文 vs LLM 前置生成的精準度交易

Anthropic Contextual Retrieval 用 LLM 為每塊生成 50-100 token 前置上下文把失敗率從 5.7% 壓到 1.9%(含 rerank),成本約 $1.02/1M tokens;Late Chunking 先以 32K 長上下文模型全文件編碼再切塊 mean-pool,零額外 LLM 成本,取捨在窗口、延遲與文件結構。

ai guide

Unsloth 完整指南:在本地微調和運行 LLM 的加速工具

Unsloth 是目前最省 VRAM、最快的本地 LLM 微調工具,訓練速度快 2 倍、VRAM 省 70%。2026 年加入 Desktop 桌面應用後,整合了推論、微調、圖片影片生成、web search 和 agent 連接,從微調庫變成完整的本地 AI 工作站。

tech deep-dive AI 模型家族

Apple Foundation Models——隱私優先的封閉生態 AI,20B 稀疏模型跑在手機上

Apple Foundation Models(AFM)是 Apple 自研的封閉生態 AI 家族,三代演進從 2024 年的 3B dense + LoRA adapter,到 2026 年的五個模型。AFM 3 Core Advanced 用 IFP 稀疏架構把 20B 跑在手機上(只啟動 1–4B),雲端最強的 Cloud Pro 跑在 Google Cloud NVIDIA GPU、用 Gemini 蒸餾精煉。沒有公開 API 定價,沒有第三方 benchmark,只透過 Foundation Models framework 給 iOS/macOS 開發者使用。

tech guide

Mac 遠端桌面怎麼選:Tailscale、Jump Desktop、RustDesk 與內建螢幕共享

不想付錢就用 Tailscale + 內建螢幕共享,完全免費且最穩;要更順才考慮付費的 Jump Desktop,本文對比 4 種方案並給 5 分鐘設定與闔蓋休眠三大坑解法。

tech guide 自架推論服務

自架推論服務導讀:什麼時候值得自己跑模型

自架推論的關鍵不在引擎多快,而在你的 GPU 使用率:一張打滿的 A100 約 $0.70 / 百萬輸出 token,使用率掉到一成就變 $7,比多數雲端 API 貴。這篇是系列導讀,把七套工具分成三層,幫你判斷該選哪一層。

tech deep-dive 自架推論服務

TensorRT-LLM:編譯換效能的 NVIDIA 專用 LLM 推論引擎

TensorRT-LLM 是 NVIDIA 的開源 LLM 推論庫(Apache 2.0),用離線編譯把模型權重與計算圖轉成最佳化的 TensorRT engine,再用自訂 CUDA kernel、in-flight batching 與多種平行化壓出硬體極限。代價是只支援 NVIDIA GPU、編譯要數十分鐘、換模型或量化就要重新 build。

tech deep-dive 自架推論服務

TGI:HuggingFace 的 LLM 推論伺服器,以及它為什麼進入維護模式

Text Generation Inference(TGI)是 HuggingFace 自家的 LLM 推論伺服器,用 Rust + Python 實作,率先在開源推論引擎裡引入 continuous batching 與 Flash Attention。2026 年 3 月 GitHub 倉庫歸檔進入維護模式,官方建議遷移到 vLLM 或 SGLang。了解 TGI 仍然重要:它定義了後繼引擎的架構基線,而且許多 HuggingFace Inference Endpoint 上的既有服務仍在跑它。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:電腦視覺篇

2021 是 Transformer 正式入侵電腦視覺的元年——Swin Transformer 拿下 ICCV Best Paper,DINO 證明自監督 ViT 能自動學會物件分割,NeRF 從單篇論文變成一整個子領域。CVPR 和 ICCV 都因疫情改為全線上舉辦,但這一年產出的論文深遠影響了此後整個 CV 領域的架構選擇。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:機器學習篇

2021 年是 diffusion model 超越 GAN、自監督學習理論突破、RL 評估方法論覺醒的一年。NeurIPS 收了 9,122 篇投稿創當時紀錄,ICLR 的 Score-Based Generative Modeling 論文日後成為整個 diffusion 生態的理論基石,ICML 則在優化理論與自監督學習動力學分析上交出紮實貢獻。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:自然語言處理篇

2021 年是 NLP 從「fine-tune 整個模型」轉向「只調一小部分參數」的分水嶺——Prefix-Tuning(ACL)、LoRA(arXiv,後成為業界標準)、Prompt Tuning(EMNLP)三篇同年出現,ACL Rolling Review 同年啟動,Findings track 正式站穩成為第二發表管道。

ai deep-dive AI 頂會導讀

2021 AI 頂會在收什麼題目:Transformer 擴散、自監督學習與 Diffusion 的起點

2021 年是 AI 頂會的分水嶺:Transformer 從 NLP 全面入侵 CV 與時序領域,自監督學習成為各會議最熱門關鍵詞,Diffusion Model 拿下 ICLR Outstanding Paper 但還沒有人意識到它會取代 GAN——而 GNN 和 Federated Learning 正處於論文量的歷史高峰,之後開始走下坡。

ai deep-dive AI 頂會導讀

2022 AI 頂會導讀:電腦視覺篇

2022 年是 CV 從「辨識」走向「生成」的轉折點——Latent Diffusion Models 在 CVPR 發表後催生了 Stable Diffusion,NeRF 從 2021 年的 25 篇暴增到 CVPR 單場超過 50 篇,ConvNeXt 替 CNN 打了一場漂亮的反擊戰,而 ECCV 則在 Tel Aviv 交出了 157 篇 Oral 的歷史最高紀錄。

ai deep-dive AI 頂會導讀

2022 AI 頂會導讀:機器學習篇

2022 年是 diffusion model 登上頂會舞台中央、Chinchilla scaling laws 改寫大模型訓練範式、Chain-of-Thought 讓推理成為可提示能力的一年。NeurIPS 破萬篇投稿,13 篇 Outstanding Paper 裡有 3 篇跟 diffusion 直接相關,Chinchilla 和 data pruning 兩篇挑戰了『大就是好』的信條。ChatGPT 年底發佈前夜,所有拼圖都在這一年的頂會上各就各位。

ai deep-dive AI 頂會導讀

2022 AI 頂會導讀:自然語言處理篇

2022 年是 NLP 從「模型能力展示」走向「模型對齊與控制」的轉折年——InstructGPT 把 RLHF 推上主流、Chain-of-Thought 證明推理能力可以靠提示詞解鎖、Flan 2022 讓 instruction tuning 的方法論成熟化。ACL 與 NAACL 同年全面啟用 ARR 滾動審稿,暴露了大量基礎設施與審稿人負載問題。年底 ChatGPT 上線,NLP 研究的遊戲規則從此改寫。

ai deep-dive AI 頂會導讀

2022 AI 頂會在收什麼題目:Diffusion 爆發、Chain-of-Thought 與 ChatGPT 前夜

2022 年是 AI 頂會的轉折年:Diffusion Model 從冒頭變成主流(NeurIPS 兩篇 Outstanding Paper),Chinchilla 改寫 scaling laws 的遊戲規則,Chain-of-Thought 證明大模型能推理,InstructGPT 用 RLHF 讓語言模型學會聽話——而這一切在年底 ChatGPT 上線後瞬間從學術議題變成全球新聞。

ai deep-dive AI 頂會導讀

2023 AI 頂會導讀:電腦視覺篇

2023 是 CV 從「看圖」走向「理解+生成+控制」的一年——Segment Anything 讓分割變成 zero-shot 通用能力,ControlNet 讓擴散模型可精準控制,3D Gaussian Splatting 以即時渲染速度挑戰 NeRF,DreamBooth 和 InstructPix2Pix 把文生圖從「生成」推向「編輯」。CVPR 投稿量突破九千、ICCV 突破八千,兩場會議恢復實體舉辦,規模與密度同創新高。

ai deep-dive AI 頂會導讀

2023 AI 頂會導讀:機器學習篇

2023 年是 LLM 全面接管 ML 頂會的一年。NeurIPS 投稿破 12,000 篇,兩篇 Outstanding Paper 都直接針對大模型(隱私審計與湧現能力質疑),Runner-Up 的 DPO 在短短兩年內成為 RLHF 的實質替代標準。ICLR 的 DreamFusion 開啟了 text-to-3D 賽道,ICML 則把 LLM 水印和學習率自適應推上舞台。Mamba 以 arXiv 預印本之姿在 NeurIPS 現場引爆討論,預示 Transformer 的第一個真正挑戰者即將到來。

ai deep-dive AI 頂會導讀

2023 AI 頂會導讀:自然語言處理篇

2023 年是 ChatGPT 之後的第一個完整學術年——NLP 頂會的議程被 LLM 全面重寫:ACL 的 Best Paper 研究幽默理解和政治偏見追蹤,EMNLP 的 Best Paper 用資訊流視角解釋 in-context learning,而 HackAPrompt 這篇 prompt injection 競賽論文直接拿下 EMNLP Best Paper,標誌著安全研究正式進入主流。整年最大的主題轉變是:研究者不再問「怎麼讓模型更準」,開始問「怎麼知道模型在不在騙你」。

ai deep-dive AI 頂會導讀

2023 AI 頂會在收什麼題目:LLM 重寫研究議程的一年

2023 年是 LLM 全面重寫 AI 研究議程的第一年:DPO 拿下 NeurIPS Outstanding Runner-Up、ReAct 成為 ICLR Oral、hallucination 從邊緣詞彙變成每場會議的熱門 track——同時 3D Gaussian Splatting 在 SIGGRAPH 發表後橫掃 CV 社群,Mamba 年底出現挑戰 Transformer 的注意力壟斷,而傳統 NLP pipeline 的論文量開始明確萎縮。

ai deep-dive AI 頂會導讀

2024 AI 頂會導讀:電腦視覺篇

2024 是 3D Gaussian Splatting 全面接管 3D 重建、video generation 從研究走向產品、vision-language model 深入各垂直領域的一年。CVPR 投稿量突破 11,500 篇再創紀錄,Best Paper 給了 Google Research 的 Generative Image Dynamics 和 UCSD/Google 合作的 Rich Human Feedback for Text-to-Image Generation;ECCV Best Paper 則頒給哥倫比亞大學的 Minimalist Vision with Freeform Pixels——一篇回歸光學基礎物理的非典型得獎作。

ai deep-dive AI 頂會導讀

2024 AI 頂會導讀:機器學習篇

2024 年是 ML 頂會投稿量爆炸的一年:NeurIPS 收到 15,671 篇創歷史紀錄,ICML 和 ICLR 也分別突破九千和七千。研究主題從「把模型練更大」轉向「推論時怎麼花算力更聰明」——test-time compute scaling 成為年度最重要的新方向。Best Paper 層面,VAR 用 next-scale prediction 在影像生成上超越 diffusion、Rectified Flow 成為 Stable Diffusion 3 的理論基礎、ICLR 首次頒發 Test of Time Award 給 VAE 原論文。

ai deep-dive AI 頂會導讀

2024 AI 頂會導讀:自然語言處理篇

2024 年的 NLP 頂會在 LLM 全面統治下重新定義自己:ACL 把開放科學列為年度主題、七篇 Best Paper 有四篇在問語言模型的根本能力邊界;EMNLP 則把焦點轉向多語言與跨文化,Best Paper 從語音表徵做到梯度可解釋性。投稿量持續爆炸(ACL+EMNLP 合計破萬),但社群真正焦慮的不是數量,而是當 LLM 能做幾乎所有 NLP 任務時,NLP 研究本身還剩什麼。

ai deep-dive AI 頂會導讀

2024 AI 頂會在收什麼題目:Agent 元年與 Scaling 辯論

2024 年 AI 頂會的關鍵字是 agent、alignment、multimodal LLM 和 inference-time compute——LLM 相關論文在五大會議的佔比從 2023 年的顯著上升再度翻倍,agent 相關關鍵詞成長 4.3 倍,而 diffusion model 從「新興方向」正式晉升為與 LLM 並列的雙主軸。同時,傳統任務導向 NLP 研究持續萎縮,GAN 幾乎從頂會消失。

ai deep-dive AI 頂會導讀

2025 AI 頂會導讀:電腦視覺篇

2025 是 CV 雙會年——CVPR 和 ICCV 同年舉辦。CVPR 投稿 13,008 創歷史新高,Best Paper VGGT 把 3D 重建從逐步最佳化拉到 feed-forward 推論;ICCV 的 Marr Prize 頒給了用文字生成可實際拼搭積木結構的 BrickGPT。3D Gaussian Splatting 全面取代 NeRF、video generation 從研究走向產品、flow model 開始取代 diffusion——CV 領域在這一年完成了多項典範轉移。

ai deep-dive AI 頂會導讀

2025 AI 頂會導讀:機器學習篇

2025 年是 ML 頂會投稿量全面破紀錄、審稿系統承壓到極限的一年。NeurIPS 收了 21,575 篇投稿動用超過兩萬名審稿人,ICML 首度突破 12,000 篇,ICLR 也衝上 11,565 篇。研究主題上,reasoning 與 agent 成為最強勢的兩股潮流——NeurIPS Best Paper 之一直接質疑 RLVR 是否真的帶來新推理能力,拿下該屆唯一滿分;而 attention 機制的結構性改進(Alibaba Qwen 的 Gated Attention)和 neural scaling laws 的理論解釋同時獲獎,標誌著社群正從「衝規模」轉向「理解為什麼有效」。

ai deep-dive AI 頂會導讀

2025 AI 頂會導讀:自然語言處理篇

2025 年 NLP 頂會的投稿量全面翻倍(ACL 8,360 篇、EMNLP 8,174 篇),中國第一作者在 ACL 佔比突破 51%,DeepSeek 的 Native Sparse Attention 拿下 ACL Best Paper——但最值得注意的是會議本身的身份危機:ACL 主席說『ACL 不是 AI 會議』,一篇量化分析問『Has ACL Lost Its Crown?』,EMNLP 被質疑跟 ACL/NAACL 還有什麼差別。

ai deep-dive AI 頂會導讀

2025 AI 頂會在收什麼題目:Agent 爆發與 Reasoning 革命

2025 年 AI 頂會的兩個最強訊號:reasoning 論文從 47 篇暴增到 216 篇(4.6 倍)、agent 相關關鍵詞合計超過 150 篇(4.3–11 倍成長)。Diffusion model 已從「爆發」進入「基礎設施」階段,RAG 以五會議全覆蓋的罕見擴散速度成為企業 AI 的主流架構,而 state space model 和 world model 正複製 2020–2021 年 Vision Transformer 的早期軌跡。純 prompt engineering 論文開始遭遇 reviewer fatigue。

ai deep-dive AI 頂會導讀

獨立研究者投頂會:現實評估

獨立研究者投頂會不是不可能,但數據很殘酷:頂會的單一作者論文比例已降到個位數百分比,平均作者數從 3 人漲到 5 人,前 20 大機構佔了 35-50% 的作者署名。Andreas Madsen 花 8 個月無薪工作拿到 ICLR Spotlight,結果還是得回去讀博。這篇整理實際案例、審稿偏見的研究證據、以及沒有大 lab 資源時的可行路徑。

ai guide AI 頂會導讀

一篇頂會論文從投稿到見刊經過什麼

一篇 AI 頂會論文從投稿到見刊,要走過匿名化投稿、格式審查、reviewer bidding 與分配、3-4 位審稿人獨立評分、author rebuttal、AC/SAC/PC 三層決策、camera-ready 修訂——全程約 4-5 個月。ACL 系列還多了一層 ARR 滾動審稿的「先審後 commit」機制。

ai deep-dive AI 頂會導讀

Main Track、Findings、D&B Track 差在哪:AI 頂會的三條發表路徑

同一篇論文投到同一場會議,可能走三條完全不同的路:Main Track 是最高門檻的正式發表、Findings 是 ACL 系列獨有的「品質夠但沒上主軌」附刊、D&B Track 是 NeurIPS 為純資料集和評測方法論開的專門賽道。三條路在審稿標準、prestige、職涯訊號上差異明顯,投之前搞清楚差別比寫論文本身更重要。

ai deep-dive AI 頂會導讀

誰在投頂會:AI 學術圈的實驗室、企業與地理版圖

AI 頂會的論文版圖正在劇烈重組:企業研究院主導前沿模型開發(2024 年近 90% 的 notable model 來自業界),但學術界仍是高引用研究的最大產出方;中國高校五年內從追趕者變成 NeurIPS 論文量佔比近半的主力;OpenAI、Anthropic 等公司則幾乎從頂會論文名單上消失——發表量與研究能力的脫鉤,是這個時代最值得注意的訊號。

ai deep-dive

Marin 535B 怎麼訓:Scaling Ladder、MoE 專家並行、Harrier 資料與 W&B 現場

Stanford Marin 在 11×GB200 上公開訓練 535B-A23B,先用 1% 算力的 5 階 Scaling Ladder 預註冊 paloma macro-loss 2.04,再以 W&B 即時公開 847 組訓練數據;本文按訓練流程拆解其設計與監控方法。

tech guide

AI 模型評測來源指南——怎麼判斷一個模型好不好用

模型廠商的自測數字不能直接信。這篇整理 2026 年最重要的獨立評測平台、領域 benchmark、市場熱度指標和官方來源,說明各自測什麼、怎麼解讀、偏差在哪,附上不同情境的選型該看哪些數字。

tech deep-dive AI 模型家族

Claude——從 AI 安全實驗室到 SWE-bench 冠軍,閉源 Agent 最強選擇

Claude 是 Anthropic 推出的閉源 LLM 家族,以 Constitutional AI 訓練、Agent 能力和 Coding 表現聞名。2026 年 7 月的 Opus 5 以 SWE-bench Verified 96% 拿下 coding 冠軍,Fable 5 則以 LiveBench 83% 領跑通用能力。四層產品線(Fable / Opus / Sonnet / Haiku)從 $1 到 $10 覆蓋不同場景,是系列裡唯一完全沒有開放權重的家族。

tech deep-dive AI 模型家族

Cohere——RAG 原生的異類:Command、Embed、Rerank、Aya 四支柱怎麼選

Cohere 是唯一把生成、檢索、重排、多語言四條線都做成產品的模型家族。Command A 111B 以兩張 GPU 跑 256K 上下文、Embed v4 支援圖文混合檢索、Rerank v4 32K 處理半結構化資料、Aya 覆蓋 101 種語言——四件套為 RAG 而生,這篇拆開每一塊的定位、授權與選型。

tech deep-dive AI 模型家族

DeepSeek——從 MoE 實驗室到 OpenRouter 用量第一的開源王者

DeepSeek 用 MLA + MoE 兩項架構創新把推論成本壓到業界最低,V4 Flash 以 13B 活躍參數跑出接近前端模型的品質,成為 OpenRouter 用量第一。這篇追蹤從 V1 到 V4 的演化、R1 推理線的分叉、以及每個版本該怎麼選。

tech deep-dive AI 模型家族

Gemini——Google 的原生多模態旗艦,1M context 與科學推理的雙料冠軍

Gemini 是 Google DeepMind 推出的原生多模態 LLM 家族,以 1M context window、原生影片/語音輸入和科學推理能力聞名。3.1 Pro 在 GPQA Diamond 94.1% 和 ARC-AGI-2 77.1% 拿下科學推理雙冠,定價 $2/$12 只有 Claude 的 1/6。3.7 Flash 以 $0.75/$3.75 提供接近 Pro 的 Agent 能力。

tech deep-dive AI 模型家族

GLM——從清華實驗室到 744B 開源旗艦,以及 GLM-5.3 的資安突襲

GLM 是智譜 AI(Z.ai)推出的開源 LLM 家族,源自清華大學 KEG 實驗室。GLM-5.3(2026/08)在 coding benchmark 比前代提升 50%,CyberGym 84.5% 超過 Anthropic Mythos 5 與 OpenAI GPT-5.6 Sol,在 Artificial Analysis Intelligence Index 得分 60 與 Kimi K3 並列開源第一。它是目前唯一完全在華為昇騰晶片上訓練出的前沿開源模型。

tech deep-dive AI 模型家族

GPT——閉源 API 收營收、開源 GPT-OSS 補生態,統一路由架構的全球最大 AI 平台

GPT 是 OpenAI 推出的 LLM 家族,從 2018 年的 117M 參數到 2026 年的 GPT-5.6 Sol/Terra/Luna 三層產品線,擁有超過 10 億使用者和 200 萬企業客戶。GPT-5.6 Sol 在 LiveBench 81.1%、Terminal-Bench 2.1 88.8%、Artificial Analysis Coding Agent Index 80 等多項 benchmark 領先,同時首次推出開源模型 GPT-OSS(Apache 2.0)。

tech deep-dive AI 模型家族

Grok——從 314B 開源賭注到 Grok 4.6/Build/Imagine,xAI 的分發驅動追趕

Grok 是 xAI 的 LLM 家族,2023/07 成立、2024/03 以 314B MoE Apache 2.0 開源起手,兩年半迭代到 Grok 4.6(500K、$2/$6、四檔推理)與 2M 的 Grok 4 Fast;另有 Imagine 圖像/影片與 Grok Build 終端 coding agent——護城河在分發(X / grok.com / Tesla / Bedrock),而非單點模型能力。這篇追蹤 Grok 1→4.6 的演化、子線定位、定價與授權陷阱。

tech deep-dive AI 模型家族

Kimi——從 200K 長文本工具到 2.8T 開源前沿,以及 K3 的架構躍進

Kimi 是月之暗面(Moonshot AI)推出的 LLM 家族,以超長 context 起家。2026 年 7 月發布的 Kimi K3 是全球首個開源 3T 級模型——2.8T 參數、104B 活躍、1M context,在 Artificial Analysis Intelligence Index 得分 60 與 GLM-5.3 並列開源第一。其 Kimi Delta Attention 架構帶來 2.5 倍 scaling 效率提升。

tech deep-dive AI 模型家族

Llama——從開源實驗到部署量最大的開源 LLM,以及 Meta 的閉源轉向

Llama 是 Meta 推出的開源 LLM 家族,以企業部署量最大、生態最成熟聞名。Llama 4 Scout(10M context)和 Maverick(17B active / 400B total MoE)是目前的開源多模態標竿,但 Meta 已在 2026 年 4 月轉向閉源 Muse Spark——Llama 4 很可能是最後一個主要的開源 Llama,且授權不是真正的開源(Llama 4 Community License,月活超 7 億需另外授權)。

tech deep-dive AI 模型家族

Mistral——歐洲的開源 AI 挑戰者:用更小模型和歐洲主權打一場不一樣的仗

Mistral 是歐洲最成功的 AI 新創,以「更小、更快、更便宜」的策略和歐洲資料主權定位在 AI 市場殺出血路。Mistral Large 3 是歐洲最強的商用 LLM,Small 4 是 24B 級別的效率之王,Medium 3.5 則是專為 agentic coding 優化的 Modified MIT 開源模型。它的護城河不是技術規模,而是「歐洲合規」這張牌。

tech deep-dive AI 模型家族

Qwen——從 0.8B 到 2.4T 全尺寸開源,HuggingFace 下載量王者的雙軌打法

Qwen 是 HuggingFace 下載量最高的模型家族,尺寸從 0.8B 一路涵蓋到 2.4T。2026 年 8 月阿里首度開源 Max 級旗艦權重(Qwen3.8-2.4T-A95B),但授權換成了自訂條款而非慣例的 Apache 2.0;同期開源、筆電就能跑的原生視覺模型 Qwen3.8-27B 反而是新面孔裡唯一的 Apache 2.0。這篇追蹤 Qwen 從 2023 年到 3.8 世代的演化、開源線與商用線的分家邏輯,以及每一層該怎麼選。

tech guide AI 模型家族

AI 模型用途總覽——2026 年你該知道的模型地圖

2026 年 AI 模型按用途分成七大類、20+ 個子用途。這篇是「AI 模型家族」系列的導讀地圖——從用途找模型、從模型找家族,附每個用途的選型建議和最新排名。

Antigravity CLI:Google 用閉源 Go binary 取代十萬星開源 Gemini CLI

2026 年 5 月 Google I/O 宣布 Antigravity CLI(agy),用閉源 Go binary 取代 Apache 2.0 的 Gemini CLI。技術上升級——多 agent 編排、原生沙箱、毫秒啟動——但免費額度砍 98%、開源轉閉源、28 天過渡期,社群反應強烈。

Grok Build:xAI 的 Rust Coding Agent,開源之前先把你的 repo 傳上去了

Grok Build 是 xAI 用 Rust 寫的 coding agent,845K 行程式碼、8 個平行子 agent、Arena Mode。2026 年 5 月 beta、7 月開源(Apache 2.0)——但開源的直接原因是隱私事件:它靜默把整個 repo(含 SSH key、.env)上傳到 Google Cloud Storage,27,800 倍的流量比。資料外洩的程式碼至今還在 binary 裡,只靠 server-side flag 關閉。

Muse Code:Meta 的第一個 Coding Agent,用訓練權換八折定價

2026 年 8 月 Meta Superintelligence Labs 發布 Muse Code beta。閉源靜態 binary、Muse Spark 1.2 模型、平行子 agent + worktree 隔離。最大爭議是定價:標準版 $1.25/$4.25 per M tokens,Contributor 版 $0.10/$0.20——便宜 20 倍,但你的程式碼進 Meta 的訓練管線。

自架推論伺服器怎麼選:從 Ollama 到 Xinference,六套工具的定位與取捨

自架推論伺服器分三層:執行引擎(llama.cpp)、服務引擎(vLLM、SGLang)、模型管理平台(Ollama、Xinference、Triton)。選對層級比選對工具重要——先問你的瓶頸在排程還是在部署流程,再決定複雜度放在哪裡。

Xinference:一個平台管 LLM、Embedding、語音與圖像模型的自架推論伺服器

Xinference 把 vLLM、SGLang、llama.cpp、Transformers、MLX 五種後端包在同一個管理層,用 Web UI 和 OpenAI 相容 API 統一管理 LLM、embedding、rerank、語音和圖像模型,適合需要多類型模型共存的自架部署;但管理層的解析邏輯也讓攻擊面比純 serving engine 大(CVE-2026-61539 是案例)。

ai deep-dive AI 頂會導讀

AI 頂會是什麼:CCF、CORE 與 h5-index 為什麼會互相矛盾

「AI 頂會」不是任何機構的官方認證,而是 CCF-A、CORE-A*、Google Scholar 高 h5-index、低接受率四套獨立訊號的社群共識交集——而這四套訊號經常互相矛盾,ICLR 完全不在 CCF 名單裡就是活生生的例子。

tech deep-dive

Agent Platform 深度解析(八)— Context/Memory 與 Cloudflare 部署:本機開發到生產環境的零縫隙遷移

Agent Platform 採 Cloudflare-first 架構:本機 `npm run dev` 跑 Node 模擬,生產映射到 Workers + Workers Assets + D1 + KV + R2 + Vectorize + Queues + Workflows + Durable Objects + Workers AI。Runtime 介面相同(InMemory → Cloudflare 實作),上層零感知遷移。部署只需 `wrangler login` → 建資源 → 填 ID → `wrangler secret put` → `wrangler deploy`。CI/CD 監聽 main 分支,跑 typecheck + build + dry-run + migration + deploy。

tech deep-dive

Agent Platform 深度解析(七)— Evaluation & Quality Gates:全維度評測、Regression Prevention 與技能發布免疫系統

Evaluation 是 Agent Platform 的「品質免疫系統」:不只是事後統計,而是內建於執行流程的 Pre-run/In-run/Post-run 三階段把關。7 類 Eval 全覆蓋 Flow→Step→Skill→Artifact→Evidence→Policy→Regression。Skill 發布必須通過 Trigger→Functional→Policy→Regression→Human Review 五關,任一失敗即阻擋。Learning Loop 從 Run 捕獲 Signal → 產生 Proposal → Human Review → Sandbox Eval → Quality Gate → Publish,嚴守「Agent 提案、人類審核、Eval 閘門」鐵律。

tech deep-dive

Agent Platform 深度解析(二)— Flow Runtime:版本化流程、Checkpoint 與 Resume/Retry 機制

Flow Runtime 是 Agent Platform 的心臟:Flow 發布即不可變、Run 綁定具體 version+preset、Step 以 DAG 邊緣條件流轉、每個邊界存 checkpoint、支援 resume/retry-step 不丟失 trace 歷史。

tech deep-dive

Agent Platform 深度解析(六)— Observability、Evidence 與 Artifacts:結構化 Trace、Claim-to-Source 追溯與版本化產出

Observability 不是事後加的 log,而是第一公民:結構化 Trace 連結 FlowRun→StepRun→SkillInvocation→ProviderCall→ToolInvocation→GuardResult→EvidenceItem→ArtifactVersion。Evidence Store 讓每個 claim 追溯到 source/excerpt/citation/confidence/conflict。Artifact 版本化支援 approve/reject/regenerate 不刪除歷史。Context Snapshot 按類別分配 token budget,超額自動壓縮記錄決定。Memory 分 procedural/episodic/semantic 三類,寫入需 proposal 經人工審核。

tech deep-dive

Agent Platform:開源 AI Workflow Control Plane 深度解析(一)— 架構與定位

Agent Platform 把 AI agent 從「空白聊天視窗」升級為「可定義、可版本化、可觀測、可驗證、可改進」的結構化工作流平台,內建 Deep Research seed flow 示範完整閉環。

tech deep-dive

Agent Platform 深度解析(五)— Policy Engine:Runtime Guards、Budget Control、Human Approval 與 Loop Protection

Policy Engine 是 Agent Platform 的「憲法與執法者」:Policy 版本化綁定 Flow/Preset、四層 Guard 在 step boundary 強制執行、Budget 多維度限制(cost/tokens/runtime/iterations/tool_calls)、External write 必須人工核准、Loop detection 自動熔斷、Escalation 記錄可審計軌跡。配置驅動而非硬編碼,新增規則只改 JSON。

tech deep-dive

Agent Platform 深度解析(四)— Provider Router & MCP:多 Provider 路由、Fallback 鏈與 OpenAI 相容 Proxy

Provider Router 是 Agent Platform 的「模型與工具網關」:統一 30+ providers、MCP tool discovery、step-local 權限控制、fallback chain with RRF fusion、OpenAI 相容 Proxy 讓現有 SDK 零改動接入。配置驅動而非硬編碼,provider 健康度感知路由。

tech deep-dive

Agent Platform 深度解析(三)— Skill System:版本化能力包、顯式綁定與 Learning Loop 閉環

Skill = 可版本化、可安裝、可審計的能力包。雙檔架構分離 metadata 與指令,顯式綁定替代模型路由,invocation 全記錄。Learning Loop 從 run 產生 signal → proposal → sandbox eval → human review → publish,嚴守「Agent 提案、人類審核、Eval 閘門」原則。

tech deep-dive

Groundlane 實戰系列(篇 1):為什麼 AI 代理需要一個受控的網路存取層

Groundlane 是一個開源 TypeScript 遠端 MCP 伺服器(v0.1.0),以單一穩定合約為 AI 代理提供 web_search、web_fetch、web_extract 三種能力,並把身份驗證、提供者替換與資源限制留在操作者邊界內。

tech deep-dive

Groundlane 實戰系列(篇 2):三個 MCP 工具的參數、回傳與錯誤處理

以實際呼叫範例說明 web_search(十適配器、RRF 合併、雙提供者預設)、web_fetch(format/render 策略、finalUrl 來源證據)、web_extract(CSS selector 結構、無 LLM 隱式步驟),並整理回傳結構與錯誤邊界。

tech deep-dive

Groundlane 實戰系列(篇 3):與傳統方案的對比 — WebFetch、stealth_fetch、puppeteer 與 requests

從確定性、可替換性、身份邊界、維運成本四維度比較 Groundlane 三工具與傳統本機方案(WebFetch、stealth_fetch、puppeteer、requests),指出各方案適合與不適合的場景。

tech deep-dive

Groundlane 實戰系列(篇 4):在 quidproquo 站內的應用 — 以現有 MCP 工具與流程為事實

以站內 .claude/skills/groundlane 的 usage-modes 流程為事實,說明如何把 web_fetch 與 web_extract 整合進文章參考驗證與每日 digest 資料收集,而不假設未實作功能。

tech deep-dive

Groundlane 實戰系列(篇 5):踩坑與最佳實踐 — timeout、selector、render 模式與安全邊界

整理實戰中最常見的操作陷阱:timeout 與位元組上限導致的 truncated、selector 設計錯誤、render 模式切換的成本與確定性風險、版本變動(v0.1.0 早期預覽)的可重現驗證方式,以及預設安全邊界不可繞過的原因。

tech deep-dive

台股研究 Agent 實戰系列(篇 1):為什麼台股需要自己的研究 Agent

美股 LLM agent 已經捲到近十萬星,台股在 GitHub 上卻連一個破 10 星的都沒有;我把三個 side project 收斂成一個「每個結論都要先過回測」的台股研究 agent,這篇講為什麼。

tech deep-dive

台股研究 Agent 實戰系列(篇 2):LangGraph 並行架構——五個分析師同時開工

五個 analyst 在同一個 superstep 並行 fan-out,延遲是 max 不是 sum;回測與 reflection 擋在 synthesis 前面,讓 LLM 只能解釋已存在的證據。

tech deep-dive

台股研究 Agent 實戰系列(篇 3):LLM 分層與降級鏈——API、本地 CLI、詞典三層 fallback

只有兩個 role 會叫 LLM,其餘分析師全程程式化;每個 call 依 Anthropic API → 本地 claude CLI → 規則降級的鏈路走,成本只信 provider 回報值,未知成本永遠不當 $0。

tech deep-dive

台股研究 Agent 實戰系列(篇 4):回測查核——為什麼回測會說謊

這個專案的核心規矩:任何 LLM 結論必須先通過同一組訊號的歷史回測,期望值為負時 synthesis 禁止樂觀;四個讓回測說謊的坑各有程式化對策。

tech deep-dive

台股研究 Agent 實戰系列(篇 5):評估方法學:walk-forward、run card 與 50% 的誠實 baseline

我不量測『感覺很準』,我用 walk-forward 凍結參數跑 OOS、run card 記錄每次輸入的 hash、golden eval 留下 5/10 = 50% 的誠實 baseline,讓這個 agent 承認自己還不準。

tech deep-dive

台股研究 Agent 實戰系列(篇 6):讓 LLM 報告的每個數字都可稽核

LLM 寫報告時最容易幻覺的不是觀點而是數字,所以我把所有可信數字建成 SHA-256 定址的 evidence manifest,LLM 只能引用 {{fact.id}},膽敢寫裸數字就整份丟棄回退規則模板。

tech deep-dive

台股研究 Agent 實戰系列(篇 7):Copilot loop——計畫合約、可驗證來源與人類審查

研究請求先變成一份要人批准的 ResearchPlan,外部文件必須完整抓取並驗證逐字引用才能進報告,quant 的審查意見永遠 append-only、free-text 永不回流進 prompt——這是 M5 Copilot loop 的完整樣貌。

tech deep-dive

台股研究 Agent 實戰系列(篇 8):研究到模擬單的邊界:content-addressed 執行合約

用三個 frozen Pydantic 合約把「研究成果」和「下單權限」之間焊死:內容定址、八道硬性閘門、paper-only,agent 永遠摸不到憑證。

tech deep-dive

台股研究 Agent 實戰系列(篇 9):部署邊界——Docker 到 Cloudflare Containers 的公開 API

一個 Python agent 從本機 uv run 到 Docker 到 Cloudflare Containers 公開 API 的完整部署鏈:Worker 擋認證、Container 跑 FastAPI、secret 永遠不進映像檔,10 分鐘沒人用就自動休眠——side project 的正確省錢姿勢。

學術搜尋怎麼組:arXiv、OpenAlex、Crossref、Semantic Scholar 與 PubMed 的分工

學術搜尋不能把五個 API 的結果直接串起來:先用 arXiv/PubMed 做領域發現,再用 DOI、PMID、arXiv ID 對齊 OpenAlex/Semantic Scholar,最後由 Crossref 與 PubMed 關係資料檢查正式版本、勘誤與撤稿。

ai deep-dive

AG2:以對話、GroupChat 與 speaker selection 組織多 Agent 協作

AG2 延續 AutoGen 的 ConversableAgent 心智模型:agent 透過訊息協作,GroupChatManager 再用 round-robin、manual、random 或 LLM 決定下一位發言者。

ai deep-dive

2026 Agent 框架怎麼選:LangGraph、CrewAI、MAF、AG2、Mastra、Pydantic AI、DSPy

七套工具不是同一類產品:LangGraph、MAF 與 Mastra偏耐久工作流,CrewAI 與 AG2 偏多 agent 協作,Pydantic AI 偏型別化 Python agent,DSPy 則用資料與 metric 最佳化整個 AI 程式。先選控制模型,再選框架。

Agent 搜尋 Query 怎麼寫:關鍵字、語意描述、拆解與改寫

Agent 不該把使用者原句直接丟給每一種搜尋服務:先辨認 exact lookup、keyword、semantic 或 fielded search,再把來源、時間、語言與欄位限制放進 provider 原生參數,最後依零結果、結果過廣與來源不對症狀改寫。

ai deep-dive

Amazon Bedrock 深入介紹:把模型 API 放進 AWS 治理邊界

Amazon Bedrock 不只是代售多家模型 API;它把模型呼叫、IAM、Region、Knowledge Bases、Guardrails 與 CloudWatch 串成同一套 AWS 控制面。它最適合已在 AWS 上、治理成本比最低 token 單價更重要的團隊。

ai deep-dive

Arize Phoenix:從 Trace 長出 Dataset、Experiment 與 Evaluator

Phoenix 是 MIT 授權的開源 LLM observability/eval 平台:先用 OpenTelemetry + OpenInference 收 trace,再把 production failure 收進 versioned dataset,以 experiment 比 prompt、model 或 RAG 改動,最後用 code、human 與 LLM evaluator 回寫分數。它不是 Arize AX;自架預設無認證且永久保留資料,正式環境必須先補安全政策。

ai guide 搜尋與爬取實戰

需要登入的網站怎麼交給 Agent:Session、權限與自動化邊界

登入狀態不是方便攜帶的設定,而是一把能冒用身分的鑰匙。安全做法是使用專用低權限帳號與隔離 browser profile,把讀取、可逆寫入、高風險交易拆成三級,MFA 與最後提交留給人。

ai deep-dive

Baseten:從 Truss 打包到 Autoscaling 的模型推論生命週期

Baseten 把自訂模型的打包、GPU 部署、推論引擎、autoscaling 與發布流程收進同一平台;價值不在多一個 OpenAI API,而是讓 ML 團隊保留 runtime 控制權,同時少維護一層 GPU orchestration。

ai deep-dive

Braintrust:把 LLM 評估做成從 Dataset 回到 Production 的迴圈

Braintrust 把 versioned datasets、immutable experiments、scorers 與 production traces 接成同一個評估迴圈;它的價值不是多一個分數,而是把線上失敗送回離線測試。公司在 2026-02 宣布 8,000 萬美元 B 輪,客戶名單為公司自報。

ai guide

Brave Search API 完整指南:用獨立搜尋索引替 Agent 取得網路結果

Brave Search API 以 Brave 自有的網頁索引與排名模型提供 Web、News、Images、Videos 與 LLM Context 五類端點;核心搜尋不只是 Google SERP 的 API 包裝。

ai deep-dive

Browserbase:把 Agent 的瀏覽器拆成可營運的基礎設施

Browserbase 把遠端 Chromium、持久化 Context、代理伺服器與 Session Inspector 包成同一個控制平面;它解決的是瀏覽器艦隊的生命週期與除錯,不替 agent 決定下一步。官方截至 2026-08 自報每月超過 3,500 萬次 browser session、逾 10,000 家客戶。

ai deep-dive

Cartesia 深入介紹:從 Sonic 串流 TTS 到即時語音 Agent Pipeline

Cartesia 的核心是 Sonic 即時 TTS、Ink STT 與串流推論;雖然 2026 年已有 Line voice-agent 平台,選型時仍要分清模型層與電話 orchestration,並把 voice cloning 同意、資料保存與 fallback 自己設計好。

ai deep-dive

Cerebras Inference:把 wafer-scale 速度放進 Agent 迴圈前,先看懂真正的瓶頸

Cerebras 的價值是把支援模型的生成階段大幅加速;但 Agent 的端到端速度仍取決於 prefill、工具 I/O、模型能力與平台相容性。

ai deep-dive

Chroma 向量資料庫完整指南:從本機 RAG 到分散式檢索

Chroma 用 collection 統一管理 embedding、文件與 metadata;本機可嵌入 Python,單機版採 HNSW,分散式版則以物件儲存、SSD 快取與 SPANN 拆分運算和儲存。

ai deep-dive

Claude Code 新創操作手冊:Anthropic 歸納的五條出貨原則

Anthropic 訪談 15 間新創,歸納出 Claude Code 操作五原則:人人出貨、自動化瑣事、信任但驗證、為重建而建、原型到產品化。ClickHouse 多出 30% 功能、Clay 100% 自動化 bug triage、Artemis Security 一週 6,000+ PR。

ai deep-dive

Cloudflare Kitesurf:不是 Chromium 的 Agent 瀏覽器,該拿什麼換規模

Kitesurf 是 Browser Run 內仍在 beta 的非 Chromium 瀏覽器後端:用 Workers isolates、Rust/Wasm 與無狀態元件換低 CPU/記憶體,但犧牲像素相容性、長登入工作階段、WebGL 與完整反機器人能力。

ai deep-dive Cloudflare AI Stack

Cloudflare Sandboxes 深入介紹:Workers、Durable Objects 與 Containers 怎麼組成 Agent 執行環境

Cloudflare Sandboxes 把 Worker 當入口、Durable Object 當具名控制面、獨立 VM 內的 Container 當執行面;適合已在 Cloudflare 上、需要大量短暫 Linux 工作區的 agent,但持久資料、安全邊界與三層費用都得自己設計。

CMU 07-280 全課總結:學會什麼、缺什麼,以及下一門怎麼選

完成 07-280 不等於看完 24 篇導讀;至少要留下搜尋器、監督式模型、CNN/GPT-2 實驗與一個 RL+MCTS 小系統,再依缺口選 07-380、10-301 或專題課。

CMU 07-280 完整課程導讀:搜尋、GPT-2、AlphaZero 為什麼在同一門課?

07-280 是 CMU Spring 2026 首開的 AI+ML 核心:24 講、12 個作業編號,從 heuristic search、CSP 與機器學習一路做到 AlexNet、GPT-2、AlphaZero。教材足以自學,但沒有完整公開錄影、Canvas checkpoint 或 Gradescope 回饋。

CMU 07-280 Lecture 1 導讀:AI、機器學習與表示學習的共同問題

Lecture 1 用 alien autoencoder、AI/ML 範圍與 AI 發展史建立全課座標:智慧系統不是模型清單,而是在不確定下把輸入表示成可計算決策。

CMU 07-280 Lecture 2 導讀:從 UCS、Greedy 到 A* 的 heuristic search

Lecture 2 把搜尋拆成 problem、frontier 與 priority:UCS 看已付成本,Greedy 看估計剩餘成本,A* 用 `f=g+h` 合併兩者;tree 與 graph search 的最優條件並不相同。

CMU 07-280 Lecture 3 導讀:Minimax、Alpha-Beta 與 Expectimax

Lecture 3 把單一路徑改成 contingent plan:minimax 對抗最佳對手,alpha-beta 在不改 root value 下跳過無關分支,expectimax 則用機率取代最壞情況。

CMU 07-280 Lecture 4 導讀:CSP、AC-3 與搜尋順序

Lecture 4 利用 variables、domains、constraints 暴露問題結構,再把 DFS 升級成 backtracking、forward checking、AC-3、MRV 與 LCV;重點是更早證明某些選擇不可能成功。

CMU 07-280 Lecture 5 導讀:用 Loss、Risk 與 ERM 定義機器學習

Lecture 5 把機器學習寫成 `X → Y`、loss、risk 與 empirical risk minimization:訓練集只能提供平均已知損失,真正目標仍是未知分布上的 generalization。

CMU 07-280 Lecture 6 導讀:Decision Trees 如何用 Mutual Information 分裂資料

Lecture 6 從 decision stump 遞迴建樹,用 entropy 衡量 label uncertainty,再以 `I(Y;W)=H(Y)-H(Y|W)`選擇分裂;這是計算可行的 greedy ERM,不是全域最佳樹保證。

CMU 07-280 Lecture 7 導讀:Linear Regression 與 Normal Equation

Lecture 7 把 ERM 套到 linear functions 與 squared loss,從一維 slope 推到矩陣形式 `argmin ||y-Xθ||²`,再在 `XᵀX` 可逆時得到 normal equation。

CMU 07-280 Lecture 8 導讀:Gradient Descent、SGD 與 Learning Rate

Lecture 8 從一維 parabola 推到 vector gradient,再比較 batch GD、SGD 與 mini-batch;learning rate 決定更新是收斂、震盪或發散。

CMU 07-280 Lecture 9:Logistic Regression 如何把分類改寫成機率估計

Lecture 9 不直接預測 0 或 1,而以 sigmoid 建模 P(y=1|x),再用 cross-entropy 與凸最佳化學出參數;多類別版本自然延伸成 softmax regression。

CMU 07-280 Lecture 10:Feature Engineering 與 Regularization 如何交換表達力和穩定性

Lecture 10 先用 φ(x) 讓線性模型表達非線性,再以 train/validation/test 分工、L1/L2 regularization 與 model selection 限制新增自由度造成的過度擬合。

CMU 07-280 Lecture 11:從 Logistic Regression 組出第一個 Neural Network

Lecture 11 把單一 logistic neuron 擴成多層網路:linear layer 產生 z、activation 產生 a,多個 neuron 共同學出 feature transform,再以 loss 和 gradient descent 訓練權重。

CMU 07-280 Lecture 12:Backpropagation 如何重用 Chain Rule

Lecture 12 把神經網路視為 computation graph:forward pass 保存中間量,backward pass 從 loss 開始傳遞 upstream gradient,並用線性層、activation 與 softmax 的局部規則一次算出全部參數梯度。

CMU 07-280 Lecture 13:AI Alignment 從 Reward Hacking 走到可稽核的 AI Scientist

Lecture 13 把 alignment 拆成目標規格、distribution shift、監督與修正能力,並用 autonomous AI scientists 的 benchmark selection、data leakage 與 post-hoc selection 實驗說明:只看最終論文不足以稽核整個研究流程。

CMU 07-280 Lecture 14:CNN 如何把影像的空間結構寫進模型

Lecture 14 以 local connectivity 與 parameter sharing 取代全連接影像模型,從 convolution、stride、padding、pooling 走到 AlexNet、GPU data parallelism、ResNet skip connection 與 BatchNorm。

CMU 07-280 Lecture 15:Pre-training、Transfer Learning 與 Fine-tuning 的分工

Lecture 15 將 pretrained model 拆成 representation g 與 task head h:可以凍結 g 只訓練 head,也能用較小 learning rate fine-tune 部分或全部參數;選擇取決於資料量與 source-target 差距。

CMU 07-280 Lecture 16:Maximum Likelihood 如何統一 Logistic 與 Linear Regression

Lecture 16 從 likelihood p(D|θ) 出發,以 i.i.d. 將聯合機率寫成乘積,再用 log 變成和;Bernoulli MLE 得到樣本比例,conditional Bernoulli 得到 logistic cross-entropy,Gaussian noise 則得到 squared error。

CMU 07-280 Lecture 17:從 Tokenization 到 N-gram Language Model

第 17 講先決定文字如何切成 token,再用 N-gram 把序列機率改寫成可從 corpus 計數的條件機率;tokenization 不是前處理小事,而是模型能看見什麼的第一個設計決定。

CMU 07-280 Lecture 18:N-gram 如何訓練、取樣與失敗

第 18 講把 chain rule 截成 N-gram Markov assumption,以 corpus counts 做 MLE,再比較 greedy、categorical sampling 與 temperature;真正的瓶頸是未見 context 的零機率與固定視窗。

CMU 07-280 Lecture 19:Word Embedding 如何把下一詞預測變成幾何

第 19 講以兩個 embedding matrices、dot-product similarity、softmax 與 cross-entropy 建立最小 next-token model,讓相似 context 透過共享向量參數取代 N-gram 的獨立計數格。

CMU 07-280 Lecture 20:從 Position Encoding 推到 Causal Self-Attention

第 20 講先把單 token embedding 擴成 sequence,以 positional encoding 補順序,再推導 Q/K/V scaled dot-product attention、causal mask 與 multi-head blocks,最後接到 GPT-2。

CMU 07-280 Lecture 21:Bellman Equation 如何解 Markov Decision Process

第 21 講把隨機序列決策寫成已知 dynamics 的 MDP,以 Bellman backup 定義 value 與 Q-value,再用 value iteration 或 policy iteration 求最佳 policy。

CMU 07-280 Lecture 22:不知道 Dynamics 時如何做 Q-learning

第 22 講保留 MDP 骨架,拿掉已知 transition 與 reward 的假設;TD learning 用一步 sample 更新 value,Q-learning 再以 off-policy target 直接學最佳 action values。

CMU 07-280 Lecture 23:從 Approximate Q-learning 到 DQN

第 23 講以 Qθ(s,a) 取代巨大 Q-table:先用 features 線性近似並由 squared TD error 推導 gradient update,再以 replay data 與固定 target network 形成 DQN。

CMU 07-280 Lecture 24:Monte Carlo Tree Search 如何接上 AlphaZero

Spring 2026 Lecture 24 是 MCTS,不是 Fall 2026 的 LLM post-training;本講以 selection、expansion、rollout、backup 與 UCB 分配模擬,再由 policy/value heads 與 self-play 接到 AlphaZero。

CMU 07-280 階段複習一:從搜尋問題走到監督式學習

第一階段把 Lectures 1–12 串成同一條決策鏈:先定義狀態、動作與目標,再用 heuristic、loss、regularization 與 backpropagation 控制龐大搜尋空間。

CMU 07-280 階段複習二:用 AlexNet 與 GPT-2 把模型真正組起來

第二階段不把 CNN 與 Transformer 當兩份架構圖背誦,而是透過 HW8 與 HW11 檢查表示、計算圖、訓練、遷移與生成是否真的接得起來。

CMU 07-280 階段複習三:從 MDP、Q-learning 到 AlphaZero

第三階段把 value、policy、bootstrapping、function approximation 與 MCTS 接成 AlphaZero:network 提供先驗與估值,search 改善決策,self-play 再產生下一輪資料。

CMU 11-785 Lecture 1:導論:從感知器到深度網路

Spring 2026 Lecture 1 聚焦神經元、感知器、連結主義與深度學習問題設定;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 2:神經網路作為通用近似器

Spring 2026 Lecture 2 聚焦布林電路、網路寬度與深度,以及表示能力不等於可訓練性;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 3:訓練一:學習與經驗風險最小化

Spring 2026 Lecture 3 聚焦資料分布、假設、損失、經驗風險與泛化之間的角色;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 4:訓練二:梯度下降

Spring 2026 Lecture 4 聚焦梯度、學習率、參數更新與線性神經元的訓練;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 5:訓練三:反向傳播

Spring 2026 Lecture 5 聚焦計算圖、chain rule、局部導數與梯度重用;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 6:訓練四:收斂、損失曲面與動量

Spring 2026 Lecture 6 聚焦非凸損失曲面、曲率、鞍點與 momentum 的累積方向;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 7:訓練五:SGD、batch size 與二階方法

Spring 2026 Lecture 7 聚焦full batch、mini-batch、隨機梯度與二階資訊的成本取捨;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 8:訓練六:最佳化器與正則化

Spring 2026 Lecture 8 聚焦AdaGrad、Adam、正則化、BatchNorm、Dropout 與 loss 選擇;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 9:卷積神經網路一

Spring 2026 Lecture 9 聚焦局部連接、權重共享、卷積核與特徵圖;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 10:卷積神經網路二

Spring 2026 Lecture 10 聚焦stride、padding、receptive field 與多通道卷積;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 11:卷積神經網路三

Spring 2026 Lecture 11 聚焦卷積架構堆疊、特徵階層與設計取捨;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 12:卷積神經網路四

Spring 2026 Lecture 12 聚焦CNN 訓練、架構選擇與視覺模型的整體串接;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 13:循環神經網路一

Spring 2026 Lecture 13 聚焦序列狀態、時間展開、參數共享與 recurrent computation;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 14:循環神經網路二

Spring 2026 Lecture 14 聚焦時間反向傳播、梯度穩定性與 LSTM 類 gated memory;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 15:Seq2Seq 與 CTC

Spring 2026 Lecture 15 聚焦可變長輸入輸出、對齊未知問題與 CTC 目標;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 16:CTC blank 與 beam search

Spring 2026 Lecture 16 聚焦blank、collapse 規則、前綴機率與近似解碼;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 17:語言模型與翻譯

Spring 2026 Lecture 17 聚焦自回歸機率分解、條件語言模型與翻譯解碼;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 18:Attention 與 Transformer

Spring 2026 Lecture 18 聚焦query、key、value、scaled dot-product attention 與 Transformer block;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 19:Transformer 與後續架構

Spring 2026 Lecture 19 聚焦encoder/decoder 結構、mask、residual path 與架構變體;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 20:大型語言模型

Spring 2026 Lecture 20 聚焦規模化自回歸模型、訓練階段、推論與能力邊界;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 21:表示學習與 autoencoder

Spring 2026 Lecture 21 聚焦瓶頸表示、重建目標、降維與表示品質;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 22:變分自編碼器

Spring 2026 Lecture 22 聚焦latent variable、ELBO、KL 項與 reparameterization trick;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 23:擴散模型

Spring 2026 Lecture 23 聚焦forward noising、reverse denoising、score/noise prediction 與採樣;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 24:生成對抗網路

Spring 2026 Lecture 24 聚焦generator、discriminator、minimax objective 與訓練不穩定;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 25:圖神經網路

Spring 2026 Lecture 25 聚焦message passing、aggregation、node representation 與 permutation symmetry;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 26:強化學習

Spring 2026 Lecture 26 聚焦state、action、reward、return、value 與 policy learning;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 27:Hopfield 網路

Spring 2026 Lecture 27 聚焦聯想記憶、能量函數、固定點與 pattern retrieval;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 28:Boltzmann machine

Spring 2026 Lecture 28 聚焦能量式機率模型、隨機單元、partition function 與學習困難;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 深度學習完整課程導讀:28 講能看,作業鏈卻不完整公開

CMU 11-785 Spring 2026 的 28 講內容都有官方 slides 與 YouTube,另有大量公開 bootcamp/recitation;但 HW1–4 的核心規格、starter 與評測依賴 Autolab、Piazza 和 Kaggle。

ai deep-dive

Python coding agent 實戰 M11:為什麼 exec 迴圈做不出 Claude Code 的對話體驗

要做出 Claude Code 或 Codex 的 TUI,關鍵不是滿版配色,而是長生命期 session、typed transcript 與 tool-boundary approval。

ai deep-dive

Cognee 完整介紹:把文件變成 Agent 可查詢的知識圖記憶

Cognee 是資料到 AI memory 的 pipeline:用 relational store 保存來源與 provenance、vector store 找語意相近內容、graph store 表達 entity 關係,再以 remember、recall、improve、forget 管理生命週期。

CS124 Week 1 Introduction and Setup:先把語言問題拆成可計算的元件

CS124 Winter 2026 第一週不是先教 Transformer,而是先畫出從斷詞、分類、檢索到語音與網路的十週路線,並用 PA0 建好後續九週共同使用的 Jupyter 環境。

CS124 Week 10 PageRank and Social Networks:從 anchor text、圖中心性到課程收束

Week 10 以 anchor text、PageRank 與 centrality 分析 Web graph;post-training、多語與 speech 只歸於檔名及內容標示 2025 的公開 final deck outline,不歸為 2026 現場內容。

CS124 Week 2 Words, Tokens, Edit Distance, and N-grams:LLM 之前先決定模型看見什麼

Week 2 把文字處理拆成三層:以 BPE 建立 token 詞彙、以動態規劃求最小編輯距離,再以 n-gram 近似序列機率;PA1 把正規表示式與 BPE 變成可執行作業。

CS124 Week 3 Logistic Regression and Text Classification:從特徵到機率與 loss

Week 3 用 logistic regression 串起文字特徵、sigmoid 機率、cross-entropy loss 與 gradient descent,讓分類不只輸出標籤,也能說明每個特徵如何推動預測。

CS124 Week 4 Information Retrieval:從倒排索引、tf-idf 到 RAG 的檢索底座

Week 4 從倒排索引建立候選集,以 tf-idf 與 cosine similarity 排序,再把檢索結果接到生成模型;PA3 要求實作的不是聊天介面,而是 RAG 前半段可檢查的搜尋核心。

CS124 Week 5 Embeddings and Social NLP:語境向量與公開材料的證據邊界

Week 5 的公開材料支持 distributional hypothesis、word embeddings 與 cosine similarity;同週 Social NLP 現場課未錄影且投影片受限,具體 audit 方法只作作者延伸。

CS124 Week 6 Neural Networks and LLMs:從神經元、反向傳播到 decoder-only 模型

Week 6 以公開 neural-network slides 建立 weighted sum、nonlinearity、loss 與 backpropagation,再用檔名標示 2025 的公開 LLM/Transformer deck 連到 decoder-only 架構,不視為 2026 現場逐字內容。

CS124 Week 7 Transformers and Speech Processing:causal attention、生成與未錄現場課的邊界

Week 7 的可公開主線是 PA6a:實作 causal self-attention、訓練 Shakespeare 小型 Transformer、取樣並計算 perplexity;同週 speech live lecture 未錄影,只能保留為明示缺口。

CS124 Week 8 Speech and PA7/Git Lab:把 TTS→STT pipeline 當成可稽核的資訊損失

Week 8 以 PA6b 把文字轉語音再轉回文字,要求分類錯誤、檢查格式遺失與口音偏差;同週 Lab 4 以 Git 與 PA7 協作把課程帶入團隊 agent 專案。

CS124 Week 9 Collaborative Filtering and LLM Agents:從電影相似度到搜尋與記憶工具

Week 9 以 item-item collaborative filtering 產生電影推薦,再把推薦、web search、database 與 memory 包成 LLM agent tools;PA7 同時把模型非決定性、API 預算與團隊協作變成交付條件。

CS224N 第 3 講:矩陣微積分與反向傳播

第 3 講把神經網路訓練拆成計算圖、局部導數與鏈鎖律:forward pass 算結果,backprop 由輸出往回累積梯度,讓每個參數知道自己該往哪裡移。

CS224N 第 11 講:Benchmark 與 LLM 評估為什麼會過期

第 11 講把評估拆成測什麼、怎麼量與何時不再可信:benchmark 會飽和、遭污染或被提示格式左右,LLM judge 也只是帶著自身偏差的模型。

CS224N 第 9 講:Prompting、LoRA 與參數高效微調

第 9 講比較 prompting、pruning、LoRA、prompt tuning 與 adapters:它們都在回答同一題——要讓一個大型預訓練模型適應新任務,究竟需要改多少參數與儲存多少任務狀態?

ai guide Stanford CS224N 導讀

CS224N 第 6 講:把期末專案收斂成可驗證的研究問題

第 6 講先補完 Transformer encoder、decoder 與 cross-attention,再把期末專案拆成題型、評分、研究題目與資料來源;好題目必須能用一個明確 baseline 和指標驗證。

CS224N 第 1 講:NLP 的四次典範轉移

Winter 2026 第 1 講用四個時代整理 NLP:早期探索、符號系統、統計機器學習、深度與自監督學習;重點不是背年表,而是看每個時代如何重新定義語言問題。

CS224N 第 15 講:沒有公開投影片時,如何讀 Agentic Interpretability

第 15 講由 Been Kim 客座談 interpretability,但 Winter 2026 官網沒有公開投影片或 agenda;本文不虛構講授內容,只用官方五篇閱讀建立概念發現、agentic investigation 與新詞彙三條閱讀路線。

CS224N 第 17 講:Multimodality 的官方閱讀地圖

第 17 講由 Luke Zettlemoyer 客座談 multimodality,但官網沒有公開投影片或 agenda;官方閱讀清單可確認三條主線:視覺推理介面、early-fusion token 模型、文字自回歸加影像 diffusion。

CS224N 第 19 講:小模型如何跨過 Scaling Law 的門檻

最後一講把 Open Questions in NLP 2026 收斂成 smart scaling:以 prolonged RL、Prismatic synthetic data、RL as pretraining 與開放協作,讓小模型不只靠增加參數追求推理能力。

CS224N 第 8 講:從 instruction tuning、RLHF 到 DPO

第 8 講解釋預訓練模型如何經 instruction tuning、偏好資料與 RLHF 變成助理,再以 DPO 直接從勝負配對學習;每一步都把人的判斷轉成訓練訊號,也把偏差帶進模型。

CS224N 第 7 講:預訓練、subword 與 in-context learning

第 7 講把預訓練拆成可擴張資料、subword tokenization、三種模型目標與 in-context learning;核心取捨是用通用的自監督目標換取可重用表示,再用下游訊號指定用途。

CS224N 第 10 講:RAG 與 Language Agents 的六個元件

第 10 講從問答與 RAG 進入 language agents,再拆成推理規劃、記憶、工具、資料與評估;agent 不是單一模型,而是模型與外部狀態之間可被逐步檢查的迴圈。

CS224N 第 12 講:Decoding、DeepSeek-R1 與推理訓練

第 12 講先證明輸出策略不是小細節:greedy、beam 與 sampling 會產生不同文字;再由 R1-Zero/R1 走進 PPO、GRPO、DAPO,最後追問長推理何時真的有用。

CS224N 第 13 講:Speculative Decoding 與 Test-Time Scaling

第 13 講從推論效率走到推論能力:speculative decoding 用小模型草擬、大模型驗證;on-policy distillation 處理資料漂移;長上下文與 test-time scaling 則用更多推論資源換取表現。

CS224N 第 4 講:語言模型、RNN 與消失梯度

第 4 講把語言模型定義成下一詞機率分布,再用 RNN 壓縮任意長前文;它同時揭露 recurrence 的核心代價:資訊與梯度都必須沿時間步逐步傳遞。

CS224N 第 16 講:Hallucination、創造力、工作與價值對齊

第 16 講把 NLP 的社會影響拆成四題:模型為何 hallucinate、AI 輔助創作的同質化悖論、工作如何重組,以及價值對齊為何不能化約成單一 reward。

CS224N 第 18 講:Tinker and LoRA Without Regret 材料缺口紀錄

第 18 講由 John Schulman 客座,官方只公布題名 Tinker and LoRA Without Regret、日期與講者,沒有投影片、agenda 或閱讀;因此本篇只保存可確認事實與不可確認清單。

CS224N 第 14 講:Tokenization 如何製造多語言成本差

第 14 講從 word、character/byte 與 subword 切分一路走到 BPE failure cases 和跨語言公平:tokenizer 決定序列長度、運算成本與模型看到的語言單位,因此不是中立前處理。

CS224N 第 5 講:從 recurrence 到 Transformer

第 5 講從 RNN 的長距離與循序瓶頸走到 self-attention,再組成 Transformer;它縮短位置間的資訊路徑並容許平行計算,但付出二次方 attention 成本與位置資訊必須另行注入的代價。

CS224N 第 2 講:word2vec 如何把語意變成向量

第 2 講從 word2vec 的預測任務、目標函數與梯度一路走到 count-based vectors 和評估,核心是:詞義不是查表得到的標籤,而是從上下文分布學出的高維座標。

Stanford CS224V 第 10 講:SPINACH Agent 如何逐步探索 Wikidata 並寫 SPARQL

SPINACH 不一次猜完整 SPARQL,而是搜尋 entity/property、查看 Wikidata entry 與 property examples、執行小查詢,再逐步組合完整查詢;action set 與停止規則是可靠性的核心。

Stanford CS224V 第 12 講:CHURRO 如何讓多語歷史文件變成可搜尋文字

CHURRO 以 HDML 表示整頁文字、版面與 metadata,整合跨世紀多語資料訓練 page-level VLM,再把輸出接到 HistoryGenie,讓檔案館材料能被檢索與對話。

Stanford CS224V 第 14 講:資料受限時,語言模型還能怎麼擴展

最後一講不是完整 LLM 訓練教學,而是資料效率研究:在 compute 充足、資料固定時重看 epochs、batch、ensemble 與 self-training,再研究 synthetic continued pretraining 的可擴展條件。

Stanford CS224V 第 5 講:WikiChat 的七階段 RAG 如何逐條攔下幻覺

WikiChat 不把檢索結果直接交給一次生成,而是形成查詢、檢索、過濾、生成、拆主張、再檢索查核與移除無根據內容,並把檢索與事實性分開評估。

Stanford CS224V 第 1 講:用計算思維把會幻覺的 LLM 變成可靠助理

Fall 2025 第一講把 CS224V 的主線定成計算思維:不要期待一次提示解決可靠性,而要把檢索、形式表示、查核與生成拆成可測試的演算法。

Stanford CS224V 第 2 講:STORM 與 Co-STORM 怎麼把搜尋變成知識策展

STORM 用觀點引導的提問、模擬訪談與大綱建立改善研究廣度;Co-STORM 再把人放進迴圈,讓探索未知問題與共同編修成為系統的一部分。

Stanford CS224V 第 8 講:SLIDERS 如何用自動 schema 分析一整組長文件

SLIDERS 不讓模型直接吞完所有長文件,而是從問題誘導 schema、做語意切塊與情境化擷取、協調重複列,再用 SUQL 查詢產生答案。

Stanford CS224V 第 13 講:ReactGenie 如何讓語音命令與原生 GUI 共用同一個狀態

ReactGenie 以 React 元件加 annotations 暴露資料、動作與視圖,將複合語音命令解析成 DSL,並在同一份 UI context 中產生原生圖形輸出。

Stanford CS224V 第 11 講:把臨床試驗條件翻成 SMT,而不是讓 LLM 直接判資格

這堂把病人紀錄與試驗條件各自轉成 SMT,先以較弱的命題邏輯投影做大規模候選檢索,再用 solver 檢查候選;推理可解釋,但 NL-to-SMT 仍是主要錯誤入口。

Stanford CS224V 第 9 講:自動質性編碼為什麼需要 codebook、型別與人工覆核

自動質性編碼先以 codebook 定義事件型別與 arguments,再把長文分類、結構化抽取和 entity linking 分開;受約束 JSON 能保格式,仍不能取代領域專家的覆核。

Stanford CS224V 第 6 講:資料庫 Agent 為什麼要先做語意剖析

結構化資料 agent 的可靠路線是把自然語言轉成可執行查詢、處理 schema 與列舉值,再把 query execution 和回答生成分開評估;混合資料則要先判斷該走資料庫還是文字檢索。

Stanford CS224V 第 7 講:SUQL 把 SQL 與自由文字檢索放進同一個查詢語言

SUQL 在 SQL 裡加入 answer 與 summary 兩種自由文字函式,semantic parser 產生一個混合查詢,再由 compiler 做 predicate pushdown、top-k 與 lazy evaluation。

Stanford CS224V 第 4 講:任務型 Agent 評估不能只看回答像不像人

CS224V 把任務型 agent 評估拆成狀態更新與完整互動:先測 semantic parser,再讓真人檢查任務完成、知識查詢與動作是否可靠。

Stanford CS224V 第 3 講:用 Genie Worksheets 建立不亂編動作的任務型 Agent

Genie Worksheets 把任務能力宣告成表單式規格,讓 contextual semantic parser 只更新形式對話狀態;查詢、動作與回應由 runtime 依規格執行。

CS336 Lecture 3:Transformer 架構很多,真正穩定的預設值其實很少

第三講比較大量現代 LLM 後得到的不是一張最佳架構配方,而是一組保守共識:pre-norm、RMSNorm、無 bias、SwiGLU、RoPE,以及少數值得偏離預設的推論與穩定性設計。

CS336 Lecture 4:Attention 不只一種,MoE 也不是免費擴大模型

第四講沿著兩種稀疏化拆解現代 LLM:linear/recurrent attention 減少序列維度成本,MoE 讓每個 token 只啟用部分參數;兩者都把理論省下的 FLOPs 換成 routing、平衡與通訊問題。

CS336 Lecture 14:Filtering、Dedup 與資料混合才把 raw web 變成訓練語料

第十四講把 raw documents 經語言辨識、品質與安全 filtering、exact/near dedup、source mixing 送進訓練;每一步都會改變模型分布,而 synthetic instruction 與 agent trajectories 又把資料管線延伸到可執行環境。

CS336 Lecture 13:語料不會從天上掉下來,每個來源都有存取與授權成本

第十三講沿著 Common Crawl、Wikipedia、GitHub、arXiv、書籍與歷代開放資料集追溯語料來源;抓得到不等於可合法使用,raw data 也不等於 training data,來源 provenance 必須先於清理與混合。

CS336 Lecture 12:沒有一個真正的 LLM 評分,只有規則不同的遊戲

第十二講從 perplexity 走到考試、聊天偏好、agent、推理與安全評測;每次換 benchmark 都同時換了能力定義、scaffold、judge 與污染風險,因此評分前必須先說清楚到底在比較 method、model 還是完整 system。

CS336 Lecture 5:GPU 快不是因為每個 thread 快,而是資料少搬幾次

第五講從 SM、warp 與記憶體階層解釋 GPU,再用低精度、fusion、recomputation、coalescing 與 tiling 統一常見優化;FlashAttention 正是這些原則在 attention 上的組合。

CS336 Lecture 10:LLM 推論的核心不是少算,而是少讀權重與 KV cache

第十講把 prefill 與 decode 分開:前者能平行、常受算力限制,後者逐 token 且常受記憶體頻寬限制;GQA/MLA、量化、speculative decoding、continuous batching 與 PagedAttention 都在改寫這條成本。

CS336 Lecture 6:寫 Triton kernel 前,先學會 benchmark 與 profile

第六講把 GPU 原理落到 kernel:benchmark 看不同尺寸如何縮放,profiler 看實際呼叫與時間,再以 Triton 實作 GeLU、softmax、reduction 與 tiled matmul;快的前提是先量對。

CS336 Lecture 17:多模態模型先把影像變成 token,再處理語意與細節的衝突

第十七講把 CLIP/SigLIP、LLaVA、Qwen-VL 與 Chameleon 排成三條路:對比式 encoder 學語意、vision encoder+projector+LM 做理解、離散 image tokens 做生成;解析度、token budget 與 modality balance 是共同瓶頸。

CS336 Lecture 1:從位元組到 tokenizer,先決定什麼值得隨規模成長

CS336 第一講不把「從零打造語言模型」理解成重做所有舊技術,而是先區分 mechanics、mindset 與 intuitions,再用 BPE 示範如何把原始位元組轉成可訓練的 token。

CS336 Lecture 7:從 collective operations 組出資料、張量與管線平行

第七講不從 FSDP API 開始,而是用 broadcast、all-reduce、all-gather、reduce-scatter 與 all-to-all 建立通訊語言,再親手組出 data、tensor 與 pipeline parallelism。

CS336 Lecture 8:ZeRO、FSDP 與 3D Parallelism 怎麼對齊硬體拓撲

第八講把平行化從原語提升到系統設計:ZeRO 逐階切 optimizer、gradient 與 parameter,TP/PP/SP/EP 再分別切 width、depth、sequence 與 experts;組合順序必須服從網路拓撲與動態 activation memory。

CS336 Lecture 2:先算 FLOPs 與記憶體,再談模型跑不跑得動

第二講把模型訓練還原成 tensor、FLOPs、bytes 與時間:用 einops 管維度,以 arithmetic intensity 和 roofline 判斷瓶頸,再用 gradient accumulation 與 activation checkpointing 交換運算和記憶體。

CS336 Lecture 16:RLVR 用可驗證獎勵擴大推理,但 GRPO 不是免費的 PPO

第十六講從 PPO 走到 GRPO 與 RLVR:數學、程式碼和環境結果提供可規模化 reward,避開一般偏好模型的部分 overoptimization;但 group-normalized advantage 會引入難度與長度偏差,rollout infrastructure 也成為主要成本。

CS336 Lecture 9:Scaling law 不是水晶球,是小實驗的外推工具

第九講從資料量與 error 的 log-log 線性關係出發,說明 scaling law 如何比較架構、optimizer、batch 與模型資料配置;Chinchilla 爭議也示範擬合方法、資料範圍與部署目標會改變答案。

CS336 Lecture 11:Scaling law 落地時,learning rate 與 batch 也要一起縮放

第十一講從 MiniCPM、DeepSeek、Qwen 與 Llama 3 的公開 recipe 拆解 scaling 實務:先固定大多數架構比例,再用小規模 sweep 找 learning rate、batch 與 IsoFLOPs 配置;μP 有用,但會被 normalization、optimizer 與 weight decay 破壞。

CS336 Lecture 15:SFT 教模型模仿,RLHF 才開始直接最佳化偏好

第十五講把 post-training 拆成 imitation 與 optimization:SFT 從 instruction-response data 抽出預訓練已有能力,RLHF 用 pairwise feedback 跨過人類示範與偏好之間的落差;PPO 與 DPO 都逃不掉資料偏差、reward overoptimization 和 mode collapse。

ai deep-dive

Daytona Agent Sandbox:把每個 Agent 分到一台可分支的電腦

Daytona 把 sandbox 設計成可啟動、暫停、快照與 fork 的長生命週期電腦;2026 年完成 2,400 萬美元 A 輪,Laude Institute 案例一週建立 3.7 萬個 sandbox。它適合平行評測與 coding agent,但核心開源 repo 已停止維護,不能再把託管版與可自架版視為同一件事。

ai deep-dive

Deepgram Voice Agent API:從串流 STT、Turn Detection 到 TTS

Deepgram 把 streaming STT、LLM orchestration、turn detection、barge-in 與 streaming TTS 放進單一 WebSocket,也保留分開採用語音模型或 BYO LLM/TTS 的路徑。

ai deep-dive

Dify 低程式碼 Agent 平台:從 Workflow 實作到 AI 應用發布

Dify 把模型、Knowledge、視覺化 Workflow、Agent、Plugin 與應用 API 放在共同 workspace;本文會實作一條可測試、發布並由 API 呼叫的最小 Workflow,再說明何時才該換成 Agent。

ai deep-dive

DSPy:用 Signature、Metric 與 Optimizer 編譯 AI 程式

DSPy 不把 prompt 當手寫字串,而以 Signature 宣告任務、Module 決定執行策略,再用資料集與 metric 讓 Optimizer 編譯出較好的提示與示例。

ai deep-dive

E2B Agent Sandbox:把模型產生的程式碼關進可恢復的 microVM

E2B 把 Template、Firecracker microVM 與檔案/程序/網路 API 組成 agent 專用執行層;真正的選型優勢是可暫停並保留記憶體與程序,而不是單純多一個 code interpreter。

ai deep-dive

ElevenLabs ElevenAgents:從即時語音到電話 Agent 的完整生命週期

ElevenLabs 已從 TTS 供應商擴成 ElevenAgents 平台:Scribe Realtime 收音、Flash 合成語音,再把 LLM、turn-taking、工具與電話整合收進同一條即時管線;選型關鍵是你要聲音品質,還是整個 agent 控制面。

ai deep-dive

Fireworks AI:從 Serverless API 到客製模型部署的推論平台

Fireworks AI 把開放權重模型的試用、專用 GPU 部署與 LoRA 客製化放在同一套 API 後面;Serverless 適合低流量起步,On-demand 適合穩定高流量與自有模型,保留容量則換取企業級的容量保證。

ai deep-dive

Flowise 深入介紹:從 Assistant、Chatflow、Agentflow 到 EOL 遷移判斷

Flowise 用 Assistant、Chatflow 與 Agentflow 三個入口涵蓋簡易助理、單一 Agent 和多 Agent 編排;但官方已在 2026 年 8 月封存 repository,並排定 8 月 31 日 EOL,新案不應在沒有維護 fork 與遷移方案時採用。

ai deep-dive

Galileo 深入介紹:Experiments、Evaluators 與 Agent Observability 的完整評估迴圈

Galileo 把 dataset experiment、LLM/code/Luna evaluator、production traces 與 runtime guardrail 接成一個迴圈;適合需要企業級可觀測性與線上介入的團隊,但舊 Protect 名稱已 deprecated,評分模型也不能取代人工校準與應用安全。

2026 下半年 Harness 大戰:八大框架重寫、三家模型商入場,110+ CLI 怎麼看

2026 年 8 月,不只五個框架在動。OMP 2、Pi v2、Opencode 2、dsh、Claude Code 之外,Google(Antigravity CLI)、Meta(Muse Code)、xAI(Grok Build)三家模型商直接下場做 coding agent,加上 Amp、Cline 2.0、Codex CLI Rust 重寫,共八個以上框架同時有架構級變動。再算進 110+ 個 CLI 工具,H2 2026 是 harness 方法論的分裂期。本文從四條架構路線、一個共同方向、一場信任危機拆解。

ai deep-dive

Haystack 深入介紹:用 Component 與 Pipeline 組出可測試的 RAG

Haystack 把 indexing、retrieval、generation 與 evaluation 都做成可替換的 Component,再用 directed multigraph Pipeline 串接;適合要把 RAG 流程當成程式資產測試、版本化與部署的 Python 團隊。

ai deep-dive

Helicone 深入介紹:把 LLM Gateway、請求追蹤與成本分析放在一起

Helicone 是開放原始碼的 LLM Gateway 與觀測平台:請求經過相容端點後,自動留下模型、延遲、token、成本與自訂欄位;它也能用 managed credits 或 BYOK 路由與 fallback。

ai deep-dive

Hugging Face 不只是模型下載站:Hub、Datasets、Spaces 與 Inference 怎麼分

Hugging Face Hub 是以版本化 repository 串起模型、資料集與應用程式的協作層;Datasets 管資料,Spaces 跑展示程式,Inference Providers 與 Endpoints 才負責代管推論。

ai deep-dive

Hyperbrowser 深入介紹:Agent 的 Browser-as-a-Service 執行層

Hyperbrowser 把 Playwright/Puppeteer 的 Chrome session、proxy、stealth、profile 與錄影包成託管 API;它適合要快速擴充真實瀏覽器工作的 Agent,但 profile 憑證、反爬蟲合規與 proxy 流量成本仍由應用端負責。

Jina Reader 完整指南:把網頁轉成 Agent 可讀 Markdown

Jina Reader 把單一 URL 轉成適合 LLM 使用的 Markdown;真正上線時,還要控制渲染時機、正文範圍、token 上限與失敗回退。

ai deep-dive

LanceDB 深入介紹:把向量搜尋嵌進 Arrow 資料工作流

LanceDB 以 Lance 欄式格式保存向量、metadata 與多模態原始資料;OSS 可直接嵌入 Python、TypeScript 或 Rust 程序,資料放大或多人共用時再轉向分散式 Enterprise。

ai deep-dive

LangChain v1 Agents:create_agent、middleware 與 LangGraph runtime

LangChain v1 用 create_agent 提供高階 agent loop,底層由 LangGraph 執行;工具、structured output 與 middleware 是正式擴充邊界。

ai deep-dive

LangSmith 深入介紹:從 Agent Trace 到離線與線上評估

LangSmith 把 LLM 應用拆成 project、trace、run 與 thread,再用 dataset、evaluator 與 experiment 把 production 問題送回離線回歸測試;它可觀測任何 LLM 應用,不要求使用 LangChain。

ai deep-dive

Letta/MemGPT 完整介紹:把記憶管理做進 Stateful Agent Runtime

Letta 延續 MemGPT 的作業系統類比,但它不是單一 memory API:agent state、可編輯的 in-context memory blocks、conversation history 與外部 archival memory 都由 runtime 持久化,模型也能透過工具主動整理記憶。

ai deep-dive

LiteLLM:從 Python SDK 到自架 AI Gateway 的多模型控制層

LiteLLM 不是模型供應商,而是一套可當 Python SDK 或自架 Proxy 使用的統一介面:把 100+ 家 LLM API 轉成一致格式,並在 Gateway 層集中處理路由、fallback、虛擬金鑰、預算與觀測。

ai deep-dive

LiveKit Voice Agents:從 WebRTC Room 到可插話的語音 Pipeline

LiveKit 把語音 agent 建模成 realtime media room 裡的 server participant,再由 AgentSession 串接 STT、turn detection、LLM、TTS 與 interruption。2026 年完成 1 億美元 C 輪、估值 10 億美元;它適合需要 WebRTC、多端 client、電話與可替換模型的產品,但自架 media server 不等於自架整條 AI pipeline。

ai deep-dive

Mastra:把 Agent、Workflow、Memory 與 Evals 放進 TypeScript

Mastra 是 TypeScript agent 框架,將 agent、typed workflow、memory、MCP、tracing 與 scorers 放進同一套 Node.js 開發環境。

ai deep-dive

Mem0 完整介紹:替 AI Agent 加上可控的長期記憶

Mem0 是介於 agent 與儲存層之間的記憶服務:從對話抽出值得保留的事實,以 user、agent、run 分區,再於下一次生成前搜尋;優勢是 API 簡單,風險則是抽取錯誤、過期記憶與權限邊界。

ai deep-dive

Milvus 向量資料庫深入介紹:從 Segment、索引到分散式維運

Milvus 把即時寫入、歷史查詢、索引建置與持久化拆成可獨立擴縮的元件,適合需要大量向量、持續更新與分散式維運的檢索服務;小型專案則常會為這套架構付出過多複雜度。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 1:深度學習的最小骨架

2026 第 1 講從感知器、前向傳播、loss 到 gradient descent,建立後續九講共用的語言。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 2:序列模型:從 RNN 到注意力

2026 第 2 講處理文字、音訊與時間序列中「順序會改變意義」的問題,並連到 Lab 1 的音樂生成。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 3:電腦視覺:卷積如何保留空間結構

2026 第 3 講從影像張量、卷積與 pooling 走到辨識系統,替 Lab 2 的 MNIST 與臉部偵測打底。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 4:生成模型:從潛在空間到 diffusion

2026 第 4 講區分生成與判別問題,整理 VAE、GAN 與 diffusion 的學習目標,並接到 Lab 2 的 DB-VAE。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 5:強化學習:用回報取代標準答案

2026 第 5 講把 agent、environment、state、action、reward 與 policy 接成互動迴圈,理解信用分配與探索。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 6:新前沿:模型之外還要選問題

2026 第 6 講把深度學習放進新應用與真實限制,提醒讀者先定義資料、輸出、評量與失敗條件。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 7:AI 三法則:安全要落在可觀測與評估

2026 第 7 講從 Asimov 的文學法則出發,討論現代 AI 安全協定的限制,以及 trace、測試資料與持續評估。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 8:AI for Science:把領域結構放進學習流程

2026 第 8 講以科學發現循環為主線,說明 simulator、AI emulator 與實驗如何合作,而不是把科學簡化成通用預測。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 9:大規模平行訓練:記憶體與通訊才是邊界

2026 第 9 講從 GPU 記憶體壓力進入 checkpointing、offloading、ZeRO、FSDP 與多種 parallelism,理解擴展不是只加卡。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 1:用 PyTorch 與 LSTM 生成音樂

2026 先完成 PyTorch tensor、autograd 與 module 基礎,再把 ABC 樂譜切成字元序列,訓練 LSTM 逐字生成音樂。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 2:從 MNIST 到 DB-VAE 臉部去偏差

2026 Part 1 用 dense network 與 CNN 辨識 MNIST;Part 2 以 DB-VAE 學習臉部 latent distribution,再調整訓練取樣。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 3:LoRA 微調與 LLM-as-a-Judge 評估

2026 以 LFM2-1.2B 建立 chat template 與生成流程,用 LoRA 做風格調適,再透過 OpenRouter 與 Opik 組合 judge workflow。

ai deep-dive

n8n 深入介紹:從 Trigger、AI Agent 到人工審核與營運

n8n 是 automation-first 平台:先由 webhook、排程或應用事件啟動 workflow,再把 AI Agent 放進其中選工具;真正上線前還要處理 memory、人工核准、credentials、執行紀錄與擴充架構。

ai deep-dive

OpenRouter:一把 API Key 串起多模型與多供應商的 LLM 路由層

OpenRouter 用 OpenAI 相容 API 統一多家模型與推論端點,並把供應商排序、故障切換、BYOK 與零資料保留政策放進同一套路由規則。

ai deep-dive

OpenViking:把 Agent 記憶做成虛擬檔案系統

火山引擎開源 OpenViking 把 agent 的記憶、知識、技能存成 viking:// 虛擬檔案系統,用 ls、tree、find 就能翻。三層載入(L0/L1/L2)讓平均檢索只用 550 tokens,LoCoMo 記憶準確率從 24–57% 提升到 80–83%。

ai deep-dive

Parallel Web Systems:Agent 的搜尋、擷取與深度研究層

Parallel Web Systems 把 Search、Extract 與 Task API 分成三個成本與延遲不同的網路存取層,並以 Basis 把引用、摘錄與信心標到輸出欄位。

ai deep-dive

Patronus AI 深入介紹:從 Evaluator、Experiment 到 Production Monitoring

Patronus AI 把 evaluator 當成可重用評分單元,再接到離線 experiment 與線上 trace;它適合要現成幻覺、安全與多模態評估模型的團隊,但 judge 分數不能取代人工標註、確定性測試或真正的資安驗證。

ai deep-dive

pgvector 深入介紹:把向量搜尋放回 PostgreSQL

pgvector 是 PostgreSQL extension,不是獨立向量資料庫;它用同一份資料模型、交易與維運工具承接精確或近似向量搜尋,代價是索引調校與水平擴充仍屬 PostgreSQL 問題。

ai deep-dive

Portkey:把 LLM 路由、觀測與治理收進同一個 AI Gateway

Portkey 是放在應用程式與模型供應商之間的 AI Gateway:用一個 OpenAI 相容端點統一路由、fallback、用量紀錄、預算與 guardrails,也能自行架設開放原始碼 gateway。

ai deep-dive 私有語料管線

私有語料查詢安全:ACL、刪除傳播與 freshness

私有搜尋的授權必須在候選生成前生效,並把 ACL、刪除事件與來源版本傳到每一份衍生索引;freshness 也要用可量測的事件時間與 SLA 管理。

ai deep-dive 私有語料管線

私有語料搜尋的邊界與架構:先決定資料能去哪裡

私有語料管線的第一個決定不是選向量資料庫,而是列出資料分級、信任區、權限決策點與 freshness SLA;索引、模型和觀測系統都只能收到被允許的最小資料。

ai guide 私有語料管線

私有語料 Retrieval Eval 實測:先把繁中題庫變成可重跑的 benchmark

Repo 已有 20 題繁中/英文 golden dataset,但缺少文件層級 qrels、retrieval run、延遲原始值與執行 script;目前不能誠實報 Recall@k、MRR 或 nDCG 實測分數。本文把缺口整理成可重跑的評估契約。

ai deep-dive 私有語料管線

從來源到索引:私有語料的同步與增量更新管線

私有語料同步的核心不是定時重抓,而是用 canonical ID 固定文件身分、用來源版本與 checksum 判斷變更、用冪等 upsert 寫入,並讓 tombstone 走完所有索引的刪除傳播。

ai deep-dive

Promptfoo 深入介紹:把 LLM Eval 與 Red Team 寫進本機測試迴圈

Promptfoo 用 YAML 把 prompts、providers、test cases 與 assertions 組成可在本機與 CI 重跑的 LLM 評估矩陣,並共用同一套 target 做 red team;它降低測試門檻,但隨機輸出、LLM judge 偏差與 hosted data flow 仍要另外治理。

ai deep-dive

Pydantic AI:用型別、Dependency Injection 與驗證建立 Python Agent

Pydantic AI 把 Agent 寫成 Agent[Deps, Output]:依賴、工具輸入與最終輸出都有型別,模型結果必須通過 Pydantic 驗證。

ai deep-dive

R2R 深入介紹:把 Ingestion、Hybrid Search 與 RAG 包成 API

R2R 把文件匯入、hybrid search、knowledge graph、RAG、Agent 與權限包在 REST API 後面;適合已有產品前後台、只想補上 retrieval service 的團隊。

ai deep-dive

RAG 框架怎麼選:LlamaIndex、Haystack、RAGFlow、Dify、R2R 不是同一層產品

LlamaIndex、Haystack 是以程式碼為主的框架;RAGFlow、Dify 是帶管理介面的平台;R2R 則把檢索系統包成 API 服務。先決定團隊要保留多少 ingestion、retrieval 與營運控制權,再選工具。

ai deep-dive

RAGFlow 深入介紹:從文件解析、Chunk 檢查到可追溯回答

RAGFlow 把文件解析、chunk 人工檢查、retrieval test、聊天與引用放在同一套平台;適合 PDF、表格與版面複雜文件,但部署重量和平台狀態都高於 Python library。

ai deep-dive

Runloop:為程式開發 Agent 設計的 Devbox 執行環境

Runloop 把隔離 microVM、可重現映像、磁碟分支、憑證代理與 eval 放進同一套程式開發 Agent 基建;官方案例已公開單一工作負載突破 10,000 個並行 Devbox。

ai deep-dive

Sail Research:用延遲換成本的 Long-Horizon Agent 推論平台

Sail Research 讓每個推論 request 宣告 completion window,把可等待的背景 Agent 排到較便宜的運算資源;並以 Sailboxes 補上長時間執行環境。

從搜尋結果到可靠引用:URL 去重、來源分級與 Claim-Source Mapping

可靠引用不是在答案後面塞 URL:先把 URL、內容副本與來源獨立性拆開,再用 atomic claim、quote span、snapshot 與可重跑檢查建立 claim-source matrix。

ai guide

SerpAPI 完整指南:多搜尋引擎、結構化 SERP 與非同步查詢

SerpAPI 的核心是代管搜尋結果頁的抓取與解析:用 engine 指定來源,取得結構化 SERP,再自行處理地區、分頁、非同步輪詢與結果驗證。

ai guide

Serper Search API 完整指南:把 Google 搜尋結果變成 Agent 可用 JSON

Serper 是第三方 Google SERP API:用一個 POST 請求取得 organic、knowledgeGraph、peopleAlsoAsk 等結構化 JSON;真正上線前仍要驗證選填欄位、URL、重試與引用證據。

ai deep-dive

Slack Code:多人協作 AI Coding 與 Agent 控制平面的競爭版圖

Slack Code 把 AI coding agent 從開發者的終端搬進 Slack 頻道,讓團隊即時看到 diff、預覽與計畫。但它解決的是管理層的透明度焦慮,不是工程師的生產力瓶頸——真正的戰場在「誰當 agent 的控制平面」。

CS221 Lecture 1:Overview:用資源限制定義智慧

Stanford CS221 Autumn 2025 第 1 講,從 Overview:用資源限制定義智慧建立可操作的 AI 問題表示與演算法直覺。

CS221 Lecture 2:Learning I:從計算圖到線性迴歸

Stanford CS221 Autumn 2025 第 2 講,從 Learning I:從計算圖到線性迴歸 建立可操作的 AI 問題表示與演算法直覺。

CS221 Lecture 3:Learning II:線性分類、特徵與交叉熵

Stanford CS221 Autumn 2025 第 3 講,從 Learning II:線性分類、特徵與交叉熵 建立可操作的 AI 問題表示與演算法直覺。

CS221 Lecture 4:Learning III:深度網路是可重複組合的計算圖

Stanford CS221 Autumn 2025 第 4 講,從 Learning III:深度網路是可重複組合的計算圖 建立可操作的 AI 問題表示與演算法直覺。

CS221 Lecture 5:Search I:先定義狀態,再談搜尋演算法

第 5 講把搜尋問題寫成 state、action、successor 與 cost,並用 acyclic dynamic programming 說明:狀態若遺漏未來所需資訊,再快的演算法也只會解錯問題。

CS221 Lecture 6:Search II:UCS 與 A* 的優先順序

Stanford CS221 Autumn 2025 第 6 講依官方材料拆解 Search II:UCS 與 A* 的優先順序,並標出方法成立的假設與限制。

CS221 Lecture 7:MDPs I:把隨機性放進狀態轉移

Stanford CS221 Autumn 2025 第 7 講依官方材料拆解 MDPs I:把隨機性放進狀態轉移,並標出方法成立的假設與限制。

CS221 Lecture 8:MDPs II:不知道轉移模型時如何學 Q 值

Stanford CS221 Autumn 2025 第 8 講依官方材料拆解 MDPs II:不知道轉移模型時如何學 Q 值,並標出方法成立的假設與限制。

CS221 Lecture 9:MDPs III:直接對 policy 的期望報酬求梯度

Stanford CS221 Autumn 2025 第 9 講從 tabular RL 走到 function approximation,再用 log-derivative identity 推出 REINFORCE,最後落到可執行的 PyTorch 更新。

CS221 Lecture 10:Games I:從 expectimax 到 minimax

第 10 講把單一 agent 搜尋擴成 adversarial game tree:expectimax 對 chance 求期望、minimax 對對手取最差結果,alpha-beta 則在不改答案下剪掉無關分支。

CS221 Lecture 11:Games II:TD learning、同時賽局與 Nash 均衡

第 11 講先用 temporal-difference updates 從遊戲經驗學 value,再從 sequential play 轉向 simultaneous games,以 mixed strategies、minimax guarantee 與 Nash equilibrium 描述穩定策略。

CS221 Lecture 12:Bayesian Networks I:從 joint distribution 到 factorization

第 12 講用 random variables 與 factors 建 joint distribution,再以 Bayesian-network factorization 表達 conditional independence,讓 conditioning 與 marginalization 成為可執行的 probabilistic inference。

CS221 Lecture 13:Bayesian Networks II:Gibbs sampling 與 Markov blanket

第 13 講在 exact inference 太昂貴時改用 Gibbs sampling:每次只重抽一個變數,僅依 Markov blanket 計算 conditional distribution,並以樣本頻率近似查詢機率。

CS221 Lecture 14:Bayesian Networks III:從計數、平滑到 EM

第 14 講從 complete data 的 maximum-likelihood counts 與 Laplace smoothing,走到 latent variables 下交替計算 posterior responsibilities 和更新參數的 EM。

CS221 Lecture 15:Logic I:模型、蘊涵與 SAT

第 15 講分開 propositional logic 的 syntax 與 semantics:model checking 用 satisfying assignments 定義 entailment,SAT solver 找見證,inference rules 則必須同時檢查 soundness 與 completeness。

CS221 Lecture 16:Logic II:量詞讓知識跨越單一命題

第 16 講用 predicates、quantifiers 與 functions 壓縮跨物件知識,再以 substitution、unification 與 definite-clause forward inference 推導結論,同時標出 termination 與 completeness 限制。

CS221 Lecture 17:Language Models:從 next-token prediction 到生成

第 17 講把 language model 定義為 sequence probability 的 chain-rule factorization,對照 n-gram 與 neural conditional models,並說明 sampling、temperature 與 evaluation 如何改變生成結果。

CS221 Lecture 18:AI & Society:效益、誤用、事故與制度

第 18 講用 benefits、misuse、accidents 與 structural harms 分類 AI 社會影響,再把 fairness audits、研究倫理、著作權與平台條款接回可追責的制度選擇。

CS221 Lecture 19:AI Supply Chains:模型背後的資源、勞動與市場

Lecture 19 用 Economics of AI deck 把 AI 的 compute、data、distribution 與組織互補品接到 GDP、勞動與 ideas 的成長路徑。

CS221 Lecture 20:Fireside Chat, Conclusion:把二十講收束成建模選擇

第 20 講是 Percy Liang 談職涯研究、CS221/Stanford 與 AI 未來的 fireside chat;每項歸因都連回官方影片,編者整理則與自動字幕的不確定性分開。

Stanford CS224W 第 1 講:Introduction:為什麼關係資料需要圖機器學習

依 Fall 2025 官方投影片逐段整理第 1 講,涵蓋 課程地圖與工具、圖資料的共同語言、傳統特徵與表示學習,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 2 講:Node Embeddings:從隨機漫步到 node2vec

依 Fall 2025 官方投影片逐段整理第 2 講,涵蓋 編碼器—解碼器觀點、鄰近度與目標函數、隨機漫步,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 3 講:Graph Neural Networks:message passing 的第一個完整模型

依 Fall 2025 官方投影片逐段整理第 3 講,涵蓋 從固定 embedding 到深度編碼器、message passing 框架、聚合與更新,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 4 講:A General Perspective on GNNs:把模型拆成可設計的元件

依 Fall 2025 官方投影片逐段整理第 4 講,涵蓋 GNN 設計空間、訊息、聚合與更新、GraphSAGE,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 5 講:GNN Augmentation and Training:資料、任務與模型怎麼一起設計

依 Fall 2025 官方投影片逐段整理第 5 講,涵蓋 圖資料 augmentation、特徵與結構 augmentation、supervision 與 loss,並標出自學者拿不到的課堂材料。

Stanford CS224W 第 6 講:Theory of GNNs:WL test、GIN 與表達能力的上限

依 Fall 2025 官方投影片整理第 6 講,涵蓋 什麼叫可區分、Weisfeiler–Lehman test、message passing 的上界,並標出無法公開取得的課堂材料。

Stanford CS224W 第 7 講:Designing Powerful Graph Encoders:結構辨識與位置辨識

依 Fall 2025 官方投影片整理第 7 講,涵蓋 完美 GNN 的思想實驗、標準 GNN 的三層失敗、identity-aware encoding,並標出無法公開取得的課堂材料。

Stanford CS224W 第 8 講:Graph Transformers:attention 如何接上圖結構

依 Fall 2025 官方投影片整理第 8 講,涵蓋 self-attention 與 message passing、圖上 attention 的範圍、位置與結構編碼,並標出無法公開取得的課堂材料。

Stanford CS224W 第 9 講:Heterogenous Graphs:讓節點與關係類型進入 message passing

依 Fall 2025 官方投影片整理第 9 講,涵蓋 異質圖 schema、relation-specific messages、R-GCN,並標出無法公開取得的課堂材料。

Stanford CS224W 第 10 講:Knowledge Graphs:TransE、ComplEx 與 RotatE 的關係建模

依 Fall 2025 官方投影片整理第 10 講,涵蓋 知識圖譜與 completion、三元組 scoring、TransE 與關係模式,並標出無法公開取得的課堂材料。

Stanford CS224W 第 11 講:GNNs for Recommender Systems:從協同過濾到 LightGCN

依 Fall 2025 官方投影片整理第 11 講,涵蓋 推薦系統的圖表示、matrix factorization baseline、NGCF 的訊息傳遞,並標明公開材料邊界。

Stanford CS224W 第 12 講:Relational Deep Learning:把資料庫直接變成預測圖

依 Fall 2025 官方投影片整理第 12 講,涵蓋 表格 pipeline 的限制、關聯式資料庫轉圖、temporal entity graph,並標明公開材料邊界。

Stanford CS224W 第 13 講:Advanced Architectures in RDL:RelGNN 與 Relational Graph Transformer

依 Fall 2025 官方投影片整理第 13 講,涵蓋 RDL 的多關係瓶頸、RelGNN composite message passing、relation-specific aggregation,並標明公開材料邊界。

Stanford CS224W 第 14 講:Advanced Topics in GNNs:圖上 in-context learning 與不確定性

依 Fall 2025 官方投影片整理第 14 講,涵蓋 relational foundation model 的目標、zero-shot relational transfer、PRODIGY 的 prompt graph,並標明公開材料邊界。

Stanford CS224W 第 15 講:Foundation Models for Knowledge Graphs:新實體、新關係與雙重等變性

依 Fall 2025 官方投影片整理第 15 講,涵蓋 transductive KG embedding 的邊界、entity-inductive link prediction、relation graph,並標明公開材料邊界。

Stanford CS224W 第 16 講:LLM + GNN:讓語言模型讀圖,也讓圖模型讀文字

依 Fall 2025 官方投影片整理第 16 講,涵蓋 LLM 與 GNN 的互補缺口、text-attributed graphs、LLM as predictor or encoder,並標明公開材料邊界。

Stanford CS224W 第 17 講:Agents + Graphs:讓 agent 在結構化世界中檢索、規劃與行動

依 Fall 2025 官方投影片整理第 17 講,涵蓋 從 graph QA 到 agent、STaRK 的多模態檢索、工具使用與 traversal,並標明公開材料邊界。

Stanford CS224W 第 18 講:Deep Generative Models for Graphs:GraphRNN 與目標導向分子生成

依 Fall 2025 官方投影片整理第 18 講,涵蓋 圖生成問題與資料表示、生成品質的評估、GraphRNN 的 autoregressive factorization,並標明公開材料邊界。

Stanford CS224W 第 19 講:315K 個 GNN designs 如何用 anchor models 排名

Fall 2025 Conclusion deck 在 32 個 tasks 上研究約 315K 個 GNN designs:先跑少量 anchor models,以 ranking 描述 task similarity,再從相似 task 轉移 best designs。

線性迴歸:從 LMS 到局部加權迴歸

線性迴歸不只是一條最佳直線;第一章用平方損失串起梯度下降、常態方程、最大概似估計與局部加權迴歸。

分類與邏輯斯迴歸:從決策邊界到 Newton 法

第二章從 sigmoid 機率模型推導邏輯斯損失,再比較感知器、多類別 softmax 與 Newton 法。

廣義線性模型:用指數族統一迴歸與分類

第三章用指數族、自然參數與連結函數,把最小平方法和邏輯斯迴歸放進同一套建模模板。

生成式學習演算法:GDA、Naive Bayes 與平滑

第四章改從 p(x|y) 與 p(y) 建模,用 GDA、Naive Bayes 和 Laplace 平滑展示生成式分類的力量與代價。

核方法:不顯式展開特徵的非線性學習

第五章把高維特徵的內積改寫成 kernel,讓依賴內積的線性演算法在不顯式建立特徵的情況下學非線性。

支援向量機:間隔、對偶與 SMO

第六章把分類信心形式化為幾何間隔,再用拉格朗日對偶、kernel 與 SMO 建出可實作的 SVM。

深度學習:模組、反向傳播與向量化

第七章把神經網路拆成可組合模組,並用反向傳播與向量化說明深度模型如何有效率地訓練。

泛化:偏差變異、雙降與樣本複雜度

第 8 章把測試誤差拆成不可避免雜訊、偏差平方與變異,再用 uniform convergence 與 VC dimension 說明模型何時能從訓練資料泛化;雙降則提醒我們,參數數量不是萬用的複雜度尺度。

正規化與模型選擇:顯式、隱式與交叉驗證

第 9 章把泛化控制拆成三條路:在損失中顯式懲罰複雜度、利用最佳化器偏好的隱式正規化,以及用未參與訓練的資料選模型;MAP 則說明高斯先驗如何對應 L2 懲罰。

分群與 k-means:交替最佳化的第一個範例

第 10 章用 k-means 建立非監督式學習的第一個完整演算法:交替更新會讓 distortion 單調不增並在數值上收斂,但不保證得到全域最佳解。

EM 演算法:從高斯混合到 VAE

第 11 章從高斯混合模型的軟指派出發,用 Jensen inequality 建立 ELBO,將 EM 解釋為對變分分布與模型參數的交替最大化,再以近似後驗與 reparameterization trick 延伸到 VAE。

主成分分析:投影、重建與降維

第 12 章把 PCA 寫成一個幾何最佳化問題:在單位方向上最大化投影變異,解就是共變異矩陣的主特徵向量;取前 k 個特徵向量,同時得到保留最大變異與最小線性重建誤差的低維表示。

獨立成分分析:從混合訊號恢復獨立來源

第 13 章把 ICA 建模為 x=As:觀測是未知線性混合,目標是估計 W=A^{-1} 恢復獨立且非高斯的來源。變數變換的 Jacobian determinant 進入 likelihood,導出 Bell–Sejnowski 的梯度更新。

擴散模型:正向加噪、反向生成與 ELBO

第 14 章從固定的高斯加噪 Markov chain 出發,學習逐步反轉每個 transition;ELBO 把 reverse-kernel matching 化成加權雜訊預測,連續時間觀點則用 score ∇log p_t 解釋反向漂移。

基礎模型概覽:線性探測、微調與 LoRA

第 15 章比較線性探測、完整微調與 LoRA:差別不只在可訓練參數量,也在表徵是否移動、資料需求與記憶體成本。

表徵學習:對比學習、語意檢索與 RAG

第 16 章把表徵學習連到實際系統:對比目標塑造向量空間,語意檢索在其中找鄰居,RAG 再把取回內容交給生成模型。

大型語言模型:分詞、Transformer、MoE 與 SFT

第 17 章從 next-token loss 推到 Transformer、KV cache、MoE 與 SFT,說清楚 LLM 的訓練目標、架構與推論成本如何連在一起。

LLM 推理:思維鏈與長推理 RLVR

第 18 章把 LLM 推理拆成兩個槓桿:推論時用思維鏈增加計算,訓練時用可驗證獎勵與 policy gradient 學出長推理行為。

強化學習:MDP、價值迭代與連續狀態

第 19 章用 Bellman 方程把長期決策拆成一步更新,並從已知 MDP 的 value iteration 走到模型學習與連續狀態近似。

LQR、DDP 與 LQG:從線性控制到不確定性

第 20 章利用線性動態與二次目標得到可解的 LQR,再以 DDP 處理局部非線性、以 Kalman filter 與 LQG 處理不可直接觀測的狀態。

策略梯度及其變體:REINFORCE 與 PPO

第 21 章從 log-derivative trick 推出 REINFORCE,再用 reward-to-go、baseline 與 PPO clipping 控制 policy-gradient 的高變異與更新幅度。

ai deep-dive

Steel Browser:Agent 的開源瀏覽器 API 與自架邊界

Steel 用 Apache-2.0 runtime 把 Chromium session、CDP、proxy、stealth 與除錯介面包成同一套 browser API;公開 repo 約 7,400 stars,並在 2026 年進入 Stripe Projects developer preview。單機自架適合開發與資料邊界,Cloud 才解決高併發、託管 proxy、CAPTCHA、錄影與 SLA。

ai deep-dive

Together AI:從 Serverless 推論到專屬端點與 Fine-tuning

Together AI 把開放權重模型的 Serverless API、專屬 GPU 端點、批次推論與 Fine-tuning 放在同一平台,適合先按 token 驗證,再在流量或客製化需求成形後升級部署。

ai debug

Claude Code skill 怎麼寫才不吃 context:入口、門檻、成本、來源

把 Anthropic 的 session 成本建議做成全域 skill,第一版就犯了它要防的錯:description 塞滿觸發關鍵字、用檔案數和分鐘數當硬門檻、把「保護主 context」和「省總 token」混成一件事。三輪修正後入口縮到一頁,細節拆進 references,數量門檻換成四個判斷維度,草稿裡的主張則逐條對官方文件查證。

ai deep-dive

Vapi:語音 Agent 的即時編排層,以及電話上線前的安全界線

Vapi 把電話與 Web 音訊、STT、LLM、TTS、tool calls 和 call observability 接成託管 voice runtime;可換 provider,卻不能搬走 Vapi 專屬的即時編排。官方 2026-05 自報已有 100 萬名開發者,並宣布 5,000 萬美元 B 輪。

ai deep-dive

Vercel Sandbox 深入介紹:把 Agent 執行層放進 Vercel 生態

Vercel Sandbox 用 Firecracker microVM 隔離不受信任的程式碼,搭配 Fluid compute、Active CPU 計價與 Vercel OIDC;它最適合已在 Vercel 上運行的 Agent,但網路預設值、記憶體計費與持久化生命週期仍要自己設計。

ai deep-dive

Vertex AI:從模型 API 到 Gemini Enterprise Agent Platform

Vertex AI 不是只有 Gemini API,而是把 200+ 個模型的取用、訓練、評估、部署與治理放進同一個 Google Cloud 控制面;2026 年 4 月後,它的產品與後續藍圖已併入 Gemini Enterprise Agent Platform,但 Vertex AI API、文件路徑與既有資源名稱仍大量存在。

網頁抽取品質實測:Crawl4AI、Firecrawl、Jina Reader 與 Readability 差多少?

抽取工具不能只比 HTTP 200;同一組 20 個 URL 要分別量正文、heading、table、code、link、metadata、雜訊、延遲與成本。本文先公開 corpus、adapter contract 與評分 gate,但因目前缺 Firecrawl credential 與四條同版本 raw run,尚不發佈勝負。

ai deep-dive

Zep 完整介紹:用時序知識圖管理 Agent 記憶

Zep 的核心不是向量化聊天紀錄,而是把 episode 抽成帶有效時間的 entity 與 fact,讓新資訊使舊關係失效但不抹掉歷史;Graphiti 是開源核心,Zep 則是代管與治理層。

career guide

不只有 Upwork:七個值得收藏的海外遠端工作平台

從免費的 We Work Remotely 到只收 3% 菁英的 Toptal,七個平台各有定位——求職型看 FlexJobs、WWR、Remote OK;新創型看 Wellfound;社群型看 Remotive;探索型看 Working Nomads;菁英接案看 Toptal。都比在 Upwork 跟全球低價搶單友善得多。

CS188 Bayes Nets 與 Ghostbusters:看不見 Ghost 時怎麼推論

Lecture 13–18 與 Project 4 從 factor operations、variable elimination 走到 exact inference 與 particle filtering,讓 Pacman 用有雜訊的距離感測追蹤看不見的 ghosts。

CS188 結業路線:把 28 講與 P0–P5 變成作品集

Lecture 26–28 用核監測、AI safety 與課程回顧收尾;校外結業不該只算 autograder 分數,而要為 P1–P5 各留下模型假設、測試證據與失敗分析。

CS188 CSP 與多代理搜尋:Minimax、Alpha-Beta、Expectimax 怎麼選

Lecture 5–8 先用 CSP 練變數、限制與搜尋順序,再由 Project 2 實作 minimax、alpha-beta 與 expectimax;三者差別在對其他 agent 行為的假設。

CS188 決策與機器學習:從 VPI、Naive Bayes 到 Attention

Lecture 19–25 把 rational decisions、VPI 與 ML 接起來,Project 5 再用 PyTorch 實作 regression、分類、CNN、attention 與 optional character-GPT。

CS188 MDP 與強化學習:從 Value Iteration 到 Q-Learning

Lecture 9–12 與 Project 3 用同一個 Gridworld 對照已知模型的 value iteration、未知模型的 Q-learning,以及用 features 泛化的 approximate Q-learning。

CS188 搜尋與 Heuristic:從 DFS、BFS 到 A* 的 Pacman 實作

Lecture 1–4 與 Project 1 把 DFS、BFS、UCS、A*、state representation 和 heuristic 串成同一套搜尋工具;關鍵不是背演算法,而是看清楚 frontier、cost 與 state 各自改變什麼。

Berkeley CS188 Spring 2026:用 P0–P5 六個 Projects 學人工智慧

CS188 Spring 2026 公開 28 組錄影、27 組講義、11 組討論與 P0–P5 六個 projects;P0 是 Python/autograder tutorial,P1–P4 採 Pacman 情境,P5 是一般機器學習任務。

Berkeley CS189 Spring 2025 總覽:用 HW1–7 與 code/data 走完的機器學習,用 Fall 2026 看下一學期

CS189 Spring 2025 公開完整 notes、影片、HW1–7 與 code/data,是目前唯一 A3 自學版;Fall 2026(eecs189.org/fa26)已上線 27 講行事曆但多數教材尚未開放,輪替站舊檔有 404 風險,本文以 Spring 2025 為主、Fall 2026 為對照。

Berkeley CS285 L19–25:探索、RL 理論、多任務學習與開放問題

最後七講從 exploration 與理論界線,經兩講期中複習,走到 advanced exploration、multi-task RL 與仍未解決的研究問題。

Berkeley CS285 作業與期末專案:CPU、GPU、H100 成本分界

五份作業從 CPU 友善的 imitation learning 走到 H100 LLM RL 與六小時 offline RL runs;自學者應按成本分三階段,而非整套照搬。

Berkeley CS285 L1–4:模仿學習、分布偏移與 RL 基礎

前四講從 behavioral cloning 走到 MDP;HW1 再用 MSE policy、DAgger 與 flow matching,讓分布偏移從概念變成可觀察的失敗。

Berkeley CS285 L11–18:從變分推論、LLM RL 到 Offline RL

L11–18 把 control as inference、LLM RL、model-based RL 與 offline RL 接成一條主線,並用 HW4、HW5 呈現兩種高運算成本實作。

Berkeley CS285 L5–10:Policy Gradient、Actor-Critic、DQN 與 SAC

L5–10 用 policy-based 與 value-based 兩條路建立深度 RL 核心;HW2 可用 CPU,HW3 的 Atari 與 HalfCheetah 則約需數小時 GPU。

Berkeley CS285 Spring 2026 導讀:25 講、5 份作業與自學邊界

Spring 2026 CS185/285 公開 25 講投影片、9 組討論課資料、5 份作業與 starter code;當期錄影在 bCourses,HW4 預設 H100,不能把它包裝成零成本公開課。

Berkeley CS288(五):Inference-time Compute、Reasoning 與 Embodied Agents

15–18 組教材把 NLP 模型放進感知、推理、工具與環境迴圈;核心問題從下一個 token,轉成如何分配推論計算並驗證多步行動。

Berkeley CS288(一):從 n-gram、詞表示到文字分類

前四組教材先建立可計數、可表示、可分類的文字模型;A1 再要求從 n-gram、perceptron 做到 NBOW MLP。

Berkeley CS288 Spring 2026 導讀:18 組教材、三份作業與自學邊界

CS288 用 18 組公開投影片與三份作業,從 n-gram 走到 RAG、reasoning 與 agents;錄影需 Berkeley 登入,所以這是一條教材型 A3 路線。

Berkeley CS288(三):Pre-training、Post-training、Generation 與 Evaluation

08–12 組教材把 base model 變成可互動系統:預訓練決定基礎能力,post-training 改變行為,generation 與 evaluation 決定輸出如何被使用與判讀。

Berkeley CS288(四):Retrieval、RAG 與進階架構如何變成一個系統

13–14 組教材把模型接到外部知識;A3 要學生自行蒐集資料、標註 QA、建索引、做 ablation,並在 CPU 與延遲限制下交付 RAG。

Berkeley CS288(二):Sequence Models、Seq2Seq 與 Transformer

05–07 組教材把固定向量的分類器推進序列狀態、encoder-decoder,再用 attention 與 Transformer 改寫資訊路徑。

CMU 07-380 Fall 2026 總覽:首開 26 講從邏輯與規劃到擴散模型,HW 與 Project 尚未全開放

07-380 Fall 2026 是 CMU AI 新制第二門首開,26 講涵蓋邏輯、規劃、優化、機率圖、生成式與系統,Lec01 與 Prop Logic 已公開;HW1-7、Quiz×6 與 Final Project 多數尚未釋出,本文以 A2→A3 過渡版對照 07-280 的銜接與校外自學邊界。

CMU 10-301 HW1:先用數學與 Python 找出機器學習地基缺口

HW1 是 written+programming 作業:用機率、微積分、線代與 CS 題組檢查地基,再實作 majority-vote classifier。

CMU 10-301 HW2:從資訊量手算到完整 Decision Tree

HW2 要先用 entropy 與 mutual information 手算切分,再完成建樹、預測與評估的端到端分類器。

CMU 10-301 HW3:比較 K-NN、Perceptron 與 Linear Regression

HW3 是純 written 作業,以 decision tree 回顧,再比較 K-NN、Perceptron 與 Linear Regression 的 inductive bias、誤差與 model selection。

CMU 10-301 HW4:把 Logistic Regression 從 likelihood 寫成分類器

HW4 把機率解釋、cross-entropy 梯度與程式實作綁在一起,驗收的是一條可追蹤的訓練流程。

CMU 10-301 HW5:用 NumPy 拆開 Neural Network 與 Backpropagation

HW5 的價值在於不靠自動微分,親手追蹤 forward shapes、cache 與 backward gradients。

CMU 10-301 HW6:Learning Theory、MLE/MAP 與公平指標

HW6 把 generalization、MLE/MAP、probabilistic learning、公平指標與社會影響放在同一份 written 作業,逼你說清楚假設與取捨。

CMU 10-301 HW7:從基礎神經網路走到 Deep Learning

HW7 在 HW5 的 backpropagation 地基上加入深度模型的架構與訓練問題,重點是診斷而非只把網路加深。

CMU 10-301 HW8:從 MDP 到 Reinforcement Learning 更新規則

HW8 把 state、action、reward、transition 與 value update 接起來,驗收你能否區分環境動態、policy 與估計誤差。

CMU 10-301 HW9:用 Ensembles、k-Means、PCA 與推薦系統收束全課

最後一份 written 作業把 ensemble、clustering、representation 與 recommendation 並列,驗收你能否按問題結構選學習典範。

CMU 10-301/601 Spring 2026:用九份作業學完整機器學習

Spring 2026 的 10-301/601 公開 27 講教材與九份作業包;校外讀者能完成主要實作,但拿不到 Panopto、Piazza、Gradescope 與正式作業解答。

learning deep-dive

CMU AI 核心改制:15-281+10-315 到 07-280+07-380,不只是換課號

CMU 在 2026 年把原本分開的廣義 AI 與 SCS 機器學習入口,重新整合成 07-280 → 07-380;這是內容與先修路線的重切,不是兩門課逐一改名。

Stanford CS107 Lecture 4:Bitwise operators、型別轉換與 bitmask

第四講先釐清 signed/unsigned 轉型不改 bits、混合比較可能改變數值意義,以及 sign extension、zero extension、truncation;再推導 AND、OR、NOT、XOR 與 bitmask 的讀取、設定、清除和集合操作。

Stanford CS107 Lecture 3:整數、位元組與 two's complement

第三講從 32/64-bit 位址空間出發,推導 unsigned 與 two's-complement signed integer 的範圍、反相加一與共用加法硬體,再分清 unsigned modulo 運算和 C signed overflow,最後用四組故障案例檢查模型。

Stanford CS107 Lecture 5:Bit shifts、bit tricks 與 GDB

第五講把 bitmask 推進到 left/right shift、power-of-two 與 popcount tricks,並用 absolute-value 範例揭示 signed intermediate 在 INT_MIN 會 overflow;後半建立 GDB 的 breakpoint、執行控制、格式化 print、memory examine 與 backtrace 工作流。

Stanford CS107 Lecture 2:第一支 C 程式,以及 binary 與 hexadecimal

第二講把 C 放回 Unix 的歷史與開發環境:拆解 header、main、printf、argc/argv,走過 ssh、emacs、make 與執行檔,再用位值系統推導 8 bits = 1 byte、byte 的 256 種 pattern,以及 binary/hexadecimal 的雙向換算。

Stanford CS107 Lecture 1:從課程地圖走進 Unix 命令列

Winter 2026 第一講先回答 CS107 為何要往抽象層底下挖:從位元組、記憶體、組合語言到 heap allocator,再交代作業 40%、lab 10%、期中 20%、期末 30% 的課程制度,最後用 Unix 命令列替後續 C 開發暖身。

Harvard AI/ML 課程導讀:CS50 AI、CS181、CS182 的影片與作業是不是同一版?

Harvard 校外最完整的入口是 CS50 AI,但 Summer 2026 實際沿用 2020 錄影與作業資產,OCW 作業又已更新到不同版本;CS181 Spring 2026 公開當期作業與講義、沒有當期錄影,CS182 Fall 2026 則尚未完成開課。

learning deep-dive

Pacman AI project 血統:Berkeley CS188 與 CMU 15-281 怎麼重組同一套教材

CMU 15-281 的 Search and Games 明確標示源自 Berkeley Pacman AI projects;官方課站另列一份零分 P0 tutorial,以及 P1–P5 五份 programming assignments。

Stanford CS103 Lecture 0:從集合語言走到 Cantor 對角線

從集合的元素、子集合與冪集開始,最後用 Cantor 對角線證明任何集合都不可能和自己的冪集一樣大。

Stanford CS103 Lecture 1:從 even/odd 定義寫出第一個直接證明

用偶數平方與兩奇數相加兩個例題,練習任取、假設、見證與 want-to-show 如何組成可逐行檢查的直接證明。

Stanford CS103 Lecture 2:否定、逆否證明與反證法

本講先精確刻畫蘊涵何時為假,再把量詞否定、逆否命題與反證法變成可檢查的證明工具。

Stanford CS103 Lecture 3:命題邏輯、真值表與等價式

命題邏輯把英文陳述抽象成真假變數,再用真值表檢查連接詞、翻譯方向與 De Morgan 等價式。

Stanford CS103 Lecture 4:一階邏輯的物件、量詞與型別

本講把命題邏輯擴充成能談論物件的一階邏輯:分清常數、predicate、function 與命題的型別,再用存在與全稱量詞表達 some 與 every。

Stanford CS103 Lecture 5:一階邏輯 II——巢狀量詞、否定與唯一性

把自然語言逐層翻成一階邏輯:辨認全稱與存在句型,再處理量詞順序、否定、限制量詞與唯一性。

Stanford CS103 Lecture 6:函數 I,從定義到單射與滿射證明

函數不只是一條公式:定義域、陪域、全域有定義與確定性缺一不可,而 involution、單射與滿射的量詞正好決定證明怎麼寫。

Stanford CS103 Lecture 7:函數 II——滿射、假設與函數合成

本講以滿射與鳥類證明釐清『假設』和『證明』的不同操作,再證明 involution 必為單射與滿射,並把同一套推理帶進函數合成。

Stanford CS103 Lecture 8:用雙射定義基數與 Cantor 對角論證

兩個集合等大,意思是它們之間存在雙射;Cantor 的對角集合則能對任意 S 到其冪集的函數造出一個漏接值。

Stanford CS103 Lecture 9:圖論 I

本講從圖與有向圖的形式定義,推進到獨立集、頂點覆蓋,以及兩者的補集關係。

Stanford CS103 Lecture 10:走訪、圖的補集與鴿籠原理

從 walk、path、cycle 與連通分量出發,以補圖必有一者連通、同度數節點、廣義鴿籠原理及朋友與陌生人定理練習完整證明。

Stanford CS103 Lecture 11:廣義鴿籠原理、Ramsey Theory 與平均負載

以廣義鴿籠原理證明六人派對必有三位共同朋友或共同陌生人,再用平均負載與反證解出電影偏好 puzzle。

Stanford CS103 Lecture 12:數學歸納法、假幣問題與不變量

數學歸納法不是把幾個案例排在一起,而是證明起點成立、任意一步能把真命題傳給下一步,再由歸納原理涵蓋所有自然數。

Stanford CS103 Lecture 13:數學歸納法 II

本講從「從上一講的標準歸納法出發」推進到「起點不必是零」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 14:有限自動機 I

本講從「為什麼先研究一台很弱的電腦」推進到「從裝置行為抽出狀態機」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 15:有限自動機 II

本講從「DFA 的形式定義把前半學期串起來」推進到「regular 語言 是「存在一台 DFA」」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 16:有限自動機 III

本講從「自動機階梯:能力要用語言區分」推進到「DFA transition table 是圖的精確轉寫」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 17:正規表示式

本講從「從 closure 性質 走向描述語言的語法」推進到「regex 是數學表示式,不等於某套程式庫」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 18:非正規語言

本講從「四種 regular 的說法已經等價」推進到「finite memory 的精確直覺」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 19:上下文無關語言

本講從「從有限狀態限制轉向遞迴結構」推進到「arithmetic grammar 的四組規則」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 20:圖靈機 I

本講從「為何 CFG 之後還要換模型」推進到「長加法揭示 local access 原則」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 21:圖靈機 II

本講從「sample TM:從最後一格回看第一格」推進到「TM 能做的工作遠超逐格配對」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 22:圖靈機 III

本講從「recognizer 與 decider 的快速量詞稽核」推進到「為何所有問題都能寫成 語言」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 23:不可解問題 I

本講從「從 R、RE 與 UTM 接回來」推進到「self-reference 回顧的三個程式」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 24:不可解問題 II

本講從「HALT 的定義與位置」推進到「為何 HALT 可辨識」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 25:不可解問題 III

本講從「Lava Diagram 的兩個辨識任務」推進到「Rice's Theorem 的 投影片 版判讀」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 Lecture 26:複雜度理論

本講從「decidable 不等於 feasible」推進到「efficiency 要先選 resource」,依官方例題重建定義、推導與易錯邊界。

Stanford CS103 全課總結:四條知識主線與下一門課

最後一講把證明、圖論、自動機與可計算性重新接起來,再對照會直接使用這些基礎的 Stanford 後續課程。

Stanford CS107 Lecture 15:看懂 x86-64 addressing modes,分清位址和值

CS107 第 15 講把 x86-64 的 mov 拆成 immediate、register、absolute、indirect、displacement、indexed 與 scaled indexed operands,並以 D + R[b] + R[i]×s 統一解讀 pointer dereference 和 array access。

Stanford CS107 Lecture 16:從 subregister 到 ALU,讀懂 x86-64 算術與位元運算

CS107 第 16 講把 b/w/l/q 資料寬度、subregister、movs/movz、lea、呼叫慣例、算術邏輯與 shift 串成一套規則:先確定操作寬度,再追蹤來源、目的與是否真的讀取記憶體。

Stanford CS107 Lecture 18:從 condition codes 到 loops,讀懂 x86-64 條件控制

CS107 第 18 講以 ZF/SF/CF/OF 串起 cmp、test、signed/unsigned conditional jumps,再拆解 if、loops、dynamic instruction count、setcc 與 cmovcc。

Stanford CS107 Lecture 17:從乘除法到 %rip,讀懂 x86-64 control flow

CS107 第 17 講先完成 x86-64 的 full-width multiplication 與 division,再沿著 instruction bytes 追蹤 %rip,最後以 direct/indirect jmp 說明程式如何離開預設的順序執行。

Stanford CS107 Lecture 19:從 call/ret 到 calling convention,讀懂 x86-64 函式呼叫

CS107 第 19 講追蹤 %rsp、push/pop、call/ret、parameters、return values、stack locals 與 caller/callee register discipline,建立可跨函式維持資料與控制流的 ABI 契約。

Stanford CS107 Lecture 14:從 C 到 x86-64,第一次讀懂反組譯輸出

CS107 第 14 講用 sum_array 的 10 條 x86-64 指令拆開反組譯輸出:左側是位址與機器碼,右側是 AT&T assembly;讀者的任務是由 opcode、operand、register 與控制流程還原 C,而不是手寫組合語言。

Stanford CS107 Lecture 7:從字串搜尋到 Buffer Overflow,輸入驗證不是容量檢查

CS107 第 7 講先用 strchr、strstr、strspn 建立指標式字串掃描,再指出只驗證內容仍擋不住 buffer overflow:安全邊界必須同時涵蓋輸入規則、目的地容量、終止字元與記憶體檢測。

Stanford CS107 Lecture 25:Caching、Memory Hierarchy 與 Locality

CS107 第 25 講用精簡投影片建立 cache 的核心模型:記憶體存取成本不均,較小且較快的層級保存可能再次使用的資料,而 temporal 與 spatial locality 決定程式能否受益。

Stanford CS107 Lecture 6:C 字串不是型別,而是一份記憶體契約

CS107 第 6 講把 C 字串拆回 char 陣列、終止空字元與位址:strlen、strcmp、strcpy、strncpy、strcat 的每一個便利,都以呼叫者維持容量與終止條件為代價。

Stanford CS107 Lecture 24:先用 Callgrind 找熱點,再讀懂 GCC 做了哪些最佳化

CS107 第 24 講用矩陣乘法與 Callgrind 建立量測流程,再拆解 GCC 的 constant folding、共同子運算式消除、dead-code elimination、strength reduction、code motion 與遞迴轉迴圈;最佳化從瓶頸證據開始。

Stanford CS107 Lecture 23:把 realloc 留在原地,必須守住哪些 allocator 不變量

CS107 第 23 講把 explicit free list 推進到原地 realloc:縮小時切出可用區塊,放大時吞併右側 free blocks,做不到才配置、複製、釋放;每一步都要同時維持實體 heap 與邏輯 free list。

Stanford CS107 Lecture 12:Function Pointer 讓 Generic C 注入比較規則

CS107 第 12 講先用 char * 完成 byte-wise generic swap 與 rotate,再以 function pointer 把 bubble sort 的走訪機制和比較規則拆開;void * 解決資料型別,callback 解決行為差異。

Stanford CS107 Lecture 13:從 Comparator 到完整 Generic Bubble Sort

CS107 第 13 講把 bool callback 升級成三向 comparator,再把 void *、element width 與 const void * callback 合併成完整 generic bubble sort,最後對照 qsort、bsearch、lfind 與 lsearch。

Stanford CS107 Lecture 11:void * 如何讓 C 擁有泛型,又不假裝型別還在

CS107 第 11 講先收完 calloc、strdup、free、realloc 的 heap 契約,再把 swap 從多份型別專用程式改造成 void * 加 byte count:C 的泛型不是保留未知型別,而是明確交接位址、寬度與解讀責任。

Stanford CS107 Lecture 21:Heap Allocator 的第一個設計,速度與空間為何互相拉扯

CS107 第 21 講從 allocator 的 alignment、throughput 與 utilization 目標出發,以 bump allocator 和 implicit free list 拆解 metadata、splitting、placement、內部與外部碎片,以及 free 後為何必須 coalesce。

Stanford CS107 Lecture 22:Explicit Free List 為何同時活在兩種順序裡

CS107 第 22 講把 implicit free list 改成 explicit free list:搜尋只拜訪可重用 blocks,但每塊 free memory 同時具有實體相鄰順序與邏輯鏈結順序,unlink、coalesce、reinsert 必須共同維持不變量。

Stanford CS107 Lecture 8:指標不是魔法,而是可被複製的位址

CS107 第 8 講從 & 取址與 * 解參照出發,說清楚 C 的 pointer parameter 為何仍是 pass-by-value,以及 int *、char *、char ** 如何分別修改 caller 擁有的 int、char 與 pointer。

Stanford CS107 Lecture 9:Array 不是 Pointer,但它們在運算式裡合作

CS107 第 9 講用 C strings 七條規則拆開 array object、pointer variable 與 string literal:array 常在運算式中退化成首元素指標,但儲存空間、可重新賦值性、可修改性與 sizeof 行為仍完全不同。

Stanford CS107 Lecture 20:Reverse Engineering 之後,先問 Privacy 與 Trust,再進 Heap Allocator

CS107 第 20 講把 reverse engineering 能力放回倫理脈絡:privacy 有個人與社會模型,trust 等於 reliance 加上 betrayal risk;接著複習 process memory,從 malloc client 轉成 heap allocator implementer。

Stanford CS107 Lecture 10:Stack 與 Heap 的差別不是速度,而是 Lifetime 與 Ownership

CS107 第 10 講從 sizeof 與 pointer arithmetic 走進 stack frame lifetime:回傳 local array 會留下 dangling pointer;malloc 讓資料跨越函式返回,但也把 NULL、容量計算、ownership、free 與 memory leak 交給程式設計者。

Stanford CS107 Lecture 26:Wrap-up,六個系統問題與下一站

CS107 第 26 講用六個大問題收束十週內容:representation、text、memory、generics、execution 與 allocation;它以 explicit allocator 檢查學習成果,並把後續路線指向 CS111 與其他 systems 課。

Stanford CS109 Lecture 1|What is Probability?:先把隨機問題列成結果集合,再談事件的機率。

先把隨機問題列成結果集合,再談事件的機率。

Stanford CS109 Lecture 2|Conditional Probability:條件不是裝飾,而是把樣本空間縮到已知資訊仍允許的部分。

條件不是裝飾,而是把樣本空間縮到已知資訊仍允許的部分。

Stanford CS109 Lecture 3|Bayes Theorem:Bayes 定理把容易建模的生成方向,翻成真正想問的推論方向。

Bayes 定理把容易建模的生成方向,翻成真正想問的推論方向。

Stanford CS109 Lecture 4|Counting and Combinatorics:先判斷順序是否重要、元素能否重複,公式才不會套錯。

先判斷順序是否重要、元素能否重複,公式才不會套錯。

Stanford CS109 Lecture 5|Random Variables and Expectation:隨機變數是把結果映成數字;期望值是加權平均,不保證會真的出現。

隨機變數是把結果映成數字;期望值是加權平均,不保證會真的出現。

Stanford CS109 Lecture 6|Moments:期望值、LOTUS 與線性性

期望值把分布壓成加權平均;LOTUS 處理變換後的值,linearity 則讓隨機變數的和即使不獨立也能直接計算。

Stanford CS109 Lecture 7|Variance 與 Poisson:從分散程度到稀有事件計數

先用 variance 描述隨機變數的分散程度,再用 Poisson 處理固定區間內的事件數,以及大 n、小 p 的二項近似。

Stanford CS109 Lecture 8|Continuous Random Variables:PDF、CDF、Uniform 與 Exponential

連續變數的單點機率為零,區間機率是 PDF 面積;CDF、Uniform 與 Exponential 則把面積、等待時間與 memorylessness 串起來。

Stanford CS109 Lecture 9|Normal Distribution:標準化、Φ 與 continuity correction

標準化把不同尺度的 Normal 變數轉成 Z;Φ、線性轉換與 continuity correction 再把區間與大型 binomial 變成可計算的機率。

Stanford CS109 Lecture 10|Probabilistic Models:joint、marginal、independence 與 Bayes

Joint distribution 保存多個變數的完整關係;marginal、conditional、independence 與 Bayes 都是從這份關係表取出不同問題的答案。

Stanford CS109 Lecture 11|Inference:prior × likelihood → normalize

Inference 把 hidden variable 的 prior 逐項乘上 observation likelihood,再正規化成 posterior;同一迴圈可處理多次觀察與離散化的連續 belief。

Stanford CS109 Lecture 12|General Inference:Bayesian networks、sampling 與 rare evidence

Bayesian network 用 conditional independence 分解巨大 joint;ancestral sampling 生成 joint samples,rejection sampling 再以 evidence 篩出 conditional。

Stanford CS109 Lecture 13|Multinomial:多類別計數、bag of words 與 log probability

Multinomial 把 binomial 的兩類計數推廣到多類;同一 PMF 也能把文件視為 word counts,配 Bayes 與 log-score 做 authorship inference。

Stanford CS109 Lecture 14|Beta:把未知 probability 變成可更新的 random variable

Beta distribution 表示對未知成功率的完整 belief;success/failure data 只需更新兩個參數,便能取得 posterior、平滑估計與 Thompson-sampling decision。

Stanford CS109 Lecture 15|Adding Random Variables 與 Central Limit Theorem

少數分布的 independent sums 有 closed form;一般 IID sums 則由 CLT 在大樣本下近似 Normal,離散 sums 還需 continuity correction。

Stanford CS109 Lecture 16|Bootstrapping:sampling statistics、error bars 與 p-values

Bootstrap 把 sample histogram 當作 population proxy,以 replacement 重抽並重算 statistic,近似 estimator 的 sampling distribution、error bar 與 null p-value。

Stanford CS109 Lecture 17|Algorithmic Analysis:conditional expectation、indicators 與 recursion

隨機程式的 expected cost 可依第一個 random choice 分情境;計數問題則拆成 indicators,兩者都靠 linearity,而不必硬求完整 distribution。

Stanford CS109 Lecture 18|Information Theory:surprise、entropy、information gain 與 KL

Surprise 把低機率事件轉成 bits;entropy 是 expected surprise,information gain 選擇最能降低 uncertainty 的問題,KL 則量化錯用 model distribution 的額外代價。

Stanford CS109 Lecture 19|Maximum Likelihood Estimation:固定資料,找最能解釋資料的參數

MLE 固定觀察資料、最佳化參數;log-likelihood 讓乘積變加總,但最大值也可能落在邊界。

Stanford CS109 Lecture 20|Logistic Regression:從 Bernoulli likelihood 推出 gradient

Logistic regression 用 sigmoid 把線性分數變成 Bernoulli 機率,而 gradient xⱼ(y-ŷ) 直接來自 log-likelihood 的 chain rule。

Stanford CS109 Lecture 21|Comparing Classifiers:accuracy 之外還要問 calibration、錯誤成本與 fairness

比較 classifier 不能只看 accuracy;還要用 held-out data、baseline、calibration、precision/recall 與明確的 fairness criterion。

Stanford CS109 Lecture 22|Deep Learning:用 chain rule 推出 backpropagation

Neural network 是堆疊的 logistic units;forward pass 算機率,backpropagation 重用 output error 來計算所有 gradients。

Stanford CS111 Lecture 1:作業系統的歷史、抽象化與三條課程主線

第 1 講沿 1940 年代共用 I/O 卡片、batch processing、multiprogramming 與個人電腦的演變,解釋 OS 的功能如何隨硬體成本與使用者需求逐層增加。

Stanford CS111 Lecture 2:行程與執行緒的執行抽象、狀態與切換

第 2 講先定義行程與執行緒的共享/私有狀態,再用 fork、execvp、waitpid 與 thread creation 說明核心如何建立執行單位。

Stanford CS111 Lecture 3:核心執行緒、使用者執行緒、context switch 與 dispatcher

第 3 講沿 running、blocked、ready 狀態轉移,拆解 PCB、context save/restore 與 dispatcher 如何完成一次 CPU 控制權交接。

Stanford CS111 Lecture 4:交錯執行、race condition、atomicity 與 critical section

第 4 講逐步拆解 Too Much Milk 的失敗排程,從具體 interleaving 推導 race condition、atomicity、critical section 與正確同步條件。

Stanford CS111 Lecture 5:mutex、condition variable 與 Mesa semantics

第 5 講用容量為 8 的環形 Pipe 證明:mutex 只提供互斥;condition variable 才能在 predicate 不成立時原子地釋放鎖並阻塞;Mesa semantics 下,wait 返回後必須用 while 重查條件。

Stanford CS111 Lecture 6:關中斷、原子指令、spinlock 與阻塞式 lock 的實作

第 6 講從單核心關中斷一路修到多核心 v5,追蹤 guard、lock 與 wait queue,說明 atomic exchange、spin、block 與 wakeup 如何避免 race 和 lost wakeup。

Stanford CS111 Lecture 7:Deadlock 的四個必要條件與全域鎖順序

第 7 講用 request/ownership graph 拆出 deadlock 的四個必要條件,再比較 detection、prevention 與 lock ranking;實務上最常破壞 circular wait,但代價是所有模組必須遵守同一個全域順序。

Stanford CS111 Lecture 8:FIFO、round robin、priority 與多核心排程

第 8 講從 FIFO、round robin 與不可實作的 SRPT,推到自適應 priority queues、BSD scheduler,再處理多核心 queue contention、core affinity 與 work-conserving 的衝突。

Stanford CS111 Lecture 9:object file、symbol、relocation、static 與 dynamic linking

第 9 講沿著 source→assembly→object→executable→process,拆解 linker 的三次掃描、symbol relocation,以及 dynamic loader 如何用 jump table 把 shared library 位址延後到啟動時解決。

Stanford CS111 Lecture 10:allocator 介面、free list、fragmentation 與 placement policy

第 10 講從 stack 的可預測 LIFO,推到 heap 的 free lists、first/best fit 與 slabs,再比較 reference counting 和 mark-and-sweep 如何在 dangling pointers、leaks、cycles、fragmentation 間取捨。

Stanford CS111 Lecture 11:Storage Reclamation、Reference Counting 與 GC

第 11 講的官方 PDF 與 Lecture 10 逐位元組相同;本文誠實保留此 artifact 缺口,聚焦後半的 reachability、dangling pointers、leaks、reference-count cycles 與 mark/compact GC。

Stanford CS111 Lecture 12:可信任的定義、隔離、驗證與從不信任建立信任

第 12 講把 trust 定義為自願承受 vulnerability,區分 over-trust 與 untrustworthiness,再用 assumption、inference、substitution 分析 Linux TCB、xz attack 與 AI code policy。

Stanford CS111 Lecture 13:位址空間、relocation、base-and-bound 與保護

第 13 講從 single-tasking 與 load-time relocation 的失敗出發,以 MMU 的 base/bound 建立 virtual/physical address spaces、透明隔離與 traps,再用 segmentation 解開單一連續區域的限制。

Stanford CS111 Lecture 14:segmentation、共享、稀疏位址空間與配置限制

Lecture 14 的官方 PDF 與 Lecture 13 逐位元組相同;本文明示此缺口,聚焦 segmentation 如何以多組 base/bound/protection 支援 growth、sharing、compaction,以及 fixed-count、fragmentation、rigid layout 限制。

Stanford CS111 Lecture 15:page、frame、page table、TLB 與多層頁表

第 15 講以固定大小 pages 消除跨 process external fragmentation,再拆解 x86-64 四層 page-table walk、sharing/aliasing 與 TLB,說明 translation speed、table sparsity、context switch 和 page size 的連動取捨。

Stanford CS111 Lecture 16:Page Fault、Demand Fetching 與 Prefetch

Demand paging 只在需要時載入頁面;present bit、精確例外與可重啟指令讓核心能從 executable、zero-fill 或 backing store 安全補頁。

Stanford CS111 Lecture 17:從 page fault 到 Clock,記憶體滿了該換掉誰?

第 17 講把 demand paging 分成 fetching 與 replacement:MIN 無法預知未來,精確 LRU 成本過高,Clock 只靠 reference/dirty bits 找夠舊的 page;active working sets 放不進 RAM 時,1% fault rate 就可能帶來約 1,000 倍 slowdown。

Stanford CS111 Lecture 18:磁碟幾何、Interrupt 與 DMA

磁碟把機械式 seek 與 rotation 隱藏成線性 block API;現代 I/O 再用 memory-mapped registers、DMA queues 與 interrupts,讓 CPU 只負責下命令和收完成通知。

Stanford CS111 Lecture 19:檔案抽象、配置策略與 FAT

檔案系統把耐久 byte collection 映射到磁碟 blocks;contiguous、linked 與 FAT 分別交換 locality、成長彈性、random access 與 metadata 成本。

Stanford CS111 Lecture 20:多層 Inode、Index Walk 與磁碟排程

4.3BSD inode 用 direct、single-indirect 與 double-indirect pointers 讓 lookup depth 隨檔案大小分級;FIFO、SPTF、SCAN 與 CSCAN 則交換 seek cost、公平性與等待時間。

Stanford CS111 Lecture 21:Block Cache、Free Bitmap 與 Delayed Allocation

Block cache 把熱索引留在 DRAM,bitmap 與保留空間維持配置選擇,fragments 和 delayed allocation 則用較晚、較完整的資訊換取 locality。

Stanford CS111 Lecture 22:Directory Lookup、Hard Link 與 Symbolic Link

Directory 把文字名稱映射到 file-system-local i-number;hard link 共享 inode 與 reference count,symbolic link 則保存 pathname,換得跨檔案系統能力但可能形成 loop 或 dangling link。

Stanford CS111 Lecture 23:從 fsck、Ordered Writes 到 Write-Ahead Logging

檔案系統一次操作會改動多個 block,崩潰卻可能發生在任兩次寫入之間;本講比較 fsck、ordered writes 與 write-ahead logging 如何交換復原時間、效能、耐久性與一致性。

Stanford CS111 Lecture 24:Journaling、Transaction 與 Checkpoint

第 24 講從 WAL 入口往下拆 transaction、idempotent replay 與 checkpoint,說明一致性不等於 durability,journal 也不能取代 fsync 與備份。

Stanford CS111 Lecture 25:Truth, Trust, and Technology——演算法、生成式 AI 與 deepfake 如何改寫信任

第 25 講把 trust 拆成假設、推論與替代三種建立方式,再檢視社群推薦、生成式 AI 與合成媒體如何放大過度信任;實務答案是保留來源、交叉驗證並協調責任。

Stanford CS111 Lecture 26:Flash Translation Layer、Garbage Collection 與 Wear Leveling

Flash 只能逐頁 program、整個 erase unit 清除;FTL 以 out-of-place mapping 隱藏不對稱,再用 garbage collection、temperature segregation、wear leveling 與 TRIM 管理放大成本。

Stanford CS111 Lecture 27:Trap-and-Emulate、Virtual I/O 與 Nested Page Tables

VM 把 process interface 擴成完整硬體介面;hypervisor 讓普通指令直接執行、攔截 privileged operations,並虛擬化 interrupts、I/O 與兩層位址轉譯。

Stanford CS111 Lecture 28:用四個觀念串起並行、記憶體與儲存

第 28 講把整學期收斂成並行、記憶體、儲存三條主線,再用 virtualization、atomicity、locality、layering 四個觀念解釋作業系統如何管理共享資源。

Ably:Channels、Presence 與 Recovery 的全球即時訊息平台

Ably 管理全球 realtime connections、channels、presence 與短期 recovery;application 仍要定義 idempotency、durable business state、token capability 與 offline resync。

AI Agent 代理授權:不要把使用者 Token 直接交給模型

Agent 應以短效、限 audience、限權限的代理憑證執行單一任務,並同時保留使用者與 agent 身分、執行時授權、確認與稽核鏈。

AI Agent 沙箱逃逸與權限邊界:Container 不是 Security Boundary 的全部

Agent execution 要同時限制 kernel、filesystem、process、network、credentials 與 tool authorization;沙箱逃逸只是其中一條路,過寬 API token 往往更直接。

Linode/Akamai Cloud:經典 VPS 產品如何接上 Edge 與 Managed Kubernetes

Linode 現在是 Akamai Cloud Computing 的 compute 基礎;VM、LKE、storage 與 managed database 仍有區域和網路邊界,不能因 Akamai edge 品牌就假設全部整合。

tech deep-dive

Algolia 站內搜尋深入介紹:託管索引、排名與 InstantSearch

Algolia 把索引、即時查詢、facet 與前端元件包成託管服務;上線很快,但資料同步、搜尋品質與用量成本仍要自己負責。

Apache Kafka:不是把訊息排隊,而是保存可重播的事件日誌

Kafka 的核心是依 partition 排序、依 retention 保存的分散式 log;consumer group 用 offset 分工,exactly-once 只在 Kafka transaction 能涵蓋的邊界內成立。

Apache Pulsar:把 stateless broker 與 BookKeeper 儲存拆開的事件平台

Pulsar 將 serving 與 storage 分離:stateless broker 處理連線,BookKeeper 保存 ledger 與 subscription cursor;彈性與多租戶能力換來更多營運元件。

Appwrite:可自架的 Auth、Database、Storage、Functions 與 Realtime BaaS

Appwrite 把 Auth、TablesDB、Storage、Functions、Realtime 與 Messaging 放進一致 API;Cloud 與 self-hosted 功能相近,維運責任卻完全不同。

tech deep-dive

assistant-ui 完整介紹:用 Runtime 與 Primitives 組出可替換後端的 Agent Chat

assistant-ui 把 Agent Chat 拆成 headless React primitives、conversation runtime 與後端 adapters;UI 不必直接綁死某個模型 SDK 的 message state。

AWS App Runner:從原始碼或 Container 到 Web Service 的最短 AWS 路徑

App Runner 把 build、deploy、TLS、load balancing 與 autoscaling 包成 Web service;換來的是較少的編排控制與必須理解的 VPC、instance 與健康檢查邊界。

AWS Fargate:不用管 EC2,不代表不用管 ECS

Fargate 移除容器主機管理,但 task definition、ECS service、VPC、IAM、擴縮、部署與可觀測性仍是你的系統。

AWS Lambda:選函式運算前,先讀懂事件、重試與並行度

Lambda 適合短生命週期、事件驅動且流量不規則的工作;真正的設計中心是 invocation、重試、冪等與下游容量,不是把容器切小。

AWS SQS 與 SNS:一個保存工作,一個把事件 fan-out

SQS 是 pull-based durable queue,SNS 是 push-based topic;常見可靠 fan-out 是 SNS topic 接多個 SQS queue,而不是讓多個 worker 共讀一條 queue。

Azure App Service:Web App 的核心不是 Container,而是 App Service Plan

App Service 代管 Web runtime、TLS、deployment 與 scaling;容量、成本和隔離則落在共享的 App Service Plan,不能只看單一 app。

Azure Container Apps:用 Revision、KEDA 與 Environment 跑 Serverless Container

Azure Container Apps 封裝 Kubernetes,提供 HTTP/TCP ingress、revision、KEDA scaling、jobs 與 Dapr;你仍要設計 replica concurrency、事件冪等、VNet 與身分。

Better Auth:TypeScript 認證框架不是應用程式授權層

Better Auth 統一登入、session、provider 與外掛;resource-level authorization、撤銷時效和代理操作政策仍要由應用程式明確實作。

tech deep-dive

Better Auth:把 TypeScript 認證放回應用程式裡,值得嗎?

Better Auth 用程式庫與自有資料庫換來身分資料、流程和部署的控制權;代價是 migration、安全更新與事故處理也回到自己手上。

tech deep-dive

Bright Data 深入介紹:從 Proxy、Web Unlocker 到 Scraping Browser 與 Datasets

Bright Data 把網頁資料取得拆成四層:Proxy 保留控制權,Web Unlocker 回傳已解鎖內容,Browser API 代管互動式瀏覽器,Web Scraper APIs 與 Datasets 直接交付結構化資料。

CapRover:Docker Swarm、Nginx 與 Persistent App 的自架 PaaS

CapRover 用 Docker Swarm、Nginx 與 captain-definition 提供簡化 PaaS;stateless app 可擴展,local persistent app 則被鎖在單一節點。

tech deep-dive

Clerk 認證平台:從登入元件、Session Token 到組織授權的完整邊界

Clerk 最有價值的不是一個登入框,而是把身分生命週期做成可組裝的平台;但資源層級授權、租戶隔離與業務資料一致性仍然是應用自己的責任。

Cloudflare Durable Objects:讓 Workers 有狀態、協調與 WebSocket 的那塊拼圖

Durable Objects 把一個 name 或 ID 對到全球唯一、單執行緒、帶私有 SQLite storage 的 actor。它適合 per-room、per-user、per-tenant、per-run 這種需要強一致協調的邊界;真正的設計題是 object key 要切在哪裡。

Cloudflare Queues:把 Workers request 拆成可重試、可批次的背景工作

Cloudflare Queues 是 Workers 旁邊的 message queue:producer 把慢工作寫進 queue,consumer 用批次、ack/retry、delay 與 DLQ 處理失敗。它適合單步背景工作;流程需要記住多步驟狀態時,下一篇要看 Workflows。

CodeQL:把 Codebase 抽成 Database,再用 Query 追 Data Flow

CodeQL 先由 language extractor 建立 code database,再以 QL queries 查 AST、types、calls、control/data flow;深度來自 model,也帶來 build extraction 與 query maintenance 成本。

Convex:用 Query、Mutation、Action 建立 Reactive TypeScript Backend

Convex 把 typed backend functions、transactional document database 與 reactive query subscription 綁在一起;關鍵是正確分開 deterministic mutation 和外部副作用 action。

Coolify:自架 PaaS 的 Control Plane、Docker Server 與責任邊界

Coolify 用 SSH 控制自有 server 上的 Docker、proxy 與 resources;它簡化部署,但 OS、安全、容量、資料備份與平台復原仍由團隊負責。

tech deep-dive

CopilotKit 完整介紹:把 Agent 狀態、工具與 Human-in-the-Loop 接進 React

CopilotKit 不只提供聊天框;它用 React 元件、AG-UI 事件、共享狀態與中斷流程,把 Agent 的執行過程接進既有產品介面。

CoreWeave:以 Kubernetes、GPU Fabric 與儲存組成的 AI 專用雲

CoreWeave 的價值不只是租 GPU,而是把 Kubernetes、GPU 網路、儲存與 inference 組成 AI infrastructure;代價是仍需平台工程與容量治理。

Crusoe Cloud:從 GPU VM、Managed Kubernetes 到 Managed AI

Crusoe 同時提供 Infrastructure Cloud 與 Managed AI;GPU VM/cluster 給控制,serverless/dedicated inference 給較高抽象,兩者責任不可混寫。

DeepSeek Harness(dsh):把 Everything is a Plugin 做到底的 coding agent 框架

DeepSeek Harness(dsh)是 DeepSeek 官方的開源 coding agent 框架,2026-08-13 發布 v0.1 開發者預覽版,9 天內累積 184,000+ 星。核心是 Cordis plugin kernel——模型、工具、agent loop、UI 全部都是可抽換的外掛。四種 runtime 模式,能把 Claude Code 和 Codex 當子代理使用。Web UI 優先,目前沒有原生 CLI。

Deno Deploy:Deno 2、Revision、Timeline 與全球 TypeScript Serverless

新版 Deno Deploy 是以 Deno 2 執行 application revision 的 serverless 平台;應以 timeline、context、database 與 observability 理解,而不是沿用 Deploy Classic 印象。

DigitalOcean App Platform:用 Component 與 App Spec 管理 PaaS 拓撲

DigitalOcean App Platform 以 Service、Worker、Job、Static Site 與 Function 等 Components 組成 App,再用 App Spec 保存可 review 的部署合約。

DigitalOcean:從 Droplet 到 App Platform 的簡化型 Cloud

DigitalOcean 用 Droplet、DOKS、Managed Databases 與 App Platform 覆蓋常見產品架構;簡單來自較小的服務面,不是免除 OS、網路、備份與 HA 設計。

Django:ORM、Admin、Auth 與長期演進的 Python Web Framework

Django 的價值是把資料模型、migration、auth、admin、forms 與安全預設組成一致系統;代價是要理解 QuerySet、middleware、async 邊界與 production settings。

Dokku:把單台 Docker 主機變成 Git Push PaaS

Dokku 用 Git receiver、buildpack/Dockerfile、process model、Nginx 與 plugins 在單機提供 Heroku 式體驗;簡潔來自刻意縮小編排範圍。

Dokploy:Application、Docker Compose、Remote Server 與 Swarm 的自架 PaaS

Dokploy 同時支援單 container Application 與 Compose/Stack,並把單機、獨立 remote servers、Swarm cluster 定義成三種不同部署拓撲。

DuckDB:把 OLAP Query Engine 放進 Process 裡

DuckDB 是 in-process columnar OLAP database,擅長直接分析 Parquet、CSV 與 DataFrame;它不是一般 web app 的多使用者 OLTP server。

tech deep-dive

Elasticsearch 與 OpenSearch:從 Lucene 全文檢索到站內搜尋的選型

Elasticsearch 與 OpenSearch 都以 Lucene 支撐文字分析、BM25、聚合與向量搜尋,但 2021 年分家後,授權、治理、混合搜尋 API 與託管生態已是兩條路。

Elysia:Bun-first、Runtime Schema 與端到端型別安全的 API Framework

Elysia 把 runtime schema、TypeScript inference、OpenAPI 與 Eden client 串成同一條 contract,但 Bun-first 的效能優勢、plugin scope 與跨 runtime 相容性仍要分開驗證。

Fastify:Plugin Encapsulation、JSON Schema 與高效 Node.js API

Fastify 的核心不只是 benchmark,而是以 plugin scope、hooks、decorators 與 compiled JSON Schema 建立可組合且有明確 request/response contract 的 Node.js API。

Firebase:Auth、Firestore、Functions 與 Security Rules 的 BaaS 邊界

Firebase 的速度來自 client SDK 直連 Auth、Firestore、Storage 等 managed services;真正的後端合約落在資料模型、Security Rules、Functions 與成本限制。

Fly.io:Machines、Fly Proxy 與多區域部署的真實邊界

Fly.io 把可快速啟停的 Machines 放到指定 region,再由 Fly Proxy 與私有 6PN 接線;真正困難仍是有狀態資料的跨區一致性。

gitleaks:掃 Working Tree、Git History 與 CI Diff 的 Secret Detection

gitleaks 用 rules、regex、entropy 與 allowlists 掃檔案或 Git patches;找到 secret 後第一步是 revoke/rotate,而不是只刪檔或改寫 history。

Google Cloud Model Armor:在 Prompt、Response 與 Agent Tool 前加 Runtime Filter

Model Armor 能在 runtime 檢查 prompt injection、jailbreak、敏感資料、惡意 URL 與內容安全;它是 probabilistic detector,不是 authorization 或 sandbox boundary。

Google Cloud Run:Service、Job、Worker Pool 是三種不同的 Container 生命週期

Cloud Run 不只是一個 HTTP container 平台;先按 request、run-to-completion、always-on pull worker 選對 resource,再設計 concurrency、identity 與擴縮。

Google Kubernetes Engine:GKE Autopilot 降低 Node 操作,不會消除 Kubernetes

GKE 代管 Kubernetes control plane;Autopilot 再代管多數 node 基礎設施,但 workload、policy、網路、升級相容性與成本治理仍屬於團隊。

GraphQL 與 Code Generator:型別安全來自 schema 加 operation,不只 schema

GraphQL schema 定義可查詢能力;GraphQL Code Generator 再結合實際 query、mutation、fragment,產生精確 result、variables 與 typed document。

gRPC 與 Connect:同一份 Protobuf 合約如何跨服務與瀏覽器

gRPC 以 Protobuf service 產生跨語言 stub;Connect server 可同時支援 gRPC、gRPC-Web 與 Connect protocol,讓瀏覽器不必額外翻譯 proxy。

Hatchet:一套同時處理 task queue、DAG 與 durable task 的工作流引擎

Hatchet 以 Postgres-backed control plane 統一一般 task、DAG 與 durable task;durable task 在等待與 child task 邊界 checkpoint,恢復時重播 deterministic 編排碼。

Hetzner Cloud:便宜 VM 的真正成本是你要擁有整個作業系統

Hetzner Cloud 以 Server、Network、Volume、Load Balancer 與 Firewall 提供精簡 IaaS;價格優勢只有在 patch、HA、backup、egress 與 on-call 成本算進去後才成立。

Hono RPC:從 route implementation 推導 Fetch client 型別

Hono RPC 匯出 route 的 `typeof AppType`,讓 `hc` client 推導 input、response body 與 status code;它共享的是 TypeScript type,不是獨立 wire schema。

Inngest:用 step 把 serverless function 變成可恢復的工作流

Inngest 讓一般 TypeScript、Python、Go function 以 step 為持久化邊界;失敗時函式從頭執行,但已完成 step 由紀錄回填,不再重做 side effect。

Kamal:沒有常駐 Control Plane 的 Docker 部署工具

Kamal 從操作者端透過 SSH 把 immutable image 部署到 servers,靠 kamal-proxy 切換流量;它不是 scheduler,也不替團隊管理主機與資料。

Koyeb:App、Service、Instance 與全球 Serverless 部署模型

Koyeb 以 App 收納 Services、以 Instance 在指定 region 執行 revision,並整合 global routing、autoscaling、private discovery 與 CPU/GPU compute。

Kubernetes:從 Pod、Controller 到 Declarative Reconciliation 的容器編排

Kubernetes 的核心不是 YAML,而是 API objects、controllers 與 reconciliation loop;它管理 workload lifecycle,卻不自動解決 application state、資料一致性與組織治理。

Kysely:把 SQL 保留下來的 TypeScript 型別安全 Query Builder

Kysely 從資料庫型別推導查詢結果,保留 SQL 的可見性與逃生口;但 migration、實際 schema 與 generated types 仍要由團隊維持同步。

Lambda Cloud:從單台 GPU VM 到多節點 AI Cluster 的算力雲

Lambda Cloud 提供 on-demand GPU VM 與 1-Click Cluster;它賣的是較直接的 AI 算力環境,不是自動完成 training、serving 與 MLOps。

Liveblocks:Presence、Storage、Comments 與 Notifications 的協作後端

Liveblocks 把 room、presence、conflict-free storage、comments 與 notifications 做成 managed product primitives;導入時仍須對齊既有 auth、canonical DB 與 data lifecycle。

MongoDB:Document Model 的彈性,代價在資料邊界

MongoDB 適合一起讀寫的聚合資料與可演進 document schema;真正難題是 embedding、transaction boundary、index 與 shard key。

MySQL:成熟關聯式資料庫,不只是『大家都會用』

MySQL 的價值是成熟生態、InnoDB 交易與可預測維運;選它仍要理解索引、隔離級別、replication lag 與 schema migration。

NATS 與 JetStream:先選即時訊息還是持久事件,再談同一套 API

Core NATS 是不落盤的 at-most-once pub/sub;JetStream 才加入 stream、consumer、ack、retention 與重播。兩者同用 subject,可靠性契約卻完全不同。

Nebius AI Cloud:GPU Cluster、Managed Kubernetes 與 Serverless AI 的完整平台

Nebius 同時提供 GPU VM/cluster、Kubernetes、Slurm、storage 與 Serverless AI;先選責任層級,再比較硬體與價格。

Neon vs Turso:別把兩種 Serverless Database 都叫託管 Postgres

Neon 是 serverless PostgreSQL;Turso Cloud 目前是 libSQL/SQLite 相容平台。兩者都強調 scale-to-zero 與開發體驗,compatibility boundary 完全不同。

NestJS:Modules、Dependency Injection 與 Request Lifecycle 的 Node.js 架構框架

NestJS 的價值不是 decorator 本身,而是以 Module、Provider、DI 與可預期 request lifecycle 統一 HTTP、GraphQL、WebSocket 和 microservice application architecture。

Netlify:Atomic Deploy、Functions 與 Edge Functions 的 Web Platform

Netlify 以 atomic deploy 和 preview 為核心,Functions、Edge Functions、Blobs/Database 再加入動態能力;每種 runtime 與 state 都有不同一致性和限制。

ngrok:從 Localhost Tunnel 到可控的全球 Ingress

ngrok 是由 agent 主動連出的 reverse proxy/ingress,不是把整台電腦加入 VPN;公開 endpoint 前仍要明確設定 authentication、traffic policy 與資料邊界。

Nhost:PostgreSQL、Hasura GraphQL、Auth 與 Storage 的 BaaS

Nhost 以 PostgreSQL 為真實資料層,由 Hasura 產生 GraphQL,再把 Auth claims、role permissions、Storage 與 Functions 接進同一平台。

OMP 2(Oh My Pi 2):從 Pi fork 到全 Rust 重寫的獨立 coding harness

OMP 2 不再是 Pi 的 fork。整個 codebase 用 Rust 從零重寫,約 41 個 crate 涵蓋自製 bash 引擎、GPU 加速 GUI、嵌入式 CPython 3.14t、gRPC transport 與 Kokoro-82M TTS。目前 pre-release,尚未正式發行。

openapi-typescript:把 OpenAPI 變成零 runtime 的型別與 Fetch client

openapi-typescript 將 OpenAPI 3.0/3.1 產成純 TypeScript 型別;搭配 openapi-fetch,method、literal path、parameters 與 response union 都能由 schema 推導。

Opencode 2:Bun 換 Node、Tauri 換 Electron、API 全部打掉重練的代價

Opencode 2 是 Anomaly(Dax Raad)主導的大重寫。runtime 從 Bun 換成 Node.js(記憶體問題)、桌面從 Tauri 換成 Electron(WebKit 效能與 Node 整合)、v1 API 刻意不相容。新增多分頁並行 session、持久化後端服務、HTTP API + SDK。目前 beta,預估 2026 年 9 月 stable。約 200K stars。

OpenStack:不是一套虛擬化 UI,而是一組要長期營運的 Cloud Services

OpenStack 以 Keystone、Nova、Neutron、Glance、Placement、Cinder 等服務提供多租戶 IaaS;採用它等於建立 cloud platform team,而不是安裝完成就結束。

Oracle Cloud Infrastructure:先理解 Compartment、VCN 與 Fault Domain

OCI 是完整 hyperscale cloud;架構起點不是 Compute shape,而是 tenancy/compartment IAM、region/AD/fault domain 與 VCN,再選 Compute、OKE、database 與 storage。

oRPC:把 end-to-end type safety 與 OpenAPI 放在同一條路徑

oRPC 同時支援 implementation-first 與 contract-first,能用 RPC client,也能由同一個 router 服務 OpenAPI 3.1.1 HTTP endpoint。

OVHcloud:Public Cloud、OpenStack、vRack 與 Dedicated Server 的組合

OVHcloud 的特色是 Public Cloud、OpenStack API、Managed Kubernetes、vRack 與 dedicated/private cloud 共存;彈性也帶來較多 network 與責任邊界。

Oxc 與 Oxlint:快不只是 Rust,而是把 parser、型別與規則重新接在一起

Oxlint 已從高速 ESLint 補充品走到支援 type-aware lint 與 JS plugin 的獨立 linter;遷移關鍵不是 50–100 倍跑分,而是確認規則、framework file 與 plugin 相容範圍。

tech deep-dive

Pagefind 完整介紹:Astro 靜態網站如何做到零後端全文搜尋

Pagefind 在 Astro build 完成後掃描靜態 HTML,把索引與 WebAssembly 搜尋程式一起輸出;瀏覽器只按查詢載入需要的索引切片,因此不必維護搜尋伺服器。

PartyKit:把每個協作 Room 變成 Edge Stateful Server

PartyKit 以 room-keyed stateful server 收斂 WebSocket coordination,適合多人協作與 presence;但 durable document、authorization、hibernation 與 platform ownership 仍要明確設計。

Pi v2:AgentHarness API 升穩、Earendil 公司化,極簡主義走進下一章

Pi v0.84.0(2026-08-06)把 AgentHarness v2 API 升為 stable。Lane-based v4 Session model 讓操作可持久化、可中斷。CBOR 取代 JSON,Unix socket 取代 HTTP。背後的 Earendil Inc.(Armin Ronacher 的 PBC)拿到首輪資金。95.4K stars,still MIT,still 極簡。

PocketBase:SQLite、Auth、Realtime 與單一執行檔的 Backend

PocketBase 把 SQLite、collections、Auth、file storage、SSE realtime 與 admin UI 包進小型執行檔;部署簡單,但單機邊界與 v1 前相容性風險必須明講。

Promptfoo Red Team:把 Prompt Injection、Tool Misuse 與資料外洩變成 Regression Tests

Promptfoo 以 plugins 產風險 probes、strategies 變形攻擊、targets 執行系統、graders 判斷結果;有價值的 red team 必須測整個 agent application,而不只是 foundation model。

Protobuf 與 Buf:把跨語言 schema 的 lint、codegen 與相容性放進 CI

Protobuf 用穩定 field number 定義 binary message;Buf 補上 module、lint、remote plugin、generation 與 breaking-change check,讓 schema 能被治理。

Proxmox VE:把 KVM、LXC、Cluster、Ceph 與 Backup 組成地端平台

Proxmox VE 整合 VM、container、cluster、HA、storage 與 backup;它降低虛擬化管理門檻,但 hardware、quorum、network、capacity 與 DR 仍由你負責。

Pulumi:用 TypeScript、Python、Go 等一般語言寫 Infrastructure as Code

Pulumi 讓一般程式語言註冊 cloud resources,再由 deployment engine、providers 與 stack state 執行 preview/update;語言能力增加,也要求更嚴格的 abstraction discipline。

RabbitMQ:先用 exchange 表達路由,再用 quorum queue 保住工作

RabbitMQ 的強項是 exchange、binding 與 queue 組成的訊息路由;需要高可用時以 quorum queue 為預設,並同時啟用 publisher confirm、manual ack 與冪等 consumer。

Railway:用 Project、Service 與 Environment 部署完整應用拓撲

Railway 的核心不是一鍵部署,而是把多個 container service、環境、變數與私有網路放進同一個可操作的 application project。

tech deep-dive 自架推論服務

Ray Serve 自架推論服務:Python 服務圖、GPU 排程與自動擴縮

Ray Serve 是建立在 Ray 上的分散式 serving layer:用 deployment 與 handle 組合 Python 服務圖,配置 CPU/GPU replica、自動擴縮與模型多工;它負責編排,不取代 vLLM 或 SGLang 的 LLM 執行引擎。

Redis Streams:用 append-only log 與 consumer group 補上 Redis 的可靠訊息層

Redis Streams 以 `XADD` 保存可回讀 entry,consumer group 再用 Pending Entries List 與 `XACK` 追蹤處理;它比 Pub/Sub 可靠,但不是自動變成 Kafka。

Redpanda:Kafka API 相容,不代表換 broker 可以不做驗證

Redpanda 以 C++/Seastar、thread-per-core 與每個 partition 的 Raft group 重做 Kafka-compatible event log;client 相容度高,營運與邊角語意仍須實測。

Render:Web Service、Private Service、Worker 與 Cron 的完整 PaaS 拓撲

Render 的價值不是只把 repository 變 URL,而是用不同 service type 表達 public HTTP、private listener、queue worker、cron、data store 與 Blueprint。

Renovate:把 Dependency Updates 變成可治理的持續流程

Renovate 不只是開升級 PR;packageRules、grouping、schedule、minimumReleaseAge 與 automerge policy 決定更新速度、review noise 和供應鏈暴露。

Replicate:把模型版本變成 Prediction API,而不是租一台 GPU

Replicate 以 versioned model、prediction、Cog 與 deployment 抽象 GPU;整合者要負責版本釘選、async workflow、webhook 驗證、資料保存與成本上限。

Restate:把 journal、durable state 與服務呼叫放進同一個執行模型

Restate 以 journal 記錄操作與結果,失敗後重跑 handler 並跳過已完成操作;Virtual Object 與 Workflow 再提供 keyed state、single-writer 與長期協調。

RunPod:GPU Pod 與 Serverless Endpoint 是兩種不同產品

RunPod Pod 適合互動與長駐 GPU 工作,Serverless 適合 queue-based 或 load-balanced inference;選錯會把 persistence、cold start 與重試語意混在一起。

Scaleway:歐洲 Cloud 的 Instance、Kapsule、Serverless 與 Managed Data

Scaleway 已不只是低價 VM,而是涵蓋 compute、Kapsule、serverless、database、storage、AI 與 IAM 的歐洲 cloud;選型仍要逐 region 驗證成熟度與整合。

tech deep-dive

Scrapy 深入介紹:從 Engine 到 Pipeline 的自架爬蟲架構

Scrapy 把抓取流程拆成 Engine、Scheduler、Downloader、Spider、Item Pipeline 與 Middleware;適合大量、規則明確的 HTTP 頁面,也能自行控制排程、節流、重試與資料落地。

tech deep-dive

Selenium 深入介紹:從 WebDriver session 到 Grid 的瀏覽器自動化

Selenium 透過標準化 WebDriver session 操作真實瀏覽器,適合跨瀏覽器流程、既有測試資產與遠端 Grid;它能執行 JavaScript 頁面,卻不保證繞過 CAPTCHA 或其他反自動化機制。

Semgrep:把組織的安全規則寫成可讀、可測的 Static Analysis

Semgrep 讓團隊用接近 source syntax 的 patterns 與 taint rules 自訂 SAST policy;規則品質取決於 positive/negative tests、framework modeling 與 exception lifecycle。

Server-Sent Events:用 HTTP Event Stream 做可恢復的單向推送

SSE 以普通 HTTP 傳送 text/event-stream,瀏覽器原生重連並帶 Last-Event-ID;簡單不代表自動 durable,server 仍要保存 cursor 後的事件。

tech deep-dive 自架推論服務

SGLang 自架推論服務:RadixAttention、OpenAI API 與多 GPU 部署

SGLang 是專攻生成式模型的推論引擎:用 RadixAttention 重用共同前綴的 KV cache,提供 OpenAI 相容 API、結構化輸出與多 GPU 平行化;它解決的是高吞吐 LLM serving,不是完整的產品後端。

Sigstore 與 SLSA:驗證誰用哪個 Build Process 產出這份 Artifact

Sigstore 提供 identity-bound signing、短效憑證與 transparency log;SLSA 定義可信 build provenance 的成熟度。只有在 deploy admission 驗證 identity、issuer、digest 與 build expectations 時才形成防線。

Snyk:把 SCA、SAST、Container 與 IaC Findings 接進開發流程

Snyk 的價值是把 code、open-source、container 與 IaC findings 對到 project、fix path 與 developer workflow;成功導入取決於 baseline、ownership 與可執行的 policy。

Socket.dev:在 Dependency Diff 當下攔截惡意 Package 行為

Socket.dev 不只比對 CVE,而是分析新增套件的 install scripts、obfuscation、network、shell 與 ownership 變化,在 dependency merge 前暴露供應鏈行為風險。

Socket.IO:Rooms、Acknowledgements 與斷線恢復的即時事件層

Socket.IO 是建立在 WebSocket/long-polling 上的事件協定與 runtime,不是原生 WebSocket 相容層;ordering、arrival、recovery 與水平擴展要分開設計。

Speakeasy:用 OpenAPI Overlay 與 workflow 管理多語言 SDK

Speakeasy 把 OpenAPI、Overlay、target 與 generator version 寫進 `.speakeasy/workflow.yaml`,可在本機或 CI 產生、編譯並發布多語言 SDK。

SST v3:用 Components、Link 與 Dev Mode 組合 Full-Stack Cloud App

SST v3 以 TypeScript config、高階 app components、Pulumi/Terraform providers 與 resource linking 組合自有雲資源;它是 application-first IaC,不是代管 PaaS。

Stainless:從 OpenAPI 持續產生可發布的多語言 SDK

Stainless 以 OpenAPI 加上專屬 config 產生多語言 SDK、文件、CLI 與 MCP;重點不是一次性 codegen,而是 preview、發布與升級的持續產品管線。

tech deep-dive

Stytch 深入介紹:從 B2C 登入、Session 到 B2B 組織與授權

Stytch 是 API-first 的託管身分平台:先選 Consumer 或 B2B 資料模型,再把登入因子收斂成 session,最後在伺服器端以 organization 與 RBAC 授權;它適合需要深度客製流程的團隊,不是把登入畫面貼上就結束。

Teleport:以短效憑證、RBAC 與 Session Audit 管理基礎設施存取

Teleport 是 protocol-aware infrastructure access platform:Auth Service 簽短效憑證,Proxy 與 Agents 代理 SSH、Kubernetes、database、app 等資源並留下 audit evidence。

Terraform:Provider、Plan、Apply 與 State 的 IaC 工作模型

Terraform 以 provider resource schema、configuration 與 state 對照真實 API,產生 plan 再 apply;最重要的資產不是 HCL,而是受控的 state 與變更流程。

tech deep-dive 自架推論服務

NVIDIA Triton Inference Server:多框架模型、自動批次與推論管線

Triton Inference Server 用統一的 HTTP/gRPC 介面服務 TensorRT、ONNX、PyTorch 等模型,核心能力是 model repository、動態批次、instance group 與 ensemble;它適合異質模型平台,不是專為 LLM KV cache 打造的引擎。

tRPC:用 TypeScript inference 連起 client 與 server 的 API 合約

tRPC 讓 client 直接引用 server router 的型別,不需先寫 schema 或產生程式碼;v11 另有 alpha 階段的官方 OpenAPI 3.1 產生器。

ts-rest:保留 REST 語意的 TypeScript contract-first API

ts-rest 用共享 contract 描述 method、path、status code 與 schema,在不產生程式碼的前提下讓 server 與 client 保有端到端型別。

Twingate:以 Identity 與 Resource 取代整段網路存取

Twingate 透過 client、connector、controller 與 relay,把使用者授權收斂到特定 resource;它是 managed ZTNA,而不是任意 peer-to-peer overlay。

TypeScript 7:Go 原生重寫讓 type check 變快,但遷移不只換掉 tsc

TypeScript 7 把 compiler 與 language service 原生重寫為 Go,官方與大型使用者回報約 10 倍級的改善;收益來自共享記憶體平行化,代價是舊 API 與 compiler option 必須清理。

tech deep-dive

Typesense 站內搜尋:把全文檢索做成可控制的產品功能

Typesense 是以即時、容錯關鍵字搜尋為核心的搜尋伺服器:用 collection schema、欄位權重、facet 與排序就能做出站內搜尋,也能自行架設或交給 Typesense Cloud;繁體中文欄位要設 locale: zh,專業詞彙則可能需要自訂斷詞。

Vercel:Frontend Cloud 的優勢來自 Framework-aware Deployment

Vercel 把 framework build output、preview、CDN/cache 與 Functions 綁成 deployment;速度來自深度整合,代價是 runtime、data locality、成本與可攜性邊界。

Vite 8 與 Rolldown:前端建置從雙引擎走向同一條管線

Vite 8 把開發期的 esbuild 與正式建置的 Rollup 收斂成 Rolldown;速度是結果,真正重要的是開發與 production 不再由兩套 bundler 語意拼接。

Vitest:共用 Vite 設定,但不要把 component test 當成 E2E

Vitest 的優勢不是 Jest API 長得熟,而是測試與應用共用 Vite 的 transform、alias 與 plugin;Browser Mode 增加真瀏覽器信心,卻仍不能取代完整 E2E。

Vultr:Cloud Compute、VKE 與 GPU 之間怎麼選

Vultr 從 VM、bare metal、GPU 到 VKE、database 與 storage 都有;優勢是區域與產品選擇,風險是把多產品存在誤認為已完成架構整合。

WebSocket:雙向長連線只是起點,Protocol 與 Backpressure 才是工程

WebSocket 提供一條雙向 message transport,不包含 auth renewal、schema、ack、replay、rooms 或 backpressure policy;這些才決定 production correctness。

WireGuard:用 Cryptokey Routing 建立最小化 VPN Tunnel

WireGuard 是小而明確的 L3 加密 tunnel;它把 public key、peer 與 AllowedIPs 綁在一起,但不替團隊提供 identity、裝置管理或 policy control plane。

tech deep-dive

WorkOS Enterprise Auth:從 AuthKit 登入一路長到 SSO、SCIM 與 Audit Logs

WorkOS 的優勢不是只有登入 UI,而是讓 B2B SaaS 沿同一個 organization identity model 逐步加入 SAML/OIDC、SCIM 與稽核輸出;authorization 與資料治理仍由應用負責。

Yjs 與 CRDT:把並行編輯變成可交換、可重放的 Document Updates

Yjs 用 shared types 與可交換、可結合、冪等的 binary updates 收斂 concurrent edits;它不綁 transport,也不自帶 authorization、persistence 或 domain conflict resolution。

ZeroTier:以 Controller 與 Flow Rules 組出跨網路 Virtual LAN

ZeroTier 把裝置放進可管理的 virtual L2/L3 network,嘗試 peer-to-peer 傳輸並由 controller 發布成員與 policy;它比單純 tunnel 更像軟體定義網路。

zizmor:專門掃 GitHub Actions 的 Template Injection 與 Token 風險

zizmor 針對 workflow/action YAML 做 domain-specific static analysis,找 template injection、過寬 permissions、artifact credential leak 與 unpinned uses;它不分析被呼叫 shell script 本身。

Zodios:用 Zod endpoint definition 建立 Axios 型別安全 client

Zodios 以中央 Zod endpoint definition 驅動 Axios client 的型別、runtime validation 與 alias,也能接 Express 和產生 OpenAPI。

tech deep-dive

Zyte 深入介紹:從 Scrapy 開發、反爬取頁到 Scrapy Cloud

Scrapy 負責爬取流程與資料模型,Zyte API 接手取頁、瀏覽器與反爬細節,Scrapy Cloud 再負責部署、排程和輸出;三者可以分開採用,不是一套綁死的框架。

Agent Plugins 1.0:OpenAI、Google、AWS 罕見聯手,統一 AI Agent 擴充的封裝標準

Agent Plugins 1.0 是一個封裝格式標準,把 Agent Skills(Markdown 指令)和 MCP server 設定包成一個目錄,讓同一個 plugin 能被 ChatGPT、Cursor、GitHub Copilot、Kiro、VS Code 直接載入。它不是新的協議,是協議之上的包裝紙。Vercel 發起,OpenAI、AWS、Microsoft、Cursor 共同制定,Google 發佈當天加入——Anthropic 不在治理名單上,但 MCP 團隊正面回應。

ai guide

AgentQL 完整介紹:用語意查詢做網頁擷取與 Playwright 自動化

AgentQL 用接近資料結構的語意查詢取代易碎的 CSS/XPath:`query_data` 回傳結構化資料,`query_elements` 回傳可操作的 Playwright locator。Starter 公開方案列出每月 50 次免費 API 呼叫,但超額、綁卡與遠端瀏覽器時數的實際停止規則仍要在 Billing 頁確認。

ai guide

Apify 完整介紹:Actor、Task、排程與資料集怎麼組成爬取平台

Apify 不是單一 crawler,而是把爬取程式包成 Actor,再用 Task 固定設定、Schedule 觸發執行、Dataset 交付結果的平台。適合不想自己維護佇列、排程與執行環境的團隊,但 Actor 費用、運算、proxy、儲存與傳輸會共同消耗預付額度。

ai guide

Browser Use 完整介紹:讓 AI Agent 操作瀏覽器的任務迴圈

Browser Use 把瀏覽器狀態、模型決策與 click/type/extract 等動作組成可重複迴圈;開放原始碼版本適合自訂工具與執行策略,Cloud 則代管瀏覽器、profile、proxy 與並行工作。

ai guide

changedetection.io 完整指南:用 selector、通知與 Browser Steps 監控網頁

changedetection.io 是網頁變更訊號層:先縮小監控範圍、排除雜訊,再把真正的變更通知下游;它不是搜尋 API,也不該取代 crawler。

Composio:agent 接一百個 SaaS 時,誰替你保管每個使用者的 token

站上把 MCP 寫得很齊,卻從沒寫過它下面那一層:agent 要代表一萬個終端使用者去讀他們各自的 Gmail 時,refresh token 存在誰家、怎麼更新、怎麼撤銷。Composio 是這層目前最完整的一家——SDK 是 MIT,執行與託管 OAuth 是雲端服務;官方自稱 1,000+ toolkit,但託管 OAuth 清單實際列出 121 個,另外 96 個要你自備憑證。2026-08-15 起的新價目:免費 10 萬次 tool call、Pro $29/月。這篇拆它的授權模型到可操作的深度,並劃出「自己接 MCP server」與「用整合平台」的分界。

ai deep-dive

Context 滿了怎麼辦:七種答案,沒有一種是共識

Chroma 的對照實驗證明:就算塞得下,塞滿也會變差。於是各家 coding agent 發展出七種對策——壓縮、換手、剪枝、少載入、隔離、進模型、換單位。Amp 直接移除 /compact,Atlassian 說摘要該是最後手段,Cursor 的 A/B 測出 46.9% token 降幅。三場分歧的根源不是誰對,是各自在衡量不同的東西。

ai guide

Crawl4AI 完整介紹:從 Markdown 抓取到結構化資料抽取

Crawl4AI 負責 URL 之後的抓取與抽取:穩定 DOM 先用 JsonCssExtractionStrategy,只有語意判讀或版面不規則時才切 LLMExtractionStrategy。

CrewAI:用角色扮演組織多 Agent 協作的框架

CrewAI(GitHub 57.4k star,MIT,PyPI 週下載 1,164 萬)用角色(role)、目標(goal)、背景故事(backstory)定義 agent,再把一組 agent 編成 crew 來協作。跟 LangGraph 的圖優先和 MAF 的工作流優先不同,CrewAI 是團隊優先——你不畫節點和邊,你描述一個團隊裡每個人負責什麼。2024 年底完成 LangChain 依賴的全面移除,現在是獨立框架。商業端分開源套件與 AMP 託管平台,AMP 加的是視覺化建構、部署、追蹤與合規。

Exa:為 agent 而不是為人設計的神經搜尋 API

Exa 把整個網頁索引轉成 embedding 再檢索,而不是比對關鍵字。2026-08 官方定價:/search $7 / 1k 次(含前 10 筆結果)、/contents $1 / 1k 頁、deep 系列 $12–15 / 1k 次,新帳號 $20 免費額度。這個 blog 的 CLAUDE.md 把 Exa 列在雲端抓取工具的第一順位,38 支 skill 裡有 16 支寫到它,站上既有文章只有 4 篇順帶提過——但一篇專文都沒有。這篇補上。

ai guide

Firecrawl 完整介紹:Scrape、Crawl、Map 與結構化抽取怎麼選

Firecrawl 把單頁抓取、網站探索、整站爬取與 JSON 抽取包成同一套 API;雲端版省下瀏覽器、proxy 與 worker 維運,自架版則換得基礎設施控制,但預設能力不等同雲端。

ai deep-dive

免費搜尋、爬取與瀏覽器 API 怎麼選:週期額度、限速、試用與自架成本

免費方案有每日或每月額度、餘額補回、持續限速與一次性試用;有些 API 沒有免費額度,必須預付或按量計費。

ai guide 搜尋與爬取實戰

Linkup Search API 完整指南:從 standard、deep 到結構化輸出

Linkup 把搜尋深度與輸出格式分開控制:多數 agent 查詢先用 standard + searchResults,需要循線讀多頁才升到 deep;每月補回 20 美元是餘額恢復,不是固定再送 20 美元。

LlamaIndex:它已經不是 RAG 框架了,而你可能還在照舊教學選它

LlamaIndex(GitHub 51,775 star,MIT,2026-08-21 實查)的重心已經從索引搬到 Workflows:獨立套件 llama-index-workflows 的 PyPI 週下載 281 萬,比傘狀套件 llama-index 的 197 萬還高。這篇拆核心抽象、跟自己刻 pipeline 的取捨,並實測它在繁中語料上的預設值——同樣的 chunk_size=1024,英文裝得下 4,645 字元,繁中只有 1,332。另附一個選型前必看的事實:TypeScript 版已封存停更。

ai deep-dive

Meilisearch 完整介紹:索引、中文搜尋與多租戶安全

Meilisearch 適合把應用程式資料做成快速、容錯的全文搜尋;真正的導入難點不在 search API,而在索引設定、非同步 task、中文分詞、權限過濾與備份還原。

Microsoft Agent Framework:兩個框架合併之後,AutoGen 這個名字現在指誰

微軟把 Semantic Kernel 與自家 AutoGen 合併成 Microsoft Agent Framework,2026-04-02 發 1.0 GA(.NET 與 Python,Go 仍是 public preview)。被收編的 autogen-agentchat 停在 2025-09-30 沒再發版;但原作者那側的社群分支 AG2 沒有合併,六天前還在發 1.0.2,而且 `pip install autogen` 裝到的是 AG2 不是微軟。這篇拆解 MAF 的抽象、遷移時程,以及這團名字到底該怎麼讀。

ai guide MIT 6.S191 導讀

MIT 6.S191 導讀:九講與三個 labs 全公開,但完整跑完仍要三個外部服務

MIT 6.S191 的 2026 版已公開九講影片、投影片、三個 software labs 與解答,足以列為 A3 自學課;但官方執行路線需要 Google/Colab、Comet,以及 Lab 3 的 OpenRouter,校外讀者也拿不到 MIT 的學分、專案回饋與 API credit。

Modal:跑推論引擎的那一層,以及它什麼時候不值那個溢價

Modal 是按秒計費的 serverless GPU 平台,同時把 agent sandbox 做成一級公民(官方自報累計啟動逾 10 億個 sandbox、佔營收三分之一以上)。選型的關鍵不是它多方便,是你的 GPU 使用率:2026-08-21 實查,Modal A100 80GB 折算 $2.50/hr、RunPod 同卡 $1.59/hr,使用率超過六成四自己開機器就比較便宜;但同一天 H100 SXM Modal $3.95/hr、Lambda $3.99/hr,這張卡的溢價幾乎是零。

ai deep-dive

Qdrant 完整指南:Collection、Hybrid Search 與自架維運

Qdrant 的核心不是把 embedding 存進去,而是先固定 vector schema、替高頻過濾欄位建 payload index,再用 dense + sparse query、租戶邊界、snapshot 與監控把檢索做成可維運的服務。

ai guide

Scrapling 完整介紹:從 adaptive selector 到並行 Spider

Scrapling 把 HTTP、Playwright 瀏覽器、CSS/XPath 抽取與 Spider 放進同一套 Python API;adaptive selector 會保存元素特徵,版面改動後再用相似度重新定位,但仍需要驗證輸出。

ai guide

SearXNG 完整介紹:引擎調校、JSON API 與自架維運

SearXNG 是元搜尋引擎,不是 crawler,也沒有自己的全網索引。這篇以官方 2026.8.20 文件為準,從 Compose 安裝、settings.yml、引擎選擇與 JSON API,一路做到空結果診斷。

ai guide 搜尋與爬取實戰

自己架一套搜尋後端:SearXNG + Crawl4AI,從零到接進 Claude Code

三個元件、各做一件事:SearXNG 負責找、Crawl4AI 負責讀、一層薄薄的程式把兩者黏起來。有三個預設值不改就不會動——`formats` 預設只吐 HTML、`secret_key` 預設是 `ultrasecretkey`、limiter 開了會擋你自己的程式。另外官方安裝方式在 2026 年 3 月換過,網路上多數教學指的 searxng-docker 已經封存了。

Tavily 和 Exa 不能自己架:要怎麼自己組一套

Tavily 和 Exa 都是純雲端 API,不能自己架。能自己組的是 SearXNG(269 個上游引擎、82 個預設開啟)+ Crawl4AI(78.8k stars、Apache-2.0),現成的 Tavily 相容 wrapper 都還是幾十顆星的個人專案,不建議直接用。但 SearXNG 沒有自己的索引,而且從機房 IP 跑會被搜尋引擎打成空結果——這兩件事決定了自架划不划算。

Stanford CS124 導讀:課號掛 100,先修寫死四門,而且下一學年整年不開

CS124 是 Stanford NLP 分支的第一門課,教科書是 Jurafsky 自己免費放在網路上的《Speech and Language Processing》,九個作業 repo 全部公開。但課程網站首頁掛著一行公告:2026–27 學年整年不開。而且那份課綱指定的章號,已經跟 2026 年 8 月版的教科書對不上了。

Stanford CS221 導讀:AI 入門課的先修欄位,寫的是 CS103、CS106B、CS109、CS161

CS221 把 AI 排成一條軸:反射式模型(也就是深度學習)在最低階那一格,往上是狀態、變數、邏輯。2025 年秋季 Percy Liang 接手後把講義換成可執行的 Python,並在第一堂的原始碼裡寫下『Cut constraint satisfaction problems :(』——但 ExploreCourses 與 Stanford Online 兩個官方頁面到現在還把約束滿足列為課程主題。專案已經從 2019 年的兩成成績掉到只剩加分。

Stanford CS224N 導讀:打開 2019 年那版課表,Transformer 還排在第 14 堂

CS224N 把 2000 年以來每一屆的課程網站都留在線上。2019 冬季那版,Transformer 是第 14 堂的客座講題;2026 冬季那版,它是第 5 堂,之後每一堂都預設你已經懂它。機器翻譯作業整個消失了,第三份作業改成自己刻一個 decoder-only Transformer,附 pytest 可以在筆電上跑。

Stanford CS224U 導讀:課程網站停在 2023 年春季,但整套教材可以 clone 下來跑

CS224U 的教材不是投影片,是一個 Apache-2.0 的 GitHub repo,講義、作業、評分文件全在裡面。但校內班從 2023 年春季之後連停三個學年,ExploreCourses 把它排回 2026-27 春季;官方課程描述至今仍列著 relation extraction 與 semantic parsing,2023 年的講次表一堂都沒有。第一份作業的資料載入 cell 在今天的新環境會卡在 Hugging Face 的相容性改動上。

Stanford CS224V 導讀:2026 年才改名叫 Agentic AI,教的卻是拿形式方法治幻覺

CS224V 的課名在 2026-2027 學年才從 Conversational Virtual Assistants 換成 Agentic AI,但底下的東西沒換:把自然語言翻成形式語意、用 SMT 與知識圖譜約束 agent,而不是拼框架。閱讀清單十一篇 Mandatory 裡,七篇出自授課者自己的實驗室。投影片全公開,課程網站卻明講它們是刻意殘缺的。

Stanford CS224W 導讀:作業全在 Colab 上,但最大一塊分數自學者拿不到

CS224W 的六份 Colab 現在全部可以直接下載開跑,第一份只用 NetworkX,連 PyG 都不用裝。但期末考佔 35%,是全課最大一塊,而它是閉書實體考。公開錄影停在 2021 年,涵蓋不到現在課表後半的 graph transformer、關聯式深度學習與 LLM+GNN。

Stanford CS228 導讀:先修只寫「基本機率與演算法」,但這門課已經停開兩年

CS228 的官方先修就一句『basic probability theory and algorithm design and analysis』,沒有指定任何前置課程。但 ExploreCourses 顯示它最後一次開課是 Winter 2024,下一次排在 2026-27 冬季、講師欄還空著。自學者真正拿得到的是那份公開講義 cs228-notes:16 章寫完,最後一次改動停在 2025 年 6 月。

Stanford CS229 導讀:講義每年重編,公開作業停在 2020,官方自測題是 2008 年的

CS229 的自學三件套不在同一個時鐘上:講義 278 頁、2026 年 8 月才重編過;公開拿得到的作業是 2020 年夏季那批;Stanford Online 叫你入學前先做的自測題,PDF 建立於 2008 年。2026 春季錄影公開 17 支,最後三支的標題跟內容對不上。

ai deep-dive

Stanford CS25 V6:叫 Transformers United 的課,前兩場講的都不是 Transformer

CS25 是 Stanford 的 1 學分 seminar,唯一作業是出席,全程對外開放。2026 春季第六季九場講座裡,最值得看的三場是 Albert Gu 談 SSM 與 Transformer 的歸納偏誤、Charles Frye 談上千張 GPU 的推論服務、Victoria Lin 談原生多模態還沒解決什麼。

Stanford CS329Z 導讀:先用 litellm 手刻一遍 agent,再讓 DSPy 把它收走

CS329Z 是 Stanford 2026 年秋季新開的三學分 agent 工程課,第一份作業要求先用 litellm 從零刻出 RAG、工具呼叫與 ReAct 迴圈,再用 DSPy 把同一批元件重寫一次並交出對照。課程網站架在公開的 GitHub repo 上,commit 紀錄顯示 8 月中作業從三份砍成兩份,被砍掉的那份是「Data for Agents」。

Stanford CS336 導讀:講義是跑得起來的 Python,作業從第二份開始要自己付 GPU 的錢

CS336 的十七堂正課裡,只有九堂是可以執行的 Python 程式,另外八堂是 PDF 投影片——分界線剛好是兩位授課者。第一份作業的講義有八個「低資源提示」教你怎麼在筆電上做完,第二到第五份一個都沒有。課程頁自己列了 B200 的每小時單價,作業講義自己列了每題要幾個 B200 小時。

ai guide

Tavily Search API 完整指南:搜尋、抽取、Map 與 Crawl

Tavily 把 Search、Extract、Map、Crawl 做成同一組 agent 網路 API;免費方案每月有 1,000 credits,Search 的 basic、fast、ultra-fast 各用 1 credit,advanced 用 2 credits。

ai deep-dive 自架推論服務

vLLM:自架推論服務的預設選擇,以及它什麼時候是過度工程

vLLM 是自架 LLM 推論的事實標準(GitHub 89,470 stars,2026-08-21 實查),核心是把 KV cache 當作業系統的分頁來管。但選型的關鍵不在它多快,在你的 GPU 使用率:以 Red Hat 實測的每秒 793 個輸出 token 換算,一張打滿的 A100 約 $0.70 / 百萬輸出 token,使用率掉到一成就變 $7——比多數雲端 API 貴。

Agent 搜尋品質怎麼驗收:Web Retrieval Benchmark 實作

Web retrieval 要測的是完整 task,不是 HTTP 200:固定 30 題、五種失敗層、三條 live channel,同時量答案、引用、freshness、延遲、成本與不必要升級。本文交付可執行 harness 與 gate,但因目前沒有三條 live channel 設定,不提供虛構排名。

AI Agent 上網查資料的完整路由:Search、Fetch、Crawler、Browser 怎麼切換

Agent 上網不該一律開瀏覽器:先依任務分流 Search 或 Fetch,再按狀態碼、內容品質、JS shell、登入與 challenge 訊號逐級升級;每一步都受 retry、budget、快取、去重與來源紀錄約束。

Berkeley AI/ML 課程導讀:從 CS61A 到 CS288,最新公開教材怎麼排

Berkeley 沒有獨立的大學部 AI 學位;可行路線是在 CS BA 或 EECS BS 的共同基礎上,從 CS188 的廣義 AI 或 CS189 的數學型 ML 入口,再分流到深度學習、NLP、視覺與強化學習。2025–2026 有不少 A3 公開課,但最新班次、最新穩定網址與最好用的自學版本並不總是同一個。

learning deep-dive

CMU 的 AI 學位:全美第一個 AI 學士,把「AI 該學什麼」寫成了畢業要求

Stanford 沒有 AI 學位,AI 是 CS 底下的一條 track;CMU 2018 年開出全美第一個 B.S. in Artificial Intelligence,把 AI 拆成四個 cluster 並強制各修一門,還把倫理課列進畢業要求。碩士這條線則是 MSAII——不在 CS 系,在語言技術研究所,195 學分裡有 84 分是創業流程,最後要交一個能拿去募資的 capstone。查證時發現兩處官方頁面自己打架:AI Core 是 2 門還 3 門、總學分是 192 還 195。

CMU AI/ML 課程導讀:07-280 新主幹與校外可走的公開路線

CMU 現行 BSAI 已改成 07-280 → 07-380,再從 NLP/視覺核心與四個 AI clusters 延伸;但 07-380 要到 Fall 2026 才首開。07-280 Spring 2026 的殘留教材與 10-301/601 已能完整自學,15-281 則是仍有價值的退休舊路線。

learning deep-dive

會議即內容工廠:AI Engineer 頻道的結構性優勢

AI Engineer YouTube 三年衝到 60 萬訂閱,不是因為他們很會做影片,而是因為他們根本不需要「做」影片——一年八場會議的錄影副產品,就是取之不盡的 YouTube 素材。內容創作的真正瓶頸不是技能,是結構。

世界名校 AI/CS 課程地圖:哪些課真的能公開自學?

這份地圖盤點 Stanford、CMU、MIT、UC Berkeley 在 2025–2026 年的 AI/CS 課程,將公開程度拆成 A0 課表可見、A1 課綱可見、A2 教材部分開放、A3 足以自學。課程官網存在、YouTube 播放清單存在,都不代表校外讀者真的拿得到當期影片、作業與起始碼。

MIT AI/ML 課程導讀:6-4 是正式 AI 學位,公開教材卻分散在三個年代

MIT 自 2022 年已有正式的 6-4 Artificial Intelligence and Decision Making 學位;但校外自學時,現行學位要求、2025–2026 課站與最好用的 OCW 版本往往不是同一套。真正可行的路線,是先照 6-4 的程式、演算法、線代與機率骨架打底,再依公開程度選 6.S191、6.3900、6.4110、6.7960、電腦視覺或機器人分支。

Stanford CS103 導讀:一門數學課,開學第一件事是裝 C++ 編譯器

CS103 前半教怎麼寫證明、後半教什麼證不出來,但外界最少提到的是它有 C++ 程式作業:PS0 就是裝 Qt Creator。它的真正資產是一整排自製的『Guide to X』講義與一份會拿來扣分的 Proofwriting Checklist,全部公開;解答與練習考題全部鎖在 Stanford 登入後面,而且鎖的理由寫在 Honor Code 裡。

Stanford CS107 導讀:同一門課的作業占比,在不同學期是 40% 對 20%

CS107 從 Unix 與 C 一路做到 x86-64 與自己寫 malloc,七份作業。但翻四個學期的封存 syllabus 會發現同一門課差很多:作業在三個學期占 40%,在 Summer 2026 只占 20%(多了 40% 的隨堂小考);重交政策只出現在 Cain 開的學期,Troccoli 那學期完全沒有。唯一不收遲交的是最後那份 heap allocator。而擋住自學者的不是評分器,是起始碼全在 AFS 上。

Stanford CS109 導讀:一門機率課把「怎麼用語言模型讀這一講」寫成了官方教材

CS109 在 2026 年夏季的每一講旁邊,掛了一份官方寫的 LLM Learning Guide——六個概念、每個概念一組 Learn 與 Test me 提示詞,逐週產出共 23 份 PDF。同一門課的榮譽守則第 4 條卻明文禁止拿 LLM 解作業,而成績有 65% 壓在現場考試。這兩件事是同一套設計的兩半。

Stanford CS111 導讀:九份作業拼成一部作業系統,但考試不考作業

CS111 的九份作業從 lambda 一路做到日誌式檔案系統的崩潰復原,但把官網逐頁讀完會看到三件課綱不寫的事:第三份作業是分水嶺,因為第四份會直接編譯你第三份的程式碼;期末考有一整塊在考倫理學名詞,公開的練習卷連解答都在;還有,把自己的程式碼貼給 AI 問問題,這門課白紙黑字寫成違反榮譽準則。

Stanford CS161 導讀:一門把「寫清楚」列為第三個學習目標的演算法課

CS161 第一堂投影片寫下的課程目標有三個:設計、分析、溝通。第三個才是作業不准手寫、要求寫得像給同事的備忘錄的原因。八份作業裡 HW2 是分水嶺,講義的 Python notebook 用來示範「量時間看不出誰比較快」,而暑期班是同課號、同課名、完全另寫一套的另一門課。

Stanford CS161 Lecture 1:為什麼分析演算法要從 Karatsuba 乘法開始

把兩個 n 位數各切成兩半,直覺分治仍要做 4 個子乘法,時間沒有離開 n²;Karatsuba 用 (a+b)(c+d)-ac-bd 算交叉項,把分支降到 3,得到約 n^1.585 的成長率。

Stanford CS161 Lecture 2:從 InsertionSort 證明到 MergeSort 的 n log n

第二講把「快」拆成可證明的最壞情況上界:InsertionSort 用迴圈不變量證正確、最壞為 n²;MergeSort 用遞迴不變量與每層 O(n) 的遞迴樹,得到 O(n log n)。

Stanford CS161 Lecture 3:Master Theorem 怎麼讀懂一棵遞迴樹

對 T(n)=aT(n/b)+O(n^d),真正的比較是分支成長 a 與單題工作縮小 b^d:a=b^d 時每層同重,a<b^d 時頂層主導,a>b^d 時葉層主導;不合模板就改用 substitution。

Stanford CS161 Lecture 4:Median of Medians 如何保證線性 Selection

Selection 不必先排序。Median of medians 每 5 個元素取中位數,再取這些中位數的中位數作 pivot,保證較大的遞迴側至多 7n/10+5;用 substitution 可證 worst-case O(n)。

Stanford CS161 Lecture 5:Randomized QuickSort 的期望時間怎麼證

Randomized QuickSort 對每個固定輸入都有 O(n log n) 期望時間,但最壞仍是 Θ(n²);正確證明不是把期望子問題大小代入 recurrence,而是計算每對元素被比較的機率。

Stanford CS161 Lecture 6:Sorting 下界與線性時間 Radix Sort

Ω(n log n) 只限制 comparison sorting。若整數 key 可直接索引 bucket,stable Counting Sort 可作為 Radix Sort 的內層;在 M≤n^c 等條件下能達 O(n)。

Stanford CS161 Lecture 7:二元搜尋樹、紅黑樹與最壞 O(log n) 的來源

一般 BST 的操作成本是 O(h),偏斜時會退化成 O(n);紅黑樹用五條顏色不變量把高度限制在 2 log₂(n+1),因此搜尋、插入與刪除都有最壞 O(log n) 保證。

Stanford CS161 Lecture 8:雜湊、碰撞與期望 O(1) 到底保證什麼

Universal hash family 只需讓任意兩個不同 key 的碰撞機率不超過 1/n,就能把某個 key 所在 bucket 的期望長度壓到 2 以下;這給的是 expected O(1),不是每次操作的最壞 O(1)。

Stanford CS161 Lecture 9:圖的表示、DFS、BFS 與兩種搜尋順序的證明

DFS 與 BFS 都在 adjacency list 上以 O(n+m) 掃完整張圖;DFS finish times 能為 DAG 產生拓撲順序,BFS layers 則精確等於無權圖的最短距離。

Stanford CS161 Lecture 10:兩次 DFS 為什麼能找出強連通分量

把每個 SCC 壓成一點後一定得到 DAG;第一趟 DFS 的 finish times 排出這些分量,第二趟在轉置圖按遞減順序搜尋,每棵 DFS tree 恰好是一個 SCC,總時間 O(n+m)。

Stanford CS161 Lecture 11:Dijkstra、Bellman–Ford 與鬆弛的兩種秩序

Dijkstra 每次確定最小 estimate,正確性依賴非負 edge weights;Bellman–Ford 不挑 vertex、反覆鬆弛所有 edges,以 O(nm) 換取負權支援並能偵測 source 可達的負環。

Stanford CS161 Lecture 12:用動態規劃重寫 Bellman–Ford 與 Floyd–Warshall

動態規劃先精確定義子問題,再用 optimal substructure 寫 recurrence,最後依相依順序填表;Bellman–Ford 以 edge 數分層,Floyd–Warshall 則以允許的中繼頂點分層。

Stanford CS161 Lecture 13:從 LCS、背包到樹上獨立集的動態規劃設計法

Lecture 13 把動態規劃整理成五步:選 state、寫 transition、填表、回復解、再優化實作。LCS 是 O(mn),兩種背包都是 O(nW) 的擬多項式時間,樹上最大權重獨立集則能在 O(|V|) 完成。

Stanford CS161 Lecture 14:貪婪演算法何時能從局部最佳走到全域最佳

貪婪演算法不是『每次挑看起來最好的』,而是每次只保留一個選擇,並用交換論證證明它不會排除最佳解。Lecture 14 以 activity selection、weighted completion time 與 Huffman coding 展示三種證明。

Stanford CS161 Lecture 15:用 cut property 證明 Prim 與 Kruskal

MST 的核心不是背兩支演算法,而是維持『目前選邊仍包含於某棵 MST』,再用 cut property 證明 Prim 與 Kruskal 每一步都安全。

Stanford CS161 Lecture 16:Ford–Fulkerson、殘餘網路與最大流最小割

Ford–Fulkerson 在殘餘網路沿 augmenting path 推流;找不到路時,可達集合形成與 flow 同值的 cut,同時證明最大流、最小割與兩者相等。

Stanford CS161 Lecture 17:Gale–Shapley、穩定配對與可撤銷的貪婪選擇

Deferred Acceptance 允許暫時接受後再反悔;proposal 的單調性證明它在 O(n²) 結束、產生 stable matching,且偏向 proposal 的一側。

Stanford CS161 Lecture 18:從演算法工具箱走向 LP、編碼與 ML

期末課以 slides 回顧 CS161 工具箱,再用 LP duality、Reed–Solomon 與 ML-assisted algorithms 指向後續方向;官方沒有提供 notes。

「AI 時代的技術選擇」導讀:先選多人用的,其餘五條判準是拿來分勝負的

選型的主判準沒有變,仍然是採用度——而 AI 讓它更重要,不是更不重要:用的人多,訓練語料就多,agent 寫出來的正確率就高。這個系列整理的另外五條判準(文件的機器可讀性、型別、原始碼在不在你 repo 裡、資料骨架、機器可呼叫性)是用來在採用度相近時分勝負,或估算你選冷門要付多少代價。

AI SDK 的 message parts:對話介面的資料骨架

AI SDK v5 把一則 AI 訊息拆成 parts 陣列——text、reasoning、source-url、tool-* 各自是獨立片段。這個資料結構決定了現代 AI 對話介面怎麼寫:render 時 switch part.type,每種片段交給對應元件。這篇拆解 parts 模型的設計邏輯、useChat 的串流機制,以及它如何成為 AI Elements 這類元件庫的地基。

Drizzle ORM:SQL-first 的 TypeScript 資料庫存取層

Drizzle ORM 是一個 SQL-first 的 TypeScript ORM——query builder 長得像 SQL,agent 寫出來的查詢在 diff 裡讀得懂。零依賴、約 7.4 KB gzipped,原生支援 Cloudflare D1、Neon、Turso 等 edge database。版本至今仍是 0.45.2,但週下載量已達 1,690 萬,超過 Prisma 的 1,380 萬。

llms.txt:把文件寫給機器讀的那一份

llms.txt 是 Jeremy Howard 於 2024-09-03 提出的慣例(規範已更新至 v2):在網站根目錄放一份給 LLM 讀的 Markdown 索引。六個前端文件站實測:TanStack、shadcn、Zustand、AI SDK、Next.js 都有,React Router 是唯一 404。配套的 llms-full.txt(全文版)Anthropic、Cloudflare 等也已採用。這篇講規範內容、誰在用、以及它為什麼開始影響套件選型。

shadcn registry 與 MCP:元件分發的第三條路

元件分發向來只有兩條路:npm 套件(黑盒依賴)或手動複製貼上。shadcn registry 把第三條路標準化——元件以 JSON 描述原始碼與依賴,CLI 一鍵裝進你的 repo 變成你的程式碼。任何人都能架自己的 registry(AI Elements 就是一個),官方 MCP server 更讓 AI agent 直接瀏覽與安裝元件。

Supabase:把整個後端建在 PostgreSQL 上的平台

Supabase 不只是 Firebase 的開源替代,它的核心設計是把 Auth、Storage、Realtime 全部建在 PostgreSQL 的 schema 和 WAL 上。結果是:你可以用一條 SQL 查所有東西,pgvector 直接用,agent 寫 SQL 就能操作整個平台。108k GitHub stars、Apache 2.0 授權、Free 方案 500 MB 資料庫。

Tailscale:agent 住在你家,不是你連回家

自架一個 24 小時跑著的 agent,等於在自己網路裡開了一個必須從外面連得到、又不能開在公網上的東西。這篇拆 Tailscale 的四個機制各自解決什麼:tailnet 解決連得到、subnet router 解決碰內網、tag 與 ACL 解決權限邊界、policy 秒級生效與 tailnet lock 解決收得回。附 2026-08 實查的定價:Personal 免費、6 個使用者、user device 無上限、50 個 tagged resource。

TanStack Router:把路由變成編譯期可驗證的東西

TanStack Router(2023-12 發 1.0,週下載約 20M)把路徑、params、search params 全部做成編譯期推導:導航到不存在的路由是型別錯誤,不是執行期 404。這篇拆解它的三個核心設計——型別安全、search params 一等公民、與 Query 整合的 loader——以及為什麼這在 AI agent 寫碼的時代價值被放大。

Temporal:把流程寫成程式碼,崩了也能接著走完

Temporal 是 durable execution 平台(Server 1.31.2、Python SDK temporalio 1.31.0,MIT,2026-08 實查)。它跟 BullMQ / Celery 那種任務佇列的差別不是規模,是保證的東西不同:佇列保證訊息被消費,Temporal 保證一段橫跨多次外部呼叫的流程走完。代價是工作流程碼必須決定性——而 LLM 呼叫天生非決定性,這篇講這個張力怎麼解、什麼時候不划算。

Trigger.dev:用行程快照做持久任務,不要求你的程式碼有決定性

Trigger.dev 是 Apache 2.0 的持久任務平台(v4.5.12,2026-08 實查),用 CRIU 對整個 Node.js 行程做記憶體快照來暫停與復原。跟 Temporal 的 replay 模型不同,它不重跑你的編排碼、不要求決定性——LLM 呼叫直接寫在 task 裡就行。代價是快照無法保留 TCP 連線,還原後要自己重建;而且快照是 cloud-only,自架拿不到。

WebMCP:讓網頁把自己的功能交出去給 agent 呼叫

WebMCP 讓網頁用 document.modelContext.registerTool() 把自己的功能註冊成 agent 可呼叫的工具,取代 agent 猜 DOM 點按鈕。Chrome 已在 149 開 origin trial、預計 157 進 stable,Edge 150 跟進。但 WebKit 明確表態反對(「agent 本質上是輔助科技,網站不該把它單獨挑出來對待」),Mozilla 給 neutral。這篇講兩套 API 怎麼寫、安全模型擋在哪、以及在只有一個半引擎支持的情況下要不要現在投資。

tech deep-dive

實測五個繁中用語檢查工具:一個能用,一個的 --fix 會把「只是」改成「隻是」

在 109 篇確實含中國用語的文章上,zhtw-mcp 精確率 29.4%、召回 85.2%,twlint 是 21.2% / 82.5%——但 twlint 有 195 個 error 級判斷是把合法正體字當簡體字(干→幹 60 次、只→隻 15 次),跑 --fix 會毀掉文章。最有用的發現不是誰勝出:zhtw-mcp 幫我補了五個自己漏抓的中國用語,也擋下一個我誤列的(審計)。工具的價值在校準你的清單,不是取代它。

Zod:從表單驗證長成 TypeScript 生態的通用合約

Zod 週下載 224M(2026-08 實查),已遠超「表單驗證庫」的定位:API 邊界、環境變數、路由 search params、LLM tool schema 與 structured output,全在用同一套 schema。核心機制是「一次定義、兩層收穫」——執行期驗證與靜態型別從同一個來源推導。Zod 4(2025-07 上 npm)主打更快、更省 tsc。

Behavioral & Ethics 面試攻略:AI 倫理、團隊合作與影響力敘事

行為面試不是靠臨場發揮,而是靠事前準備好的故事庫。AI Engineer 的行為面試有獨特的考點:AI 倫理(bias、fairness、privacy)、技術決策的影響力敘事(為什麼選這個模型/架構)、跨團隊推動 ML 專案的經驗。準備策略:建立 8-10 個 STAR 故事,每個故事練到能在 2 分鐘內講完。

Coding 面試攻略:ML-flavored 程式題的準備策略

AI Engineer 的 coding 面試和 SWE 不完全一樣——除了 LeetCode medium,還會出 ML-flavored 的題(實作 tokenizer、寫 batch inference pipeline、處理稀疏矩陣)。準備策略:LeetCode medium 練到 70% 通過率就夠,剩下的時間花在 numpy/pandas 操作、資料處理 pipeline、以及 ML 相關的程式題。

Deep Learning 面試攻略:從 CNN 到 Transformer 的核心直覺

深度學習面試重點不是推導反向傳播,而是能不能解釋架構背後的設計直覺。高頻考點:CNN 的 locality 與 translation invariance、RNN 到 Transformer 的演進為什麼必要、self-attention 的計算邏輯與複雜度、BatchNorm vs LayerNorm 的適用場景、常見的 training tricks(learning rate schedule、gradient clipping、mixed precision)。

LLM Application Design 面試攻略:從 RAG 到 Agent 架構

LLM Application Design 是 2025-2026 面試最熱的新題型。核心考點:RAG pipeline 的 chunking/retrieval/reranking 設計、agent 架構的 tool-use 與 planning loop、context window 管理策略、guardrails 與 safety 設計、以及 LLM 應用的評估方法。面試官特別看重你有沒有踩過坑。

ML Fundamentals 面試攻略:從 bias-variance 到 evaluation metrics

ML 基礎面試不考你背公式,考你能不能用直覺解釋概念、在追問下不崩潰。高頻考點:bias-variance tradeoff 的實際意義、L1/L2 regularization 的選擇邏輯、cross-entropy 為什麼比 MSE 適合分類、SGD 與 Adam 的取捨、precision/recall 在不同場景的重要性差異。

ML System Design 面試攻略:從需求拆解到生產架構

ML System Design 面試的核心不是選模型,而是怎麼把一個商業目標變成一個可上線、可監控、可迭代的 ML 系統。面試官想看你能不能:把業務目標翻成 ML 目標、設計 data pipeline 和 feature store、選擇合理的 serving 策略、規劃 monitoring 和 A/B testing。

MLOps & Deployment 面試攻略:從 CI/CD 到模型監控

MLOps 面試考的是你有沒有把模型推上生產的經驗。高頻考點:ML pipeline 的 CI/CD(跟軟體 CI/CD 有什麼不同)、model registry 與版本管理、A/B testing 的設計與陷阱、inference 的 scaling 策略(水平擴展、模型壓縮、caching),以及生產環境的 monitoring 與 alerting 設計。

NLP & LLM 面試攻略:從 tokenization 到 RLHF

LLM 面試的分水嶺是你有沒有實際用過這些東西。高頻考點:BPE tokenization 的邏輯與多語言問題、預訓練目標(CLM vs MLM)、fine-tuning 的三種層次(full/LoRA/prompt tuning)、RLHF 的流程與 failure mode、prompting 的工程實踐、LLM 評估的困難與現有方法。

AI Engineer 面試全景圖:從公司類型到準備策略

AI Engineer 面試不只考 ML——大廠看系統設計與 coding,新創看端到端交付,AI-native 公司看 LLM 工程深度。準備策略:先釐清目標公司類型,再按六大維度(ML 基礎、系統設計、LLM 應用、Coding、Paper Reading、行為面試)分配時間。

Paper Reading 面試攻略:怎麼讀、怎麼討論、必讀清單

Paper Reading 面試不是考你有沒有讀過那篇 paper,而是考你能不能快速理解一個新方法並找出它的限制。AI-native 公司(Anthropic、OpenAI)特別愛考。準備策略:練習 30 分鐘讀完一篇 paper 並能口述 contribution + limitation,建立自己的必讀論文清單,每篇練習用三句話總結。

Stanford CS329A 導讀:這門課教自我改進,也親口說了它改進不了什麼

CS329A 的軸心是 generation–verification gap:模型答得出來,卻認不出哪個對。但課程自己下的結論更值得記——目前這些方法讓模型變得更穩定,不是更聰明。錄影公開 9 支,只涵蓋 20 堂中的 9 堂。

Stanford CS 課程導讀:按先修關係排一次,從 CS106A 到 CS336

Stanford CS 的骨架是 CS103、CS107、CS109、CS111、CS161;CS221 先修列出其中三門,另加 CS106B。本文依官方先修與編輯者建議順序排出主線,並標明公開教材與停開風險。

learning deep-dive 品味修煉

AI 時代,品味是放大器

AI 把執行成本壓到接近零,結果品味好的人產出更多價值,品味差的人產出更多垃圾。差別不在會不會用 AI,而在用之前腦中有沒有值得被放大的東西。這個系列記錄我系統性磨利判斷力的過程。

AI Product Design 面試攻略:從 Human-in-the-Loop 到信任建立

AI Product Design 是 2025-2026 面試最熱的新題型。核心考點:什麼時候該用 AI(不是所有問題都需要 AI)、human-in-the-loop 的設計模式(什麼時候讓人介入)、信任建立(怎麼讓用戶相信 AI 的輸出)、AI 產品的獨特挑戰(hallucination、latency、cost),以及 AI 產品的評估指標。

Behavioral & Leadership 面試攻略:影響力、衝突處理與 Vision 表達

Product Builder 的行為面試和 SWE 不一樣——不只考團隊合作,特別考你怎麼在沒有直接權力的情況下推動事情。核心能力:影響力敘事(怎麼說服工程師做你想做的功能)、衝突處理(跟設計師/工程師/stakeholder 意見不同時怎麼辦)、vision 表達(怎麼用 30 秒讓人理解你的產品方向),以及失敗故事(怎麼從失敗中學習而不是推卸責任)。

Execution 面試攻略:從 Roadmap 到跨團隊協作

Execution 面試考的是你能不能把想法變成可交付的東西。核心能力:roadmap 規劃(怎麼在有限資源下排序)、優先序辯護(為什麼先做 A 不做 B)、跨團隊協作(怎麼推動工程和設計)、stakeholder management(怎麼處理衝突),以及用數據追蹤進度的能力。

Growth & Experimentation 面試攻略:從 Growth Loop 到實驗設計

Growth 面試考的不是你會不會做 growth hack,而是你有沒有系統性的成長思維。核心能力:growth loop 設計(acquisition → activation → retention → referral 的飛輪)、實驗設計(假設 → 指標 → 實驗 → 分析的完整流程)、retention 策略(找到 aha moment、設計 habit loop)、以及用數據判斷什麼值得繼續投資。

Metrics & Analytics 面試攻略:從北極星指標到實驗設計

Metrics 面試考的是你能不能用數字做決策,而不是你懂多少統計。核心能力:北極星指標的選擇邏輯(為什麼選這個不選那個)、指標樹拆解(找到可操作的 lever)、漏斗分析(哪一步流失最值得修)、A/B testing 的設計與陷阱、以及面對反直覺數據時的判斷力。

Product Builder 面試全景圖:從 PM 到 Builder 的思維轉換

Product Builder 不是傳統 PM——你要能從 0 到 1 建產品,不只寫 PRD。面試考的是產品直覺、指標思維、技術理解力與執行力的交集。準備策略:先搞清楚目標公司要的是 PM 還是 Builder,再按九大維度分配時間。

Product Design 面試攻略:從問題到方案的設計過程

Product Design 面試不是考你畫 wireframe,而是考你怎麼從問題走到方案。核心能力:MVP 範圍判斷(什麼該做什麼不做)、trade-off 分析(速度 vs 完整度、通用 vs 客製)、設計決策的溝通能力(為什麼選 A 不選 B),以及快速迭代的思維。

Product Sense 面試攻略:從用戶洞察到功能優先序

Product Sense 面試考的不是你能想出多少功能,而是你能不能從一個模糊的需求裡找到真正值得解的問題。核心能力:用戶分群思維、問題重構(把『加個功能』翻成『解決什麼問題』)、feature prioritization 的結構化論述、以及在面試官追問下堅持或修正判斷的能力。

Strategy 面試攻略:從市場定位到競爭護城河

Strategy 面試不是考你背框架,而是考你能不能在資訊不完整時做判斷。核心能力:市場規模估算(TAM/SAM/SOM 的實際用法)、競爭護城河分析(網路效應、轉換成本、品牌)、進入新市場的 go/no-go 決策,以及用排除法而不是加法來做策略取捨。

Technical PM 面試攻略:從 API 設計到架構理解

Technical PM 面試不要求你寫 production code,但你要能讀懂 trade-off。核心能力:API 設計的基本思維(RESTful、版本控制、錯誤處理)、系統架構的 high-level 理解(微服務、資料庫選型、快取策略)、與工程師協作的溝通模式(RFC 流程、技術 spec review),以及在技術限制下做產品決策的能力。

ai guide AI 證照備考

AWS 三張 AI 證照怎麼選:MLA-C01 的窗口只剩 40 天,而且只有英文版在倒數

AIF-C01、MLA-C01、AIP-C01 不是難度階梯,是三個不同的職能切面:AIF 考「說得出來」、MLA 考「把 ML 上線」、AIP 考「把別人的模型整合成系統」。但 2026 年 8 月的選擇被時間卡住——官方認證頁公告 MLA-C01 英文版最後考試日是 2026/9/28,從今天算只剩 40 天,而 MLA-C02 要 9/1 才開放報名、考綱尚未公布。非英文(日/韓/簡中)考生的窗口反而長得多,這是真實差異。同一頁還同時出現 MLA-C02 與 ME1-C02 兩個代碼,官方沒說明兩者關係。另外續期圖會反過來決定考試順序:AIP-C01 一張就把 AIF-C01、MLA-C01 與 Data Engineer – Associate 各續三年。

ai guide AI 證照備考

Claude 四張認證怎麼選:先確認你報不報得了名

選 Claude 四張認證之前有一個比所有考點都重要的前提:報考只開放給 Claude Partner Network 的組織,個人無法自行報名。過得了這關的人,實際的分岔點有四個——CCAO-F $99 不計入 partner tier 資格(另外三張計入);Claude Code 在 CCAR-F 佔 20%、在 CCDV-F 只佔 3.1%,架構師那張考這個工具比開發者那張重;CCAR-P 有 28% 是治理與利害關係人溝通,系列裡沒有第二張這樣;CCAO-F 最便宜但 Prompting 只有 14%,輸出評估 21% 才是主軸。四張效期都是 12 個月,重考間隔 14 / 30 / 90 天、12 個月內最多 4 次。

ai guide AI 證照備考

微軟這條線怎麼選:AI-103、AI-500、AB-620、AB-100 四張的分岔點

微軟四張 AI/agent 認證裡,只有 AI-103 → AI-500 是官方寫死的階梯,其餘全是定位問題。選擇要走三個分岔:寫不寫 Python(AI-103/AI-500 vs AB-620)、建東西還是做判斷(AB-100 vs 其餘三張)、以及今天能不能真的開始——AI-500 的四條官方學習路徑目前全 404、AB-620 沒有練習測驗、AB-100 有免費練習測驗。對台灣讀者還有第四個分岔:AI-103 與 AB-620 有繁體中文,AI-500 與 AB-100 只有英文。四張都是 $165、效期一年、續期免費但只在到期前六個月開放。

ai guide AI 證照備考

NVIDIA 四張怎麼選:兩張還不能報名,訓練全要付費,官方文件還在打架

NVIDIA 生成式 AI 線有四張:NCA-GENL、NCA-GENM(各 $125,associate)、NCP-GENL、NCP-AAI(各 $200,professional)。選之前先看三件別家沒有的事:一、兩張 professional 的 Register 按鈕都標著「Coming soon」,近期計畫直接只剩兩張 associate;二、NVIDIA 是本系列唯一官方備考課全部付費的廠商,真實成本是考試費加課程費,NCA-GENL 自學五門 $390、NCA-GENM 有兩門只有 $500 講師版、NCP-GENL 官方清單列價合計 $1,620;三、官方文件自相矛盾——NCP-AAI 的權重網頁加總 98%、PDF 加總 92%,NCP-GENL 網頁表格有兩格描述錯置(其中一格是 OpenUSD 的文字)。另外綁定程度差很多:NCP-AAI 只有 7% 綁 NVIDIA 產品,NCP-GENL 有 31% 在考 GPU 與模型壓縮。

Aider:最老牌的終端 AI Pair Programmer,以及它現在的維護狀況

Aider 是 2023 年就存在的終端 AI pair programmer(Python、Apache-2.0、約 48.3k stars),設計上跟現在的自主 agent 走反方向:手動 /add 檔案控制 context、每次修改自動產生一個 atomic git commit、architect/editor 雙模型分工。但要注意維護節奏:最後一版 PyPI 發布是 2026-02 的 0.86.2,最後一筆 commit 在 2026-05,官網仍推薦 Claude 3.7 Sonnet 與 o1。

Amp:靠「砍功能」定義自己的 coding agent

Amp 已於 2025 年 12 月從 Sourcegraph 獨立為 Amp Frontier Corporation,npm 套件也從 @sourcegraph/amp 改為 @ampcode/cli。它的識別特徵是持續砍功能:editor 擴充、Amp Tab、TODO 清單、Fork、custom commands、public threads 全部刪掉。2026-07-18 才首度推出月費訂閱(Megawatt $20、Gigawatt $200),此前只有 pay-as-you-go。現在主軸是 orbs——關掉筆電也會繼續跑的遠端機器。

GitHub Copilot CLI:把 agent 開在 GitHub 這個平台上

Copilot CLI 於 2026-02-25 正式 GA,所有 Copilot 方案(含 Free)都包含。差異化不在 agent 本身,而在 GitHub 平台整合:內建 GitHub MCP server 直接操作 issue 與 PR、組織政策自動繼承、`&` 前綴把工作丟給雲端 coding agent。計費走 GitHub AI Credits(1 credit = $0.01),Pro $10/mo 含 $15、Pro+ $39 含 $70、Max $100 含 $200。

omp(Oh My Pi):把 Pi 的極簡主義翻過來的 batteries-included 分支

omp 是 Pi 的 fork,但不只是插件層堆疊:它多了約 80,000 行 Rust,把 grep/shell/AST/PTY 全部搬進 in-process。內建工具從 Pi 的 7 個變成 31 個,外加 14 個 LSP op、28 個 DAP op、60+ 供應商。同一份 codebase,兩個相反的賭注。

AI 時代的 React 套件選型:從 TanStack 三件組到整層 Stack 的地圖

以 TanStack Router(19.7M 週下載)+ Query(55.8M)+ Zustand(44.5M)為核心,配 Vite、react-hook-form + Zod(224M)、Tailwind + shadcn、Vitest + Playwright,整理純 SPA 的當代預設 stack。AI 時代選套件多了三個判準:文件有沒有 llms.txt(TanStack 全家有、React Router 沒有)、型別安全能不能當 agent 護欄、原始碼是不是在你 repo 裡讓 agent 讀得到。

AI Elements:Vercel 把 ChatGPT 式介面拆成可複製的 shadcn 積木

AI Elements 是 Vercel 為 AI SDK 生態出的 React 元件庫,registry 現有 48 個元件,涵蓋 Conversation、Reasoning、Sources、Tool 等 AI 介面積木。走 shadcn 模式:npx ai-elements@latest 把原始碼直接複製進專案,完全可改,跟 useChat 的 message parts 一一對應。

ai deep-dive

AI Agent 自動產生簡報:讓模型看見自己排的版

2026 年 agent 做簡報的共識:outline-first + 內容/構建分離 + render 成圖讓 fresh-eyes subagent 做視覺 QA。Anthropic 與 OpenAI 的官方 slides skill 都收斂到 PptxGenJS + 視覺驗證迴圈,學術線(PPTAgent→PreGenie→DeepPresenter)也指向同一方向。但下半年出現兩個修正:PresentBench 指出常被引用的 PPTEval 給分過於樂觀,SeaSlides 則主張不該讓模型直接寫自由格式的 HTML/SVG。

ai deep-dive AI 證照備考

AI 治理框架對照:EU AI Act、NIST AI RMF、ISO/IEC 42001,以及沒有一張證照點名它們

治理在證照裡的比重比多數工程師以為的高——CCAR-P 的 Governance 14% 加 Stakeholder 14% 共 28%、CCAO-F 治理 15%、AB-100 的部署治理塊 40–45%、AIF-C01 的負責任 AI 14% 加安全治理 14%。但把十五份官方 exam guide 逐份查過,沒有任何一張點名 EU AI Act、NIST AI RMF 或 ISO/IEC 42001;全系列唯一被官方點名的法規只有 CCAR-P 的 GDPR、HIPAA、FedRAMP。所以這篇的用法不是「背框架去考試」,而是用三份框架當骨架,把六張證照散落的治理條目歸位。三份框架的分工是:EU AI Act 是法律(2026-08-02 全面適用,高風險義務被 AI Omnibus 延到 2027-12-02)、NIST AI RMF 是自願框架(GOVERN/MAP/MEASURE/MANAGE 四個功能,且 1.0 正在改版)、ISO/IEC 42001 是可驗證的管理系統標準(條文付費,本文只用 ISO 官方公開頁能證實的部分)。

ai guide AI 證照備考

AWS AI Practitioner(AIF-C01)備考路徑:v1.1 把它變成 agentic AI 考試

AIF-C01 的考綱在 2026 年 4 月 30 日更新到 v1.1,一口氣新增七條目標,把 MCP、多 agent 模式、context engineering、token 計價、幻覺偵測全部變成考點,in-scope 服務也加入 Bedrock AgentCore、Kiro、Strands Agents——網路上流傳的整理幾乎都是舊版。這篇以官方五章權重(20/24/28/14/14)為骨架給出四週路徑。官方規格:$100、90 分鐘、65 題(50 題計分)、及格 700、效期 3 年,而且是本系列唯一提供繁體中文的考試。

ai guide AI 證照備考

AWS GenAI Developer Professional(AIP-C01)備考路徑:整張考試都在考別人的模型怎麼整合

AIP-C01 是 AWS 唯一專攻 GenAI 應用開發的 professional 級證照,官方明確排除模型訓練、進階 ML 與特徵工程——它考的是把別人的基礎模型整合進生產系統。五章權重 31/26/20/12/11,最重的第 1 章有將近一半的技能點落在向量儲存與 RAG。2026 年 3 月的改版加入 Bedrock AgentCore,beta 已於 3/31 結束,更早的教材全部過期。官方規格:$300、180 分鐘、75 題(65 題計分)、及格 750、效期 3 年,考過會同時續掉 AIF-C01、MLA-C01 與 Data Engineer – Associate。

ai guide AI 證照備考

Claude Certified Architect Foundations 考試完整指南

Claude 官方架構師認證(CCAR-F)的完整備考指南:五大領域權重 27/18/20/20/15、六大考試情境抽四個、常見反模式與實際演練建議。官方規格為 60 題 / 120 分鐘 / $125 / 效期 12 個月 / 及格 720,報考限 Claude Partner Network 成員,準時續期免費且非監考。

ai guide AI 證照備考

Claude Certified Architect Professional(CCAR-P)備考路徑:有 28% 不考技術

CCAR-P 是 Anthropic 四張裡最貴也最資深的一張($175、63 題、120 分鐘)。七個領域裡最重的是 Integration 19%,但真正讓它跟系列其他證照不同的是另外兩塊——Governance, Safety & Risk Management 14% 與 Stakeholder Communication & Lifecycle Management 14%,合計 28% 考的是法遵、風險、需求訪談與交付生命週期,不是寫程式。官方點名 GDPR、HIPAA、FedRAMP,並在 Intended Audience 明講「不適合入門開發者,也不適合只寫 prompt 而不負責系統設計的人」。

ai guide AI 證照備考

Claude Certified Associate(CCAO-F)備考路徑:最重的一塊是「怎麼判斷 Claude 講錯了」

CCAO-F 是 Anthropic 四張裡最便宜的一張($99、60 題、120 分鐘),給的是「用 Claude 做事」而不是「寫程式串 Claude」的人。七個領域裡最重的是 Output Evaluation and Validation 21%——辨識幻覺、判斷何時需要人工複核、比較與改寫輸出;Governance, Risk, and Responsible Use 也有 15%。官方明講它不適合寫 API 或設計 agentic 系統的開發者。另有一條容易被忽略:這張不計入 Claude Partner Network 的 tier 資格,另外三張才算。

ai guide AI 證照備考

Claude Certified Developer(CCDV-F)備考路徑:三分之一考的是普通軟體工程

CCDV-F 是 Anthropic 四張認證裡對應工程師的那張。官方 blueprint 有八個領域,最重的 Applications and Integration 佔 33.1%——而它底下最大的兩塊是 Claude Application Design 8.6% 與 Software Engineering Foundations 7.4%,也就是說三分之一的考試在考 API 機制與普通軟體工程。反直覺的是 Claude Code 只佔 3.1%、Eval 只佔 2.6%,而同家族的 Architect 那張光 Claude Code 就佔 20%。官方規格:$125、53 題、120 分鐘、及格 720、效期 12 個月,報考限 Claude Partner Network 組織。

ai deep-dive AI 證照備考

成本、延遲與可用性的考點交集:六張證照從三個不同高度考同一件事

Google PMLE、AWS AIF-C01 與 AIP-C01、微軟 AI-103 與 AI-500、NVIDIA NCP-GENL 都考「怎麼讓 GenAI 應用又快又便宜又不掛」,但排起來是一道三階梯子:AIF-C01 問你知不知道成本隨 token 走,AIP-C01 與微軟兩張問你控不控得住,NCP-GENL 問你改不改得動模型與硬體。切入的高度差三層:NVIDIA 在 kernel 與量化層(Model Optimization 17% + GPU Acceleration 14% = 31%,全系列最重的單一成本延遲區塊),AWS 與微軟在應用層(快取三層、token 上限、chargeback),Google 在 MLOps 層(CPU/GPU/TPU 評估、資料平行 vs 模型平行、依吞吐量擴展服務後端)。交集是八根槓桿,但同一根在三個高度上是三種題目。本文刻意不帶任何價格與硬體規格數字——那是這個主題腐敗最快的部分。

ai guide AI 證照備考

Google PMLE 備考路徑:考綱重寫後怎麼準備

Google Professional ML Engineer 的考綱在 2026 年被重寫,Vertex AI 全面改名為 Gemini Enterprise Agent Platform,舊教材的產品名對不上題目。這篇以官方 exam guide 的六章權重為骨架,逐章列出考什麼、配哪些官方材料、練什麼,並換算成一份看得懂依據的時程。官方規格:$200、兩小時、50–60 題單選加複選、效期兩年、建議 3 年以上業界經驗含 1 年以上 Google Cloud。

Hermes Agent 的研究面:批次跑幾千條 prompt 產訓練資料,以及把它嵌進別的系統

`batch_runner.py` 把數千條 prompt 平行跑成 ShareGPT 格式的 tool-calling trajectory,每條 prompt 可指定自己的容器映像,中斷後靠內容比對而非索引續跑。它內建兩道品質過濾:完全沒有 reasoning 的樣本丟掉、含幻覺工具名的條目在合併時剔除。這解釋了為什麼一家研究機構要做個人 agent——agent 本身就是資料產線。

Hermes Agent 的 Gateway 與排程:無人看管的 agent 最該防的是自己花錢

一個 Gateway 行程接 30 幾個聊天平台,預設拒絕所有不在白名單也未配對的使用者。排程這邊做了兩道少見的防護:pre-dispatch 驗證讓設定壞掉的 job 連 LLM 都不呼叫就標成 blocked_config,而 model drift guard 會讓「沒釘模型」的 job 在全域模型被換掉時直接跳過執行——防的是你切到付費模型後,一個每小時跑的 job 幫你燒錢。

Hermes Agent 安裝與升級:先看支援層級,再決定用哪條路裝

Hermes 的安裝方式分成三個支援層級:macOS(Apple Silicon)/Windows 10-11/Linux-WSL2/Docker 是 Tier 1,Termux 與 Nix 是 Tier 2,而 pip、brew、AUR 與 Intel Mac 明確不支援——用不支援的路裝,修 bug 的 PR 官方不收。升級端 `hermes update` 會先做快照、pull 後編譯九個關鍵檔案驗語法,失敗自動 `git reset --hard` 回滾。

Hermes Agent 導讀:Nous Research 的自我改進 agent,以及它跟 OpenClaw 的真實關係

Hermes Agent 是 Nous Research 的 MIT 授權 agent 框架,賣點是內建學習迴路(自動生技能、記憶提醒、FTS5 跨 session 檢索)。它提供 `hermes claw migrate` 從 OpenClaw 搬家,但 OpenClaw 並沒有被取代,兩邊仍各自在走。這篇是系列導讀,先講清楚它是什麼、跟誰不同、哪些情況不該選它。

Hermes Agent 的記憶與技能:一個會自己改自己的系統,以及你能在哪裡插手

Hermes 的記憶是硬上限的:MEMORY.md 2,200 字元、USER.md 1,375 字元,寫爆不會自動壓縮而是回錯誤讓 agent 自己騰位子。技能則由 curator 背景維護,預設 7 天跑一次、只在閒置 2 小時後啟動,30 天未用標 stale、90 天封存——但從不刪除。真正該打開的開關是 `memory.write_approval` 與 `skills.write_approval`,它們把背景自我改進的寫入變成待審。

從 OpenClaw 搬到 Hermes Agent:搬得動的、搬不動的、還有那份封存目錄

`hermes claw migrate` 會把 OpenClaw 的 persona、記憶、四個來源的技能、模型與供應商設定、平台 token 與審批白名單搬進 Hermes——但金鑰永遠不會靜默搬過去,連 `--preset full` 都要另外加 `--migrate-secrets`。搬不動的東西(cron、plugin、hook、多 agent 清單、複雜頻道設定)不會消失,而是丟進 `~/.hermes/migration/openclaw/<timestamp>/archive/` 等你手動處理。從 Claude Code 或 Codex 過來則是另一個指令 `hermes import-agent`。

Hermes Agent 的模型供應商:訂閱制登入的帳單陷阱,以及 fallback 只會觸發一次

Hermes 支援 40 家以上供應商,其中「用消費者訂閱登入」的路徑最容易產生帳單意外:Anthropic OAuth 只吃 Claude Max 的加購額度、Claude Pro 根本不能用;auxiliary 任務預設 `provider: auto` 會走你的主模型,等於用貴模型做壓縮與視覺。fallback 鏈是每個 session 只觸發一次的一次性切換,不是持續重試。

Hermes Agent 的安全模型:--yolo 之下還有一層拿不掉的地板

Hermes 的審批預設是 smart 模式:低風險指令由 auxiliary 模型放行、真正危險的自動拒絕、不確定的才問人。`--yolo` 與 `approvals.mode: off` 都關不掉 hardline 封鎖清單(`rm -rf /`、fork bomb、`dd` 寫實體磁碟),而 `approvals.deny` 是它的使用者版:在 yolo 之前就攔下來。官方自己標明這整套的威脅模型是「誠實但犯錯的 agent」,不是對抗惡意行程。

Hermes Agent 的七種終端後端:換到沙箱等於關掉危險指令審批

Hermes 的指令可以跑在 local、ssh、docker、singularity、modal、daytona、vercel_sandbox 七種後端。關鍵取捨不是效能而是審批:local 與 ssh 會做危險指令檢查,其餘五種一律跳過,因為官方把容器/沙箱本身當成邊界。另外 Docker 預設是「一個長壽容器跨 session 共用」,不是每次對話一個乾淨環境。

Nous Tool Gateway:用一份訂閱換掉四個帳號,代價是把工具供應鏈集中到一家

Tool Gateway 把 Hermes 的網頁搜尋(Firecrawl)、圖像生成(FAL 九個模型)、TTS(OpenAI)與雲端瀏覽器(Browser Use)四類工具改走 Nous 的基礎設施,用一次 OAuth 取代四個帳號。它是 per-tool 開關而非全有全無,`use_gateway: true` 會蓋過你 `.env` 裡的直連金鑰——這是最容易搞混的優先序。

Hermes Agent 的工具層:3,300 個 MCP 工具塞不進 context 時,它怎麼處理

接上一堆 MCP server 之後,工具 schema 本身就會吃掉大半 context——官方舉的極端例子是 Cloudflare 單一 server 約 3,300 個工具、光名稱就 32K token。Hermes 的解法是 Tool Search:把 MCP 與非核心 plugin 工具換成三個橋接工具,schema 按需載入,核心工具永不延後。另外 plugin 預設全部停用,要在 `plugins.enabled` 逐一點名才會跑。

ai guide AI 證照備考

微軟 AB-100 備考路徑:架構師那張,別照官方頁面那段簡介準備

AB-100 是微軟 agent 線的架構師版,三塊權重 25-30 / 25-30 / 40-45,重心在部署與治理。它的 outline 幾乎全是 design、recommend、propose 這類動詞——考的是情境判斷而不是實作。三個要先知道的:官方考試頁的簡介段落是錯的(寫成資訊保護與 DLP 的樣板文,我逐字驗過),準備要以 study guide 為準;它有免費練習測驗,是微軟三張 agent 證照裡唯一有的;官方列了 15 張可用的 associate 證照但沒有一張是必要條件。官方規格:$165、僅英文、及格 700、效期一年。

ai guide AI 證照備考

微軟 AB-620 備考路徑:Copilot Studio 這條低程式碼的 agent 線

AB-620 是微軟 agent 認證線裡的低程式碼那條——考的是 Copilot Studio 上的 agent flows、adaptive cards、computer use、MCP tools、A2A 與 Fabric data agent,不是寫 Python。三塊權重 30-35 / 40-45 / 20-25,最重的是整合與擴充。官方規格:$165、120 分鐘、及格 700、效期一年、13 種語言含繁體中文,是微軟三張 agent 證照裡唯一有在地化的。已經 GA,但練習測驗還沒開放。

ai guide AI 證照備考

微軟 AI-103 備考路徑:Foundry 換代之後,舊 Azure AI 教材全部作廢

AI-103 取代 2026 年 6 月 30 日退場的 AI-102,考綱完全重寫成 Microsoft Foundry 體系——prompt flow、Azure AI Studio、Azure OpenAI Service、Azure AI Agent Service 這些名詞在目標裡一個都沒有。五塊技能權重 25-30 / 30-35 / 10-15 / 10-15 / 10-15,生成式與 agent 佔最大宗。官方規格:$165、120 分鐘、及格 700、有繁體中文、含互動題型,而且效期只有一年——但續期是免費、開書、非監考的線上評量。

ai guide AI 證照備考

微軟 AI-500 備考路徑:考綱已經公布,官方教材還沒上線

AI-500 是主流雲端業者裡少見的多 agent 系統專家級認證,四塊權重 15-20 / 30-35 / 20-25 / 20-25,官方點名 Agent Framework、LangGraph、Hugging Face Transformers、MCP server 架在 Azure Functions / Logic Apps / API Management、A2A、Key Vault、AI Red Teaming Agent。但它現在有三個限制要先知道:仍是 beta(成績要等重新計分)、必須先取得 AI-103 才能考、而且官方學習路徑尚未上線——考試頁列的四條路徑網址目前全部 404,講師課要等 2026/9/30。

ai deep-dive AI 證照備考

多 agent 架構的考點交集:五張證照重複考什麼,又各自獨有什麼

微軟 AI-500、AB-620、AB-100、NVIDIA NCP-AAI、Claude CCAR-F 這五張證照都考多 agent 架構,交集是七件事:編排拓樸、A2A 與 MCP、每個 agent 的身分邊界、三層記憶、可觀測性與 agent replay、人在迴圈、四個介入點的 guardrail。但同一件事四家用四個名字,而且各自有無法互相轉移的獨有考點——微軟命名了四種 context window 失效模式、NVIDIA 有 7% 綁死自家 NeMo 與 NIM、Claude 考 stop_reason 這種 SDK 層細節。另外修一個常見誤解:Google PMLE 滿篇「Agent Platform」是 Vertex AI 改名,不是多 agent 考點。

ai deep-dive

2026 上半年多模態模型盤點:原生融合 vs. 外接視覺,以及排行榜為什麼會互相打臉

純圖片理解已經打平:MMMU-Pro 上四家前沿模型全部過 80%,差距在 3 分內。真正分勝負的是影片、長文件 OCR、即時語音這幾條軸線,各有不同的領先者。但整理這些排名時最該學的一課,是兩份都算可信的來源對同一個 Video-MME 給出的榜首可以差超過 10 分,而且不是同一家。七月與八月又各換過一輪。

ai guide AI 證照備考

NVIDIA NCA-GENL 備考路徑:名字寫 LLM,考綱有一半是傳統 ML

NCA-GENL 是職缺點名「NVIDIA Generative AI / LLM 相關認證」時最常指的那張。但官方 blueprint 的權重跟名字落差很大——Core Machine Learning and AI Knowledge 30%、Software Development 24%、Experimentation 22%、Data Analysis 14%、Trustworthy AI 10%,LLM 與 RAG 的內容散在條目層而不是自成一塊,spaCy、NumPy、Keras、cross validation 都在考。另一個要先知道的:NVIDIA 官方備考課程全部要付費($30 到 $500),是本系列唯一沒有免費官方學習路徑的廠商。官方規格:$125、1 小時、50–60 題、效期兩年、僅英文、pass/fail 不給分數。

ai guide AI 證照備考

NVIDIA NCA-GENM 備考路徑:多模態那張,但兩門必備課程只有 $500 講師版

NCA-GENM 與 NCA-GENL 同價同時長同級別,但重心完全不同:Experimentation 升到 25%(最重),Core ML 從 30% 降到 20%,並多出 Multimodal Data 15% 與 Performance Optimization 10% 兩塊。內容上考 U-Net、CLIP、擴散模型、多模態損失函數、attention map,以及 Riva/NeMo/Triton/ACE 這幾個 NVIDIA SDK。要注意成本結構:官方建議的五門課裡有兩門只有 $500 的講師版、沒有自學選項——純自學路線先天蓋不滿。官方規格:$125、1 小時、50–60 題、效期兩年、僅英文。

ai guide AI 證照備考

NVIDIA NCP-AAI 備考路徑:還不能報名,而且官方兩份文件的權重互相矛盾

NCP-AAI 是 NVIDIA 的 agentic AI 專業級認證,$200、120 分鐘、60–70 題、效期兩年。但兩件事要先知道:一、官方頁面的 Register 按鈕旁標著「Coming soon」,現在還不能報名;二、官方網頁與官方 PDF study guide 的權重表互相矛盾——Deployment and Scaling 網頁寫 13%、PDF 寫 5%,Run/Monitor/Maintain 網頁寫 5%、PDF 寫 7%,而且兩版加總分別只有 98% 與 92%。兩份都是 nvidia.com。文章把它標成範圍與不確定性,不挑一個當事實。

ai guide AI 證照備考

NVIDIA NCP-GENL 備考路徑:三成考的是 GPU 與模型最佳化,而官方表格有兩格是壞的

NCP-GENL 是 NVIDIA 的 LLM 專業級認證,$200、120 分鐘、60–70 題。它跟其他 GenAI 證照最大的差別在重心:Model Optimization 17% 加 GPU Acceleration 14% 合計 31%,考的是量化、蒸餾、剪枝、分散式平行與 CUDA profiling,不是接 API。兩個要先知道的:官方頁面的 Register 標著 Coming soon,還不能報名;而且同一頁的權重表有兩格描述文字是壞的——Fine-Tuning 那格寫的是 OpenUSD 的資料交換,Model Optimization 那格寫的是部署內容,兩處我都逐字驗過,正確描述在官方 PDF 裡。

ai deep-dive AI 證照備考

prompt 與 context engineering 的考法:十張證照怎麼問,跟實務差在哪

多數人以為 GenAI 證照的主軸是 prompt 寫作,但 CCAO-F 的 Prompting 只有 14%,輸出評估卻有 21%;CCDV-F 的 Prompt and Context Engineering 只有 11%。真正被考的是結構化輸出、防禦性 prompt、動態 context 注入、context 壓縮與快取、prompt 生命週期治理,以及「prompt 改了怎麼證明變好」——這六件事比較接近 context engineering 與軟體工程,而不是寫作技巧。另外沒有任何一張要你現場寫 prompt,全是選擇題,所以練「說得出為什麼」比練手感有用。最該記住的一條來自 CCAR-F:業務邏輯必須被保證時,「先改 prompt」通常是錯誤選項。

ai deep-dive AI 證照備考

RAG 與檢索評估的考點交集:四張證照重複考什麼,還有一張大家以為它考、其實沒有

真正把 RAG 與檢索評估當考點的是四張:AWS AIF-C01(第 2、3 章合計 52%,RAG、向量儲存、FM 評估指標全在裡面)、AWS AIP-C01(第 1 章 31% 裡有 11 個技能點落在向量儲存與 RAG)、NVIDIA NCP-AAI(Knowledge Integration 10% + Evaluation and Tuning 13%)、微軟 AI-500(Develop 30–35% 裡的「多 agent RAG 架構」)。Google PMLE 只貢獻一條 LLM-as-a-judge,而 Claude CCDV-F——那張大家最容易假設它考 RAG 的開發者證照——八個領域裡一條檢索考點都沒有,Eval 只佔 2.6%。附 AIF 與 AIP 的同廠雙級別對照、四家名詞對照表、獨有考點清單與練習專案。

ai deep-dive

自架常駐個人 agent 橫向對照:九個專案,同一個安全問題的九種答案

OpenClaw 386k star、Hermes Agent 232k,但 OpenRouter 上 Hermes 的日 token 量在 2026-05-10 就反超了(224B vs 186B)。這半年冒出來的九個自架 agent 不是九個競品,是對同一題的九種答案:agent 的執行邊界該畫在哪。CVE-2026-44112 打穿的是 OpenClaw 的沙箱本身,而 Meta 對齊主管那次刪信事故裡連攻擊者都沒有——安全指令是被 context 壓縮吃掉的。

Cloudflare Workers AI 模型選型指南:依用途、價格與 context 挑模型

Workers AI 目錄目前 84 個模型。通用對話選 glm-4.7-flash($0.06 / $0.40 per M、131K context),要 vision 選 gemma-4-26b-a4b-it($0.10 / $0.30、256K),極省成本選 granite-4.0-h-micro($0.017 / $0.112),embedding 選 qwen3-embedding-0.6b 或 bge-m3(同為 $0.012 per M)。這篇會定期跟著官方目錄更新。

travel guide

常去日韓該不該開外幣帳戶:拆解海外刷卡 1.5% 與日圓、韓元的換匯成本

海外刷卡 1.5% = 國際組織 1% + 發卡行 0.5%,雙幣卡照收。台銀韓元只有現鈔匯率、來回價差 15.7%,日圓即期只有 2.45%——所以日圓值得開外幣帳戶,韓元不值得。

ai deep-dive

microsoft/AI-Engineering-Coach 的 45 條規則:一份把 agentic 工程意見寫成可執行門檻的清單

微軟員工開源的 VS Code extension,讀本機 Claude Code / Codex / OpenCode 的 session log。真正的內容物是 45 條 Markdown 規則:prompt 短於 30 字元、收到 20 行 AI 程式碼後 15 秒內就送下一則、instructions 檔超過 4000 bytes——把「context engineering」翻成可以爭論的數字。

CS146S Week 4:CLAUDE.md 該寫什麼、hooks 該擋什麼、subagent 該切在哪

課程把指揮 agent 的工具列成四件:指示檔、hooks、commands、subagents。指示檔是唯一每次開機都全額進 context 的,所以它是 config 不是 memory;hooks 補上「規則會被忽略、hook 不會」那一塊;commands 是四件裡唯一由人主動觸發的。課程另給一張表,把軟體任務七步驟裡只剩一步半標成人的工作。

CS146S Week 1:coding agent 的內部構造,其實是一個 while 迴圈

CS146S 第一週的講題是「用 200 行寫出 Claude Code」加上「解剖 production agent 的 system prompt」。agent loop 本身確實只有十幾行。課程投影片最後一頁列了四條 Claude 底下實際在做的事,其中一條是用 `<system-reminder>` 標籤在各處防止模型漂掉——這在官方文件裡找不到。

CS146S Week 5:Express 拿 28 分、CockroachDB 拿 74 分——agent 就緒度是可以量的

Factory 把「repo 夠不夠格讓 agent 動」拆成八根柱子、五個等級,並公開了實測分數:CockroachDB L4(74%)、FastAPI L3(53%)、Express L2(28%)。核心論點是 agent readiness ≈ codebase 裡確定性驗證迴圈的密度——linter、type checker、測試,這些對 agent 來說是獎勵訊號。

CS146S Week 7:o3 找到 Linux kernel 零日,代價是 1:50 的訊噪比

課程量到的 AI SAST 誤報率是 50–100%,而傳統 SAST 本來也有 50% 以上——真正的新問題是非決定性:同一個 prompt 跑兩次結果不同,你無法回答「掃完了沒有」。課程列的 agent 攻擊向量有五種,其中 intent breaking 攻擊的是 agent 的計畫本身。

CS146S Week 3:Agent Skills 是一個資料夾,難的是那兩行 description

Agent Skills 的規格小到一句話講得完:一個含 SKILL.md 的資料夾。真正的設計在三層 progressive disclosure——開機只載 name 與 description,命中才讀全文,需要才展開附檔。本站自己的 repo 有 35 個 skill、7,893 行 SKILL.md,開機成本仍然只有那 35 組 metadata。

CS146S Week 6:Google 為了讓 AI review 有用,先刪掉 17 條規則

Google 的 AutoCommenter 部署到數萬名工程師身上,論文寫出了整條調校過程:把 17 條「技術上正確但沒價值」的規則停掉,有用率從 54% 升到 66%,目標訂在 80% 才准進下一階段。最後的留言解決率約 40%。AI code review 的瓶頸從來不是抓不到,是抓太多。

CS146S Week 9:一個人接 MCP 沒問題,三百個人接就需要一座門

個人怎麼接工具是偏好問題,組織怎麼接是治理問題——誰能碰什麼資料、金鑰放哪、成本算誰的。Anthropic 自己公布的十個團隊使用紀錄裡有個好指標:安全工程團隊佔了整個 monorepo 自訂 slash command 的 50%。採用不是均勻擴散的,它先在會自己造工具的團隊裡起飛。

CS146S Week 8:把 agent 丟到雲端跑之後,瓶頸從等待變成審查

背景 agent 把「你盯著它跑」換成「它自己跑完開 PR」。三家的做法收斂到同一組零件:隔離環境、外部觸發(issue、Slack、Linear)、產出是 PR。真正的新問題是你變成瓶頸——五個 agent 同時跑完,五份 diff 排隊等你讀,而它們互相不知道彼此存在。

CS146S Week 2:context 工程、RePPIT,與 MCP 的 98.7% 那一刀

Fall 2026 把整整一週的 prompting 壓成這週的一節,換上 RePPIT(Research、Propose、Plan、Implement、Test)與 MCP。RePPIT 的兩條硬規則最值得抄:propose 一定要兩個方案、寫 code 的那個 instance 不准 review 自己的 code。MCP 那邊 Anthropic 量到把工具改成程式碼呼叫可以把 150,000 tokens 壓到 2,000。

Stanford CS146S 兩版大綱對照:一年之間,這門 AI 開發課改掉了什麼

Stanford CS146S 的 Fall 2026 大綱把 prompting 從整整一週壓成一節,砍掉終端機與 UI 生成兩週,換上 Agent Skills、Agent-Ready Codebases、Background Agents、AI-Native Team。評分也動了:Final Project 從 80% 降到 50%,多出 30% 的 open source 貢獻。這個系列照十週逐篇讀。

CS146S Week 10:software factory 不是自動化,是把回饋迴圈交出去

最後一週的講題是「self-running, self-improving software systems」。前九週的零件其實都出現過:確定性驗證迴圈、可寫回的 skill、背景 agent、集中治理。課程投影片有個容易被忽略的比例——寫程式只佔工程時間的 30%,另外 70% 是把它跑在 production 上。

Adversarial Robustness and Generative Models:不是非線性,是線性

研究者一開始以為神經網路好騙是因為非線性,結果錯了——Goodfellow 2014 那篇論文主張主因是它們的線性本質,而高維度讓每個微小擾動複利累積。後半場講生成模型:GAN 的三個病,以及 diffusion 為什麼靠「加噪再學會去噪」繞開了其中兩個。

Agents, Prompts, and RAG:一堂課教完之後,剩下的才是難的

BCG 的實驗發現一條「鋸齒狀邊界」:邊界內 AI 大幅提升顧問表現,邊界外 AI 讓結果更差,而人們會在方向盤上睡著。這一講也給了一個很有立場的判斷——盡可能避開 fine-tuning,因為等你調完,下一代模型已經打敗你 fine-tune 過的版本了。

ai guide Stanford CS230 導讀

AI Project Strategy:三四個小時的試算表,省掉幾週的錯方向

Andrew Ng 用 deep researcher 當例子示範 error analysis:列是 pipeline 的每個步驟,行是 10 到 100 個查詢,只看表現不好的那些,逐格標記哪裡壞掉。百分比不需要加起來等於 100%。他說這要花三四個小時,但省下的是幾週走錯方向的時間——而真的會去做的人的比例遠低於 100%。

Deep Reinforcement Learning:把 RLHF 放回強化學習的框架裡

圍棋不能用監督式學習的第三個理由最有意思:ground truth 本身就沒有良好定義——最強的人類不是每天下出最好的棋,而他最好的棋也不是最優解。這一講的最後 20 分鐘把 RLHF 完整放回 RL 的框架:agent 是被微調的模型、action 是下一個 token、一個 episode 是一次完整生成,而且獎勵極度稀疏。

ai guide Stanford CS230 導讀

Full Cycle of a DL Project:資料收兩天就好

Andrew Ng 用人臉辨識開門系統走完整個專案生命週期,而全講只有一個核心論點:速度。他給團隊的期限是兩天,理由是「花在準備資料的時間,應該和訓練一次模型的時間相稱」。最後收在一句話:我的工作是做出一個真的能用的東西,那和做出一個在測試集上能用的東西不一樣。

Supervised, Self-Supervised & Weakly Supervised Learning:從比較像素到比較意義

CS230 第二講用三個案例研究推導出 embedding:日夜分類教你怎麼用人當 proxy 決定解析度,喚醒詞偵測教你三小時生出上百萬筆訓練資料,人臉驗證教你設計出第一個 loss function。最後從監督式 triplet 走到自監督 pairs——那一步才是現代模型能吃下數十億張未標註影像的原因。

What's Going On Inside My Model?:模型退步了,你先看哪裡

問模型「你心目中的鵝長什麼樣」,它畫出一大群鵝——因為標註資料把一群鵝標成 goose,它以為整群才是那個標籤。這一講給了七種打開 CNN 看內部的方法,然後誠實地說:這套方法到 transformer 上,最前沿的研究也只解釋得了兩層。

ai guide Stanford CS230 導讀

Introduction to Deep Learning:光靠 prompt 走不遠的那兩個時刻

CS230 第一講是課程總覽,但 Andrew Ng 花最多時間講的是三件事:為什麼 scaling 有效、什麼時候 prompt 就不夠用了、以及他認為「不要學寫程式」是史上最糟的職涯建議之一。

ai deep-dive 文件解析實戰

掃描 PDF 實測:10 種解析工具丟進考古題,結果差多少?

用 4 份台大碩班掃描考古題實測 10 種開源 PDF 解析工具。VLM 類(Firecrawl、MinerU 3.4、Marker v2)在公式和程式碼上全面碾壓傳統 OCR,但安裝踩坑才是真正的門檻——MinerU 舊包名會進依賴地獄、Marker 首次模型下載要 10 分鐘、PaddleOCR 缺引擎。實務推薦兩階段策略:RapidOCR 粗篩 + MinerU/Firecrawl 精查。

Career Advice in AI:投了 300 份履歷都失敗的 10x 工程師

一個菁英等級的工程師投了 300 多份工作全部失敗,原因是求職手冊教他「站穩立場、要有骨氣」,而他詮釋成強硬。面試官的判斷是:這人就是那個 10x 工程師,但我不想讓他靠近我的團隊。這一講也給了 vibe coding 最好的判準——技術債。

ai deep-dive

X 演算法開源:權重公開之後,反而更清楚黑箱在哪

2026-08-13 的發布新增 363,246 行,首次公開 For You 的排序權重:favorite 0.5、reply 5.0、report −234.0。但權重是常數,真正決定順序的 P(action) 來自一個 2560 維、8 層的 transformer。

ai deep-dive Agent 生產線

context 與記憶:agent 失敗的真正位置

Chroma 測了 18 個前沿模型,全部隨輸入變長而跳崖式退化。記憶失效多半是檢索失效偽裝的。而 KV cache 的真正成本是頻寬不是儲存——decoding 每產生一個 token 都要讀過整個 cache。

ai deep-dive Agent 生產線

安全:prompt injection 只能在 harness 層做損害控制

2025-11 三大實驗室聯手把先前提出的 12 種 prompt injection 防禦全部攻破。EchoLeak 的 payload 通過了微軟自己的專用分類器。所以目標不是擋住每次攻擊,是攻擊成功時活下來——而這只能在 harness 做。

ai deep-dive Agent 生產線

概念界線:agent、workflow、RAG、MCP 到底差在哪

workflow 與 agent 的分界是「步數由誰決定」——開發者在設計時決定是 workflow,模型在執行時決定是 agent。依這個定義,今天大多數上線的 LLM 系統其實是 workflow。附 agent / RAG / MCP 的可操作判準。

ai deep-dive Agent 生產線

上線才是工作的開始:企業 agent 案例橫向讀

Salesforce 從兩萬個部署得到的數字:agent 有 90% 的工作發生在上線之後,跟傳統軟體剛好相反。Stripe 每週合併 1,300 個零人類手寫的 PR,靠的是環境而不是模型。附六家公司的橫向比對。

ai deep-dive Agent 生產線

協定層:MCP、A2A、ACP、Skills 各解什麼問題

MCP 管 agent ↔ 工具,A2A 管 agent ↔ agent,Skills 管可重複使用的知識。判準是資料會不會變:呼叫之間會變就要 MCP,穩定到可以寫下來就用 skill 檔案——後者不需要一個會獨立失敗的 runtime。

ai deep-dive Agent 生產線

模型只是元件,harness 才是系統

Microsoft、OpenAI、Salesforce、Stripe 等七個獨立案例講出同一句話:可靠性來自模型周圍的工程。而「把確定性的部分還給程式碼」已經被四家公司各自做成產品——Agent Script、Procedures、runtime、blueprints。

ai deep-dive Agent 生產線

RAG 的三種形態與 evaluator paradox

Standard RAG 取錯 chunk 就答錯,而且沒有任何機制會發現。Agentic RAG 補上自我檢查,但代價是 evaluator paradox——自我修正能力的上限,就是那個做評估的 LLM 判斷相關性的能力。

台灣機場被無人機關場 23 次:而機場拿到的授權只有「取締」

立法院三份預算評估報告的一手清單:108 年度到 112 年 8 月底,台灣機場因無人機關場 23 次,而每一列的處理方式欄都是同一句「會同航警局查處」。民航法第 99 條之 13 第 6 項給機場的動詞是「取締」,不是「制止或排除」,但 113 年度報告已寫各機場均購置手持式干擾器。

電廠、水廠、晶圓廠:關鍵基礎設施在民航法的授權表上,連一格都沒有

民航法第 99 條之 13 第 3、4 項寫的是「政府機關(構)、學校或法人」,但唯一讓場地方「制止或排除」的第 7 項但書只寫「政府機關(構)」——台電、中油、晶圓廠都是法人。它們剩下的路徑是請縣市政府公告禁限區再「取締」,罰則從最低 30 萬掉成最高 30 萬;而輸入干擾器要的「關鍵基礎設施提供者」身分,是靠收到一封信知道的。

警察飛無人機的法源是完整的——但那是「飛」的法源,不是「拍」的法源

八個警察局成立無人機隊,飛的法源很清楚——民航法第 99 條之 16 第 2 項給政府機關執行法定職務的操作豁免。但那是飛安豁免:台北市法規會的法律鑑定意見寫明它「恐無法作為以無人機空拍方式實施行政調查時之法律基礎」,而 2024 年三讀的刑訴特殊強制處分專章授權了 GPS、M 化車與隱私空間攝錄,空中調查一條都沒有。

誰有權把無人機打下來:台灣的法律授權了「排除」,卻沒授權任何一種手段

中央法規裡「無人機」出現在 19 部,「反制無人機」只出現在 1 部,而那一部是採購特別條例。六個場域被授權「制止或排除」侵入的無人機,但沒有一條說可以用什麼手段——民航法第 99 條之 13 只寫「採取適當措施」,而警械公告的 31 項裡有迫擊砲、沒有干擾槍,電信管理法第 67 條第 1 項也沒有任何公務除外規定。

飛控的「自主」共 56 項,只有一項是為了把握機會

ArduPilot 的 ModeReason 列舉就是「機上自主決策」的完整清單:56 個值裡 43 個是飛機自己決定的,其中 21 個是偵測到危險,而只有 SOARING_THERMAL_DETECTED 一項是因為發現機會。至於 end-to-end,PX4 主線那個 mc_nn_control 的 tensor arena 只有 10 KB、Kconfig 預設 n,ArduPilot 主線一個都沒有。

無人機熱像儀的價格為什麼跳著漲:出口管制畫出的成本階梯

熱像儀的價格跳著漲,是因為美國 CCL 6A003.b.4.b 把管制切在焦平面 111,000 個元素上:384×288 差 408 個像素過關,640×512 超過三倍,中間沒有常見規格,而 Boson 640 的定價是 320 版的 2.04–2.31 倍。至於 Note 3.b 那條豁免,限制的不是解析度是焦距——你可以有熱像儀,但不能有望遠的熱像儀。

量產爬升的證據不在工廠,在「無法決標公告」裡

量產爬坡的公開證據不在工廠,在政府電子採購網:消防署 88 組熱顯像無人機的案子中央統一定價,六個消防局第一次招標無人投標,我拉到的七件決標金額全部等於預算、一毛沒殺,投標池大約六家公司。但補做的雲梯車對照組(流標/決標 0.54,高於無人機的 0.33)推翻了本文原本的第一條結論——流標是台灣消防裝備採購的常態。

燈光秀的「群飛」裡沒有群:兩百架只同步一個整數

把 Skybrush 那套開源燈光秀韌體 9,199 行搜遍 neighbour、collision、swarm,沒有任何一架飛機知道別架的存在——兩百架之間同步的全部內容,是一個 GPS 週內秒加一個毫秒偏移,防撞是在地面的編排軟體裡算完的。而資安檢測規範第 7 章那個群飛專章,十二個項目的「遙控無人機」欄從頭到尾都是「-」,測的是交換器與路由器。

無人機資安檢測規範拆解:真正在測「打不打得倒」的那五項,全部是選測

讀完整份規範有三件事跟直覺不一樣:必測的七項裡無人機本體只佔三項,其餘全落在地面控制站;通訊安全那一關「不加密」也可以通過,只要在使用手冊或包裝外盒說明原因或風險,規範要的是揭露不是加密;而真正在測韌性的五項——定位欺騙、定位干擾、通訊失效、韌體已知漏洞、APP 標章——全部在選測的第 8 章。

續航從 40 分鐘到 6 小時,換的不是電池是機體形態

同一台 5 公斤機、同一顆 2 公斤電池,多旋翼懸停要 512 W 飛 41 分鐘,定翼機巡航只要 128 W 飛 164 分鐘、航程 197 公里,而且那個航程跟巡航速度無關。VTOL 的代價不是轉換時燒掉的能量(只佔 2.4%),是它必須同時揹旋翼和機翼,吃掉約四分之一航程;台灣這條階梯從 40 分鐘的電動多旋翼一路到 6 小時的內燃機直升機。

無人機為什麼只能飛 30 到 45 分鐘:一條式子就算得出來

懸停功率跟起飛重量的 1.5 次方成正比,電池能量只跟重量的一次方成正比——這一個指數差讓加電池的報酬遞減得非常快,而最佳電池比例解出來是起飛重量的三分之二,跟槳徑、旋翼數、效率、能量密度全部無關。真正壓住續航的不是法規重量門檻是酬載:要飛 60 分鐘需要 314 Wh/kg 的電芯,今天最好的高倍率芯是 242 Wh/kg。

跳頻不是加密:ExpressLRS 原始碼與台灣的頻道數功率上限

ExpressLRS 的跳頻順序由一句綁定口令經 MD5 推出 UID、再餵給一個線性同餘產生器算出來,完全可複現(我移植成 Python 跟原始 C 碼逐位元對過),而鏈路本身沒有任何加密,只有 14 bit CRC。台灣 LP0002 又讓頻道數變成功率上限:2.4 GHz 跳頻用滿 75 個頻道可以發 1 W,不足只能發 0.125 W。

類比 FPV 圖傳在台灣找不到條文可走

類比 FPV 圖傳在台灣有兩個獨立的問題:LP0002 給 5.8 GHz 的窗口只有 125 MHz,而市售頻道表橫跨 300 MHz,四十個經典頻道把發射寬度算進去只剩十八個落在窗口內。更硬的是 §4.10.1.1 對 5.8 GHz 只寫「採用跳頻之發射器材」,而類比圖傳固定頻率不跳頻——它不是違反哪一條,是這份規範裡沒有一條長成它的樣子。

GPS 被干擾的那七秒:飛控怎麼發現、又為什麼預設不偵測

在 SITL 裡把無人機飛到 28 公尺,再打開模擬器內建的 GPS 干擾,約 7 秒後飛控自己宣告 EKF 失效、切成 LAND、降落上鎖——它沒有飛走,也沒有墜毀。而讀 PX4 原始碼會發現 EKF2_GPS_CHECK 的 12 道閘門裡,第 11 位的「干擾」偵測預設是關的:估計器自己就抓得到干擾,詐騙卻只能靠接收機告訴它。

PX4 還是 ArduPilot:真正的分岔在授權條款

把兩套都 clone 下來各 build 一次之後,有三件事跟原本的認知不一樣:ArduPilot 的 EKF3 檔頭直接寫著推導來自 PX4/ecl,兩套在最難的那一層是同源的;PX4 近一年的提交來自公司網域(Auterion 一家 380 筆),ArduPilot 來自個人信箱且一個人佔 37%;而真正決定選哪個的不是效能,是 BSD-3 vs GPLv3 與你要改的是哪一層。

「標案毛利到底多少」:財報回答了我以為要訪談才知道的事

我原本把「軍用商規標案毛利多少、現金週期多長」列成非訪談不可的問題。翻開公開財報才發現答案在那裡,而且更精確:毛利率 35–39%,落在硬體業的正常區間;但營業費用吃光了它,最近三季的營業利益連續為負,帳面獲利來自業外。真正的關鍵在存貨——約 385 天的存貨天數,撐出接近 377 天的現金轉換循環。這門生意的錢不是卡在毛利,是卡在存貨。

民航局把題庫全公開了:從四個科目看主管機關在意什麼

2022 年交通部發了一篇標題叫「刪除艱澀考題,題庫全數公開」的新聞稿,把 1,420 題全部放上網——普通 388 題、專業 588 題、屆期換證 324 題、簡易換證 120 題。理由寫得很坦白:考生反映太難。而公開後的題庫本身變成了一份政策文本:四個科目裡,氣象整套搬了有人機的航空氣象學,飛行原理大量是定翼機空氣動力學,但大多數人飛的是多旋翼。

無人機專章沒有隱私條款:被飛過的人只能回頭找刑法

民航法的無人機專章管的是飛行安全,不是被飛的人——這不是我的評論,是立法院法制局 2020 年研析報告自己寫的:專章「對於與民眾關係最重要的隱私權管理並未具體規範」。所以隱私只能回頭靠刑法第 315 條之 1 與個資法,而實際判決顯示那套接得上一部分:對著湯屋拍會被起訴、舉手機窺視窗內判四個月。接不上的是取證——法制局的原話是「當受害者發現它時,它可能已經無影無蹤」。

「飛手年收 200 萬」之後:農噴走完了一輪循環

農噴是無人機所有應用裡唯一單位經濟完全透明的一塊:計價單位是分地、費率 150–300 元、噴一分地約兩分鐘、設備 30–50 萬,連替代方案(人工每分地約 200 元)的價格都是公開的。而正因為人人算得出來,人人都進來了——2018 年進場的飛手一年噴上千公頃、收入破百萬;後來進場的有人兩三年只能打平然後轉行。合法飛手一分地 300 元,黑飛壓到 150 元。這是產業週期史的微型版本,只花了六年。

巡檢是台灣跑得最遠的無人機應用——因為它繞開了 BVLOS

我原本以為巡檢跟物流一樣被視距外法規卡住。查完發現不是:橋檢、電塔、高鐵橋全都在跑,而且數字很硬——公路局一座橋從 8 人 4 車 2 天變成 5 人 1 車半天且免交通管制、成本降到六成;高鐵人力一天最多巡 700 公尺,換無人機省 3 到 5 倍;嘉惠電力降 3/4 人力、5 成成本且無須斷電。原因是這些巡檢都是分段、定點的,視距內就能做完。真正卡在 BVLOS 的是長距離連續航線,不是「所有巡檢」。

台灣的無人機物流已經有 24 條廊道——它走的不是等法規那條路

我以為台灣沒有真正的無人機物流商業案例,因為沒有 BVLOS 框架。錯了:民航局核准過 10 案、累計 24 條飛行廊道,運研所從 2020 年起走完 PoC → PoS → PoB 三階段,2025 年進入商業營運驗證。它繞開的方式跟巡檢正好相反——巡檢是把作業切小到視距內,物流是一條一條廊道逐案核准。而它的價值也不是比船便宜:小琉球颱風停航那幾天,無人機十幾分鐘飛到,那是船不開時唯一還能動的東西。

救災無人機:唯一一個 ROI 不是錢的應用,也是最容易被砍的預算

農噴每分地 150–300 元,算得清清楚楚;救災沒有這個數字,因為救回一條命沒有標價。這個差別決定了兩件事:一、規格由地形定義而非性能定義——消防署那批機的關鍵特徵是「不依賴 GPS」,因為山區會斷訊、樹林要穿梭;二、當立法院提案減列預算時,內政部只能拿今年六月馬太鞍溪救回一個人當論據。用個案辯護預算是脆弱的,但這個應用沒有更好的武器。

反制無人機為什麼難:干擾正在失效,而台灣的難題不只是技術

電戰反制有一個根本限制:它需要有訊號才能攻擊。光纖導引不發射無線電、衛星通訊繞過地面干擾器、AI 終端導引在最後一段完全不需要鏈路——三種手段正在系統性地讓干擾失效,所以重心從軟殺移向攔截。而台灣的難題還多一層:監察院的調查報告記錄了國防部在兩個月內把無人機應處 SOP 改了三次,從「可擊落」改成「只能射信號彈、第一擊須經部長授權」,再改回「7.62mm 以下輕兵器擊落」。那不是技術問題。

拆兩份運安會炸機報告:兩次都不是操作人的錯

台灣進入運安會統計的無人機重大事故只有 4 件,但那是因為門檻是「逾 25 公斤遭受實質損害」——一般玩家炸機根本不進統計。公開的兩份調查報告是同一款機、同一家製造商、同一個機關,而且兩次的可能原因都是硬體失效:一次是主旋翼伺服器電系,一次是尾旋翼變距連桿斷裂。兩次都與飛控電腦和操作人無關。

怎麼讀無人機規格表:法規把哪幾行變成了分界線

規格表上最重要的三行,正好是規格表最不會寫的三行。數發部會銜交通部的《遙控無人機資安檢測規範》定義「系列產品」時寫得很白:飛控、通訊及衛星定位晶片之模組均為相同者——法規認定兩台無人機是不是同一台,看的是這三個模組,不是外觀或續航。而重量欄位也不是行銷數字,250 公克、1 公斤、2 公斤、15 公斤、25 公斤各是一道不同的法律門檻。

ai deep-dive

2026 年工程師 AI 證照有哪些

2026 年工程師能報名的 AI 證照逐張列出:AWS 三張(AIP-C01 / MLA-C01 / AIF-C01)、Google PMLE、微軟 AI-103 與 AI-500、NVIDIA 目錄十二張、Databricks、Snowflake、Oracle Agentic AI、IBM watsonx、Salesforce Agentforce、GitHub GH-300、Anthropic Claude 四張、iPAS AI 應用規劃師初中級,另有 IAPP AIGP 與 ISACA AAISM / AAIA 這條治理稽核線,價格、效期、報考門檻全部對照官方頁面。兩個會影響荷包的重點:Google PMLE 的考試大綱已把 Vertex AI 全面改名為 Gemini Enterprise Agent Platform,2026 年年中以前的教材等同作廢;iPAS 中級證書效期是 5 年而非永久。

ai deep-dive 文件解析實戰

anydoc:14 種辦公格式轉 Markdown,Firecrawl 用 Rust 給的另一個答案

Firecrawl 開源的 Rust 轉檔函式庫,14 種辦公格式(含 .doc / .ppt / .xls 老格式)統一轉 GFM,中位耗時 4.7ms,同樣計時條件下比 Docling 快 109 倍。代價是完全不碰 OCR。

ai deep-dive 文件解析實戰

解析層:當結構要用模型推斷——而授權才是真正的選型軸

掃描件與複雜版面只能靠模型推斷結構。但 MinerU、Marker、Docling 的技術差距遠小於授權差距——MinerU 過 $20M 月營收要另談授權、Marker 的模型權重過門檻要付費、只有 Docling 是乾淨的 MIT。選型先看 LICENSE,再看 benchmark。

ai deep-dive 文件解析實戰

文件解析的三層階梯:轉換、抽取、解析,先選對層再選工具

把文件餵給 LLM 之前,最常見的錯誤不是選錯工具,是選錯層。結構已經在檔案裡的用轉換層(毫秒級),有文字沒結構的用抽取層,連文字都要推斷的才用解析層——anydoc 的 4.7ms 到 Docling 的 513.6ms 差 109 倍,多數人卻直接跳最貴的那層。

ai deep-dive 文件解析實戰

確定性抽取層:不用任何模型,先解決八成的 PDF

數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。

無人機產業的職業地圖:十一種角色,以及軟體人能切進哪幾格

把無人機的職缺放回產業鏈五層來看:第 2 層是機械電機的地盤,第 3 層(飛控韌體、感測融合、射頻、邊緣 AI)才是軟體人真正的入口,也正好是台灣最缺的一層。但先看規模——全台 267 家業者、2025 年產值 129 億元,職缺總量比新聞熱度小得多。

進入台灣無人機產業的四道門:公開資料能告訴你的入場機制

TEDIBOA 會員從創始 50 家長到逾 260 家,但自 2025 年 7 月 1 日起,加入前必須先是「國防產業發展協會」正式會員——這是第一道實際門檻。產創平台補助上限為全案 50%、同一企業同期最多 3 案、最長 3 年,且明訂禁用紅色供應鏈零組件並須通過資安聯合驗測。這篇只寫公開文件寫得出來的機制。

從軟體業轉進無人機:用 PX4 的架構圖當求職地圖

PX4 官方架構文件自己寫著:機載電腦跑 Linux,因為「Linux 是比 NuttX 好得多的一般軟體開發平台,Linux 開發者多得多」。那句話就是軟體人的入口。三條遷移路徑的摩擦力差很多——機載電腦上的 CV 與 MAVLink 應用幾乎直接遷移,飛控韌體要補 RTOS 與 work queue 限制,估測與控制要補四元數與卡爾曼濾波。

台灣無人機的四條學習路徑:科大、證照、競賽、在職訓練

台灣沒有「無人機系」。體系核心是虎尾科技大學飛機工程系——教育部補助 9,000 萬元在嘉義亞創中心設培育基地,是全台 18 座區域型基地中唯一設在產業園區的,另斥資 5,000 萬元建含大型低速風洞的實驗室。而 2026 總統盃競賽的三個題目(邊緣運算 AI 辨識、高精度定位、GNSS 拒止自主導航)幾乎就是產業缺口的鏡子。

追無人機的國防預算:三筆錢、一條卡了兩個月的立法程序

台灣無人機的公部門錢分三筆:442 億元統籌型計畫(研發補助,已核定)、2,100 億元國防自主無人載具採購特別條例(採購,卡在黨團協商),以及各部會年度公務預算(2026 年度逾 72 億元)。最大那筆的期程原訂 2026 年 8 月 1 日起算,但 7 月 27 日逐條審查後全數條文保留——原訂起算日過了,錢還沒開始撥。而政院版只買三個品項。

用四條件框架看無人機供應鏈:四條裡目前只成立一條

把「供應鏈關鍵節點/結構性需求/高替換成本/法人長期持有」這把尺拿來量無人機板塊:台灣目前站在可替代性最高的第 2 層、八成需求來自公部門預算而非終端行為、只有「認證造成的替換成本」這一條真正成立。陸軍 9.8 億元反制系統標案三度驗收不合格、全額解約、沒收約 9,878 萬元保證金,是「得標不等於營收」最貴的一堂課。

learning deep-dive

數位學習之外,紙筆還剩下什麼:三個實體仍然有效的地方,與一個沒有

學習全面數位化之後,實體仍有明確效果的地方有三個:閱讀(紙勝螢幕 g ≈ −0.21,17 萬人樣本,需要捲動時擴大到 0.35–0.48)、作答時動筆(螢幕上題目越難反而越少用草稿紙)、畫圖(回憶率 45% 對比抄寫 20%)。反倒是最多人相信的「手寫筆記比較好記」,四份統合分析從 −0.008 到 +0.248 沒有共識。

台灣無人機操作證怎麼考:分級、逐級制度、規費與時程

普通操作證只考學科,總規費 450 元(學科 200 + 證照 250);專業基本級要加術科與體檢,總規費 1,900 元。專業證採逐級報考,不能跳級,拿到最高級距要一年半到兩年。高級 G1/G2/G3 每組術科各收 1,200 元。規費數字以《管理規則》附件十七為準——網路上流傳的「術科 500 元」是錯的。

台灣無人機法規白話版:什麼要註冊、什麼要考照、什麼會被罰

250 公克以上要註冊、註冊號碼效期 2 年;自然人 2 公斤以上未達 15 公斤且有導航設備才需要普通操作證;操作證效期已經是 3 年不是 2 年,學習操作證年齡已下修到 14 歲不是 16 歲。這篇只寫全國法規資料庫的現行條文,並標出網路懶人包最常見的三個過時說法。

無人機的四種商業模式:為什麼賣機體是最差的一種

硬體毛利 35–55% 且長期被 DJI 壓價,自主軟體與 DaaS 訂閱毛利 60–80% 且會重複發生。Skydio 2023 年軟體訂閱已占營收約 30%、整體毛利率 38%;印度 Garuda 的 DaaS 在 FY24 占營收 62%,現金循環天數 351 天,遠優於國防為主的同業 597 天。台灣目前幾乎全押在毛利最低、可替代性最高的那一格。

BVLOS 三地對照:美國還沒發布、歐盟已經能飛、台灣根本沒有這個框架

歐盟自 2020 年底起就有可行路徑——Specific 類別憑風險評估取得營運授權,加上 U-space 法規 (EU) 2021/664 逐步部署。美國的 Part 108 到 2026 年 7 月仍在 OIRA 審查、尚未發布。台灣則連框架都還沒有:《管理規則》給的是「延伸視距飛航」(900 公尺、400 呎、要目視觀察員),真正的視距外只能靠法人逐案申請、許可效期 3 個月。

無人機產業週期史:2016 年那次泡沫是怎麼破的,這次哪裡不一樣

2016 年那波消費級無人機泡沫留下明確殘骸:3D Robotics 停產硬體、GoPro Karma 上市六週召回全部 2,500 台並裁員 15%、Parrot 砍掉 35% 無人機人力、Lily Robotics 收了 3,400 萬美元預購後倒閉。2023 年連募了 5.7 億美元的 Skydio 都退出消費市場——而三年後它的估值來到 44 億美元。這次的引擎完全換了人——但有三件事跟上次一模一樣。

無人機產業地圖:從零組件、法規天花板到非紅供應鏈重組

全球無人機市場 2026 年約 690 億美元(IDTechEx),中國掌握約 80% 市場(CSIS)、DJI 占多旋翼七成以上。美國 FCC 在 2025 年 12 月把所有外國製無人機列入 Covered List;台灣產值一年從 50 億元跳到 129 億元,2026 Q1 出口就超過 2025 全年。這篇拆解產業鏈五層、四大需求板塊,以及卡住規模化的兩個天花板。

tech deep-dive

手機沒偷聽你講話:從 FTC 罰單到 Meta 官方文件,拆解廣告為什麼這麼準

Northeastern 實測 17,260 個 Android app,零個啟動麥克風。2026-05 FTC 更認定號稱在「偷聽」的 Cox Media Group 根本沒蒐集語音,賣的是資料掮客的二手 email 名單,三家合計罰 93 萬美元。真正的管線是站外事件回流、相似受眾外溢、通訊錄社交圖與位置掮客。

台灣無人機供應鏈:267 家在哪裡、卡在哪一層

經濟部盤點的 267 家業者,北部就占 164 家。但地理分布不等於產業分工——雷虎公開的自製清單顯示,馬達、電池、機架、螺旋槳留在台灣,飛控、通訊與 GPS、鏡頭三個模組選擇跟歐美日大廠合作。2025 年 129 億產值裡外銷只占 23%,財政部統計顯示出口值有 88.1% 集中在 2–7 公斤級距。這篇拆解層級、缺口與國際比例尺。

tech deep-dive

手繪風 SVG 圖示的三條路:近 9 萬個免費圖庫、把 Lucide 弄歪的生成器,還有那張沒人看的授權頁

Koboyo 宣稱有近 9 萬個免費手繪 SVG(數字上下跳動:92,967 → 87,954 → 90,150),但 sitemap 只列得出約 17,930 個圖示頁,而且授權頁明文禁止拿去做圖示庫或畫布 app。想要手繪感其實有三條路:收圖庫、用程式把既有幾何弄歪(sketchyicons 把 Lucide 的每條直線轉成二次貝茲,用 icon 名稱當亂數種子確保 byte-for-byte 一致)、或 AI 生成。這篇比較七家圖庫的規模與授權、拆解 sketchyicons 與 tldraw 的生成演算法,並整理正在往 MCP 靠的圖示搜尋工具。

AI 讓你在該困難的地方變順:生成式 AI 對學習做了什麼

AI 教育界被引用最多的那篇 meta-analysis(g = 0.867、瀏覽近 50 萬次)已於 2026 年 4 月被 Nature 撤稿。但正向結論沒被推翻——問題是它測的是「AI 在手時的表現」。Bastani 的 PNAS RCT 測了另一件事:練習時用 GPT-4 正確率 +48%,收走後考試比從沒用過的低 17%。

Learning How to Learn:拆解 417 萬人修過的學習課,哪些站得住、哪些是比喻

Dunlosky 2013 評比 10 種學習技術,判定為高效用的只有自我測驗與分散練習;學生最愛的重讀落在低效用層。但 2026 年的系統性回顧把效果量壓到 0.22–0.46,而 Pan & Rickard 的遷移 meta 校正發表偏誤後「往往顯示零遷移」——整套框架的名字本身,是被測得最不好看的一塊。

ai deep-dive

數位員工:可靠度來自 harness,不來自模型

「數位員工」不是技術,是計價與課責單位。Anthropic Project Vend 讓 Claude 真的開了三家店,發現最有效的介入不是換更強的模型,而是強迫走流程——官方原話是「我們重新發現了 bureaucracy matters」。Gartner 估計數千家自稱 agentic 的廠商中只約 130 家是真的。

ai deep-dive

圖生影片技術地圖:2026 年 I2V 的架構、模型與真實價格

圖生影片(I2V)在 2026 年的骨幹清一色是 latent diffusion + DiT,畫質已經不是選型軸;真正的軸是原生音訊、能不能自架、每秒多少錢。三個容易踩的坑:Sora 的 app 已在 4/26 關閉、API 9/24 關;Wan 2.7 被大量文章稱為 Apache 2.0 開源但一手來源查無權重;Veo 3.1 官方價是 $0.40/s 而非二手網站流傳的 $0.75/s。

ai deep-dive

2026 做 3D 模型的工具地圖:AI 生成、掃描、CAD、手工建模怎麼選

做 3D 模型在 2026 年有四條路:AI 生成(Meshy-6 / Tripo / Rodin Gen-2.5 / 混元 3D)、手機掃描、Text-to-CAD、手工建模。選錯的代價很具體——AI 生成的 mesh 改不動尺寸、Rodin 的 STL 常需修補、Meshy 免費版的資產是公開的。這篇按「模型最後要拿去幹嘛」給選型建議,並附各家官網當前價格。

AI 爬蟲工具全景圖:34 個開源專案的五大分類與選型指南

從 MarkItDown (175k stars, MIT) 到 curl_cffi (6k stars),整理 34 個「爬資料餵 AI」的開源工具。沿五條軸線分類:整站爬取、AI 瀏覽器代理、文件轉檔、智慧擷取、反偵測基建。選型關鍵不是哪個最好,是場景匹配。

ai deep-dive

Uncle Bob 不讀 agent 寫的程式碼:他用什麼關卡取代 code review

2026/7/23 Uncle Bob 那則 418 萬瀏覽的貼文不是宣言,是回覆——回一位 1983 年入行的工程師問「我心理上就是需要看懂程式碼,是不是太老派」。而且他沒有完全不讀:6/1 那則四階段 pipeline 的原文寫著 I spot check the code,門檻是 crap ≤ 6(業界慣例 30)、mutation 要 kill all survivors。附開源的 Acceptance-Pipeline-Specification 拆解與 Grady Booch 點名的三個指標盲區。

coffee deep-dive

梯形 vs 錐形濾杯:SCA 研究告訴你的事,跟咖啡師沒說的事

濾杯形狀對風味的影響比研磨度更可被感知(SCA 研究 p=0.004)。錐形放大你的技巧(好壞都放大),平底/梯形壓縮波動。磨豆機 > 濾杯 > 注水技巧。兩個都買不衝突。

product deep-dive

數位產品的價值驗證:從假設地圖到 AI 產品的 M3 留存基準

價值驗證的單位是假設不是點子。Kohavi 的資料顯示產業中位數只有 10% 的實驗會成功,這代表在 p<0.05 下約 22% 的「獲勝實驗」其實是假陽性;Sean Ellis 的 40% 門檻查不到任何公開資料集;AI 產品的留存要從 M3 而非 M0 起算,且 <$50/mo 的 GRR 只有 23%、>$250/mo 有 70%。

product deep-dive

Product Builder 是什麼?跟 PM 的差別與轉型路徑

Product Builder 是能獨立跑完「發現問題→設計→建造」完整循環的人。跟 PM 最大的差別是:PM 靠權威影響團隊執行,Product Builder 靠能力直接產出可用產品。LinkedIn 已用 Associate Product Builder track 取代原本的 APM 計畫,PayFit 早在 2019 年就定義了這個角色。

ai deep-dive

3D 生成式模型走到哪了:從 Lyra 2.0 拆解 2026 年的技術地圖

2026 年 3D 生成的核心範式是「video diffusion → feed-forward 3D 重建」,Lyra 2.0 是這條線的代表作。但 CVPR 2026 的三篇 Best Paper 暗示下一波轉向:SAM 3D 帶來 foundation model 級別的物件重建、D4RT 用統一 transformer 數秒重建動態 4D、O-Voxel 用結構化 latent 取代 Gaussian。3DGS 仍是主流但正在被表面原語挑戰,pixel-space diffusion 正在反攻 latent-space。

tech deep-dive

各家內容平台的 Feed 怎麼排?從 Reddit 公式到 TikTok 興趣圖

十家平台的 feed 排序拆開來看,大家其實都在解同一道題:怎麼在「最新」「最好」「讓新內容被看見」之間取捨。而真正決定你該怎麼選的,不是演算法多聰明,而是你的內容是過剩還是稀缺——大平台的排序是為了濾掉內容,小社群卻是希望每一則都被看到。

ai guide

2026 年該上哪些 AI 課程:從不懂 AI、vibe coding,到能上 production

把 OpenAI、Anthropic、Google 三家官方課程平台,加上 Stanford CS146S/CS336、Elements of AI、Hugging Face、MIT 6.S191、李宏毅等資源實際逐頁抓過一遍,按「不懂 AI / vibe coding / 讓它能上 production / 底層 AI」四層重排。另收 2026 年仍在更新的自學倉庫與免裝環境的互動式平台,並用「最後更新日期」篩掉星數很高但停在 2024 的名教材。結論:課幾乎全部免費,稀缺的不是課,是選課的判斷力;而第四層不會解決第三層的問題。

learning deep-dive

2026 還在被討論的長青書單:用 Threads、Dcard、方格子的社群訊號選書

用 Threads、Dcard、PTT、方格子 2025 下半年到 2026 的討論證據,從生產力、人生設計、腦科學、心理、理財五個分類篩出 24 本還在被熱議的長青書。最強訊號:《Rewire—神經可塑性》擠進 2026 誠品、博客來上半年雙榜前三。

tech deep-dive

PostgreSQL 就夠了?別急著上專用資料庫

大部分團隊不需要五種資料庫。PostgreSQL 的擴充生態已經能覆蓋快取、佇列、全文搜尋、向量搜尋,但真正的判斷標準不是「能不能做」,而是「維運成本 vs 效能需求」的交叉點在哪裡。

ai deep-dive

HyperFrames 深度解析:HTML 即影片,Agent 時代的影片製作範式轉移

HeyGen 開源的 HyperFrames 用 HTML data 屬性定義影片時間軸,headless Chrome 逐幀 seek 截圖再由 FFmpeg 編碼成 MP4。3 個月 33k stars,Apache 2.0,21 個 agent skills——AI agent 寫 HTML 就能產影片,不需要 React。

investing deep-dive

小型元大台灣50ETF期貨(SRF)是什麼:一張截圖看懂 0050 的期貨版本與槓桿設計

SRF 是小型元大台灣50ETF期貨,標的直接是 0050 這檔 ETF 本身,原始保證金 7,900 元就能持有約 11 萬元的合約,槓桿近 14 倍;除息靠「權益數調整」,跟一般指數期貨的逆價差機制完全不同。

investing deep-dive

從零看懂這篇交易貼文:權證、股期、維持率一次解釋清楚

看到一篇交易紀錄貼文,裡面全是我不懂的詞:權證、股期、維持率。查了一圈,整理給同樣看不懂的人。

ai deep-dive

Loop Engineering:當 AI 不再需要你打 Prompt

Loop Engineering 是設計「自動 prompt agent 的系統」而非手動 prompt 的工程實踐。Boris Cherny 跑數百個 agent、Addy Osmani 正式命名、Blake Crosley 指出驗證成本才是真正瓶頸——這篇整理一手來源、五大構建塊、適用邊界與批評觀點。

climbing deep-dive

攀岩書籍知識版圖:從訓練科學到心理哲學,60+ 本書的完整導覽

攀岩書不是一本本獨立存在的——它們背後有學派之爭、有哲學差異、有知識斷層。這篇整理了 60+ 本書之間的關係,幫你選對下一本該讀的書。

Browser MCP 三選一:CDP、Playwright MCP、Puppeteer MCP 比較

這題現在其實是二選一:@playwright/mcp(跨瀏覽器、accessibility tree 省 token)對上 chrome-devtools-mcp(Chrome 官方、效能與記憶體診斷);@modelcontextprotocol/server-puppeteer 已被封存,不再是選項。分野也不再是抽象層級高低,而是「操作網頁」還是「診斷 Chrome」。

Chrome DevTools MCP:直連 CDP 的 MCP Server

Chrome 團隊官方維護的 chrome-devtools-mcp,把 DevTools 的能力包成 MCP server:效能 trace 與洞察、Lighthouse 稽核、heap snapshot、擴充功能管理,都是 Playwright MCP 拿不到的。底層是 Puppeteer,所以互動有 auto-wait;代價是只支援 Chrome,而且預設會回傳使用統計給 Google。

@playwright/mcp:微軟官方的瀏覽器自動化 MCP Server

@playwright/mcp 預設用 accessibility tree(browser_snapshot)取代截圖,大幅省下 token,加上 Playwright 原生 auto-wait,是 AI agent 做網頁自動化的合理起點。要注意它預設是 headed、預設帶持久 profile,而且進階工具群組要用 --caps 開。

@modelcontextprotocol/server-puppeteer:官方 Puppeteer MCP Server

server-puppeteer 是 MCP 官方 monorepo 裡的 Puppeteer 封裝,工具集精簡、以截圖 + evaluate 為核心。但它已被官方封存(移到 servers-archived、不再更新),新專案不該再選它——想要 Puppeteer 血統的 MCP,現在該看 Chrome 團隊的 chrome-devtools-mcp。

investing deep-dive

在 Threads 看到這套正2系統,背後是這三本書

一套正2投資系統的哲學根源來自三本書:《漫步華爾街》回答「持什麼」(大盤指數)、《生命週期投資法》回答「怎麼加速」(槓桿分散時間風險)、《投資金律》回答「如何不被淘汰」(再平衡紀律)。組合起來就是 60% 正2 + 40% 現金、Beta=1.2、±10% 觸發再平衡。

ai deep-dive

Text / Image to Lottie:AI 動畫生成工具全景導讀

從 CLI 工具 kin3o 到 CVPR 2026 論文 OmniLottie,盤點把文字和圖片轉成 Lottie 動畫的開源路徑,附效能基準與選型建議。

tech deep-dive

AI 驅動的 E2E 測試:canary、Stagehand、Magnitude、Shortest 的不同解法

AI agent 跑測試不可重現、手寫 Playwright 難維護——2024-2025 年出現四套工具各自解決這個兩難,設計哲學差異很大。

ai deep-dive

LLM Agent 的技能管理革命:從 Voyager 到 MUSE-Autoskill 的 Skill Lifecycle 全景

MUSE-Autoskill(2026)提出五階段 skill 生命週期框架,自創 skill 在 SkillsBench 達 60.35%(+7.16%),成功生成 skill 的任務上更達 87.94%,超越人工撰寫上限。本文整合六篇 arXiv 論文,梳理 skill evolution 研究全景。

design deep-dive

Design System 配色系統導讀:從 Tailwind 到 Material 3,網站配色不用自己發明

整理 7 個主流 design system(Tailwind、Radix、Material 3、Carbon、Ant Design、Primer、Apple HIG)的配色架構:色階怎麼切、neutral 怎麼選、dark mode 三種流派,以及為什麼新專案該用 OKLCH 而不是 HSL。

ai deep-dive

調整 agent 之後,怎麼嚴謹比較前後差異:從 golden set 到統計檢定

即使 temperature=0,LLM 輸出實測仍可能抖動 15%。要嚴謹比較 agent 調整前後,得靠凍結 golden set、每題跑 ≥3 次取平均、LLM-as-judge 盲評(pairwise 偏好翻轉率高達 35%)與配對統計檢定,而不是前後各問一遍看感覺。

ai deep-dive

Agent 可觀測性:從 OTel Trace 到抓出幻覺、工具誤用與無限迴圈

業界已收斂到用 OpenTelemetry GenAI 語義約定把每個 LLM call / tool call 變成 span;偵測三大故障再分三條線:faithfulness + semantic entropy 抓幻覺、framework 層 symbolic guardrail 擋 tool misuse、max steps + action hash 去重防無限迴圈,最後全部掛上 Final / Trajectory / Single-step 三層評估。

ai deep-dive

Agent 的資源理性:在 token、工具呼叫、延遲之間做最優決策

資源受限下的 agent 決策是 bounded rationality 的復活:Rational Metareasoning 用 VOC 獎勵省 20–37% token、BATS 證明沒有 budget awareness 加預算也沒用、FrugalGPT cascade 最高省 98% 成本、Speculative Actions 降 20% 延遲。三約束最後收斂成一條 Pareto 曲線,主線是「從人手調旋鈕走向模型自己做資源理性決策」。

ai deep-dive

Agent 安全的同一條裂縫:從 Prompt Injection、信任邊界到 Multi-Agent 蠕蟲

三個聽起來不同的 agent 安全問題——tool output 注入、信任邊界、惡意 agent——根是同一個:LLM 把指令與資料攤平成同一條 token 串流,架構上無法區分。理解這條主線,就能看懂從 EchoLeak(CVE-2025-32711,zero-click)到 Morris II AI 蠕蟲的所有攻擊,以及為什麼「把模型調乖」沒用、只有架構約束(六大設計模式、CaMeL)有用。

ai deep-dive

Agent 怎麼決定「要不要查、查什麼、怎麼合」:Agentic RAG 的三個決策層

傳統 RAG 是固定管線「先查再答」;Agentic RAG 把檢索拆成三層決策:何時檢索(FLARE 用 token 機率、Adaptive-RAG 用複雜度分類器)、檢索什麼(HyDE / RAG-Fusion / 分解 / Step-back)、如何整合(RRF k=60 → cross-encoder rerank → 壓縮,Anthropic 實測失敗率 −67%)。關鍵反直覺:不必要的檢索會傷品質,「決定不查」是一級能力。

ai deep-dive

別再手工調 prompt:從 GEPA 到 tool description,agent 行為的自動最佳化

自動 prompt 優化(APO)從 APE/OPRO 演進到 GEPA:用語言反思取代稀疏 reward,少 4–35 倍 rollouts 贏過 GRPO 約 6pp。另一邊,tool description 是被忽略的 prompt——小改措辭能讓工具選用率變 10 倍,Anthropic 實測讓 Claude 自我改寫 tool description 勝過人類專家手寫。兩條線正在合流:eval-driven 的自動優化吃掉手工調 prompt。

ai deep-dive

Deep Research Agent 怎麼蓋:多輪搜尋規劃、衝突調和、可驗證結論

自主研究 agent = 四個可控環節:規劃(拆子問題)、檢索迴圈(search→read→反思 gap→再 search)、證據仲裁(≥2 獨立來源、衝突分型處理)、可驗證輸出(句級引用 + 獨立查核 pass)。兩條路線:訓練派用 RL 端到端學會何時搜(Search-R1 +41%),編排派用 orchestrator-worker 分工(Anthropic 內部評測 +90.2%,代價 ~15× token)。

ai deep-dive

Machine Theory of Mind:Agent 如何推斷其他 agent 的意圖、知識與目標

從觀察行為反推他者的信念/目標/意圖,學界叫 Machine Theory of Mind。三條血脈:符號 BDI、貝氏逆向規劃、深度學習 ToMnet。LLM 時代最大爭議是 ToMBench 上 GPT-4 仍落後人類 >10 分——高分到底是真推理還是統計捷徑。

ai deep-dive

Multi-Agent 的錯誤傳播與恢復:向分散式系統借三十年的武器

每步 99% 準確率、跑 100 步,無錯完成率只剩 36%——錯誤複利是結構問題,不是 prompt 能調掉的。分散式系統的 supervisor tree、bulkhead、circuit breaker、saga、durable execution 幾乎可一對一搬進 agent 編排;但 LLM 多了一種傳統系統沒有的故障——不會 crash 的語意錯誤,得靠 Inspector agent(recover 96.4%)與冗餘投票(MAKER 百萬步零錯誤)補上。

ai deep-dive

語意相似 ≠ 檢索相關:embedding 檢索系統性失靈的情境、偵測與補救

Cosine similarity 和 relevance 在一整類情境系統性背離:否定詞(NevIR 上多數 IR 模型 ≤ 隨機)、精確識別碼、數值門檻、邏輯組合(SoTA 模型在 LIMIT 上 recall@100 < 20)——其中一部分是單向量範式的理論上限,換大模型無解。補救順序:hybrid BM25 → reranker(Anthropic 實測 −67%)→ 上游 metadata 路由 → 領域微調 / multi-vector。

ai deep-dive

幾百個工具怎麼選得準:tool selection 的崩塌曲線與工程解法

工具一多,選擇準確率不是緩降是崩塌:4→51 個工具從 43% 掉到 2%、10→100+ 個從 78% 掉到 13.62%。根治解法是別一次塞全部——Anthropic Tool Search Tool 用 defer loading + 檢索砍 85% token,Opus 4.5 準確率 79.5%→88.1%。description 品質的效益是條件式的:簡單場景沒差,多工具串接場景 correctness 44%→50%。

ai deep-dive

換更貴的 embedding 救不了繁中 RAG:三層失敗成因與補救順序

繁中 RAG 檢索失敗是三層疊加:embedding 的粒度缺陷(BGE/GTE 從 0.1B 到 7B 都在「炸鸡」這種簡單 query 上排錯)、簡中/英文語料主導造成的在地詞彙偏移(保費、不保事項對齊不可靠)、MTEB 中文榜是簡體導致選型訊號失真。修復是架構性的:OpenCC 正規化 → hybrid + jieba 斷詞 → reranker → 最後才是在地微調——而且一切前提是先建繁中專屬 eval set。

ai guide

arXiv 論文品質判讀指南:從 endorsement 機制到實戰 checklist

arXiv 不做 peer review,約 2% 投稿被拒。判斷品質靠外部訊號:頂會收錄 > 機構 + 開源復現 > 引用品質。附 20 項實戰 checklist 和 2026 年工具箱(PWC 已關閉)。

tech deep-dive

Bumblebee:Perplexity 唯讀供應鏈端點掃描器的設計拆解

Perplexity 2026-05 開源的 Go 唯讀掃描器(v0.1.1、零非 stdlib 依賴)。盤點 npm/PyPI/Go/RubyGems/Composer/MCP/編輯器與瀏覽器擴充等來源成 NDJSON,比對自訂 exposure catalog,回答供應鏈事件當下「機隊哪台機器現在中了」。它刻意不執行任何套件管理員,也不是 EDR。

ai deep-dive

上傳檔案就自動 embedding 是個壞預設:Adaptive / Agentic RAG 與 Agentic Parsing 論文導讀

把『使用者上傳檔案就自動切 chunk、embedding』設為預設行為,等於替 LLM 預先做了一個它本來可以自己做的決定。從 Self-RAG (2310.11511)、Adaptive-RAG (2403.14403) 到 AgenticOCR (2602.24134) 這條學術線索,正在把『要不要 retrieve、要不要 parse、怎麼切 chunk』三層決策權,從 ingestion pipeline 往後推到對話時的 agent。

ai deep-dive

把 LLM Agent 的 skills / tools / code interpreter 真正組裝起來:一份論文導讀地圖

LLM agent 的難點不是把 function calling、skill、code interpreter、文件工具各自做出來,而是把它們組成一個會選工具、會寫程式、會拆任務、會驗證結果、又不會被 prompt injection 打穿的系統。這篇把代表論文整理成六個工程決策:function calling 可靠度、tool/skill selection、code-as-action、多步 planning、skill 系統、安全與文件生成。

tech debug

手機 Chrome 登入後跳回登入頁:HTTP 入口沒有轉 HTTPS 的踩坑記錄

手機 Chrome 登入後跳回登入頁,不一定是 OAuth 或前端狀態壞掉;這次根因是 app-dev.daodao.so 的 HTTP 入口沒有 301 到 HTTPS,導致 /auth/me 以 http origin 發出時沒有帶 auth_token。

ai deep-dive

A2UI(Agent-to-User Interface):Google 讓 agent 把 UI 當資料傳出去的開放協定

A2UI 是 Google 在 2025-12-15 開源的 agent 生成式 UI 協定:agent 只送宣告式 JSON 描述 UI 意圖,client 用自己的元件 catalog 白名單渲染成原生畫面,疊在 A2A 之上。發布時 format v0.8,3 個月後已迭代到 v0.9。

browse.sh:把瀏覽器 Agent 學過的事存成技能目錄

Browserbase 在 2026-05 推出的 browse.sh,是「瀏覽器技能目錄 + Browse CLI」兩件事。核心論點:瀏覽器 Agent 的瓶頸是健忘症不是推理,把學過的網站操作存成純文字 SKILL.md,Craigslist 任務官方自評從 ~$0.22 降到 ~$0.12。注意它跟 2018 年的 Browsh 文字瀏覽器毫無關係。

ai deep-dive

CodeGraph:本地端程式碼知識圖譜,與「直接走圖才省錢」的真相

CodeGraph 用 tree-sitter 把 codebase 抽成本地 SQLite/FTS5 知識圖譜,讓 AI coding agent 查圖而不是掃檔。官方端到端 benchmark(7 repos、median of 4)平均省 35% 成本、70% tool calls;但前提是 agent 直接走圖——把探索 delegate 給只會讀檔的 subagent,CodeGraph 反而變成 overhead。

ai deep-dive

大家怎麼讀 arXiv 論文?方法論與工具全景

讀論文是兩個問題疊在一起:方法論(Keshav 三遍閱讀法,5-10 分/1 小時/4-5 小時)決定怎麼讀,工具(arXiv HTML、alphaXiv、NotebookLM、Connected Papers、Zotero)負責縮短每一遍的時間。AI 負責降低理解門檻,判斷對錯永遠留給人。

Midscene.js:押注純視覺的跨平台 UI 自動化框架

字節跳動開源(MIT)的 UI 自動化框架。UI 動作只靠截圖餵給視覺語言模型,不解析 DOM;一套 JS API 跨 Web / Android / iOS / 桌面。代價是每步較慢、token 較貴,而且高度綁在模型的 grounding 能力上。注意它已在 1.9.8 之後停掉 MCP,改走 Skills + CLI。

Antigravity CLI:Google 用一套 agent harness 收編 Gemini CLI 的終端機介面

Antigravity CLI 是 Google 在 2026/5/19 I/O 發表的終端機 agent,用 Go 重寫(Gemini CLI 是 Node),二進位檔叫 agy,與桌面版 Antigravity 2.0 共用同一套 agent harness。它同時是 Gemini CLI 的接班人——個人方案的 Gemini CLI 將於 2026/6/18 停止服務。

ai deep-dive

Claude 怎麼讀寫 PDF / DOCX / PPTX:拆解 skill + sandbox 的三層架構

Claude 沒有 docx_tool / pdf_tool — 它只用 bash + file tools,加上 SKILL.md 指令、容器內預裝的 pdfplumber / python-pptx 等 library,三層拼出檔案讀寫能力。

ai deep-dive

Open Design:11 天 fork 出來的 Claude Design 開源替代品

Anthropic 2026-04-17 發 Claude Design,4-28 nexu-io/open-design 公開,同樣的 artifact-first loop、Apache-2.0、跑在你已經有的 16 個 coding-agent CLI 上。兩週從 0.1 到 0.7、40k+ stars。把 AI 設計工具從 vertical SaaS 攤平成 skill bundle 的範式轉移。

ai deep-dive

system_prompts_leaks 導讀:40k star 的 AI 系統提示 archive 在解什麼問題

asgeirtj/system_prompts_leaks 蒐集 40 多個 AI 助理的 system prompt 原文,從 GPT-5.5、Claude Opus 4.7 到 Gemini 3.1 Pro 都有,40.3k stars、461 commits、MIT 授權。價值不在於拿到秘密,而在於把廠商的隱性政策變成可比對的工程素材——要學的是設計決定,不是文字本身。

ai deep-dive

拆解 Anthropic Founder's Playbook:四階段、三條 moat、一個 Cowork 合規坑

Anthropic 2026-05-14 發的 35 頁創業手冊,把 Idea/MVP/Launch/Scale 四階段按 agentic AI 重排。最值得學的是『build 越容易、validation 越重要』與 CLAUDE.md 當作 MVP 第一個 artifact;最該打折扣的是 Launch 章節把合規 workstream 跑在 Cowork 上 — Anthropic 自家文件說 Cowork 不寫 audit log。

tech debug

LLM agent 的 tool description 決定它怎麼選 tool:三個踩坑修法

把 tool description 從軟建議改成硬規則(白名單 + 後果說明),LLM 亂選 tool 的問題消失了;另外加 skip_signal=True 修掉 vector store 雙重 indexing。

ai deep-dive

用 AI Agent 操作影片生成工具:HyperFrames、HeyGen、Runway 整合指南

AI agent 可透過 Skills、MCP Connector、直接 API 三種方式操作影片生成工具,選對整合方式比選對工具更重要。

ai deep-dive

Code Mode:把 tool definition 從 context 搬進 code

別再把所有 tool description 在 session 開頭一次塞進 context。讓 model 寫 code、runtime 執行,tool 定義只在 import 那行才進 context — Anthropic 的 GDrive→Salesforce 範例從 ~150K tokens 降到 2K,Cloudflare 的 2,500 endpoints schema 從 1.17M 降到 1K。

ai deep-dive

FDE 戰爭:OpenAI 和 Anthropic 為何同時複製 Palantir 的劇本

MIT 研究說 95% 企業 AI pilot 零回報。OpenAI 和 Anthropic 在同一週各自宣布百億美元規模的合資公司,把 Palantir 用了十幾年的 Forward Deployed Engineer 模式整套搬進企業 AI 落地戰場。

ai deep-dive

別人怎麼用 LLM 寫文章:從 Karpathy LLM-wiki 到多 agent pipeline 的取捨筆記

綜述 11 個公開的 LLM 寫作 pipeline,三條主流模式:多 agent(researcher → writer → critic)、Karpathy LLM-wiki(raw + wiki + LLM 寫不手寫)、品質防線(technical verifier + never fabricate + brief gate)。Princeton GEO 論文(KDD 2024)量化了 inline 引用 +28%、加數字 +33%、quote 原文 +41%、關鍵字塞詞 −9%。

ai deep-dive

OpenAI 公開 Codex 安全部署策略:沙箱、自動審批與企業治理框架

OpenAI 在 2026 年 5 月公開 Codex 內部部署實踐:沙箱劃技術邊界、審批決定何時停下、Auto-review 用子代理代替人類審批、Managed configuration 由企業管理員強制下發。核心理念是:低風險動作零摩擦,高風險動作必經審查。

ai guide

9Router:把 Claude Code / Cursor / Cline 路由到 40+ 家供應商的本地三層 fallback 路由器

本地起一支 OpenAI 相容端點 localhost:20128,把 Claude Code / Cursor / Cline / Codex / Copilot 等 CLI 的請求,自動依 訂閱 → 便宜 → 免費 三層 fallback 路由到 40+ 家供應商。內建 RTK 壓縮 tool_result(省 20–40% input token)、Caveman mode 壓 output、OAuth 自動 refresh、多帳號輪詢,npm install -g 9router 兩條指令裝完。

Claude、Codex、Gemini 都進瀏覽器了:三家 AI Agent 在 Chrome 的路線比較

三家原本走三條路:Anthropic 做擴充、OpenAI 蓋自己的瀏覽器、Google 直接焊進 Chrome。到 2026-08 已經變成兩條——OpenAI 的 Atlas 在 8/9 停止運作,能力收回 ChatGPT 桌面版與 Codex。剩下的分歧是「寄生在 Chrome 上」對「Chrome 本身就是」。

ai deep-dive

自製 auto-dev agent 的 15 個 walls:從 Stripe Minions 學到的具體實作

Stripe Minions 講『The walls matter more than the model』,但矽谷四家 case study 沒講具體要怎麼蓋這些 walls。這篇把 daodao auto-dev agent 實際落地的 15 個 walls 拆給你看:每個 wall 防什麼、檔案放哪、tradeoff 在哪。Tier 1 必上、Tier 2 強化、Tier 3 嚴肅治理。

ai guide

什麼是 auto-dev agent?daodao 自動化開發系統的入門解說

PM 在 Notion 勾選一張任務卡 → 系統自己同步成 GitHub issue → 寫成 plan → 寫成 code → 開 PR 給人類 review。這篇講這套系統做什麼、不做什麼、為什麼現在可行,給沒在寫 code 的人看。

ai guide

手把手建一條 Notion → PR auto-dev agent:daodao pipeline 的可複製版本

從零建一條 Notion 任務 → GitHub issue → spec PR → code PR 的 auto-dev agent。用 daodao 案例為範本,講清楚每一步要做什麼、要驗證什麼、踩到問題怎麼處理。Notion DB schema → bin/ scaffold → 兩條 Claude Code routine → cloud env vars → staging 測試。

ai deep-dive

Claude for Financial Services:拆解 Anthropic 的多 Agent 參考實作

Anthropic 開源了 12 個金融業 Agent + 11 個 MCP connector,最值得抄的不是 Agent 本身,而是『同一份 prompt 雙 runtime』和『純檔案擴充』的分層設計。

ai guide

從 Plan 到 PR:daodao 的 auto-dev agent 實戰

用 5 輪 consensus 寫 plan、再用 team mode 5 worker 並行做完 12 個 task;中間踩了不少坑,記下來給未來的自己跟同樣在嘗試的人看。

ai deep-dive

DeepSeek-OCR:把長上下文壓成圖片的 10× 壓縮實驗

DeepSeek-OCR 的論文題目是 Contexts Optical Compression — OCR 只是手段,真正驗證的是『把文字渲染成圖片再餵給 VLM』能達到 10× 壓縮且 97% 精度。這對長上下文 LLM 與 RAG 的 token 成本是質變。

ai deep-dive

2026 年 LLM Inference 服務商免費額度與定價:40+ 家分梯整理

個人專案、玩具 demo、做 RAG 原型,不想第一步就掏卡。整理 2026/05 還在運作的 40+ 家 LLM inference 服務商,按免費資源「是持續補充還是一次性」分梯,標註綁卡需求、模型清單、付費起價,數字全部從官方 pricing 頁驗證。中國原廠含智谱 GLM(永久免費)、豆包(每日 200 萬 tokens)、Kimi、百煉、Ollama 本地跑法一併收錄。

Claude Code /loop:把 AI 變成背景 worker 的排程功能(v2.1.72+ 新版)

/loop 是 Claude Code 的原生 cron 功能,自然語言設定排程,讓 Claude 在背景持續監控、自動修 PR、定期執行任務。Session 範圍、7 天到期,跨 session 用 Routines 或 Desktop 任務。

Claude Code Routines 全攻略:雲端自動化系統的完整設定與案例(前 Cloud Scheduled Tasks)

Routines 是 Claude Code 的雲端自動化系統(前身 Cloud Scheduled Tasks)。除了 cron 排程,還能用 API 端點或 GitHub 事件觸發——掃 issue、審 PR、跑檢查、開 PR,電腦關了也會跑。

ai deep-dive

Claude Skills:把專業知識打包成資料夾,教一次就一直記得

Skill 是一個資料夾、一份 SKILL.md。三層 progressive disclosure 讓 Claude 在需要時才載入細節,避免每次對話重新解釋偏好。

ai guide 搜尋與爬取實戰

Local Deep Research 導讀:本地優先的深度研究 Agent

Local Deep Research 是個本地優先、隱私導向的深度研究 Agent,用 LangChain + LangGraph 串起 20+ 搜尋引擎和 30+ 種研究策略,旗艦的 langgraph_agent_strategy 走 LLM 自主 tool-calling 路線,跟固定流程的 RAG graph 是兩種思路。

ai deep-dive RAG 技法大全

PageIndex:不做向量的 RAG,把長文件變成一本有目錄的書

PageIndex 不切 chunk、不做 embedding、不存向量,靠 LLM 推理一份 LLM 自己寫的目錄樹,在 FinanceBench 上由開發方自評拿到 98.7%。它解的不是向量 RAG 的同一個問題——是『在一份結構清楚的厚文件裡找對的那一節』。

tech deep-dive

從外面連回家裡的 Mac:Cloudflare Tunnel 與 2026 的替代方案

想從外面連回家裡的 Mac,2026 年的標準答案有兩個:要公開分享或瀏覽器免裝 client,用 Cloudflare Tunnel;自己用、要簡單,用 Tailscale。本文比較兩者、加上 ZeroTier / Pangolin / NetBird 等替代方案,說明 2026 年 Cloudflare 推的『遠端託管 tunnel』為什麼讓設定變簡單。

ai guide 搜尋與爬取實戰

AI Agent 接搜尋 MCP 工具:當 WebFetch / WebSearch 被擋的時候

用 Claude Code、Cursor 等 AI agent 時,內建 WebFetch / WebSearch 常被 Cloudflare、地理限制或 rate limit 擋住。接一個 search MCP server 是最直接的解法,這篇比較 2026 年實際能用的選項。

ai guide

Groq Console:用 LPU 推論開源模型的開發者平台

Groq Console 是 Groq 自家 LPU 晶片的開發者入口,提供 OpenAI 相容 API、Playground、免費額度,主打把 Llama、Qwen、DeepSeek 等開源模型跑出市面上最快的 token/秒。

Warp:從現代終端機到 Agentic Development Environment

Warp 從一個用 Rust 打造的現代終端機,演化成整合 AI Agent 的開發環境(ADE),2026 年 4 月開源,目前擁有 70 萬開發者使用者。

goose:開源、跨平台、不鎖 LLM 的本地 AI Agent

goose 是由 Linux Foundation 旗下 AAIF 維護的開源 AI Agent,支援 15+ LLM 供應商、70+ MCP 擴充,用 Rust 打造桌面 App + CLI + API,定位是不鎖廠商、可自架的 Claude Code 替代方案。

ai guide Cloudflare AI Stack

Gemma on Cloudflare Workers AI:繁中應用的務實選擇

在 Cloudflare Workers AI 上跑繁中 LLM,Gemma 系列的指令跟隨比同級 Llama 穩定。gemma-3-12b-it 已於 2026-05-30 標為 deprecated,現在的對應選項是 gemma-4-26b-a4b-it:256K context、Vision、Function calling,$0.10 / $0.30 per M tokens。

ai deep-dive

用 LLM 做知識管理:從 Karpathy 的 llm-wiki 到開源生態全覽

Karpathy 在 2026 年提出 llm-wiki 模式,讓 LLM 主動維護 markdown wiki 而非每次從頭 RAG;目前已有 100+ 開源實作,從本機 CLI 到 serverless Telegram bot 各有差異。

ai deep-dive

OpenAI Workspace Agents:從 Custom GPT 進化到團隊自動化平台

OpenAI 2026/4/22 推出 Workspace Agents,以 Codex 為底、可長時間在雲端執行、能串 Slack/Salesforce/Google Drive,是 Custom GPT 的企業版後繼者。

ai guide RAG 技法大全

36 小時建出法律合約 RAG:Weaviate Query Agent + ColQwen 架構拆解

用 Weaviate Query Agent + ColQwen 多向量模型,一個 prompt 在 36 小時內搭出生產等級的法律合約搜尋系統——這篇拆解它的架構邏輯、技術選擇,以及你真正需要注意的事。

marketing guide

AKIRAXCLAW 的內容模式:每天 5 篇、三層漏斗、Agent 輔助發布

Akira 用 Threads → Blog → Docs 三層漏斗 + Agent 輔助發布,在中文 AI 內容市場建立了一套可持續的知識付費模式。

ai guide

AI Code Review 走到哪了:從 Cloudflare 的 Multi-Agent 系統看業界現況

Cloudflare 內部跑了 30 天 Multi-Agent Code Review,131K 次 Review、中位數 3 分鐘。這篇整理他們的架構,以及 Anthropic、GitHub、CodeRabbit、Greptile 等業界方案怎麼做同一件事。

ai guide

深入 Codex Agent Loop:OpenAI 如何讓 AI Agent 持續迭代工作

OpenAI 詳解 Codex 的 agent loop 設計:prompt 如何建構、multi-turn 對話如何管理、prompt caching 如何避免成本爆炸,以及 context window 自動壓縮的實作。

ai guide

Codex App Server:OpenAI 如何把 Agent Harness 變成通用協議

OpenAI 把 Codex harness 包裝成 JSON-RPC over stdio 的 App Server,讓 VS Code、JetBrains、Web、桌面 App 都能共用同一套 agent loop,三個核心 primitive:Item、Turn、Thread。

ai guide AI Agent 實戰

OpenAI 用 Codex 寫了 100 萬行程式碼:Harness Engineering 實戰

OpenAI 內部團隊 5 個月、3 人、0 行手寫程式碼,用 Codex 交付了一個完整產品。這篇整理他們在 AGENTS.md 設計、repo-local 知識庫、架構強制執行、entropy 管理上的核心心得。

AEO / GEO 工具全景:輸入面、流量面、輸出面——從 isitagentready 到 aeo-radar 到 Profound

AEO/GEO 工具不是單一類別,而是三個面向:輸入面(網站有沒有準備好給 AI 讀)、流量面(AI bot 實際爬了多少)、輸出面(品牌在答案裡怎麼被提到)。這篇把三面向、從開源自架到商業 SaaS 的工具一次攤開。

tech project

DeerFlow:字節跳動開源的超級代理框架,把 Agent 做成可長跑的研究系統

DeerFlow 是字節跳動開源的 Super Agent Harness,基於 Python 3.12 + LangGraph,透過沙箱、長期記憶、子代理、技能與訊息閘道協調長時任務。2026 年 2 月登上 GitHub 趨勢榜第一,目前超過 63,000 星,支援 Telegram/Slack/飛書等 IM、Claude Code 整合與多種搜尋後端。

travel guide

2026 旅遊不便險完整指南:新制重點、保障比較與購買方式

2026/4/1 不便險新制:同行程最多 2 張、不同家、定額賠付上限降至 6000 元。整理班機延誤、行李遺失等六大保障項目及購買管道。

ai guide AI Agent 實戰

Agentic Engineering:讓 AI Agent 像真實工程團隊一樣協作

Agentic Engineering 不是讓 AI 寫更快的程式碼,而是讓軟體更快走完整個交付流程——透過多 agent 協作,壓縮跨團隊的協作摩擦。

ai guide AI Agent 實戰

Agentic Engineering 的記憶問題:從類型、實作到擁有權

Agent 的記憶不是一個插件,而是 harness 本身的一部分。選對記憶類型、估算資料量、再決定用什麼技術——最後,也要搞清楚你是否真的擁有那份記憶。

ai guide

用 Codex + Gemini + Claude 做多引擎 Code Review:原理、模式與實作

AI 模型審查自己的程式碼時會自我合理化,用三個不同 CLI 做獨立 review 可以有效捕捉盲點——這篇介紹背後的設計哲學與實際的工作流程模式。

tech guide

YouTube to NotebookLM 擴充套件怎麼做到的?拆解逆向工程與跨 Tab 架構

NotebookLM 沒有官方 API,這個擴充套件靠的是逆向工程 Google 內部 batchexecute RPC + DOM scraping + 跨 Tab 訊息傳遞,三者組合完成整個流程。

tech debug

本機開發 AI Backend API 永遠回空資料:Cookie Domain 隔離問題

主後端跑在遠端 HTTPS,auth_token cookie 的 domain 是遠端,瀏覽器不會把它送到本機 AI backend,導致 API 認為未登入。

ai guide

把 AI Agent 接進開發流程:從 SDLC 五大階段看怎麼做

Agentic AI 不只是 autocomplete,而是能自主執行多步驟任務的 AI 系統。這篇文章拆解 SDLC 的五大階段,說明每個階段能從哪裡切入、怎麼從 CLI 工具走到全流程自動化,以及目前最值得追蹤的外部資源。

ai guide

一本由 AI 自己寫的書,教你怎麼跟 AI 一起寫軟體

Encyclopedia of Agentic Coding Patterns 收錄 190 個 pattern,幫你在 AI 代寫程式的時代做出正確的軟體決策——而這本書本身就是由 AI agent 自主撰寫和維護的。

ai guide

GitHub Copilot Coding Agent:把 Issue 丟給 AI,讓它自己開 PR

GitHub Copilot Coding Agent 讓你把 Issue 指派給 Copilot,它在雲端沙箱裡自動開 branch、寫程式、跑 CI、開 PR。成功關鍵是設好 AGENTS.md,沒設定的話 agent 容易跑偏。適合定義清楚的中型任務,需 Pro+(每月 1,500 premium requests)或 Enterprise 方案。

ai guide

knowledge-pipeline:六層管線幫你的 RAG 做品質管控

一個六層確定性管線,從 URL 擷取到向量嵌入全自動處理,透過八維度評分系統在資料進 RAG 之前就篩掉垃圾。

ai guide 文件解析實戰

MarkItDown:把任何檔案餵給 LLM 之前,先讓它變成 Markdown

Microsoft 開源的輕量工具,把 PDF、Office、圖片、音訊等格式統一轉成 Markdown,專門為 LLM pipeline 設計。

ai guide

MCP vs CLI vs API:Agent 工具介面的真實分界

MCP 不會退場,但有效範圍比想像中窄。本機開發場景 CLI 和 raw API 幾乎都贏過 MCP;MCP 真正不可替代的,是「跨 agent 共享的本機工具層」這條窄縫。

你的 JSON-LD 和 schema 對 AI 搜尋引擎是隱形的嗎?各家管線拆解與 AEO/GEO 策略

不同 AI 引擎讀網頁的方式差異很大。有的只看 body、有的靠預建索引。JSON-LD 和 schema 不是萬能的,正文品質和結構才是跨平台有效的基礎。

product project

quidproquo 部落格改進完整規劃:從內容、技術、RAG 設計到 Harness 基礎建設

用自己寫的 30+ 篇 RAG/Agent 文章交叉檢視部落格現狀,整理出橫跨內容品質、網站技術、RAG 設計修正、Harness 基礎建設、AI Agent 應用的完整改進清單,按優先級排列、不分階段。

ai guide

從實戰整理:AI Native 團隊該做好的事

不是每個人都該直接用 coding agent 改 code。AI Native 團隊要搞定 interface 規格、測試先行、monorepo、security guardrail、human-in-the-loop 與 token 預算管控,在 coding agent 上面再建一層 agent platform 並明確開發者角色轉型才是正途。

ai guide

Autoreason:讓 LLM 自我修正時知道何時該停手

Autoreason 用競爭式多版本評估(A/B/AB + 盲測 Borda count)取代傳統的「批評→改寫」迴圈,解決 LLM 自我修正中的提示偏差、範疇蔓延和缺乏克制三大問題。

ai project

Vercel Open Agents:把 coding agent 從你的筆電搬到雲端

Vercel Labs 開源的 coding agent 參考實作。三層架構分離 web UI、agent workflow、sandbox VM,設計給想自建 Claude Code / Cursor Background Agent 的團隊當起手。

tech guide Cloudflare AI Stack

Cloudflare Workers AI binding 全貌:不只是 run()

env.AI 這個 binding 不是只有 run()。它還掛了 toMarkdown(文件轉 Markdown)、autorag(託管 RAG)、gateway(外部 provider 代理)、models(metadata 查詢)。認識這四組方法,才能在 Workers 上把 Cloudflare 當完整的 AI 平台用。

ai guide

Claude Octopus:把 8 個模型同時掛在 Claude Code 上的共識 Plugin

Claude Octopus 是一個 Claude Code plugin,能同時叫 Codex、Gemini、Copilot、Qwen、Ollama、Perplexity、OpenRouter 和 Claude 一起看同一份 code,用 75% 共識門檻找單模型的盲點。內建 32 個 persona、48 個 /octo:* slash commands、51 個 skill、以及 Dark Factory 全自動 spec-to-code 管線。

ai guide

LLM Council:Karpathy 週末打造的多模型議會,三階段讓 LLM 互相評審

LLM Council 是 Andrej Karpathy 花一個週末做的本地 Web App,把一個問題同時丟給多個 LLM,再讓它們匿名互評,最後由 Chairman 模型綜合出一份答案。定位是讀書時比較模型用的小工具,99% vibe coded、不打算長期維護,但架構本身就是一份值得參考的 ensemble LLM 最小實作。

tech guide

Better Agent Terminal:把多個專案的 Terminal 和 Claude Code Agent 收進同一個視窗

Better Agent Terminal (BAT) 是一個 Electron 桌面 app,把多個專案的 workspace、terminal、以及 Claude Code Agent 整合到同一個視窗,解決開一堆 iTerm 分頁、Agent 沒有好 GUI 容器的日常痛點。MIT License,macOS / Windows / Linux 都能裝。

ai guide

Claude Managed Agents:把 agent 外殼和沙箱都交給 Anthropic

Claude Managed Agents 是 Anthropic 2026/04/08 推出的 beta 服務,提供 agent harness 加雲端容器沙箱,按 token 加 $0.08/session-hour 計費,適合長時間非同步任務,不想自己寫 agent loop 和跑沙箱的人值得看。

ai guide

Agent Skills:讓 AI 代理像資深工程師一樣工作的技能框架

Agent Skills 是 Addy Osmani 開源的 19 個生產級工程技能,透過 /spec → /plan → /build → /test → /review → /ship 的指令驅動 AI 代理遵循資深工程師的開發紀律,而不是走捷徑。

ai guide

Graphify:把程式碼和文件變成可查詢的知識圖譜

Graphify 用 tree-sitter AST 提取程式碼結構,再用 LLM 語意分析文件與圖片,把整個專案壓縮成一張可查詢的知識圖譜。號稱每次查詢比讀原始檔案省 71.5 倍 token。

Claw Code:用 Rust 重寫 Claude Code 的開源 CLI Agent

Claw Code 是用 Rust 從零重寫的 Claude Code CLI 替代品,48K 行程式碼、40 個工具、MIT 授權。最驚人的是整個專案在 5 天內由多個 AI Agent 協作完成,上線不到一週就突破 170K stars。

ai guide

clawhip:讓多 Agent 開發不再失控的事件通知路由器

clawhip 是一個 Rust 寫的 daemon,專門把 AI coding agent 的事件(commit、PR、session 狀態)路由到 Discord / Slack,解決多 Agent 並行時「不知道誰在做什麼」的可觀測性問題。

ai guide

notebooklm-py:用 Python 操控 Google NotebookLM 的非官方 API

notebooklm-py 透過逆向工程 Google 的 batchexecute RPC 協議,讓你用 Python / CLI / AI Agent 程式化操作 NotebookLM,包含音訊、影片、投影片、測驗等生成功能。

ai guide

oh-my-claudecode:把 Claude Code 變成多 Agent 協作平台的增強層

oh-my-claudecode(OMC)在 Claude Code 上加了 8 種協作模式、19 個專業 Agent、跨模型調度(Claude + Codex + Gemini),讓單人 CLI 工具變成多 Agent 開發平台。支援 Deep Interview 需求釐清、Smart Model Routing 省 30-50% token、rate limit 自動恢復。

ai guide

oh-my-codex:在 OpenAI Codex CLI 上疊加結構化工作流的增強層

oh-my-codex(OMX)不是取代 Codex CLI,而是在它上面加一層結構化工作流——從需求釐清、計畫產出到多 Agent 並行執行,用 4 個核心 Skill 把散亂的 prompt 對話變成可追蹤的開發流程。

ai guide

oh-my-openagent:用多模型 Agent 團隊取代單一 LLM 的編碼框架

oh-my-openagent(OmO)把 OpenCode 從單一 LLM 工具變成多模型 Agent 團隊——Opus 當主力、GPT-5.2 當架構師、Gemini 做前端、Sonnet 查文件,一個 ultrawork 關鍵字觸發全員並行。48K stars,UltraWorkers 生態系中最早建立多 Agent 編碼模式的專案。

ai project

OpenHarness:把 Agent Harness 完整開源的框架

香港大學 HKUDS 開源的 Agent Harness 框架,實作了工具呼叫、技能載入、記憶、權限、多代理協作等完整基礎設施,支援 Anthropic / OpenAI / GitHub Copilot 三種 API 格式。

tech guide

Codex 和 Claude Code 的設定檔重複維護問題:用 symlink 一次解決

Claude Code 不認 AGENTS.md,Codex 不認 CLAUDE.md,多人協作專案被迫維護兩份一樣的設定。解法:把 CLAUDE.md 做成 AGENTS.md 的 symlink,只維護一份。

ai guide

Claude Code Agent Teams 怎麼用?從 GitHub 6,400+ 個 agent 看設計模式

GitHub 上已有 6,400+ 個 .claude/agents/*.md 檔案。我們拆解了 4 個代表性專案——ChemistryTimes(內容生產 pipeline)、claude-sub-agent(document-driven 開發流水線)、agentic(Temporal.io DAG 平行執行)、vs-copilot-multi-agent(Hook 強制記憶寫入)——加上 ruflo 的企業級 swarm 架構,歸納出 6 種設計模式和 5 個實戰趨勢。

ai guide AI Agent 實戰

從 Stripe 到 Meta:矽谷一線公司如何用 AI Agent 取代鍵盤

矽谷一線公司各自獨立打造內部 AI coding agent,從 Slack 訊息到 merged PR 全程自動化。深入拆解 Stripe、Ramp、Coinbase、Spotify 四家的架構,再擴展到 Google、Meta、Amazon、Uber、Goldman Sachs、Walmart 等十多家公司的做法與指標。

ai guide

LLM 知識庫的三種模式:知識庫、經驗庫、部落格

Andrej Karpathy 提出用 LLM 編譯個人知識 wiki 的框架——收集原始資料、LLM 編譯成 .md wiki、對 wiki 做 Q&A、輸出歸檔回 wiki。本文比較三種實踐路線:Karpathy 的知識庫模式、社群的經驗庫模式、以及 quidproquo 的部落格模式。

ai guide

AI Agent 的 Cache 不只一層:從 Claude Code 的 18 種快取到 ReAct Agent 的多層設計

拆解 Claude Code 的 18+ 種快取機制後發現:provider-level prompt cache 你做不了,但 embedding cache、tool result cache、entity cache 你不但做得了,效果還更好。附完整的 AgentCache 介面設計與 per-tool TTL 策略。

ai guide

AI Agent 的 Tool 描述不該是靜態的:從 Claude Code 學到的動態 prompt() 設計

Claude Code 的 45 個 tool 中,每個 prompt() 都會根據使用者類型、feature flags、系統能力動態調整。將這個模式套用到 ReAct Agent,根據 orchestrator 模型能力、locale、可用 tools 三個維度動態生成 tool description,小模型自動補 few-shot,大模型省 token。

ai guide Agent CLI 選型指南

Claude Code 完整方案分析:終端 Agent 的深度推理之王

Claude Code 從 $20/mo Pro 到 $200/mo Max 20x,額度以 5 小時滾動視窗計算並疊加週上限,Claude 網頁/桌面/終端共用同一個池子。額度用完可選擇改走 API 費率的 usage credits 繼續做事,而不是硬停。

ai guide Agent CLI 選型指南

Cursor CLI 完整方案分析:從 IDE Agent 延伸到終端的全能選手

Cursor CLI 把 IDE 的 Agent 帶進終端,支援 interactive TUI 與 headless、Plan/Ask/Agent 三種模式、Cloud Handoff、CI/CD 整合。計費改為兩個獨立額度池:Cursor 自家模型(Grok 4.6/4.5、Composer 2.5)與第三方模型(Pro 含 $20、Pro+ $70、Ultra $400)。

ai guide Agent CLI 選型指南

Google 終端 Agent 方案分析:個人免費那條路已經沒了

Google 這條線的付費路徑對照:個人免費層與 Google AI Pro / Ultra 的 Gemini CLI 存取已於 2026/6/18 終止,個人只剩 Antigravity CLI 或自備付費 API key;企業授權與 Google Cloud 不受影響。零成本起步的選項已經換人。

ai guide Agent CLI 選型指南

Kiro (AWS) 完整方案分析:Spec-Driven 開發的 Agentic IDE

Kiro 分五層:Free 50 credits、Pro $20/1,000、Pro+ $40/2,000、Pro Max $100/5,000、Power $200/10,000,加購 credit 一律 $0.04。Auto 模式混合模型省成本(同一任務走 Sonnet 要 1.3 倍 credit),Spec-Driven 流程把 vibe coding 變成可追蹤的結構化開發。

ai guide Agent CLI 選型指南

OpenAI Codex 完整方案分析:ChatGPT 生態系的 Agent 整合

Codex 綁定 ChatGPT 訂閱(Free / Go $8 / Plus $20 / Pro 5x $100 / Pro 20x $200),2026/4/2 起計費改為按 token 計 credit。模型主線是 GPT-5.6 Sol / Terra / Luna;GPT-5.4 與 5.4 mini 將於 2026/8/31 在 ChatGPT 登入模式下退場。

OpenCode 完整方案分析:75+ 模型供應商的開源終端 Agent

OpenCode 是免費開源的 TypeScript CLI agent(MIT,約 198K GitHub stars),支援 75+ 模型供應商含本地 Ollama,可用 Copilot/ChatGPT 帳號認證,session 中途切換模型不丟上下文。另有桌面版與官方 Zen gateway。

ai guide Agent CLI 選型指南

Agent CLI 訂閱方案全比較:打造可自由切換的多模型使用模式

比較六大 Agent CLI 的訂閱方案(Claude Code、Cursor CLI、Codex、Kiro、Antigravity/Gemini CLI、OpenCode),並研究多模型路由模式——簡單任務給便宜模型、複雜任務給強模型。各家計費在 2026 上半年幾乎全部改過一輪,這一版是 8/18 重新查證的結果。

ai guide

2026 個人 AI 硬體選購指南:DGX Spark、Mac Studio、MSI AI Edge 全比較

比較 NVIDIA DGX Spark、Apple Mac Studio M4 Ultra、ASUS Ascent GX10、MSI AI Edge 等個人 AI 工作站,幫你找到適合的本地推論硬體。

ai guide Agent CLI 選型指南

Multi-Model Routing 開源工具與實作:讓對的模型做對的事

透過多模型路由,將 70% 的簡單任務導向便宜模型,只讓 10-15% 的複雜任務使用旗艦模型,實測節省 40-85% 推論成本。本文介紹五個主要開源工具的架構與實作。

product project

數位生態系研究:從 LINE、Shopify 到台灣 MarTech,拆解平台串接策略

拆解數位生態系三層結構:LINE 超級應用、Shopify App Store 飛輪、台灣 MarTech 串接策略,核心是透過 API 與數據流讓參與者相互依賴、共同強化護城河。

tech guide

AI Agent 的全域 Skills 要放哪裡?.claude、Codex Skills、AGENTS.md 的分工

Skill 路徑通常是 runtime-specific,跨 agent 真正穩的是 AGENTS.md;個人共用能力放各自 agent 支援的全域目錄,專案 workflow 放 repo 內。

tech guide

code-review-graph:用知識圖譜讓 AI Code Review 省下 8 倍 Token

code-review-graph 用 Tree-sitter 解析 codebase 建立持久化知識圖譜,追蹤變更的爆炸半徑,只把真正相關的 context 餵給 AI,號稱平均省下 8.2 倍 token。

tech guide

GitBook:把文件變成產品的文件平台

GitBook 是一個以 Git 為底層的文件平台,支援 Markdown 編輯、版本控制、多人協作。適合技術文件、API docs、內部知識庫。免費方案對個人和小團隊夠用。

tech guide

NVIDIA DGX Spark:桌上型 AI 超級電腦,把一個 petaFLOP 塞進你的桌面

NVIDIA DGX Spark 搭載 GB10 Grace Blackwell Superchip,128GB 統一記憶體,提供 1 petaFLOP FP4 算力,售價約 $3,999 美元起。適合開發者在本地跑 200B 參數模型、fine-tune 70B 模型,是目前最容易入手的 NVIDIA AI 開發平台。

tech guide

文件平台選擇指南:GitBook、Docusaurus、Mintlify 和其他七個選項

九個主流文件平台的定位、優缺點、適用場景和實際使用案例。選擇邏輯:開源專案選 Docusaurus/VitePress,API docs 選 Mintlify/ReadMe,企業內部選 Confluence,快速上手選 GitBook。

ai guide Agent CLI 選型指南

Agent CLI 完整指南:設計邏輯、工具比較與使用原則

Agent CLI 不是更聰明的補全工具,而是能讀懂 codebase、執行多步驟任務、操作真實環境的 AI 代理。Claude Code、Codex CLI、Gemini CLI、OpenCode、Aider、Pi、Kiro、Amp、Cursor CLI... 工具越來越多,但底層共享一套設計邏輯——理解這套邏輯,才能真正用好它們。

ai guide

2026 年 15 個值得關注的 Agent 框架

按 GitHub Stars 排序,盤點 2026 年 15 個主流 AI Agent 框架的定位、特色與適用場景。不是排名,是地圖。

ai guide

一句話發一篇 IG 輪播 — 從手動 3 小時到全自動的 Pipeline 實作教學

用 Claude Code 當 orchestrator,串接 Playwright 截圖、catbox.moe 圖床、Meta Graph API 發布、Telegram 通知,一句話完成 IG 輪播圖文的生成與發布。

ai guide

llama.cpp — 從純 C++ 到消費級硬體上的 LLM 推論引擎

llama.cpp 是目前最廣泛使用的本地 LLM 推論引擎,用純 C/C++ 實作,支援 CPU、Metal、CUDA、Vulkan 等多後端,搭配 GGUF 量化格式讓消費級硬體能跑數十億參數的模型。

ai guide

TurboQuant+ — 用兩階段量化把 KV Cache 壓到 2-bit,讓 MacBook 跑 100B 模型

TurboQuant+ 是 Google Research ICLR 2026 論文的開源實作,用 PolarQuant + QJL 兩階段量化壓縮 KV cache 達 3.8-6.4x,讓消費級硬體跑更大模型和更長上下文。

ai guide

能在手機上跑的小模型:2026 年的選擇與限制

2026 年行動端 LLM 主力是 Gemma 3n、Qwen 3.5 Small、Llama 3.2、Phi-4-mini、Ministral 3 和 SmolLM3。3B 以下量化模型在 8GB RAM 手機上能跑到 30–50 tokens/sec,但 RAM、散熱和 context window 仍是硬限制。

ai project

2026 Q1 開源 LLM 全景圖:從前沿大模型到手機端,完整盤點

2026 Q1 開源模型全面爆發:LLM 方面 GLM-5、Kimi K2.5、Qwen3.5 追上閉源;Embedding 和 Reranker 由 Qwen3 和 BGE 主導;語音有 Voxtral TTS 和 Whisper V3;圖像有 FLUX.2;影片有 Wan 2.2 追平 Sora。這篇是完整導覽地圖。

tech guide Agent CLI 選型指南

Claude Code:Anthropic 終端機 AI Coding Agent 完整介紹

Claude Code 是 Anthropic 的 agentic coding 工具,跑在終端機、IDE、Slack、GitHub 和 Web 上。核心擴充機制有六層:CLAUDE.md(永駐 context)、Skills(按需工作流程)、Hooks(確定性自動化)、Subagents(隔離委派)、MCP(外部工具連接)、Agent Teams(多 agent 協作)。

Codex CLI:OpenAI 開源終端機 Coding Agent 完整介紹

Codex CLI 是 OpenAI 的開源終端機 coding agent(Rust,Apache-2.0,約 106.6k stars),支援 MCP、subagents、圖片輸入、code review、Skills。模型主線已換成 GPT-5.6 Sol / Terra / Luna,桌面版、CLI 與 IDE 擴充共用一份 config.toml。

Gemini CLI:曾經最慷慨的免費終端 Agent,現在只剩企業路徑

Gemini CLI 是 Google 開源的終端機 AI agent(Apache 2.0,~106.6k stars),曾提供每分鐘 60 次、每天 1,000 次的免費額度含 1M context。個人方案已於 2026/6/18 停止服務,接替者是 Antigravity CLI。專案本身沒關閉,repo 仍在維護,但只服務 Gemini Code Assist Standard/Enterprise 授權與付費 API key。

OpenCode:開源 AI 終端機 Coding Agent 完整介紹

OpenCode 是用 TypeScript 打造的開源 AI coding agent(MIT,約 198K GitHub stars,repo 在 anomalyco/opencode),內建 TUI、支援 75+ LLM、LSP 整合、Vim 風格編輯器、SQLite session 管理,另有桌面版。免費、不需訂閱,可接本地或雲端模型。

Pi Coding Agent:極簡主義的開源終端機 Coding Harness

Pi 是 Mario Zechner 打造的極簡 coding agent(TypeScript、MIT、約 93K stars),只有 4 個核心工具與極短 system prompt,其餘全靠 Extensions/Skills/Prompt Templates 自己疊。刻意不做 MCP、sub-agents、plan mode、權限彈窗。repo 已改名 earendil-works/pi,npm scope 換成 @earendil-works。

ai guide AEO / GEO 與 AI 搜尋

AI-Ready Content:把網站變成 AI 可讀的資料來源,完整指南

2025–2026 年,網站不只要給人看,還要給 AI 看。從 llms.txt、Schema Markup、GEO 到 RAG ingestion pipeline,這篇整理了讓你的網站變成 AI 可用資料來源的完整技術地圖。

ai guide AI Agent 實戰

Harness Engineering 進階模式:Tool Registry、Guard System 與 Checkpoint-Resume

Harness 不只是呼叫 LLM 的 wrapper。Tool Registry 管理工具的動態載入與選擇、Guard System 建立四層防護網、Checkpoint-Resume 讓長時間任務可以中斷恢復。這三個模式是生產級 Agent 系統的關鍵基礎設施。

ai guide

Skill vs Subagent:Claude Code 兩種 Agent 協作模式比較

Skill 是你手動呼叫的 prompt 模板,Subagent 是 Claude 自動 routing 的獨立 agent。看起來很像,但觸發方式、工具隔離、context 管理完全不同。

ai guide

Ticketing 已死,Review 才是新的 Planning

當 AI agent 能在幾分鐘內把 intent 變成 PR,軟體工程的瓶頸就從「規劃該做什麼」翻轉成「評估做出來的東西對不對」。Ticketing 時代的產物(sprint、story point、backlog grooming)正在壓縮歸零,取而代之的核心實踐是 review。

Claude Code Spinner Verbs:從原始碼挖出 185 個狀態動詞的完整清單

Claude Code 處理請求時會從 185 個預設動詞中隨機顯示(如 Thinking、Brewing、Clauding),完成時從 8 個動詞中選一個搭配耗時。可透過 settings.json 的 spinnerVerbs 設定自訂,支援 replace 和 append 兩種模式。本文所有資料來自 cli.js 原始碼實際驗證。

tech guide

gstack — Garry Tan 把 Claude Code 變成虛擬工程團隊的 20 個 Skills

gstack 是 Garry Tan 開源的 Claude Code skills 工具集,用 20 個專業 skill 把一個人變成一整個工程團隊——從產品規劃、設計審查、code review、QA 到部署,全部自動化。

ai guide AI Agent 實戰

Anthropic 的 Harness Design:讓 AI Agent 像工程師一樣工作

同一個模型在不同的 harness 設計下會產生截然不同的結果。Anthropic 用雙 Agent 架構、跨 session 狀態檔、GAN 式 generator-evaluator 迴圈,讓 Claude 能自主完成數小時的軟體開發任務。

ai guide

Google 的八種 Multi-Agent 設計模式

Google 整理了八種 multi-agent 設計模式:從最簡單的 Sequential Pipeline 到可組合的 Composite Pattern。不是越複雜越好——選對模式比堆 agent 重要。

ai guide AI Agent 實戰

從 Prompt 到 Harness:AI 工程的三次演化

AI 工程經歷三個階段:Prompt Engineering(寫好指令)→ Context Engineering(餵對資訊)→ Harness Engineering(設計整個工作環境)。每一次演化不是取代前者,而是在更高的抽象層級上操作。

OpenClaw Agent Loop:序列化、寫入者宣告,與那個防止舊回合覆寫逐字稿的柵欄

Agent loop 是每個 session 序列化的執行。最值得學的是它處理並行的方式:每個被接受的回合會記下 activeWriterRunId 宣告,之後每次逐字稿寫入都要附上 expectedWriterRunId,在交易裡比對——被取代的回合因此無法提交過期資料。

OpenClaw Agent Runtime:系統 prompt 是組出來的,而它被一條快取邊界切成兩半

OpenClaw 每次執行都自己組系統 prompt,沒有執行期的預設 prompt。組出來的內容被一條內部快取邊界切開——穩定的 workspace 前綴在上面、每輪會變的頻道脈絡在下面——好讓有前綴快取的後端能跨頻道重用同一段前綴。

ai guide OpenClaw 文件導讀

OpenClaw 存取控制:SecretRef 不是程序隔離,以及它到底解決了什麼

SecretRef 讓憑證不必以明文躺在設定檔裡,模型呼叫鏈上看到的是 process-local 的哨兵值。但官方講得很白:這不是程序隔離——真正的值仍在同一個程序的記憶體裡,而且 agent 讀得到的任何明文檔案都繞過了這層保護。

ai guide OpenClaw 文件導讀

OpenClaw 自動化(一):六種機制怎麼選,以及「排程要準」與「順便看一下」是兩件事

Cron 已經改名為 Automations(openclaw cron 仍是別名),而自動化現在有六種機制。核心的取捨只有一條:Automations 給你精確時間與隔離執行,Heartbeat 給你完整的主 session 脈絡與大約每 30 分鐘一次的頻率。

ai guide OpenClaw 文件導讀

OpenClaw 自動化(二):Standing Orders 是授權書,Automations 是時鐘

Standing orders 給 agent 對某個「程式」的永久操作權限,寫在 AGENTS.md 裡、每個 session 自動注入。它定義的是「被授權做什麼」,時間點則交給 automations——兩者分工,而且 automation 的提示應該引用 standing order 而不是複製它。

ai guide OpenClaw 文件導讀

OpenClaw 企業頻道:Slack 的三種傳輸模式,與「內建」這欄已經不存在了

企業頻道全部改成 plugin 了,包含以前內建的 Slack 與 Google Chat。Slack 現在有三種傳輸模式——Socket Mode、HTTP Request URLs、Relay——而官方明說它們在功能上已經對等,要按部署形狀選,不是按功能選。

ai guide OpenClaw 文件導讀

OpenClaw 主力頻道:WhatsApp、Telegram、Discord 各自會卡在哪一步

三個頻道各有一個「不知道就會卡住」的點:WhatsApp 是 QR 登入沒辦法遠端做、Telegram 是 bot 預設開著 Privacy Mode 收不到群組訊息(改完還要把 bot 退出再加回去)、Discord 是 Message Content Intent 沒開就收不到伺服器訊息。

ai guide OpenClaw 文件導讀

OpenClaw 其他頻道:Signal、iMessage、LINE,以及讓兩個人的 agent 直接對話的 Reef

這批頻道裡最值得看的是 Reef——不同人的 OpenClaw agent 之間的端對端加密側頻道,訊息在你的機器上封裝、雙向都經過釘死模型的守衛審查,中繼站永遠讀不到內容。它是 bundled plugin,不用另外裝。

ai guide OpenClaw 文件導讀

OpenClaw 頻道總覽:31 個頻道幾乎都是 plugin,以及「誰能觸發」與「模型看得到什麼」是兩回事

OpenClaw 支援 31 個聊天頻道,但只有 WebChat 在核心裡——連 Slack 和 WhatsApp 都是要裝的 plugin。而群組安全其實有兩個獨立的軸:allowlist 管的是誰能觸發 agent,不管模型會看到哪些引用與歷史,後者要另外設 contextVisibility。

ai guide OpenClaw 文件導讀

OpenClaw Gateway 篇(一):嚴格驗證會讓它拒絕啟動,以及那些擋住你自己的保護

OpenClaw 的設定驗證是嚴格的——多一個不認識的鍵、型別不對、值無效,Gateway 就拒絕啟動。它會保留最後已知良好的設定,但啟動與熱重載都不會自動還原,只有 doctor --fix 會。

ai guide OpenClaw 文件導讀

OpenClaw Gateway 篇(二):綁定、認證與那份憑證優先權契約

Gateway 預設只綁 loopback,而綁到 loopback 以外一律要求認證——這是它自己會擋的,不是建議。容器裡的有效預設是 auto,但 Tailscale serve/funnel 啟用時會強制回 loopback。

ai guide OpenClaw 文件導讀

OpenClaw 安裝指南(下):雲端部署的四個決定,與 K8s 上的實際坑

雲端部署 OpenClaw 要決定的其實只有四件事:Gateway 綁哪裡、state 放哪裡、誰能連進來、壞了怎麼復原。平台選擇是最不重要的一項。

ai guide OpenClaw 文件導讀

OpenClaw 安裝指南(上):六種本機安裝方式怎麼選,以及會卡住的地方

OpenClaw 有六種本機安裝方式,差別不在指令而在你要不要可重現性、隔離、與自我更新。真正會卡住的是套件管理器的 lifecycle script 政策:npm 12 與 pnpm 全域安裝都預設擋掉 OpenClaw 的 build script。

ai guide OpenClaw 文件導讀

OpenClaw 模型進階:容錯的兩階段、冷卻的真實數字,與 Prompt Caching

OpenClaw 的容錯是兩階段:先在同一供應商內輪替 auth profile,再換模型。但真正決定行為的是「這個模型是誰選的」——你手動用 /model 選的模型是嚴格的,失敗就報錯,不會偷偷用別的模型回答你。

ai guide OpenClaw 文件導讀

OpenClaw 的模型需求與供應商生態:先搞懂 provider、model、runtime 是三件事

OpenClaw 對模型的硬需求是 tool use 加夠大的 context——onboarding 自動推薦本地模型的門檻是支援 tool 且 context 至少 16K。但更容易搞混的是 provider、model、agent runtime 其實是三層,`openai/*` 不等於走 Codex。

ai guide OpenClaw 文件導讀

OpenClaw 的 60 個供應商:分類地圖,與接本地模型真正會踩的坑

官方 provider 目錄現在有 60 個條目。接本地模型最常見的失敗是把 Ollama 的 base URL 寫成 /v1——那會破壞 tool calling,模型會把 tool JSON 當純文字吐出來。

ai guide OpenClaw 文件導讀

OpenClaw 多 Agent:一個 agent 是一整個人格邊界,而 agent 現在可以要求生出 agent

一個 agent 是完整的人格範圍——workspace、auth profile、模型登錄、session 儲存全部獨立。但隔離不是絕對的:次要 agent 的 OAuth 憑證過期時,OpenClaw 會回頭讀主 agent 的同名 profile,而 workspace 只是預設工作目錄,不是硬性沙箱。

OpenClaw Nodes 深入:核准綁的是計畫,不是你之後改過的指令

遠端 node 執行最值得看的是核准的綁定方式:exec 在核准前先備好一份標準化的 systemRunPlan,核准之後 gateway 轉發的是那份存起來的計畫,不是任何之後被呼叫端改過的指令、cwd 或 session 欄位——而且執行前會重新驗證工作目錄。

ai guide OpenClaw 文件導讀

OpenClaw 文件導讀:200+ 份文件,從哪讀起?

OpenClaw 有 200+ 份文件,這篇幫你搞懂全貌、知道每塊在講什麼、依你的角色決定從哪讀起。

OpenClaw 參考篇:Pi 已經被吸收掉了——內建 runtime 現在就叫 openclaw

「OpenClaw 是 Pi 的 Gateway 殼」這個說法已經過期。官方文件現在寫的是:內建 runtime id 是 openclaw,而 pi 是會被正規化掉的 legacy 別名,「已經沒有外部 agent 框架套件」。留下的第三方 pi 相關依賴只剩一個終端機元件工具包。

ai guide OpenClaw 文件導讀

OpenClaw 桌面平台:Windows 現在有原生 Hub,而 Node 是硬性需求

Node 是必要的執行期,因為標準狀態儲存用 node:sqlite——Bun 只能拿來裝依賴。Windows 這邊變化最大:新增了原生的 Windows Hub companion app,不需要管理員權限,還能自己開一個 app 專屬的 WSL 發行版來裝 Gateway。

ai guide OpenClaw 文件導讀

OpenClaw 行動平台:手機是周邊,不是 Gateway——連 Apple Watch 都有自己的傳輸

iOS 與 Android 的 app 是 node,不是 Gateway:它們不跑 Gateway 服務,Telegram 或 WhatsApp 的訊息也是落在 Gateway 上而不是手機上。Apple Watch 比較特別——因為 watchOS 擋掉一般 app 的低階網路,它改用簽章過的 HTTPS 輪詢。

ai guide OpenClaw 文件導讀

OpenClaw Plugin 系統:把安裝當成執行程式碼,以及冷檢查證明不了執行期

官方對安裝 plugin 的定調是「把它當成執行程式碼」——ClawHub 與內建目錄是受信任來源,任意的 npm、git、本地路徑在非互動安裝時需要 --force。而驗證要用 inspect --runtime,因為不帶旗標的 inspect 只是冷的 manifest 檢查。

ai guide OpenClaw 文件導讀

OpenClaw 沙箱機制:四種後端、三個獨立開關,與「以為在沙箱裡其實沒有」

沙箱由三個獨立設定決定:mode(何時套用)、scope(開幾個容器)、backend(在哪執行)。最容易出事的是預期落差——`tools.exec.host` 現在預設是 auto,所以「沒設就等於在沙箱裡」已經不成立,安全稽核有一條專門抓這個。

ai guide OpenClaw 文件導讀

OpenClaw 的 Session 與記憶:一條滾動的主對話,加上四個會被寫進磁碟的檔案

預設下所有 DM 匯進同一條「主 session」,群組活動與背景工作都往那裡回報。記憶則完全是磁碟上的 Markdown——模型只記得被寫下來的東西,沒有隱藏狀態。但如果不只你一個人能私訊它,DM 隔離是必須主動打開的。

OpenClaw 的威脅模型:先講清楚它「不保護什麼」

OpenClaw 的安全文件現在開宗明義寫著:這是個人助理的信任模型,一個 Gateway 對應一個受信任的操作者。它明確「不是」多個互相敵對的使用者共用一個 agent 時的安全邊界——而且有一份『依設計不算漏洞』的清單把這件事寫死。

ai guide OpenClaw 文件導讀

OpenClaw 工具篇(一):一個專屬瀏覽器、三種附著方式,與被標成「不可信」的搜尋結果

OpenClaw 的瀏覽器是一個獨立的 agent 專用 profile,跟你的個人瀏覽器完全隔離。而 web_search 的回傳結構裡有一個 externalContent.untrusted 標記——搜尋結果在型別層就被標成不可信的外部內容。

ai guide OpenClaw 文件導讀

OpenClaw 工具篇(三):關掉檔案工具不會讓 exec 變成唯讀

exec 是一個會改變狀態的 shell 面:關掉 write、edit、apply_patch 這些檔案工具,完全不會讓它變成唯讀。而沙箱預設是關的,所以 host=auto 實際上會解析到 gateway——真的要沙箱就明確寫,它至少會 fail closed。

ai guide OpenClaw 文件導讀

OpenClaw 工具篇(二):Skills 的六層優先順序,與子 agent 不給訊息工具的理由

Skills 從六個來源載入、同名時高優先者勝,而 per-agent 的清單是取代不是合併。子 agent 預設拿不到 session 與訊息工具——它回傳純文字給父 agent,人看得到的回覆權留在父 agent 手上。

ai guide OpenClaw 文件導讀

OpenClaw 工具篇(四):當工具多到塞不進 prompt——Code Mode、Tool Search 與 MCP

工具目錄大到塞不進 prompt 時,OpenClaw 有兩個答案:Code Mode 只讓模型看到 exec 與 wait,由它寫小程式去搜尋與呼叫隱藏的目錄;Tool Search 則保留結構化的搜尋/描述/呼叫控制。兩者都不繞過工具政策。

ai guide OpenClaw 文件導讀

OpenClaw 維運篇:前 60 秒的七行指令,與「感覺變笨了」通常不是模型的錯

官方的分診流程是七行指令跑一遍、兩分鐘出診斷。而「assistant 感覺受限、工具不見了」這個最常見的症狀,多半是工具 profile——minimal 只允許 session_status,coding 才是新本地設定的預設。

ai guide OpenClaw 文件導讀

OpenClaw UI:新增的側欄可以問「這個 session 在幹嘛」而不打斷它

Control UI 加了一條 session rail:它用 utility model 產生執行摘要,還附一個唯讀的伴讀 thread,讓你問「這個 session 現在怎樣」而不會進入或打斷主 agent 執行。它的內容不會進入 chat.history。

ai guide

Phil Schmid:為什麼 Agent Harness 是 2026 年最重要的事

模型是 CPU,harness 是作業系統,agent 是應用程式。模型能力再強,沒有好的 harness 就只是 demo。Phil Schmid 認為 harness 是 2026 年 AI 工程最關鍵的基礎設施。

Claude Code Troubleshooting 索引:第 33-35 篇安裝、執行期與設定診斷

原 Claude Code 除錯合集已拆分為第 33-35 篇:安裝與登入、執行期問題、設定診斷。本頁是三篇的索引。

tech guide 搜尋與爬取實戰

AI Agent 繞過 Cloudflare 反爬蟲完整指南:從踩坑到自建 MCP Server

標準 Playwright 無法通過 Cloudflare 驗證。playwright-extra + stealth 和 nodriver 都能繞過,最終包成 MCP server 讓 AI agent 自動使用。

Claude Code Agent Teams 怎麼用:Team Lead、點對點傳訊與共享任務板

Agent Teams 讓多個完整的 Claude Code session 組成一個團隊:Team Lead 分配工作,teammates 各自擁有獨立 context window,靠點對點傳訊和共享任務清單自我協調。本文講它跟 sub-agent 的三個關鍵差別、teammateMode 兩種顯示模式的取捨,以及 token 成本隨人數線性上升這件事。

Claude Code 實戰工作流:探索、規劃、實作到 commit 的官方最佳實踐

Claude Code 官方最佳實踐的主軸只有一條:管好 context window。本文按探索、plan mode、實作、驗證、commit 的循環整理 prompt 技巧、/clear 與 rewind 的使用時機,以及官方點名的五種失敗模式。

Claude Code Channels 怎麼運作:外部事件、reply tools 與 sender gating

Channels 是一種特殊的 MCP server,能把 CI 失敗、監控告警、Telegram 訊息這類外部事件直接推進正在跑的 Claude Code session,Claude 讀完事件還能透過 reply tool 從同一條通道回話。本文拆解 channel contract、雙向回覆、安全閘門與安裝需求。

Claude Code Checkpointing 深入介紹:snapshot 機制、rewind 選單與追蹤邊界

Checkpointing 不是 git commit:Claude Code 在每個 user prompt 前自動存檔案 snapshot,一個 session 保留最近 100 個、30 天清除。本文拆解 /rewind 選單的五個選項、bash 與 subagent 等追蹤邊界,以及它跟 git 的分工。

Claude Code 怎麼看見你的瀏覽器:Chrome 整合、console 除錯與表單自動化

Claude Code 透過 Claude in Chrome 擴充套件取得瀏覽器控制權:讀 console log 與 DOM、點擊輸入、上傳檔案、錄 GIF,還能直接操作你已登入的網站。官方前置條件列出 Chrome、Edge 與 Brave、Arc、Vivaldi、Opera 等 Chromium 系瀏覽器,但 WSL 不支援。

Claude Code 怎麼進 CI/CD:GitHub Actions 的 @claude 與 GitLab MR 流程

用 anthropics/claude-code-action 把 Claude Code 放進 GitHub Actions:/install-github-app 一條指令裝好,@claude 在 PR 和 Issue 留言就能叫它修 bug、推分支並給 PR 建立入口;Bedrock/Vertex/Foundry 三種雲端後端走 OIDC 免存金鑰;GitLab CI/CD(beta)則用 .gitlab-ci.yml 一個 job 對應,所有變更走 merge request。

Claude Code 怎麼記住你的專案:CLAUDE.md 層級串接、imports、rules 與 auto memory

Claude Code 每個 session 都是乾淨的 context window,靠三種記憶跨 session 帶知識:每個 session 都載入的 CLAUDE.md、寫 paths 就條件載入的 .claude/rules/、以及 Claude 自己累積的 auto memory。各層 CLAUDE.md 是串接進 context,不是繼承覆蓋。本文拆解層級行為、@path imports、monorepo 拆檔策略,以及用 @AGENTS.md 讓多個工具共用一份指示。

Claude Code 的 context window 怎麼管理:自動載入內容、各功能成本與 compaction 三件套

Claude Code 在你打第一個字之前就載入了 system prompt、MEMORY.md、CLAUDE.md、MCP tool 名稱和 skill 描述。本文拆解 session 開頭的自動載入內容、六類擴充功能各自的 context 成本,以及 /compact、/autocompact、autoCompactWindow 三層壓縮控制的用法。

Claude Code 沙箱怎麼運作:sandboxed Bash、網路 allowlist 與六種隔離環境的威脅模型

Claude Code 內建的 sandboxed Bash 用 OS 層機制限制每條指令:寫入限工作目錄與 session temp,讀取預設整機可讀;網路走 proxy allowlist,預設零網域。開關在 /sandbox 面板和 sandbox.enabled,不是 --sandbox 旗標。本文再比較 sandbox runtime、devcontainer、Docker、VM 與 Claude Code on the web 這幾種更重的隔離方案該什麼時候用。

Headless 與 Agent SDK:從 claude -p 到程式化 agent

claude -p 把 Claude Code 從終端機互動變成一條可寫進腳本和 CI 的指令:pipe 資料進去、用 --output-format json 拿結構化結果、--bare 跳過大多數自動探索來加速啟動。本文以 CLI 用法為主體,最後講四個該改用 Python/TypeScript Agent SDK 的訊號。

Claude Code 怎麼接上外部工具:MCP server 的三種 scope、transport 與認證

Claude Code 用 MCP(Model Context Protocol)連外部工具,手動設定分三種 scope:專案共用放 .mcp.json、個人跨專案和 local 都在 ~/.claude.json、企業走 managed config——不在 settings.json。本文涵蓋 claude mcp add/login 流程、SSE 已 deprecated 的 transport 現狀,以及 tool search 延遲載入。

Claude Code Plugins 與 Marketplaces:把 skills、hooks、MCP 打包成一個安裝單位

Plugin 的價值不是新能力,而是分發:把散在 .claude/ 的 skills、agents、hooks、MCP 設定收進一個帶 manifest 的目錄,透過 marketplace 安裝、更新、鎖版本。本文拆解 plugin 目錄結構、最小建立流程、marketplace 發佈與 dependencies 版本約束。

Claude Code Remote Control:從任何裝置接續本地 session

Remote Control 把 claude.ai/code 或 Claude 手機 app 變成你本地 Claude Code session 的遙控器:程式照樣跑在自己的機器上,MCP servers 和本地工具全部可用,但對話同步會經過 Anthropic 伺服器。本文涵蓋啟動、續接、推送通知與傳檔,以及安全邊界。

Claude Code settings.json 設定大全:五層 scope、合併規則與常用欄位

Claude Code 的設定分五層——managed settings、CLI flag、專案 local、專案共用、使用者——純值型 key 由高層蓋掉低層,permissions.allow 這類清單型 key 則跨層合併。本文整理每層檔案的角色、allow/deny/ask 三清單的寫法,以及用 /status 和 claude doctor 驗證設定是否生效。

從 Slack 指派 coding 任務:Claude Code in Slack 與 Claude Tag 兩條路

在 Slack @Claude 就能把 bug report 變成雲端跑的 Claude Code session。但現在有兩條路:Pro/Max 走原 Claude Code in Slack(每個 session 掛在個人帳號),Team/Enterprise 新設定或遷移則看 Claude Tag(組織共用身分、admin 管權限與用量)。先確認方案再設定,才不會裝錯。

Claude Code Sub-agents 怎麼運作:context 隔離、frontmatter 定義、背景執行與權限繼承

Sub-agent 是在獨立 context window 中工作的專業助手:一個 Markdown 檔定義 system prompt、工具與模型,Claude 依 description 自動委派,也能 @-mention 直接指派。本文拆解 frontmatter schema、背景執行與巢狀 spawn 的現狀、permission 繼承規則,以及什麼時候不該用。

tech guide RAG 技法大全

「推薦下一條」和「推薦類似的」不是同一件事 — RAG 推薦系統的意圖消歧

攀岩 RAG 系統中「推薦下一條路線」(progression)和「推薦類似路線」(similarity)被同一個 hasSimilarRouteIntent() 函式混為一談,導致推薦品質崩壞。解法是 Regex Fast Path + LLM Fallback 的兩階段意圖分類。

tech guide RAG 技法大全

RAG 多實體查詢:當使用者一次丟五條路線,系統只看到第一條

RAG 系統的 extractRouteReference() 用 for...return 只抓第一個匹配,使用者給了五條完攀紀錄卻只用到一條。解法從 rule-based 多實體擷取、user profile aggregation 到 embedding centroid,分三層遞進實作。

tech deep-dive RAG 技法大全

當 Vector Search 把名字當難度搜:RAG 系統的 Attribute Conflation 問題

查詢「美人照鏡 5.11b,推薦類似難度路線」,結果回來的全是名字像的路線而不是難度像的。根因是 dense embedding 把多個屬性壓進同一個向量,名稱的稀有性壓過了難度訊號。解法:metadata pre-filter + query rewriting + score fusion 三層防線。

ai guide

LangGraph:用圖結構管理 Agent 工作流程

LangGraph 把 LLM 工作流程建模成有向圖,解決多輪迭代、條件分支、平行執行這些用線性 pipeline 做很痛的問題。

tech guide

Biome:用 Rust 取代 ESLint + Prettier

Biome 一個工具做 ESLint + Prettier 兩個工具的事,速度快 10-20 倍,設定簡單很多。DaoDao 在整個 monorepo 用它,lint + format 一次過。

AEO 答案引擎優化指南 — 讓 AI 搜尋引擎引用你的內容

AEO(Answer Engine Optimization)是針對 AI 搜尋引擎(Perplexity、ChatGPT Search、Google AI Overview)的內容優化策略。核心是讓你的內容成為 AI 最容易引用的「答案來源」,而不只是搜尋結果中的一個連結。

部落格 SEO 優化完整指南 — 從 meta tags 到結構化資料

SEO 不只是關鍵字,結構化資料(JSON-LD)、Open Graph、hreflang、robots.txt 這些技術面優化才是讓搜尋引擎真正理解你內容的關鍵。本文以 Astro 部落格為例,完整走一遍實作。

tech guide

BullMQ:Node.js 最成熟的 Redis-backed 任務佇列

BullMQ 是 Node.js 生態裡最成熟的任務佇列,底層用 Redis,支援優先級、重試、排程、延遲任務。島島用它處理通知發送和實踐自動完成排程。

tech guide

Celery:Python 生態裡分散式任務佇列的標準解法

Celery 是 Python 最主流的分散式任務佇列,用 Redis 或 RabbitMQ 當 broker,讓耗時工作跑在背景。島島的 AI 服務用它處理 LLM 回饋生成等非同步任務。

Claude Code Global Skills 新 Session 找不到?釐清 Skill Discovery 機制與排查方法

Global skills 放在 ~/.claude/skills/ 但新 session 或 Desktop App 看不到?問題通常不是檔案不存在,而是 skill 描述沒被載入 context。本文釐清 CLI vs Desktop App 的差異、settings.json 的角色,以及最穩定的解法。

tech guide

ClickHouse:當 PostgreSQL 的分析查詢開始變慢,你需要 OLAP

ClickHouse 是欄導向 OLAP 資料庫,掃幾億行只要幾秒,島島用它記錄使用行為事件,供 AI 推薦引擎的特徵工程使用,讓 PostgreSQL 專心處理交易型資料。

Cloudflare D1:跑在邊緣的 SQLite 關聯式資料庫

D1 是 Cloudflare 的 serverless SQLite 資料庫,直接綁定 Workers,支援完整 SQL(JOIN、transaction)、自動備份。適合中小規模的關聯式資料需求,NobodyClimb 把它當主資料庫用。

Cloudflare KV:全球邊緣的 Key-Value Store

KV 是 Cloudflare 的全球分散式 key-value store,讀取從最近的邊緣節點回應,延遲極低。適合快取、feature flag、暫態資料,但寫入是最終一致性。

Cloudflare R2:零 Egress 費用的 S3 替代方案

R2 是 Cloudflare 的物件儲存,S3 相容 API、零 egress 費用、Workers 原生 binding。媒體密集的應用不用再擔心流量帳單。

Cloudflare Workers:不是 Lambda,不是容器,是 V8 Isolate

Cloudflare Workers 用 V8 Isolate 取代容器,沒有 cold start,全球邊緣部署,透過 Bindings 接 D1、R2、KV、AI。適合 API、SSR、輕量後端,不適合 CPU 密集的工作。

tech guide

Docker 實務入門:從開發到部署的容器化

Docker 讓你把應用程式和它的環境打包在一起,消除「在我電腦上可以跑」的問題。搭配 multi-stage build 和 Compose,是現代後端部署的基本配備。

tech guide

Expo + React Native:一套程式碼跑 iOS 和 Android,實際上是什麼體驗

Expo 讓 React Native 開發從「環境設定地獄」變成可以直接寫邏輯的狀態。Expo Router 帶來 file-based routing,讓 web 開發者轉移成本更低。島島和 NobodyClimb 都用它跨 iOS/Android。

tech guide

Express.js:Node.js 後端的預設答案,以及它為什麼還值得選

Express 是 Node.js 最成熟的 Web framework,middleware 生態完整、學習資源豐富。搭配 TypeScript 和清楚的分層架構,在 2026 年仍然是有理由選的選項。

tech guide

FastAPI:Python AI 服務的標準答案

FastAPI 是基於 Python type hint 的現代 Web framework,自動生成 OpenAPI 文件、原生 async 支援、效能接近 Node.js。AI/ML 服務的首選,也是 Python 後端裡最值得學的框架。

tech guide

GitHub Actions:CI/CD 的入門與 Monorepo 策略

GitHub Actions 是目前最省設定成本的 CI/CD 工具,適合中小型專案。Monorepo 的關鍵是用 path filter 讓只有受影響的 app 觸發 build。

Hono:為 Edge Runtime 而生的輕量 Web Framework

Hono 是專為 Cloudflare Workers、Deno、Bun 等 edge runtime 設計的 Web framework,比 Express 輕一個數量級,原生支援 Web Standard API,是 edge 環境下的首選。

tech guide

Next.js 15 + App Router:Server Components 和 use cache 實際上在做什麼

Next.js 15 + React 19 的 App Router 把渲染責任從客戶端移到伺服器,use cache 讓快取邏輯直接跟資料綁在一起而不是散在 fetch 選項裡。島島和 NobodyClimb 都選它,原因很務實。

@opennextjs/cloudflare:把 Next.js 跑在 Cloudflare Workers 上

@opennextjs/cloudflare 讓 Next.js App Router 部署到 Cloudflare Workers,動態 SSR 走 Worker,靜態資源走 Cloudflare Assets。沒有 server 管理成本,但有明確的功能限制。

tech guide

PM2:Node.js 程序管理的實用選擇

PM2 讓 Node.js 應用在 server 上持續跑,掛掉自動重啟,可以開 cluster 模式用滿 CPU,Log 也幫你管好。部署在 VM 或 VPS 的 Node.js 應用幾乎都需要它。

tech guide

Prisma ORM:TypeScript 專案的型別安全資料庫存取

Prisma 用 schema-first 設計讓資料庫 migration 有版本控制、查詢有完整 TypeScript 型別、關聯查詢直覺。代價是學習曲線和 ORM 的固有限制,但對多數 TypeScript 專案是值得的換法。

tech guide

React Hook Form + Zod:表單處理的最佳組合

React Hook Form 處理表單效能,Zod 定義驗證 schema,兩者搭配讓表單開發幾乎不需要寫樣板程式碼。在 monorepo 裡共用 Zod schema,前後端驗證邏輯一份就夠。

tech guide

Redis 入門:快取、Session、Pub/Sub 一次搞懂

Redis 是 in-memory key-value store,快到不像話,島島用它同時扛快取、Session、BullMQ 任務佇列三個職責,一台 Redis 幹三件事。

tech guide

shadcn/ui:不是套件,是複製貼上的元件原始碼

shadcn/ui 不是 npm 套件,它把元件原始碼複製到你的專案,你完全擁有這些程式碼。島島用它建立 packages/ui 元件庫,讓三個 Next.js app 共用同一套 UI。

tech guide

TailwindCSS:utility-first 不只是風格偏好,是一種 CSS 管理策略

TailwindCSS 解決的核心問題是 CSS 的全域命名汙染和死碼問題。utility class 讓樣式跟元件放在一起,build 時自動移除沒用到的 class,生產環境的 CSS bundle 通常只有幾十 KB。島島和 NobodyClimb 都用它做 web 端樣式。

tech guide

Tamagui:React Native 的 UI framework,為什麼 NobodyClimb 選它而不是 NativeWind

Tamagui 是針對 React Native 設計的 UI framework,有完整的 design token 系統和 theme 支援,編譯時期優化讓樣式計算移到 build time。NobodyClimb 選它而不是 NativeWind,主要是因為跨平台的 token 系統更完整。

tech guide

TanStack Query:Server State 的標準解法

自己用 useState + useEffect 管 API 資料,等於重造輪子還造得比較差。TanStack Query 處理快取、背景更新、loading/error 狀態,讓你專注在 UI 邏輯。

tech guide

Turborepo + pnpm workspaces:Monorepo 的標準答案

Turborepo 解決 monorepo 的 build 速度問題,pnpm workspaces 解決依賴共用問題。兩者搭配是目前 JS/TS monorepo 的最佳選擇。

tech guide

Zod:TypeScript 的 Runtime 型別驗證

TypeScript 的型別只存在編譯期,執行時消失。Zod 讓你在 runtime 驗證外部資料,同時推斷出 TypeScript 型別,一個 schema 兩件事都搞定。

tech guide

Zustand:React 最輕量的全域狀態管理

不需要 Provider、不需要 reducer,幾行就能設定好全域狀態。NobodyClimb 用它管 auth 和 UI 狀態,搭配 TanStack Query 處理 server state。

一個人的全端團隊:從 OpenSpec 到自動部署的 AI 驅動開發流程

用 OpenSpec 把需求拆成工程任務,Claude Code 實作,hooks 自動格式化和保護,commit 前本地 review,PR 上三個 AI reviewer 平行審查,merge 後自動部署。整套流程讓一個人能維護六個子專案的品質。

Claude Code Hooks 完整指南:用事件驅動控制 AI 的每一步

Hook 是 Claude Code 的事件系統。在 AI 執行工具前後、送出 prompt 時、結束任務時自動觸發 shell command、HTTP 請求、MCP tool 或 LLM 判斷。用來擋住危險操作、自動審核、注入上下文、記錄 audit log。

Claude Code Skill 完整指南:把重複的工作流程變成一句指令

Skill 是寫給 AI 看的 SOP。一個 markdown 檔案定義步驟,Claude 照著執行。不用寫程式,不用學框架,只要把「有經驗的人會怎麼做」寫成步驟就好。

用 Claude Code Skill 把 Debug 對話變成 GitHub Issue:/file-bug-issue 的設計

Debug 到一半發現修不了?用 /file-bug-issue 直接把對話中的錯誤分析、重現步驟、已嘗試的方案打包成一個結構完整的 GitHub issue。搭配 Remote Agent,還能讓 AI 自動接手修復。

讓 AI 自己接 Issue、寫 Code、開 PR:用 Claude Code Remote Agent 做到半夜自動開發

用 Claude Code 的 Scheduled Remote Agent,每 2 小時自動掃描 GitHub issues、實作功能、開 PR、修 review feedback。人類只需要寫 issue 和按 merge。搭配自製的 /publish-tasks skill,把 OpenSpec 的工程任務一鍵發成 GitHub issues。

ai guide

Langfuse 完整指南:LLM 應用的可觀測性從零開始

Langfuse 是目前最成熟的開源 LLM Observability 平台。這篇從 Tracing、Prompt 管理、評估、Dataset 四個核心功能切入,帶你搞清楚它在實際專案中怎麼用。

Claude Code 的三層品質防線:Hook、Skill、指令檔

Hook 是自動化安全網(擋住壞 commit),Skill 是互動式工作流程(跑檢查 + 自動修),指令檔(CLAUDE.md / AGENTS.md)是行為指引。三層各自獨立,組合起來讓 AI agent 在 commit 前自動完成 lint、typecheck、build 檢查。

tech guide

Code Review Comment 怎麼分類?從 Conventional Comments 到 AI Review 工具的分類體系

主流分類系統有三種路線:Conventional Comments(標籤制)、Google 嚴重度前綴(Nit/Optional/FYI)、SonarQube 四象限(Bug/Vulnerability/Code Smell/Hotspot)。AI review 工具各自發展出不同分類,但核心維度收斂在正確性、安全、效能、可維護性四大塊。

ai guide AI Agent 實戰

Context Engineering:為什麼你的 AI Agent 問題出在資訊,不在模型

Context Engineering 是 2025 年取代 Prompt Engineering 的核心概念:重點不再是「怎麼問」,而是「給什麼資訊」。把對的資訊在對的時機送進 context window,比換更強的模型更有效。這篇整理了定義、四大策略、實作技巧和常見失敗模式。

tech guide

用 Cloudflare Workers AI 把前端 mock 變成真的:action-maker AI 整合全記錄

把 action-maker 從假資料升級為 Cloudflare Workers AI 即時生成,架構拆成 Worker(純 AI)、Server(存資料)、Frontend(串接),踩了 Qwen3 thinking block 和 Workers AI response 格式兩個坑。

ai guide

MCP(Model Context Protocol):AI Agent 工具呼叫的標準化協定

每個 AI 工具都有自己的呼叫格式,整合成本高。MCP(Model Context Protocol)是 Anthropic 提出的開放標準,統一 AI Agent 與外部工具、資料源的通訊協定,讓工具可以跨 Agent 重用。

tech guide

Node.js image 弱掃誤判?先分 app 套件與 npm 內建套件

Node.js image 的弱掃結果不能只看套件名稱,先分清楚是專案依賴,還是 base image 內建 npm 自己帶的相依套件,才不會修錯地方。

tech guide

弱掃是什麼?用 Trivy 快速建立 Docker 與套件掃描觀念

弱掃不是只為了交報告,而是幫你提早知道系統裡有哪些已知風險。這篇用 Trivy 當例子,快速介紹弱掃在掃什麼、常見結果怎麼看,以及該怎麼開始。

tech guide

把爬蟲腳本做成 MCP Server,讓 Claude 直接用

用 FastMCP 把本地 Python 腳本包成 MCP Server,讓 Claude Code 可以直接呼叫,不再需要手動跑 pipeline。

tech debug

MCP Tool 回傳 1M 字元:search_local_jobs 的 token 爆炸問題

MCP tool 回傳 description 欄位導致 1033 筆職缺超過 token 上限,改成預設不回傳 description 並加上分頁就解決了。

ai guide

Agent Memory 系統:從 RAG 到 Read-Write 記憶的演化

RAG 是唯讀的。Agent Memory 讓 AI 不只能讀,還能寫入和持久化資訊。三種記憶類型:Procedural(行為模式)、Episodic(時間事件)、Semantic(事實知識),構成完整的認知記憶系統。

ai deep-dive

AI Agent 架構模式完整指南:從三支柱到 Multi-Agent 的系統化導航

AI Agent 不是一個技術,是一整個架構體系。本文是系統化導航:從 Agent 三支柱(Context/Cognition/Action)出發,穿過 AI 工程三階段演化(Prompt → Context → Harness),到八種 Multi-Agent 設計模式和生產級 Harness 基礎設施。每個主題都有對應專文深入。

ai guide

AI Agent 的三個核心支柱:Context、Cognition、Action

AI Agent 不是黑盒子——它由三層構成:知道什麼(Context)、怎麼想(Cognition)、能做什麼(Action)。搞清楚這三層,才能理解 agent 為什麼有時聰明、有時失控,以及怎麼設計一個真正好用的 agent 系統。

tech guide

docker restart 不會重新套用 volumes —— bind mount 失效排查記錄

docker restart 不會重建容器,volumes 設定改了必須用 docker-compose down && up 才會生效。

ai guide RAG 技法大全

Multi-Agent RAG:多個專業 Agent 協作的分散式檢索架構

單一 RAG Agent 處理所有查詢會遇到知識邊界和效能瓶頸。Multi-Agent RAG 把檢索任務分派給多個專業化 Agent,每個 Agent 有自己的知識庫和檢索策略,由中央 Orchestrator 協調合併結果。

Claude Code Permission Modes 全解析:從預設到 Auto Mode 的五種權限模式

Claude Code 有五種權限模式:default(逐步確認)、acceptEdits(自動接受編輯)、plan(唯讀規劃)、auto(AI classifier 背景審查)、bypassPermissions(YOLO 全跳過)。用 Shift+Tab 切換,搭配 settings.json 精細控制。auto mode 是最佳平衡點——既不用每步確認,又有安全防護。

tech guide

nginx 502:跨 Compose 專案的容器 DNS 解析踩坑

跨 Compose 專案時 service name 不可解析,要加 network alias 才能讓 nginx 找到容器。

tech guide

為 GitHub Copilot CLI 安裝並驗證 Superpowers:實作、診斷與驗證

紀錄在本機為 Copilot CLI 安裝 Superpowers(DwainTR 打包)、遇到安裝後看不到技能的診斷流程,以及最終解法和實用建議。

tech guide

Docker DNS 解析:container_name vs network alias

跨 Compose 專案只能靠 container_name 或 network alias 解析,而 alias 才支援 scale。

ai guide RAG 技法大全

LongRAG:用長上下文模型重新思考 RAG 的 Chunking 策略

傳統 RAG 把文件切成小 chunks 再檢索,但這造成資訊碎片化。LongRAG 利用 100K+ token 的長上下文模型,檢索更大的文件區段(整個章節甚至整份文件),減少碎片化同時保持檢索效率。

ai guide RAG 技法大全

Speculative RAG:用小模型平行打草稿,大模型一次驗證

Speculative RAG 用小型專家模型從不同文件子集平行生成多個答案草稿,再由大型模型一次驗證選出最佳答案。論文在 PubHealth 上準確度提升 12.97 個百分點、延遲降低 50.83%——但這是最好的那一格,其他 benchmark 的幅度小很多。

tech guide

nginx 重啟後 Cloudflare 一直回 502,但 origin 明明是正常的

nginx 重啟期間短暫出錯,Cloudflare 偵測到 origin 不健康後停止轉發請求,自己回傳 502。localhost 打 origin 是 200,nginx access log 空白是關鍵線索。等 Cloudflare 自動 re-check 即可恢復。

tech guide

用 nginx conf.d 管理多服務 reverse proxy:以島島為例

單一 nginx.conf 隨服務增加變得難以維護,用 include conf.d/*.conf 按服務拆分是標準解法。

tech guide

nginx 第一個請求必定 502,之後全部正常

nginx 用 set $variable 做動態 upstream 時,DNS 快取每 30 秒過期,第一個請求因無可用 IP 而 502。升到 nginx 1.27.3 改用 upstream + resolve 參數,DNS 在背景非同步更新,根治問題。

tech guide

用 SSH config alias 下載 VPS 檔案

設定好 SSH config 後,scp 可以直接用 alias,不用打完整 IP

ai guide

Ollama 完整指南:一行指令在本地跑 LLM

Ollama 把 llama.cpp 包裝成 Docker 風格的 CLI + REST API,一行指令就能在本地跑 LLM。這篇從核心概念、安裝、API、硬體需求到 Modelfile 自訂,完整介紹這個工具適合什麼、不適合什麼。

ai guide RAG 技法大全

RAG 系統模式完整指南:從 Naive 到 Multi-Agent 的十代演化與實戰導航

RAG 已經從簡單的「搜尋+生成」演化成涵蓋十個世代的技術體系,2025 年後更進入 Agentic/Reasoning RAG 新階段。本文是系統化導航:從 Naive RAG 到 Multi-Agent/LongRAG 的十代演化、後十代 Agentic Era(Search-R1/RL 搜索、MCP 協議、GraphRAG 3.x、視覺直嵌)、檢索策略、Chunking、Embedding、Reranking、評估框架、可觀測性、成本優化。每個主題都有對應專文深入。

ai guide 自架推論服務

vLLM — 從 PagedAttention 到生產級 LLM 推論引擎

vLLM 用 PagedAttention 解決 KV cache 記憶體浪費問題,搭配 continuous batching 和 prefix caching,成為目前最主流的開源 LLM 推論引擎。

tech guide

Ghostty 與 cmux:現代終端機的選擇指南

Ghostty 是快速、原生的通用終端機;cmux 是基於 Ghostty、專為 AI coding agents 設計的終端機。不是競品,是不同層級的工具。

ai guide

聊天機器人開發完整指南:狀態管理、記憶策略與tech stack選型

聊天機器人不只是接 API。對話狀態管理、記憶機制、Streaming、Guardrails、可觀測性、tech stack選型,每一層都影響使用者體驗。

ai guide

Prompt Engineering 實戰:迭代方法論、常見錯誤與 Few-shot 最佳化

好的 Prompt 不是一次寫出來的,而是迭代出來的。從最簡單的 prompt 開始,用真實 case 測試,分類錯誤類型,針對性修改。本文涵蓋 System Prompt 三段式結構、推理框架選擇、Few-shot 最佳化、Token 預算管理和六個常見錯誤。

Cloudflare Free Plan 設維護頁:Custom Error Pages 不能用,改用 Worker

Cloudflare Custom Error Pages 需要付費方案,Free Plan 可改用 Worker inline HTML 攔截 5xx。

tech guide

用 Git Conditional Includes 管理個人與工作帳號

用 includeIf + SSH Host alias,讓 git 自動依路徑切換帳號,不再手動切換。

Astro + Cloudflare Workers:Native Module 在 Prerender Route 也會讓 Build 炸掉

即使 route 有 prerender = true,Cloudflare Workers 的 Rollup 還是會嘗試打包 native module,導致 build 失敗。把需要 native module 的工作移到 postbuild script 才是正解。

tech debug

Astro Scoped CSS 不套用到 MDX 渲染的內容

Astro scoped CSS 會加 scope hash,但 <Content /> 渲染的 MDX 元素沒有這個 hash,導致所有 prose 樣式失效。

ai guide RAG 技法大全

Agentic RAG:讓 LLM 自己決定要不要再搜尋一次

複雜多跳問題,RAG 一次搜尋不夠。Agentic RAG 讓 LLM 評估結果是否充分,不夠就改寫查詢再搜一次,形成 ReAct 迴圈。

ai guide RAG 技法大全

BGE-M3:為什麼這個 Embedding 模型適合繁體中文 RAG

Embedding 模型的選擇直接影響 RAG 的搜尋品質。BGE-M3 的多語言訓練、1024 維向量、同系列 Reranker,是繁中 RAG 的實用選擇。

ai guide RAG 技法大全

Chunking 策略:切塊方式決定 RAG 能不能找到答案

切太大找不準,切太小失去上下文,碰到表格更是全軍覆沒。Chunking 是 RAG 最被低估的環節,策略選錯,後面再多優化都是白費。

ai guide RAG 技法大全

ColBERT:向量搜尋的第三條路

Bi-Encoder 太粗糙,Cross-Encoder 太慢,ColBERT 的 Late Interaction 在兩者之間找到平衡:token 級別的相互比較,但可以預先計算文件向量。

ai guide RAG 技法大全

Contextual Retrieval:幫每個 Chunk 加上「這段在說什麼」

文件切塊後,每個 chunk 失去了它在原文件中的上下文。Contextual Retrieval 在索引時,用整份文件為每個 chunk 各自生成一段上下文再前綴進去,解決 chunk 孤島問題。

ai guide RAG 技法大全

CRAG:檢索失敗時,自動放寬條件重試

過濾條件太嚴格導致零結果?CRAG 自動放寬過濾條件重試,比讓 LLM 用通用知識瞎猜好多了。

ai guide RAG 技法大全

Cross-Encoder Reranking:讓最相關的文件排到前面

向量搜尋的相似度分數不等於相關性,Cross-Encoder 用成對比較重新排序,把真正相關的文件推上來。

ai guide RAG 技法大全

GraphRAG:把知識做成圖,讓 LLM 沿著關係推理

向量搜尋找相似,圖搜尋走關係。當問題需要跨多個實體的推理(岩場→路線→完攀者→難度分布),GraphRAG 比標準 RAG 更有優勢。

ai guide RAG 技法大全

Hybrid Search:用 BM25 + 向量搜尋彌補彼此的盲區

向量搜尋抓語義,BM25 抓關鍵字,兩者用 RRF 融合才能同時照顧模糊查詢和精確術語。

ai guide RAG 技法大全

HyDE:用假設答案提升向量搜尋的 Recall

用 LLM 先生成一份「理想答案」,再把這份假設文件 embed 去搜尋,比直接搜尋查詢本身效果更好。

ai guide RAG 技法大全

RAG 個性化:從對話中學習使用者偏好

每次對話後,異步提取使用者可能的偏好和程度,下次查詢時自動個性化搜尋條件,不需要使用者手動設定。

ai guide RAG 技法大全

MMR + 熱門度加權:讓推薦結果既相關又多樣

只看相關性會讓結果都是同一條路線的不同描述,MMR 在相關性和多樣性之間取平衡,再疊加熱門度讓結果更實用。

ai deep-dive RAG 技法大全

Modular RAG Pipeline:把 RAG 設計成可組合的 DAG

RAG 不是固定的三步流程,而是一組可以動態啟用、跳過、重排的步驟。Pipeline as Code 讓系統在不重新部署的情況下調整行為。

ai guide RAG 技法大全

Multi-Query Expansion:一個問題,多個角度搜尋

複雜查詢只用一個向量搜尋容易漏掉相關文件,讓 LLM 改寫成 3-5 個子查詢並行搜尋,召回率顯著提升。

ai guide RAG 技法大全

Multimodal RAG:把圖片也納入知識庫

攀岩路線有大量圖片資訊(路線圖、岩壁照片),純文字 RAG 遺漏了這些。Multimodal RAG 讓圖片也能被搜尋和理解。

ai deep-dive RAG 技法大全

RAG 的三個世代:從 Naive 到 Modular

Naive RAG 夠用但有很多問題,Advanced RAG 針對性修補,Modular RAG 重新架構讓系統可組合、可配置。了解三個世代,才能理解現代 RAG 系統為什麼長這樣。

ai guide RAG 技法大全

Plan-and-Execute:先規劃再執行的 RAG 模式

對複雜問題,先讓 LLM 規劃出需要哪些資訊、分幾步取得,再按計畫執行,比邊搜邊想更系統化。

ai guide RAG 技法大全

Query Classification:讓 RAG 知道該怎麼回答這個問題

不是所有問題都需要 RAG。用 LLM 先分類查詢類型,再決定執行路徑,節省成本又提升準確度。

ai guide RAG 技法大全

RAG A/B 測試:怎麼科學地比較兩個 Pipeline 配置

「加了 Cross-Encoder 之後感覺好多了」不是科學的評估。A/B 測試讓你知道改動是否真的有效,效果多大,在哪類查詢上有效。

ai guide RAG 技法大全

RAG 冷啟動:沒有資料時怎麼讓系統能用

RAG 系統需要資料才能回答問題,但一開始就沒有資料。冷啟動策略決定了系統從空到可用的路徑。

ai guide RAG 技法大全

RAG 成本優化:把每次查詢的花費壓到最低

RAG 系統的成本來自 LLM token、Embedding API、向量搜尋。每個環節都有可以壓成本的地方,但要確認優化沒有犧牲太多品質。

ai guide RAG 技法大全

RAG 評估框架與工具選型:Promptfoo、RAGAS、DeepEval、TruLens

RAG 評估沒有指定工具的業界標準;先把 retrieval、generation、operation 分開量,再依技術棧選 Promptfoo、RAGAS、DeepEval 或 TruLens。

ai debug RAG 技法大全

RAG 常見失敗模式:10 種問題和對應的解法

RAG 系統出問題,90% 的情況是這 10 種之一。先識別是哪種失敗模式,再找對應的解法,比盲目優化有效很多。

ai guide RAG 技法大全

RAG Guardrails:在輸入和輸出加一道防線

RAG 系統面對的攻擊不只是技術層面的,Prompt Injection 和 Jailbreak 是真實威脅。輸入輸出都需要獨立的防護層。

ai guide RAG 技法大全

RAG 可觀測性工具全景:2026 年的選擇

自己寫 trace 夠用,但開源工具讓你少做很多事。Langfuse、Phoenix、LangSmith 各有定位,選哪個取決於你對自架、開源、整合複雜度的取捨。

ai guide RAG 技法大全

RAG Observability:讓黑盒子變透明的逐節點追蹤

RAG 系統最難的不是建起來,是搞清楚為什麼這次回答不好。Pipeline Tracing 把每個步驟的決策和數據記下來,讓除錯有跡可循。

ai guide RAG 技法大全

RAG Prompt Engineering:System Prompt 和 Context 怎麼設計

搜尋找到了正確的文件,但 LLM 的回答還是不好——很多時候問題在 Prompt 設計。System prompt 結構、context 排版、指令語言都會影響輸出品質。

ai guide RAG 技法大全

RAG Streaming:SSE 讓 LLM 回答邊生成邊顯示

LLM 生成需要 3-5 秒,等全部生成完再顯示體驗很差。SSE 讓 token 一邊生成一邊推送,首個字元出現時間從 5 秒縮到 1 秒以內。

ai guide RAG 技法大全

RAG 配額系統:用雙重限制控制 LLM 成本

只限制請求次數不夠,一個超長的查詢可能消耗掉十個普通查詢的 token。雙重配額(請求數 + token 數)才能真正控制成本。

ai deep-dive RAG 技法大全

RAG vs Fine-tuning:不是非此即彼

RAG 和 Fine-tuning 解決的是不同問題。RAG 給模型新知識,Fine-tuning 改變模型的行為風格。大多數情況是兩者都用,而不是選一個。

ai guide RAG 技法大全

RRF:RAG 系統裡多路結果怎麼合併

BM25、向量搜尋、HyDE、Multi-Query 各出一份結果,怎麼合理地合成一份?RRF 用名次而不用分數,規避了跨系統分數無法比較的根本問題。

ai guide RAG 技法大全

Self-Reflection + LLM-as-Judge:讓 AI 評估自己的回答

用另一個 LLM 評估回答的準確度和品質,分數太低就重新生成,並自動加上適當的免責聲明。

ai guide RAG 技法大全

Semantic Caching:語義相近的問題只跑一次 RAG

快取不只能比對完全一樣的查詢,語義相近的問題也能命中快取,省下整個 RAG pipeline 的執行。

ai guide RAG 技法大全

SPLADE:比 BM25 更聰明的稀疏向量搜尋

BM25 只認識查詢裡出現的詞,SPLADE 能推斷相關詞彙並加入搜尋,在保持關鍵字搜尋精確性的同時獲得部分語義能力。

ai guide RAG 技法大全

Text-to-SQL Router:精確查詢不走 RAG

「我今年完攀幾條」這種問題,RAG 語義搜尋永遠不如直接查資料庫。讓 LLM 識別意圖、提取參數,執行預定義 SQL 模板。

ai guide RAG 技法大全

Vector Database 選型:Pinecone、Weaviate、Qdrant、Vectorize 怎麼選

向量資料庫的選型比 LLM 選型更受部署平台限制。先確認平台和規模需求,再看功能特性,不要只看 benchmark。

education guide

你的學習為什麼半途而廢?島島阿學想解決這件事

自主學習失敗的核心不是動機,是缺乏共學環境。島島阿學透過主題實踐、靈感動態、共同挑戰和學習夥伴連結,把「想學」變成「持續在學」,並把成長歷程資產化為能力證明。

product project

線上學習的下一個戰場:為什麼「完課率」才是真正的問題

MOOC 完課率只有 5–15%,問題不在課程品質,在執行斷層。島島阿學定位為「學習作業系統」,透過實踐承諾、社群互動與 AI 推薦,讓學習可見且可持續。

product project

從「想學」到「真的在學」:島島阿學的產品設計思維

島島阿學不是內容平台,而是學習連接器。用反完美主義設計、社群共學、零決策推薦,幫學習者跨越執行鴻溝——從模糊想法到可行動計畫。

攀岩社群為什麼需要 AI?NobodyClimb 的實驗與學到的事

NobodyClimb 用 RAG 解決攀岩路線資訊分散的問題,配額制度與社群參與度綁定,Cloudflare Workers AI 讓推論成本趨近於零。

NobodyClimb:為什麼攀岩社群需要自己的平台

攀岩社群不缺分享的意願,缺的是一個能串連和延續文化的地方。

Cloudflare Workers 綁定自訂網域的正確寫法

wrangler.jsonc 的 routes 用 custom_domain: true,pattern 只填 hostname,不加 /*

tech deep-dive

島島(DaoDao)技術架構全覽:Monorepo、多語言後端與 AI 推薦系統

Next.js + Expo 前端、Node.js + Python 雙後端、PostgreSQL + Redis 核心架構,加上社交通知系統與 LLM 推薦引擎,島島如何用現代tech stack打造學習社群平台。

NobodyClimb:用 Cloudflare 全端打造攀岩社群平台

一個攀岩社群平台,從 Web、Mobile 到 AI 問答全部跑在 Cloudflare 上,沒有獨立伺服器。

NobodyClimb AI 架構:在 Cloudflare Workers 上打造 20 節點 RAG Pipeline

用 Cloudflare Workers AI(gemma-3-12b-it + bge-m3)打造可動態組裝的 RAG pipeline,14 個基礎 step + 6 個 LangGraph 專屬節點,三種策略圖(Baseline / Agentic / Plan-Execute)動態切換。

tech guide

Astro 部落格換模板前要知道的事

換模板 = 換整個專案底層;先搞清楚自己要什麼,再選 AstroPaper / Cactus / AstroWind