Paper reading 面試環節考的不是背論文結論,而是能不能在 15-20 分鐘內講清楚一篇陌生論文的問題定義、方法核心與限制,並提出有意義的追問。今天精讀的論文提出 invalidation contracts:讓 LLM agent 快取的錯誤修復建議帶上版本戳記與可快取性提示,伺服端資料一旦飄移就能精準逐筆(row-level)讓快取失效,而不必整批作廢或每次都重新推導。論文最核心的洞察是把「快取有沒有省到錢」拆成兩個獨立變數——validity(快取內容還對不對,只跟協議設計有關)與 compliance(規劃模型願不願意採用這個修復建議,因模型而異,同一份資料在 Claude Haiku 4.5 上有 100% 的第一次遵循率,在 Claude Sonnet 5 上卻可能低於 11%)。這個拆解框架本身就是很好的面試素材:它示範了怎麼把一個含糊的效能問題,拆成可以分別度量、分別歸因的兩個因子。
Technical PM 面試不是要你會設計系統,是要你能跟工程師用同一套語言討論取捨。今天用 RFC 流程(Draft-Review-Decision-Implementation)練『怎麼收斂技術討論的範圍』,用 Architecture Decision Record(Context-Decision-Consequences-Alternatives)練『怎麼把一個技術取捨寫清楚、留下可追溯的紀錄』,練一道 Exponent 收錄的 Stripe 技術輪真實題:設計一個 Ledger Service。
ML coding 面試考的不是背 LeetCode 樣板,而是能不能用 NumPy 徒手寫出 building blocks(linear、residual、layer norm、causal self-attention)並且看得懂別人的訓練/推論迴圈在哪裡壞掉。今天聚焦四個概念:coding 面試的真正考點是徒手實作能力而不是背答案;BPE tokenizer 的核心是「頻率統計 → 迭代合併 → 用同樣的合併順序 encode」,順序錯了 encode 就會跟 decode 對不上;batch inference 的吞吐量/延遲取捨要處理不同長度序列的 padding 與浪費運算;NumPy 向量化的判斷依據是「這段迴圈裡有沒有跨元素依賴」。練習題是 Glean 技術篩選常出的題目:實作一個 BPE tokenizer,走一遍從訓練到 encode/decode 的完整思路。
Growth 面試最容易漏掉的不是成長點子,是忘記雙邊市場(Guest/Host)要同時成長才叫成長。今天用 HubSpot 的 Growth Flywheel(Attract-Engage-Delight)拆解成長的複利結構,再用 Nir Eyal 的 Hook Model(Trigger-Action-Reward-Investment)設計讓使用者「不用被推、自己想回來」的習慣迴圈,練一道 Exponent 收錄的 2026 年真實 Airbnb 面試題:How would you 3x Airbnb's growth?
LLM & Agent Engineering 面試考的重點不是『你會不會串 LangChain』,而是你能不能把一個模糊的『系統壞掉了』拆成可診斷的子問題。今天聚焦四個高頻概念:RAG 的『retrieval 對、答案卻錯』要拆成 retrieval 和 generation 兩段分開評估;agent context window 變大不能解決品質下降,因為問題是 context pollution(雜訊稀釋注意力)不是 token 數不夠;RAG 跟 fine-tuning 的選擇邏輯是『RAG 管知識、fine-tuning 管行為』;LLM-as-judge 有一致性偏誤與自我偏好偏誤,不能單獨當唯一指標。練習題是一道很常見的企業面試情境題:『retrieval 90% 準、答案只有 60% 準,怎麼診斷』,走一遍把模糊症狀拆成可驗證假設的完整思路。
AI 產品題最容易垮的地方不是講不出願景,是講不出「這個模型會怎麼壞掉、壞掉時使用者會怎麼樣」。Meta 今年把 PM 面試五年來首次改版,新增一輪「Product Sense with AI」,要求候選人跟 AI 一起即時解題,考的正是這件事。今天用前 Google/Meta AI PM Marily Nika 提出的「地圖失敗模式→定義最小可行品質(MVQ)→設計 Guardrail」框架,拆一道真實案例:一個 Slack 摘要助理把還沒拍板的討論當成決策,還幫沒答應的人指派了 owner。案例則看 GitHub Copilot 怎麼用 Ghost Text 讓「忽略建議」的成本趨近於零,讓使用者在數百次互動裡自然校準出該信任哪些建議。
ML System Design 面試考的不是你會不會畫架構圖,而是你能不能把每一層的取捨講清楚。今天聚焦四個高頻考點:feature store 如何保證 training/serving 一致性、部署策略要怎麼分層選擇並設計 rollback 觸發條件、監控要拆成 system/data/model 三層並用 PSI/KS test 抓 drift,以及線上推論的 latency 預算怎麼分配。練習題是「設計一個電商即時推薦服務」,走一遍從釐清需求、估算流量、到 feature store 與部署策略的完整設計。
策略題最容易垮的地方不是分析不出市場多大,是分不清「這個市場值得進」跟「我們有能力打贏」是兩件事。Exponent 最新版 Google Product Strategy 面試指南收錄了一道經典市場進入題:Google 該不該做線上家具零售。今天用五力分析加 TAM-SAM-SOM 拆這題,案例是 Zoom 在 Cisco WebEx、Skype 都已經卡位的飽和市場裡,靠「摩擦力最低」而不是「功能最多」硬生生打出一條路——策略題最後拚的往往不是市場大小,是你有沒有一個對手複製不了的優勢。
Deep Learning & NLP 面試考的不是你會不會畫 transformer 架構圖,而是你懂不懂每個設計決策背後在犧牲什麼。今天聚焦四個高頻考點:self-attention 的計算與 KV cache 的作用、tokenization 的 vocab size 取捨、『embedding 是向量空間契約、維度相同不代表相容』這個資深候選人才會講的細節,以及 fine-tuning 跟 prompting 該怎麼選、catastrophic forgetting 怎麼防。練習題則是 Scale AI 的『設計 embedding 生成與分類 API』,走一遍版本相容性、部分失敗與多租戶隔離的完整設計。
Metrics 題最容易垮的地方不是選不出指標,是說不出「這個指標為什麼能代表使用者價值」,以及分不清相關與因果。Exponent 最新彙整的 2026 真題庫裡有一道 Meta 風格的執行題:留言數上升但觀看時長下降,怎麼辦。今天用指標樹拆解這題,案例是 Facebook 著名的「7 天內加 7 位好友」北極星指標——它幫 Facebook 找到成長槓桿,也一度讓整個矽谷把相關性誤當因果,是講「怎麼驗證指標背後因果關係」的最佳素材。
ML fundamentals 面試考的是能不能在拿到一個『指標很漂亮但線上出包』的落差時,講出正確的診斷路徑。今天聚焦四個高頻考點:AUC-ROC 在極度不平衡資料下為什麼會虛高、PR-AUC 才是該看的曲線、分類為什麼要用 cross-entropy 而不是 MSE(牽涉梯度消失)、bagging 和 boosting 分別修正 variance 還是 bias,以及多重共線性只毀可解釋性不毀預測準確度的常見誤解。
Product Sense 題最容易垮的地方不是想不出功能,是想到功能後說不出「為什麼是這個」。Exponent 最新彙整的 2026 真實面試題庫裡,一位 Adobe 候選人被問到『幫 LinkedIn 設計一個功能』,強答案的共同點是先鎖定一個使用者分群、再往下拆到具體痛點,而不是一次列十個構想。今天用 CIRCLES 框架加一層根因拆解,練這道題,案例是 Airbnb 早期用「幫房東拍專業照片」這個不規模化的動作解決轉換率問題。
行為面試考的不是你有沒有故事,而是你能不能在 90 秒內把一個技術事件講成『情境明確、行動具體、結果可量化』的敘事。今天用『上線模型效果驟降,你怎麼在跨團隊壓力下把它修好』這個 AI Engineer 最常被問到的情境,走一輪完整 STAR,並回顧本週 ML Fundamentals 到 Paper Reading 五個主題練了什麼。
Behavioral 面試考的不是你有沒有精彩的故事,是委員會聽完能不能回答『這個人會不會隨時間變得更好』。今天用 STAR-R 框架(Situation-Task-Action-Result-Reflection)練一道 influencing without authority 的情境題,案例是一場 Amazon L5 PM debrief 的真實紀錄——候選人因為說不清楚怎麼處理跨部門抵抗,被委員會爭論 18 分鐘後刷掉。文末附本週七天回顧與下週預習方向。