Skip to content
所有標籤

#machine-learning

127 篇文章

AI Engineer 面試日練 — 2026-08-31:ML Fundamentals

ML fundamentals 面試考的是能不能在拿到一個『指標很漂亮但線上出包』的落差時,講出正確的診斷路徑。今天聚焦四個高頻考點:AUC-ROC 在極度不平衡資料下為什麼會虛高、PR-AUC 才是該看的曲線、分類為什麼要用 cross-entropy 而不是 MSE(牽涉梯度消失)、bagging 和 boosting 分別修正 variance 還是 bias,以及多重共線性只毀可解釋性不毀預測準確度的常見誤解。

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 4:Learning——監督式學習、k-NN、SVM、強化學習 Q-learning 與 Nim

Week 4 進入機器學習:監督式分類(k-NN、SVM、Perceptron)、模型評估、強化學習基礎(MDP、Q-learning、ε-greedy),專案 Shopping 預測購買意願、Nim 學會玩遊戲。

A/B testing 怎麼把產品改動變成可推論的效果?

A/B testing 怎麼把產品改動變成可推論的效果? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

多組平均不能一直 t-test:ANOVA 在保護什麼?

ANOVA 先檢查三組以上平均是否有整體差異,避免你用一堆兩兩 t 檢定把 false positive 風險一路放大。

大樣本近似為什麼常能用,又什麼時候不能亂用?

大樣本近似為什麼常能用,又什麼時候不能亂用? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Bayesian inference 怎麼把 prior、資料與 posterior 串起來?

Bayesian inference 怎麼把 prior、資料與 posterior 串起來? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

點估計的 bias、variance、consistency 各在檢查什麼?

bias 看估計中心有沒有歪,variance 看抽樣波動,MSE 合併兩者,consistency 則問樣本變大時估計量會不會靠近真值。

不知道公式分布時,bootstrap 怎麼用重抽樣估不確定性?

不知道公式分布時,bootstrap 怎麼用重抽樣估不確定性? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

因果推論入門:為什麼預測準不代表真的有效?

因果推論入門:為什麼預測準不代表真的有效? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

卡方題怎麼判斷是在考適合度還是獨立性?

卡方檢定處理類別資料的次數差異;先分清楚一個變數對理論比例的適合度,還是兩個類別變數之間的獨立性。

Bernoulli、Binomial、Normal、Poisson 什麼時候該出場?

分布不是公式清單,而是資料生成情境的名字。這篇用 Bernoulli、Binomial、Normal、Poisson 說明如何從題目敘述選分布。

信賴區間怎麼寫,才不是只背上下界公式?

信賴區間把點估計放回抽樣波動裡看;會寫上下界只是第一步,真正要會的是解釋標準誤、臨界值與 coverage。

看到一份資料,第一眼要先看哪些統計量?

資料型態決定你能用什麼統計工具。這篇從類別、數值、計數與時間資料開始,說明平均數、比例、變異數、列聯表在考題和 ML 資料檢查中的用途。

Delta method 怎麼估 F1、ratio 這類非線性指標的不確定性?

Delta method 怎麼估 F1、ratio 這類非線性指標的不確定性? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

好估計量怎麼判斷:不偏、變異、MSE 要看哪個?

估計量是用樣本推母體的計算規則;判斷它好不好,要一起看 bias、variance 與 MSE。

混合題來了,要怎麼在 30 秒內判斷工具?

考前最後階段要練的是題型辨識:先判斷資料型態、未知量與決策目標,再選公式,最後用語境結論收束。

期望值和變異數在考題與模型評估中各代表什麼?

期望值描述長期平均,變異數描述波動大小。這篇用離散分布算例說明 E[X]、E[X^2]、Var(X),並接到平均 loss 和模型穩定度。

實驗設計怎麼讓結果可以被解讀,而不是只像相關?

實驗設計怎麼讓結果可以被解讀,而不是只像相關? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Fisher information 怎麼告訴你參數估得穩不穩?

Fisher information 用 likelihood 的曲率衡量資料對參數的定位能力;資訊越大,MLE 的標準誤通常越小。

信賴區間不只 t 表:一般建構到底怎麼想?

信賴區間不只 t 表:一般建構到底怎麼想? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

GLM 怎麼依資料型態選分布和 link function?

GLM 怎麼依資料型態選分布和 link function? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

假設檢定從 H0 到 p 值,到底要做哪個決策?

假設檢定是一套在不確定資料中做決策的流程:先寫 H0/H1,再用檢定統計量與 p 值判斷資料是否足夠反駁原假設。

估計、檢定、likelihood、Bayes 要怎麼放在同一張推論地圖?

估計、檢定、likelihood、Bayes 要怎麼放在同一張推論地圖? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Likelihood ratio test 怎麼比較兩個巢狀模型?

LRT 比較受限模型和完整模型的 log likelihood 差;只有在 nested model 與近似條件成立時,常見卡方參考分布才有意義。

OLS 的假設壞掉時,迴歸線還能怎麼用?

OLS 的假設壞掉時,迴歸線還能怎麼用? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

分類模型為什麼要先學 log odds?

logistic regression 把線性分數接到 0 到 1 的機率;讀懂 odds、log odds、odds ratio,才不會把分類模型係數解釋錯。

Logistic regression 怎麼從機率走到 threshold 和錯誤成本?

Logistic regression 怎麼從機率走到 threshold 和錯誤成本? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

MAP 為什麼會把先驗變成 regularization?

MAP 為什麼會把先驗變成 regularization? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Matching 和 weighting 怎麼讓觀察資料比較像實驗?

Matching 和 weighting 怎麼讓觀察資料比較像實驗? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

MLE 為什麼是在問:哪個參數最可能生成這批資料?

MLE 把資料固定、比較不同參數讓這批資料出現的合理程度;log likelihood 讓乘積變加總,也接上 ML 的 negative log loss。

Method of Moments 為什麼是用樣本矩對母體矩?

Method of Moments 用樣本矩對上理論母體矩,再解出參數;它不一定最有效率,但很適合建立參數估計的第一個直覺。

缺資料不只是空格:它會怎麼扭曲統計和模型?

缺資料不只是空格:它會怎麼扭曲統計和模型? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

ML/AI 評估報告怎麼寫,才不只是貼排行榜分數?

ML/AI 評估報告怎麼寫,才不只是貼排行榜分數? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

殘差、outlier、leverage 在告訴你模型哪裡壞了?

殘差、outlier、leverage 在告訴你模型哪裡壞了? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

多變量分析怎麼整理一起變動的特徵?

多變量分析怎麼整理一起變動的特徵? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

Neyman-Pearson 觀點在說哪一種最佳檢定?

Neyman-Pearson 把檢定看成決策規則:在固定第一型錯誤 alpha 下,選出 power 最高的拒絕區域。

Nonparametric methods 少做哪些分布假設?彈性又要付出什麼代價?

Nonparametric methods 少做哪些分布假設?彈性又要付出什麼代價? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

台大資管 114–115 統計考古題要怎麼拆,不要只背答案?

考古題的價值是訓練拆題紀律,不是用兩年題型猜完整範圍;每題都要回到資料型態、未知量、工具、計算與語境結論。

聯合分布和 PMF 轉換題,怎麼不漏格?

聯合 PMF 題要把所有格子列完;邊際化、條件機率和變數轉換,本質上都是對原始格子的加總與重新分組。

條件機率、獨立、貝氏:考題到底在換哪個視角?

機率題的難點常在視角,不在公式。這篇用事件、條件機率、獨立與 Bayes rule,說明考題如何從原因到結果、再從結果反推原因。

樣本、統計量、抽樣分布三者怎麼分清楚?

樣本是資料,統計量是樣本的函數,抽樣分布是統計量在重複抽樣下的分布;這三者分清楚,推論公式才會有意義。

PMF、PDF、CDF 怎麼把機率變成可計算的題目?

隨機變數把事件結果轉成數字。這篇用 PMF、PDF、CDF 說明離散與連續機率怎麼計算,並接到模型分數、threshold 和 token 機率分布。

迴歸表的 coef、SE、t、F、R2 要怎麼一起讀?

迴歸表不是 p 值清單;coef、SE、t、F、R2 分別回答效果大小、不確定性、單一係數、整體模型與樣本內解釋力。

Ridge、Lasso、weight decay 為什麼能讓模型穩一點?

Ridge、Lasso、weight decay 為什麼能讓模型穩一點? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計與 ML 評估怎麼做才重跑得出同一個結論?

統計與 ML 評估怎麼做才重跑得出同一個結論? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

為什麼只看樣本,也能推回母體或模型表現?

抽樣讓樣本統計量有波動,標準誤描述這個波動。這篇分清楚 SD、SE、抽樣分布與 CLT,並接到 benchmark 分數的不確定性。

抽樣分配怎麼從公式變成考試可用的判斷?

抽樣分配描述統計量在重複抽樣下的波動;平均、比例、變異數各有常用分布,信賴區間和檢定都從這裡長出來。

讀完 53 篇後,怎麼把統計接到 ML、因果與數理統計?

讀完 53 篇後,怎麼把統計接到 ML、因果與數理統計? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

一條迴歸線怎麼變成預測、解釋與誤差?

簡單線性迴歸用一個 X 描述 Y 的平均變化;斜率、截距、殘差和平方誤差共同構成最小的 supervised learning 模型。

Monte Carlo 怎麼用重複模擬回答算不動的統計問題?

Monte Carlo 怎麼用重複模擬回答算不動的統計問題? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計學從哪裡開始讀,才接得上考試和 ML/AI?

準備統計學不要從背公式開始。這篇先建立讀書順序:資料、機率、抽樣、推論、迴歸,再接到模型評估、A/B testing 與 ML/AI 的不確定性判斷。

時間序列為什麼不能隨機切資料?

時間序列為什麼不能隨機切資料? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

兩組平均或比例差異,該用哪一種比較題型?

兩組比較要先判斷 outcome 是數值還是比例、兩組資料是否獨立;這一步會決定標準誤、檢定統計量與結論可信度。

變數選擇怎麼避免把訓練資料背起來?

變數選擇怎麼避免把訓練資料背起來? 這篇會從考試題型、核心直覺、手算例子一路接到 ML/AI 的實際工作流。

統計學不是背公式:它到底在替你判斷什麼?

統計學的核心不是公式,而是判斷:描述資料、估計未知量、比較差異、檢查關聯,最後在不確定性下做決策。

tech deep-dive

GPUtw.ai 是什麼:台灣在地 GPU 雲端、短租算力與研究者工作流

GPUtw.ai 是台灣在地的短租 GPU 雲端,核心不是最大規模的算力,而是台灣機房、預付點數、Jupyter/ComfyUI/Ollama/vLLM 範本、Vault 與團隊帳務。公開資料足夠做服務介紹,還不足以當正式採購或 production 背書。

Harvard CS181 HW0:開學前先做這 4 題,卡哪題就先補哪裡

HW0 用四題檢查 CS181 的先修:矩陣 y=Xw 的可解條件、目標函數的微分與優化、機率推理,以及用 Python 實作 OLS。做不順的地方就是開學後要優先補的缺口。

Harvard CS181 HW1:冰芯溫度迴歸— 先掌握線性、核、神經網路三條路徑

HW1 以 800k 年冰芯溫度資料做線性迴歸、核迴歸與簡易神經網路,先掌握三種模型的訓練與驗證方法,為接下來的分類與深度學習鋪路。

Harvard CS181 Machine Learning 導讀總覽:2026 七份作業怎麼跟?四年版本一次看懂

CS181 2026 以 hw0–6 七份作業為週節拍、無當期錄影但 A3 可自學;2025 多 practical、2024 雙期中、2023 單授 Weiwei Pan。看懂四年沿革後,從 HW0 體檢先修再逐週跟最穩。

Ahead of AI:一位學者用月更深度文做到 20 萬訂閱的反直覺路線

計算生物學博士、前威斯康辛大學統計系教授 Sebastian Raschka,2022 年在 Substack 創辦 Ahead of AI,用月更長文拆解 LLM 論文與架構,四年做到 20 萬+訂閱。他刻意不接贊助、不追日更,靠書籍和付費訂閱變現,證明低頻高深度在 AI 電子報紅海裡也能走出一條路。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:機器學習篇

2021 年是 diffusion model 超越 GAN、自監督學習理論突破、RL 評估方法論覺醒的一年。NeurIPS 收了 9,122 篇投稿創當時紀錄,ICLR 的 Score-Based Generative Modeling 論文日後成為整個 diffusion 生態的理論基石,ICML 則在優化理論與自監督學習動力學分析上交出紮實貢獻。

ai deep-dive AI 頂會導讀

2022 AI 頂會導讀:機器學習篇

2022 年是 diffusion model 登上頂會舞台中央、Chinchilla scaling laws 改寫大模型訓練範式、Chain-of-Thought 讓推理成為可提示能力的一年。NeurIPS 破萬篇投稿,13 篇 Outstanding Paper 裡有 3 篇跟 diffusion 直接相關,Chinchilla 和 data pruning 兩篇挑戰了『大就是好』的信條。ChatGPT 年底發佈前夜,所有拼圖都在這一年的頂會上各就各位。

ai deep-dive AI 頂會導讀

2023 AI 頂會導讀:機器學習篇

2023 年是 LLM 全面接管 ML 頂會的一年。NeurIPS 投稿破 12,000 篇,兩篇 Outstanding Paper 都直接針對大模型(隱私審計與湧現能力質疑),Runner-Up 的 DPO 在短短兩年內成為 RLHF 的實質替代標準。ICLR 的 DreamFusion 開啟了 text-to-3D 賽道,ICML 則把 LLM 水印和學習率自適應推上舞台。Mamba 以 arXiv 預印本之姿在 NeurIPS 現場引爆討論,預示 Transformer 的第一個真正挑戰者即將到來。

ai deep-dive AI 頂會導讀

2024 AI 頂會導讀:機器學習篇

2024 年是 ML 頂會投稿量爆炸的一年:NeurIPS 收到 15,671 篇創歷史紀錄,ICML 和 ICLR 也分別突破九千和七千。研究主題從「把模型練更大」轉向「推論時怎麼花算力更聰明」——test-time compute scaling 成為年度最重要的新方向。Best Paper 層面,VAR 用 next-scale prediction 在影像生成上超越 diffusion、Rectified Flow 成為 Stable Diffusion 3 的理論基礎、ICLR 首次頒發 Test of Time Award 給 VAE 原論文。

ai deep-dive AI 頂會導讀

2025 AI 頂會導讀:機器學習篇

2025 年是 ML 頂會投稿量全面破紀錄、審稿系統承壓到極限的一年。NeurIPS 收了 21,575 篇投稿動用超過兩萬名審稿人,ICML 首度突破 12,000 篇,ICLR 也衝上 11,565 篇。研究主題上,reasoning 與 agent 成為最強勢的兩股潮流——NeurIPS Best Paper 之一直接質疑 RLVR 是否真的帶來新推理能力,拿下該屆唯一滿分;而 attention 機制的結構性改進(Alibaba Qwen 的 Gated Attention)和 neural scaling laws 的理論解釋同時獲獎,標誌著社群正從「衝規模」轉向「理解為什麼有效」。

AI Engineer 面試日練 — 2026-08-24:ML Fundamentals

ML fundamentals 面試考的不是背定義,而是拿到一個 train/val 落差時能不能走出一套診斷流程。今天聚焦四個高頻考點:bias-variance decomposition 與 learning curve 判讀、L1/L2 正則化的幾何直覺與選擇邏輯、loss function 要對齊商業目標而非預設值,以及 AdamW 為什麼把 weight decay 和 L2 正則化拆開處理。

CMU 07-280 全課總結:學會什麼、缺什麼,以及下一門怎麼選

完成 07-280 不等於看完 24 篇導讀;至少要留下搜尋器、監督式模型、CNN/GPT-2 實驗與一個 RL+MCTS 小系統,再依缺口選 07-380、10-301 或專題課。

CMU 07-280 完整課程導讀:搜尋、GPT-2、AlphaZero 為什麼在同一門課?

07-280 是 CMU Spring 2026 首開的 AI+ML 核心:24 講、12 個作業編號,從 heuristic search、CSP 與機器學習一路做到 AlexNet、GPT-2、AlphaZero。教材足以自學,但沒有完整公開錄影、Canvas checkpoint 或 Gradescope 回饋。

CMU 07-280 Lecture 1 導讀:AI、機器學習與表示學習的共同問題

Lecture 1 用 alien autoencoder、AI/ML 範圍與 AI 發展史建立全課座標:智慧系統不是模型清單,而是在不確定下把輸入表示成可計算決策。

CMU 07-280 Lecture 5 導讀:用 Loss、Risk 與 ERM 定義機器學習

Lecture 5 把機器學習寫成 `X → Y`、loss、risk 與 empirical risk minimization:訓練集只能提供平均已知損失,真正目標仍是未知分布上的 generalization。

CMU 07-280 Lecture 6 導讀:Decision Trees 如何用 Mutual Information 分裂資料

Lecture 6 從 decision stump 遞迴建樹,用 entropy 衡量 label uncertainty,再以 `I(Y;W)=H(Y)-H(Y|W)`選擇分裂;這是計算可行的 greedy ERM,不是全域最佳樹保證。

CMU 07-280 Lecture 7 導讀:Linear Regression 與 Normal Equation

Lecture 7 把 ERM 套到 linear functions 與 squared loss,從一維 slope 推到矩陣形式 `argmin ||y-Xθ||²`,再在 `XᵀX` 可逆時得到 normal equation。

CMU 07-280 Lecture 8 導讀:Gradient Descent、SGD 與 Learning Rate

Lecture 8 從一維 parabola 推到 vector gradient,再比較 batch GD、SGD 與 mini-batch;learning rate 決定更新是收斂、震盪或發散。

CMU 07-280 Lecture 9:Logistic Regression 如何把分類改寫成機率估計

Lecture 9 不直接預測 0 或 1,而以 sigmoid 建模 P(y=1|x),再用 cross-entropy 與凸最佳化學出參數;多類別版本自然延伸成 softmax regression。

CMU 07-280 Lecture 10:Feature Engineering 與 Regularization 如何交換表達力和穩定性

Lecture 10 先用 φ(x) 讓線性模型表達非線性,再以 train/validation/test 分工、L1/L2 regularization 與 model selection 限制新增自由度造成的過度擬合。

CMU 07-280 Lecture 11:從 Logistic Regression 組出第一個 Neural Network

Lecture 11 把單一 logistic neuron 擴成多層網路:linear layer 產生 z、activation 產生 a,多個 neuron 共同學出 feature transform,再以 loss 和 gradient descent 訓練權重。

CMU 07-280 Lecture 12:Backpropagation 如何重用 Chain Rule

Lecture 12 把神經網路視為 computation graph:forward pass 保存中間量,backward pass 從 loss 開始傳遞 upstream gradient,並用線性層、activation 與 softmax 的局部規則一次算出全部參數梯度。

CMU 07-280 Lecture 16:Maximum Likelihood 如何統一 Logistic 與 Linear Regression

Lecture 16 從 likelihood p(D|θ) 出發,以 i.i.d. 將聯合機率寫成乘積,再用 log 變成和;Bernoulli MLE 得到樣本比例,conditional Bernoulli 得到 logistic cross-entropy,Gaussian noise 則得到 squared error。

CMU 07-280 階段複習一:從搜尋問題走到監督式學習

第一階段把 Lectures 1–12 串成同一條決策鏈:先定義狀態、動作與目標,再用 heuristic、loss、regularization 與 backpropagation 控制龐大搜尋空間。

ai deep-dive

DSPy:用 Signature、Metric 與 Optimizer 編譯 AI 程式

DSPy 不把 prompt 當手寫字串,而以 Signature 宣告任務、Module 決定執行策略,再用資料集與 metric 讓 Optimizer 編譯出較好的提示與示例。

ai deep-dive

Hugging Face 不只是模型下載站:Hub、Datasets、Spaces 與 Inference 怎麼分

Hugging Face Hub 是以版本化 repository 串起模型、資料集與應用程式的協作層;Datasets 管資料,Spaces 跑展示程式,Inference Providers 與 Endpoints 才負責代管推論。

線性迴歸:從 LMS 到局部加權迴歸

線性迴歸不只是一條最佳直線;第一章用平方損失串起梯度下降、常態方程、最大概似估計與局部加權迴歸。

分類與邏輯斯迴歸:從決策邊界到 Newton 法

第二章從 sigmoid 機率模型推導邏輯斯損失,再比較感知器、多類別 softmax 與 Newton 法。

廣義線性模型:用指數族統一迴歸與分類

第三章用指數族、自然參數與連結函數,把最小平方法和邏輯斯迴歸放進同一套建模模板。

生成式學習演算法:GDA、Naive Bayes 與平滑

第四章改從 p(x|y) 與 p(y) 建模,用 GDA、Naive Bayes 和 Laplace 平滑展示生成式分類的力量與代價。

核方法:不顯式展開特徵的非線性學習

第五章把高維特徵的內積改寫成 kernel,讓依賴內積的線性演算法在不顯式建立特徵的情況下學非線性。

支援向量機:間隔、對偶與 SMO

第六章把分類信心形式化為幾何間隔,再用拉格朗日對偶、kernel 與 SMO 建出可實作的 SVM。

深度學習:模組、反向傳播與向量化

第七章把神經網路拆成可組合模組,並用反向傳播與向量化說明深度模型如何有效率地訓練。

泛化:偏差變異、雙降與樣本複雜度

第 8 章把測試誤差拆成不可避免雜訊、偏差平方與變異,再用 uniform convergence 與 VC dimension 說明模型何時能從訓練資料泛化;雙降則提醒我們,參數數量不是萬用的複雜度尺度。

正規化與模型選擇:顯式、隱式與交叉驗證

第 9 章把泛化控制拆成三條路:在損失中顯式懲罰複雜度、利用最佳化器偏好的隱式正規化,以及用未參與訓練的資料選模型;MAP 則說明高斯先驗如何對應 L2 懲罰。

分群與 k-means:交替最佳化的第一個範例

第 10 章用 k-means 建立非監督式學習的第一個完整演算法:交替更新會讓 distortion 單調不增並在數值上收斂,但不保證得到全域最佳解。

EM 演算法:從高斯混合到 VAE

第 11 章從高斯混合模型的軟指派出發,用 Jensen inequality 建立 ELBO,將 EM 解釋為對變分分布與模型參數的交替最大化,再以近似後驗與 reparameterization trick 延伸到 VAE。

主成分分析:投影、重建與降維

第 12 章把 PCA 寫成一個幾何最佳化問題:在單位方向上最大化投影變異,解就是共變異矩陣的主特徵向量;取前 k 個特徵向量,同時得到保留最大變異與最小線性重建誤差的低維表示。

獨立成分分析:從混合訊號恢復獨立來源

第 13 章把 ICA 建模為 x=As:觀測是未知線性混合,目標是估計 W=A^{-1} 恢復獨立且非高斯的來源。變數變換的 Jacobian determinant 進入 likelihood,導出 Bell–Sejnowski 的梯度更新。

擴散模型:正向加噪、反向生成與 ELBO

第 14 章從固定的高斯加噪 Markov chain 出發,學習逐步反轉每個 transition;ELBO 把 reverse-kernel matching 化成加權雜訊預測,連續時間觀點則用 score ∇log p_t 解釋反向漂移。

CS188 決策與機器學習:從 VPI、Naive Bayes 到 Attention

Lecture 19–25 把 rational decisions、VPI 與 ML 接起來,Project 5 再用 PyTorch 實作 regression、分類、CNN、attention 與 optional character-GPT。

Berkeley CS189 Spring 2025 總覽:用 HW1–7 與 code/data 走完的機器學習,用 Fall 2026 看下一學期

CS189 Spring 2025 公開完整 notes、影片、HW1–7 與 code/data,是目前唯一 A3 自學版;Fall 2026(eecs189.org/fa26)已上線 27 講行事曆但多數教材尚未開放,輪替站舊檔有 404 風險,本文以 Spring 2025 為主、Fall 2026 為對照。

CMU 07-380 Fall 2026 總覽:首開 26 講從邏輯與規劃到擴散模型,HW 與 Project 尚未全開放

07-380 Fall 2026 是 CMU AI 新制第二門首開,26 講涵蓋邏輯、規劃、優化、機率圖、生成式與系統,Lec01 與 Prop Logic 已公開;HW1-7、Quiz×6 與 Final Project 多數尚未釋出,本文以 A2→A3 過渡版對照 07-280 的銜接與校外自學邊界。

CMU 10-301 HW1:先用數學與 Python 找出機器學習地基缺口

HW1 是 written+programming 作業:用機率、微積分、線代與 CS 題組檢查地基,再實作 majority-vote classifier。

CMU 10-301 HW2:從資訊量手算到完整 Decision Tree

HW2 要先用 entropy 與 mutual information 手算切分,再完成建樹、預測與評估的端到端分類器。

CMU 10-301 HW3:比較 K-NN、Perceptron 與 Linear Regression

HW3 是純 written 作業,以 decision tree 回顧,再比較 K-NN、Perceptron 與 Linear Regression 的 inductive bias、誤差與 model selection。

CMU 10-301 HW4:把 Logistic Regression 從 likelihood 寫成分類器

HW4 把機率解釋、cross-entropy 梯度與程式實作綁在一起,驗收的是一條可追蹤的訓練流程。

CMU 10-301 HW5:用 NumPy 拆開 Neural Network 與 Backpropagation

HW5 的價值在於不靠自動微分,親手追蹤 forward shapes、cache 與 backward gradients。

CMU 10-301 HW6:Learning Theory、MLE/MAP 與公平指標

HW6 把 generalization、MLE/MAP、probabilistic learning、公平指標與社會影響放在同一份 written 作業,逼你說清楚假設與取捨。

CMU 10-301 HW7:從基礎神經網路走到 Deep Learning

HW7 在 HW5 的 backpropagation 地基上加入深度模型的架構與訓練問題,重點是診斷而非只把網路加深。

CMU 10-301 HW8:從 MDP 到 Reinforcement Learning 更新規則

HW8 把 state、action、reward、transition 與 value update 接起來,驗收你能否區分環境動態、policy 與估計誤差。

CMU 10-301 HW9:用 Ensembles、k-Means、PCA 與推薦系統收束全課

最後一份 written 作業把 ensemble、clustering、representation 與 recommendation 並列,驗收你能否按問題結構選學習典範。

CMU 10-301/601 Spring 2026:用九份作業學完整機器學習

Spring 2026 的 10-301/601 公開 27 講教材與九份作業包;校外讀者能完成主要實作,但拿不到 Panopto、Piazza、Gradescope 與正式作業解答。

learning deep-dive

CMU AI 核心改制:15-281+10-315 到 07-280+07-380,不只是換課號

CMU 在 2026 年把原本分開的廣義 AI 與 SCS 機器學習入口,重新整合成 07-280 → 07-380;這是內容與先修路線的重切,不是兩門課逐一改名。

Harvard AI/ML 課程導讀:CS50 AI、CS181、CS182 的影片與作業是不是同一版?

Harvard 校外最完整的入口是 CS50 AI,但 Summer 2026 實際沿用 2020 錄影與作業資產,OCW 作業又已更新到不同版本;CS181 Spring 2026 公開當期作業與講義、沒有當期錄影,CS182 Fall 2026 則尚未完成開課。

Stanford CS109 Lecture 20|Logistic Regression:從 Bernoulli likelihood 推出 gradient

Logistic regression 用 sigmoid 把線性分數變成 Bernoulli 機率,而 gradient xⱼ(y-ŷ) 直接來自 log-likelihood 的 chain rule。

Stanford CS109 Lecture 21|Comparing Classifiers:accuracy 之外還要問 calibration、錯誤成本與 fairness

比較 classifier 不能只看 accuracy;還要用 held-out data、baseline、calibration、precision/recall 與明確的 fairness criterion。

Lambda Cloud:從單台 GPU VM 到多節點 AI Cluster 的算力雲

Lambda Cloud 提供 on-demand GPU VM 與 1-Click Cluster;它賣的是較直接的 AI 算力環境,不是自動完成 training、serving 與 MLOps。

Replicate:把模型版本變成 Prediction API,而不是租一台 GPU

Replicate 以 versioned model、prediction、Cog 與 deployment 抽象 GPU;整合者要負責版本釘選、async workflow、webhook 驗證、資料保存與成本上限。

RunPod:GPU Pod 與 Serverless Endpoint 是兩種不同產品

RunPod Pod 適合互動與長駐 GPU 工作,Serverless 適合 queue-based 或 load-balanced inference;選錯會把 persistence、cold start 與重試語意混在一起。

Stanford CS229 導讀:講義每年重編,公開作業停在 2020,官方自測題是 2008 年的

CS229 的自學三件套不在同一個時鐘上:講義 278 頁、2026 年 8 月才重編過;公開拿得到的作業是 2020 年夏季那批;Stanford Online 叫你入學前先做的自測題,PDF 建立於 2008 年。2026 春季錄影公開 17 支,最後三支的標題跟內容對不上。

Berkeley AI/ML 課程導讀:從 CS61A 到 CS288,最新公開教材怎麼排

Berkeley 沒有獨立的大學部 AI 學位;可行路線是在 CS BA 或 EECS BS 的共同基礎上,從 CS188 的廣義 AI 或 CS189 的數學型 ML 入口,再分流到深度學習、NLP、視覺與強化學習。2025–2026 有不少 A3 公開課,但最新班次、最新穩定網址與最好用的自學版本並不總是同一個。

CMU AI/ML 課程導讀:07-280 新主幹與校外可走的公開路線

CMU 現行 BSAI 已改成 07-280 → 07-380,再從 NLP/視覺核心與四個 AI clusters 延伸;但 07-380 要到 Fall 2026 才首開。07-280 Spring 2026 的殘留教材與 10-301/601 已能完整自學,15-281 則是仍有價值的退休舊路線。

MIT AI/ML 課程導讀:6-4 是正式 AI 學位,公開教材卻分散在三個年代

MIT 自 2022 年已有正式的 6-4 Artificial Intelligence and Decision Making 學位;但校外自學時,現行學位要求、2025–2026 課站與最好用的 OCW 版本往往不是同一套。真正可行的路線,是先照 6-4 的程式、演算法、線代與機率骨架打底,再依公開程度選 6.S191、6.3900、6.4110、6.7960、電腦視覺或機器人分支。

Stanford CS109 導讀:一門機率課把「怎麼用語言模型讀這一講」寫成了官方教材

CS109 在 2026 年夏季的每一講旁邊,掛了一份官方寫的 LLM Learning Guide——六個概念、每個概念一組 Learn 與 Test me 提示詞,逐週產出共 23 份 PDF。同一門課的榮譽守則第 4 條卻明文禁止拿 LLM 解作業,而成績有 65% 壓在現場考試。這兩件事是同一套設計的兩半。

Stanford CS161 Lecture 18:從演算法工具箱走向 LP、編碼與 ML

期末課以 slides 回顧 CS161 工具箱,再用 LP duality、Reed–Solomon 與 ML-assisted algorithms 指向後續方向;官方沒有提供 notes。

ML Fundamentals 面試攻略:從 bias-variance 到 evaluation metrics

ML 基礎面試不考你背公式,考你能不能用直覺解釋概念、在追問下不崩潰。高頻考點:bias-variance tradeoff 的實際意義、L1/L2 regularization 的選擇邏輯、cross-entropy 為什麼比 MSE 適合分類、SGD 與 Adam 的取捨、precision/recall 在不同場景的重要性差異。

AI Engineer 面試全景圖:從公司類型到準備策略

AI Engineer 面試不只考 ML——大廠看系統設計與 coding,新創看端到端交付,AI-native 公司看 LLM 工程深度。準備策略:先釐清目標公司類型,再按六大維度(ML 基礎、系統設計、LLM 應用、Coding、Paper Reading、行為面試)分配時間。

ai guide AI 證照備考

Google PMLE 備考路徑:考綱重寫後怎麼準備

Google Professional ML Engineer 的考綱在 2026 年被重寫,Vertex AI 全面改名為 Gemini Enterprise Agent Platform,舊教材的產品名對不上題目。這篇以官方 exam guide 的六章權重為骨架,逐章列出考什麼、配哪些官方材料、練什麼,並換算成一份看得懂依據的時程。官方規格:$200、兩小時、50–60 題單選加複選、效期兩年、建議 3 年以上業界經驗含 1 年以上 Google Cloud。

ai guide Stanford CS230 導讀

AI Project Strategy:三四個小時的試算表,省掉幾週的錯方向

Andrew Ng 用 deep researcher 當例子示範 error analysis:列是 pipeline 的每個步驟,行是 10 到 100 個查詢,只看表現不好的那些,逐格標記哪裡壞掉。百分比不需要加起來等於 100%。他說這要花三四個小時,但省下的是幾週走錯方向的時間——而真的會去做的人的比例遠低於 100%。

ai guide Stanford CS230 導讀

Full Cycle of a DL Project:資料收兩天就好

Andrew Ng 用人臉辨識開門系統走完整個專案生命週期,而全講只有一個核心論點:速度。他給團隊的期限是兩天,理由是「花在準備資料的時間,應該和訓練一次模型的時間相稱」。最後收在一句話:我的工作是做出一個真的能用的東西,那和做出一個在測試集上能用的東西不一樣。

飛控的「自主」共 56 項,只有一項是為了把握機會

ArduPilot 的 ModeReason 列舉就是「機上自主決策」的完整清單:56 個值裡 43 個是飛機自己決定的,其中 21 個是偵測到危險,而只有 SOARING_THERMAL_DETECTED 一項是因為發現機會。至於 end-to-end,PX4 主線那個 mc_nn_control 的 tensor arena 只有 10 KB、Kconfig 預設 n,ArduPilot 主線一個都沒有。