Skip to content
所有標籤

#optimization

11 篇文章

MIT 6.7960 L03:優化總覽——SGD、Adam、學習率排程與縮放規則

從 SGD 到 Adam,用縮放規則一次搞懂深度學習優化器怎麼選、學習率怎麼調

tech guide Harvard CS50 AI 導讀

Harvard CS50 AI Week 3:Optimization——局部搜尋、模擬退火、約束滿足問題與填字遊戲

Week 3 探討優化問題:爬山算法、模擬退火逃離局部最優、CSP 框架與 AC-3 弧一致性、回溯搜尋,專案 Crossword 實作填字遊戲生成器。

Harvard CS50 AI 綜論(一):從搜尋到語言——七週 AI 知識弧線的完整圖譜

綜論第一篇:梳理七週主題如何從符號搜尋一路延伸到語言模型,揭示古典 AI 到現代 ML 的知識脈絡與設計哲學。

MIT 6.7960 L07:優化縮放定律 —— 譜視角、特徵學習與超參數遷移

優化不是孤立的數值問題:用譜視角看 SGD,權重更新的『量』決定特徵學習;Maximal Update Parameterization 讓學習率與初始化跨寬度遷移,critical batch size 決定算力換取收斂的邊際。

ai deep-dive 認識 AI 模型

模型怎麼改進自己:梯度下降與訓練迴圈

模型透過 loss 知道自己錯多少,透過梯度知道往哪邊調。梯度下降就是反覆做三件事:算 loss、算梯度、調參數。Learning rate 決定每步調多大——太大會跳過最佳解,太小訓練到天荒地老。

CMU 07-280 Lecture 8 導讀:Gradient Descent、SGD 與 Learning Rate

Lecture 8 從一維 parabola 推到 vector gradient,再比較 batch GD、SGD 與 mini-batch;learning rate 決定更新是收斂、震盪或發散。

CS336 Lecture 11:Scaling law 落地時,learning rate 與 batch 也要一起縮放

第十一講從 MiniCPM、DeepSeek、Qwen 與 Llama 3 的公開 recipe 拆解 scaling 實務:先固定大多數架構比例,再用小規模 sweep 找 learning rate、batch 與 IsoFLOPs 配置;μP 有用,但會被 normalization、optimizer 與 weight decay 破壞。

支援向量機:間隔、對偶與 SMO

第六章把分類信心形式化為幾何間隔,再用拉格朗日對偶、kernel 與 SMO 建出可實作的 SVM。

CMU 10-301 HW4:把 Logistic Regression 從 likelihood 寫成分類器

HW4 把機率解釋、cross-entropy 梯度與程式實作綁在一起,驗收的是一條可追蹤的訓練流程。

Stanford CS107 Lecture 24:先用 Callgrind 找熱點,再讀懂 GCC 做了哪些最佳化

CS107 第 24 講用矩陣乘法與 Callgrind 建立量測流程,再拆解 GCC 的 constant folding、共同子運算式消除、dead-code elimination、strength reduction、code motion 與遞迴轉迴圈;最佳化從瓶頸證據開始。

ai deep-dive

別再手工調 prompt:從 GEPA 到 tool description,agent 行為的自動最佳化

自動 prompt 優化(APO)從 APE/OPRO 演進到 GEPA:用語言反思取代稀疏 reward,少 4–35 倍 rollouts 贏過 GRPO 約 6pp。另一邊,tool description 是被忽略的 prompt——小改措辭能讓工具選用率變 10 倍,Anthropic 實測讓 Claude 自我改寫 tool description 勝過人類專家手寫。兩條線正在合流:eval-driven 的自動優化吃掉手工調 prompt。