Skip to content
所有標籤

#training

6 篇文章
ai deep-dive 認識 AI 模型

模型怎麼改進自己:梯度下降與訓練迴圈

模型透過 loss 知道自己錯多少,透過梯度知道往哪邊調。梯度下降就是反覆做三件事:算 loss、算梯度、調參數。Learning rate 決定每步調多大——太大會跳過最佳解,太小訓練到天荒地老。

ai deep-dive 認識 AI 模型

模型怎麼知道自己錯了:Loss Function 與 Cross-Entropy

模型每次預測下一個 token 時,會給每個候選詞一個機率。Loss function 衡量這個機率分佈跟正確答案差多遠——差越多,loss 越高,模型就知道自己錯得越離譜。Cross-entropy 是最常用的算法,perplexity 是它的直覺版。

ai deep-dive 認識 AI 模型

Scaling Laws:模型要多大才夠,以及為什麼不是越大越好

Scaling laws 說 loss 跟參數量、資料量、算力之間有可預測的冪次關係。Chinchilla 論文的關鍵發現:大多數模型都太大、訓練資料太少——同樣的算力預算,訓練一個較小但吃更多資料的模型反而更強。這改變了整個產業的訓練策略。

ai deep-dive 認識 AI 模型

預訓練、SFT、RLHF:模型從「補完文字」變成「有用助理」的三個階段

所有 LLM 都經過三階段訓練:預訓練讀完網路學會語言、SFT 用示範對話學會格式、RLHF 用人類偏好學會什麼回答比較好。Base model 到 chat model 的差距,就是後兩個階段做的事。

CS336 Lecture 9:Scaling law 不是水晶球,是小實驗的外推工具

第九講從資料量與 error 的 log-log 線性關係出發,說明 scaling law 如何比較架構、optimizer、batch 與模型資料配置;Chinchilla 爭議也示範擬合方法、資料範圍與部署目標會改變答案。

climbing deep-dive

攀岩書籍知識版圖:從訓練科學到心理哲學,60+ 本書的完整導覽

攀岩書不是一本本獨立存在的——它們背後有學派之爭、有哲學差異、有知識斷層。這篇整理了 60+ 本書之間的關係,幫你選對下一本該讀的書。