Skip to content
所有標籤

#fine-tuning

15 篇文章

MIT 6.7960 L18:遷移學習(Transfer Learning)—— 預訓練、特徵抽取、與微調策略

遷移學習的核心是『在大資料上學到的特徵是好的通用表示』:下游任務資料少時,把 backbone 凍住只訓練線性 head;資料夠就全模型微調;想省算力就上 LoRA / adapter。SimCLR、MAE 這類自督導預訓練讓『上游不需要標籤』,下游表現又上一層樓。

ai guide

個人學模型訓練要租 GPU 嗎:GPUtw.ai、LoRA、Jupyter 與第一輪實驗

GPUtw.ai 適合個人把短租 GPU 當成學習工具:先跑 Jupyter、Ollama、ComfyUI,再用 LoRA/QLoRA 做小模型微調。它不是大型基礎模型訓練平台,第一次使用應該小額測部署、計費與資料保存。

ai deep-dive 認識 AI 模型

後訓練 RL 三條路線:Ornith、Nous Research、MiniMax 怎麼用強化學習做出黑馬模型

2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。

ai deep-dive 認識 AI 模型

Fine-tuning vs RAG:什麼時候該教模型、什麼時候該幫模型查資料

資料常更新、需要引用來源 → RAG。需要統一風格、要跑在小裝置上 → fine-tuning。實務上很多系統兩者都用:fine-tune 一個懂你領域語言的小模型,再用 RAG 補上最新資料。

ai guide 認識 AI 模型

認識 AI 模型:從 token 到自架,18 篇讀懂模型的通用知識

不需要變成研究員也能系統理解 AI 模型。這個系列從你看得見的東西(token、context window)開始,一路走到自架開源模型,18 篇覆蓋選模型、讀 benchmark、算成本需要的所有基礎。

ai deep-dive 認識 AI 模型

預訓練、SFT、RLHF:模型從「補完文字」變成「有用助理」的三個階段

所有 LLM 都經過三階段訓練:預訓練讀完網路學會語言、SFT 用示範對話學會格式、RLHF 用人類偏好學會什麼回答比較好。Base model 到 chat model 的差距,就是後兩個階段做的事。

tech deep-dive AI 模型家族

Nous Research:從研究社群到開源 AI 生態系的反叛者

Nous Research 不預訓練,只做 fine-tuning 和 RL——Hermes 4 在 MATH-500 拿 96.3%,NousCoder-14B 只用 24K 樣本就把 Qwen3-14B 的 coding 能力拉高 7%。但真正的護城河是 Hermes Agent 框架:236K GitHub stars,全球第 19 名,3,000 位貢獻者。

ai guide

Unsloth 完整指南:在本地微調和運行 LLM 的加速工具

Unsloth 是目前最省 VRAM、最快的本地 LLM 微調工具,訓練速度快 2 倍、VRAM 省 70%。2026 年加入 Desktop 桌面應用後,整合了推論、微調、圖片影片生成、web search 和 agent 連接,從微調庫變成完整的本地 AI 工作站。

CMU 07-280 Lecture 15:Pre-training、Transfer Learning 與 Fine-tuning 的分工

Lecture 15 將 pretrained model 拆成 representation g 與 task head h:可以凍結 g 只訓練 head,也能用較小 learning rate fine-tune 部分或全部參數;選擇取決於資料量與 source-target 差距。

ai deep-dive

Fireworks AI:從 Serverless API 到客製模型部署的推論平台

Fireworks AI 把開放權重模型的試用、專用 GPU 部署與 LoRA 客製化放在同一套 API 後面;Serverless 適合低流量起步,On-demand 適合穩定高流量與自有模型,保留容量則換取企業級的容量保證。

基礎模型概覽:線性探測、微調與 LoRA

第 15 章比較線性探測、完整微調與 LoRA:差別不只在可訓練參數量,也在表徵是否移動、資料需求與記憶體成本。

ai deep-dive

Together AI:從 Serverless 推論到專屬端點與 Fine-tuning

Together AI 把開放權重模型的 Serverless API、專屬 GPU 端點、批次推論與 Fine-tuning 放在同一平台,適合先按 token 驗證,再在流量或客製化需求成形後升級部署。

ai guide Stanford CS230 導讀

Introduction to Deep Learning:光靠 prompt 走不遠的那兩個時刻

CS230 第一講是課程總覽,但 Andrew Ng 花最多時間講的是三件事:為什麼 scaling 有效、什麼時候 prompt 就不夠用了、以及他認為「不要學寫程式」是史上最糟的職涯建議之一。

ai guide

LLM 知識庫的三種模式:知識庫、經驗庫、部落格

Andrej Karpathy 提出用 LLM 編譯個人知識 wiki 的框架——收集原始資料、LLM 編譯成 .md wiki、對 wiki 做 Q&A、輸出歸檔回 wiki。本文比較三種實踐路線:Karpathy 的知識庫模式、社群的經驗庫模式、以及 quidproquo 的部落格模式。

ai deep-dive RAG 技法大全

RAG vs Fine-tuning:不是非此即彼

RAG 和 Fine-tuning 解決的是不同問題。RAG 給模型新知識,Fine-tuning 改變模型的行為風格。大多數情況是兩者都用,而不是選一個。