Skip to content
所有標籤

#code-model

7 篇文章
ai deep-dive 認識 AI 模型

2026 Coding Benchmark 怎麼讀:SWE-bench、Terminal-Bench、DeepSWE、Aider 各自測什麼

每個模型發布都帶 benchmark 數字,但同一個模型在不同 harness 上可以差 20 分、SWE-bench Verified 的 32% 驗證器判斷有誤、DeepSWE 113 題讓多數模型掛零。這篇拆解六個主要 coding benchmark 各自測什麼、哪些容易灌水、讀者該看哪個。

ai deep-dive 認識 AI 模型

MoE 為什麼贏:從 Ornith 到 MiniMax,2026 年前沿模型都在用的架構

2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。

ai deep-dive 認識 AI 模型

開源 AI 授權地雷指南:MIT、Apache 2.0、Llama License 到底差在哪

AI 的「開源」不等於軟體的開源。MIT 和 Apache 2.0 真的隨便用;Llama License 超過 7 億月活要另外談;舊版 Gemma 授權 Google 可以片面修改(Gemma 4 已改 Apache 2.0)。這篇按授權類型整理你能做什麼、不能做什麼。

tech deep-dive AI 模型家族

MiniMax:聊天機器人公司做出的 Coding 模型,性價比碾壓閉源

MiniMax 從消費級聊天 App 起家,M2.5 在 SWE-bench Verified 拿 80.2% 但 API 價格只有 Claude Opus 的 1/10-1/20;M3(456B 總量 / 45.9B 啟用)是首個在 SWE-bench Pro 突破 59% 的開源權重模型,還有 1M context。

tech deep-dive AI 模型家族

Nous Research:從研究社群到開源 AI 生態系的反叛者

Nous Research 不預訓練,只做 fine-tuning 和 RL——Hermes 4 在 MATH-500 拿 96.3%,NousCoder-14B 只用 24K 樣本就把 Qwen3-14B 的 coding 能力拉高 7%。但真正的護城河是 Hermes Agent 框架:236K GitHub stars,全球第 19 名,3,000 位貢獻者。

tech deep-dive AI 模型家族

Ornith:小團隊用自我改進 RL 做出的開源 Coding 黑馬

DeepReinforce 用 self-improvement RL 訓練的 Ornith 1.5 家族:397B 旗艦在 SWE-bench Verified 拿 86.0 追平 Claude Opus 4.8,35B-A3B 每 token 只啟用 3B 參數卻在同量級 coding benchmark 全面領先,9B 版本可以跑在手機上。MIT 授權、完全開源。

ai project

2026 Q1 開源 LLM 全景圖:從前沿大模型到手機端,完整盤點

2026 Q1 開源模型全面爆發:LLM 方面 GLM-5、Kimi K2.5、Qwen3.5 追上閉源;Embedding 和 Reranker 由 Qwen3 和 BGE 主導;語音有 Voxtral TTS 和 Whisper V3;圖像有 FLUX.2;影片有 Wan 2.2 追平 Sora。這篇是完整導覽地圖。