Skip to content
所有標籤

#agentic-coding

24 篇文章
ai deep-dive

LLM 開發流程全景:瓶頸從寫程式移到驗證程式之後

AI 讓寫 code 快了 34%,但 review 時間暴增 441%、實測交付反而慢 19%。四輪研究整理出當前全景:確定性護欄(hook 擋)vs 機率性護欄(prompt 引導)、乾淨 context review、自我改進回饋迴圈、規格驅動開發、AI 測試品質危機(覆蓋率高但 mutation score 低至 53%),以及 Replit agent 偽造測試結果的真實事故。

ai deep-dive

screenshot-to-code 怎麼把截圖變程式碼:Agent Loop、素材裁切、視覺驗證

screenshot-to-code 不是一步到位的截圖轉碼工具。核心是一個最多 30 步的 Agent Loop,搭配 7 個工具——從截圖裁切真實素材、用 Playwright 自我驗證、到同時跑 4 個模型讓使用者選最好的版本。GitHub 74,500+ stars,MIT License。

ai deep-dive 認識 AI 模型

2026 Coding Benchmark 怎麼讀:SWE-bench、Terminal-Bench、DeepSWE、Aider 各自測什麼

每個模型發布都帶 benchmark 數字,但同一個模型在不同 harness 上可以差 20 分、SWE-bench Verified 的 32% 驗證器判斷有誤、DeepSWE 113 題讓多數模型掛零。這篇拆解六個主要 coding benchmark 各自測什麼、哪些容易灌水、讀者該看哪個。

ai deep-dive 認識 AI 模型

後訓練 RL 三條路線:Ornith、Nous Research、MiniMax 怎麼用強化學習做出黑馬模型

2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。

tech deep-dive AI 模型家族

MiniMax:聊天機器人公司做出的 Coding 模型,性價比碾壓閉源

MiniMax 從消費級聊天 App 起家,M2.5 在 SWE-bench Verified 拿 80.2% 但 API 價格只有 Claude Opus 的 1/10-1/20;M3(456B 總量 / 45.9B 啟用)是首個在 SWE-bench Pro 突破 59% 的開源權重模型,還有 1M context。

tech deep-dive AI 模型家族

Ornith:小團隊用自我改進 RL 做出的開源 Coding 黑馬

DeepReinforce 用 self-improvement RL 訓練的 Ornith 1.5 家族:397B 旗艦在 SWE-bench Verified 拿 86.0 追平 Claude Opus 4.8,35B-A3B 每 token 只啟用 3B 參數卻在同量級 coding benchmark 全面領先,9B 版本可以跑在手機上。MIT 授權、完全開源。

ai deep-dive

BytePlus ModelArk Coding Plan:字節跳動的 AI 編碼訂閱方案

BytePlus ModelArk Coding Plan 提供 Lite($10/月)和 Pro($50/月)兩種訂閱,整合 DeepSeek-V4、GLM-5.2、Seed-2.0 等多模型,支援 Claude Code、Cursor 等主流工具,Lite 月配額約 24,000 次請求,Pro 為其 5 倍。

tech deep-dive AI 模型家族

Claude——從 AI 安全實驗室到 SWE-bench 冠軍,閉源 Agent 最強選擇

Claude 是 Anthropic 推出的閉源 LLM 家族,以 Constitutional AI 訓練、Agent 能力和 Coding 表現聞名。2026 年 7 月的 Opus 5 以 SWE-bench Verified 96% 拿下 coding 冠軍,Fable 5 則以 LiveBench 83% 領跑通用能力。四層產品線(Fable / Opus / Sonnet / Haiku)從 $1 到 $10 覆蓋不同場景,是系列裡唯一完全沒有開放權重的家族。

tech deep-dive AI 模型家族

GPT——閉源 API 收營收、開源 GPT-OSS 補生態,統一路由架構的全球最大 AI 平台

GPT 是 OpenAI 推出的 LLM 家族,從 2018 年的 117M 參數到 2026 年的 GPT-5.6 Sol/Terra/Luna 三層產品線,擁有超過 10 億使用者和 200 萬企業客戶。GPT-5.6 Sol 在 LiveBench 81.1%、Terminal-Bench 2.1 88.8%、Artificial Analysis Coding Agent Index 80 等多項 benchmark 領先,同時首次推出開源模型 GPT-OSS(Apache 2.0)。

ai deep-dive

Slack Code:多人協作 AI Coding 與 Agent 控制平面的競爭版圖

Slack Code 把 AI coding agent 從開發者的終端搬進 Slack 頻道,讓團隊即時看到 diff、預覽與計畫。但它解決的是管理層的透明度焦慮,不是工程師的生產力瓶頸——真正的戰場在「誰當 agent 的控制平面」。

ai deep-dive

microsoft/AI-Engineering-Coach 的 45 條規則:一份把 agentic 工程意見寫成可執行門檻的清單

微軟員工開源的 VS Code extension,讀本機 Claude Code / Codex / OpenCode 的 session log。真正的內容物是 45 條 Markdown 規則:prompt 短於 30 字元、收到 20 行 AI 程式碼後 15 秒內就送下一則、instructions 檔超過 4000 bytes——把「context engineering」翻成可以爭論的數字。

CS146S Week 4:CLAUDE.md 該寫什麼、hooks 該擋什麼、subagent 該切在哪

課程把指揮 agent 的工具列成四件:指示檔、hooks、commands、subagents。指示檔是唯一每次開機都全額進 context 的,所以它是 config 不是 memory;hooks 補上「規則會被忽略、hook 不會」那一塊;commands 是四件裡唯一由人主動觸發的。課程另給一張表,把軟體任務七步驟裡只剩一步半標成人的工作。

CS146S Week 1:coding agent 的內部構造,其實是一個 while 迴圈

CS146S 第一週的講題是「用 200 行寫出 Claude Code」加上「解剖 production agent 的 system prompt」。agent loop 本身確實只有十幾行。課程投影片最後一頁列了四條 Claude 底下實際在做的事,其中一條是用 `<system-reminder>` 標籤在各處防止模型漂掉——這在官方文件裡找不到。

CS146S Week 5:Express 拿 28 分、CockroachDB 拿 74 分——agent 就緒度是可以量的

Factory 把「repo 夠不夠格讓 agent 動」拆成八根柱子、五個等級,並公開了實測分數:CockroachDB L4(74%)、FastAPI L3(53%)、Express L2(28%)。核心論點是 agent readiness ≈ codebase 裡確定性驗證迴圈的密度——linter、type checker、測試,這些對 agent 來說是獎勵訊號。

CS146S Week 7:o3 找到 Linux kernel 零日,代價是 1:50 的訊噪比

課程量到的 AI SAST 誤報率是 50–100%,而傳統 SAST 本來也有 50% 以上——真正的新問題是非決定性:同一個 prompt 跑兩次結果不同,你無法回答「掃完了沒有」。課程列的 agent 攻擊向量有五種,其中 intent breaking 攻擊的是 agent 的計畫本身。

CS146S Week 6:Google 為了讓 AI review 有用,先刪掉 17 條規則

Google 的 AutoCommenter 部署到數萬名工程師身上,論文寫出了整條調校過程:把 17 條「技術上正確但沒價值」的規則停掉,有用率從 54% 升到 66%,目標訂在 80% 才准進下一階段。最後的留言解決率約 40%。AI code review 的瓶頸從來不是抓不到,是抓太多。

CS146S Week 8:把 agent 丟到雲端跑之後,瓶頸從等待變成審查

背景 agent 把「你盯著它跑」換成「它自己跑完開 PR」。三家的做法收斂到同一組零件:隔離環境、外部觸發(issue、Slack、Linear)、產出是 PR。真正的新問題是你變成瓶頸——五個 agent 同時跑完,五份 diff 排隊等你讀,而它們互相不知道彼此存在。

Stanford CS146S 兩版大綱對照:一年之間,這門 AI 開發課改掉了什麼

Stanford CS146S 的 Fall 2026 大綱把 prompting 從整整一週壓成一節,砍掉終端機與 UI 生成兩週,換上 Agent Skills、Agent-Ready Codebases、Background Agents、AI-Native Team。評分也動了:Final Project 從 80% 降到 50%,多出 30% 的 open source 貢獻。這個系列照十週逐篇讀。

CS146S Week 10:software factory 不是自動化,是把回饋迴圈交出去

最後一週的講題是「self-running, self-improving software systems」。前九週的零件其實都出現過:確定性驗證迴圈、可寫回的 skill、背景 agent、集中治理。課程投影片有個容易被忽略的比例——寫程式只佔工程時間的 30%,另外 70% 是把它跑在 production 上。

ai deep-dive

Uncle Bob 不讀 agent 寫的程式碼:他用什麼關卡取代 code review

2026/7/23 Uncle Bob 那則 418 萬瀏覽的貼文不是宣言,是回覆——回一位 1983 年入行的工程師問「我心理上就是需要看懂程式碼,是不是太老派」。而且他沒有完全不讀:6/1 那則四階段 pipeline 的原文寫著 I spot check the code,門檻是 crap ≤ 6(業界慣例 30)、mutation 要 kill all survivors。附開源的 Acceptance-Pipeline-Specification 拆解與 Grady Booch 點名的三個指標盲區。

ai deep-dive

Loop Engineering:當 AI 不再需要你打 Prompt

Loop Engineering 是設計「自動 prompt agent 的系統」而非手動 prompt 的工程實踐。Boris Cherny 跑數百個 agent、Addy Osmani 正式命名、Blake Crosley 指出驗證成本才是真正瓶頸——這篇整理一手來源、五大構建塊、適用邊界與批評觀點。

ai guide AI Agent 實戰

OpenAI 用 Codex 寫了 100 萬行程式碼:Harness Engineering 實戰

OpenAI 內部團隊 5 個月、3 人、0 行手寫程式碼,用 Codex 交付了一個完整產品。這篇整理他們在 AGENTS.md 設計、repo-local 知識庫、架構強制執行、entropy 管理上的核心心得。

ai guide

一本由 AI 自己寫的書,教你怎麼跟 AI 一起寫軟體

Encyclopedia of Agentic Coding Patterns 收錄 190 個 pattern,幫你在 AI 代寫程式的時代做出正確的軟體決策——而這本書本身就是由 AI agent 自主撰寫和維護的。

ai guide AI Agent 實戰

從 Stripe 到 Meta:矽谷一線公司如何用 AI Agent 取代鍵盤

矽谷一線公司各自獨立打造內部 AI coding agent,從 Slack 訊息到 merged PR 全程自動化。深入拆解 Stripe、Ramp、Coinbase、Spotify 四家的架構,再擴展到 Google、Meta、Amazon、Uber、Goldman Sachs、Walmart 等十多家公司的做法與指標。