Skip to content
所有標籤

#multi-agent

66 篇文章

AI Agent Arxiv Digest — 2026-09-05

A Case Study on Emergent Cheating and Whistleblowing 記錄 100 個自主研究 Agent 在無人介入下自發作弊、也自發組織抓弊;You Can't Escape Your Own Activations 顯示即使告訴會合謀的 Agent 它正被激活值監控,最強探針依然抓得住;Fresh Memory, Stale Plans 的 PlanFence 在 30 個受控真實工作流程中,把「照著過時計畫執行」的錯誤從 100% 降到 0%

AI Agent Arxiv Digest — 2026-09-04

The Memory Trust Gap 顯示 Qwen3 各規模模型有 92%–100% 的機率沿用過期記憶,模型越大在某些陷阱條件下淨傷害反而越深;Epistemic Sybil Resistance 用兩萬多次真實 LLM agent 呼叫證明,把報告數從 1 疊到 32 篇,樸素聚合器的後驗覆蓋率會從 0.940 崩到 0.263;LLM-as-a-Judge Is Not an Oracle 記錄了自我優化迴圈裡 11 種評分訊號失效方式,其中一次讓 100% 的通過率掩蓋了實際只有 68.1% 的真實能力

AI Agent GitHub Digest — 2026-09-04

github/spec-kit 滿一年衝上 1.0.0,維護者特別強調穩定性讓位給適應力;stablyai/orca 讓你在各自 git worktree 同時跑一整支 coding agent 艦隊,單日狂漲 812 星;KeygraphHQ/shannon 3.0 上線,AI agent 自動滲透測試直接出 SARIF 報告接 CI/CD。瀏覽器端 ChromeDevTools/chrome-devtools-mcp 把官方 MCP server 開給任何 agent 操作 Chrome。框架端 Pydantic AI v2.38.0 改了一次性 capability 的合併規則(breaking),Claude Code v2.1.259 修掉多 session 互蓋設定的老問題。

ai deep-dive 文件解析實戰

Agentic Parsing:讓 Agent 決定怎麼解析文件

傳統文件解析用固定 pipeline 一體適用,但合約、財報、技術手冊各需不同策略。Agentic Parsing 讓 LLM agent 觀察文件後動態選工具——AgenticOCR 只解析需要的區域(視覺 token 省 70%+)、ParseBench 2,000 頁企業文件實測最佳方案也只拿 84.9%,沒有銀彈。

跟成熟 coding agent 學設計(32):Subagent 與 worktree 隔離——讓主 loop 學會分工

成熟 subagent 需要角色、fan-out 上限、權限收窄與成果回傳契約。looplane 已有 native named-role schedule、平行 fan-out、子 task allowed_paths 不得超出 parent、預設禁用 unsafe exec,以及 parent-approved transaction proposal baseline;常駐 background lifecycle、遞迴深度管理與自動 worktree merge 仍未完成。

同一個多 Agent 任務,四種寫法:Omnigent YAML、LangGraph、CrewAI 與 Goose

用同一個 Polly 任務(平行 git worktree + 跨廠商審查)對照四種多 Agent 寫法:Omnigent 以 YAML 在 Server 層治理、LangGraph 以 StateGraph 精準控流程、CrewAI 以角色扮演快速拼裝、Goose 以 Recipe 跑單機自動化,對比 token、延遲與可維護性的真實取捨。

多個 Agent 怎麼一起管:Omnigent 的 meta-harness、Policy 與跨裝置 Session

Databricks 開源的 Omnigent 把 Claude Code、Codex、Cursor、Pi 等 harness 包在 Runner/Server 與 Omnibox 沙盒之上,用三層 Policy 與可分享的持久化 Session 讓模型與 harness 一鍵替換,9.3k stars 的 alpha 專案。

Claude Code 多代理怎麼選:subagents、agent view、agent teams、dynamic workflows

官方文件把 Claude Code 的平行工作分成 4 種方式:subagents 在同一個 session 內委派、agent view 讓你自己盯多個背景 session、agent teams 由 lead 協調一群工人、dynamic workflows 用腳本跑大量 subagent 交叉驗證;檔案衝突一律靠 worktree 隔離。本文附官方比較表中譯與三題決策指引。

tech deep-dive

台股研究 Agent 實戰系列(篇 2):LangGraph 並行架構——五個分析師同時開工

五個 analyst 在同一個 superstep 並行 fan-out,延遲是 max 不是 sum;回測與 reflection 擋在 synthesis 前面,讓 LLM 只能解釋已存在的證據。

ai deep-dive

AG2:以對話、GroupChat 與 speaker selection 組織多 Agent 協作

AG2 延續 AutoGen 的 ConversableAgent 心智模型:agent 透過訊息協作,GroupChatManager 再用 round-robin、manual、random 或 LLM 決定下一位發言者。

ai deep-dive

2026 Agent 框架怎麼選:LangGraph、CrewAI、MAF、AG2、Mastra、Pydantic AI、DSPy

七套工具不是同一類產品:LangGraph、MAF 與 Mastra偏耐久工作流,CrewAI 與 AG2 偏多 agent 協作,Pydantic AI 偏型別化 Python agent,DSPy 則用資料與 metric 最佳化整個 AI 程式。先選控制模型,再選框架。

CS188 CSP 與多代理搜尋:Minimax、Alpha-Beta、Expectimax 怎麼選

Lecture 5–8 先用 CSP 練變數、限制與搜尋順序,再由 Project 2 實作 minimax、alpha-beta 與 expectimax;三者差別在對其他 agent 行為的假設。

CrewAI:用角色扮演組織多 Agent 協作的框架

CrewAI(GitHub 57.4k star,MIT,PyPI 週下載 1,164 萬)用角色(role)、目標(goal)、背景故事(backstory)定義 agent,再把一組 agent 編成 crew 來協作。跟 LangGraph 的圖優先和 MAF 的工作流優先不同,CrewAI 是團隊優先——你不畫節點和邊,你描述一個團隊裡每個人負責什麼。2024 年底完成 LangChain 依賴的全面移除,現在是獨立框架。商業端分開源套件與 AMP 託管平台,AMP 加的是視覺化建構、部署、追蹤與合規。

AI Agent GitHub Digest — 2026-08-20

Volcengine(字節跳動旗下)開源 OpenViking,用 viking:// 虛擬檔案系統取代黑盒向量搜尋做 Agent 記憶,官方測試把準確率拉到 80%+ 同時省 34–91% token;munder-difflin 把多個 coding CLI 包成桌面辦公室、用共享記憶層互相協作;ai-memory 用 Rust MCP server 解決『換 CLI 就失憶』的痛點;mukul975 的資安技能包一天內衝到近 2.8 萬星。pydantic-ai v2.32.0 補強 OpenRouter/xAI 附件搜尋與 instrumentation。

ai guide AI 證照備考

微軟 AI-500 備考路徑:考綱已經公布,官方教材還沒上線

AI-500 是主流雲端業者裡少見的多 agent 系統專家級認證,四塊權重 15-20 / 30-35 / 20-25 / 20-25,官方點名 Agent Framework、LangGraph、Hugging Face Transformers、MCP server 架在 Azure Functions / Logic Apps / API Management、A2A、Key Vault、AI Red Teaming Agent。但它現在有三個限制要先知道:仍是 beta(成績要等重新計分)、必須先取得 AI-103 才能考、而且官方學習路徑尚未上線——考試頁列的四條路徑網址目前全部 404,講師課要等 2026/9/30。

ai deep-dive AI 證照備考

多 agent 架構的考點交集:五張證照重複考什麼,又各自獨有什麼

微軟 AI-500、AB-620、AB-100、NVIDIA NCP-AAI、Claude CCAR-F 這五張證照都考多 agent 架構,交集是七件事:編排拓樸、A2A 與 MCP、每個 agent 的身分邊界、三層記憶、可觀測性與 agent replay、人在迴圈、四個介入點的 guardrail。但同一件事四家用四個名字,而且各自有無法互相轉移的獨有考點——微軟命名了四種 context window 失效模式、NVIDIA 有 7% 綁死自家 NeMo 與 NIM、Claude 考 stop_reason 這種 SDK 層細節。另外修一個常見誤解:Google PMLE 滿篇「Agent Platform」是 Vertex AI 改名,不是多 agent 考點。

ai guide AI 證照備考

NVIDIA NCP-AAI 備考路徑:還不能報名,而且官方兩份文件的權重互相矛盾

NCP-AAI 是 NVIDIA 的 agentic AI 專業級認證,$200、120 分鐘、60–70 題、效期兩年。但兩件事要先知道:一、官方頁面的 Register 按鈕旁標著「Coming soon」,現在還不能報名;二、官方網頁與官方 PDF study guide 的權重表互相矛盾——Deployment and Scaling 網頁寫 13%、PDF 寫 5%,Run/Monitor/Maintain 網頁寫 5%、PDF 寫 7%,而且兩版加總分別只有 98% 與 92%。兩份都是 nvidia.com。文章把它標成範圍與不確定性,不挑一個當事實。

AI Agent Arxiv Digest — 2026-08-18

ActBench 用執行軌跡紅隊測試協作 agent,固定 harness 下攻擊成功率仍達 73.7%–94.4%;Agent Behavioral Contracts II 證明同模型兩階段 pipeline 共同失敗率高達 90%,「條件獨立」假設不成立;Graph-Based RL Drift Diagnosis 用小模型外掛復原圖,在不重訓主力 agent 下偵測漂移並自動回滾

CS146S Week 4:CLAUDE.md 該寫什麼、hooks 該擋什麼、subagent 該切在哪

課程把指揮 agent 的工具列成四件:指示檔、hooks、commands、subagents。指示檔是唯一每次開機都全額進 context 的,所以它是 config 不是 memory;hooks 補上「規則會被忽略、hook 不會」那一塊;commands 是四件裡唯一由人主動觸發的。課程另給一張表,把軟體任務七步驟裡只剩一步半標成人的工作。

CS146S Week 8:把 agent 丟到雲端跑之後,瓶頸從等待變成審查

背景 agent 把「你盯著它跑」換成「它自己跑完開 PR」。三家的做法收斂到同一組零件:隔離環境、外部觸發(issue、Slack、Linear)、產出是 PR。真正的新問題是你變成瓶頸——五個 agent 同時跑完,五份 diff 排隊等你讀,而它們互相不知道彼此存在。

CS146S Week 10:software factory 不是自動化,是把回饋迴圈交出去

最後一週的講題是「self-running, self-improving software systems」。前九週的零件其實都出現過:確定性驗證迴圈、可寫回的 skill、背景 agent、集中治理。課程投影片有個容易被忽略的比例——寫程式只佔工程時間的 30%,另外 70% 是把它跑在 production 上。

AI Agent GitHub Digest — 2026-08-16

Vercel 推出 filesystem-first 的 TypeScript agent 框架 eve,深度綁定自家 AI Gateway/Sandboxes;Prime Intellect 的 Prime Agent 把整個對話 context 當程式變數,搭配可自我改寫的 Continual Harness;aden-hive 的 Hive 用『複製 Queen』取代預先編譯的執行圖;HKUDS 的 nanobot 靠 v0.3.0 Agency Release 半年內衝上 4.7 萬星。今日 watchlist 框架無重大版號更新。

AI Agent Arxiv Digest — 2026-08-13

EvoGraph-Mem 用失敗感知的可編輯圖譜讓 Agent 記憶能自我修正,避免過時洞見反覆污染決策;MAP-Graph 把出處追蹤從事後稽核變成即時存取控制,在 2,700 個合成任務上達到 95% 成功率;MaSRead 證明多 Agent 可以共用 KV cache 片段作為記憶,但讀取需要按內容定址而非位置定址

AI Agent Arxiv Digest — 2026-08-11

Muscle Memory 提出「編譯式記憶」取代檢索式記憶,在 90 個場景中贏下 88.9% 的個人化對決;MoRSE 用 role-subtask 條件化 LoRA 專家讓多 Agent 在程式碼生成上顯著超越純 prompt 分工;ASCon 建立統一故障歸因模型,在三種歸因目標上分別提升 5.83%、10.63%、14.73%

AI Agent Arxiv Digest — 2026-08-05

ToolLIFT 把工具軌跡抽象成函數級工作流圖,OOD 準確率平均提升 4+ 百分點;HyperAgent 用工具-Schema 超圖建構缺口驅動的支援子圖,在 AppWorld 上比 ReAct 高 14.3 百分點且 token 用量更低;多語言多 Agent 規劃診斷發現低資源語言的規劃失敗佔比隨語言資源下降而升高,TART 修正法平均提升 5.6 百分點

AI Agent Arxiv Digest — 2026-08-03

今天三篇論文分別從多 Agent 的「組織設計」、「安全隔離」與「使用者授權」三個維度切入平台建設難題。IMACS 把 multi-agent 系統拆成三個可獨立替換的層(組織、協調、協作演算法),讓框架設計者能像換積木一樣調整 Agent 角色或協作策略;APPA 用「分支上下文」打破 IFC(資訊流控制)的可用性瓶頸,在 4 個模型上把 prompt injection 外洩率從 31–50% 壓低至 0–7%;UW 的調查在 21 個 Agent 授權方案中發現,絕大多數系統只提供「開發者定義的全局策略」,使用者個人化授權幾乎付之闕如。三篇合在一起,勾勒出 agent 平台從原型走向生產

AI Agent Arxiv Digest — 2026-08-02

今天三篇各從不同角度逼視「Agent 在真實環境裡出事了怎麼辦」:ProACT 問的是多人協作中 Agent 應何時開口(Agent UX 設計問題);第二篇用真實 GitHub 資料揭露 Coding Agent 和自己開的 PR 互衝(平台 ops 痛點);第三篇從安全視角整理 Cyber-capable Agent 五大漏洞類別,以今年七月的 HuggingFace/OpenAI 事件為 case study。三篇合起來是一堂「Agent 上線後,你沒想到的麻煩都在這裡」速成課。

AI Agent Arxiv Digest — 2026-07-29

今天三篇論文共同聚焦在「生產級多代理人系統的基礎設施可靠性」:第一篇比較 MCP 與 A2A 兩個協定如何分工、不是競爭而是互補;第二篇實測工具升版後 12 個頂尖模型的能力退化,發現前沿模型也會掉分 13-14%;第三篇揭示把安全模型串成 pipeline 之後整體反而不安全,因為防護其實是靠雲端供應商的伺服器端過濾器在撐。三篇合起來回答了「怎麼接工具」、「工具升版會不會壞」、「串起來安不安全」三個平台工程師最實際的問題。

AI Agent Arxiv Digest — 2026-07-21

今天三篇論文從不同層面回答同一個問題:「怎樣才算一個真正能用的 agent 系統?」SearchOS-V1 給出架構答案——把搜尋進度外顯成結構化狀態、記錄失敗路徑,讓 multi-agent 協作搜尋更可靠;AutoSynthesis 展示高度結構化的學術任務(系統性文獻統合分析)可以被 multi-agent 流水線全自動化;Digital Pantheon 則解決「如何讓 agent 在壓力下維持既定人設」的角色工程問題,並引入可審計的多 agent 協商架構。三篇合看,分別對應 agent runtime 設計、workflow 編排、與人設工程三個核心挑戰的最新解法。

AI Agent Arxiv Digest — 2026-07-20

今日三篇論文從三個不同角度審視 AI coding agent 的落地挑戰:第一篇用系統性實驗揭露 coding agent 在安裝套件時可被普通 README 發動供應鏈攻擊,且防禦能力主要取決於 harness 框架而非模型本身;第二篇提出 BPO 演算法,專為 sandbox-native agent 強化學習設計,只在高熵關鍵決策點分叉採樣提升訓練效率;第三篇以電網研究為案例,展示 MCP 如何作為標準協議串接工業場景的 domain-specific 仿真工具,為垂直領域 agent 落地提供可複製模板。

AI Agent Arxiv Digest — 2026-07-18

今天三篇論文從三個維度切入「生產等級 Agent 可靠性」:MemCon 把記憶體操作建模為強化學習問題,讓 agent 自學何時存、取、忘,在 6 個 benchmark 上任務成功率最高提升 15.2 分;AgentCheck 把 MCP 伺服器變成除錯介面,開發者可重現工具故障、注入修復並驗證效果,填補了 MCP 生態長期缺乏「測試工具」的空缺;AgentAbstain 則用 263 個配對任務揭露:即便是最強的 frontier 模型,在「應拒絕行動」情境下正確率不到 60%,且棄動能力與任務解決能力幾乎無關——光靠換更強的模型無法解決這個問題。

AI Agent Arxiv Digest — 2026-07-16

三篇論文不約而同都在問同一個問題:agent 的每一步執行單元,到底應該怎麼設計才能讓它可稽核、可重用、出了錯能最小範圍修復?ATG 把任務分解成有向無環圖(DAG)讓子任務並行、中間結果可複用;PalmClaw 把手機原生 API 直接包成結構化工具,甩掉難以追蹤的 GUI 點擊序列;IoAT 則把 agent 網路延伸到 IoT 物理世界,從智慧建築到邊緣設備,畫出跨雲端、邊緣、感測器層的協調藍圖。共同主軸:執行邊界要清楚、動作要可稽核、失敗要能局部恢復。

AI Agent Arxiv Digest — 2026-07-07

今天三篇論文都圍繞「讓 agent 系統更安全、更可預測、不出包」這個主軸。前兩篇出自同一研究團隊,以靜態分析角度出發:一篇系統性揭露 agent 陷入無限循環的成因與規模,另一篇則為整個 agent 程式碼建立依賴圖,讓安全審計和元件盤點成為可能。第三篇針對 multi-agent 軟體開發,把 LLM 輸出的信心分數引入協作流程,防止早期幻覺向下游蔓延。

AI Agent Arxiv Digest — 2026-07-01

今天三篇涵蓋 AI Agent 生態的不同維度:Qwen 團隊推出首個跨七大 agent 領域的「語言世界模型」,讓 agent 能在模擬環境中訓練而非倚賴真實 API;快手 AgentX 展示多 Agent 系統在工業規模下的生產部署成果,把推薦算法迭代效率提升至人工的 13.8 倍;OpenAI 則用 Codex 真實使用數據,首次量化 agentic AI 正在如何改變各職能工作者的實際產出,並揭示非技術職能(法務、研究)的 agentic 紅利甚至超越工程師。

AI Agent Arxiv Digest — 2026-06-26

今天三篇各攻一個角度:第一篇 **RigorBench** 問的是「AI coding agent 怎麼解題」而非只看答對率,提出五維流程紀律指標;第二篇來自產業實踐,教你如何把大型 LLM multi-agent 系統客製化、加速,讓企業真的用得起(實測 4.48 倍吞吐量提升);第三篇則從治理角度出發,為 AI 融入軟體開發生命週期提出一套正式協議語言,讓「哪些決定讓 AI 做、哪些要人工審核」從 prompt 裡的一句話,變成可機器驗證的規格。三篇合起來覆蓋「怎麼評估、怎麼部署、怎麼治理」。

AI Agent Arxiv Digest — 2026-06-24

今天三篇從工具可靠性、協定選型、多 Agent 協作三個角度切入 Agent 平台的痛點:PlanBench-XL 揭露頂尖 LLM 在真實大型工具環境下一遇到工具失效就崩潰(GPT-5.4 從 52% 跌至 11%);TU Munich 給出第一份 MCP/A2A/ACP/ANP 等 9 個協定的技術分類法,讓選型有系統依據;AMD 的 Arbor 提出以樹狀搜尋作為多 Agent 的共享認知空間,讓失敗也成為有用的探索訊號。三篇合在一起,恰好描繪出 2026 年 Agent 平台的三塊基礎設施缺口。

AI Agent Arxiv Digest — 2026-06-23

AI Agent Arxiv Digest — 2026-06-14

今天三篇論文從不同角度切入同一核心問題:**如何在真實部署條件下評估與運行 AI Agent?** Emergence World 建立持續運行數週的多 Agent 沙盒,揭露短期 benchmark 看不到的行為漂移與跨模型交叉影響;Survey 論文為 agent 執行環境設計建立完整分類學(8 屬性 × 8 領域),並提出 symbolic vs. neural 兩種自動合成範式;Martin Monperrus 的 position paper 則直接宣告:coding agent 已達門檻,人工 code review 可以退場了。

AI Agent Arxiv Digest — 2026-06-08

今天三篇分別對應 agent 平台堆疊的三個層次:AgentJet(訓練層)提出讓多個異質 LLM 同步做強化學習訓練的分散式框架,解決現有工具只能單模型訓練的根本痛點;AdaPlanBench(評測層)用 67.75% 的成績上限揭示 LLM agent 在「規則邊走邊揭露」的現實場景中遠未成熟,是第一個系統量化這種適應性規劃能力的 benchmark;Beyond Tokens(通訊層)整理了 multi-agent 系統改用「傳 embedding 而非傳文字」的研究現狀,提供分類框架評估這條新通訊路徑的工程取捨。

ai deep-dive

Agent 安全的同一條裂縫:從 Prompt Injection、信任邊界到 Multi-Agent 蠕蟲

三個聽起來不同的 agent 安全問題——tool output 注入、信任邊界、惡意 agent——根是同一個:LLM 把指令與資料攤平成同一條 token 串流,架構上無法區分。理解這條主線,就能看懂從 EchoLeak(CVE-2025-32711,zero-click)到 Morris II AI 蠕蟲的所有攻擊,以及為什麼「把模型調乖」沒用、只有架構約束(六大設計模式、CaMeL)有用。

ai deep-dive

Deep Research Agent 怎麼蓋:多輪搜尋規劃、衝突調和、可驗證結論

自主研究 agent = 四個可控環節:規劃(拆子問題)、檢索迴圈(search→read→反思 gap→再 search)、證據仲裁(≥2 獨立來源、衝突分型處理)、可驗證輸出(句級引用 + 獨立查核 pass)。兩條路線:訓練派用 RL 端到端學會何時搜(Search-R1 +41%),編排派用 orchestrator-worker 分工(Anthropic 內部評測 +90.2%,代價 ~15× token)。

ai deep-dive

Machine Theory of Mind:Agent 如何推斷其他 agent 的意圖、知識與目標

從觀察行為反推他者的信念/目標/意圖,學界叫 Machine Theory of Mind。三條血脈:符號 BDI、貝氏逆向規劃、深度學習 ToMnet。LLM 時代最大爭議是 ToMBench 上 GPT-4 仍落後人類 >10 分——高分到底是真推理還是統計捷徑。

ai deep-dive

Multi-Agent 的錯誤傳播與恢復:向分散式系統借三十年的武器

每步 99% 準確率、跑 100 步,無錯完成率只剩 36%——錯誤複利是結構問題,不是 prompt 能調掉的。分散式系統的 supervisor tree、bulkhead、circuit breaker、saga、durable execution 幾乎可一對一搬進 agent 編排;但 LLM 多了一種傳統系統沒有的故障——不會 crash 的語意錯誤,得靠 Inspector agent(recover 96.4%)與冗餘投票(MAKER 百萬步零錯誤)補上。

AI Agent Arxiv Digest — 2026-06-01

今天三篇論文聚焦「agent 規模化部署的成本-能力邊界」:SR²AM 重新設計規劃架構,讓 30B 模型少用九成 token 就能競爭 685B-1T 系統;GroupMemBench 揭示現有記憶系統在多人群組對話中徹底崩潰(最強系統只有 46% 準確率,1990 年代的 BM25 關鍵字搜尋反而打贏它);AgentFloor 用 16,542 次測試確認,agent pipeline 大量的短程 tool use 根本不需要大模型。共同主軸:在算力成本壓力下,精確判斷「哪個環節需要多少智慧」已成為 agent 平台設計的核心課題。

AI Agent Arxiv Digest — 2026-05-30

今天三篇分別從「設計語言」、「安全地圖」、「認知侷限」三個面向挑戰 AI Agent 實務:第一篇建立雙軸分類框架,讓工程師和研究者有共同語言溝通 agent 架構的設計取捨;第二篇系統整理 agentic AI 在工具呼叫、記憶體、多步驟執行中的安全與隱私風險全景;第三篇最具衝擊——用近 4 萬個 AI 生成想法的大規模實驗揭示,AI 研究 agent 傾向圍著舊文獻打轉而非真正拓寬科學探索。

AI Agent Arxiv Digest — 2026-05-25

今天三篇圍繞 2026 年 agent 平台最迫切的問題:**多代理系統的安全規範,在執行過程中能維持住嗎?** 2605.10481 命名了一個新失效模式——「約束漂移」(constraint drift):系統設計時寫好的安全限制,會在代理人傳遞、記憶讀寫、工具呼叫過程中悄悄弱化,到輸出端時早已走樣。2605.07728(SARC)提出架構解法:把規範編譯成四個可執行卡關點,嵌進代理人執行迴圈,不再依賴 prompt 提醒,已開源。2605.13851 則用心理學實驗發現:當多代理系統的協調者是「隱形的」,整個系統的保護性行為會顯著下降——這對主流 orchestrator-based 架

ai deep-dive

別人怎麼用 LLM 寫文章:從 Karpathy LLM-wiki 到多 agent pipeline 的取捨筆記

綜述 11 個公開的 LLM 寫作 pipeline,三條主流模式:多 agent(researcher → writer → critic)、Karpathy LLM-wiki(raw + wiki + LLM 寫不手寫)、品質防線(technical verifier + never fabricate + brief gate)。Princeton GEO 論文(KDD 2024)量化了 inline 引用 +28%、加數字 +33%、quote 原文 +41%、關鍵字塞詞 −9%。

ai deep-dive

Claude for Financial Services:拆解 Anthropic 的多 Agent 參考實作

Anthropic 開源了 12 個金融業 Agent + 11 個 MCP connector,最值得抄的不是 Agent 本身,而是『同一份 prompt 雙 runtime』和『純檔案擴充』的分層設計。

ai guide

從 Plan 到 PR:daodao 的 auto-dev agent 實戰

用 5 輪 consensus 寫 plan、再用 team mode 5 worker 並行做完 12 個 task;中間踩了不少坑,記下來給未來的自己跟同樣在嘗試的人看。

ai guide

AI Code Review 走到哪了:從 Cloudflare 的 Multi-Agent 系統看業界現況

Cloudflare 內部跑了 30 天 Multi-Agent Code Review,131K 次 Review、中位數 3 分鐘。這篇整理他們的架構,以及 Anthropic、GitHub、CodeRabbit、Greptile 等業界方案怎麼做同一件事。

ai guide AI Agent 實戰

Agentic Engineering:讓 AI Agent 像真實工程團隊一樣協作

Agentic Engineering 不是讓 AI 寫更快的程式碼,而是讓軟體更快走完整個交付流程——透過多 agent 協作,壓縮跨團隊的協作摩擦。

ai guide AI Agent 實戰

Agentic Engineering 的記憶問題:從類型、實作到擁有權

Agent 的記憶不是一個插件,而是 harness 本身的一部分。選對記憶類型、估算資料量、再決定用什麼技術——最後,也要搞清楚你是否真的擁有那份記憶。

Claw Code:用 Rust 重寫 Claude Code 的開源 CLI Agent

Claw Code 是用 Rust 從零重寫的 Claude Code CLI 替代品,48K 行程式碼、40 個工具、MIT 授權。最驚人的是整個專案在 5 天內由多個 AI Agent 協作完成,上線不到一週就突破 170K stars。

ai guide

clawhip:讓多 Agent 開發不再失控的事件通知路由器

clawhip 是一個 Rust 寫的 daemon,專門把 AI coding agent 的事件(commit、PR、session 狀態)路由到 Discord / Slack,解決多 Agent 並行時「不知道誰在做什麼」的可觀測性問題。

ai guide

oh-my-claudecode:把 Claude Code 變成多 Agent 協作平台的增強層

oh-my-claudecode(OMC)在 Claude Code 上加了 8 種協作模式、19 個專業 Agent、跨模型調度(Claude + Codex + Gemini),讓單人 CLI 工具變成多 Agent 開發平台。支援 Deep Interview 需求釐清、Smart Model Routing 省 30-50% token、rate limit 自動恢復。

ai guide

oh-my-codex:在 OpenAI Codex CLI 上疊加結構化工作流的增強層

oh-my-codex(OMX)不是取代 Codex CLI,而是在它上面加一層結構化工作流——從需求釐清、計畫產出到多 Agent 並行執行,用 4 個核心 Skill 把散亂的 prompt 對話變成可追蹤的開發流程。

ai guide

oh-my-openagent:用多模型 Agent 團隊取代單一 LLM 的編碼框架

oh-my-openagent(OmO)把 OpenCode 從單一 LLM 工具變成多模型 Agent 團隊——Opus 當主力、GPT-5.2 當架構師、Gemini 做前端、Sonnet 查文件,一個 ultrawork 關鍵字觸發全員並行。48K stars,UltraWorkers 生態系中最早建立多 Agent 編碼模式的專案。

ai project

OpenHarness:把 Agent Harness 完整開源的框架

香港大學 HKUDS 開源的 Agent Harness 框架,實作了工具呼叫、技能載入、記憶、權限、多代理協作等完整基礎設施,支援 Anthropic / OpenAI / GitHub Copilot 三種 API 格式。

ai guide

Claude Code Agent Teams 怎麼用?從 GitHub 6,400+ 個 agent 看設計模式

GitHub 上已有 6,400+ 個 .claude/agents/*.md 檔案。我們拆解了 4 個代表性專案——ChemistryTimes(內容生產 pipeline)、claude-sub-agent(document-driven 開發流水線)、agentic(Temporal.io DAG 平行執行)、vs-copilot-multi-agent(Hook 強制記憶寫入)——加上 ruflo 的企業級 swarm 架構,歸納出 6 種設計模式和 5 個實戰趨勢。

ai guide

Skill vs Subagent:Claude Code 兩種 Agent 協作模式比較

Skill 是你手動呼叫的 prompt 模板,Subagent 是 Claude 自動 routing 的獨立 agent。看起來很像,但觸發方式、工具隔離、context 管理完全不同。

ai guide AI Agent 實戰

Anthropic 的 Harness Design:讓 AI Agent 像工程師一樣工作

同一個模型在不同的 harness 設計下會產生截然不同的結果。Anthropic 用雙 Agent 架構、跨 session 狀態檔、GAN 式 generator-evaluator 迴圈,讓 Claude 能自主完成數小時的軟體開發任務。

ai guide

Google 的八種 Multi-Agent 設計模式

Google 整理了八種 multi-agent 設計模式:從最簡單的 Sequential Pipeline 到可組合的 Composite Pattern。不是越複雜越好——選對模式比堆 agent 重要。

ai guide OpenClaw 文件導讀

OpenClaw 多 Agent:一個 agent 是一整個人格邊界,而 agent 現在可以要求生出 agent

一個 agent 是完整的人格範圍——workspace、auth profile、模型登錄、session 儲存全部獨立。但隔離不是絕對的:次要 agent 的 OAuth 憑證過期時,OpenClaw 會回頭讀主 agent 的同名 profile,而 workspace 只是預設工作目錄,不是硬性沙箱。

Claude Code Agent Teams 怎麼用:Team Lead、點對點傳訊與共享任務板

Agent Teams 讓多個完整的 Claude Code session 組成一個團隊:Team Lead 分配工作,teammates 各自擁有獨立 context window,靠點對點傳訊和共享任務清單自我協調。本文講它跟 sub-agent 的三個關鍵差別、teammateMode 兩種顯示模式的取捨,以及 token 成本隨人數線性上升這件事。

ai deep-dive

AI Agent 架構模式完整指南:從三支柱到 Multi-Agent 的系統化導航

AI Agent 不是一個技術,是一整個架構體系。本文是系統化導航:從 Agent 三支柱(Context/Cognition/Action)出發,穿過 AI 工程三階段演化(Prompt → Context → Harness),到八種 Multi-Agent 設計模式和生產級 Harness 基礎設施。每個主題都有對應專文深入。

ai guide RAG 技法大全

Multi-Agent RAG:多個專業 Agent 協作的分散式檢索架構

單一 RAG Agent 處理所有查詢會遇到知識邊界和效能瓶頸。Multi-Agent RAG 把檢索任務分派給多個專業化 Agent,每個 Agent 有自己的知識庫和檢索策略,由中央 Orchestrator 協調合併結果。