Skip to content
所有標籤

#open-source

81 篇文章

AI Agent GitHub Digest — 2026-09-05

mattpocock/skills 單日暴漲 2,757 星,是今天 GitHub Trending 漲最快的專案;Anthropic 官方 anthropics/skills 與開源 coding agent anomalyco/opencode 同步在榜。另一頭,MCP server reverify 用 71 個真實 Windows 系統檔案的 benchmark 證明:AI 讀 binary 時有 97% 機率在瞎掰,唯有確定性工具能攔下來。框架端 pydantic-ai、agno、haystack 今天都只有例行 patch,無重大更新。

AI Agent GitHub Digest — 2026-09-04

github/spec-kit 滿一年衝上 1.0.0,維護者特別強調穩定性讓位給適應力;stablyai/orca 讓你在各自 git worktree 同時跑一整支 coding agent 艦隊,單日狂漲 812 星;KeygraphHQ/shannon 3.0 上線,AI agent 自動滲透測試直接出 SARIF 報告接 CI/CD。瀏覽器端 ChromeDevTools/chrome-devtools-mcp 把官方 MCP server 開給任何 agent 操作 Chrome。框架端 Pydantic AI v2.38.0 改了一次性 capability 的合併規則(breaking),Claude Code v2.1.259 修掉多 session 互蓋設定的老問題。

AI Agent GitHub Digest — 2026-09-03

NousResearch/hermes-agent 靠自我學習迴圈記住怎麼用你的工具、跨平台記得你是誰,239,994 星持續衝榜;pacifio/atlas 讓多個 coding agent 共用一套「看得到是誰改的」版本控制,一天漲 895 星;blader/humanizer 用 35 種模式把 AI 味洗掉但不竄改事實。文件處理端 firecrawl/pdf-inspector 用 Rust 在 50ms 內判斷 PDF 要不要 OCR;superlinked/sie 把 agent 會用到的所有模型收進一個自架推理叢集。框架端 AG2 v1.0.3 全面遷移 MCP 2.0(breaking change),並加入不靠 LLM 判斷的 TealTigerMiddleware 做 prompt injection 防護。

AI Agent GitHub Digest — 2026-09-02

openclaw/openclaw 這款自架個人助理已經衝上 38 萬星,用單一 Gateway 串起 WhatsApp/Telegram/Slack 等聊天管道;同一週 NVIDIA 端出 SkillSpector,專門掃描 Claude Code/Codex/MCP skill 裡的 71 種漏洞模式,研究指出 26.1% 的 skill 有漏洞、5.2% 疑似惡意。另外 stablyai/orca 把多 agent 平行開發做成完整 IDE,VectifyAI/PageIndex 則用推理式樹狀索引挑戰「RAG 一定要向量資料庫」的預設。claude-code v2.1.257 新增 Containment Escape 安全規則,agno v3.0.5 把 embedding 失敗從默默吞掉改成如實回報。

AI Agent GitHub Digest — 2026-09-01

HKUDS/nanobot 半年內衝上 4.7 萬星,示範「小核心+多管道+長期記憶」的自架個人 Agent;zhayujie/CowAgent(前身 chatgpt-on-wechat)用三層記憶架構和 Deep Dream 夜間蒸餾把老牌聊天機器人重生為完整 Agent Harness;conductor-oss/conductor 把耐久執行圖形引擎接上原生 MCP 工具呼叫,讓 agent 迴圈撐過當機或數週人工審核;mksglu/context-mode 直擊 MCP 工具呼叫塞爆 context window 的痛點,衝上 HN 第一。agno v3.0.4 是唯一達標的框架更新,把 KnowledgeManagementTools 的 ingest_path 改成預設關閉以堵安全缺口。

AI Agent GitHub Digest — 2026-08-31

can1357/oh-my-pi 從知名 coding agent「Pi」fork 出來,靠死磕工具呼叫格式讓 Grok Code Fast 1 的任務成功率從 6.7% 衝到 68.3%;K-Dense-AI/scientific-agent-skills 把 163 個科研技能開放給任何相容 Agent Skills 標準的 agent;addyosmani/agent-skills 把資深工程師的六階段開發流程包成技能包,一週衝上 9 萬星;THU-MAIC/OpenMAIC v1.0.0 加入對話式 Pro workbench,把 multi-agent 落到課程內容產製這個具體垂直場景。框架端 agno v3.0.2 是本次唯一達標的重要更新:直接把 Agent/Team/Workflow 發布成具名 MCP tool,同時有多筆 breaking changes。

跟成熟 coding agent 學設計:系列總覽——拆五個專案的原始碼,蓋自己的 agent

我在寫自己的 Python coding agent「looplane」,這個系列把 pi、oh-my-pi、opencode、codex、claude-code 五個成熟專案的原始碼逐題對照,也對照 Looplane 現在已經落地的 TUI、外部 CLI runtime、local gateway、usage/OTel/session 工具與 Cloudflare 切片。每篇固定走「設計問題→五家做法→looplane 選擇→學術依據→改善路線」五段,證據一律給到 file#symbol 層級。

AI Agent GitHub Digest — 2026-08-30

Google 官方的 ChromeDevTools/chrome-devtools-mcp(5 萬星)讓 coding agent 直接操控真實 Chrome 做效能分析與除錯;abhigyanpatwari/GitNexus 用純瀏覽器端知識圖譜取代「讀程式碼靠猜」;mksglu/context-mode 專攻 coding agent 的 context window 浪費問題;google/skills 是 Google 自家的官方 Agent Skills 套件庫;livekit/agents 語音 agent 框架持續活躍。框架端 pydantic-ai v2.36.0 加入 `@durable_operation`,讓第三方 durable execution 引擎可插拔進來。

ai deep-dive

screenshot-to-code 怎麼把截圖變程式碼:Agent Loop、素材裁切、視覺驗證

screenshot-to-code 不是一步到位的截圖轉碼工具。核心是一個最多 30 步的 Agent Loop,搭配 7 個工具——從截圖裁切真實素材、用 Playwright 自我驗證、到同時跑 4 個模型讓使用者選最好的版本。GitHub 74,500+ stars,MIT License。

AI Agent GitHub Digest — 2026-08-29

calesthio/OpenMontage 用 12 條產線、700+ 個 skill 檔把通用 coding agent 變成影片後製棚,本週衝上 5 萬星;Anthropic 官方外掛市集 claude-plugins-official 單日 +292 星;rohitg00/agentmemory 用 BM25+向量+知識圖譜做 coding agent 跨 session 記憶,自家 benchmark 宣稱 LongMemEval-S R@5 95.2%;sodiumsun/agenttrail 幫 Claude Code / Codex / Cursor 做本機即時任務地圖。今日框架端無重大 release。

AI Agent GitHub Digest — 2026-08-28

thedotmack/claude-mem 用壓縮記憶讓 context 跨 session 存活,總星數破 9 萬;volcengine/OpenViking 把記憶/RAG/skills 統一成用 viking:// 協定瀏覽的虛擬檔案系統,本週 +3,078 星;apache/maka 進 Apache Incubator,把 agent 執行過程做成可回放的 event-sourcing log;K-Dense-AI/scientific-agent-skills 讓 17.5 萬科學家用 163 個 skill 把通用 coding agent 變成領域專家。Haystack v3.1.0 加入 AgentTool 支援多 agent 委派。

AI Agent GitHub Digest — 2026-08-27

deepseek-ai/deepseek-harness(dsh)用 Cordis 外掛架構把「模型/工具/沙箱/記憶」全部做成可替換元件,developer preview 上線一週已逼近 20 萬星;PrimeIntellect-ai/prime-agent 用 Recursive Language Model 架構做長跑研究型 coding agent,靠持久 IPython session 撐過終端機斷線;liqiwa/mcp-radar 反過來做這類 digest 的自動化版本,每天掃 GitHub 排名新出現的 MCP server。框架端 Mastra 1.61.0 補上可撐過當機的背景任務佇列,ComposioHQ/composio 0.17.0 把 SSRF 防護延伸到工具執行下載與 S3 上傳。

ai deep-dive 認識 AI 模型

2026 Coding Benchmark 怎麼讀:SWE-bench、Terminal-Bench、DeepSWE、Aider 各自測什麼

每個模型發布都帶 benchmark 數字,但同一個模型在不同 harness 上可以差 20 分、SWE-bench Verified 的 32% 驗證器判斷有誤、DeepSWE 113 題讓多數模型掛零。這篇拆解六個主要 coding benchmark 各自測什麼、哪些容易灌水、讀者該看哪個。

ai deep-dive 認識 AI 模型

MoE 為什麼贏:從 Ornith 到 MiniMax,2026 年前沿模型都在用的架構

2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。

ai deep-dive

OLMo:唯一連訓練資料都開源的語言模型家族

Allen AI 的 OLMo 是目前唯一把權重、訓練資料(Dolma,9.3 兆 token)、訓練程式碼、所有中間 checkpoint 和評估工具全部公開的語言模型家族。OLMo 3 的 32B Think 模型在 MATH 跑到 96.1%,同時你可以用 OlmoTrace 追溯任何輸出回到訓練資料的哪一段。

ai deep-dive 認識 AI 模型

開源 AI 授權地雷指南:MIT、Apache 2.0、Llama License 到底差在哪

AI 的「開源」不等於軟體的開源。MIT 和 Apache 2.0 真的隨便用;Llama License 超過 7 億月活要另外談;舊版 Gemma 授權 Google 可以片面修改(Gemma 4 已改 Apache 2.0)。這篇按授權類型整理你能做什麼、不能做什麼。

ai deep-dive 認識 AI 模型

後訓練 RL 三條路線:Ornith、Nous Research、MiniMax 怎麼用強化學習做出黑馬模型

2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。

AI Agent GitHub Digest — 2026-08-26

tinyhumansai/openhuman 用本地優先的 Memory Tree 壓縮數位生活、指揮多個 agent,早期 beta 已衝上 3.7 萬星;Vercel Labs 的 fx 用 Zig 寫出不到 8 MiB 的原生 coding agent CLI;NVIDIA 開源 labs-OO-Agents,把 agent 的 prompt/tool/workflow 收進單一 Python class;CopilotKit/OpenBot 把 agent 包進容器並加上治理閘門,動作先審後動。Agno v3.0.0 是需要跑資料庫遷移的重大 breaking release,Haystack v3.1.0 新增多 agent 委派工具 AgentTool 和上下文壓縮 CompactionHook。

tech deep-dive AI 模型家族

MiniMax:聊天機器人公司做出的 Coding 模型,性價比碾壓閉源

MiniMax 從消費級聊天 App 起家,M2.5 在 SWE-bench Verified 拿 80.2% 但 API 價格只有 Claude Opus 的 1/10-1/20;M3(456B 總量 / 45.9B 啟用)是首個在 SWE-bench Pro 突破 59% 的開源權重模型,還有 1M context。

tech deep-dive AI 模型家族

Nous Research:從研究社群到開源 AI 生態系的反叛者

Nous Research 不預訓練,只做 fine-tuning 和 RL——Hermes 4 在 MATH-500 拿 96.3%,NousCoder-14B 只用 24K 樣本就把 Qwen3-14B 的 coding 能力拉高 7%。但真正的護城河是 Hermes Agent 框架:236K GitHub stars,全球第 19 名,3,000 位貢獻者。

tech deep-dive AI 模型家族

Ornith:小團隊用自我改進 RL 做出的開源 Coding 黑馬

DeepReinforce 用 self-improvement RL 訓練的 Ornith 1.5 家族:397B 旗艦在 SWE-bench Verified 拿 86.0 追平 Claude Opus 4.8,35B-A3B 每 token 只啟用 3B 參數卻在同量級 coding benchmark 全面領先,9B 版本可以跑在手機上。MIT 授權、完全開源。

AI Agent GitHub Digest — 2026-08-25

Panniantong/Agent-Reach 用一支 CLI 包住 yt-dlp、twitter-cli 等工具,讓 agent 讀遍 Twitter/Reddit/YouTube/Bilibili;LangChain 官方推出 deepagents,把檔案系統、sub-agent、skills 打包成開箱即用的 harness;Tracer-Cloud/opensre 把「AI SRE agent」做成有評分 RCA 題庫的框架;Anthropic 的 claude-plugins-community 市集靠審核流程幫社群外掛做信任背書,單日 +490 星。GitHub Copilot CLI v1.0.81-8(pre-release)加上 Grok 4.6 xhigh 推理與外掛即時熱重載。

ai deep-dive

Marin 535B 怎麼訓:Scaling Ladder、MoE 專家並行、Harrier 資料與 W&B 現場

Stanford Marin 在 11×GB200 上公開訓練 535B-A23B,先用 1% 算力的 5 階 Scaling Ladder 預註冊 paloma macro-loss 2.04,再以 W&B 即時公開 847 組訓練數據;本文按訓練流程拆解其設計與監控方法。

AI Agent GitHub Digest — 2026-08-24

duty1g/x64dbg-mcp-server 把逆向工程除錯器包成 MCP 工具,兩天衝上 563 星;Cripacx/mediagen 把歐盟 AI 法案要求的內容標記做進生圖 MCP server;QwenLM/qwen-code v0.22.0 公開 SWE-bench Verified 完整測試軌跡,77.08% 過關;open-gitagent/gitagent 把核心引擎搬到 Rust 重寫,agent 狀態整個活在 git repo 裡。框架端,GitHub 官方 MCP Server v1.10.0 是一次資安大掃除,`--tools` 打錯名稱現在會直接讓 server 啟動失敗。

tech deep-dive AI 模型家族

DeepSeek——從 MoE 實驗室到 OpenRouter 用量第一的開源王者

DeepSeek 用 MLA + MoE 兩項架構創新把推論成本壓到業界最低,V4 Flash 以 13B 活躍參數跑出接近前端模型的品質,成為 OpenRouter 用量第一。這篇追蹤從 V1 到 V4 的演化、R1 推理線的分叉、以及每個版本該怎麼選。

tech deep-dive AI 模型家族

GLM——從清華實驗室到 744B 開源旗艦,以及 GLM-5.3 的資安突襲

GLM 是智譜 AI(Z.ai)推出的開源 LLM 家族,源自清華大學 KEG 實驗室。GLM-5.3(2026/08)在 coding benchmark 比前代提升 50%,CyberGym 84.5% 超過 Anthropic Mythos 5 與 OpenAI GPT-5.6 Sol,在 Artificial Analysis Intelligence Index 得分 60 與 Kimi K3 並列開源第一。它是目前唯一完全在華為昇騰晶片上訓練出的前沿開源模型。

tech deep-dive AI 模型家族

Grok——從 314B 開源賭注到 Grok 4.6/Build/Imagine,xAI 的分發驅動追趕

Grok 是 xAI 的 LLM 家族,2023/07 成立、2024/03 以 314B MoE Apache 2.0 開源起手,兩年半迭代到 Grok 4.6(500K、$2/$6、四檔推理)與 2M 的 Grok 4 Fast;另有 Imagine 圖像/影片與 Grok Build 終端 coding agent——護城河在分發(X / grok.com / Tesla / Bedrock),而非單點模型能力。這篇追蹤 Grok 1→4.6 的演化、子線定位、定價與授權陷阱。

tech deep-dive AI 模型家族

Kimi——從 200K 長文本工具到 2.8T 開源前沿,以及 K3 的架構躍進

Kimi 是月之暗面(Moonshot AI)推出的 LLM 家族,以超長 context 起家。2026 年 7 月發布的 Kimi K3 是全球首個開源 3T 級模型——2.8T 參數、104B 活躍、1M context,在 Artificial Analysis Intelligence Index 得分 60 與 GLM-5.3 並列開源第一。其 Kimi Delta Attention 架構帶來 2.5 倍 scaling 效率提升。

tech deep-dive AI 模型家族

Llama——從開源實驗到部署量最大的開源 LLM,以及 Meta 的閉源轉向

Llama 是 Meta 推出的開源 LLM 家族,以企業部署量最大、生態最成熟聞名。Llama 4 Scout(10M context)和 Maverick(17B active / 400B total MoE)是目前的開源多模態標竿,但 Meta 已在 2026 年 4 月轉向閉源 Muse Spark——Llama 4 很可能是最後一個主要的開源 Llama,且授權不是真正的開源(Llama 4 Community License,月活超 7 億需另外授權)。

tech deep-dive AI 模型家族

Mistral——歐洲的開源 AI 挑戰者:用更小模型和歐洲主權打一場不一樣的仗

Mistral 是歐洲最成功的 AI 新創,以「更小、更快、更便宜」的策略和歐洲資料主權定位在 AI 市場殺出血路。Mistral Large 3 是歐洲最強的商用 LLM,Small 4 是 24B 級別的效率之王,Medium 3.5 則是專為 agentic coding 優化的 Modified MIT 開源模型。它的護城河不是技術規模,而是「歐洲合規」這張牌。

tech deep-dive AI 模型家族

Qwen——從 0.8B 到 2.4T 全尺寸開源,HuggingFace 下載量王者的雙軌打法

Qwen 是 HuggingFace 下載量最高的模型家族,尺寸從 0.8B 一路涵蓋到 2.4T。2026 年 8 月阿里首度開源 Max 級旗艦權重(Qwen3.8-2.4T-A95B),但授權換成了自訂條款而非慣例的 Apache 2.0;同期開源、筆電就能跑的原生視覺模型 Qwen3.8-27B 反而是新面孔裡唯一的 Apache 2.0。這篇追蹤 Qwen 從 2023 年到 3.8 世代的演化、開源線與商用線的分家邏輯,以及每一層該怎麼選。

tech guide AI 模型家族

AI 模型用途總覽——2026 年你該知道的模型地圖

2026 年 AI 模型按用途分成七大類、20+ 個子用途。這篇是「AI 模型家族」系列的導讀地圖——從用途找模型、從模型找家族,附每個用途的選型建議和最新排名。

AI Agent GitHub Digest — 2026-08-23

CopilotKit/OpenBot 用 AG-UI 協定包出「每個都有自己電腦」的 AI coworker 框架,一週衝上 2,289 星;Bruno 官方 MCP server(usebruno/bruno-mcp)比社群版(Ostico/bruno-mcp-studio)晚兩個月才補上;browser-use 團隊另開 macOS Harness 專案,用六個 accessibility 原語讓 LLM 直接操控 Mac;搬到 Anomaly 底下的 opencode 星數(約 19.9 萬)已經超過 Anthropic 自家 Claude Code(約 14.2 萬)。框架端,MCP TypeScript SDK v2 把單一套件拆成 8 個子套件,並跟進協定的 stateless 改版,拿掉了 session handshake。

2026 下半年 Harness 大戰:八大框架重寫、三家模型商入場,110+ CLI 怎麼看

2026 年 8 月,不只五個框架在動。OMP 2、Pi v2、Opencode 2、dsh、Claude Code 之外,Google(Antigravity CLI)、Meta(Muse Code)、xAI(Grok Build)三家模型商直接下場做 coding agent,加上 Amp、Cline 2.0、Codex CLI Rust 重寫,共八個以上框架同時有架構級變動。再算進 110+ 個 CLI 工具,H2 2026 是 harness 方法論的分裂期。本文從四條架構路線、一個共同方向、一場信任危機拆解。

ai deep-dive

Helicone 深入介紹:把 LLM Gateway、請求追蹤與成本分析放在一起

Helicone 是開放原始碼的 LLM Gateway 與觀測平台:請求經過相容端點後,自動留下模型、延遲、token、成本與自訂欄位;它也能用 managed credits 或 BYOK 路由與 fallback。

ai deep-dive

OpenViking:把 Agent 記憶做成虛擬檔案系統

火山引擎開源 OpenViking 把 agent 的記憶、知識、技能存成 viking:// 虛擬檔案系統,用 ls、tree、find 就能翻。三層載入(L0/L1/L2)讓平均檢索只用 550 tokens,LoCoMo 記憶準確率從 24–57% 提升到 80–83%。

ai deep-dive

Steel Browser:Agent 的開源瀏覽器 API 與自架邊界

Steel 用 Apache-2.0 runtime 把 Chromium session、CDP、proxy、stealth 與除錯介面包成同一套 browser API;公開 repo 約 7,400 stars,並在 2026 年進入 Stripe Projects developer preview。單機自架適合開發與資料邊界,Cloud 才解決高併發、託管 proxy、CAPTCHA、錄影與 SLA。

AI Agent GitHub Digest — 2026-08-22

HKUDS/nanobot 靠 v0.3.0「The Agency Release」7 個月衝上 4.7 萬星,主打個人自架 agent runtime;genspark-ai/genoffice 用開源桌面應用做 AI 辦公套件,三週破 3,400 星;NVIDIA 發表 labs-OO-Agents(NOOA),把 agent 狀態收進單一 Python class;MCP server repo-context-mcp 幫 coding agent 讀 repo 不用整包塞進 prompt。框架端 Mastra 1.60.0 補上 durable execution 與 Cloudflare Sandbox;pydantic-ai v2.33.0 因 anthropic SDK 升級 httpx2 而有 breaking change。

DeepSeek Harness(dsh):把 Everything is a Plugin 做到底的 coding agent 框架

DeepSeek Harness(dsh)是 DeepSeek 官方的開源 coding agent 框架,2026-08-13 發布 v0.1 開發者預覽版,9 天內累積 184,000+ 星。核心是 Cordis plugin kernel——模型、工具、agent loop、UI 全部都是可抽換的外掛。四種 runtime 模式,能把 Claude Code 和 Codex 當子代理使用。Web UI 優先,目前沒有原生 CLI。

OMP 2(Oh My Pi 2):從 Pi fork 到全 Rust 重寫的獨立 coding harness

OMP 2 不再是 Pi 的 fork。整個 codebase 用 Rust 從零重寫,約 41 個 crate 涵蓋自製 bash 引擎、GPU 加速 GUI、嵌入式 CPython 3.14t、gRPC transport 與 Kokoro-82M TTS。目前 pre-release,尚未正式發行。

Opencode 2:Bun 換 Node、Tauri 換 Electron、API 全部打掉重練的代價

Opencode 2 是 Anomaly(Dax Raad)主導的大重寫。runtime 從 Bun 換成 Node.js(記憶體問題)、桌面從 Tauri 換成 Electron(WebKit 效能與 Node 整合)、v1 API 刻意不相容。新增多分頁並行 session、持久化後端服務、HTTP API + SDK。目前 beta,預估 2026 年 9 月 stable。約 200K stars。

Pi v2:AgentHarness API 升穩、Earendil 公司化,極簡主義走進下一章

Pi v0.84.0(2026-08-06)把 AgentHarness v2 API 升為 stable。Lane-based v4 Session model 讓操作可持久化、可中斷。CBOR 取代 JSON,Unix socket 取代 HTTP。背後的 Earendil Inc.(Armin Ronacher 的 PBC)拿到首輪資金。95.4K stars,still MIT,still 極簡。

Tavily 和 Exa 不能自己架:要怎麼自己組一套

Tavily 和 Exa 都是純雲端 API,不能自己架。能自己組的是 SearXNG(269 個上游引擎、82 個預設開啟)+ Crawl4AI(78.8k stars、Apache-2.0),現成的 Tavily 相容 wrapper 都還是幾十顆星的個人專案,不建議直接用。但 SearXNG 沒有自己的索引,而且從機房 IP 跑會被搜尋引擎打成空結果——這兩件事決定了自架划不划算。

AI Agent GitHub Digest — 2026-08-21

Cursor 開源官方外掛市集 cursor/plugins,用 plugin.json + skills + MCP 定義把生態標準化,一天 +470 星;apache/maka 進 Apache 孵化器,用 append-only 事件日誌記錄 agent 的每次工具呼叫與權限決策,主打可稽核的 local-first 工作台;magnitudedev/magnitude 幫你自動偵測硬體、下載並在本機跑模型,開箱即用的離線 agent;vercel/eve 把 agent 能力放進 tools/、skills/、schedules/ 等慣例目錄,檔案系統就是介面。框架端 pydantic-ai 補了 v2.32.1 patch。

Supabase:把整個後端建在 PostgreSQL 上的平台

Supabase 不只是 Firebase 的開源替代,它的核心設計是把 Auth、Storage、Realtime 全部建在 PostgreSQL 的 schema 和 WAL 上。結果是:你可以用一條 SQL 查所有東西,pgvector 直接用,agent 寫 SQL 就能操作整個平台。108k GitHub stars、Apache 2.0 授權、Free 方案 500 MB 資料庫。

AI Agent GitHub Digest — 2026-08-20

Volcengine(字節跳動旗下)開源 OpenViking,用 viking:// 虛擬檔案系統取代黑盒向量搜尋做 Agent 記憶,官方測試把準確率拉到 80%+ 同時省 34–91% token;munder-difflin 把多個 coding CLI 包成桌面辦公室、用共享記憶層互相協作;ai-memory 用 Rust MCP server 解決『換 CLI 就失憶』的痛點;mukul975 的資安技能包一天內衝到近 2.8 萬星。pydantic-ai v2.32.0 補強 OpenRouter/xAI 附件搜尋與 instrumentation。

AI Agent GitHub Digest — 2026-08-19

DeepSeek 開源的 agent harness「dsh」8/13 發布一小時內破 2 萬星,目前累積約 15.8 萬星,社群兩天湧入 2000+ 外掛提案;核心是 Cordis 驅動的「一切皆插件」架構,甚至能把 Claude Code、Codex 當子 agent 呼叫。RightNow-AI 用 Rust 從 OS 層級重新定義 agent(openfang),網易有道推出建立在 OpenClaw 之上的桌面 Agent LobsterAI,PrimeIntellect 的 prime-agent 主打自我改進推理迴路。CrewAI 1.15.16 補強 execution context 追蹤與 flow 錯誤記錄。

Aider:最老牌的終端 AI Pair Programmer,以及它現在的維護狀況

Aider 是 2023 年就存在的終端 AI pair programmer(Python、Apache-2.0、約 48.3k stars),設計上跟現在的自主 agent 走反方向:手動 /add 檔案控制 context、每次修改自動產生一個 atomic git commit、architect/editor 雙模型分工。但要注意維護節奏:最後一版 PyPI 發布是 2026-02 的 0.86.2,最後一筆 commit 在 2026-05,官網仍推薦 Claude 3.7 Sonnet 與 o1。

omp(Oh My Pi):把 Pi 的極簡主義翻過來的 batteries-included 分支

omp 是 Pi 的 fork,但不只是插件層堆疊:它多了約 80,000 行 Rust,把 grep/shell/AST/PTY 全部搬進 in-process。內建工具從 Pi 的 7 個變成 31 個,外加 14 個 LSP op、28 個 DAP op、60+ 供應商。同一份 codebase,兩個相反的賭注。

ai deep-dive

自架常駐個人 agent 橫向對照:九個專案,同一個安全問題的九種答案

OpenClaw 386k star、Hermes Agent 232k,但 OpenRouter 上 Hermes 的日 token 量在 2026-05-10 就反超了(224B vs 186B)。這半年冒出來的九個自架 agent 不是九個競品,是對同一題的九種答案:agent 的執行邊界該畫在哪。CVE-2026-44112 打穿的是 OpenClaw 的沙箱本身,而 Meta 對齊主管那次刪信事故裡連攻擊者都沒有——安全指令是被 context 壓縮吃掉的。

AI Agent GitHub Digest — 2026-08-18

headroom 把送進 LLM 前的 tool output/log/RAG chunk 先做本地、內容感知的壓縮,7 個月衝上 6.6 萬星;agentmemory 讓 Claude Code、Cursor、Codex CLI 等十幾種 coding agent 共用同一份跨會話記憶,半年衝上 2.7 萬星;Andrew Ng 團隊的桌面 agent OpenWorker 把目標使用者從工程師擴大到一般知識工作者;NVIDIA 的 labs-OO-Agents 用物件導向重新設計 agent 抽象。Mastra 1.59.0 把 CostGuardProcessor 更名 TokenCostControl(breaking),browser-use 0.13.8 加入第一方 OpenClaw skill 支援。

AI Agent GitHub Digest — 2026-08-17

forge 給自架 LLM 的 tool-calling 加一層可靠性 middleware,可直接代理 opencode/aider/Claude Code 免改程式;repo-context-mcp 用 MCP 提供 token 預算化的 repo context 打包,上線 5 天就做進 PR CI;DeepSeek 官方 harness dsh 一週內冒出至少 5 個獨立社群桌面包裝版,合計逼近 1,500 星;微軟研究院的瀏覽器 agent 框架 Webwright 靠 Skill Factory 把解過的任務蒸餾成免模型呼叫的可重跑腳本,在 WebArena 上拉高 15 個百分點的重用準確率;Mastra 1.59.0 把 CostGuardProcessor 更名 TokenCostControl(breaking),Pydantic AI v2.30.0 修了本機 web chat 介面的 DNS rebinding 資安漏洞。

ai deep-dive

microsoft/AI-Engineering-Coach 的 45 條規則:一份把 agentic 工程意見寫成可執行門檻的清單

微軟員工開源的 VS Code extension,讀本機 Claude Code / Codex / OpenCode 的 session log。真正的內容物是 45 條 Markdown 規則:prompt 短於 30 字元、收到 20 行 AI 程式碼後 15 秒內就送下一則、instructions 檔超過 4000 bytes——把「context engineering」翻成可以爭論的數字。

ai deep-dive 文件解析實戰

掃描 PDF 實測:10 種解析工具丟進考古題,結果差多少?

用 4 份台大碩班掃描考古題實測 10 種開源 PDF 解析工具。VLM 類(Firecrawl、MinerU 3.4、Marker v2)在公式和程式碼上全面碾壓傳統 OCR,但安裝踩坑才是真正的門檻——MinerU 舊包名會進依賴地獄、Marker 首次模型下載要 10 分鐘、PaddleOCR 缺引擎。實務推薦兩階段策略:RapidOCR 粗篩 + MinerU/Firecrawl 精查。

AI Agent GitHub Digest — 2026-08-16

Vercel 推出 filesystem-first 的 TypeScript agent 框架 eve,深度綁定自家 AI Gateway/Sandboxes;Prime Intellect 的 Prime Agent 把整個對話 context 當程式變數,搭配可自我改寫的 Continual Harness;aden-hive 的 Hive 用『複製 Queen』取代預先編譯的執行圖;HKUDS 的 nanobot 靠 v0.3.0 Agency Release 半年內衝上 4.7 萬星。今日 watchlist 框架無重大版號更新。

ai deep-dive

X 演算法開源:權重公開之後,反而更清楚黑箱在哪

2026-08-13 的發布新增 363,246 行,首次公開 For You 的排序權重:favorite 0.5、reply 5.0、report −234.0。但權重是常數,真正決定順序的 P(action) 來自一個 2560 維、8 層的 transformer。

PX4 還是 ArduPilot:真正的分岔在授權條款

把兩套都 clone 下來各 build 一次之後,有三件事跟原本的認知不一樣:ArduPilot 的 EKF3 檔頭直接寫著推導來自 PX4/ecl,兩套在最難的那一層是同源的;PX4 近一年的提交來自公司網域(Auterion 一家 380 筆),ArduPilot 來自個人信箱且一個人佔 37%;而真正決定選哪個的不是效能,是 BSD-3 vs GPLv3 與你要改的是哪一層。

ai deep-dive 文件解析實戰

anydoc:14 種辦公格式轉 Markdown,Firecrawl 用 Rust 給的另一個答案

Firecrawl 開源的 Rust 轉檔函式庫,14 種辦公格式(含 .doc / .ppt / .xls 老格式)統一轉 GFM,中位耗時 4.7ms,同樣計時條件下比 Docling 快 109 倍。代價是完全不碰 OCR。

ai deep-dive 文件解析實戰

解析層:當結構要用模型推斷——而授權才是真正的選型軸

掃描件與複雜版面只能靠模型推斷結構。但 MinerU、Marker、Docling 的技術差距遠小於授權差距——MinerU 過 $20M 月營收要另談授權、Marker 的模型權重過門檻要付費、只有 Docling 是乾淨的 MIT。選型先看 LICENSE,再看 benchmark。

ai deep-dive 文件解析實戰

文件解析的三層階梯:轉換、抽取、解析,先選對層再選工具

把文件餵給 LLM 之前,最常見的錯誤不是選錯工具,是選錯層。結構已經在檔案裡的用轉換層(毫秒級),有文字沒結構的用抽取層,連文字都要推斷的才用解析層——anydoc 的 4.7ms 到 Docling 的 513.6ms 差 109 倍,多數人卻直接跳最貴的那層。

ai deep-dive 文件解析實戰

確定性抽取層:不用任何模型,先解決八成的 PDF

數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。

tech deep-dive

手繪風 SVG 圖示的三條路:近 9 萬個免費圖庫、把 Lucide 弄歪的生成器,還有那張沒人看的授權頁

Koboyo 宣稱有近 9 萬個免費手繪 SVG(數字上下跳動:92,967 → 87,954 → 90,150),但 sitemap 只列得出約 17,930 個圖示頁,而且授權頁明文禁止拿去做圖示庫或畫布 app。想要手繪感其實有三條路:收圖庫、用程式把既有幾何弄歪(sketchyicons 把 Lucide 的每條直線轉成二次貝茲,用 icon 名稱當亂數種子確保 byte-for-byte 一致)、或 AI 生成。這篇比較七家圖庫的規模與授權、拆解 sketchyicons 與 tldraw 的生成演算法,並整理正在往 MCP 靠的圖示搜尋工具。

AI 爬蟲工具全景圖:34 個開源專案的五大分類與選型指南

從 MarkItDown (175k stars, MIT) 到 curl_cffi (6k stars),整理 34 個「爬資料餵 AI」的開源工具。沿五條軸線分類:整站爬取、AI 瀏覽器代理、文件轉檔、智慧擷取、反偵測基建。選型關鍵不是哪個最好,是場景匹配。

ai deep-dive

HyperFrames 深度解析:HTML 即影片,Agent 時代的影片製作範式轉移

HeyGen 開源的 HyperFrames 用 HTML data 屬性定義影片時間軸,headless Chrome 逐幀 seek 截圖再由 FFmpeg 編碼成 MP4。3 個月 33k stars,Apache 2.0,21 個 agent skills——AI agent 寫 HTML 就能產影片,不需要 React。

ai deep-dive

Text / Image to Lottie:AI 動畫生成工具全景導讀

從 CLI 工具 kin3o 到 CVPR 2026 論文 OmniLottie,盤點把文字和圖片轉成 Lottie 動畫的開源路徑,附效能基準與選型建議。

tech deep-dive

AI 驅動的 E2E 測試:canary、Stagehand、Magnitude、Shortest 的不同解法

AI agent 跑測試不可重現、手寫 Playwright 難維護——2024-2025 年出現四套工具各自解決這個兩難,設計哲學差異很大。

ai deep-dive

Open Design:11 天 fork 出來的 Claude Design 開源替代品

Anthropic 2026-04-17 發 Claude Design,4-28 nexu-io/open-design 公開,同樣的 artifact-first loop、Apache-2.0、跑在你已經有的 16 個 coding-agent CLI 上。兩週從 0.1 到 0.7、40k+ stars。把 AI 設計工具從 vertical SaaS 攤平成 skill bundle 的範式轉移。

ai deep-dive

system_prompts_leaks 導讀:40k star 的 AI 系統提示 archive 在解什麼問題

asgeirtj/system_prompts_leaks 蒐集 40 多個 AI 助理的 system prompt 原文,從 GPT-5.5、Claude Opus 4.7 到 Gemini 3.1 Pro 都有,40.3k stars、461 commits、MIT 授權。價值不在於拿到秘密,而在於把廠商的隱性政策變成可比對的工程素材——要學的是設計決定,不是文字本身。

Warp:從現代終端機到 Agentic Development Environment

Warp 從一個用 Rust 打造的現代終端機,演化成整合 AI Agent 的開發環境(ADE),2026 年 4 月開源,目前擁有 70 萬開發者使用者。

goose:開源、跨平台、不鎖 LLM 的本地 AI Agent

goose 是由 Linux Foundation 旗下 AAIF 維護的開源 AI Agent,支援 15+ LLM 供應商、70+ MCP 擴充,用 Rust 打造桌面 App + CLI + API,定位是不鎖廠商、可自架的 Claude Code 替代方案。

AEO / GEO 工具全景:輸入面、流量面、輸出面——從 isitagentready 到 aeo-radar 到 Profound

AEO/GEO 工具不是單一類別,而是三個面向:輸入面(網站有沒有準備好給 AI 讀)、流量面(AI bot 實際爬了多少)、輸出面(品牌在答案裡怎麼被提到)。這篇把三面向、從開源自架到商業 SaaS 的工具一次攤開。

tech project

DeerFlow:字節跳動開源的超級代理框架,把 Agent 做成可長跑的研究系統

DeerFlow 是字節跳動開源的 Super Agent Harness,基於 Python 3.12 + LangGraph,透過沙箱、長期記憶、子代理、技能與訊息閘道協調長時任務。2026 年 2 月登上 GitHub 趨勢榜第一,目前超過 63,000 星,支援 Telegram/Slack/飛書等 IM、Claude Code 整合與多種搜尋後端。

ai project

Vercel Open Agents:把 coding agent 從你的筆電搬到雲端

Vercel Labs 開源的 coding agent 參考實作。三層架構分離 web UI、agent workflow、sandbox VM,設計給想自建 Claude Code / Cursor Background Agent 的團隊當起手。

Claw Code:用 Rust 重寫 Claude Code 的開源 CLI Agent

Claw Code 是用 Rust 從零重寫的 Claude Code CLI 替代品,48K 行程式碼、40 個工具、MIT 授權。最驚人的是整個專案在 5 天內由多個 AI Agent 協作完成,上線不到一週就突破 170K stars。

ai project

OpenHarness:把 Agent Harness 完整開源的框架

香港大學 HKUDS 開源的 Agent Harness 框架,實作了工具呼叫、技能載入、記憶、權限、多代理協作等完整基礎設施,支援 Anthropic / OpenAI / GitHub Copilot 三種 API 格式。

OpenCode 完整方案分析:75+ 模型供應商的開源終端 Agent

OpenCode 是免費開源的 TypeScript CLI agent(MIT,約 198K GitHub stars),支援 75+ 模型供應商含本地 Ollama,可用 Copilot/ChatGPT 帳號認證,session 中途切換模型不丟上下文。另有桌面版與官方 Zen gateway。

ai project

2026 Q1 開源 LLM 全景圖:從前沿大模型到手機端,完整盤點

2026 Q1 開源模型全面爆發:LLM 方面 GLM-5、Kimi K2.5、Qwen3.5 追上閉源;Embedding 和 Reranker 由 Qwen3 和 BGE 主導;語音有 Voxtral TTS 和 Whisper V3;圖像有 FLUX.2;影片有 Wan 2.2 追平 Sora。這篇是完整導覽地圖。

Codex CLI:OpenAI 開源終端機 Coding Agent 完整介紹

Codex CLI 是 OpenAI 的開源終端機 coding agent(Rust,Apache-2.0,約 106.6k stars),支援 MCP、subagents、圖片輸入、code review、Skills。模型主線已換成 GPT-5.6 Sol / Terra / Luna,桌面版、CLI 與 IDE 擴充共用一份 config.toml。

Gemini CLI:曾經最慷慨的免費終端 Agent,現在只剩企業路徑

Gemini CLI 是 Google 開源的終端機 AI agent(Apache 2.0,~106.6k stars),曾提供每分鐘 60 次、每天 1,000 次的免費額度含 1M context。個人方案已於 2026/6/18 停止服務,接替者是 Antigravity CLI。專案本身沒關閉,repo 仍在維護,但只服務 Gemini Code Assist Standard/Enterprise 授權與付費 API key。

OpenCode:開源 AI 終端機 Coding Agent 完整介紹

OpenCode 是用 TypeScript 打造的開源 AI coding agent(MIT,約 198K GitHub stars,repo 在 anomalyco/opencode),內建 TUI、支援 75+ LLM、LSP 整合、Vim 風格編輯器、SQLite session 管理,另有桌面版。免費、不需訂閱,可接本地或雲端模型。

Pi Coding Agent:極簡主義的開源終端機 Coding Harness

Pi 是 Mario Zechner 打造的極簡 coding agent(TypeScript、MIT、約 93K stars),只有 4 個核心工具與極短 system prompt,其餘全靠 Extensions/Skills/Prompt Templates 自己疊。刻意不做 MCP、sub-agents、plan mode、權限彈窗。repo 已改名 earendil-works/pi,npm scope 換成 @earendil-works。