Skip to content
所有標籤

#agent-skills

17 篇文章

AI Agent GitHub Digest — 2026-09-05

mattpocock/skills 單日暴漲 2,757 星,是今天 GitHub Trending 漲最快的專案;Anthropic 官方 anthropics/skills 與開源 coding agent anomalyco/opencode 同步在榜。另一頭,MCP server reverify 用 71 個真實 Windows 系統檔案的 benchmark 證明:AI 讀 binary 時有 97% 機率在瞎掰,唯有確定性工具能攔下來。框架端 pydantic-ai、agno、haystack 今天都只有例行 patch,無重大更新。

AI Agent GitHub Digest — 2026-09-03

NousResearch/hermes-agent 靠自我學習迴圈記住怎麼用你的工具、跨平台記得你是誰,239,994 星持續衝榜;pacifio/atlas 讓多個 coding agent 共用一套「看得到是誰改的」版本控制,一天漲 895 星;blader/humanizer 用 35 種模式把 AI 味洗掉但不竄改事實。文件處理端 firecrawl/pdf-inspector 用 Rust 在 50ms 內判斷 PDF 要不要 OCR;superlinked/sie 把 agent 會用到的所有模型收進一個自架推理叢集。框架端 AG2 v1.0.3 全面遷移 MCP 2.0(breaking change),並加入不靠 LLM 判斷的 TealTigerMiddleware 做 prompt injection 防護。

AI Agent GitHub Digest — 2026-08-31

can1357/oh-my-pi 從知名 coding agent「Pi」fork 出來,靠死磕工具呼叫格式讓 Grok Code Fast 1 的任務成功率從 6.7% 衝到 68.3%;K-Dense-AI/scientific-agent-skills 把 163 個科研技能開放給任何相容 Agent Skills 標準的 agent;addyosmani/agent-skills 把資深工程師的六階段開發流程包成技能包,一週衝上 9 萬星;THU-MAIC/OpenMAIC v1.0.0 加入對話式 Pro workbench,把 multi-agent 落到課程內容產製這個具體垂直場景。框架端 agno v3.0.2 是本次唯一達標的重要更新:直接把 Agent/Team/Workflow 發布成具名 MCP tool,同時有多筆 breaking changes。

AI Agent GitHub Digest — 2026-08-29

calesthio/OpenMontage 用 12 條產線、700+ 個 skill 檔把通用 coding agent 變成影片後製棚,本週衝上 5 萬星;Anthropic 官方外掛市集 claude-plugins-official 單日 +292 星;rohitg00/agentmemory 用 BM25+向量+知識圖譜做 coding agent 跨 session 記憶,自家 benchmark 宣稱 LongMemEval-S R@5 95.2%;sodiumsun/agenttrail 幫 Claude Code / Codex / Cursor 做本機即時任務地圖。今日框架端無重大 release。

ai debug

Claude Code skill 怎麼寫才不吃 context:入口、門檻、成本、來源

把 Anthropic 的 session 成本建議做成全域 skill,第一版就犯了它要防的錯:description 塞滿觸發關鍵字、用檔案數和分鐘數當硬門檻、把「保護主 context」和「省總 token」混成一件事。三輪修正後入口縮到一頁,細節拆進 references,數量門檻換成四個判斷維度,草稿裡的主張則逐條對官方文件查證。

Agent Plugins 1.0:OpenAI、Google、AWS 罕見聯手,統一 AI Agent 擴充的封裝標準

Agent Plugins 1.0 是一個封裝格式標準,把 Agent Skills(Markdown 指令)和 MCP server 設定包成一個目錄,讓同一個 plugin 能被 ChatGPT、Cursor、GitHub Copilot、Kiro、VS Code 直接載入。它不是新的協議,是協議之上的包裝紙。Vercel 發起,OpenAI、AWS、Microsoft、Cursor 共同制定,Google 發佈當天加入——Anthropic 不在治理名單上,但 MCP 團隊正面回應。

ai deep-dive

AI Agent 自動產生簡報:讓模型看見自己排的版

2026 年 agent 做簡報的共識:outline-first + 內容/構建分離 + render 成圖讓 fresh-eyes subagent 做視覺 QA。Anthropic 與 OpenAI 的官方 slides skill 都收斂到 PptxGenJS + 視覺驗證迴圈,學術線(PPTAgent→PreGenie→DeepPresenter)也指向同一方向。但下半年出現兩個修正:PresentBench 指出常被引用的 PPTEval 給分過於樂觀,SeaSlides 則主張不該讓模型直接寫自由格式的 HTML/SVG。

CS146S Week 3:Agent Skills 是一個資料夾,難的是那兩行 description

Agent Skills 的規格小到一句話講得完:一個含 SKILL.md 的資料夾。真正的設計在三層 progressive disclosure——開機只載 name 與 description,命中才讀全文,需要才展開附檔。本站自己的 repo 有 35 個 skill、7,893 行 SKILL.md,開機成本仍然只有那 35 組 metadata。

AI Agent Arxiv Digest — 2026-08-16

PIMiner 用可跨模型轉移的策略庫,以約 20 美元查詢成本讓提示注入攻擊成功率衝上 76-87%;Agent Skills Can Be Harmful 從 307 個技能誘發失敗中發現看似相關的技能比明顯無關的技能更容易搞砸任務,過度流程占效率退化六成以上;Order 66 情境分析用組合式威脅模型證明休眠植入、事後記憶投毒與對等擴散單獨看都不致命,疊加後可能自我維持傳播

ai deep-dive Agent 生產線

協定層:MCP、A2A、ACP、Skills 各解什麼問題

MCP 管 agent ↔ 工具,A2A 管 agent ↔ agent,Skills 管可重複使用的知識。判準是資料會不會變:呼叫之間會變就要 MCP,穩定到可以寫下來就用 skill 檔案——後者不需要一個會獨立失敗的 runtime。

ai deep-dive

HyperFrames 深度解析:HTML 即影片,Agent 時代的影片製作範式轉移

HeyGen 開源的 HyperFrames 用 HTML data 屬性定義影片時間軸,headless Chrome 逐幀 seek 截圖再由 FFmpeg 編碼成 MP4。3 個月 33k stars,Apache 2.0,21 個 agent skills——AI agent 寫 HTML 就能產影片,不需要 React。

ai deep-dive

LLM Agent 的技能管理革命:從 Voyager 到 MUSE-Autoskill 的 Skill Lifecycle 全景

MUSE-Autoskill(2026)提出五階段 skill 生命週期框架,自創 skill 在 SkillsBench 達 60.35%(+7.16%),成功生成 skill 的任務上更達 87.94%,超越人工撰寫上限。本文整合六篇 arXiv 論文,梳理 skill evolution 研究全景。

browse.sh:把瀏覽器 Agent 學過的事存成技能目錄

Browserbase 在 2026-05 推出的 browse.sh,是「瀏覽器技能目錄 + Browse CLI」兩件事。核心論點:瀏覽器 Agent 的瓶頸是健忘症不是推理,把學過的網站操作存成純文字 SKILL.md,Craigslist 任務官方自評從 ~$0.22 降到 ~$0.12。注意它跟 2018 年的 Browsh 文字瀏覽器毫無關係。

ai deep-dive

Claude 怎麼讀寫 PDF / DOCX / PPTX:拆解 skill + sandbox 的三層架構

Claude 沒有 docx_tool / pdf_tool — 它只用 bash + file tools,加上 SKILL.md 指令、容器內預裝的 pdfplumber / python-pptx 等 library,三層拼出檔案讀寫能力。

ai deep-dive

別人怎麼用 LLM 寫文章:從 Karpathy LLM-wiki 到多 agent pipeline 的取捨筆記

綜述 11 個公開的 LLM 寫作 pipeline,三條主流模式:多 agent(researcher → writer → critic)、Karpathy LLM-wiki(raw + wiki + LLM 寫不手寫)、品質防線(technical verifier + never fabricate + brief gate)。Princeton GEO 論文(KDD 2024)量化了 inline 引用 +28%、加數字 +33%、quote 原文 +41%、關鍵字塞詞 −9%。

ai guide

Agent Skills:讓 AI 代理像資深工程師一樣工作的技能框架

Agent Skills 是 Addy Osmani 開源的 19 個生產級工程技能,透過 /spec → /plan → /build → /test → /review → /ship 的指令驅動 AI 代理遵循資深工程師的開發紀律,而不是走捷徑。

Claude Code Skill 完整指南:把重複的工作流程變成一句指令

Skill 是寫給 AI 看的 SOP。一個 markdown 檔案定義步驟,Claude 照著執行。不用寫程式,不用學框架,只要把「有經驗的人會怎麼做」寫成步驟就好。