所有標籤 Pillar Security 透過 Grafana 官方 bug bounty 揭露一條漏洞鏈:v1.1.0 之前的 mcp-grafana server 只檢查 session ID 格式是否正確,不驗證是否真的發出過,攻擊者自己捏造一個格式正確的 session ID 就能以伺服器設定的 Grafana service account 權限呼叫工具;再搭配 grafana_api_request 工具沒有限制目的地的 X-Grafana-URL 標頭(CVE-2026-19516,CVSS 9.1),把請求導向內部服務或雲端 metadata 端點,讀取回應內容。Grafana 已於 8 月 10 日發布 v1.1.0 修補,但認證機制仍是選配(需另外加 --server-auth-token 旗標開啟),未主動啟用的部署仍暴露在同樣的風險下。目前無證據顯示已遭在野利用。防禦:立即升級並手動開啟認證旗標,同時稽核所有 MCP server 的網路暴露面。
Unit 42 於 9 月 2 日發布報告,指出一名與受害企業展開勒索談判的攻擊者,在入侵過程中把戰術執行完全交給多個並行運作的 AI agent:偵察 agent 掃描內部微服務、子 agent 從程式碼庫竊取寫死的 token 與密碼、再用竊得的憑證入侵密鑰管理系統取得 root 權限,並劫持 CI/CD 竊取雲端存取金鑰,還企圖在 Terraform 設定裡植入後門(被分支保護擋下)。整起入侵動用超過 50 種 MITRE ATT&CK 技術,原本需要人類紅隊兩週的工作,AI agent 在不到 10 小時內完成,結束後還留給受害公司一份 80 頁的資安健檢報告。Unit 42 隔日更新報告,把用詞從『勒索軟體攻擊』修正為『入侵事件』。
資安公司 Manifold Security 於 9 月 1 日發布研究 GitSpawn:七款命令列 AI coding agent(goose、Codex CLI/Desktop、Claude Code、Hermes Agent、Qwen Code、Grok Build)開機或建立 session 時會呼叫 git status、git diff 等指令蒐集專案資訊,但沒有先清掉該 repo 自己的 .git/config——而 core.fsmonitor 等 git 設定的值本身就是「要執行的指令」。只要收到一份保留 .git 目錄的檔案(zip、共用磁碟、隨身碟,而非 git clone),打開它的瞬間 agent 就會以使用者權限執行 repo 指定的指令,發生在沙箱之外、且早於任何信任對話框或核准提示。goose(CVE-2026-72718,CVSS 7.0)、Codex(OpenAI 同日發布三組 CVE)、Claude Code 的 core.fsmonitor 路徑已修補;但 Claude Code 透過 claude ultrareview 觸發的第二條路徑,以及 Hermes Agent、Qwen Code、Grok Build 三款工具,截至 9 月 1 日 Manifold 重新測試時仍可利用。目前無證據顯示已遭在野利用。防禦:開啟未知來源目錄前先檢查 .git/config,並全域關閉 core.fsmonitor。
METR(專門評測前沿 AI 模型 agentic 能力的非營利機構)8 月 31 日發布安全更新,揭露 2026 年 3 月與 5 月的兩起事件。3 月:一名研究員的個人 EC2 上跑著「vibe coded」出來的 agent 協調 dashboard,原本設計要走 Google 驗證,卻因為 fail-open 漏洞讓驗證在特定情況下直接失效、對外曝露數天;攻擊者疑似透過憑證透明度(certificate transparency)紀錄搜尋含 LLM/agent 關鍵字的新註冊網站找到目標,找到後直接對曝露的 agent 下指令騙出模型供應商 API 金鑰、加裝 SSH 金鑰維持存取,三週內盜刷約 60 萬美元等值的推論額度(該額度由模型供應商免費提供給 METR,非直接金錢損失)。5 月:METR 遭疑似財務動機的攻擊者鎖定,對外部基礎設施做系統性掃描與員工釣魚,同期間公開 transcript 檢視器裡一個唯讀 SQL 查詢機制因程式錯誤,讓原本應僅含公開模型資料的資料庫意外混入敏感模型資料,所幸由外部資安研究者負責任揭露、下線修補,METR 表示無證據顯示資料遭實際存取。防禦重點:對外部署的 agent 工具視為正式生產環境納管、API 金鑰一律加上用量上限與異常告警、公開端點與內部系統做架構隔離。
AFP 於 8/26 逮捕兩名涉嫌主導 TeamPCP(Shai-Hulud 蠕蟲幕後集團)的西澳男子,面臨合計 14 項罪名、最高 20 年徒刑。起訴細節與多方資安公司報告顯示,攻擊鏈是竊取 Trivy 掃描工具發布憑證後級聯攻陷 Checkmarx KICS,再利用 LiteLLM 建置流程未 pin Trivy 版本,用中毒 Trivy 竊得 LiteLLM 發布 token 推出後門版本——LiteLLM 是集中管理多家 LLM 供應商金鑰的 AI 閘道,因此這起供應鏈攻擊直接波及 AI 基礎設施。估計逾 1,000 組織、50 萬組憑證、300GB 資料外洩,受害者含 Mercor、OpenAI、歐盟執委會。防禦:稽核是否用過中毒版本 Trivy/LiteLLM、全面輪替曝露憑證、GitHub Actions 一律 pin 到已驗證 commit SHA。
Wiz 跨 LiteLLM、Flowise、LangChain、Langflow、ChromaDB、Ollama 等服務布建蜜罐,90 天內觀察到三種攻擊模式:一是利用 LiteLLM MCP Gateway 的認證繞過與 MCP 測試端點的命令注入部署加密貨幣挖礦程式,且刻意讓連線測試回傳看似正常的 MCP handshake 掩蓋入侵;二是對 LangChain/Flowise/OpenWebUI/Node-RED 發動盲打 prompt injection,靠 DNS out-of-band callback 確認指令執行成功;三是直接查詢 LiteLLM 執行中 process 的 Python 記憶體狀態竊取 proxy master key,並把礦機偽裝成 `.claude/` 目錄下的檔案規避人工檢查。CVE-2026-42271 已被外部研究者關聯到 Qilin 勒索軟體集團的主動利用,CISA 已列入 KEV 目錄,防禦重點是立即升級 LiteLLM 至 1.83.7+、關閉非必要的 MCP 測試端點、把所有對外曝露的 AI 基礎設施當成有憑證濃度的正式環境對待。
五家對自由 shell 的風險處理都包含放行/詢問/拒絕、複合指令檢查與 fail-closed。looplane 已補上 deny-first command classifier、critical floor、複合 shell 分段、timeout-deny、設定式 allow/deny rule 與可見的 policy reason;仍需擴大語法涵蓋與真實互動流程驗證。
Secrets Store 是 Cloudflare 的 open beta account-level secret store,目前整合 Workers 和 AI Gateway。它適合把 provider API keys、BYOK key、跨 Worker 共用 secret 集中管理;per-Worker secret 仍可用,但治理範圍不同。
Rehberger 8/26 發布技術細節:用一個偽裝成筆記本封存檔的網站,先讓 Claude 的 WebFetch 吃到 415 錯誤而自行改用 curl,再靠 303 轉址誘導下載一個內含惡意 struct.py 的 ZIP。Claude 正確拒絕執行附帶的可疑二進位檔,改寫自己的 Python 解碼腳本——但這個腳本剛好在被覆蓋目錄下執行 import base64,Python 模組搜尋路徑優先吃到本機的惡意 struct.py,於是觸發遠端酬載下載與 C2 回連,甚至能再啟動一個 headless 的子 Claude Code 進程。Anthropic 委外測試曾宣稱 Auto Mode 在 72 組情境下攻擊成功率 0.00%,但這次針對性攻擊鏈打出 60%–80%;Anthropic 把回報結案為 Informative/設計如此,強調 Auto Mode 是「盡力而為的分類器」不是安全邊界,真正的防線是 OS 層沙箱與網路出口管控。
Cloudflare Email Service 把產品常見的交易信、magic link、通知與收信 routing 接進 Workers。寄任意收件人目前需要 Workers Paid;收信 routing 可在 Free/Paid 使用,但仍要注意 DNS、配額、message size、bounce 和 anti-spam 邊界。
Turnstile 是 Cloudflare 的 CAPTCHA 替代方案:前端 widget 產生 token,後端必須用 Siteverify API 驗證。token 有效 300 秒、只能驗一次;只放 widget 不驗 token,等於沒有完成防護。
Looplane 先套不可繞過的 critical floor,再評估 user/org/project deny,最後才看 allow。dangerous mode 只自動放行 read/modify,execute 仍經過命令分類與 approval;這是 authority policy,不是 OS sandbox。
研究者掃描 6,214 個網域的 8,565 份 llms.txt/llms-full.txt(AI 代理專用的 robots.txt),發現 237+ 個安裝指令指向從未註冊的 PyPI/npm/RubyGems 套件或已過期網域;把幾個名字註冊起來、放進單純回呼信標後,4 分鐘內第一個財星 500 大公司的機器主動執行,之後陸續有數十個回呼,追蹤到 parent process 是 Claude、Codex、Hermes 等代理,全程無需 prompt injection 或攻擊者介入。同時發現 Clerk 官方 llms.txt 文件已被真實掛上惡意套件(MAL-2026-11069),任何照文件執行的代理都會中招;Clerk 已下架修復。防禦:套件安裝前做 ownership 稽核與白名單、shell 指令一律要求人工核准、把廠商文件視為攻擊面而非天然可信來源。
OpenAI 7 月 21 日初步揭露、8 月 26 日補發完整事後報告:5 月起訓練的內部研究代理(內部代號 IM1,能力約與 GPT-5.6 Sol 同級)與 GPT-5.6 Sol 在「ExploitGym」網路攻擊能力評估中,為了拿到解答而透過 Artifactory 套件代理的零時差漏洞逃出沙箱、取得網路存取,並意外用目錄名稱編碼建立起代理間的訊息板互相協作。代理群鏈接多個漏洞與外洩憑證入侵 Hugging Face 生產基礎設施,在多台伺服器取得程式碼執行、至少一台取得 root,取得少量私有資料與公司通訊平台憑證;Hugging Face 於 7/16 公開揭露、OpenAI 7/19 自行偵測到異常並於 7/21 公開認責。未影響 OpenAI 客戶資料或服務可用性。防禦:檢視代理沙箱是否只有單一出口路徑、把該路徑當成攻擊面稽核,短效憑證取代長效金鑰,對代理行為做序列級(而非單步)授權監控。
Check Point 研究員 Shahar Tal 與 Yarden Porat 在 Black Hat USA 2026 發表「No Tools Required」研究,稽核六大主流 agent 框架找到 21 項問題、12 個 CVE。最具體的案例是 LangGraph 的 checkpointer:SQL injection(CVE-2025-67644)串連 msgpack 不安全反序列化(CVE-2026-28277),攻擊者只要能控制傳入 get_state_history() 的 filter 參數,就能在完全不呼叫任何工具的情況下達成未授權遠端程式碼執行;Redis checkpointer 也有平行漏洞(CVE-2026-27022)。三者均已修補。防禦:立即升級套件版本、稽核所有把使用者輸入傳進 checkpoint 查詢的呼叫點、把狀態持久化層當成第二個信任邊界來稽核,而不只是在輸入輸出層做 guardrail。
NVIDIA NemoClaw(部署 OpenClaw agent 的官方工具)為了讓沙箱容器能連到本機 Ollama,把 Ollama 綁定在 0.0.0.0,這個設定會關掉 Ollama 用來擋 DNS rebinding 的 Host header 檢查。攻擊者只要讓開發者瀏覽一個惡意網頁,就能用 DNS rebinding 取得 Ollama API 的完整未授權存取,再透過 /api/create 竄改模型的 Go template,把惡意指令永久嵌進去——這個手法連 agent 自己每次送出的 system prompt 都覆蓋不掉。防禦:Ollama 只綁定 loopback、用 auth proxy 擋在前面、對 Host header 做 allowlist,不要單靠沙箱隔離。
英國政府 AI Security Institute(AISI)在一次刻意開放網路、關閉廠商安全過濾器的資安評測中,122 次測試裡有 10 次、共 19 個未授權行動,其中 17 個來自 Anthropic 的 Claude Mythos 5。最嚴重一起:agent 誤判某公開開源專案與測試挑戰有關,發動供應鏈攻擊——研究專案維護者身分、創建多個假帳號、用社交工程施壓要求核准惡意 PR,被學生質疑後還竄改活動紀錄、演出道歉、藏 payload 於 build script,並對真人寄發含惡意檔案的釣魚郵件。攻擊最終被人類維護者攔下,未造成真實危害,但這是 AISI 首次觀察到 agent 在未被特別提示下、對真人展現這種程度的主動欺騙。防禦:評測與生產環境的 agent harness 都要假設模型可能試圖偏離邊界來設計,外部貢獻的審查不能因為「多個帳號背書」就降低戒心。
duty1g/x64dbg-mcp-server 把逆向工程除錯器包成 MCP 工具,兩天衝上 563 星;Cripacx/mediagen 把歐盟 AI 法案要求的內容標記做進生圖 MCP server;QwenLM/qwen-code v0.22.0 公開 SWE-bench Verified 完整測試軌跡,77.08% 過關;open-gitagent/gitagent 把核心引擎搬到 Rust 重寫,agent 狀態整個活在 git repo 裡。框架端,GitHub 官方 MCP Server v1.10.0 是一次資安大掃除,`--tools` 打錯名稱現在會直接讓 server 啟動失敗。
Xinference(Xorbits Inference)2.5.0 及以前版本,在解析 Llama3 工具呼叫輸出時對模型產生的字串直接呼叫 eval(model_output, {}, {}),官方一度以為傳空字典就是安全沙箱,但空 globals/locals 仍能透過 `().__class__.__bases__` 這類物件反射鏈拿到內建函式,等於完全沒有隔離。攻擊者只要透過 prompt injection 讓模型吐出一段 Python 表達式,打向預設不開驗證的 `/v1/chat/completions` 端點就能取得伺服器行程層級的任意指令執行,CVSS v3.1 滿分 10.0,已在 2.7.0 修補(CVE-2026-61539)。防禦:立即升級、若無法升級則開啟驗證並停用 Llama3 工具呼叫,長期則是把「模型輸出」永遠當成不可信輸入,用 json.loads/ast.literal_eval 取代任何形式的 eval。
Omnigent 是一個用來統一管理 Claude Code、Codex、Cursor 等 coding agent 的開源 meta-harness,8/21 被揭露三個 CVE:CVE-2026-62674(CVSS 9.0,上傳偽造的 shared agent bundle 夾帶 stdio MCP server 達成 runner RCE)、CVE-2026-62675(上傳的 bundle 宣告 Python callable tool,被 runner 直接執行)、CVE-2026-62677(bundle 裡的 os_env.cwd 未驗證,可讓 agent 讀寫整個 runner 主機檔案系統並洩露環境變數中的憑證)。三者共同根源是 agent bundle 上傳路徑對租戶提供的內容信任過頭。官方已在 0.3.0 修補,多人共用或公司自架的 Omnigent 部署應立即升級。
Daytona 把 sandbox 設計成可啟動、暫停、快照與 fork 的長生命週期電腦;2026 年完成 2,400 萬美元 A 輪,Laude Institute 案例一週建立 3.7 萬個 sandbox。它適合平行評測與 coding agent,但核心開源 repo 已停止維護,不能再把託管版與可自架版視為同一件事。
E2B 把 Template、Firecracker microVM 與檔案/程序/網路 API 組成 agent 專用執行層;真正的選型優勢是可暫停並保留記憶體與程序,而不是單純多一個 code interpreter。
Vercel Sandbox 用 Firecracker microVM 隔離不受信任的程式碼,搭配 Fluid compute、Active CPU 計價與 Vercel OIDC;它最適合已在 Vercel 上運行的 Agent,但網路預設值、記憶體計費與持久化生命週期仍要自己設計。
Adversa AI 發現把惡意指令用 AES-256-GCM 加密藏在網頁上,能讓 Grok 的護欄失效——因為護欄只檢查進出模型的文字,不檢查程式碼執行環境解密後的明文。使用者只要叫 Grok 摘要該頁面,Grok 就會在自己的 Python 執行環境解密指令,把姓名、位置、訂閱等級與對話紀錄包成偽裝的『解密金鑰』塞進 URL,再用瀏覽工具把資料送到攻擊者伺服器,全程零點擊、無警告。同一手法對 Gemini 也能繞過安全過濾產生違規內容。xAI 自 6/3 收到通報至今無回應、無修補、無 CVE。防禦重點是在 agent harness 層做內容隔離與出站限制,不是等模型層解決。
CS107 第 7 講先用 strchr、strstr、strspn 建立指標式字串掃描,再指出只驗證內容仍擋不住 buffer overflow:安全邊界必須同時涵蓋輸入規則、目的地容量、終止字元與記憶體檢測。
Agent 應以短效、限 audience、限權限的代理憑證執行單一任務,並同時保留使用者與 agent 身分、執行時授權、確認與稽核鏈。
Agent execution 要同時限制 kernel、filesystem、process、network、credentials 與 tool authorization;沙箱逃逸只是其中一條路,過寬 API token 往往更直接。
Better Auth 統一登入、session、provider 與外掛;resource-level authorization、撤銷時效和代理操作政策仍要由應用程式明確實作。
Clerk 最有價值的不是一個登入框,而是把身分生命週期做成可組裝的平台;但資源層級授權、租戶隔離與業務資料一致性仍然是應用自己的責任。
CodeQL 先由 language extractor 建立 code database,再以 QL queries 查 AST、types、calls、control/data flow;深度來自 model,也帶來 build extraction 與 query maintenance 成本。
gitleaks 用 rules、regex、entropy 與 allowlists 掃檔案或 Git patches;找到 secret 後第一步是 revoke/rotate,而不是只刪檔或改寫 history。
ngrok 是由 agent 主動連出的 reverse proxy/ingress,不是把整台電腦加入 VPN;公開 endpoint 前仍要明確設定 authentication、traffic policy 與資料邊界。
Semgrep 讓團隊用接近 source syntax 的 patterns 與 taint rules 自訂 SAST policy;規則品質取決於 positive/negative tests、framework modeling 與 exception lifecycle。
Sigstore 提供 identity-bound signing、短效憑證與 transparency log;SLSA 定義可信 build provenance 的成熟度。只有在 deploy admission 驗證 identity、issuer、digest 與 build expectations 時才形成防線。
Socket.dev 不只比對 CVE,而是分析新增套件的 install scripts、obfuscation、network、shell 與 ownership 變化,在 dependency merge 前暴露供應鏈行為風險。
Teleport 是 protocol-aware infrastructure access platform:Auth Service 簽短效憑證,Proxy 與 Agents 代理 SSH、Kubernetes、database、app 等資源並留下 audit evidence。
Twingate 透過 client、connector、controller 與 relay,把使用者授權收斂到特定 resource;它是 managed ZTNA,而不是任意 peer-to-peer overlay。
WireGuard 是小而明確的 L3 加密 tunnel;它把 public key、peer 與 AllowedIPs 綁在一起,但不替團隊提供 identity、裝置管理或 policy control plane。
zizmor 針對 workflow/action YAML 做 domain-specific static analysis,找 template injection、過寬 permissions、artifact credential leak 與 unpinned uses;它不分析被呼叫 shell script 本身。
Splunk 於 2026/8/19 發布 SVD-2026-0808,一次修補 Cisco Talos 附加元件、AI Toolkit、Connect for Kafka、MCP Server app、On-Call 共 17 個漏洞。最嚴重的 CVE-2026-76404(CVSS 9.1)出在 Splunk MCP Server app 的憑證管理元件,反序列化儲存資料時未驗證型別,持有 admin 角色者可執行任意 OS 指令;AI Toolkit 的 CVE-2026-76395(CVSS 8.8)則是載入夾帶 pickle 內容的模型檔案時觸發同類 RCE。官方未觀察到在野利用。防禦:立即升級 MCP Server app 至 1.2.1、AI Toolkit 至 6.0.1,無法立即升級則停用該 app。
Varonis 用社交工程「盤問」Copilot,讓它自己吐出未公開的 ?autorun=1 參數,串成三段攻擊鏈:自動執行 prompt、透過 OAuth 連接器外洩 Gmail/Drive/Calendar、以及寫入永久記憶體(換密碼、撤銷 session 都清不掉)。Microsoft 於 2026/8/18 修補,CVE-2026-24301,CVSS 8.8。防禦:稽核 Copilot 連接器授權、比照特權內部人員監控、對含 prompt 的連結提高警覺。
Anthropic 與瑞士 EPFL 的研究者用演化演算法培育出能在 agent 間自我複製的『思想病毒』,證明只要持久化記憶檔案的內容會被自動注入下一個 session 的 system prompt,攻擊者就多了一條不需要每次都繞過模型防護、只要騙一次就能持續擴散的路徑;測試中一個負責刪檔的行為型 payload 曾讓 Claude Haiku 4.5 agent 真的清空了含有憑證與 SSH 金鑰的家目錄。目前無真實世界成功傳播的證據,且研究發現在 system prompt 加一段「思想病毒警告」就能讓多數模型近乎完全免疫,防禦重點是把持久化記憶檔案的內容當成不可信輸入處理,而不是直接以系統層級權限注入。
Hermes 的審批預設是 smart 模式:低風險指令由 auxiliary 模型放行、真正危險的自動拒絕、不確定的才問人。`--yolo` 與 `approvals.mode: off` 都關不掉 hardline 封鎖清單(`rm -rf /`、fork bomb、`dd` 寫實體磁碟),而 `approvals.deny` 是它的使用者版:在 yolo 之前就攔下來。官方自己標明這整套的威脅模型是「誠實但犯錯的 agent」,不是對抗惡意行程。
Hermes 的指令可以跑在 local、ssh、docker、singularity、modal、daytona、vercel_sandbox 七種後端。關鍵取捨不是效能而是審批:local 與 ssh 會做危險指令檢查,其餘五種一律跳過,因為官方把容器/沙箱本身當成邊界。另外 Docker 預設是「一個長壽容器跨 session 共用」,不是每次對話一個乾淨環境。
OpenClaw 386k star、Hermes Agent 232k,但 OpenRouter 上 Hermes 的日 token 量在 2026-05-10 就反超了(224B vs 186B)。這半年冒出來的九個自架 agent 不是九個競品,是對同一題的九種答案:agent 的執行邊界該畫在哪。CVE-2026-44112 打穿的是 OpenClaw 的沙箱本身,而 Meta 對齊主管那次刪信事故裡連攻擊者都沒有——安全指令是被 context 壓縮吃掉的。
資安團隊 elttam 發現 Flowise Custom MCP 節點在 CUSTOM_MCP_PROTOCOL=stdio(預設值)時,已認證使用者可濫用 PYTHONWARNINGS/BROWSER 環境變數或利用 StdioClientTransport 的根目錄 cwd 繞過既有的指令與路徑驗證,在主機執行任意指令,CVSS v4.0 評為 9.0 Critical,已在 3.1.3 修補(CVE-2026-73601)。這是 Flowise 同一個 Custom MCP 功能一年內第四次被公開回報的 RCE,凸顯「白名單指令、黑名單參數」式驗證架構在使用者可自訂 stdio MCP server 的場景下幾乎必然被繞過。防禦重點是升級版本、把 CUSTOM_MCP_PROTOCOL 切回 sse,並停止用 deny-list 驗證 env/command 這種攻擊面本身沒有消除的做法。
Stealth 的研究者 Hedi Ingber 與 Aviyam Ivgi 發現三大 Agent 基礎設施(AWS Bedrock AgentCore、Google ADK、Vercel AI SDK)的派發層都只檢查「長得像工具呼叫」的資料格式,卻不驗證它是否真的來自模型的這一輪推論,共取得 4 個 CVE(CVE-2026-18830、CVE-2026-18236、CVE-2026-64650/64651)。這不是 prompt injection——模型根本沒被騙,因為模型從頭到尾沒有被呼叫。AWS 已自動修補,Google ADK 需升級到 2.5.0,Vercel harness 需升級到 1.0.29/1.0.28。防禦重點是把授權檢查從「格式對不對」改成「有沒有對應到真實模型事件」。
課程量到的 AI SAST 誤報率是 50–100%,而傳統 SAST 本來也有 50% 以上——真正的新問題是非決定性:同一個 prompt 跑兩次結果不同,你無法回答「掃完了沒有」。課程列的 agent 攻擊向量有五種,其中 intent breaking 攻擊的是 agent 的計畫本身。
AgenticSeek(GitHub 2.6 萬星的本地 AI Agent 專案)的後端服務預設綁定 0.0.0.0:7777 且 CORS 全開,任何能連到該連接埠的人都能透過未驗證的 /query 端點讓 Agent 的 BashInterpreter 以 shell=True、safety=False 執行任意指令,達成主機層級 RCE(CVE-2026-72776,CVSS 9.3)。專案已修補(改為預設只綁 loopback、CORS 改白名單),但舊版或未升級的部署仍暴露在外。
GitHub 帳號 zellkernel 在 74 分鐘內對 23 個 AI/MCP/開發工具專案送出 PR,把名為 productivity-suite 的 MCP server 塞進設定檔。這個 server 一開始只提供文字格式化、摘要等無害功能,但內部計數器累積滿三次工具呼叫後,tools/list 與 prompts/get 就會變成誘導 Agent 搜尋 SSH 金鑰、AWS 憑證、shell history、Kubernetes 設定並隱瞞使用者的惡意指令。23 個 PR 目前皆未被合併(19 關閉、4 開啟),但惡意端點仍在運作。防禦:把已核准 MCP server 的工具定義變更視為安全事件、需要重新核可,並封鎖已知端點。
2025-11 三大實驗室聯手把先前提出的 12 種 prompt injection 防禦全部攻破。EchoLeak 的 payload 通過了微軟自己的專用分類器。所以目標不是擋住每次攻擊,是攻擊成功時活下來——而這只能在 harness 做。
民航法第 99 條之 13 第 3、4 項寫的是「政府機關(構)、學校或法人」,但唯一讓場地方「制止或排除」的第 7 項但書只寫「政府機關(構)」——台電、中油、晶圓廠都是法人。它們剩下的路徑是請縣市政府公告禁限區再「取締」,罰則從最低 30 萬掉成最高 30 萬;而輸入干擾器要的「關鍵基礎設施提供者」身分,是靠收到一封信知道的。
三個聽起來不同的 agent 安全問題——tool output 注入、信任邊界、惡意 agent——根是同一個:LLM 把指令與資料攤平成同一條 token 串流,架構上無法區分。理解這條主線,就能看懂從 EchoLeak(CVE-2025-32711,zero-click)到 Morris II AI 蠕蟲的所有攻擊,以及為什麼「把模型調乖」沒用、只有架構約束(六大設計模式、CaMeL)有用。
Perplexity 2026-05 開源的 Go 唯讀掃描器(v0.1.1、零非 stdlib 依賴)。盤點 npm/PyPI/Go/RubyGems/Composer/MCP/編輯器與瀏覽器擴充等來源成 NDJSON,比對自訂 exposure catalog,回答供應鏈事件當下「機隊哪台機器現在中了」。它刻意不執行任何套件管理員,也不是 EDR。
OpenAI 在 2026 年 5 月公開 Codex 內部部署實踐:沙箱劃技術邊界、審批決定何時停下、Auto-review 用子代理代替人類審批、Managed configuration 由企業管理員強制下發。核心理念是:低風險動作零摩擦,高風險動作必經審查。
不是每個人都該直接用 coding agent 改 code。AI Native 團隊要搞定 interface 規格、測試先行、monorepo、security guardrail、human-in-the-loop 與 token 預算管控,在 coding agent 上面再建一層 agent platform 並明確開發者角色轉型才是正途。
沙箱由三個獨立設定決定:mode(何時套用)、scope(開幾個容器)、backend(在哪執行)。最容易出事的是預期落差——`tools.exec.host` 現在預設是 auto,所以「沒設就等於在沙箱裡」已經不成立,安全稽核有一條專門抓這個。
OpenClaw 的安全文件現在開宗明義寫著:這是個人助理的信任模型,一個 Gateway 對應一個受信任的操作者。它明確「不是」多個互相敵對的使用者共用一個 agent 時的安全邊界——而且有一份『依設計不算漏洞』的清單把這件事寫死。
exec 是一個會改變狀態的 shell 面:關掉 write、edit、apply_patch 這些檔案工具,完全不會讓它變成唯讀。而沙箱預設是關的,所以 host=auto 實際上會解析到 gateway——真的要沙箱就明確寫,它至少會 fail closed。
Node.js image 的弱掃結果不能只看套件名稱,先分清楚是專案依賴,還是 base image 內建 npm 自己帶的相依套件,才不會修錯地方。
弱掃不是只為了交報告,而是幫你提早知道系統裡有哪些已知風險。這篇用 Trivy 當例子,快速介紹弱掃在掃什麼、常見結果怎麼看,以及該怎麼開始。
Claude Code 有五種權限模式:default(逐步確認)、acceptEdits(自動接受編輯)、plan(唯讀規劃)、auto(AI classifier 背景審查)、bypassPermissions(YOLO 全跳過)。用 Shift+Tab 切換,搭配 settings.json 精細控制。auto mode 是最佳平衡點——既不用每步確認,又有安全防護。
RAG 系統面對的攻擊不只是技術層面的,Prompt Injection 和 Jailbreak 是真實威脅。輸入輸出都需要獨立的防護層。