Skip to content
所有標籤

#browser-automation

18 篇文章
ai guide 搜尋與爬取實戰

需要登入的網站怎麼交給 Agent:Session、權限與自動化邊界

登入狀態不是方便攜帶的設定,而是一把能冒用身分的鑰匙。安全做法是使用專用低權限帳號與隔離 browser profile,把讀取、可逆寫入、高風險交易拆成三級,MFA 與最後提交留給人。

ai deep-dive

Browserbase:把 Agent 的瀏覽器拆成可營運的基礎設施

Browserbase 把遠端 Chromium、持久化 Context、代理伺服器與 Session Inspector 包成同一個控制平面;它解決的是瀏覽器艦隊的生命週期與除錯,不替 agent 決定下一步。官方截至 2026-08 自報每月超過 3,500 萬次 browser session、逾 10,000 家客戶。

ai deep-dive

Cloudflare Kitesurf:不是 Chromium 的 Agent 瀏覽器,該拿什麼換規模

Kitesurf 是 Browser Run 內仍在 beta 的非 Chromium 瀏覽器後端:用 Workers isolates、Rust/Wasm 與無狀態元件換低 CPU/記憶體,但犧牲像素相容性、長登入工作階段、WebGL 與完整反機器人能力。

ai deep-dive

Hyperbrowser 深入介紹:Agent 的 Browser-as-a-Service 執行層

Hyperbrowser 把 Playwright/Puppeteer 的 Chrome session、proxy、stealth、profile 與錄影包成託管 API;它適合要快速擴充真實瀏覽器工作的 Agent,但 profile 憑證、反爬蟲合規與 proxy 流量成本仍由應用端負責。

ai deep-dive

Steel Browser:Agent 的開源瀏覽器 API 與自架邊界

Steel 用 Apache-2.0 runtime 把 Chromium session、CDP、proxy、stealth 與除錯介面包成同一套 browser API;公開 repo 約 7,400 stars,並在 2026 年進入 Stripe Projects developer preview。單機自架適合開發與資料邊界,Cloud 才解決高併發、託管 proxy、CAPTCHA、錄影與 SLA。

tech deep-dive

Selenium 深入介紹:從 WebDriver session 到 Grid 的瀏覽器自動化

Selenium 透過標準化 WebDriver session 操作真實瀏覽器,適合跨瀏覽器流程、既有測試資產與遠端 Grid;它能執行 JavaScript 頁面,卻不保證繞過 CAPTCHA 或其他反自動化機制。

ai guide

AgentQL 完整介紹:用語意查詢做網頁擷取與 Playwright 自動化

AgentQL 用接近資料結構的語意查詢取代易碎的 CSS/XPath:`query_data` 回傳結構化資料,`query_elements` 回傳可操作的 Playwright locator。Starter 公開方案列出每月 50 次免費 API 呼叫,但超額、綁卡與遠端瀏覽器時數的實際停止規則仍要在 Billing 頁確認。

ai guide

Apify 完整介紹:Actor、Task、排程與資料集怎麼組成爬取平台

Apify 不是單一 crawler,而是把爬取程式包成 Actor,再用 Task 固定設定、Schedule 觸發執行、Dataset 交付結果的平台。適合不想自己維護佇列、排程與執行環境的團隊,但 Actor 費用、運算、proxy、儲存與傳輸會共同消耗預付額度。

ai guide

Browser Use 完整介紹:讓 AI Agent 操作瀏覽器的任務迴圈

Browser Use 把瀏覽器狀態、模型決策與 click/type/extract 等動作組成可重複迴圈;開放原始碼版本適合自訂工具與執行策略,Cloud 則代管瀏覽器、profile、proxy 與並行工作。

ai guide

Scrapling 完整介紹:從 adaptive selector 到並行 Spider

Scrapling 把 HTTP、Playwright 瀏覽器、CSS/XPath 抽取與 Spider 放進同一套 Python API;adaptive selector 會保存元素特徵,版面改動後再用相似度重新定位,但仍需要驗證輸出。

AI Agent 上網查資料的完整路由:Search、Fetch、Crawler、Browser 怎麼切換

Agent 上網不該一律開瀏覽器:先依任務分流 Search 或 Fetch,再按狀態碼、內容品質、JS shell、登入與 challenge 訊號逐級升級;每一步都受 retry、budget、快取、去重與來源紀錄約束。

AI 爬蟲工具全景圖:34 個開源專案的五大分類與選型指南

從 MarkItDown (175k stars, MIT) 到 curl_cffi (6k stars),整理 34 個「爬資料餵 AI」的開源工具。沿五條軸線分類:整站爬取、AI 瀏覽器代理、文件轉檔、智慧擷取、反偵測基建。選型關鍵不是哪個最好,是場景匹配。

Browser MCP 三選一:CDP、Playwright MCP、Puppeteer MCP 比較

這題現在其實是二選一:@playwright/mcp(跨瀏覽器、accessibility tree 省 token)對上 chrome-devtools-mcp(Chrome 官方、效能與記憶體診斷);@modelcontextprotocol/server-puppeteer 已被封存,不再是選項。分野也不再是抽象層級高低,而是「操作網頁」還是「診斷 Chrome」。

Chrome DevTools MCP:直連 CDP 的 MCP Server

Chrome 團隊官方維護的 chrome-devtools-mcp,把 DevTools 的能力包成 MCP server:效能 trace 與洞察、Lighthouse 稽核、heap snapshot、擴充功能管理,都是 Playwright MCP 拿不到的。底層是 Puppeteer,所以互動有 auto-wait;代價是只支援 Chrome,而且預設會回傳使用統計給 Google。

@playwright/mcp:微軟官方的瀏覽器自動化 MCP Server

@playwright/mcp 預設用 accessibility tree(browser_snapshot)取代截圖,大幅省下 token,加上 Playwright 原生 auto-wait,是 AI agent 做網頁自動化的合理起點。要注意它預設是 headed、預設帶持久 profile,而且進階工具群組要用 --caps 開。

@modelcontextprotocol/server-puppeteer:官方 Puppeteer MCP Server

server-puppeteer 是 MCP 官方 monorepo 裡的 Puppeteer 封裝,工具集精簡、以截圖 + evaluate 為核心。但它已被官方封存(移到 servers-archived、不再更新),新專案不該再選它——想要 Puppeteer 血統的 MCP,現在該看 Chrome 團隊的 chrome-devtools-mcp。

tech deep-dive

AI 驅動的 E2E 測試:canary、Stagehand、Magnitude、Shortest 的不同解法

AI agent 跑測試不可重現、手寫 Playwright 難維護——2024-2025 年出現四套工具各自解決這個兩難,設計哲學差異很大。

Claude Code 怎麼看見你的瀏覽器:Chrome 整合、console 除錯與表單自動化

Claude Code 透過 Claude in Chrome 擴充套件取得瀏覽器控制權:讀 console log 與 DOM、點擊輸入、上傳檔案、錄 GIF,還能直接操作你已登入的網站。官方前置條件列出 Chrome、Edge 與 Brave、Arc、Vivaldi、Opera 等 Chromium 系瀏覽器,但 WSL 不支援。