目錄
「爬資料餵 AI」已經催生出一整個工具生態。從 MarkItDown 的 175k stars 到各種千星級的利基工具,GitHub 上至少有 34 個活躍專案在處理這件事。這篇把它們沿五條軸線分類——整站爬取、AI 瀏覽器代理、文件轉檔、智慧擷取、反偵測基建——幫你根據場景選對工具,不用再自己刻爬蟲。
不只是「把網頁抓下來」
爬資料餵 AI 的核心問題有三個,彼此獨立,沒有一個工具能全解:
- 格式轉換:怎麼把非結構化的網頁或文件轉成 LLM 能消化的格式(Markdown、結構化 JSON)
- 互動爬取:怎麼處理需要登入、JS 渲染、動態載入的頁面
- 穩定取得:怎麼在反爬蟲越來越嚴的環境下可靠地拿到資料
誰來決定怎麼爬:五種取向
工具之間最大的分歧在「決策者是誰」:
| 取向 | 代表工具 | 決策者 | 代價 |
|---|---|---|---|
| 規則驅動 | Scrapy、Crawlee | 開發者寫選擇器 | 維護成本高,改版就壞 |
| AI 驅動(DOM) | ScrapeGraphAI、Stagehand | LLM 看 DOM 決定 | Token 成本、延遲 |
| AI 驅動(視覺) | Skyvern、Browser-Use | LLM 看截圖決定 | 更慢更貴,但跨平台 |
| 自適應 | Scrapling、AgentQL | 智慧選擇器自動修復 | 不靠 AI 但有學習曲線 |
| 格式轉換 | MarkItDown、MinerU、Marker | 不做爬取,只做轉檔 | 需搭配上游爬蟲 |
以下五大分類就沿這些取向展開。
整站爬取:Firecrawl 領跑,但注意授權
首選 Firecrawl(170k stars, AGPL-3.0)——功能最全、生態最大,自帶 JS 渲染、Markdown 輸出、sitemap 掃描,API 設計直接面向 LLM 輸入場景。代價是 AGPL 授權:你的整合程式碼若對外提供服務,也必須開源。
如果授權不能接受,Crawl4AI(79k stars, Apache-2.0)是最接近的替代,Python 寫的、更輕量,社群成長很快。
百萬頁規模用 Scrapy(63k stars, BSD-3)——Python 生態的老牌框架,分散式架構成熟,但要自己寫解析器。JS/TS 團隊用 Crawlee(25k stars, Apache-2.0),Apify 出品,API 乾淨,支援 Playwright 和 Cheerio。非工程背景可以看 Maxun(~17k stars),no-code 介面直接在瀏覽器裡標記要爬的元素。
AI 瀏覽器代理:讓 AI 像真人操作
這類工具讓 AI 像真人一樣操作瀏覽器——點擊、填表、滾動、截圖,全程自主決策。
Browser-Use(110k stars, MIT)社群最大,Python 寫的 autonomous agent loop,每步都靠 LLM 推理決定下一動,適合「讓 AI 自己上網完成任務」的場景。Stagehand(24k stars, MIT)API 最乾淨——三個原語 act / extract / observe 就涵蓋操作和資料擷取,建在 Playwright 上,TypeScript,適合寫成穩定的自動化腳本。Skyvern(23k stars, AGPL-3.0)走視覺優先路線,不解析 DOM,純靠截圖做決策,跨平台性最好但每步最慢。
Browser-MCP(~7k stars)把瀏覽器操作暴露成 MCP tools,適合直接接進 Claude 或 LLM agent 的工作流程。
想深入了解純視覺路線的取捨,可以看站內的 Midscene.js 深度分析——同賽道但選了「只看截圖、不碰 DOM」的極端路線,連 DOM 動作模式都在 v1.0 移除了。
文件轉檔:不爬取,只轉格式
這類工具不負責爬取,吃的是你已經有的檔案。放進這篇是因為「爬資料餵 AI」的第一個核心問題就是格式轉換——但這一層的選型邏輯不在爬蟲脈絡裡,而且內部差異比看起來大。
MarkItDown(175k stars, MIT)與 anydoc(746 stars, MIT)是純轉換:讀檔案裡既有的結構、對映成 Markdown,不需要模型也不需要 GPU,中位耗時在毫秒級。MinerU(78k stars)、Marker(39k stars)、Docling(65k stars)則是要跑模型做 OCR 的解析工具,處理掃描件與複雜版面,慢兩到三個數量級,而且真正的選型軸是授權而不是準確度。
這一層的完整取捨站上另有專門系列,不在這篇重複:「文件解析實戰」的三層階梯講怎麼選層、解析層那篇講三家的授權陷阱、掃描考古題實測是 10 種工具的實際數字。
輕量選項:Trafilatura(~6k stars)專攻「從網頁抽正文、濾廣告」,做前處理穩定好用。Jina Reader(12k stars, Apache-2.0)零設定——URL 前加 r.jina.ai/ 就拿到 Markdown。Readability(~9k stars)是 Firefox 閱讀模式的引擎,常被當成前處理步驟嵌在其他工具裡。
智慧擷取:讓選擇器自己修復
規則驅動的爬蟲碰到網站改版就壞。這類工具用 AI 或自適應機制讓擷取更穩。
Scrapling(76k stars, BSD-3)是自適應選擇器——不靠 LLM,而是用智慧演算法在網站改版後自動修復失效的選擇器,速度快、不花 token。ScrapeGraphAI(29k stars, MIT)走另一條路:你用自然語言描述要什麼資料,它用 LLM 自動建爬蟲管線,適合一次性擷取任務。AutoScraper(8k stars, MIT)更簡單——給一個範例頁面和你要的資料,它自動學會選擇器。
AgentQL(~1k stars)用語意查詢取代 CSS/XPath,Parsera 是輕量的 LLM 擷取 library,ferret(~6k stars, Go)提供宣告式擷取語言。
反偵測與基建:穩定取得資料的基礎設施
curl_cffi(6k stars, MIT)偽裝 TLS 指紋,讓 HTTP 請求看起來像真實瀏覽器發出的。CloakBrowser(~29k stars)是隱身版 Chromium,可以直接 drop-in 替換 Playwright 的瀏覽器實例。botasaurus(~6k stars)是 Python 反偵測爬蟲框架,SeleniumBase(~13k stars)是 Selenium 的加強版,內建 stealth 模式。
changedetection.io(~33k stars)做另一件事——不爬取,而是監控網頁變更並通知你,適合追蹤價格、庫存或政策變動。scrcpy(148k stars, Apache-2.0)嚴格來說不是爬蟲,而是 Android 螢幕鏡像工具,用在需要從 App 擷取資料的場景。brightdata-mcp(~3k stars)是商業級 MCP server,讓 AI agent 透過 Bright Data 的基礎設施取得資料。
更多反偵測細節,參考站內的繞過 Cloudflare 反爬蟲指南(nodriver / stealth / camoufox 的比較)。MCP 串接爬蟲的實作範例,見把爬蟲腳本做成 MCP Server。
選型速查表
以下是經 GitHub API 驗證的主要工具(2026-08-21 重新查詢),按星數排序:
| 工具 | Stars | 授權 | 語言 | 定位 |
|---|---|---|---|---|
| MarkItDown | 175k | MIT | Python | 文件轉 Markdown |
| Firecrawl | 170k | AGPL-3.0 | TS | 整站爬取 + LLM 輸出 |
| scrcpy | 148k | Apache-2.0 | C | Android 螢幕鏡像 |
| Browser-Use | 110k | MIT | Python | AI 瀏覽器代理 |
| MinerU | 78k | — | Python | PDF 表格/公式擷取 |
| Crawl4AI | 79k | Apache-2.0 | Python | 輕量整站爬取 |
| Scrapling | 76k | BSD-3 | Python | 自適應選擇器 |
| Docling | 65k | MIT | Python | 結構化文件轉換 |
| Scrapy | 64k | BSD-3 | Python | 大規模爬蟲框架 |
| Marker | 39k | Apache-2.0 | Python | 快速 PDF 轉換 |
| ScrapeGraphAI | 29k | MIT | Python | 自然語言 → 爬蟲 |
| Crawlee | 25k | Apache-2.0 | TS | JS/TS 爬蟲框架 |
| Stagehand | 24k | MIT | TS | 乾淨 API 瀏覽器代理 |
| Skyvern | 23k | AGPL-3.0 | Python | 視覺優先瀏覽器代理 |
| Jina Reader | 12k | Apache-2.0 | TS | URL → Markdown |
| AutoScraper | 8k | MIT | Python | 範例驅動擷取 |
| curl_cffi | 6k | MIT | Python | TLS 指紋偽裝(維護中) |
另有 changedetection.io、CloakBrowser、Maxun、SeleniumBase、Readability、Browser-MCP、Trafilatura、ferret、botasaurus、AnyCrawl、Markdowner、CyberScraper-2077、brightdata-mcp、webclaw、Parsera、AgentQL、Craw4LLM 等 17 個工具收錄在研究筆記中,多數星數在千至萬級。
整體來說
這個領域的工具沿「規則 vs AI」和「通用 vs 專用」兩軸分布。2024–2025 的趨勢很明確:AI 驅動的爬蟲(ScrapeGraphAI、Browser-Use、Stagehand)和文件轉 LLM 格式(MinerU、Marker、Docling)爆發成長。但規則驅動的老牌工具(Scrapy、Crawlee)在百萬頁規模仍無可取代。
選型的關鍵不是「哪個最好」,而是場景匹配:
- Markdown 輸出 + 不想管 JS 渲染 → Firecrawl(注意 AGPL)或 Crawl4AI
- 登入 / 複雜互動 → Browser-Use 或 Stagehand
- PDF / Office 轉檔 → MarkItDown(通用)或 MinerU(學術 PDF)
- 網站常改版、選擇器一直壞 → Scrapling
- 被 Cloudflare 擋 → curl_cffi + 繞過 Cloudflare 指南
- 想把爬取接成自己的搜尋 API(取代 Tavily / Exa)→ Crawl4AI + SearXNG,組法與代價見自架搜尋堆疊那篇
更新紀錄
- 2026-08-21:全表星數重新以 GitHub API 查證,並修正三個已改名的 org——Firecrawl
mendableai→firecrawl、DoclingDS4SD→docling-project、MarkerVikParuchuri→datalab-to(舊網址靠 301 還能通,但寫著舊名不對)。一個月內漂動最大的是 Firecrawl(155k → 170k)與 Scrapling(71k → 76k)。另外把反偵測那節停更兩年的 curl-impersonate(最後 push 2024-07-18)整條移除,換成仍在維護的 curl_cffi。另外「文件轉檔」一節縮短:原本把純轉換(MarkItDown、anydoc)與會做 OCR 的解析工具(MinerU / Marker / Docling)混在一起講,兩者差兩到三個數量級。現在只留分界說明與轉手連結——這一層的完整選型、授權陷阱與實測歸「文件解析實戰」系列管,本篇不重複。 - 2026-08-06:「文件轉檔」一節補上 anydoc(Firecrawl 的 Rust 轉檔函式庫,14/14 格式、4.7ms 中位耗時、746 stars、MIT 授權),並標注它與 Firecrawl 主專案 AGPL-3.0 的授權差異。文件轉檔這一層的完整選型脈絡另見「文件解析實戰」系列。本篇其餘工具的星數仍為 2026-07-24 查詢值,未重新驗證。
參考資料
- Firecrawl (GitHub)
- Crawl4AI (GitHub)
- Browser-Use (GitHub)
- Crawlee (GitHub)
- Scrapy (GitHub)
- MarkItDown (GitHub)
- Scrapling (GitHub)
- ScrapeGraphAI (GitHub)
- Stagehand (GitHub)
- Skyvern (GitHub)
- MinerU (GitHub)
- Marker (GitHub)
- Docling (GitHub)
- anydoc (GitHub)
- Jina Reader (GitHub)
- Trafilatura (GitHub)
- AutoScraper (GitHub)
- curl_cffi (GitHub) — 維護中的 TLS 指紋偽裝方案
- changedetection.io (GitHub)
- scrcpy (GitHub)
- Midscene.js:純視覺 UI 自動化(站內)
- 繞過 Cloudflare 反爬蟲指南(站內)
- 把爬蟲腳本做成 MCP Server(站內)
Loading...