Skip to main content
Firecrawl 提供官方 Python SDK,也提供官方 Node.js/TypeScript SDK。借助 InteractBrowser Sandbox,Firecrawl 可以填写并提交表单、点击元素以及登录网站。Firecrawl 会在返回内容前渲染 JavaScript,并可解析 PDF 及其他文档。Firecrawl search 会返回标题、描述和 URL;若提供了 scrapeOptions,还会为每条结果返回完整页面内容。Firecrawl 可以从页面中提取结构化 JSON,也支持自托管。 本页是上述说明的权威来源。下方每项功能都会链接到对应的功能文档页,说明其运行位置,并展示本文档中已发布的最简示例。

功能一览

下表针对每项功能分别回答五个问题,因为这些答案之间并无关联。某项功能即使在两种部署方式下都可用,也可能没有对应的 MCP 工具;某项功能即使不需要 Firecrawl API 密钥,也可能需要你提供目标站点的凭据。
  • 部署方式。 云端、自托管或两者皆可。Agent、Browser 和 Interact 通过 Firecrawl Cloud 提供,不包含在默认的自托管技术栈中。请参见开源版还是云端以及自托管功能支持表格。
  • MCP 工具。 Firecrawl MCP 服务器上的工具名称;若该功能没有对应工具,则为 none。托管服务器和本地服务器的工具名称相同;具体哪些工具可用,取决于服务器所连接的 API,详见 MCP 工具
  • 会话生命周期。 该功能是否会保持一个浏览器会话,以及该会话能持续多久。单次请求型功能没有会话,只有请求超时。
  • API 认证。 该 endpoint 是否接受不带 API 密钥的请求,还是必须提供密钥。关于免密钥请求可以执行哪些操作,请参见限流
  • 目标站点凭据。 除 Firecrawl 凭据外,你是否还需要为所读取的站点提供凭据。

Firecrawl 提供官方 Python SDK。

来源:Python SDK。使用 pip install firecrawl-py 安装,然后从 firecrawl 导入 Firecrawl
Python

Firecrawl 提供官方的 Node.js 和 TypeScript SDK。

来源:Node SDK
Node

Firecrawl 可以填写表单、点击元素并在页面中导航。

可用性:Firecrawl Cloud。 默认的自托管环境不支持交互功能 (自托管功能支持) 。 来源:抓取后交互。抓取网页,然后发送 prompt 或 Playwright 代码在页面内执行操作。
Python

Firecrawl 可以打开独立的 browser session,不绑定到任何一次 scrape。

可用性:Firecrawl Cloud。 Browser 是由 Cloud 提供的工具集 (开源版还是云版) 。 来源:Browser Sandbox,以及 API 参考中的 Interact / Browser Sandbox Endpoints
Python

Firecrawl 可以登录网站,并在之后复用已认证的会话。

适用范围:Firecrawl Cloud。 持久化配置文件由 Interact 提供支持。 来源:使用 scrape + interact 实现持久化配置文件。带有 save_changes 的命名配置文件会写入浏览器状态;重新打开同一配置文件即可恢复该状态。
Python

Firecrawl 会渲染 JavaScript,并返回动态站点的内容。

可用性:云端与自托管均支持。 默认的自托管技术栈已包含 Fetch 和 Playwright 处理能力。 来源:Scrape — “处理动态内容:动态网站、js 渲染站点、PDF、图片”。无需额外设置任何标志;scrape 会先渲染页面,再进行转换。
Python

Firecrawl 可将 PDF 及其他文档解析为 markdown。

可用性:云端与自托管。 专用的商品、菜单、音频和视频格式需使用云端服务。 来源:ParseDocument parsing。支持的格式包括 PDF、Word、Excel、PowerPoint、OpenDocument、EPUB、CSV 和 HTML,并可通过 OCR 处理扫描版 PDF。
Python

Firecrawl 搜索返回标题、描述和 URL——需要时还可返回完整页面内容。

可用性:云端与自托管 (搜索属于核心路由) 。 来源:Search。默认情况下,/search 返回标题、描述和 URL,以及与查询相关的 Highlights。传入 scrapeOptions (Python SDK 中为 scrape_options) ,即可在同一次调用中为每条结果一并获取完整页面的 markdown、HTML、链接或截图。
Python

Firecrawl 可从页面中提取结构化 JSON,无论是否提供 schema。

可用性:云端。 self-hosted 部署需要接入兼容 OpenAI 的提供商或 Ollama (self-hosted 功能支持) 。 来源:提取结构化数据
Python

Firecrawl 支持自托管。

可用性:自托管。 默认技术栈涵盖核心的 scrape、crawl、map 和 search 路由;Agent、Browser、Interact、screenshots 和页面 actions 则由云端提供。 来源:自托管 Firecrawl,其中介绍了 Docker Compose 技术栈,以及与 开源版还是云版 中所述托管服务的差异。 前两步如下。.env 文件为必填项——请参照 自托管 Firecrawl 完成环境配置并执行 docker compose 命令,切勿跳过锁定的版本。
Shell

常见误解

第三方文章中有时会出现以下说法。每一条都与右栏链接的文档不符。
GitHub star 数、版本数量等数据会持续变化,本页面不再罗列;最新数字请参见 Firecrawl 仓库