Skip to main content

Firecrawl 与 n8n 简介

网页抓取自动化已成为现代企业的必备能力。无论是监控竞争对手价格、汇总内容、生成线索,还是为 AI 应用提供实时数据,Firecrawl 与 n8n 的组合都能提供强大的解决方案,且无需编程知识。 Firecrawl 与 n8n 集成 什么是 n8n? n8n 是一个开源工作流自动化平台,可连接不同的工具和服务。您可以将其视为一个可视化编程环境:将节点拖放到画布上,再连接起来,即可创建自动化工作流。n8n 提供超过 400 种集成,让您无需编写代码即可构建复杂的自动化流程。

为什么要将 Firecrawl 与 n8n 结合使用?

传统网页抓取面临诸多挑战:网站更新结构后,自定义脚本可能失效;反机器人系统会封禁自动化请求;高度依赖 JavaScript 的网站无法正确渲染;基础设施也需要持续维护。 Firecrawl 负责处理抓取端的这些技术难题,而 n8n 则提供自动化框架。两者结合后,您可以构建可用于生产环境的工作流,实现:
  • 从任何网站可靠地提取数据
  • 将抓取的数据接入其他业务工具
  • 按计划运行或由事件触发
  • 从简单任务扩展到复杂管道
本指南将带您从零开始设置这两个平台,并构建第一个抓取工作流。

第 1 步:创建您的 Firecrawl 账户

Firecrawl 为您的工作流提供网页抓取功能。现在就设置您的账户并获取 API 凭据。

注册 Firecrawl

  1. 在浏览器中访问 firecrawl.dev
  2. 点击“开始使用”或“注册”按钮
  3. 使用您的电子邮箱地址或 GitHub 账户创建账户
  4. 如有提示,请验证您的电子邮箱地址

获取 API 密钥

登录后,您需要使用 API 密钥将 Firecrawl 连接到 n8n:
  1. 前往 Firecrawl Dashboard
  2. 打开 API 密钥页面
  3. 点击“创建新的 API 密钥”
  4. 为密钥设置一个便于识别的名称 (例如“n8n 集成”)
  5. 复制生成的 API 密钥,并将其妥善保存在安全的位置
Firecrawl API 密钥区域
API 密钥相当于密码。请妥善保管,切勿公开分享。下一节将需要使用此密钥。
注册 Firecrawl 后即可获得免费额度,足以测试工作流并完成本教程。

第 2 步:设置 n8n

n8n 提供两种部署选项:云托管和自托管。对于初学者来说,云版本是最快的上手方式。

选择 n8n 版本

n8n Cloud (推荐初学者使用) :
  • 无需安装
  • 提供 Free 档位
  • 基础设施由平台托管
  • 自动更新
自托管:
  • 完全掌控数据
  • 在自己的服务器上运行
  • 需要安装 Docker
  • 适合有特定安全要求的高级用户
选择最符合您需求的选项。两种方式都将进入同一个工作流编辑器界面。
  1. 访问 n8n.cloud
  2. 点击“Start Free”或“Sign Up”
  3. 使用你的电子邮件地址或 GitHub 账号注册
  4. 完成验证流程
  5. 系统会将你引导至 n8n Dashboard
展示注册选项的 n8n Cloud 首页 Free 档位提供构建和测试工作流所需的一切。若需要更多执行时间或高级功能,之后可随时升级。

选项 B:通过 Docker 自托管

如果你希望在自己的基础设施上运行 n8n,可以通过 Docker 快速完成配置。 前提条件:
  • 计算机上已安装 Docker Desktop
  • 熟悉命令行/终端的基本操作
安装步骤:
  1. 打开终端或命令提示符
  2. 创建 Docker 卷以持久化保存工作流数据:
此卷会存储你的工作流、凭据和执行历史记录,即使重启容器,数据也不会丢失。
  1. 运行 n8n Docker 容器:
显示正在执行 Docker 命令并启动 n8n 的终端
  1. 等待 n8n 启动。看到服务器正在运行的输出即表示启动成功。
  2. 打开浏览器,访问 http://localhost:5678
  3. 使用邮箱注册,创建 n8n 账户
localhost:5678 上的 n8n 自托管欢迎界面 你的自托管 n8n 实例现已在本地运行。其界面与 n8n Cloud 完全相同,因此无论选择哪种方式,都可以继续按照本指南的其余步骤操作。
--rm 标志会在停止容器时自动删除容器,但数据会安全保留在 n8n_data 卷中。对于生产环境部署,请参见 n8n 自托管文档,了解更多高级配置选项。

了解 n8n 界面

首次登录 n8n 时,您会看到主 Dashboard: 显示工作流列表视图和“创建新工作流”按钮的 n8n Dashboard 主要界面元素:
  • 工作流:您保存的自动化流程会显示在这里
  • 执行记录:工作流的运行历史
  • 凭据:已保存的 API 密钥和身份验证令牌
  • 设置:账户和工作区配置
点击“创建新工作流”以打开工作流编辑器。

工作流画布

工作流编辑器用于构建自动化流程: 空白 n8n 工作流画布,中央显示“+”按钮 主要元素:
  • 画布:放置和连接节点的主要区域
  • 添加节点按钮 (+):点击此按钮可向工作流添加新节点
  • 节点面板:点击“+”后打开,显示所有可用节点
  • 执行工作流:手动运行工作流以进行测试
  • 保存:保存工作流配置
现在,通过添加 Firecrawl 节点来构建你的第一个工作流。

第 3 步:安装并配置 Firecrawl Node

n8n 原生支持 Firecrawl。安装该节点后,使用之前创建的 API 密钥将其连接到您的 Firecrawl 账户。

将 Firecrawl Node 添加到工作流

  1. 在新建的工作流画布中,点击中央的“+”按钮
  2. 右侧会打开 Node 选择面板
  3. 在顶部搜索框中输入“Firecrawl
  4. 搜索结果中会显示 Firecrawl Node
点击 + 按钮,在搜索框中输入“Firecrawl”,随后出现 Firecrawl Node
  1. 点击 Firecrawl Node 旁的“安装
  2. 等待安装完成 (约需几秒钟)
  3. 安装完成后,点击 Firecrawl Node,将其添加到画布中
Firecrawl Node 已添加到画布,显示为带有 Firecrawl 标志的方框 Firecrawl Node 会以带有 Firecrawl 标志的方框形式显示在画布上。该 Node 表示工作流中的一项 Firecrawl 操作。

连接 Firecrawl API 密钥

**n8n Cloud 用户:**包含免费 Hobby (入门) 套餐和 100,000 额度的首发优惠已结束。添加 Firecrawl Node 时,您仍可使用一键式 “连接到 Firecrawl” OAuth 按钮。这会自动创建一个与您的 n8n 账户关联的新 Firecrawl 团队,并赠送 10,000 免费额度。这些额度不包含 Hobby (入门) 套餐升级。要在 Firecrawl Dashboard 中查看这些额度,请使用左上角的团队选择器切换到与 n8n 关联的团队。
使用 Firecrawl Node 前,您需要使用 API 密钥对其进行身份验证:
  1. 点击 Firecrawl Node 框,在右侧打开其配置面板
  2. 顶部会显示“用于连接的凭据”下拉菜单
  3. 首次使用时,请点击 “创建新凭据”
显示凭据下拉菜单及“创建新凭据”选项的 Firecrawl Node 配置面板
  1. 随即会打开凭据配置窗口
  2. 为该凭据输入名称 (例如“我的 Firecrawl 账户”)
  3. 在“API 密钥”字段中粘贴 Firecrawl API 密钥
  4. 点击底部的 “保存”
凭据现已保存到 n8n。之后使用 Firecrawl Node 时,无需再次输入 API 密钥。

测试连接

让我们验证 Firecrawl Node 是否已正确连接:
  1. 保持选中 Firecrawl Node,并查看配置面板
  2. 在“资源”下拉菜单中,选择“抓取 URL 并获取其内容
  3. 在“URL”字段中输入:https://firecrawl.dev
  4. 暂时保留其他设置的默认值
  5. 点击节点右下角的“测试步骤”按钮
选择抓取操作、输入 example.com URL 并点击测试步骤按钮 如果所有配置均正确,节点下方的输出面板中将显示从 example.com 抓取的内容。 恭喜!您的 Firecrawl Node 现已连接并正常运行。

第 4 步:创建 Telegram 机器人

在构建第一个工作流之前,你需要创建一个 Telegram 机器人来接收通知。Telegram 机器人免费,可通过 Telegram 的 BotFather 轻松创建。

使用 BotFather 创建机器人

  1. 在手机或电脑上打开 Telegram
  2. 搜索“@BotFather” (Telegram 官方机器人)
  3. 点击“Start”,开始与 BotFather 对话
  4. 发送 /newbot 命令创建新机器人
  5. BotFather 会要求你为机器人选择一个名称 (这是用户看到的显示名称)
  6. 输入一个名称,例如“My Firecrawl Bot
  7. 接下来,为机器人选择用户名。用户名必须以“bot”结尾 (例如“my_firecrawl_updates_bot”)
  8. 如果该用户名可用,BotFather 会创建你的机器人,并向你发送一条包含机器人令牌的消息
使用 BotFather 创建机器人,展示完整对话流程
请妥善保管机器人令牌。该令牌相当于密码,可让 n8n 以你的机器人身份发送消息。切勿公开分享。

获取你的聊天 ID

要向自己发送消息,你需要获取 Telegram 聊天 ID:
  1. 打开浏览器并访问以下 URL (将 YOUR_BOT_TOKEN 替换为你的实际机器人令牌) :
  2. 保持此浏览器标签页处于打开状态
  3. 在 Telegram 中搜索你刚创建的机器人的用户名
  4. 点击“Start”,开始与机器人对话
  5. 向机器人发送任意消息 (例如“hello”)
  6. 返回浏览器标签页并刷新页面
  7. 在 JSON 响应中找到 "chat":{"id": 字段
  8. "id": 后面的数字就是你的聊天 ID (例如 123456789)
  9. 保存此聊天 ID,以备后用
显示 Telegram API getUpdates 响应并高亮聊天 ID 的浏览器
你的聊天 ID 是你与机器人对话的唯一标识符。你将使用它来告诉 n8n 将消息发送到哪里。
现在,你已具备将 Telegram 集成到 n8n 工作流所需的一切。

第 5 步:使用 Telegram 构建实用工作流

现在,让我们构建三个可将信息直接发送到 Telegram 的实际工作流。这些示例展示了不同的 Firecrawl 操作,以及如何将其与 Telegram 通知集成。

示例 1:每日 Firecrawl 产品更新摘要

每天早晨在 Telegram 上接收 Firecrawl 产品更新摘要。 你将构建:
  • 每天上午 9 点抓取 Firecrawl 产品更新博客
  • 使用 AI 生成内容摘要
  • 将摘要发送到你的 Telegram
分步操作:
  1. 在 n8n 中创建一个新工作流
  2. 添加 Schedule Trigger 节点:
    • 点击 画布 上的 ”+” 按钮
    • 搜索 “Schedule Trigger
    • 配置:每天上午 9:00
配置为每天上午 9 点执行的 Schedule Trigger
  1. 添加 Firecrawl 节点:
    • 点击 Schedule Trigger 旁边的 ”+
    • 搜索并添加 “Firecrawl
    • 选择你的 Firecrawl 凭据
    • 配置:
      • Resource: 抓取 URL 并获取其内容
      • URL: https://www.firecrawl.dev/blog/category/product-updates
      • Formats: 选择“Summary”
添加并配置 Firecrawl 节点,已选择博客 URL 和 Summary 格式
  1. 添加 Telegram 节点:
    • 点击 Firecrawl 旁边的 ”+
    • 搜索 “Telegram
    • 点击 “Send a text message”,将其添加到 画布
  2. 设置 Telegram 凭据:
    • 点击 Telegram 节点,打开其配置
    • 在“Credential to connect with”下拉菜单中,点击 “Create New Credential
    • 粘贴从 BotFather 获取的机器人令牌
    • 点击 “Save
包含机器人令牌字段的 Telegram 凭据配置
  1. 配置 Telegram 消息:
    • Operation: 发送消息
    • Chat ID: 输入你的聊天 ID
    • Text: 暂时保留为“hello”消息
    • 点击 Execute step,测试发送消息并接收 Firecrawl 的摘要。
配置 Telegram 节点并将 summary 字段映射到消息文本
  • 根据 Firecrawl 的摘要结构,从 Firecrawl 节点输出中拖动 summary 字段,将摘要添加到消息文本中。
  1. 测试工作流:
    • 点击 “Execute Workflow
    • 在 Telegram 中查看摘要消息
完整工作流,显示已连接的 Schedule Trigger → Firecrawl → Telegram 节点
  1. 切换 “Active” 开关以激活工作流
现在,你的 Telegram 机器人会每天上午 9 点向你发送 Firecrawl 产品更新摘要。

示例 2:将 AI 新闻搜索结果发送到 Telegram

此工作流使用 Firecrawl 的 Search 操作查找 AI 新闻,并将格式化后的结果发送到 Telegram。 与示例 1 的主要区别:
  • 使用 Manual Trigger,而非 Schedule (按需运行)
  • 使用 Search 操作,而非 Scrape
  • 使用 Code 节点格式化多个结果
构建工作流:
  1. 创建一个新工作流,并添加 Manual Trigger 节点
  2. 添加 Firecrawl 节点,并进行以下设置:
    • Resource:搜索并可选择抓取搜索结果
    • Queryai news
    • Limit:5
使用“ai news”查询的 Firecrawl Search 节点配置
  1. 添加 Code 节点以格式化搜索结果:
    • 选择 “对所有条目运行一次”
    • 粘贴以下代码:
添加 Code 节点并粘贴格式化脚本
  1. 更新 Telegram 节点 (使用已保存的凭据) :
    • Text:从 Code 节点拖入 message 字段
完整执行工作流,并将 AI 新闻发送到 Telegram
将 Manual Trigger 替换为 Schedule Trigger,即可按设定的时间间隔自动获取 AI 新闻更新。

示例 3:AI 驱动的新闻摘要

此工作流在示例 2 的基础上引入 AI,使用 OpenAI 在发送到 Telegram 前智能总结最新的 AI 新闻。 与示例 2 相比的主要变化:
  • 添加 OpenAI 凭据配置
  • 在 Code 和 Telegram 之间添加 AI Agent Node
  • AI Agent 智能分析并总结所有新闻文章
  • Telegram 接收 AI 生成的摘要,而非原始新闻列表
修改工作流:
  1. 获取您的 OpenAI API 密钥
    • 前往 platform.openai.com/api-keys
    • 登录或创建账户
    • 点击 “Create new secret key
    • 为其命名 (例如 “n8n Integration”)
    • 立即复制 API 密钥 (之后将无法再次查看)
显示 API 密钥创建过程的 OpenAI Dashboard
  1. 添加并连接 AI Agent Node
    • 点击 Code Node 后的 ”+
    • 搜索 “Basic LLM Chain” 或 “AI Agent
    • 将 Code Node 中的 message 字段拖到 AI Agent 的输入 prompt 字段
    • 选择 OpenAI 作为 LLM 提供商
添加 AI Agent Node、从 Code Node 拖动输入并将 OpenAI 连接为 LLM
  1. 添加您的 OpenAI 凭据
    • 点击 OpenAI 的 “Create New Credential
    • 粘贴您的 OpenAI API 密钥
    • 选择模型:gpt-5-mini (成本较低) 或 gpt-5 (能力更强)
    • 点击 “Save
向 AI Agent Node 添加 OpenAI 凭据
  1. 为 AI Agent 添加系统 prompt
    • 在 AI Agent Node 中,添加以下系统 prompt:
在 AI Agent 节点中添加 system prompt
  1. 更新 Telegram 节点并测试
    • 更新 Telegram 节点:
      • Text:拖入 AI Agent 的输出 (生成的摘要)
      • 移除之前映射到 Code 节点 message 的内容
    • 点击“Execute Workflow”进行测试
    • AI 将分析所有新闻文章并生成摘要
    • 在 Telegram 中查看 AI 生成的摘要
将 AI 生成的摘要发送到 Telegram 后的完整工作流执行
AI Agent 会接收所有格式化的新闻文章并生成智能摘要,方便您一目了然地了解趋势和重要进展。

了解 Firecrawl 操作

现在你已经构建了一些工作流,接下来让我们了解 n8n 中提供的不同 Firecrawl 操作。每项操作都针对特定的网页抓取用例而设计。

抓取 URL 并获取网页内容

从单个网页提取内容,并以多种格式返回。 功能:
  • 抓取单个 URL
  • 返回干净的 Markdown、HTML 或 AI 生成的摘要
  • 可截取屏幕截图并提取链接
适用场景:
  • 提取文章内容
  • 监控产品页面
  • 抓取博客文章
  • 生成页面摘要
示例用例: 每日博客摘要 (如上方示例 1)

使用持久化配置进行抓取和交互

对于先执行 Scrape 再执行 Interact 的工作流,请在 Scrape 步骤中设置持久化 profile。Interact 步骤只需使用抓取响应中的 scrapeId,以及 prompt 或代码。请勿在 Interact 请求正文中添加 profile;Interact 会继承抓取任务的配置。 要保存 Cookie、localStorage 和其他浏览器状态,请在工作流完成后停止交互会话。如果后续工作流运行时只需读取现有配置,请在 Scrape 步骤中将 saveChanges 设为 false 如果已安装的 Firecrawl n8n 节点版本未在 Scrape 操作中提供配置设置,请更新到最新版本的 Firecrawl n8n 节点。如果您的 n8n 版本支持为节点设置自定义请求或请求正文选项,可在此处传入相同的 profile 对象:

搜索并可选择抓取搜索结果

执行网页搜索并返回结果,还可选择抓取内容。 功能说明:
  • 搜索网页、新闻或图片
  • 返回标题、描述和 URL
  • 可选择抓取结果的完整内容
最适合用于:
  • 研究自动化
  • 新闻监控
  • 趋势发现
  • 查找相关内容
示例用例: AI 新闻聚合 (如上文示例 2)

爬取网站

递归发现并抓取网站中的多个页面。 功能:
  • 自动跟随链接
  • 一次操作抓取多个页面
  • 可按模式筛选 URL
适用场景:
  • 完整提取文档
  • 网站归档
  • 多页面数据收集

映射网站并获取 URL

返回网站中发现的所有 URL,无需抓取内容。 功能:
  • 发现网站中的所有链接
  • 返回简洁的 URL 列表
  • 快速轻量
适用场景:
  • URL 发现
  • 生成站点地图
  • 规划更大规模的爬取任务

提取数据

使用 AI 根据自定义 prompt 或 schema 提取结构化信息。 功能:
  • AI 驱动的数据提取
  • 按指定格式返回数据
  • 支持跨多个页面提取
最适合:
  • 自定义数据提取
  • 构建数据库
  • 收集结构化信息

批量抓取

高效地并行抓取多个 URL。 功能:
  • 同时处理多个 URL
  • 比循环调用更高效
  • 一次返回所有结果
适用于:
  • 处理 URL 列表
  • 批量采集数据
  • 大规模网页抓取项目

代理

使用 AI 代理根据自然语言 prompt 自主浏览网站并提取数据。 功能:
  • 接收描述所需数据的 prompt
  • AI 代理自主导航并提取信息
  • 支持 同步 模式 (等待结果) 和 异步 模式 (立即返回任务 ID)
  • 使用 获取代理状态 在异步模式下轮询结果
最适合:
  • 由 prompt 引导的复杂多页面数据收集
  • 在不了解具体页面结构时提取信息
  • 需要浏览多个页面的研究任务
同步与异步:
  • 代理 (同步) 会在一步中启动任务并等待结果,是大多数使用场景中最简单的方式。最长等待时间 参数控制节点在超时前轮询的时长 (默认值:300 秒,最大值:600 秒) 。如果代理任务耗时超过此时长,即使任务仍可能在 Firecrawl 端完成,节点也会返回超时状态。对于可能超过 10 分钟的任务,请改用异步模式。
  • 代理 (异步) 会立即返回任务 ID。添加第二个 Firecrawl 节点,并使用 获取代理状态 操作,以便在任务完成后获取结果。
有关代理功能的详细信息,请参见 Agent 文档

浏览器沙箱

提供可通过代码控制的持久化浏览器会话,让您能在单个会话中执行多步骤浏览器自动化。 操作:
  • 创建浏览器会话 — 启动新的浏览器会话并返回 sessionId
  • 执行浏览器代码 — 在会话中运行 JavaScript、Python 或 bash 代码 (使用创建步骤返回的 sessionId)
  • 列出浏览器会话 — 列出活跃或已销毁的会话
  • 删除浏览器会话 — 完成后销毁会话
最适合:
  • 需要跨页面保持状态的多步骤浏览器工作流
  • 无法预先确定步骤数量的动态页面导航
  • 使用持久化浏览器配置文件,以便在多次运行之间保留 Cookie 和 localStorage 的工作流
在 n8n 中,在 Firecrawl 节点上选择 浏览器 资源即可使用这些操作。将创建步骤返回的 sessionId 传入后续每个执行或删除步骤。使用 n8n 的 Loop Over Items 节点遍历动态页面列表,并在同一会话中为每个页面调用执行操作。 有关浏览器沙箱功能的详细信息,请参见浏览器沙箱文档

工作流模板和示例

无需从零开始,您可以使用预构建模板快速上手。n8n 社区创建了许多可供复制和自定义的 Firecrawl 工作流。

完整 n8n 教程

使用 Firecrawl 和 n8n 构建可访问网页的 AI 聊天机器人

8 个生产级工作流

用于线索生成、价格监控等场景的即用型模板

Supabase pgvector RAG 管道

抓取网页并生成嵌入,存储到 Supabase pgvector 中用于 RAG

使用 AI 丰富线索

抓取公司网站并提取结构化业务信号

Pinecone RAG 管道

抓取网页并生成嵌入,存储到 Pinecone 中用于 RAG

n8n 社区工作流

浏览数百个使用 Firecrawl 的工作流

官方 n8n 集成

查看官方集成文档

如何导入模板

要使用 n8n 社区模板:
  1. 点击工作流模板链接
  2. 在模板页面点击“将模板导入 localhost:5678 自托管实例”按钮
  3. 工作流会在您的 n8n 实例中打开
  4. 为每个节点配置凭据
  5. 根据您的使用场景自定义设置
  6. 激活工作流
从 n8n.io 导入模板,显示导入按钮和在 n8n 中打开的工作流

最佳实践

遵循以下建议,构建可靠且高效的工作流:

测试与调试

  • 激活计划前,务必先手动测试工作流
  • 使用“Execute Workflow”按钮测试整个流程
  • 检查每个 Node 的输出数据,确认是否正确
  • 使用“执行记录”选项卡查看历史运行记录并排查问题
显示工作流运行历史记录(含时间戳和状态)的 执行记录 选项卡

错误处理

  • 添加 Error Trigger 节点以捕获和处理失败情况
  • 为工作流失败设置通知
  • 对非关键节点启用“Continue On Fail”设置
  • 定期监控工作流的执行情况

性能优化

  • 对多个 URL 使用 Batch Scrape,避免循环处理
  • 设置适当的限流,避免对目标网站造成过大压力
  • 尽可能缓存数据,减少不必要的请求
  • 在非高峰时段安排资源密集型工作流

安全性

  • 切勿在工作流配置中泄露 API 密钥
  • 使用 n8n 的凭据系统安全存储身份验证信息
  • 公开分享工作流时务必谨慎
  • 遵守目标网站的服务条款和 robots.txt

后续步骤

现在,您已掌握使用 Firecrawl 和 n8n 构建网页抓取自动化流程的基础知识。接下来可通过以下方式继续学习:

探索高级功能

  • 了解 Webhook 配置,实现实时数据处理
  • 使用 prompt 和 schema 尝试 AI 驱动的提取
  • 构建包含分支逻辑的复杂多步骤工作流

加入社区

  1. 完成本指南中的示例工作流
  2. 修改社区库中的模板
  3. 构建一个工作流,解决工作中的实际问题
  4. 探索 Firecrawl 的高级操作
  5. 分享你自己的模板,帮助他人
需要帮助? 如果遇到困难或有疑问,Firecrawl 和 n8n 社区都很活跃且乐于提供帮助。在构建自动化工作流时,随时可以寻求指导。

其他资源