Skip to main content
Dify 官方插件: marketplace.dify.ai/plugins/langgenius/firecrawlDify 团队官方插件 • 安装量超过 170,000 次 • 支持 Chatflow 和代理应用 • 免费使用

Dify 集成概览

Dify 是一个开源的 LLM 应用开发平台。通过官方 Firecrawl 插件,您可以直接在 AI 工作流中抓取和爬取网页。

Chatflow 和工作流应用

使用 Firecrawl 节点构建用于提取数据的可视化流水线

代理应用

让 AI 代理能够按需抓取实时网页数据

Dify 中的 Firecrawl 工具

该插件提供七个 actions。
进行网页搜索,并可选择抓取返回的结果,一步获取最新的结果元数据或完整页面内容。使用场景: 研究助手、发现竞争对手、基于实时来源为答案提供依据。
将任意 URL 转换为干净的结构化数据,将原始 HTML 转化为可直接使用的洞察。使用场景: 提取产品数据、抓取文章内容、通过 JSON 模式获取结构化数据。
递归爬取网站及其子域名,收集大量内容。使用场景: 全站内容提取、文档抓取、多页面数据收集。
生成网站中所有 URL 的完整映射。使用场景: 网站结构分析、SEO 审核、为批量抓取发现 URL。
根据任务 ID 获取抓取结果,或取消正在执行的任务。使用场景: 监控长时间运行的爬取任务、管理异步抓取工作流、按需取消操作。
创建定时监控,按固定周期重新检查目标。使用场景: 保持已采集数据的时效性、监控变更日志、跟踪竞争对手。
获取监控详情及检查结果,仅对发生变化的页面采取操作。使用场景: 增量更新知识库、变更告警、触发下游流程。

快速开始

1

安装 Firecrawl 插件

前往 Dify 插件市场,安装 Firecrawl 工具
2

获取 Firecrawl API 密钥

前往 Firecrawl API 密钥 页面,创建新的 API 密钥
3

在 Dify 中授权

进入 插件 > Firecrawl > 待授权,输入您的 API 密钥
4

添加到工作流

将 Firecrawl 工具拖入您的 Chatflow、工作流或代理应用
5

配置并测试

设置参数并测试工作流

使用模式

可视化流水线集成
  1. 将 Firecrawl Node 添加到流水线
  2. 选择操作 (Map、Crawl、Scrape)
  3. 定义输入变量
  4. 依次执行流水线
示例流程:

常见用例

具备实时数据的 AI 聊天机器人

构建由 RAG 驱动、可抓取并引用实时网站内容的聊天机器人

内容分析代理

可通过抓取和分析多个来源来研究主题的代理

竞争对手监控

跟踪竞争对手网站并在发生变更时发出告警的自动化工作流

数据丰富管道

从网站提取并丰富数据,再导入结构化数据库

Firecrawl actions

最佳实践

代理应用

  • 让代理自行决定何时抓取
  • 使用自然语言指令
  • 在 LLM 设置中启用工具调用
  • 大规模抓取时监控 token 使用量

工作流应用

  • 对大型网站,先使用 Map,再使用 Crawl
  • 设置合适的爬取限制
  • 添加错误处理节点
  • 先用小型数据集进行测试

Dify 与其他平台对比

专业提示: Dify 擅长构建需要代理动态访问网页的 AI 原生应用,非常适合需要实时数据的聊天机器人、研究助手和 AI 工具。

将网站同步到 Dify 知识库

Firecrawl 还可以将网页抓取为 Markdown,并通过 Dify Cloud 将其导入 Dify 知识库。

配置 Firecrawl

在设置页面的 Data Source 部分配置 Firecrawl 凭据。 配置 Firecrawl 密钥 登录你的 Firecrawl 账户,获取 API 密钥,然后在 Dify 中输入并保存。 保存 Firecrawl 密钥

抓取目标网页

在知识库创建页面中,选择“Sync from website”,并输入要抓取的 URL。 Scraping setup 配置选项包括:是否爬取子页面、页面爬取上限、页面抓取最大深度、排除路径、仅包含路径,以及内容提取范围。完成配置后,点击“Run”以预览解析后的页面。 Set Firecrawl configuration

查看导入结果

导入的页面文本会存储在知识库文档中。查看结果,然后点击 Add URL 导入更多页面。 查看 Firecrawl 抓取结果