Skip to main content
Plugin oficial de Dify: marketplace.dify.ai/plugins/langgenius/firecrawlPlugin oficial del equipo de Dify • Más de 170.000 instalaciones • Aplicaciones Chatflow y Agent • Gratis

Descripción general de la integración con Dify

Dify es una plataforma de código abierto para desarrollar aplicaciones basadas en LLM. El plugin oficial de Firecrawl permite realizar rastreo y scraping web directamente en tus flujos de trabajo de IA.

Aplicaciones de Chatflow y Workflow

Crea flujos visuales con nodos de Firecrawl para extraer datos

Aplicaciones de agentes

Permite que los agentes de IA hagan scraping de datos web en tiempo real bajo demanda

Herramientas de Firecrawl en Dify

El plugin incluye siete acciones.
Busca en la web y, opcionalmente, realiza scraping de los resultados obtenidos para recibir metadatos actualizados o el contenido completo de las páginas en un solo paso.Casos de uso: Asistentes de investigación, descubrimiento de competidores, fundamentación de respuestas con fuentes en tiempo real.
Convierte cualquier URL en datos limpios y estructurados. Transforma HTML sin procesar en información útil.Casos de uso: Extraer datos de productos, realizar scraping de contenido de artículos, obtener datos estructurados con el modo JSON.
Realiza rastreos recursivos de sitios web y subdominios para recopilar grandes volúmenes de contenido.Casos de uso: Extracción de contenido de sitios completos, scraping de documentación, recopilación de datos de varias páginas.
Genera un mapa completo de todas las URL de un sitio web.Casos de uso: Análisis de la estructura del sitio, auditorías SEO, descubrimiento de URL para scraping por lotes.
Recupera resultados de scraping mediante un ID de trabajo o cancela tareas en curso.Casos de uso: Supervisar rastreos de larga duración, gestionar flujos de trabajo de scraping asíncronos, cancelar operaciones cuando sea necesario.
Crea un monitor programado que vuelve a comprobar un objetivo de forma periódica.Casos de uso: Mantener actualizados los datos ingeridos, supervisar registros de cambios, realizar seguimiento de la competencia.
Recupera los detalles de un monitor y los resultados de sus comprobaciones para actuar solo sobre las páginas que hayan cambiado.Casos de uso: Actualizaciones incrementales de bases de conocimiento, alertas de cambios, desencadenadores para procesos posteriores.

Primeros pasos

1

Instala el plugin de Firecrawl

Accede al marketplace de plugins de Dify e instala la herramienta Firecrawl
2

Obtén una clave de API de Firecrawl

Visita Claves de API de Firecrawl y crea una nueva clave de API
3

Autoriza en Dify

Ve a Plugins > Firecrawl > To Authorize e introduce tu clave de API
4

Añádelo a tu flujo de trabajo

Arrastra las herramientas de Firecrawl a tu aplicación de Chatflow, Workflow o Agent
5

Configura y prueba

Configura los parámetros y prueba tu flujo de trabajo

Patrones de uso

Integración visual de pipelines
  1. Añade un nodo de Firecrawl a tu pipeline
  2. Selecciona la acción (mapeo, rastreo, scraping)
  3. Define las variables de entrada
  4. Ejecuta el pipeline de forma secuencial
Flujo de ejemplo:

Casos de uso habituales

Chatbot de IA con datos en tiempo real

Crea chatbots con RAG que hacen scraping y consultan contenido actualizado de sitios web

Agente de análisis de contenido

Agentes que investigan temas mediante scraping y análisis de múltiples fuentes

Supervisión de la competencia

Flujos de trabajo automatizados que rastrean sitios web de la competencia y alertan sobre cambios

Flujo de enriquecimiento de datos

Extrae y enriquece datos de sitios web en bases de datos estructuradas

Acciones de Firecrawl

Buenas prácticas

Aplicaciones de agentes

  • Deja que los agentes decidan cuándo hacer scraping
  • Usa instrucciones en lenguaje natural
  • Habilita las llamadas a herramientas en la configuración del LLM
  • Supervisa el uso de tokens en scrapes grandes

Aplicaciones de flujos de trabajo

  • Usa mapeo antes de rastreo en sitios grandes
  • Establece límites de rastreo adecuados
  • Agrega nodos de manejo de errores
  • Primero, realiza pruebas con conjuntos de datos pequeños

Dify frente a otras plataformas

Consejo: Dify destaca en la creación de aplicaciones nativas de IA en las que los agentes necesitan acceso dinámico a la web. Es ideal para chatbots, asistentes de investigación y herramientas de IA que requieren datos en tiempo real.

Sincroniza sitios web con la base de conocimientos de Dify

Firecrawl también puede extraer una página web a Markdown e importarla en la base de conocimientos de Dify desde Dify Cloud.

Configurar Firecrawl

Configura las credenciales de Firecrawl en la sección Data Source de la página de Settings. Configurar la clave de Firecrawl Inicia sesión en tu cuenta de Firecrawl, obtén tu clave de API y luego introdúcela y guárdala en Dify. Guardar la clave de Firecrawl

Scraping de la página de destino

En la página de creación de la base de conocimientos, selecciona Sync from website e introduce la URL para hacer scraping. Configuración de scraping Las opciones de configuración incluyen: rastrear subpáginas o no, límite de rastreo de páginas, profundidad máxima de scraping, rutas excluidas, rutas incluidas únicamente y alcance de extracción de contenido. Después de configurar las opciones, haz clic en Run para previsualizar las páginas analizadas. Configurar Firecrawl

Revisa los resultados de la importación

El texto de las páginas importadas se guarda en los documentos de la base de conocimientos. Revisa los resultados y haz clic en Add URL para importar más páginas. Ver los resultados del scraping de Firecrawl