Skip to main content
Plugin officiel Dify : marketplace.dify.ai/plugins/langgenius/firecrawlPlugin officiel de l’équipe Dify • Plus de 170 000 installations • Applications Chatflow et Agent • Gratuit

Présentation de l’intégration Dify

Dify est une plateforme open source de développement d’applications basées sur des LLM. Le plugin officiel de Firecrawl permet d’effectuer du crawling et du scraping web directement dans vos workflows d’IA.

Applications Chatflow et Workflow

Créez des pipelines visuels avec des nœuds Firecrawl pour extraire des données

Applications d’agents

Donnez aux agents IA la possibilité de scraper des données web en temps réel, à la demande

Outils Firecrawl dans Dify

Le plugin propose sept actions.
Recherchez sur le Web et, si besoin, scrapez les résultats obtenus pour récupérer des métadonnées récentes ou le contenu complet des pages en une seule étape.Cas d’utilisation : Assistants de recherche IA, identification de concurrents, enrichissement des réponses avec des sources en temps réel.
Convertissez n’importe quelle URL en données propres et structurées. Transformez du HTML brut en insights exploitables.Cas d’utilisation : Extraction de données produit, scraping du contenu d’articles, obtention de données structurées avec le mode JSON.
Effectuez des crawls récursifs de sites Web et de sous-domaines pour collecter de grandes quantités de contenu.Cas d’utilisation : Extraction du contenu complet d’un site, scraping de documentation, collecte de données sur plusieurs pages.
Générez une cartographie complète de toutes les URL présentes sur un site Web.Cas d’utilisation : Analyse de la structure du site, audit SEO, découverte d’URL pour le scraping par lots.
Récupérez les résultats de scraping à partir d’un ID de tâche ou annulez les tâches en cours.Cas d’utilisation : Surveiller les crawls de longue durée, gérer les workflows de scraping asynchrones, annuler des opérations si nécessaire.
Créez un monitor planifié qui revérifie une cible à intervalles réguliers.Cas d’utilisation : Maintenir les données ingérées à jour, surveiller les journaux des modifications, suivre les concurrents.
Récupérez les détails d’un monitor et les résultats de ses vérifications afin d’agir uniquement sur les pages modifiées.Cas d’utilisation : Mises à jour incrémentielles de la base de connaissances, alertes de changement, déclencheurs en aval.

Premiers pas

1

Installer le plugin Firecrawl

Accédez au Marketplace des plugins Dify et installez l’outil Firecrawl
2

Obtenir une clé API Firecrawl

Rendez-vous sur Clés API Firecrawl et créez une clé API
3

Autoriser Firecrawl dans Dify

Accédez à Plugins > Firecrawl > To Authorize et saisissez votre clé API
4

Ajouter à votre workflow

Glissez les outils Firecrawl dans votre application Chatflow, Workflow ou Agent
5

Configurer et tester

Configurez les paramètres et testez votre workflow

Modèles d’utilisation

Intégration dans un pipeline visuel
  1. Ajoutez un nœud Firecrawl à votre pipeline
  2. Sélectionnez une action (cartographie, Crawl, Scrape)
  3. Définissez les variables d’entrée
  4. Exécutez le pipeline de manière séquentielle
Exemple de flux :

Cas d’utilisation courants

Chatbot IA avec données en temps réel

Créez des chatbots basés sur la RAG qui scrappent et citent du contenu web en temps réel

Agent d'analyse de contenu

Des agents qui étudient des sujets en scrappant et analysant plusieurs sources

Surveillance des concurrents

Des workflows automatisés qui suivent les sites web des concurrents et vous alertent en cas de changement

Pipeline d'enrichissement des données

Extrayez et enrichissez les données de sites web dans des bases de données structurées

Actions Firecrawl

Bonnes pratiques

Applications d’agents

  • Laissez les agents décider quand effectuer un scrape
  • Utilisez des instructions en langage naturel
  • Activez l’appel d’outils dans les paramètres du LLM
  • Surveillez l’utilisation des jetons lors de scrapes volumineux

Applications de workflows

  • Utilisez cartographie avant Crawl pour les sites volumineux
  • Définissez des limites de crawl adaptées
  • Ajoutez des nœuds de gestion des erreurs
  • Commencez par tester avec de petits jeux de données

Dify et les autres plateformes

Conseil de pro : Dify excelle dans la création d’applications nativement basées sur l’IA, où les agents ont besoin d’un accès dynamique au web. Idéal pour les chatbots, les assistants de recherche IA et les outils d’IA nécessitant des données en temps réel.

Synchroniser des sites web dans la base de connaissances de Dify

Firecrawl peut également extraire une page web au format Markdown et l’importer dans la base de connaissances de Dify depuis Dify Cloud.

Configuration de Firecrawl

Configurez les identifiants Firecrawl dans la section Source de données de la page Paramètres. Configurer la clé Firecrawl Connectez-vous à votre compte Firecrawl, récupérez votre clé d’API, puis saisissez-la et enregistrez-la dans Dify. Enregistrer la clé Firecrawl

Scraper la page web cible

Sur la page de création de la base de connaissances, sélectionnez Sync from website et saisissez l’URL à scraper. Configuration du scraping Les options de configuration incluent : Activer le crawl des sous-pages, Limite de pages à crawler, Profondeur maximale de scraping par page, Chemins exclus, Chemins à inclure uniquement, et Portée de l’extraction de contenu. Une fois la configuration terminée, cliquez sur Run pour prévisualiser les pages analysées. Définir la configuration Firecrawl

Examiner les résultats de l’importation

Le texte des pages importées est enregistré dans les documents de la base de connaissances. Consultez les résultats et cliquez sur Add URL pour importer davantage de pages. Voir les résultats du scraping Firecrawl