Skip to main content

Outils disponibles

1. outil de scraping (firecrawl_scrape)

Récupérez le contenu d’une URL unique avec des options avancées.
Pour masquer les informations permettant d’identifier une personne, incluez redactPII dans les arguments de l’outil de scrape.

2. Outil de cartographie (firecrawl_map)

Cartographiez un site web pour découvrir toutes les URL indexées qu’il contient.

Options de l’outil de cartographie :

  • url : URL de base du site web à cartographier
  • search : Terme de recherche facultatif pour filtrer les URL
  • sitemap : Contrôle l’utilisation du sitemap : « include », « skip » ou « only »
  • includeSubdomains : Indique s’il faut inclure les sous-domaines dans la cartographie
  • limit : Nombre maximal d’URL à renvoyer
  • ignoreQueryParameters : Indique s’il faut ignorer les paramètres de requête lors de la cartographie
Idéal pour : Découvrir les URL d’un site web avant de choisir celles à scraper ; trouver des sections spécifiques d’un site web. Renvoie : Tableau des URL trouvées sur le site. Effectuez une recherche sur le web et extrayez éventuellement le contenu des résultats.

Options de l’outil de recherche :

  • query : Chaîne de requête de recherche (obligatoire)
  • limit : Nombre maximal de résultats à renvoyer
  • location : Emplacement géographique des résultats de recherche
  • tbs : Filtre de recherche temporel (par exemple, qdr:d pour le dernier jour, qdr:w pour la dernière semaine, qdr:m pour le dernier mois)
  • filter : Filtre de recherche supplémentaire
  • sources : Tableau des types de sources dans lesquels effectuer la recherche (web, images, news)
  • scrapeOptions : Options de scraping des pages de résultats de recherche
  • enterprise : Tableau d’options d’entreprise (default, anon, zdr)

4. Outil de parsing (firecrawl_parse)

Convertissez un fichier local, tel qu’un document PDF, DOCX, XLSX ou HTML, en données propres et exploitables par les LLM.
Lorsque vous exécutez Firecrawl MCP localement sur une instance de l’API Firecrawl avec FIRECRAWL_API_URL, le serveur MCP peut lire directement filePath et envoie les octets du fichier à /v2/parse. Lorsque vous utilisez le serveur MCP hébergé à distance, il ne peut pas lire les fichiers présents sur votre machine. Dans ce cas, firecrawl_parse utilise un transfert en deux étapes qui fonctionne également avec l’URL distante sans clé :
  1. Appelez firecrawl_parse avec filePath. L’outil renvoie une commande de téléversement préremplie et un nextToolCall contenant une uploadRef.
  2. Exécutez la commande de téléversement sur la machine qui peut lire le fichier, puis appelez de nouveau firecrawl_parse avec l’uploadRef renvoyée.
La commande de téléversement envoie les octets du fichier vers une cible de téléversement signée à durée de vie limitée. Elle n’inclut pas votre clé API Firecrawl.

Options de l’outil de parsing :

  • filePath : Chemin local du fichier à analyser. À utiliser lors du premier appel.
  • uploadRef : Référence renvoyée par le premier appel MCP hébergé. À utiliser lors du deuxième appel, une fois le téléversement terminé.
  • formats : Formats de sortie. La valeur par défaut est markdown.
  • parsers : Paramètres du parseur, tels que les options de parsing des PDF.
  • contentType : Remplacement facultatif du type MIME du fichier.
  • declaredSizeBytes : Indication facultative de la taille du fichier. La taille des fichiers est limitée à 50 Mo.
Idéal pour : Les documents locaux ou non publics qui ne sont pas accessibles via une URL publique. Non recommandé pour : Les URL de documents publics. Utilisez plutôt firecrawl_scrape : il détecte et analyse les documents à partir de leurs URL.

5. Outil de crawl (firecrawl_crawl)

Démarrez un crawl asynchrone avec des options avancées.

6. Vérifier l’état d’un crawl (firecrawl_check_crawl_status)

Vérifiez l’état d’un crawl.
Renvoie : L’état d’avancement du crawl, ainsi que les résultats s’ils sont disponibles.

7. Outil Extract (firecrawl_extract)

Extrait des informations structurées à partir de pages web à l’aide de LLM. Prend en charge l’extraction par IA dans le cloud et par des LLM auto-hébergés.
Exemple de réponse :

Options de l’outil Extract :

  • urls : tableau d’URL à partir desquelles extraire des informations
  • prompt : prompt personnalisé pour l’extraction par le LLM
  • schema : schéma JSON pour l’extraction de données structurées
  • allowExternalLinks : autoriser l’extraction depuis des liens externes
  • enableWebSearch : activer la recherche web pour obtenir du contexte supplémentaire
  • includeSubdomains : inclure les sous-domaines dans l’extraction
Avec une instance auto-hébergée, l’extraction utilise le LLM que vous avez configuré. Avec l’API cloud, elle utilise le service LLM géré par Firecrawl.

8. Outil Agent (firecrawl_agent)

Agent de recherche web autonome qui parcourt Internet de manière indépendante, recherche des informations, navigue entre les pages et extrait des données structurées selon votre requête. Il s’exécute de manière asynchrone — il renvoie immédiatement un ID de tâche, puis vous interrogez firecrawl_agent_status pour vérifier qu’il est terminé et récupérer les résultats.
Vous pouvez également fournir des URL spécifiques sur lesquelles l’agent devra se concentrer :

Options de l’outil Agent :

  • prompt : Description en langage naturel des données souhaitées (obligatoire, 10 000 caractères maximum)
  • urls : Tableau facultatif d’URL permettant de cibler l’agent sur des pages spécifiques
  • schema : Schéma JSON facultatif pour une sortie structurée
Idéal pour : Les tâches de recherche complexes lorsque vous ne connaissez pas les URL exactes ; la collecte de données provenant de plusieurs sources ; la recherche d’informations dispersées sur le web ; l’extraction de données depuis des SPA fortement basées sur JavaScript qui échouent avec un scrape classique. Renvoie : Un ID de tâche permettant de vérifier l’état. Utilisez firecrawl_agent_status pour interroger les résultats.

9. Vérifier le statut de l’agent (firecrawl_agent_status)

Vérifiez l’état d’une tâche d’agent et récupérez les résultats une fois celle-ci terminée. Interrogez toutes les 15 à 30 secondes pendant au moins 2 à 3 minutes avant de considérer la requête comme ayant échoué.

Options de statut de l’agent :

  • id : l’ID de tâche d’agent renvoyé par firecrawl_agent (obligatoire)
États possibles :
  • processing : l’agent effectue encore ses recherches — continuez à l’interroger
  • completed : la recherche est terminée — la réponse contient les données extraites
  • failed : une erreur s’est produite
Renvoie : l’état, la progression et les résultats (si terminée) de la tâche d’agent.

10. Interagir avec une page (firecrawl_interact)

Interagissez avec une page dans une session de navigateur en direct : cliquez sur des boutons, remplissez des formulaires, extrayez du contenu dynamique ou naviguez plus loin. Utilisez l’un des deux modes de ciblage :
  • Transmettez url pour ouvrir une nouvelle page et interagir avec elle en un seul appel MCP.
  • Transmettez le scrapeId d’un appel firecrawl_scrape précédent pour réutiliser la page déjà chargée.
Ne transmettez pas simultanément url et scrapeId. Fournissez soit prompt, soit code. scrapeOptions ne peut être utilisé qu’en mode url. Exemple en mode URL :
Exemple de réutilisation d’un scrape :

Options de l’outil Interact :

  • url : Page avec laquelle interagir ; ouvre une session pour vous. Utilisez ce paramètre ou scrapeId.
  • scrapeId : ID de tâche de scraping issu d’un appel firecrawl_scrape précédent. Utilisez ce paramètre ou url.
  • prompt : Instruction en langage naturel décrivant l’action à effectuer. Fournissez prompt ou code.
  • code : Code à exécuter dans la session de navigateur. Fournissez code ou prompt.
  • language : bash, python ou node (facultatif, node par défaut, utilisé uniquement avec code).
  • timeout : Délai d’exécution en secondes, de 1 à 300 (facultatif, 30 par défaut).
  • scrapeOptions : Options de scraping facultatives utilisées uniquement en mode url.
Idéal pour : Les workflows en plusieurs étapes sur une seule page — rechercher sur un site, parcourir les résultats, remplir des formulaires, extraire des données nécessitant une interaction. Renvoie : Le résultat de l’interaction, y compris les URL de sortie et de la vue en direct.

11. Arrêter une session Interact (firecrawl_interact_stop)

Arrêtez une session Interact associée à une page scrapée. Appelez cette fonction une fois vos interactions terminées afin de libérer des ressources.

Options d’arrêt d’une session Interact :

  • scrapeId : l’ID de scrape de la session à arrêter (obligatoire)
Renvoie : la confirmation de l’arrêt de la session.

Système de journalisation

Le serveur fournit une journalisation complète :
  • État et progression des opérations
  • Indicateurs de performance
  • Surveillance de l’utilisation des crédits
  • Suivi des limites de débit
  • Conditions d’erreur
Exemples de messages de journal :

Gestion des erreurs

Le serveur offre une gestion robuste des erreurs :
  • Nouvelles tentatives automatiques en cas d’erreurs transitoires
  • Gestion des limites de débit avec backoff exponentiel
  • Messages d’erreur détaillés
  • Avertissements sur l’utilisation des crédits
  • Résilience du réseau
Exemple de réponse d’erreur :