Crawl
Remarque : Une nouvelle version v2 de cette API est désormais disponible avec de nouvelles fonctionnalités et de meilleures performances.
Autorisations
Bearer authentication header of the form Bearer <token>, where <token> is your auth token.
Corps
L’URL de base à partir de laquelle démarrer le crawl
⚠️ OBSOLÈTE : utilisez plutôt « crawlEntireDomain ». Permet au robot d'exploration de suivre les liens internes vers des URL au même niveau ou parentes, et pas seulement vers des chemins enfants.
Permet au crawler de suivre des liens pointant vers des sites web externes.
Permet au crawler de suivre les liens vers les sous-domaines du domaine principal.
Permet au crawler de suivre les liens internes vers des URL au même niveau ou de niveau supérieur, et pas seulement des chemins enfants.
false : Explore uniquement les URL plus profondes (enfants). → ex. /features/feature-1 → /features/feature-1/tips ✅ → Ne suivra pas /pricing ou / ❌
true : Explore tous les liens internes, y compris les URL au même niveau et de niveau supérieur. → ex. /features/feature-1 → /pricing, /, etc. ✅
Utilisez true pour une couverture interne plus large, au‑delà des chemins imbriqués.
Intervalle en secondes entre deux opérations de scraping. Cela permet de respecter les limites de fréquence des sites web.
Motifs d’expressions régulières de chemins d’URL qui excluent du crawl les URL correspondantes. Par exemple, si vous définissez "excludePaths": ["blog/.*"] pour l’URL de base firecrawl.dev, tous les résultats correspondant à ce motif seront exclus, comme https://www.firecrawl.dev/blog/firecrawl-launch-week-1-recap. Les motifs utilisent la syntaxe des expressions régulières Rust (style RE2) : les assertions look-around et les références arrière ne sont pas prises en charge, et un motif qui ne se compile pas est rejeté avec un code 400. Chaque champ accepte au maximum 1 000 motifs de 2 000 caractères maximum chacun, et includePaths et excludePaths ne peuvent pas contenir ensemble plus de 1 000 motifs et 100 000 caractères au total. Pour le filtrage par mots-clés, envoyez un motif court par terme plutôt que de combiner les termes dans une seule longue alternance.
10002000Ne relancez pas le scraping du même chemin avec des paramètres de requête différents (ou sans aucun paramètre)
Ignorer le sitemap du site lors du crawl
Expressions régulières (regex) pour les chemins d’URL à inclure dans le crawl. Seuls les chemins qui correspondent aux motifs spécifiés seront inclus dans la réponse. Par exemple, si vous définissez "includePaths": ["blog/.*"] pour l’URL de base firecrawl.dev, seuls les résultats correspondant à ce motif seront inclus, comme https://www.firecrawl.dev/blog/firecrawl-launch-week-1-recap. Les motifs utilisent la syntaxe des expressions régulières Rust (de type RE2) : les assertions look-around et les références arrière ne sont pas prises en charge, et tout motif qui ne se compile pas est rejeté avec une erreur 400. Chaque champ accepte au maximum 1 000 motifs de 2 000 caractères chacun, et includePaths et excludePaths ne peuvent contenir ensemble plus de 1 000 motifs et 100 000 caractères au total. Pour le filtrage par mots-clés, envoyez un motif court par terme plutôt que de combiner les termes dans une seule longue alternance.
10002000Nombre maximal de pages à explorer. La limite par défaut est de 10 000.
Nombre maximal d’opérations de scraping simultanées. Ce paramètre vous permet de définir une limite de parallélisme pour ce crawl. S’il n’est pas spécifié, le crawl respecte la limite de parallélisme de votre équipe.
Profondeur absolue maximale à explorer à partir de la base de l’URL saisie. En pratique, il s’agit du nombre maximal de barres obliques que peut contenir le chemin (pathname) d’une URL explorée.
Profondeur maximale d’exploration basée sur l’ordre de découverte. Le site racine et les pages issues du sitemap ont une profondeur de découverte de 0. Par exemple, si vous la définissez à 1 et que vous activez ignoreSitemap, seules l’URL saisie et toutes les URL liées depuis cette page seront explorées.
Lorsque cette option est définie sur true, les expressions régulières includePaths et excludePaths sont évaluées par rapport à l’URL complète (y compris les paramètres de requête), et non uniquement au chemin de l’URL. Pratique lorsque vous devez filtrer des URL en fonction des chaînes de requête.
Objet de spécification de webhook.
Si cette valeur est définie sur true, aucune donnée ne sera conservée pour ce crawl. Pour activer cette fonctionnalité, veuillez contacter help@firecrawl.dev.

