Skip to main content
Un scrape réussi vous indique ce que la page a renvoyé. Il ne prouve pas que l’état représenté par la page est à jour. Ce sont deux questions distinctes.
  • Fraîcheur → Ce contenu est-il récent ou s’agit-il d’une copie réutilisée à partir du cache de Firecrawl ? Contrôlée par maxAge.
  • Activité → L’élément sous-jacent existe-t-il toujours et est-il encore actif ? Votre application le détermine à partir des éléments disponibles.
Ce guide explique la différence, présente le compromis lié à maxAge et fournit une liste de contrôle ainsi qu’un exemple détaillé pour les actions sensibles à la fraîcheur.

Comparaison rapide


Le compromis fraîcheur/latence (maxAge)

Firecrawl met en cache les pages déjà scrapées et renvoie une copie récente lorsqu’elle est disponible, ce qui réduit la latence. maxAge correspond à l’âge maximal, en millisecondes, d’une copie en cache que Firecrawl peut renvoyer au lieu de récupérer à nouveau la page.
  • Omettre maxAge : Firecrawl peut renvoyer du contenu récemment mis en cache. La durée par défaut est de 2 jours ; Firecrawl peut utiliser une durée différente pour certains sites.
  • Définir maxAge: 0 : Firecrawl ignore le cache pour cette requête et récupère la page. Vous échangez ainsi latence et fiabilité contre des données plus fraîches.
Laissez la mise en cache activée par défaut. N’acceptez le surcoût de latence de maxAge: 0 que pour les lectures où des données obsolètes entraîneraient une décision erronée ou coûteuse — cela ne change pas le coût de la page en crédits. metadata.cacheState est renvoyé lorsque Firecrawl a pris en compte son cache pour la requête ; c’est donc un indicateur utile lors du réglage de maxAge. Il ne fait pas partie d’une réponse avec maxAge: 0, car cette requête ignore entièrement le cache. Pour en savoir plus sur le fonctionnement du cache, les valeurs courantes de maxAge, les règles de correspondance des accès au cache et les options de requête qui contournent automatiquement le cache, consultez Scraping plus rapide.

Cas d’application de maxAge

Pour récupérer une version à jour d’une page trouvée via /search, scrapez de nouveau cette URL avec /scrape et maxAge: 0.

La fraîcheur ne garantit pas l’activité

Même avec maxAge: 0, le résultat indique uniquement ce que la page a renvoyé lors de cette récupération. Une page peut renvoyer un code HTTP 200 avec du contenu tout en reflétant un état obsolète, indisponible ou modifié d’une autre manière. Ainsi, ni le code d’état ni la présence de contenu ne permettent d’établir l’activité. L’activité est une conclusion que votre application tire d’éléments propres à chaque source.

Liste de contrôle pour les actions sensibles à la fraîcheur des données

Avant toute action dépendant de l’état actuel, considérez le résultat du scraping comme un indice, et non une preuve :
  1. Utilisez maxAge: 0 pour la récupération finale afin que la réponse ne soit pas servie depuis le cache.
  2. Ne considérez pas un code HTTP 200 ou un contenu non vide comme la preuve d’activité.
  3. Examinez le contenu rendu et les indices de redirection. metadata.sourceURL est l’URL demandée ; metadata.url est l’URL que le moteur indique pour la réponse. Lorsque les deux diffèrent, cela peut indiquer une redirection vers une autre ressource. Des valeurs identiques ne prouvent pas qu’aucune redirection n’a eu lieu.
  4. Privilégiez les API ou les identifiants propres à la source lorsqu’ils sont disponibles : ils exposent souvent un état explicite qu’une page rendue masque.
  5. Considérez les indices non concluants comme unknown et arrêtez-vous avant l’étape coûteuse ou irréversible, plutôt que de supposer que la ressource est active.

Exemple détaillé : collecter les éléments de preuve de la page actuelle

Ignorez le cache, puis récupérez le contenu rendu et les métadonnées de réponse pour appliquer les règles de validation de votre application. Le scraping fournit des éléments de preuve ; il ne détermine pas l’état propre au domaine.
La distinction importante intervient après la collecte : Firecrawl fournit des éléments de preuve sur la page ; votre application les interprète à l’aide de règles propres à la source. Si ces règles ne sont pas concluantes, conservez l’état unknown.

Recommandations par scénario


Points clés

  1. La fraîcheur et l’activité répondent à deux questions distinctes. maxAge contrôle la fraîcheur ; l’activité est une décision que vous prenez sur la base d’éléments probants.
  2. Un code HTTP 200 assorti de contenu ne prouve pas que l’état représenté est à jour.
  3. Pour les actions sensibles à la fraîcheur, utilisez maxAge: 0 et suivez la liste de vérification. Inspectez le contenu rendu, comparez metadata.url à metadata.sourceURL afin de repérer d’éventuelles redirections, et privilégiez les API propres à la source.
  4. Traitez les éléments non concluants comme unknown. Un scrape seul ne doit jamais faire passer un objet à l’état active ; arrêtez-vous avant d’engager des étapes coûteuses ou irréversibles.
  5. Firecrawl ne dispose pas de champ d’activité. Votre application effectue cette détermination selon ses propres critères métier.

Pour aller plus loin