Passer au contenu principal

Prérequis

Configuration

Recherche sur le web

Créez le fichier index.mjs avec un gestionnaire de recherche :

Scraper une page

Ajoutez une action scrape dans le même gestionnaire :

Interact avec une page

Ajoutez une action interact pour contrôler une session de navigateur en direct — pour cliquer sur des boutons, remplir des formulaires et extraire du contenu dynamique :

Déployer

Créez le package et déployez avec l’AWS CLI :
Définissez le délai d’expiration de Lambda sur au moins 30 secondes. Le scraping de pages dynamiques et les sessions Interact peuvent prendre plus de temps que le délai d’expiration par défaut de 3 secondes.

Étapes suivantes

Documentation de recherche

Effectuez une recherche sur le web et obtenez le contenu complet des pages

Documentation scraper

Toutes les options de scrape, y compris les formats, les actions et les proxys

Documentation Interact

Cliquez, remplissez des formulaires et extrayez du contenu dynamique

Référence Node SDK

Référence complète du SDK avec crawl, cartographie, extraction par lot et plus encore