Skip to main content
Aprende a usar las funciones principales de Firecrawl para hacer scraping de repositorios, issues y documentación de GitHub.
Hay dos formas de obtener datos de GitHub con Firecrawl. Puedes hacer scraping, mapeo o crawling de una URL específica de github.com (que es lo que se explica en el resto de esta página), o usar la búsqueda de GitHub de Research Index para descubrir de forma semántica issues, pull requests, discusiones y README relevantes en todo GitHub sin conocer la URL exacta.

Configuración

Scrape con modo JSON

Extrae datos estructurados de repositorios mediante esquemas de Zod.
Busca repositorios, issues o documentación en GitHub.

Busca en GitHub con Research Index

El Research Index de Firecrawl incluye un índice de GitHub que permite buscar semánticamente issues, pull requests, discusiones y archivos README indexados de repositorios públicos de GitHub. Resulta útil para encontrar detalles de implementación y soluciones de ingeniería previas cuando no conoces el repositorio ni la URL exactos.
También puedes acceder al mismo índice de GitHub a través del endpoint general /search usando la categoría github.
Consulta la guía de Research Index para ver cómo usarlo con Python, cURL, CLI y MCP.

Scrape

Extrae una sola página de GitHub: un repositorio, un issue o un archivo.

Map

Descubre todas las URL disponibles en un repositorio o sitio de documentación. Nota: Map devuelve únicamente las URL, sin contenido.

Crawl

Rastrea varias páginas de un repositorio o de la documentación.

extracción por lotes

Extrae varias URL de GitHub simultáneamente.

extracción por lotes con modo JSON

Extrae datos estructurados de múltiples repositorios a la vez.