Instalação
pip install firecrawl-py llama-index llama-index-readers-web
Uso
FireCrawlWebReader oferece suporte a três modos: scrape para uma página única, crawl para um site e extract para dados estruturados.
Usando o Firecrawl para coletar um site inteiro
from llama_index.readers.web import FireCrawlWebReader
from llama_index.core import SummaryIndex
import os
# Inicialize o FireCrawlWebReader para rastrear um site
firecrawl_reader = FireCrawlWebReader(
api_key="<your_api_key>", # Substitua pela sua chave de API em https://www.firecrawl.dev/
mode="crawl", # "scrape", "crawl" ou "extract"
params={"additional": "parameters"} # Parâmetros adicionais opcionais
)
# Defina a variável de ambiente para a chave da API
os.environ["OPENAI_API_KEY"] = "<OPENAI_API_KEY>"
# Carregue documentos de uma única URL
documents = firecrawl_reader.load_data(url="http://paulgraham.com/")
index = SummaryIndex.from_documents(documents)
# Ajuste o nível de log para DEBUG para obter saídas mais detalhadas
query_engine = index.as_query_engine()
response = query_engine.query("What did the author do growing up?")
display(Markdown(f"<b>{response}</b>"))
Usando o Firecrawl para coletar uma única página
from llama_index.readers.web import FireCrawlWebReader
# Inicialize o FireCrawlWebReader com sua chave de API e o modo desejado
firecrawl_reader = FireCrawlWebReader(
api_key="<your_api_key>", # Substitua pela sua chave de API em https://www.firecrawl.dev/
mode="scrape", # "scrape", "crawl" ou "extract"
params={"additional": "parameters"} # Parâmetros adicionais opcionais
)
# Carregue documentos de uma URL específica
documents = firecrawl_reader.load_data(url="http://paulgraham.com/worked.html")
index = SummaryIndex.from_documents(documents)
# Defina o nível de log como DEBUG para obter saídas mais detalhadas
query_engine = index.as_query_engine()
response = query_engine.query("What did the author do growing up?")
display(Markdown(f"<b>{response}</b>"))

