インストール
pip install firecrawl-py llama-index llama-index-readers-web
使用方法
FireCrawlWebReader は、単一ページ用の scrape、サイト用の crawl、構造化データ用の extract の3つのモードをサポートしています。
Firecrawlでウェブサイト全体を収集する
from llama_index.readers.web import FireCrawlWebReader
from llama_index.core import SummaryIndex
import os
# ウェブサイトをクロールするために FireCrawlWebReader を初期化
firecrawl_reader = FireCrawlWebReader(
api_key="<your_api_key>", # https://www.firecrawl.dev/ で取得した実際の API キーに置き換えてください
mode="crawl", # "scrape"、"crawl"、または "extract"
params={"additional": "parameters"} # 追加パラメータ(任意)
)
# 環境変数に仮想キーを設定
os.environ["OPENAI_API_KEY"] = "<OPENAI_API_KEY>"
# 単一ページの URL からドキュメントを読み込む
documents = firecrawl_reader.load_data(url="http://paulgraham.com/")
index = SummaryIndex.from_documents(documents)
# 詳細な出力のためにログレベルを DEBUG に設定
query_engine = index.as_query_engine()
response = query_engine.query("What did the author do growing up?")
display(Markdown(f"<b>{response}</b>"))
Firecrawl を使って単一ページを収集する
from llama_index.readers.web import FireCrawlWebReader
# APIキーと目的のモードで FireCrawlWebReader を初期化します
firecrawl_reader = FireCrawlWebReader(
api_key="<your_api_key>", # https://www.firecrawl.dev/ で取得した実際のAPIキーに置き換えてください
mode="scrape", # "scrape"、"crawl"、または "extract"
params={"additional": "parameters"} # 任意の追加パラメータ
)
# 指定したURLからドキュメントを読み込みます
documents = firecrawl_reader.load_data(url="http://paulgraham.com/worked.html")
index = SummaryIndex.from_documents(documents)
# より詳細な出力のため、ログレベルをDEBUGに設定します
query_engine = index.as_query_engine()
response = query_engine.query("What did the author do growing up?")
display(Markdown(f"<b>{response}</b>"))

