Bearer authentication header of the form Bearer <token>, where <token> is your auth token.
スクレイプ対象のURL
Webhook の仕様を表すオブジェクト。
同時に実行されるスクレイプの最大数。このパラメータで、このバッチスクレイプに対する同時実行数の上限を設定できます。指定しない場合、このバッチスクレイプはチームで設定された同時実行数の上限に従います。
urls 配列に無効な URL が含まれている場合、それらは無視されます。無効な URL が原因でリクエスト全体が失敗するのではなく、残りの有効な URL を使ってバッチスクレイプが作成され、無効な URL はレスポンスの invalidURLs フィールドで返されます。
レスポンスに含める出力フォーマットを指定します。1つ以上のフォーマットを、文字列(例: 'markdown')または追加オプションを含むオブジェクト(例: { type: 'json', schema: {...} })として指定できます。一部のフォーマットでは、特定のオプションの設定が必須です。例: ['markdown', { type: 'json', schema: {...} }]。
ヘッダーやナビゲーション、フッターなどを除外し、ページのメインコンテンツのみを返します。
出力に含めるタグ。
出力結果から除外するタグ。
ページのキャッシュが、この値(ミリ秒)で指定した有効期間より新しい場合は、そのキャッシュ版を返します。キャッシュがこの値より古い場合は、新たにページのスクレイピングを行います。極めて最新のデータが不要であれば、これを有効にすることでスクレイピングを最大500%高速化できます。デフォルトは2日です。
リクエストに含めるヘッダー。Cookie や User-Agent などを送信するために使用できます。
コンテンツを取得する前に待機する時間をミリ秒単位で指定します。ページが十分に読み込まれるまでの時間を確保するための遅延です。この待機時間は、Firecrawl のスマート待機機能に加えて発生します。
モバイル端末からのスクレイピングをエミュレートしたい場合は、true に設定します。レスポンシブページのテストやモバイル向けスクリーンショットの取得に便利です。
リクエストを送信する際に TLS 証明書の検証を行わないようにします。
リクエストのタイムアウト時間(ミリ秒)。
スクレイピング時のファイルの処理方法を制御します。"pdf" が含まれている場合(デフォルト)、PDF の内容が抽出されて markdown 形式に変換され、課金はページ数に基づきます(1ページあたり1クレジット)。空の配列を渡した場合、PDF ファイルは base64 エンコード形式で返され、PDF 全体で一律1クレジットが請求されます。
コンテンツを取得する前にページに対して実行するアクション
リクエストのロケーション設定です。指定すると、利用可能な場合は適切なプロキシが使用され、対応する言語およびタイムゾーン設定がエミュレートされます。指定されていない場合は、デフォルトで「US」が使用されます。
出力からすべての Base64 画像を削除します。これらは非常に長くなる場合があります。画像の alt テキストは出力内に残りますが、URL はプレースホルダーに置き換えられます。
広告およびCookie同意ポップアップのブロックを有効化します。
使用するプロキシの種類を指定します。
basic, stealth, auto true の場合、そのページは Firecrawl のインデックスおよびキャッシュに保存されます。スクレイピング活動でデータ保護上の懸念が生じる可能性がある場合は、これを false に設定すると有用です。機密性の高いスクレイピングに関連する一部のパラメータ(例: actions、headers)を使用すると、このパラメータは強制的に false になります。
true の場合、このバッチスクレイプではゼロデータ保持が有効になり、データは一切保持されません。この機能を有効にするには、[email protected] までご連絡ください。