Skip to main content
La Protección contra amenazas permite a tu organización impedir que Firecrawl acceda a URL riesgosas. Cuando está habilitada, cada URL que una solicitud intentaría obtener a través de la API —un objetivo de scraping, un resultado de búsqueda, un enlace descubierto durante un rastreo o la URL inicial de un agente— se comprueba con la política de tu organización, y las URL que no cumplan la política se bloquean. Las comprobaciones se realizan a nivel de URL: se puede bloquear una sola página maliciosa mientras el resto de su sitio sigue siendo accesible, y un sitio marcado se bloquea en todas sus páginas. La política se define una sola vez a nivel de la organización y se aplica automáticamente a todos los endpoints. También puedes permitir ajustes por solicitud o bloquear la política para que ninguna solicitud pueda debilitarla.
La Protección contra amenazas es una función empresarial y se habilita por organización. Ponte en contacto con el equipo de cuenta de Firecrawl para activarla en tu cuenta.

Modos

Threat Protection tiene dos modos, configurados a nivel de la organización:
  • Desactivado (predeterminado) — no se realizan verificaciones.
  • Normal — las URL se verifican con Google Web Risk, que marca páginas y sitios asociados con malware, ingeniería social (phishing) y software no deseado. +2 créditos por URL analizada.
Las verificaciones están diseñadas para proteger tus datos: en la inmensa mayoría de las solicitudes, la verificación se resuelve localmente con una lista de amenazas sincronizada periódicamente, por lo que las URL que extraes nunca se envían al clasificador y Firecrawl nunca almacena ningún veredicto sobre tu tráfico.

Controles de la política

Además del clasificador, una política puede incluir:
  • Lista negra personalizada — dominios exactos o patrones globales (p. ej., *.example.com) que siempre se bloquean, sin llamar al clasificador.
  • Lista blanca personalizada — dominios exactos o patrones globales que siempre se permiten. La lista blanca prevalece sobre cualquier otra regla, por lo que un dominio de confianza nunca se bloquea.
  • TLD bloqueados — dominios de nivel superior que se bloquean directamente (p. ej., zip), con coincidencia en los límites de las etiquetas.
  • Umbral de puntuación de riesgo — la puntuación normalizada (0–100) a partir de la cual un veredicto del clasificador se considera un bloqueo. Cuanto más bajo, más estricto. El valor predeterminado es 75.
  • Política ante fallos — qué hacer cuando no se puede acceder al clasificador: bloquear (closed, la opción predeterminada y recomendada para un control de seguridad) o permitir (open).
Las reglas personalizadas de lista negra, lista blanca y TLD bloqueados son a nivel de dominio: coinciden con el host de la URL que se está comprobando; solo el clasificador opera sobre URL completas. Los dominios personalizados que incluyas en la lista negra o blanca se comparan usando la misma canonicalización de host que el clasificador, de modo que no se puedan usar codificaciones alternativas de una dirección (por ejemplo, una IP en formato entero) para eludir una entrada de la lista.

Configuración de la política

Los administradores del equipo configuran la Protección contra amenazas desde Controles empresariales → Protección contra amenazas en el panel:
  1. Abre Controles empresariales → Protección contra amenazas.
  2. Selecciona un modo, define el umbral de puntuación de riesgo y añade cualquier entrada a la lista negra, lista blanca o TLD bloqueados.
  3. Selecciona si se permiten anulaciones por solicitud y define la política ante fallos.
  4. Guarda. Los cambios se aplican de inmediato: la siguiente solicitud se evalúa según la nueva política.
Solo los administradores del equipo pueden ver o cambiar la política. El resto solo puede verla en modo de solo lectura.

Anulaciones por solicitud

Cada endpoint que acepta URL también acepta un objeto threatProtection opcional, de modo que una solicitud concreta puede reforzar (o, si su organización lo permite, ajustar) la política para esa llamada:
Las anulaciones se aplican a la política de la organización campo por campo. Si su organización ha deshabilitado las anulaciones de solicitud, cualquier solicitud que incluya un objeto threatProtection se rechaza con un 403; esto permite a un administrador garantizar que la política de la organización sea el nivel mínimo para cada solicitud. Si la Protección contra amenazas se aplica a su equipo, una anulación aún puede reforzar la política, pero no puede incluir "mode": "off"; una solicitud que lo intente se rechaza con un 403.

Cuando una URL está bloqueada

Una solicitud bloqueada devuelve un 403 y un código de error estable:
El comportamiento varía ligeramente según el endpoint, en función de lo que sea más útil:
  • Scrape, extracción por lotes, extract, agent — un objetivo bloqueado devuelve el error unsafe_domain_blocked para esa URL.
  • Crawl — una URL semilla bloqueada hace que falle la solicitud; los enlaces bloqueados que se descubren durante el rastreo se omiten y el rastreo continúa.
  • Search, map — las URL bloqueadas se eliminan de los resultados devueltos en lugar de mostrarse y ser rechazadas.
Si una solicitud se redirige a una URL distinta — incluida una redirección dentro del mismo sitio hacia otra página — el destino se vuelve a comprobar, y nunca se devuelve contenido de un destino bloqueado. Para agent, la política cubre las URL iniciales y todo lo que el agent obtiene mediante la API de Firecrawl; las navegaciones que el browser remoto realiza dentro de una página no se interceptan.

Facturación

Un escaneo cuesta +2 créditos por URL analizada en modo Normal, además del costo base de la solicitud. Algunos detalles:
  • Las decisiones tomadas exclusivamente según tu propia política (coincidencias con listas negras, listas blancas o TLD bloqueados) no pasan por el clasificador y no generan ningún cargo por escaneo.
  • Una solicitud bloqueada igualmente genera el cargo por el escaneo que produjo el veredicto.
  • Los escaneos se deduplican dentro de un solo scrape: una nueva comprobación de una redirección que se resuelve en la misma URL comparte el escaneo original, mientras que una redirección que llega a una URL diferente cuenta como un segundo escaneo.
  • Los rastreos y las extracciones por lotes verifican cada página de forma independiente. Los veredictos nunca se reutilizan entre páginas — no se almacena nada sobre tu tráfico (consulta arriba) — así que, en modo Normal, debes prever +2 créditos por página extraída. Un enlace que se descubre durante el rastreo y se bloquea factura su escaneo una vez por rastreo, sin importar cuántas páginas enlacen a él.
  • Las búsquedas y los mapeos escanean cada URL única del conjunto de resultados una vez por solicitud, por lo que sus cargos por escaneo aumentan en función de la cantidad de resultados escaneados, que puede superar ligeramente la cantidad devuelta cuando los resultados se recortan a tu limit.

Referencia de errores

Notas

  • La política abarca toda la organización: se aplica automáticamente a cada API key y a cada endpoint.
  • La lista blanca siempre prevalece, por lo que una URL en un dominio marcado explícitamente como de confianza nunca es bloqueada por el clasificador ni por una regla de TLD.
  • El código de error unsafe_domain_blocked se mantiene estable por compatibilidad, aunque las comprobaciones se realizan a nivel de URL.
  • Con la política de fallos establecida en closed (la predeterminada), una interrupción del clasificador hace que las solicitudes afectadas se bloqueen en lugar de permitirse silenciosamente.