Skip to main content
Referencia de todas las opciones disponibles en los endpoints de scraping, rastreo, mapeo y agente de Firecrawl.

Scraping básico

Para extraer una sola página y obtener contenido limpio en Markdown, utiliza el endpoint /scrape.

Extracción de PDF

Firecrawl admite PDF. Usa la opción parsers (por ejemplo, parsers: ["pdf"]) cuando quieras asegurar el análisis de PDF. Puedes controlar la estrategia de análisis con la opción mode:
  • auto (predeterminado): intenta primero una extracción rápida basada en texto y luego recurre a OCR si es necesario.
  • fast: solo análisis basado en texto (texto incrustado). Es el más rápido, pero omite páginas escaneadas o con muchas imágenes.
  • ocr: fuerza el análisis mediante OCR en cada página. Úsalo para documentos escaneados o cuando auto clasifique mal una página.
{ type: "pdf" } y "pdf" usan por defecto mode: "auto".

Opciones de scraping

Al utilizar el endpoint /scrape, puedes personalizar la solicitud con las siguientes opciones.

Formatos (formats)

El array formats controla qué tipos de salida devuelve el scraper. Predeterminado: ["markdown"]. Formatos de tipo string: pasa el nombre directamente (por ejemplo, "markdown"). Formatos de objeto: pasa un objeto con type y opciones adicionales.

Scraping móvil

Configura mobile: true para emular un dispositivo móvil. Esto resulta útil cuando un sitio responsive oculta contenido en escritorio o muestra un diseño distinto en navegadores móviles. Para sitios con contenido específico por región, combínalo con location y una captura de pantalla móvil para verificar el diseño renderizado:
Si el sitio sigue mostrando un diseño de escritorio pese a mobile: true, añade un User-Agent móvil mediante headers:

Filtrado de contenido

Estos parámetros controlan qué partes de la página aparecen en la salida. Cuando onlyMainContent es true (el valor predeterminado), se elimina el contenido de plantilla (nav, footer, etc.). includeTags y excludeTags se aplican sobre el DOM original de la página, no sobre el resultado posterior al filtrado, por lo que tus selectores deben apuntar a los elementos tal como aparecen en el HTML de origen. Si configuras onlyMainContent: false, se utiliza el HTML completo de la página como punto de partida para el filtrado por etiquetas.

Temporización y caché

Análisis de PDF

Acciones

Ejecuta acciones del navegador antes del scraping. Esto resulta útil para contenido dinámico, navegación o páginas con acceso restringido para usuarios. Puedes incluir hasta 50 acciones por solicitud, y el tiempo de espera combinado de todas las acciones wait y waitFor no debe superar los 60 segundos.

Notas sobre la ejecución de acciones

  • Write requiere un click previo para poner el foco en el elemento de destino.
  • Scroll acepta un selector opcional para desplazar un elemento específico en lugar de la página completa.
  • Wait acepta milliseconds (retraso fijo) o selector (esperar hasta que sea visible).
  • Las acciones se ejecutan secuencialmente: cada paso se completa antes de que comience el siguiente.
  • Las acciones no son compatibles con PDFs. Si la URL apunta a un PDF, la solicitud fallará.

Ejemplos de acciones avanzadas

Tomar una captura de pantalla:
cURL
Clic en varios elementos:
cURL
Generación de un PDF:
cURL
Ejecutar JavaScript (p. ej., para extraer datos incrustados de la página):
cURL
El valor devuelto por cada acción executeJavascript se captura en el array actions.javascriptReturns de la respuesta.

Ejemplo de scraping completo

La siguiente solicitud combina múltiples opciones de scraping:
cURL
Esta solicitud devuelve markdown, HTML, HTML sin procesar, enlaces y una captura de pantalla de la página completa. Limita el contenido a <h1>, <p>, <a> y .main-content mientras excluye #ad y #footer, espera 1 segundo antes de realizar el scraping, establece un tiempo de espera de 15 segundos y habilita el análisis de PDF. Consulta la referencia completa de la API de Scrape para más detalles.

Extracción de JSON mediante formatos

Usa el objeto de formato JSON en formats para extraer datos estructurados en una sola pasada:

Endpoint del agente

Usa el endpoint /v2/agent para la extracción autónoma de datos en múltiples páginas. El agente se ejecuta de forma asíncrona: inicias un trabajo y luego consultas periódicamente los resultados.

Opciones del agente

Comprobar el estado del agente

Consulta periódicamente GET /v2/agent/{jobId} para verificar el progreso. El campo status de la respuesta será "processing", "completed" o "failed".
cURL
Los SDK de Python y Node también ofrecen un método de utilidad (firecrawl.agent()) que inicia la tarea y consulta automáticamente el estado hasta que finaliza.

Rastreo de varias páginas

Para rastrear varias páginas, utiliza el endpoint /v2/crawl. El rastreo se ejecuta de forma asíncrona y devuelve un ID de trabajo. Usa el parámetro limit para controlar cuántas páginas se rastrean. Si se omite, el rastreo procesará hasta 10,000 páginas.
cURL

Respuesta

Consultar el trabajo de rastreo

Utiliza el ID de trabajo para consultar el estado de un rastreo y recuperar sus resultados.
cURL
Si el contenido supera los 10 MB o el trabajo de rastreo aún está en ejecución, la respuesta puede incluir un parámetro next con la URL de la siguiente página de resultados.

Vista previa del prompt y los parámetros de rastreo

Puedes proporcionar un prompt en lenguaje natural para que Firecrawl derive la configuración de rastreo. Primero, obtén una vista previa:
cURL

Opciones del rastreador

Al usar el endpoint /v2/crawl, puedes personalizar el comportamiento del rastreo con las siguientes opciones.

Filtrado de rutas

La URL inicial también se valida contra includePaths. Si no coincide con ninguno de los patrones, el rastreo puede devolver 0 páginas.

Alcance del rastreo

Sitemap y deduplicación

Opciones de scrape para crawl

Ejemplo de rastreo

cURL
El endpoint /v2/map identifica las URL relacionadas con un sitio web dado.
cURL

Opciones de mapeo

Aquí tienes la referencia de la API: Documentación del endpoint de mapeo

Agregar Firecrawl a la lista de permitidos

Permitir que Firecrawl rastree tu sitio web

  • User Agent: Permite FirecrawlAgent en tu firewall o en tus reglas de seguridad.
  • Direcciones IP: Firecrawl no utiliza un conjunto fijo de direcciones IP salientes.

Permitir que tu aplicación llame a la API de Firecrawl

Si tu firewall bloquea las solicitudes salientes de tu aplicación hacia servicios externos, debes incluir en la lista de permitidos la dirección IP del servidor de la API de Firecrawl para que tu aplicación pueda acceder a la API de Firecrawl (api.firecrawl.dev):
  • Dirección IP: 35.245.250.27
Agrega esta IP a la lista de permitidos de salida de tu firewall para que tu backend pueda enviar solicitudes de scraping, crawling, mapping y de agentes a Firecrawl.