Scraping básico
/scrape.
Extracción de PDF
parsers (por ejemplo, parsers: ["pdf"]) cuando quieras asegurar el análisis de PDF. Puedes controlar la estrategia de análisis con la opción mode:
auto(predeterminado): intenta primero una extracción rápida basada en texto y luego recurre a OCR si es necesario.fast: solo análisis basado en texto (texto incrustado). Es el más rápido, pero omite páginas escaneadas o con muchas imágenes.ocr: fuerza el análisis mediante OCR en cada página. Úsalo para documentos escaneados o cuandoautoclasifique mal una página.
{ type: "pdf" } y "pdf" usan por defecto mode: "auto".
Opciones de scraping
/scrape, puedes personalizar la solicitud con las siguientes opciones.
Formatos (formats)
formats controla qué tipos de salida devuelve el scraper. Predeterminado: ["markdown"].
Formatos de tipo string: pasa el nombre directamente (por ejemplo, "markdown").
Formatos de objeto: pasa un objeto con
type y opciones adicionales.
Scraping móvil
mobile: true para emular un dispositivo móvil. Esto resulta útil cuando un sitio responsive oculta contenido en escritorio o muestra un diseño distinto en navegadores móviles.
Para sitios con contenido específico por región, combínalo con location y una captura de pantalla móvil para verificar el diseño renderizado:
mobile: true, añade un User-Agent móvil mediante headers:
Filtrado de contenido
onlyMainContent es true (el valor predeterminado), se elimina el contenido de plantilla (nav, footer, etc.). includeTags y excludeTags se aplican sobre el DOM original de la página, no sobre el resultado posterior al filtrado, por lo que tus selectores deben apuntar a los elementos tal como aparecen en el HTML de origen. Si configuras onlyMainContent: false, se utiliza el HTML completo de la página como punto de partida para el filtrado por etiquetas.
Temporización y caché
Análisis de PDF
Acciones
wait y waitFor no debe superar los 60 segundos.
Notas sobre la ejecución de acciones
- Write requiere un
clickprevio para poner el foco en el elemento de destino. - Scroll acepta un
selectoropcional para desplazar un elemento específico en lugar de la página completa. - Wait acepta
milliseconds(retraso fijo) oselector(esperar hasta que sea visible). - Las acciones se ejecutan secuencialmente: cada paso se completa antes de que comience el siguiente.
- Las acciones no son compatibles con PDFs. Si la URL apunta a un PDF, la solicitud fallará.
Ejemplos de acciones avanzadas
cURL
cURL
cURL
cURL
executeJavascript se captura en el array actions.javascriptReturns de la respuesta.
Ejemplo de scraping completo
cURL
<h1>, <p>, <a> y .main-content mientras excluye #ad y #footer, espera 1 segundo antes de realizar el scraping, establece un tiempo de espera de 15 segundos y habilita el análisis de PDF.
Consulta la referencia completa de la API de Scrape para más detalles.
Extracción de JSON mediante formatos
formats para extraer datos estructurados en una sola pasada:
Endpoint del agente
/v2/agent para la extracción autónoma de datos en múltiples páginas. El agente se ejecuta de forma asíncrona: inicias un trabajo y luego consultas periódicamente los resultados.
Opciones del agente
Comprobar el estado del agente
GET /v2/agent/{jobId} para verificar el progreso. El campo status de la respuesta será "processing", "completed" o "failed".
cURL
firecrawl.agent()) que inicia la tarea y consulta automáticamente el estado hasta que finaliza.
Rastreo de varias páginas
/v2/crawl. El rastreo se ejecuta de forma asíncrona y devuelve un ID de trabajo. Usa el parámetro limit para controlar cuántas páginas se rastrean. Si se omite, el rastreo procesará hasta 10,000 páginas.
cURL
Respuesta
Consultar el trabajo de rastreo
cURL
next con la URL de la siguiente página de resultados.
Vista previa del prompt y los parámetros de rastreo
prompt en lenguaje natural para que Firecrawl derive la configuración de rastreo. Primero, obtén una vista previa:
cURL
Opciones del rastreador
/v2/crawl, puedes personalizar el comportamiento del rastreo con las siguientes opciones.
Filtrado de rutas
Alcance del rastreo
Sitemap y deduplicación
Opciones de scrape para crawl
Ejemplo de rastreo
cURL
Mapeo de enlaces de un sitio web
/v2/map identifica las URL relacionadas con un sitio web dado.
cURL
Opciones de mapeo
Aquí tienes la referencia de la API: Documentación del endpoint de mapeo
Agregar Firecrawl a la lista de permitidos
Permitir que Firecrawl rastree tu sitio web
- User Agent: Permite
FirecrawlAgenten tu firewall o en tus reglas de seguridad. - Direcciones IP: Firecrawl no utiliza un conjunto fijo de direcciones IP salientes.
Permitir que tu aplicación llame a la API de Firecrawl
api.firecrawl.dev):
- Dirección IP:
35.245.250.27

