DocumentaciónNavegador y CrawlCrawlExtraer datos de una página

Extraer una página única

La API Crawl le permite obtener los datos que desea de páginas web con una sola llamada. Puede extraer el contenido de una página y capturar sus datos en varios formatos.

Scrapeless expone endpoints para iniciar una solicitud de extracción y para obtener su estado y resultados. Por defecto, la extracción se maneja de forma asincrónica: primero se inicia el trabajo y luego se verifica su estado hasta que se completa. Sin embargo, con nuestros SDK, proporcionamos una función sencilla que maneja todo el flujo y devuelve los datos una vez finalizado el trabajo.

Instalación

npm install @scrapeless-ai/sdk
 
pnpm add @scrapeless-ai/sdk
 

Uso

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com"
  );
 
  console.log(result);
})();
 

Configuraciones del navegador

También puede proporcionar configuraciones para la sesión utilizada para ejecutar el trabajo de extracción al crear una sesión nueva; estas podrían incluir el uso de un proxy.

Scrapeless maneja automáticamente los tipos comunes de CAPTCHA, incluyendo reCAPTCHA v2 y Cloudflare Turnstile/Challenge.

No se requiere configuración adicional: Scrapeless se encarga durante el proceso de extracción. 👉 Para más detalles, consulte la sección de Resolución de CAPTCHA.

Para ver todos los parámetros del navegador disponibles, consulte la Referencia de la API o los Parámetros del navegador.

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com",
    {
      browserOptions: {
        proxyCountry: "ANY",
        sessionName: "Crawl",
        sessionRecording: true,
        sessionTTL: 900,
      },
    }
  );
 
  console.log(result);
})();
 

Configuraciones de extracción

Usted también puede especificar parámetros opcionales para el trabajo de extracción, como formatos de respuesta, habilitar la extracción solo del contenido principal, establecer un tiempo máximo de espera para la navegación de páginas, y más.

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com",
    {
      formats: ["markdown", "html", "links"],
      onlyMainContent: false,
      timeout: 15000,
    }
  );
 
  console.log(result);
})();
 

Para una referencia completa sobre el endpoint de extracción, consulte la Referencia de API.