Extraer una página única
La API Crawl le permite obtener los datos que desea de páginas web con una sola llamada. Puede extraer el contenido de una página y capturar sus datos en varios formatos.
Scrapeless expone endpoints para iniciar una solicitud de extracción y para obtener su estado y resultados. Por defecto, la extracción se maneja de forma asincrónica: primero se inicia el trabajo y luego se verifica su estado hasta que se completa. Sin embargo, con nuestros SDK, proporcionamos una función sencilla que maneja todo el flujo y devuelve los datos una vez finalizado el trabajo.
Instalación
npm install @scrapeless-ai/sdk
pnpm add @scrapeless-ai/sdk
Uso
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com"
);
console.log(result);
})();
Configuraciones del navegador
También puede proporcionar configuraciones para la sesión utilizada para ejecutar el trabajo de extracción al crear una sesión nueva; estas podrían incluir el uso de un proxy.
Scrapeless maneja automáticamente los tipos comunes de CAPTCHA, incluyendo reCAPTCHA v2 y Cloudflare Turnstile/Challenge.
No se requiere configuración adicional: Scrapeless se encarga durante el proceso de extracción. 👉 Para más detalles, consulte la sección de Resolución de CAPTCHA.
Para ver todos los parámetros del navegador disponibles, consulte la Referencia de la API o los Parámetros del navegador.
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
browserOptions: {
proxyCountry: "ANY",
sessionName: "Crawl",
sessionRecording: true,
sessionTTL: 900,
},
}
);
console.log(result);
})();
Configuraciones de extracción
Usted también puede especificar parámetros opcionales para el trabajo de extracción, como formatos de respuesta, habilitar la extracción solo del contenido principal, establecer un tiempo máximo de espera para la navegación de páginas, y más.
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
formats: ["markdown", "html", "links"],
onlyMainContent: false,
timeout: 15000,
}
);
console.log(result);
})();
Para una referencia completa sobre el endpoint de extracción, consulte la Referencia de API.