DocumentaçãoNavegador e CrawlCrawlExtrair dados de uma página

Extrair uma Única Página

A Crawl API permite que você obtenha os dados desejados de páginas web com uma única chamada. Você pode extrair o conteúdo da página e capturar seus dados em vários formatos.

O Scrapeless expõe endpoints para iniciar uma requisição de extração e para obter seu status e resultados. Por padrão, a extração é tratada de maneira assíncrona, iniciando primeiro o job e depois verificando seu status até que ele seja concluído. No entanto, com nossos SDKs, fornecemos uma função simples que lida com todo o fluxo e retorna os dados assim que o job é concluído.

Instalação

npm install @scrapeless-ai/sdk
 
pnpm add @scrapeless-ai/sdk
 

Uso

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com"
  );
 
  console.log(result);
})();
 

Configurações do Navegador

Você também pode fornecer configurações para a sessão usada para executar o job de extração ao criar uma nova sessão; essas configurações podem incluir o uso de um proxy.

O Scrapeless trata automaticamente os tipos comuns de CAPTCHA, incluindo reCAPTCHA v2, Cloudflare Turnstile/Challenge.

Nenhuma configuração adicional é necessária—o Scrapeless cuida disso durante a extração. 👉 Para mais detalhes, confira a Resolução de Captcha.

Para ver todos os diferentes parâmetros de navegador disponíveis, confira a Referência da API ou Parâmetros do Navegador.

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com",
    {
      browserOptions: {
        proxyCountry: "ANY",
        sessionName: "Crawl",
        sessionRecording: true,
        sessionTTL: 900,
      },
    }
  );
 
  console.log(result);
})();
 

Configurações de Extração

Você também pode especificar parâmetros opcionais para o job de extração, como formatos de resposta, habilitar a extração apenas do conteúdo principal, definir um tempo limite máximo de navegação da página e muito mais.

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com",
    {
      formats: ["markdown", "html", "links"],
      onlyMainContent: false,
      timeout: 15000,
    }
  );
 
  console.log(result);
})();
 

Para uma referência completa sobre o endpoint de extração, confira a Referência da API.