抓取单个页面

Crawl API 允许你通过一次调用即可从网页中获取想要的数据。你可以抓取页面内容,并以多种格式捕获其数据。

Scrapeless 提供了用于启动抓取请求以及获取其状态和结果的端点。默认情况下,抓取以异步方式处理:先启动任务,然后持续检查其状态,直到任务完成。不过,通过我们的 SDK,我们提供了一个简单的函数来处理整个流程,并在任务完成后返回数据。

Installation

npm install @scrapeless-ai/sdk
 
pnpm add @scrapeless-ai/sdk
 

Usage

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com"
  );
 
  console.log(result);
})();
 

Browser Configurations

在创建新会话时,你还可以为执行抓取任务所使用的会话提供配置,例如使用代理。

Scrapeless 会自动处理常见的 CAPTCHA 类型,包括 reCAPTCHA v2、Cloudflare Turnstile/Challenge。

无需任何额外设置——Scrapeless 会在抓取过程中自动处理。👉 更多详情,请查看 验证码破解。

要查看所有可用的浏览器参数,请查看 API 参考 或 浏览器参数。

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com",
    {
      browserOptions: {
        proxyCountry: "ANY",
        sessionName: "Crawl",
        sessionRecording: true,
        sessionTTL: 900,
      },
    }
  );
 
  console.log(result);
})();
 

Scrape Configurations

你还可以为抓取任务指定可选参数,例如响应格式、启用仅提取主体内容、设置最大页面导航超时时间等等。

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com",
    {
      formats: ["markdown", "html", "links"],
      onlyMainContent: false,
      timeout: 15000,
    }
  );
 
  console.log(result);
})();
 

有关抓取端点的完整参考,请查看 API 参考。