Tài liệuTrình duyệt và CrawlCrawlThu thập dữ liệu từ một trang

Scrape một Trang đơn

Crawl API cho phép bạn lấy dữ liệu mong muốn từ các trang web chỉ với một lệnh gọi duy nhất. Bạn có thể scrape nội dung trang và thu thập dữ liệu của nó ở nhiều định dạng khác nhau.

Scrapeless cung cấp các endpoint để bắt đầu một yêu cầu scrape cũng như để lấy trạng thái và kết quả của nó. Theo mặc định, việc scrape được xử lý theo cách bất đồng bộ bằng cách trước tiên bắt đầu tác vụ rồi kiểm tra trạng thái của nó cho đến khi hoàn tất. Tuy nhiên, với các SDK của chúng tôi, chúng tôi cung cấp một hàm đơn giản xử lý toàn bộ luồng và trả về dữ liệu ngay khi tác vụ hoàn tất.

Cài đặt

npm install @scrapeless-ai/sdk
 
pnpm add @scrapeless-ai/sdk
 

Cách sử dụng

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com"
  );
 
  console.log(result);
})();
 

Cấu hình Browser

Bạn cũng có thể cung cấp các cấu hình cho session dùng để thực thi tác vụ scrape khi tạo một session mới; các cấu hình này có thể bao gồm việc sử dụng proxy.

Scrapeless tự động xử lý các loại CAPTCHA phổ biến, bao gồm reCAPTCHA v2, Cloudflare Turnstile/Challenge.

Không cần thiết lập thêm—Scrapeless sẽ lo phần này trong quá trình scrape. 👉 Để biết thêm chi tiết, hãy xem Captcha Solving.

Để xem tất cả các tham số browser khác nhau có sẵn, hãy xem API Reference hoặc Browser Parameters.

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com",
    {
      browserOptions: {
        proxyCountry: "ANY",
        sessionName: "Crawl",
        sessionRecording: true,
        sessionTTL: 900,
      },
    }
  );
 
  console.log(result);
})();
 

Cấu hình Scrape

Bạn cũng có thể chỉ định các tham số tùy chọn cho tác vụ scrape, chẳng hạn như định dạng phản hồi, bật trích xuất chỉ nội dung chính, đặt thời gian chờ điều hướng trang tối đa, và nhiều hơn nữa.

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.scrapeUrl(
    "https://example.com",
    {
      formats: ["markdown", "html", "links"],
      onlyMainContent: false,
      timeout: 15000,
    }
  );
 
  console.log(result);
})();
 

Để tham khảo đầy đủ về endpoint scrape, hãy xem API Reference.