Tài liệuScraping APIGiới thiệu

Giới thiệu

Scrapeless Scraping API là một giải pháp đột phá được thiết kế để đơn giản hóa việc trích xuất dữ liệu từ các trang web một cách dễ dàng. Được xây dựng để điều hướng ngay cả những môi trường web phức tạp nhất, nó xử lý hiệu quả nội dung động và kết xuất JavaScript.

Chỉ với một lệnh gọi API, bạn có quyền truy cập tức thì vào dữ liệu sạch, có cấu trúc — không cần viết hay bảo trì proxy, trình duyệt hay xử lý CAPTCHA ở phía bạn.

Các Scraper có sẵn

Mỗi scraper được cung cấp thông qua cùng một API, được chọn bằng tham số actor. Bắt đầu với một scraper bên dưới:

ScraperactorMô tả
Google Searchscraper.google.searchKết quả Google Search và Google Image theo thời gian thực dưới dạng JSON có cấu trúc.
Amazon Scraperscraper.amazonChi tiết sản phẩm, kết quả tìm kiếm theo từ khóa, dữ liệu người bán và Rufus/Alexa cho câu trả lời AI mua sắm từ Amazon.
TikTok Scraperscraper.tiktokHồ sơ người dùng, bài đăng của người dùng và chi tiết sản phẩm TikTok Shop từ TikTok.

Bắt đầu

Gửi một lệnh gọi API duy nhất để trích xuất dữ liệu có cấu trúc từ trang web mục tiêu. Ví dụ dưới đây gửi một tác vụ và, đối với các tác vụ chạy lâu hơn, sẽ thăm dò cho đến khi kết quả sẵn sàng.

import { Scrapeless } from '@scrapeless-ai/sdk';
const client = new Scrapeless({
  apiKey: 'YOUR_API_KEY',
});
 
async function runTask() {
  const result = await client.scraping.scrape({
    actor: 'scraper.shopee',
    input: {
      url: 'https://shopee.tw/a-i.10228173.24803858474'
    }
  });
 
  return result;
}
 
runTask()
  .then(data => {
    console.log('Data:', data);
  })
  .catch(error => {
    console.error('Error:', error);
  });

Tham số

Tham sốKiểuMô tả
actorstringDịch vụ scraping (ví dụ: scraper.shopee).
inputobjectCác tham số dành riêng cho tác vụ (ví dụ: action, url).
proxyobjectCấu hình proxy tùy chọn với trường country.

Quy trình tác vụ

Mọi tác vụ Scraping API đều tuân theo cùng một vòng đời ba bước. Các tác vụ nhanh trả về dữ liệu trực tiếp; các tác vụ chạy lâu hơn chuyển sang luồng bất đồng bộ, thăm dò để lấy kết quả.

  1. Gửi một tác vụ — Gửi yêu cầu POST đến /api/v1/scraper/request.
  2. Xử lý phản hồi
    1. HTTP 200 (Thành công): Dữ liệu được trả về trực tiếp trong phần thân phản hồi.
    2. HTTP 201 (Đang xử lý): Sử dụng taskId được cung cấp để thăm dò lấy kết quả.
  3. Thăm dò lấy kết quả — Đối với các tác vụ bất đồng bộ, gọi lặp lại /api/v1/scraper/result/{taskId} cho đến khi dữ liệu sẵn sàng (HTTP 200).

Để xem danh sách đầy đủ các mã trạng thái và hướng dẫn thăm dò, hãy xem Kết quả và thăm dò. Để nhận kết quả qua callback thay vì thăm dò, hãy xem Webhooks.

Thông tin thanh toán

  1. Phí được tính trên cơ sở mỗi yêu cầu.
  2. Chỉ các yêu cầu thành công mới bị tính phí.