Thu thập dữ liệu một Website
Thu thập dữ liệu một website và các trang được liên kết với nó để trích xuất dữ liệu toàn diện. Để biết cách sử dụng chi tiết, hãy xem Crawl API Reference
Theo mặc định, quá trình thu thập sẽ bỏ qua các liên kết con không thuộc phân cấp URL mà bạn chỉ định. Ví dụ, việc thu thập https://example.com/products/ sẽ không nắm bắt các trang nằm dưới https://example.com/promotions/deal-567. Để bao gồm những liên kết như vậy, hãy bật tham số allowBackwardLinks.
Scrapeless cung cấp các endpoint để bắt đầu một yêu cầu thu thập dữ liệu cũng như lấy trạng thái và kết quả của nó. Theo mặc định, việc thu thập dữ liệu được xử lý bất đồng bộ: bắt đầu công việc trước, sau đó kiểm tra trạng thái của nó cho đến khi hoàn thành. Tuy nhiên, với các SDK của chúng tôi, chúng tôi cung cấp một hàm đơn giản xử lý toàn bộ luồng và trả về dữ liệu ngay khi công việc kết thúc.
Cài đặt
npm install @scrapeless-ai/sdk
pnpm add @scrapeless-ai/sdk
Cách sử dụng
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.crawlUrl(
"https://example.com",
{
limit: 2,
scrapeOptions: {
formats: ["markdown", "html", "links"],
onlyMainContent: false,
timeout: 15000,
},
browserOptions: {
proxyCountry: "ANY",
sessionName: "Crawl",
sessionRecording: true,
sessionTTL: 900,
},
}
);
console.log(result);
})();
Phản hồi
{
"success": true,
"status": "completed",
"completed": 2,
"total": 2,
"data": [
{
"url": "https://example.com",
"metadata": {
"title": "Example Page",
"description": "A sample webpage"
},
"markdown": "# Example Page\nThis is content...",
...
},
...
]
}
Mỗi trang được thu thập có trạng thái riêng là completed hoặc failed và có thể có trường lỗi riêng, vì vậy hãy lưu ý điều đó.
Để xem schema đầy đủ, hãy xem API Reference.
Cấu hình Browser
Bạn cũng có thể cung cấp cấu hình cho phiên được sử dụng để thực thi công việc thu thập khi tạo một phiên mới; những cấu hình này có thể bao gồm việc sử dụng proxy.
Để xem danh sách đầy đủ các tham số khả dụng, hãy tham khảo API Reference hoặc Browser Parameters.
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.crawlUrl(
"https://example.com",
{
limit: 2,
browserOptions: {
proxyCountry: "ANY",
sessionName: "Crawl",
sessionRecording: true,
sessionTTL: 900,
},
}
);
console.log(result);
})();
Cấu hình Scrape
Bạn cũng có thể chỉ định các tham số tùy chọn cho công việc scrape, chẳng hạn như định dạng phản hồi, bật trích xuất chỉ nội dung chính, đặt thời gian chờ điều hướng trang tối đa, và nhiều hơn nữa.
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.crawlUrl(
"https://example.com",
{
limit: 2,
scrapeOptions: {
formats: ["markdown", "html", "links"],
onlyMainContent: false,
timeout: 15000,
}
}
);
console.log(result);
})();
Để xem tài liệu tham khảo đầy đủ về endpoint crawl, hãy xem API Reference.