Scrape một Trang đơn
Crawl API cho phép bạn lấy dữ liệu mong muốn từ các trang web chỉ với một lệnh gọi duy nhất. Bạn có thể scrape nội dung trang và thu thập dữ liệu của nó ở nhiều định dạng khác nhau.
Scrapeless cung cấp các endpoint để bắt đầu một yêu cầu scrape cũng như để lấy trạng thái và kết quả của nó. Theo mặc định, việc scrape được xử lý theo cách bất đồng bộ bằng cách trước tiên bắt đầu tác vụ rồi kiểm tra trạng thái của nó cho đến khi hoàn tất. Tuy nhiên, với các SDK của chúng tôi, chúng tôi cung cấp một hàm đơn giản xử lý toàn bộ luồng và trả về dữ liệu ngay khi tác vụ hoàn tất.
Cài đặt
npm install @scrapeless-ai/sdk
pnpm add @scrapeless-ai/sdk
Cách sử dụng
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com"
);
console.log(result);
})();
Cấu hình Browser
Bạn cũng có thể cung cấp các cấu hình cho session dùng để thực thi tác vụ scrape khi tạo một session mới; các cấu hình này có thể bao gồm việc sử dụng proxy.
Scrapeless tự động xử lý các loại CAPTCHA phổ biến, bao gồm reCAPTCHA v2, Cloudflare Turnstile/Challenge.
Không cần thiết lập thêm—Scrapeless sẽ lo phần này trong quá trình scrape. 👉 Để biết thêm chi tiết, hãy xem Captcha Solving.
Để xem tất cả các tham số browser khác nhau có sẵn, hãy xem API Reference hoặc Browser Parameters.
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
browserOptions: {
proxyCountry: "ANY",
sessionName: "Crawl",
sessionRecording: true,
sessionTTL: 900,
},
}
);
console.log(result);
})();
Cấu hình Scrape
Bạn cũng có thể chỉ định các tham số tùy chọn cho tác vụ scrape, chẳng hạn như định dạng phản hồi, bật trích xuất chỉ nội dung chính, đặt thời gian chờ điều hướng trang tối đa, và nhiều hơn nữa.
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
formats: ["markdown", "html", "links"],
onlyMainContent: false,
timeout: 15000,
}
);
console.log(result);
})();
Để tham khảo đầy đủ về endpoint scrape, hãy xem API Reference.