抓取单个页面
Crawl API 允许你通过一次调用即可从网页中获取想要的数据。你可以抓取页面内容,并以多种格式捕获其数据。
Scrapeless 提供了用于启动抓取请求以及获取其状态和结果的端点。默认情况下,抓取以异步方式处理:先启动任务,然后持续检查其状态,直到任务完成。不过,通过我们的 SDK,我们提供了一个简单的函数来处理整个流程,并在任务完成后返回数据。
Installation
npm install @scrapeless-ai/sdk
pnpm add @scrapeless-ai/sdk
Usage
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com"
);
console.log(result);
})();
Browser Configurations
在创建新会话时,你还可以为执行抓取任务所使用的会话提供配置,例如使用代理。
Scrapeless 会自动处理常见的 CAPTCHA 类型,包括 reCAPTCHA v2、Cloudflare Turnstile/Challenge。
无需任何额外设置——Scrapeless 会在抓取过程中自动处理。👉 更多详情,请查看 验证码破解。
要查看所有可用的浏览器参数,请查看 API 参考 或 浏览器参数。
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
browserOptions: {
proxyCountry: "ANY",
sessionName: "Crawl",
sessionRecording: true,
sessionTTL: 900,
},
}
);
console.log(result);
})();
Scrape Configurations
你还可以为抓取任务指定可选参数,例如响应格式、启用仅提取主体内容、设置最大页面导航超时时间等等。
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
formats: ["markdown", "html", "links"],
onlyMainContent: false,
timeout: 15000,
}
);
console.log(result);
})();
有关抓取端点的完整参考,请查看 API 参考。