単一ページのスクレイピング
Crawl APIを使えば、単一の呼び出しでウェブページから必要なデータを取得できます。ページのコンテンツをスクレイピングし、さまざまな形式でデータを取得することが可能です。
Scrapeless は、スクレイピングリクエストの開始と、そのステータスおよび結果の取得を行うエンドポイントを提供しています。デフォルトでは、まずジョブを開始し、完了するまでそのステータスを確認する非同期的な方法でスクレイピングが処理されます。ただし、SDKを使用すれば、この一連の処理を自動で処理し、ジョブの完了後にデータを返すシンプルな関数を提供しています。
インストール
npm install @scrapeless-ai/sdk
pnpm add @scrapeless-ai/sdk
使用方法
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com"
);
console.log(result);
})();
ブラウザ設定
スクレイピングジョブを実行するために使用されるセッションの設定を、新しいセッションの作成時に指定することもできます。これには、プロキシの使用などが含まれます。
Scrapeless は、reCAPTCHA v2 や Cloudflare Turnstile/Challenge などの一般的な CAPTCHA タイプを自動的に処理します。
追加の設定は不要です— スクレイピング中にScrapelessが自動的に処理します。👉 詳細は CAPTCHAの解決 をご確認ください。
利用可能なすべてのブラウザパラメータを確認するには、 APIReference または ブラウザのパラメータを参照してください。
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
browserOptions: {
proxyCountry: "ANY",
sessionName: "Crawl",
sessionRecording: true,
sessionTTL: 900,
},
}
);
console.log(result);
})();
スクレイプ設定
レスポンス形式の指定、メインコンテンツのみの抽出の有効化、ページナビゲーションの最大タイムアウトの設定など、スクレイプジョブのためのオプションパラメータを指定することもできます。
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
formats: ["markdown", "html", "links"],
onlyMainContent: false,
timeout: 15000,
}
);
console.log(result);
})();
スクレイプエンドポイントの詳細なリファレンスについては、 APIReferenceを確認してください。