はじめに
Scrapeless Scraping API は、ウェブサイトからのデータ抽出を容易にするために設計された革新的なソリューションです。動的コンテンツや JavaScript レンダリングを効果的に処理し、非常に複雑なウェブ環境でも確実に動作します。
単一の API 呼び出しで、すぐにきれいな構造化データにアクセスできます。プロキシ、ブラウザ、または CAPTCHA の管理を自前で実装・維持する必要はありません。
利用可能なスクレイパー
各スクレイパーは同じAPIを通じて提供され、 actor パラメータで選択します。以下のスクレイパーから始めます:
| スクレイパー | actor | 説明 |
|---|---|---|
| Google Search | scraper.google.search | 構造化された JSON としてのリアルタイムの Google Search およびGoogle画像検索結果。 |
| Amazon Scraper | scraper.amazon | Amazonからの商品詳細、キーワード検索結果、出品者データ、ショッピングAI回答のためのRufus/Alexa。 |
| TikTok Scraper | scraper.tiktok | TikTokからのユーザープロフィール、ユーザー投稿、TikTok Shopの商品詳細。 |
はじめに
単一の API 呼び出しを送信して、ターゲットサイトから構造化されたデータを抽出します。以下の例ではタスクを送信し、実行時間の長いタスクの場合、結果が準備できるまでポーリングします。
import { Scrapeless } from '@scrapeless-ai/sdk';
const client = new Scrapeless({
apiKey: 'YOUR_API_KEY',
});
async function runTask() {
const result = await client.scraping.scrape({
actor: 'scraper.shopee',
input: {
url: 'https://shopee.tw/a-i.10228173.24803858474'
}
});
return result;
}
runTask()
.then(data => {
console.log('Data:', data);
})
.catch(error => {
console.error('Error:', error);
});パラメータ
| パラメータ | 型 | 説明 |
|---|---|---|
| actor | string | スクレイピングサービス(例: scraper.shopee)。 |
| input | object | タスク固有のパラメーター(例:action、url)。 |
| proxy | object | 国コードを指定したオプションのプロキシ設定。 |
タスクのワークフロー
すべての Scraping API タスクは同じ3段階のライフサイクルに従います。短時間で完了するタスクはデータを直接返します。長時間実行されるタスクは、非同期で結果をポーリングするフローに切り替わります。
- タスクの送信 —
POSTリクエストを/api/v1/scraper/requestに送信します。 - レスポンスを処理
- HTTP200(成功):データがレスポンスボディに直接返されます。
- HTTP201(処理中):提供された
taskIdを使用して結果をポーリングします。
- 結果のポーリング — 非同期タスクでは、
/api/v1/scraper/result/{taskId}を繰り返し呼び出し、データの準備が完了するまで待機します(HTTP 200)。
ステータスコードの完全なリストとポーリングのガイダンスについては、 結果とポーリングを参照してください。ポーリングではなくコールバックで結果を受け取る場合は、 Webhooksを参照してください。
課金情報
- 課金はリクエスト単位で行われます。
- 課金されるのは成功したリクエストのみです。