ドキュメントScraping API紹介

はじめに

Scrapeless Scraping API は、ウェブサイトからのデータ抽出を容易にするために設計された革新的なソリューションです。動的コンテンツや JavaScript レンダリングを効果的に処理し、非常に複雑なウェブ環境でも確実に動作します。

単一の API 呼び出しで、すぐにきれいな構造化データにアクセスできます。プロキシ、ブラウザ、または CAPTCHA の管理を自前で実装・維持する必要はありません。

利用可能なスクレイパー

各スクレイパーは同じAPIを通じて提供され、 actor パラメータで選択します。以下のスクレイパーから始めます:

スクレイパーactor説明
Google Searchscraper.google.search構造化された JSON としてのリアルタイムの Google Search およびGoogle画像検索結果。
Amazon Scraperscraper.amazonAmazonからの商品詳細、キーワード検索結果、出品者データ、ショッピングAI回答のためのRufus/Alexa。
TikTok Scraperscraper.tiktokTikTokからのユーザープロフィール、ユーザー投稿、TikTok Shopの商品詳細。

はじめに

単一の API 呼び出しを送信して、ターゲットサイトから構造化されたデータを抽出します。以下の例ではタスクを送信し、実行時間の長いタスクの場合、結果が準備できるまでポーリングします。

import { Scrapeless } from '@scrapeless-ai/sdk';
const client = new Scrapeless({
  apiKey: 'YOUR_API_KEY',
});
 
async function runTask() {
  const result = await client.scraping.scrape({
    actor: 'scraper.shopee',
    input: {
      url: 'https://shopee.tw/a-i.10228173.24803858474'
    }
  });
 
  return result;
}
 
runTask()
  .then(data => {
    console.log('Data:', data);
  })
  .catch(error => {
    console.error('Error:', error);
  });

パラメータ

パラメータ型説明
actorstringスクレイピングサービス(例: scraper.shopee)。
inputobjectタスク固有のパラメーター(例:action、url)。
proxyobject国コードを指定したオプションのプロキシ設定。

タスクのワークフロー

すべての Scraping API タスクは同じ3段階のライフサイクルに従います。短時間で完了するタスクはデータを直接返します。長時間実行されるタスクは、非同期で結果をポーリングするフローに切り替わります。

  1. タスクの送信 — POST リクエストを /api/v1/scraper/requestに送信します。
  2. レスポンスを処理
    1. HTTP200(成功):データがレスポンスボディに直接返されます。
    2. HTTP201(処理中):提供された taskId を使用して結果をポーリングします。
  3. 結果のポーリング — 非同期タスクでは、 /api/v1/scraper/result/{taskId} を繰り返し呼び出し、データの準備が完了するまで待機します(HTTP 200)。

ステータスコードの完全なリストとポーリングのガイダンスについては、 結果とポーリングを参照してください。ポーリングではなくコールバックで結果を受け取る場合は、 Webhooksを参照してください。

課金情報

  1. 課金はリクエスト単位で行われます。
  2. 課金されるのは成功したリクエストのみです。