文档Scraping API介绍

简介

Scrapeless Scraping API 是一款创新的解决方案,旨在轻松简化从网站提取数据的过程。它经过精心设计,能够驾驭最复杂的网络环境,有效处理动态内容和 JavaScript 渲染。

只需一次 API 调用,你即可即时获取干净、结构化的数据——无需在你这一侧编写或维护 proxies、浏览器或 CAPTCHA 处理逻辑。

可用的 Scraper

每个 scraper 都通过同一个 API 暴露,并使用 actor 参数进行选择。从下方任选一个 scraper 开始:

Scraperactor说明
Google Searchscraper.google.search以结构化 JSON 形式返回实时的 Google Search 和 Google 图片结果。
Amazon Scraperscraper.amazon来自 Amazon 的商品详情、关键词搜索结果、卖家数据,以及用于购物 AI 回答的 Rufus/Alexa。
TikTok Scraperscraper.tiktok来自 TikTok 的用户资料、用户帖子和 TikTok Shop 商品详情。

快速开始

发送一次 API 调用,即可从目标站点提取结构化数据。下方示例提交一个任务,对于运行时间较长的任务,会持续轮询直到结果就绪。

import { Scrapeless } from '@scrapeless-ai/sdk';
const client = new Scrapeless({
  apiKey: 'YOUR_API_KEY',
});
 
async function runTask() {
  const result = await client.scraping.scrape({
    actor: 'scraper.shopee',
    input: {
      url: 'https://shopee.tw/a-i.10228173.24803858474'
    }
  });
 
  return result;
}
 
runTask()
  .then(data => {
    console.log('Data:', data);
  })
  .catch(error => {
    console.error('Error:', error);
  });

参数

参数类型说明
actorstring抓取服务(例如 scraper.shopee)。
inputobject任务特定的参数(例如 action、url)。
proxyobject可选的代理配置,包含 country 字段。

任务工作流

每个 Scraping API 任务都遵循相同的三步生命周期。快速任务会直接返回数据;运行时间较长的任务则会切换为异步的轮询获取结果的流程。

  1. 提交任务 —— 向 /api/v1/scraper/request 发送一个 POST 请求。
  2. 处理响应
    1. HTTP 200(成功):数据直接在响应体中返回。
    2. HTTP 201(处理中):使用返回的 taskId 来轮询获取结果。
  3. 轮询获取结果 —— 对于异步任务,反复调用 /api/v1/scraper/result/{taskId},直到数据就绪(HTTP 200)。

有关完整的状态码列表和轮询指南,请参阅 Results and Polling。若想通过回调(而非轮询)来接收结果,请参阅 Webhooks。

计费信息

  1. 按请求逐次计费。
  2. 仅对成功的请求计费。