介绍

Crawl 是一项专为大规模数据抓取与处理而设计的前沿功能。它凭借几大核心优势脱颖而出:智能递归抓取、强大的批量数据处理能力 以及 灵活的多格式输出。这些功能使企业和开发者能够高效获取并处理海量网页数据,为 AI 训练、市场分析、商业决策等应用场景提供支撑。

主要功能与优势

  1. 大规模抓取能力: 支持海量单页抓取以及智能递归抓取。
  2. 灵活的多格式交付: 以多种格式输出数据,包括 JSON、Markdown、Metadata、HTML、Links 和 Screenshots,确保与各类工作流和系统兼容。
  3. 先进的反检测策略: 由我们自主研发的 Chromium 内核驱动,提供强大的反检测工具以绕过网站封锁,如指纹配置、CAPTCHA 解决、隐身模式和代理轮换 (内置 195 个国家/地区)。
  4. 自研 Chromium 驱动的性能表现
    1. 自动 CAPTCHA Solver:自动处理复杂的验证码,例如 reCAPTCHA v2 和 Cloudflare Turnstile/Challenge,且免费。
    2. 并发优势: 与受制于严格并发限制的竞品不同,Crawl 在其基础套餐中即标准提供 50 个并发会话——高级套餐更可解锁无限并发,实现超快速、大批量的数据采集。
    3. 成本效率: 在反爬网站上的表现优于其他工具,提供 免费的 CAPTCHA 解决,与替代方案相比预计可 节省 70% 的成本。

计费信息:

费用基于结合代理流量与按小时费率的混合定价模型计算,起价为每 GB 1.8 美元、每小时 0.09 美元,与 Browser 相同。

查看成本消耗以了解详情。

Tips
  • 对于涉及大量 JS 渲染并需要自动化操作的页面,我们推荐使用 Web Unlocker API。它提供了具有成本效益的按页计费模型,起价为每 1000 个 URL $1.00。
  • 对于需要通过 Puppeteer 或 Playwright 等框架操作浏览器的复杂自动化和数据抓取工作流,请使用 Browser 服务。