Crawl
单页采集、批量任务、网站爬取与结果。
我应该抓取单个页面、提交批量任务,还是爬取整个网站?
当你有一个已知 URL 时使用单页请求;当你有一份已知的 URL 列表时使用批量任务;当你需要发现关联页面时使用网站爬取。参见 Crawl 指南。
为什么我得到的是任务标识符而不是页面内容?
Crawl 任务是异步的。请保留返回的标识符,并使用它来获取该任务的状态和结果。受支持的 SDK 辅助工具可以为你管理这一流程。
为什么已完成的任务中包含失败的页面?
请同时检查各个页面的结果以及整体任务。一个任务可能在部分页面未成功的情况下完成。使用每个页面的状态和错误信息来判断哪些需要排查或进行有针对性的重试。
为什么有些关联页面被跳过了?
请检查爬取限制和 URL 范围。默认情况下,起始 URL 层级之外的链接会被排除;allowBackwardLinks 可以改变这一行为。缺失的页面也可能是无法访问,或在采集过程中失败。
我应该使用哪种输出格式?
文本处理选择 Markdown,当你的解析器需要标记时选择 HTML,URL 发现则选择 links。请设置你的下一处理步骤所需的输出格式。
如果我的客户端超时了,我应该重新提交任务吗?
如果你已经收到了现有任务的标识符,请先检查它的状态。仅凭客户端超时并不能证明服务器端的工作已经停止。请设置一个有边界的轮询策略,而不是反复创建新任务。
报告结果不完整时我应该提供哪些信息?
请包含任务标识符、起始 URL、采集选项、预期页面数量,以及几个缺失或失败页面的示例。通过 Contact Support 分享能够展示该问题的最小案例。
从 FAQ 导航中选择其他类别,或联系支持。