クローリング

単一ページの収集、バッチジョブ、ウェブサイトのクロール、および結果。

1ページだけスクレイピングするべきか、バッチを送信するべきか、それともウェブサイトをクロールするべきか?

特定の1つのURLを取得する場合は単一ページリクエストを使用し、既知の複数のURLリストを取得する場合はバッチを使用し、リンクされたページを発見したい場合はウェブサイトクロールを使用します。詳細は クロールガイドをご覧ください。

ジョブ識別子が返されるのはなぜですか?ページの内容が返されないのはなぜですか?

クロールジョブは非同期です。返された識別子を保持し、そのジョブのステータスと結果を取得してください。サポートされているSDKヘルパーはこのフローを自動管理できます。

完了したジョブに失敗したページが含まれているのはなぜですか?

個々のページの結果と全体のジョブの結果の両方を確認してください。ジョブは一部のページが失敗した状態で終了する場合があります。各ページのステータスとエラーを確認し、どのページを調査または再試行すべきかを判断してください。

一部のリンクされたページがスキップされたのはなぜですか?

クロール制限とURLスコープを確認してください。デフォルトでは開始時のURL階層外のリンクは除外されます。 allowBackwardLinks を設定することでこの動作を変更できます。ページが見つからない原因は、到達不能または収集中の失敗である可能性もあります。

どの出力形式を使用すべきですか?

テキスト処理にはMarkdownを、パーサーがマークアップを必要とする場合はHTMLを、URL発見にはリンクを使用してください。次の処理ステップで必要な出力形式を設定してください。

クライアントがタイムアウトした場合、ジョブを再送信すべきですか?

識別子を受信している場合は、まず既存のジョブのステータスを確認してください。クライアントのタイムアウトだけでは、サーバー側の処理が停止したとは限りません。新しいジョブを繰り返し作成するのではなく、適切なポーリングポリシーを設定してください。

結果が不完全な場合、報告に何を添付すべきですか?

ジョブ識別子、開始時のURLs、収集オプション、期待されるページ数、および見つからないまたは失敗したページの例をいくつか含めてください。問題を示す最小限のケースを、 サポートにお問い合わせくださいを通じて共有してください。

FAQナビゲーションから別のカテゴリを選択するか、 サポートにお問い合わせください。