Crawl

एकल-पृष्ठ संग्रह, बैच नौकरियां, वेबसाइट क्रॉलिंग और परिणाम।

क्या मुझे एक पृष्ठ स्क्रैप करना चाहिए, एक बैच सबमिट करना चाहिए, या एक वेबसाइट क्रॉल करनी चाहिए?

एक ज्ञात URL के लिए एकल-पृष्ठ अनुरोध का उपयोग करें, एक ज्ञात URL सूची के लिए एक बैच का उपयोग करें, या जुड़े पृष्ठों को खोजने के लिए एक वेबसाइट क्रॉल करें। देखें क्रॉल गाइड।

मुझे पेज सामग्री के बजाय एक कार्य पहचानकर्ता क्यों मिल रहा है?

क्रॉल नौकरियां असमकालिक हैं। लौटे हुए पहचानकर्ता को रखें और उस कार्य के लिए स्थिति और परिणाम पुनः प्राप्त करें। समर्थित SDK सहायक इस प्रवाह को आपके लिए प्रबंधित कर सकते हैं।

पूर्ण कार्य में विफल पृष्ठ क्यों हैं?

समग्र कार्य के साथ-साथ व्यक्तिगत पृष्ठ परिणामों का निरीक्षण करें। एक कार्य असफल पृष्ठों के साथ समाप्त हो सकती है। जांच या लक्षित पुनः प्रयास की आवश्यकता के निर्णय के लिए प्रत्येक पृष्ठ की स्थिति और त्रुटि का उपयोग करें।

कुछ जुड़े पृष्ठ क्यों छोड़ दिए गए?

क्रॉल सीमा और URL सीमा की जाँच करें। डिफ़ॉल्ट रूप से, प्रारंभिक URL पदानुक्रम के बाहर के लिंक बाहर रखे जाते हैं; allowBackwardLinks व्यवहार बदलता है। एक लापता पृष्ठ अप्राप्य भी हो सकता है या संग्रह के दौरान विफल हो सकता है।

मुझे कौन सा आउटपुट प्रारूप उपयोग करना चाहिए?

पाठ संसाधन के लिए मार्कडाउन, मार्कअप की आवश्यकता वाले पार्सर के लिए HTML, या URL खोज के लिए लिंक चुनें। अपने अगले संसाधन चरण की आवश्यकता वाले आउटपुट प्रारूप सेट करें।

क्या मुझे अपने क्लाइंट के समय समाप्त होने पर कार्य फिर से सबमिट करनी चाहिए?

यदि आपको कार्य की पहचान मिली है, तो पहले मौजूदा कार्य की स्थिति की जांच करें। केवल क्लाइंट का समय समाप्त होना यह साबित नहीं करता कि सर्वर-साइड कार्य रुक गया है। नई नौकरियां बार-बार बनाने के बजाय एक सीमित पोलिंग नीति सेट करें।

अधूरे परिणामों की रिपोर्ट करते समय मुझे क्या भेजना चाहिए?

कार्य की पहचान, प्रारंभिक URL, संग्रह विकल्प, अपेक्षित पृष्ठ संख्या और लुप्त या विफल पृष्ठों के कुछ उदाहरण शामिल करें। मुद्दे को दर्शाने वाले सबसे छोटे मामले को साझा करें संपर्क समर्थनके माध्यम से।

FAQ नेविगेशन से कोई अन्य श्रेणी चुनें, या support से संपर्क करें।