दस्तावेज़ब्राउज़र और CrawlCrawlवेबसाइट क्रॉल करें

एक वेबसाइट को क्रॉल करें

व्यापक डेटा निकालने के लिए एक वेबसाइट और उसके लिंक किए गए पृष्ठों को क्रॉल करें। विस्तृत उपयोग के लिए, क्रॉल API संदर्भ देखें

डिफ़ॉल्ट रूप से, क्रॉल उन उप-लिंक को छोड़ देता है जो आपके द्वारा निर्दिष्ट URL पदानुक्रम का हिस्सा नहीं हैं। उदाहरण के लिए, https://example.com/products/ को क्रॉल करने पर https://example.com/promotions/deal-567 के अंतर्गत आने वाले पृष्ठ शामिल नहीं होंगे। ऐसे लिंक शामिल करने के लिए, allowBackwardLinks पैरामीटर को सक्षम करें।

Scrapeless क्रॉल अनुरोध शुरू करने और उसकी स्थिति तथा परिणाम प्राप्त करने के लिए एंडपॉइंट्स प्रदान करता है। डिफ़ॉल्ट रूप से, क्रॉलिंग असमकालिक रूप से संभाली जाती है: पहले कार्य शुरू करें, फिर पूरा होने तक उसकी स्थिति की जाँच करते रहें। हालाँकि, हमारे SDK के साथ, हम पूरे प्रवाह को संभालने और कार्य पूरा होने पर डेटा लौटाने के लिए एक सरल फ़ंक्शन प्रदान करते हैं।

स्थापन

npm install @scrapeless-ai/sdk
 
pnpm add @scrapeless-ai/sdk
 

उपयोग

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.crawlUrl(
    "https://example.com",
    {
      limit: 2,
      scrapeOptions: {
        formats: ["markdown", "html", "links"],
        onlyMainContent: false,
        timeout: 15000,
      },
      browserOptions: {
        proxyCountry: "ANY",
        sessionName: "Crawl",
        sessionRecording: true,
        sessionTTL: 900,
      },
    }
  );
 
  console.log(result);
})();
 

प्रतिक्रिया

{
  "success": true,
  "status": "completed",
  "completed": 2,
  "total": 2,
  "data": [
    {
      "url": "https://example.com",
      "metadata": {
        "title": "Example Page",
        "description": "A sample webpage"
      },
      "markdown": "# Example Page\nThis is content...",
      ...
    },
    ...
  ]
}
 

प्रत्येक क्रॉल किया गया पृष्ठ completed या failed की अपनी स्थिति रखता है और इसके अपने त्रुटि क्षेत्र हो सकते हैं, इसलिए इसके प्रति सावधान रहें।

पूरी स्कीमा देखने के लिए, API संदर्भ देखें।

ब्राउज़र कॉन्फ़िगरेशन

आप नया सत्र बनाते समय स्क्रैप जॉब को निष्पादित करने के लिए उपयोग किए जाने वाले सत्र के लिए कॉन्फ़िगरेशन भी प्रदान कर सकते हैं; इनमें प्रॉक्सी का उपयोग शामिल हो सकता है।

उपलब्ध पैरामीटर्स की पूरी सूची के लिए, API संदर्भ या ब्राउज़र पैरामीटर्स देखें।

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.crawlUrl(
    "https://example.com",
    {
      limit: 2,
      browserOptions: {
        proxyCountry: "ANY",
        sessionName: "Crawl",
        sessionRecording: true,
        sessionTTL: 900,
      },
    }
  );
 
  console.log(result);
})();
 

स्क्रैप कॉन्फ़िगरेशन

आप स्क्रैप जॉब के लिए वैकल्पिक पैरामीटर्स भी निर्दिष्ट कर सकते हैं, जैसे प्रतिक्रिया प्रारूप, केवल मुख्य सामग्री निष्कर्षण सक्षम करना, अधिकतम पेज नेविगेशन टाइमआउट सेट करना और अधिक।

import { ScrapingCrawl } from "@scrapeless-ai/sdk";
 
// Initialize the client
const client = new ScrapingCrawl({
  apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
 
(async () => {
  const result = await client.crawlUrl(
    "https://example.com",
    {
      limit: 2,
      scrapeOptions: {
        formats: ["markdown", "html", "links"],
        onlyMainContent: false,
        timeout: 15000,
      }
    }
  );
 
  console.log(result);
})();
 

क्रॉल एंडपॉइंट पर पूर्ण संदर्भ के लिए, API संदर्भ देखें।