एकल पृष्ठ को स्क्रैप करें
क्रॉल API आपको एकल कॉल के साथ वेब पृष्ठों से आप चाहते हैं वह डेटा प्राप्त करने की अनुमति देता है। आप पेज की सामग्री को स्क्रैप कर सकते हैं और विभिन्न प्रारूपों में उसके डेटा को कैप्चर कर सकते हैं।
Scrapeless स्क्रैपिंग अनुरोध शुरू करने और उसकी स्थिति तथा परिणाम प्राप्त करने के लिए एंडपॉइंट्स उजागर करता है। डिफ़ॉल्ट रूप से, स्क्रैपिंग को पहले कार्य शुरू करने और फिर तब तक इसकी स्थिति की जांच करने के असमकालिक तरीके से संभाला जाता है जब तक कि यह पूरी नहीं हो जाती। हालांकि, हमारे SDK के साथ, हम पूरे प्रवाह को संभालने वाला एक सरल फ़ंक्शन प्रदान करते हैं और कार्य पूरा होने पर डेटा वापस करते हैं।
स्थापन
npm install @scrapeless-ai/sdk
pnpm add @scrapeless-ai/sdk
उपयोग
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com"
);
console.log(result);
})();
ब्राउज़र कॉन्फ़िगरेशन
आप नया सत्र बनाते समय स्क्रैप जॉब को निष्पादित करने के लिए उपयोग किए जाने वाले सत्र के लिए कॉन्फ़िगरेशन भी प्रदान कर सकते हैं; इनमें प्रॉक्सी का उपयोग शामिल हो सकता है।
Scrapeless स्वचालित रूप से reCAPTCHA v2, Cloudflare Turnstile/Challenge सहित सामान्य CAPTCHA प्रकारों को संभालता है।
कोई अतिरिक्त सेटअप आवश्यक नहीं है—स्क्रेपिंग के दौरान Scrapeless इसकी देखभाल करता है। 👉 अधिक विवरण के लिए, कैप्चा सॉल्विंग देखें।
सभी उपलब्ध ब्राउज़र पैरामीटर्स को देखने के लिए, API संदर्भ या ब्राउज़र पैरामीटर्स देखें।
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
browserOptions: {
proxyCountry: "ANY",
sessionName: "Crawl",
sessionRecording: true,
sessionTTL: 900,
},
}
);
console.log(result);
})();
स्क्रैप कॉन्फ़िगरेशन
आप स्क्रैप जॉब के लिए वैकल्पिक पैरामीटर्स भी निर्दिष्ट कर सकते हैं, जैसे प्रतिक्रिया प्रारूप, केवल मुख्य सामग्री निष्कर्षण सक्षम करना, अधिकतम पेज नेविगेशन टाइमआउट सेट करना और अधिक।
import { ScrapingCrawl } from "@scrapeless-ai/sdk";
// Initialize the client
const client = new ScrapingCrawl({
apiKey: "your-api-key", // Get your API key from https://scrapeless.com
});
(async () => {
const result = await client.scrapeUrl(
"https://example.com",
{
formats: ["markdown", "html", "links"],
onlyMainContent: false,
timeout: 15000,
}
);
console.log(result);
})();
स्क्रैप एंडपॉइंट पर पूर्ण संदर्भ के लिए, API संदर्भ देखें।