Python Scrapy के साथ एकीकरण

Python Scrapy क्रॉलर को XProxy पोर्ट के माध्यम से अनुरोध रूट करने हेतु कॉन्फ़िगर करना और अनुरोध मील के पत्थरों पर स्वचालित IP रोटेशन संभालने के लिए कस्टम मिडलवेयर लागू करना सीखें।

Scrapy को XProxy के साथ क्यों उपयोग करें?

Scrapy उच्च-प्रदर्शन डेटा क्रॉलिंग के लिए डिज़ाइन किया गया एक अतुल्यकालिक Python स्क्रैपिंग फ्रेमवर्क है। उच्च-थ्रूपुट स्क्रैपर चलाते समय मीटर्ड क्लाउड प्रॉक्सी का उपयोग करने से भारी मासिक लागत आती है। स्थानीय SIM कार्ड के साथ अपने स्वयं के XProxy फार्म से Scrapy चलाने पर असीमित डेटा पाइपलाइन मिलती है, जिससे गतिशील कैरियर CGNAT IP का लाभ उठाते हुए हजारों डॉलर की बचत होती है।

XProxy प्रॉक्सी पोर्ट सूची और सेटिंग्स

Scrapy में बुनियादी प्रॉक्सी कॉन्फ़िगरेशन

Scrapy में XProxy का उपयोग करने का सबसे सरल तरीका मानक HttpProxyMiddleware को कॉन्फ़िगर करना और प्रॉक्सी सेटिंग्स को सीधे settings.py में जोड़ना या उन्हें प्रति अनुरोध निर्दिष्ट करना है।

विकल्प A: settings.py में वैश्विक कॉन्फ़िगरेशन

अपने Scrapy प्रोजेक्ट का settings.py खोलें और निम्नलिखित सेटिंग्स जोड़ें:

settings.py
# Enable the default HTTP Proxy Middleware
DOWNLOADER_MIDDLEWARES = {
    'scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware': 400,
}

# Define your XProxy SOCKS5 or HTTP proxy URL
# Replace 192.168.6.7:5001 with your XProxy server IP and port
HTTP_PROXY = 'http://your_username:[email protected]:5001'

# Set proxy to environment variable (or configure in custom middleware)

विकल्प B: प्रत्येक Request के लिए प्रॉक्सी को गतिशील रूप से पास करें

आप अपनी स्पाइडर फ़ाइल के अंदर सीधे व्यक्तिगत अनुरोधों को प्रॉक्सी कनेक्शन भी असाइन कर सकते हैं:

myspider.py
import scrapy

class MySpider(scrapy.Spider):
    name = 'myspider'

    def start_requests(self):
        urls = ['https://httpbin.org/ip']
        for url in urls:
            yield scrapy.Request(
                url=url,
                callback=self.parse,
                meta={
                    # Route this specific request through XProxy port 5001
                    'proxy': 'http://your_username:[email protected]:5001'
                }
            )

    def parse(self, response):
        self.logger.info(f"Response: {response.text}")

उन्नत: स्वचालित IP रोटेशन मिडलवेयर

जब Google CAPTCHA दिखाए या पृष्ठ अनुरोधों की एक विशिष्ट संख्या के बाद अपने XProxy मोबाइल IP को स्वचालित रूप से रोटेट करने के लिए, एक कस्टम Scrapy मिडलवेयर लागू करें:

middlewares.py
import time
import requests
from scrapy.exceptions import NotConfigured

class XProxyRotationMiddleware:
    def __init__(self, rotate_url, request_limit=100):
        self.rotate_url = rotate_url
        self.request_limit = request_limit
        self.request_count = 0

    @classmethod
    def from_crawler(cls, crawler):
        # Read settings from settings.py
        rotate_url = crawler.settings.get('XPROXY_ROTATE_URL')
        request_limit = crawler.settings.getint('XPROXY_REQUEST_LIMIT', 100)
        
        if not rotate_url:
            raise NotConfigured
            
        return cls(rotate_url, request_limit)

    def process_request(self, request, spider):
        self.request_count += 1
        
        # Trigger rotation if limit reached
        if self.request_count >= self.request_limit:
            spider.logger.info("Request limit reached. Triggering XProxy IP rotation...")
            self._trigger_rotation(spider)
            self.request_count = 0
            
    def _trigger_rotation(self, spider):
        try:
            response = requests.get(self.rotate_url)
            spider.logger.info(f"IP rotation triggered: {response.status_code} - {response.text}")
            # Wait for 6 seconds for cellular reconnection
            time.sleep(6)
        except Exception as e:
            spider.logger.error(f"Failed to trigger rotation: {str(e)}")

अपने settings.py में मिडलवेयर सक्रिय करें:

settings.py
DOWNLOADER_MIDDLEWARES = {
    'myproject.middlewares.XProxyRotationMiddleware': 350,
    'scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware': 400,
}

# The XProxy Rotation API URL for your device position
XPROXY_ROTATE_URL = 'http://192.168.6.7:8081/api/v1/rotate_ip/position/1'
# Rotate the IP address after every 150 requests
XPROXY_REQUEST_LIMIT = 150

Why High-Quality SOCKS5 UDP & Mobile Proxies Matter for Python Scrapy Crawlers

Using cheap datacenter proxies or basic HTTP proxies in antidetect profiles leads to instant account suspensions on Facebook, Google, TikTok, and Amazon. Here is why XProxy's self-hosted 4G/5G mobile proxies deliver superior anonymity and trust:

  • SOCKS5 with Full UDP Support: Unlike standard HTTP proxies that drop UDP packets, XProxy SOCKS5 proxies fully support UDP datagrams. This ensures WebRTC, DNS queries, and real-time audio/video sockets route securely through your proxy without revealing your real IP address.
  • Instant REST API IP Rotation: Trigger cellular IP rotation on demand via simple HTTP GET requests (e.g. http://192.168.6.7:8081/api/v1/rotate_ip/position/1). Reconnect 4G/5G USB modems in 3 to 8 seconds with zero proxy dropouts.
  • 100% WebRTC & DNS Leak Protection: Combined with XProxy's local LAN gateway and TCP OS Spoofing, your browser profiles maintain pristine anonymity scores on BrowserLeaks, Whoer, Pixelscan, and IPhey.
  • Carrier-Grade NAT (CGNAT) Trust: Mobile carrier IPs are shared by thousands of active smartphone users. Major platforms never ban mobile IP ranges, granting your accounts maximum trust.
🚀 Build Your Own 4G/5G Proxy Farm

Stop Paying Monthly Rented Proxy Fees

XProxy hardware & software lets you own private mobile proxy channels with unlimited data, zero bandwidth caps, SOCKS5 UDP support, and instant REST API IP rotation (Scrapy Crawlers).

XProxy XH22 4G 5G Mobile Proxy Hardware Kit