Integracja z Python Scrapy

Dowiedz się, jak skonfigurować scrapery Python Scrapy, aby kierowały żądania przez porty XProxy, oraz jak zaimplementować własny middleware do obsługi automatycznej rotacji adresów IP po osiągnięciu progów liczby żądań.

Dlaczego warto używać Scrapy z XProxy?

Scrapy to asynchroniczny framework do scrapowania w Pythonie, zaprojektowany z myślą o wydajnym pozyskiwaniu danych. Przy uruchamianiu scraperów o dużej przepustowości korzystanie z rozliczanych proxy chmurowych prowadzi do ogromnych kosztów miesięcznych. Uruchamianie Scrapy za pośrednictwem własnej farmy XProxy z lokalnymi kartami SIM zapewnia nielimitowane potoki danych, pozwalając zaoszczędzić tysiące dolarów przy jednoczesnym wykorzystaniu dynamicznych adresów IP CGNAT od operatorów.

Lista portów proxy i ustawień XProxy

Podstawowa konfiguracja proxy w Scrapy

Najprostszym sposobem korzystania z XProxy w Scrapy jest skonfigurowanie standardowego HttpProxyMiddleware i dodanie ustawień proxy bezpośrednio do pliku settings.py lub określenie ich dla poszczególnych żądań.

Opcja A: konfiguracja globalna w pliku settings.py

Otwórz plik settings.py swojego projektu Scrapy i dodaj następujące ustawienia:

settings.py
# Enable the default HTTP Proxy Middleware
DOWNLOADER_MIDDLEWARES = {
    'scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware': 400,
}

# Define your XProxy SOCKS5 or HTTP proxy URL
# Replace 192.168.6.7:5001 with your XProxy server IP and port
HTTP_PROXY = 'http://your_username:[email protected]:5001'

# Set proxy to environment variable (or configure in custom middleware)

Opcja B: dynamiczne przekazywanie proxy dla każdego żądania (Request)

Możesz również przypisać połączenie proxy bezpośrednio w pliku spidera do poszczególnych żądań:

myspider.py
import scrapy

class MySpider(scrapy.Spider):
    name = 'myspider'

    def start_requests(self):
        urls = ['https://httpbin.org/ip']
        for url in urls:
            yield scrapy.Request(
                url=url,
                callback=self.parse,
                meta={
                    # Route this specific request through XProxy port 5001
                    'proxy': 'http://your_username:[email protected]:5001'
                }
            )

    def parse(self, response):
        self.logger.info(f"Response: {response.text}")

Zaawansowane: middleware automatycznej rotacji adresów IP

Aby automatycznie rotować mobilny adres IP XProxy, gdy Google wyświetli CAPTCHA, lub po osiągnięciu określonej liczby żądań stron, zaimplementuj własny middleware Scrapy:

middlewares.py
import time
import requests
from scrapy.exceptions import NotConfigured

class XProxyRotationMiddleware:
    def __init__(self, rotate_url, request_limit=100):
        self.rotate_url = rotate_url
        self.request_limit = request_limit
        self.request_count = 0

    @classmethod
    def from_crawler(cls, crawler):
        # Read settings from settings.py
        rotate_url = crawler.settings.get('XPROXY_ROTATE_URL')
        request_limit = crawler.settings.getint('XPROXY_REQUEST_LIMIT', 100)
        
        if not rotate_url:
            raise NotConfigured
            
        return cls(rotate_url, request_limit)

    def process_request(self, request, spider):
        self.request_count += 1
        
        # Trigger rotation if limit reached
        if self.request_count >= self.request_limit:
            spider.logger.info("Request limit reached. Triggering XProxy IP rotation...")
            self._trigger_rotation(spider)
            self.request_count = 0
            
    def _trigger_rotation(self, spider):
        try:
            response = requests.get(self.rotate_url)
            spider.logger.info(f"IP rotation triggered: {response.status_code} - {response.text}")
            # Wait for 6 seconds for cellular reconnection
            time.sleep(6)
        except Exception as e:
            spider.logger.error(f"Failed to trigger rotation: {str(e)}")

Aktywuj middleware w pliku settings.py:

settings.py
DOWNLOADER_MIDDLEWARES = {
    'myproject.middlewares.XProxyRotationMiddleware': 350,
    'scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware': 400,
}

# The XProxy Rotation API URL for your device position
XPROXY_ROTATE_URL = 'http://192.168.6.7:8081/api/v1/rotate_ip/position/1'
# Rotate the IP address after every 150 requests
XPROXY_REQUEST_LIMIT = 150

Why High-Quality SOCKS5 UDP & Mobile Proxies Matter for Python Scrapy Crawlers

Using cheap datacenter proxies or basic HTTP proxies in antidetect profiles leads to instant account suspensions on Facebook, Google, TikTok, and Amazon. Here is why XProxy's self-hosted 4G/5G mobile proxies deliver superior anonymity and trust:

  • SOCKS5 with Full UDP Support: Unlike standard HTTP proxies that drop UDP packets, XProxy SOCKS5 proxies fully support UDP datagrams. This ensures WebRTC, DNS queries, and real-time audio/video sockets route securely through your proxy without revealing your real IP address.
  • Instant REST API IP Rotation: Trigger cellular IP rotation on demand via simple HTTP GET requests (e.g. http://192.168.6.7:8081/api/v1/rotate_ip/position/1). Reconnect 4G/5G USB modems in 3 to 8 seconds with zero proxy dropouts.
  • 100% WebRTC & DNS Leak Protection: Combined with XProxy's local LAN gateway and TCP OS Spoofing, your browser profiles maintain pristine anonymity scores on BrowserLeaks, Whoer, Pixelscan, and IPhey.
  • Carrier-Grade NAT (CGNAT) Trust: Mobile carrier IPs are shared by thousands of active smartphone users. Major platforms never ban mobile IP ranges, granting your accounts maximum trust.
🚀 Build Your Own 4G/5G Proxy Farm

Stop Paying Monthly Rented Proxy Fees

XProxy hardware & software lets you own private mobile proxy channels with unlimited data, zero bandwidth caps, SOCKS5 UDP support, and instant REST API IP rotation (Scrapy Crawlers).

XProxy XH22 4G 5G Mobile Proxy Hardware Kit