AliExpress ist einer der größten Marktplätze im Web, und die dort verfügbaren Produkt-, Preis- und Suchdaten sind für Marktforschung, Wettbewerbspreisbeobachtung oder den Aufbau eines Beschaffungs-Tools äußerst nützlich. Das Problem ist, dass AliExpress automatisierten Datenverkehr aggressiv abwehrt: Bei nennenswerten Mengen von einer einzelnen Rechenzentrum-IP ernten Sie Ratenlimits, CAPTCHAs und IP-Sperren statt Daten. Dieser Leitfaden zeigt Ihnen, wie Sie AliExpress-Proxy-Scraping in Python durchführen, indem Sie Anfragen über den Crawlbase Smart AI Proxy routen, damit die Datenerfassung anonym und unblockiert bleibt.

Die gesamte Anleitung beschränkt sich auf öffentliche Daten: Produkttitel, Preise, Bilder, Versandhinweise und Verkaufszahlen, die jeder ohne Anmeldung auf einer Suchergebnisseite sehen kann. Nutzerkonten, durch Login gesperrte Inhalte, Bestellvorgänge und personenbezogene Daten werden nicht berührt. Der Rechtsabschnitt am Ende ist kein Boilerplate, lesen Sie ihn also, bevor Sie dies auf Produktionsvolumen anwenden.

Warum Sie einen Proxy benötigen, um AliExpress zu scrapen

AliExpress behandelt automatisierten Datenverkehr wie die meisten großen E-Commerce-Plattformen als Bedrohung. Drei Abwehrmechanismen stehen einem naiven Scraper im Weg, und ein rotierender Proxy neutralisiert alle drei.

IP-Sperren. Senden Sie zu viele Anfragen von einer einzigen Adresse, drosselt oder sperrt AliExpress sie vollständig. Eine einzige statische IP kann schlicht kein bedeutungsvolles Scraping-Volumen aufrechterhalten.

CAPTCHAs. Wenn Datenverkehr geskriptet wirkt, stellt AliExpress ihn mit einem CAPTCHA vor eine Herausforderung, das Menschen von Bots trennen soll. Eine markierte IP wird weiterhin herausgefordert, bis Sie sie rotieren.

Bot-Erkennung. Jenseits reiner Anfragezahlen erstellt die Plattform Fingerabdrücke von Anfrage-Mustern, um Automatisierung zu erkennen. Vorhersehbarer, hochfrequenter Datenverkehr von derselben Quelle ist das am leichtesten erkennbare Muster.

Ein Pool von rotierenden Wohngebiets-Proxys beantwortet alle drei Probleme: Jede Anfrage kann von einer anderen echten Nutzer-IP ausgehen, sodass keine einzelne Adresse ein Ratenlimit auslöst, hinter einem CAPTCHA feststeckt oder als Bot auffällt. Sie können diesen Pool selbst zusammenstellen, aber gesunde Wohngebiets-IPs zu beschaffen und die Rotationslogik am Laufen zu halten, ist der größte Teil der Arbeit. Der Crawlbase Smart AI Proxy fasst das in einem einzigen Endpunkt zusammen, auf den Sie Ihren bestehenden HTTP-Client richten.

Wie der Crawlbase Smart AI Proxy passt

Der Smart AI Proxy ist ein einzelner Proxy-Endpunkt, der vor der gesamten Crawlbase-Crawling-Infrastruktur sitzt. Anstatt Ihren Code um eine neue API herum zu schreiben, setzen Sie eine einzelne Proxy-URL und Ihre normalen requests-Aufrufe fließen durch sie hindurch. Dahinter erledigt er die Arbeit, die ein selbst aufgebauter Proxy-Stack leisten würde:

  • Automatische IP-Rotation. Die Ursprungs-IP wechselt zwischen Anfragen und zieht aus einem großen Pool von Wohngebiets- und Rechenzentrums-Adressen, sodass Sie Ratenlimits und Sperren umgehen, ohne die Rotation selbst zu verwalten. Die Mechanik entspricht einem beliebigen rotierenden Wohngebiets-Proxy-Setup, wird aber serverseitig gehandhabt.
  • Datenverkehrs-Routing und Lastverteilung. Anfragen werden über viele Proxy-Server verteilt, sodass keiner überlastet wird, was den Durchsatz bei einem langen Durchlauf stabil hält.
  • Weiterleitung an die Crawling API. Der Smart AI Proxy leitet Ihre Anfragen an die Crawling API weiter, sodass Sie die meisten Funktionen dieser API erben, einschließlich serverseitigem Rendering und den unten behandelten Parametersteuerelementen, ohne die API direkt aufzurufen.

Der praktische Vorteil für AliExpress besteht darin, dass Sie aufhören, gegen die Anti-Bot-Schicht zu kämpfen. Ihr Scraper sendet eine einfache Anfrage an eine einzige Proxy-URL; der Proxy übernimmt IP, Rotation und Routing, sodass die Seite statt einer Sperrung zurückkommt.

Smart AI Proxy vs. Crawling API

Beide erreichen dasselbe Crawling-Backend. Der Unterschied liegt in der Integrationsform. Der Smart AI Proxy ist ein Proxy-Endpunkt, den Sie in jedes Tool einsetzen, das HTTP-Proxys versteht, sodass bestehender Code unverändert funktioniert. Die Crawling API ist eine HTTP-API, die Sie direkt aufrufen, wenn Sie neuen Code schreiben. Dieser Leitfaden verwendet den Smart AI Proxy, weil der AliExpress-Scraper ein Standard-requests-Skript ist.

Den Proxy mit einem einzigen curl-Befehl testen

Bestätigen Sie, bevor Sie Python schreiben, mit einem Befehl, dass der Proxy funktioniert. Erstellen Sie zunächst ein Crawlbase-Konto und öffnen Sie Ihr Smart AI Proxy-Dashboard, um Ihr Proxy-Authentifizierungstoken zu kopieren. Führen Sie dann Folgendes aus und ersetzen Sie dabei USER_TOKEN durch dieses Token.

bash
curl -x "http://[email protected]:8012" -k "https://www.aliexpress.com/w/wholesale-macbook-pro.html"

Hier geschieht Folgendes: Das Flag -x leitet die Anfrage durch den Smart AI Proxy, der auf smartproxy.crawlbase.com an Port 8012 lauscht. Ihr Token ist der Benutzername in der Proxy-URL und das Passwort bleibt leer. Das Flag -k weist curl an, die SSL-Zertifikatsverifizierung zu überspringen, was beim Tunneln von HTTPS durch den Proxy erforderlich ist; ohne es kann der Handshake zwischen curl und dem Proxy fehlschlagen. Bei Erfolg erhalten Sie das rohe HTML der AliExpress-Suchseite zurück.

Parameter zur Feinabstimmung der Anfrage hinzufügen

Da der Smart AI Proxy an die Crawling API weiterleitet, können Sie Crawling API-Parameter über einen speziellen Header namens CrawlbaseAPI-Parameters senden. So teilen Sie dem Proxy genau mit, wie er eine Anfrage behandeln soll, statt die Standardeinstellungen zu akzeptieren.

Der nützlichste für diese Aufgabe ist scraper=aliexpress-serp. Anstatt rohes HTML zurückzugeben, führt er Crawlbase's integrierten AliExpress-Suchergebnis-Parser aus und gibt Ihnen sauberes, strukturiertes JSON, sodass Sie das Schreiben und Warten von Selektoren vollständig überspringen.

bash
curl -H "CrawlbaseAPI-Parameters: scraper=aliexpress-serp" \
  -x "http://[email protected]:8012" -k \
  "https://www.aliexpress.com/w/wholesale-macbook-pro.html"

Dieser einzelne Header verwandelt einen unordentlichen HTML-Dump in geordnete Produktdaten. Wir verwenden denselben Parameter gleich aus Python heraus.

Das Python-Projekt einrichten

Sie benötigen Python 3. Falls Sie es noch nicht haben, installieren Sie es von python.org und bestätigen Sie die Version. Erstellen Sie dann einen Projektordner und fügen Sie eine Skriptdatei hinzu.

bash
python --version

mkdir aliexpress-scraper && cd aliexpress-scraper
touch aliexpress.py

Sie benötigen nur ein externes Paket. Die requests-Bibliothek übernimmt HTTP und unterstützt Proxys nativ, und json wird mit der Python-Standardbibliothek geliefert, sodass nichts weiter zu installieren ist.

bash
pip install requests

Eine Seite über den Smart AI Proxy abrufen

Bestätigen Sie zunächst, dass der Proxy aus Python heraus funktioniert, bevor Sie etwas parsen. Öffnen Sie aliexpress.py und fügen Sie den unten stehenden Code hinzu, wobei Sie Ihr Token eintragen. Das Muster spiegelt den curl-Befehl wider: Ihr Token und ein leeres Passwort werden zu den Proxy-Credentials, und sowohl das http- als auch das https-Schema werden durch dieselbe Smart AI Proxy-URL geleitet.

python
import requests

username = "USER_TOKEN"
password = ""
proxy_auth = f"{username}:{password}"

url = "https://www.aliexpress.com/w/wholesale-macbook-pro.html"
proxy_url = f"http://{proxy_auth}@smartproxy.crawlbase.com:8012"
proxies = {"http": proxy_url, "https": proxy_url}

response = requests.get(url=url, proxies=proxies, verify=False)

print("Status:", response.status_code)
print(response.text[:500])

Drei Details sind wichtig. Das proxies-Dictionary weist requests an, jede Anfrage durch den Smart AI Proxy zu senden. Das Argument verify=False deaktiviert die SSL-Verifizierung aus demselben Grund wie -k bei curl; für einen langlebigen Produktions-Dienst würden Sie Zertifikate korrekt handhaben, anstatt die Prüfung zu deaktivieren. Führen Sie es mit python aliexpress.py aus und Sie sollten einen Status 200 und den ersten Teil des AliExpress-HTMLs sehen, was bestätigt, dass der Proxy korrekt routet.

Crawlbase AliExpress Scraper

AliExpress blockiert Scraper-ähnlichen Datenverkehr schnell. Der Smart AI Proxy ist ein einzelner Endpunkt, auf den Sie Ihre requests-Aufrufe richten: Er rotiert serverseitig durch Wohngebiets- und Rechenzentrums-IPs, handhabt das Routing und leitet an die Crawling API weiter, sodass CAPTCHAs und IP-Sperren nicht mehr Ihr Problem sind. Binden Sie ihn in den Code ein, den Sie bereits haben, und richten Sie ihn zunächst auf eine öffentliche Seite im kostenlosen Tarif.

Ergebnisse in strukturiertes JSON parsen

Rohes HTML ist schwer zu verarbeiten. Anstatt CSS-Selektoren gegen AliExpress-Markup zu schreiben, das sich ohne Vorankündigung ändert, nutzen Sie den integrierten Parser, indem Sie den Parameter scraper=aliexpress-serp als Header senden. Der Proxy gibt sauberes JSON statt HTML zurück, und json.loads wandelt das in ein Python-Dictionary um, durch das Sie navigieren können.

python
import requests
import json

username = "USER_TOKEN"
password = ""
proxy_auth = f"{username}:{password}"

url = "https://www.aliexpress.com/w/wholesale-macbook-pro.html"
proxy_url = f"http://{proxy_auth}@smartproxy.crawlbase.com:8012"
proxies = {"http": proxy_url, "https": proxy_url}

headers = {"CrawlbaseAPI-Parameters": "scraper=aliexpress-serp"}

response = requests.get(url=url, proxies=proxies, headers=headers, verify=False)

data = json.loads(response.text)
print(json.dumps(data, indent=4))

Die Antwort ist ein JSON-Objekt, dessen body.products-Array einen Eintrag pro Angebot enthält. Ein gekürztes Beispiel sieht so aus:

json
{
  "original_status": 200,
  "cb_status": 200,
  "body": {
    "products": [
      {
        "title": "5 In 1 USB C Hub Type C to 4K HD Adapter for Macbook Pro",
        "price": { "current": "$1.27" },
        "url": "https://www.aliexpress.com/item/1005005653517644.html",
        "image": "https://ae04.alicdn.com/kf/Sbffa8b7a90564cff8.jpg",
        "shippingMessage": "Free shipping",
        "soldCount": 207
      }
    ],
    "relatedSearches": []
  }
}

Jedes Produkt enthält die Felder, die Sie für die Recherche tatsächlich benötigen: Titel, aktueller Preis, Produkt-URL, Bild, Versandhinweis und Verkaufsanzahl. Der Parser gibt auch eine relatedSearches-Liste zurück, die Sie zur Entdeckung verwandter Suchanfragen nutzen können.

Die richtige Ergebnis-URL wählen

AliExpress-Suchergebnisse befinden sich unter /w/wholesale-<keyword>.html. Tauschen Sie das Keyword in diesem Pfad aus, um eine andere Suchanfrage zu scrapen, und verwenden Sie eine regionale Subdomain (z. B. eine länderspezifische), wenn Sie Preise und Versand in einem bestimmten Gebietsschema wünschen. Halten Sie die Slug-URL sicher, indem Sie mehrteilige Keywords mit Bindestrichen verbinden.

Daten in eine JSON-Datei speichern

Die Ausgabe auf der Konsole ist gut für die Iteration, aber Sie möchten die Ergebnisse auf der Festplatte. Fügen Sie einige Zeilen hinzu, um das geparste Dictionary in eine Datei zu schreiben, damit Sie es später analysieren oder in eine Pipeline laden können.

python
import requests
import json

username = "USER_TOKEN"
password = ""
proxy_auth = f"{username}:{password}"

url = "https://www.aliexpress.com/w/wholesale-macbook-pro.html"
proxy_url = f"http://{proxy_auth}@smartproxy.crawlbase.com:8012"
proxies = {"http": proxy_url, "https": proxy_url}
headers = {"CrawlbaseAPI-Parameters": "scraper=aliexpress-serp"}

response = requests.get(url=url, proxies=proxies, headers=headers, verify=False)
data = json.loads(response.text)

with open("scraped_data.json", "w") as json_file:
    json.dump(data, json_file, indent=4)

print("Saved scraped_data.json")

Die zwei neuen Zeilen erledigen die Arbeit: open(...) erstellt scraped_data.json im Schreibmodus, und json.dump serialisiert das geparste Dictionary hinein. Das ist ein vollständiger, ausführbarer AliExpress-Scraper: Er ruft eine Suchseite über einen rotierenden Proxy ab, parst sie in strukturierte Daten und speichert das Ergebnis.

Den Scraper skalieren

Eine Suchseite ist ein Demo-Beispiel. Ein echter Job läuft über viele Keywords oder Seiten hinweg und muss zuverlässig und innerhalb der Toleranz der Website bleiben. Einige Praktiken bringen das Skript von einem einzelnen Durchlauf zu einem Produktions-Job.

  • Viele Suchanfragen in einer Schleife abarbeiten. Verpacken Sie den Abruf in eine Funktion, die ein Keyword entgegennimmt, bauen Sie die /w/wholesale-<keyword>.html-URL daraus auf und iterieren Sie über eine Liste von Suchbegriffen, wobei Sie die Zeilen fortlaufend sammeln.
  • Nebenläufigkeit nutzen. Das sequentielle Abrufen einer URL nach der anderen ist langsam. Senden Sie Anfragen parallel mit concurrent.futures, oder wechseln Sie zu asyncio und aiohttp für höheren Durchsatz. Der Smart AI Proxy rotiert IPs pro Anfrage, sodass Nebenläufigkeit die Last nicht auf eine Adresse konzentriert.
  • Fehler elegant behandeln. Verpacken Sie jede Anfrage in ein try/except, prüfen Sie response.status_code vor dem Parsen und fügen Sie einen Retry mit Backoff für vorübergehende Fehler hinzu, damit eine schlechte Antwort nicht den gesamten Durchlauf zum Absturz bringt.
  • Bei großen Mengen eine echte Datenbank verwenden. Flache JSON-Dateien sind für den Anfang gut, aber für große Datensätze schreiben Sie Zeilen in eine Datenbank wie PostgreSQL oder MySQL mit geeigneter Indizierung.

Die Rotation ist der einzige Teil, den Sie nicht selbst aufbauen müssen, da der Smart AI Proxy jeder Anfrage eine neue IP aus seinem Pool zuweist. Das umfassendere Vorgehen zum Unblockiertbleiben im großen Maßstab finden Sie unter Websites scrapen ohne blockiert zu werden.

Ob das Scrapen von AliExpress erlaubt ist, hängt von den Nutzungsbedingungen der Plattform, Ihrer Gerichtsbarkeit und dem ab, was Sie mit den Daten machen. AliExpress's Bedingungen schränken automatisierten Zugriff ein, sodass Scraping unabhängig davon, wie sorgfältig Ihr Tooling ist, gegen diese Bedingungen verstoßen kann. Keiner der hier gezeigten Code-Schnipsel ändert das; er macht nur den technischen Teil funktionsfähig.

Ein paar Grenzen, an denen Sie festhalten sollten. Sammeln Sie nur öffentliche Daten: Produkttitel, Preise, Bilder, Versandhinweise und Bewertungen, die jeder auf einer Suchseite ohne Konto sehen kann. Respektieren Sie die robots.txt der Website und ihre erklärten Ratenerwartungen, und halten Sie Ihr Anfragevolumen niedrig genug, dass Sie niemandes Server nicht belasten. Wenn Sie planen, die Daten kommerziell zu nutzen, holen Sie sich eine Erlaubnis oder eine offizielle Datenvereinbarung, anstatt Schweigen als Zustimmung zu betrachten. Und sammeln Sie niemals personenbezogene Daten, einschließlich alles, was mit individuellen Käufer- oder Verkäufer-Konten verknüpft ist.

Dieser Leitfaden beschränkt sich bewusst auf öffentliche Angebotsdaten, weil das die Linie ist, die die Arbeit vertretbar hält. Er deckt nichts hinter einem Login ab, keine Konto- oder Profildaten, keine Nachrichten, keinen Bestellverlauf oder Aktionen, die die Authentifizierung umgehen. Wenn Ihr Projekt mehr als öffentliche Angebote benötigt, ist eine offizielle API oder eine Datenvereinbarung mit der Plattform der richtige Weg, kein clevererer Scraper.

Zusammenfassung

Wichtigste Erkenntnisse

  • AliExpress blockiert Scraper schnell. IP-Sperren, CAPTCHAs und Bot-Erkennung machen eine einzelne statische IP unbrauchbar, also leiten Sie Anfragen über einen rotierenden Proxy.
  • Der Smart AI Proxy ist ein Drop-in-Endpunkt. Richten Sie Ihre requests-Aufrufe auf eine einzelne Proxy-URL, und er rotiert IPs und leitet serverseitig an die Crawling API weiter, ohne Code-Umschreibung.
  • Selektoren mit dem integrierten Parser überspringen. Senden Sie scraper=aliexpress-serp im CrawlbaseAPI-Parameters-Header, und der Proxy gibt sauberes, strukturiertes JSON statt rohem HTML zurück.
  • Speichern und skalieren. Ergebnisse in JSON oder eine Datenbank persistieren, dann Keywords in einer Schleife abarbeiten, Nebenläufigkeit hinzufügen und Fehler behandeln, um von einer Demo zu einem Produktions-Job zu gelangen.
  • Bleiben Sie bei öffentlichen Daten. Respektieren Sie AliExpress's ToS und robots.txt; keine Konten, keine personenbezogenen Daten, keine Authentifizierungsumgehungen.

Häufig gestellte Fragen

Warum benötige ich einen Proxy, um AliExpress zu scrapen?

AliExpress blockiert automatisierten Datenverkehr mit IP-Sperren, CAPTCHAs und Bot-Erkennung, sodass eine einzelne statische IP bei nennenswerten Mengen fast sofort gedrosselt oder gesperrt wird. Ein rotierender Proxy gibt jeder Anfrage eine andere echte Nutzer-IP, sodass keine einzelne Adresse ein Ratenlimit auslöst oder hinter einer Herausforderung feststeckt. Der Crawlbase Smart AI Proxy übernimmt diese Rotation für Sie hinter einem einzigen Endpunkt.

Was ist der Unterschied zwischen dem Smart AI Proxy und der Crawling API?

Beide erreichen dasselbe Crawlbase-Crawling-Backend; sie unterscheiden sich in der Integration. Der Smart AI Proxy ist ein Proxy-Endpunkt, den Sie in jedes Tool einsetzen, das HTTP-Proxys versteht, sodass bestehender Code unverändert funktioniert. Die Crawling API ist eine HTTP-API, die Sie direkt aufrufen, wenn Sie neuen Code schreiben. Dieser Leitfaden verwendet den Smart AI Proxy, weil der Scraper ein Standard-Python-requests-Skript ist.

Wie erhalte ich strukturierte Daten statt rohem HTML?

Senden Sie den Parameter scraper=aliexpress-serp in einem CrawlbaseAPI-Parameters-Anfrage-Header. Da der Smart AI Proxy an die Crawling API weiterleitet, führt das Crawlbase's integrierten AliExpress-Suchparser aus und gibt sauberes JSON mit Titel, Preis, URL, Bild, Versandhinweis und Verkaufsanzahl jedes Produkts zurück, sodass Sie niemals CSS-Selektoren schreiben oder warten müssen.

Warum muss ich die SSL-Verifizierung mit dem Proxy deaktivieren?

Das Tunneln von HTTPS-Datenverkehr durch den Smart AI Proxy erfordert das Überspringen der lokalen Zertifikatsprüfung, das ist das Flag -k in curl und verify=False in Python-requests. Ohne es kann der Handshake zwischen Ihrem Client und dem Proxy fehlschlagen. Für einen langlebigen Produktions-Dienst konfigurieren Sie die Zertifikatshandhabung korrekt, anstatt die Prüfung vollständig zu deaktivieren.

Kann ich den Smart AI Proxy für andere Websites als AliExpress verwenden?

Ja. Der Smart AI Proxy ist ein allgemeiner rotierender Proxy-Endpunkt, der für die meisten öffentlichen Websites funktioniert, nicht nur für AliExpress. Der Parser scraper=aliexpress-serp ist AliExpress-spezifisch, aber der Proxy selbst routet Anfragen an jedes Ziel. Andere Websites haben eigene Parser, oder Sie können rohes HTML abrufen und selbst parsen.

Das hängt von AliExpress's Nutzungsbedingungen, Ihrer Gerichtsbarkeit und Ihrem Zweck ab, und deren Bedingungen schränken automatisierten Zugriff ein. Bleiben Sie strikt bei öffentlichen Angebotsdaten, respektieren Sie robots.txt und Ratenerwartungen, und berühren Sie niemals Konten, personenbezogene Daten oder Aktionen, die die Authentifizierung umgehen. Für kommerzielle Nutzung holen Sie sich eine Erlaubnis oder eine offizielle Datenvereinbarung, anstatt auf einen Scraper zu setzen.

Jetzt loslegen

Crawlen Sie jede Website im großen Maßstab, ohne gegen die Infrastruktur zu kämpfen.

Crawlbase übernimmt Proxys, Fingerprints und CAPTCHAs, damit Ihr Team Datenpipelines ausliefert, statt Crawl-Infrastruktur zu pflegen. 1.000 Anfragen kostenlos, keine Karte erforderlich.

Self-Service · Kein Verkaufsgespräch erforderlich · Enterprise-Crawl-Volumen verfügbar