AliExpress ist einer der größten Marktplätze im Web, und eine einzige Suchergebnisseite enthält genau die Daten, die Preisverfolgung, Produktrecherche und Lieferantensuche antreiben: einen Produkttitel, seinen Preis, eine Verkäuferbewertung, eine Bestell- oder Verkaufszahl und einen Link zurück zum Angebot. Erfassen Sie das über ein Keyword hinweg, und Sie erhalten einen strukturierten Überblick darüber, was sich verkauft, zu welchem Preis und wie gut es bewertet ist, alles aus öffentlichen Angebotsdaten.
Diese Anleitung zeigt Ihnen, wie Sie AliExpress-Suchseiten scrapen, und zwar mit JavaScript und Node.js. Sie bauen einen kleinen, lauffähigen Scraper, der ein Keyword in eine AliExpress-Such-URL umwandelt, die gerenderte Ergebnisseite über die Crawling API abruft, jede Produktkarte mit cheerio parst, die Paginierung durchläuft und die Zeilen nach JSON und CSV exportiert. Wir halten die gesamte Anleitung auf öffentliche Such- und Angebotsdaten beschränkt, und der Abschnitt zur Rechtslage gegen Ende ist kein Standardtext, lesen Sie ihn also, bevor Sie das auf reale Mengen ansetzen.
Was Sie bauen werden
Ein Node.js-Skript, das ein Such-Keyword entgegennimmt, die AliExpress-Such-URL aufbaut, das gerenderte HTML über die Crawling API abruft und für jedes Produkt auf der Ergebnisseite einen strukturierten Datensatz extrahiert. Wir erfassen diese Felder pro Karte, denselben Satz, den der frühere AliExpress-SERP-Scraper zurückgab:
- Titel der Produktname wie gelistet, zum Beispiel "Wireless Bluetooth Earbuds Noise Cancelling".
- Preis der aktuelle Preis wie auf der Karte angezeigt, etwa "$12.96".
- Bewertung der Verkäufer- oder Produktbewertungswert, zum Beispiel "4.9".
- Bestellungen die Bestell- oder Verkaufszahl, etwa "600 sold".
- Produkt-URL der Link zur einzelnen Artikelseite.
Warum eine einfache Anfrage bei AliExpress scheitert
Wenn Sie eine AliExpress-Such-URL mit einem nackten HTTP-Client anfragen, erhalten Sie eine Antwort mit Status 200 und sehr wenig brauchbaren Produktdaten im Body. Zwei Dinge arbeiten gegen Sie. Erstens baut AliExpress seine Suchergebnisse im Browser mit JavaScript auf, sodass das anfängliche HTML eine nahezu leere Hülle ist, bis die Skripte der Seite laufen und das Produktraster rendern. Zweitens markiert AliExpress automatisierten Traffic schnell: Rechenzentrums-IPs und Anfragemuster, die nicht wie ein echter Browser aussehen, werden mit Challenges, Rate-Limits oder einem CAPTCHA konfrontiert, bevor sie überhaupt die gerenderten Angebote erreichen.
Ein funktionierender AliExpress-Suchscraper braucht also zwei Dinge in einer Anfrage: einen Browser, der die Seite tatsächlich rendert, und eine IP, die die Plattform als echten Besucher liest. Sie können das selbst mit einem Headless-Browser plus einem Pool rotierender Residential-Proxys zusammenstellen, aber diese zusammenzufügen und gesund zu halten ist der Großteil der Arbeit. Die Crawling API fasst beides in einem einzigen Aufruf zusammen: Sie senden ihr die URL mit einem JavaScript-Token, sie rendert die Seite hinter einer vertrauenswürdigen IP und gibt Ihnen fertiges HTML zum Parsen zurück.
Crawlbase bietet zwei Token-Typen an. Das normale Token holt statisches HTML; das JavaScript-Token (JS) rendert die Seite zuerst in einem echten Browser. AliExpress baut sein Produktraster clientseitig auf, daher liefert Ihnen das JS-Token hier die vollständigste Seite. Das normale Token kann eine Hülle ohne Produkte zurückgeben, sodass Ihnen nichts zum Parsen bleibt.
Voraussetzungen
Sie brauchen ein paar Dinge, bevor Sie Code schreiben. Keines davon dauert lange.
Grundlagen in JavaScript und Node.js. Sie sollten sicher darin sein, ein Node-Skript zu schreiben und auszuführen und Pakete mit npm zu installieren. Wenn Sie neu bei Node sind, deckt die Anleitung dazu, wie man einen Web-Scraper mit Node.js baut, die Grundlagen ab, die dieses Tutorial voraussetzt.
Node.js 16 oder neuer. Prüfen Sie Ihre Version mit node --version. Falls Sie es nicht haben, installieren Sie es von der Node.js-Website oder über einen Versionsmanager wie nvm.
Ein Crawlbase-Konto und JS-Token. Melden Sie sich an, öffnen Sie Ihr Dashboard und kopieren Sie Ihr JavaScript-Token (JS) von der Account-Docs-Seite. Behandeln Sie das Token wie ein Passwort: Es authentifiziert Ihre Anfragen, halten Sie es also aus der Versionskontrolle heraus.
Das Projekt einrichten
Erstellen Sie einen Projektordner, initialisieren Sie ihn und installieren Sie die zwei Bibliotheken, die der Scraper braucht.
node --version mkdir aliexpress-search-scraper && cd aliexpress-search-scraper npm init -y npm install crawlbase cheerio
Zwei Abhängigkeiten erledigen die Arbeit: crawlbase ist der offizielle Node-Client für die Crawling API, und cheerio parst das zurückgegebene HTML mit einer API im jQuery-Stil, sodass Sie einzelne Felder per CSS-Selektor herausziehen können. Wenn Selektoren neu für Sie sind, ist die Einführung zu XPath und CSS-Selektoren ein guter Begleiter.
Schritt 1: Die Such-URL aus einem Keyword bauen
AliExpress verwandelt eine Keyword-Suche in eine vorhersehbare URL. Der Wholesale-Suchpfad nimmt das Keyword mit durch Bindestriche ersetzten Leerzeichen, genau die Transformation, die der frühere Scraper verwendete. Verpacken Sie das in einen kleinen Helfer, sodass jedes Keyword zu einer gültigen Such-URL wird.
function searchUrl(keyword, page = 1) { const slug = keyword.trim().split(' ').join('-'); return `https://www.aliexpress.com/w/wholesale-${slug}.html?page=${page}`; } console.log(searchUrl('wireless earbuds')); // https://www.aliexpress.com/w/wholesale-wireless-earbuds.html?page=1
Der Parameter page ist das, was Sie später erhöhen, um die Paginierung zu durchlaufen. Vorerst bleibt er bei 1, damit Sie eine einzelne Seite zum Laufen bringen können, bevor Sie hochskalieren.
Schritt 2: Die gerenderte Suchseite abrufen
Holen Sie als Nächstes die fertige Seite. Importieren Sie die Klasse CrawlingAPI, initialisieren Sie sie mit Ihrem JS-Token und fragen Sie die Such-URL an. Den Statuscode vor dem Parsen zu prüfen hält Fehler laut statt still.
const { CrawlingAPI } = require('crawlbase'); const api = new CrawlingAPI({ token: 'YOUR_CRAWLBASE_TOKEN' }); async function crawl(pageUrl) { const options = { ajax_wait: 'true', page_wait: 5000 }; const response = await api.get(pageUrl, options); if (response.statusCode === 200) { return response.body; } console.error(`Request failed: ${response.statusCode}`); return null; } crawl(searchUrl('wireless earbuds')).then((html) => { console.log(html ? html.slice(0, 500) : 'No HTML returned'); });
Die zwei Wait-Optionen sind für ein clientseitig gerendertes Ziel wie dieses entscheidend. ajax_wait weist die API an, auf das Fertigladen asynchroner Inhalte zu warten, und page_wait hält eine feste Anzahl Millisekunden nach dem Laden inne, damit das spät rendernde Produktraster erscheint, bevor die Seite erfasst wird. Fünf Sekunden sind ein vernünftiger Anfang; erhöhen Sie ihn, wenn Produkte leer zurückkommen. Führen Sie das Skript mit node scraper.js aus, und Sie sollten echtes Produkt-Markup sehen, keine abgespeckte Hülle. Das bestätigt, dass das Rendering funktioniert, bevor Sie einen einzigen Selektor schreiben.
AliExpress baut sein Produktraster clientseitig auf und konfrontiert Scraper-Traffic mit Challenges, daher brauchen Sie eine gerenderte Seite hinter einer vertrauenswürdigen IP in einem Aufruf. Die Crawling API nimmt ein JS-Token, führt die Seite in einem echten Browser aus, rotiert serverseitig durch Residential-IPs und händigt Ihnen fertiges HTML aus, sodass Sie sich das Betreiben einer Headless-Flotte und eines Proxy-Pools sparen. Richten Sie sie zuerst im kostenlosen Tarif auf eine öffentliche Suchseite.
Schritt 3: Jedes Produkt mit cheerio parsen
Mit gerendertem HTML in der Hand laden Sie es in cheerio und durchlaufen die Produktkarten. AliExpress legt jedes Suchergebnis in einer sich wiederholenden Karte an, sodass Sie jede Karte auswählen und dann Titel, Preis, Bewertung, Bestellungen und den Artikellink aus ihrem Inneren auslesen. Jedes Feld defensiv auszulesen verhindert, dass ein einziger fehlender Wert den Lauf zum Absturz bringt.
const cheerio = require('cheerio'); function parseSearch(html) { const $ = cheerio.load(html); const items = []; $('a.search-card-item').each((_, el) => { const card = $(el); const title = card.find('[title]').first().attr('title'); if (!title) return; const href = card.attr('href') || ''; const url = href.startsWith('//') ? `https:${href}` : href; items.push({ title: title.trim(), price: card.find('.multi--price-sale--U-S0jtj').text().trim() || null, rating: card.find('.multi--starList--Fh2vqvr').attr('aria-label') || null, orders: card.find('.multi--trade--Ktbl2jB').text().trim() || null, url: url || null, }); }); return items; }
Ein paar Details halten das robust. Der Titel wird aus dem Attribut title der Karte gelesen statt aus ihrem Text, da AliExpress den sichtbaren Namen kürzt, aber den vollständigen String im Attribut behält. Die Produkt-URL bei AliExpress ist oft protokollrelativ (sie beginnt mit //), daher stellt der Helfer https: voran, um sie absolut zu machen, was die frühere Ausgabe widerspiegelt, in der nackte https:-Links eine bekannte Schwachstelle waren. Jedes Feld fällt auf null zurück, wenn das Element fehlt, was häufig ist, da nicht jede Karte eine Bewertung oder eine Bestellzahl anzeigt.
AliExpress hasht seine Klassennamen (multi--price-sale--U-S0jtj, multi--starList--Fh2vqvr und den Rest) und generiert diese Hashes bei Deploys neu, sodass sie sich ohne Vorwarnung ändern. Behandeln Sie die obigen Selektoren als Ausgangsvorlage, nicht als Vertrag. Wenn ein Feld als null zurückkommt, inspizieren Sie die Live-Seite erneut in den Dev-Tools Ihres Browsers und aktualisieren Sie den Selektor. Regelmäßige Selektorpflege ist für jeden Produktions-Scraper normal, kein Zeichen dafür, dass etwas kaputt ist.
Schritt 4: Alles zusammenfügen
Verdrahten Sie nun den URL-Builder, den Abruf und das Parsen zu einem lauffähigen Skript. Bauen Sie die URL, rufen Sie das gerenderte HTML ab, übergeben Sie es dem Parser und geben Sie die strukturierten Datensätze aus.
const { CrawlingAPI } = require('crawlbase'); const cheerio = require('cheerio'); const api = new CrawlingAPI({ token: 'YOUR_CRAWLBASE_TOKEN' }); function searchUrl(keyword, page = 1) { const slug = keyword.trim().split(' ').join('-'); return `https://www.aliexpress.com/w/wholesale-${slug}.html?page=${page}`; } async function crawl(pageUrl) { const options = { ajax_wait: 'true', page_wait: 5000 }; const response = await api.get(pageUrl, options); if (response.statusCode === 200) return response.body; console.error(`Request failed: ${response.statusCode}`); return null; } function parseSearch(html) { const $ = cheerio.load(html); const items = []; $('a.search-card-item').each((_, el) => { const card = $(el); const title = card.find('[title]').first().attr('title'); if (!title) return; const href = card.attr('href') || ''; const url = href.startsWith('//') ? `https:${href}` : href; items.push({ title: title.trim(), price: card.find('.multi--price-sale--U-S0jtj').text().trim() || null, rating: card.find('.multi--starList--Fh2vqvr').attr('aria-label') || null, orders: card.find('.multi--trade--Ktbl2jB').text().trim() || null, url: url || null, }); }); return items; } async function main() { const html = await crawl(searchUrl('wireless earbuds')); if (!html) return; const items = parseSearch(html); console.log(JSON.stringify(items.slice(0, 3), null, 2)); } main();
Wie die Ausgabe aussieht
Führen Sie das vollständige Skript mit node scraper.js aus, und Sie erhalten ein sauberes Array von Datensätzen, einen pro Produkt, bereit zum Schreiben nach JSON, CSV oder in eine Datenbank.
[ { "title": "Wireless Bluetooth Earbuds Noise Cancelling Touch Control", "price": "$12.96", "rating": "4.9", "orders": "600 sold", "url": "https://www.aliexpress.com/item/1005005690275912.html" }, { "title": "TWS Gaming Earphones Low Latency Long Battery Life", "price": "$8.31", "rating": "4.7", "orders": "2000 sold", "url": "https://www.aliexpress.com/item/1005005123456789.html" } ]
Durch die Ergebnisseiten schleifen
Eine Ergebnisseite ist eine Demo; ein echter Job durchläuft die Paginierung. AliExpress macht die Seitennummer über den Query-Parameter page zugänglich, den der Helfer searchUrl bereits akzeptiert, sodass Sie jede Seiten-URL in einer Schleife bauen, sie über die Crawling API abrufen, sie mit derselben Funktion parsen und die Zeilen sammeln. Da jede Ergebnisseite dieselbe Kartenstruktur teilt, funktioniert der bereits geschriebene Parser über alle hinweg ohne Änderungen.
async function scrapePages(keyword, totalPages) { const all = []; for (let page = 1; page <= totalPages; page++) { const html = await crawl(searchUrl(keyword, page)); if (html) all.push(...parseSearch(html)); } return all; } scrapePages('wireless earbuds', 3).then((rows) => { console.log(`Collected ${rows.length} products`); });
Um jede Zeile mit vollständigen Details anzureichern (jedes Bild, die vollständige Beschreibung, Versandoptionen und das komplette Verkäuferprofil), nehmen Sie die url aus jeder Karte und rufen die einzelne Artikelseite über dieselbe Funktion crawl ab, dann schreiben Sie einen kleinen Parser für das Produktlayout. Das Muster ist identisch: rendern, dann parsen. Für die Produktseiten-Variante dieser Arbeit in einer anderen Sprache sehen Sie sich an, wie man AliExpress-Produkte mit Python scrapt.
Nach JSON und CSV exportieren
Zeilen im Speicher zu sammeln ist für eine Demo in Ordnung, aber meist möchten Sie sie auf der Festplatte haben. Das eingebaute Modul fs von Node schreibt JSON in einer Zeile, und ein winziger Helfer verwandelt dasselbe Array in CSV für Tabellenkalkulationen oder einen schnellen Import.
const fs = require('fs'); function toCsv(rows) { const headers = ['title', 'price', 'rating', 'orders', 'url']; const escape = (v) => `"${(v ?? '').toString().replace(/"/g, '""')}"`; const lines = rows.map((r) => headers.map((h) => escape(r[h])).join(',')); return [headers.join(','), ...lines].join('\n'); } scrapePages('wireless earbuds', 3).then((rows) => { fs.writeFileSync('aliexpress-products.json', JSON.stringify(rows, null, 2)); fs.writeFileSync('aliexpress-products.csv', toCsv(rows)); console.log(`Saved ${rows.length} products to JSON and CSV`); });
Der CSV-Helfer setzt jedes Feld in Anführungszeichen und verdoppelt eingebettete Anführungszeichen, was verhindert, dass Produkttitel mit Kommas darin das Spaltenlayout zerstören. Von hier aus speist das JSON eine Datenbank oder ein Notebook, und das CSV öffnet sich direkt in einer Tabellenkalkulation für einen schnellen Preisüberblick.
Ungeblockt bleiben
Selbst wenn das Rendering erledigt ist, wacht AliExpress über scraperförmigen Traffic. Ein paar Gewohnheiten halten einen Lauf gesund, und sie gelten für jedes schwierige kommerzielle Ziel.
- Drosseln Sie Ihre Anfragen. Seiten in einer engen Schleife zu bombardieren ist der schnellste Weg, gedrosselt oder mit einem CAPTCHA konfrontiert zu werden. Verteilen Sie Anfragen und variieren Sie Ihre Keywords, statt einen Pfad mit Vollgas zu crawlen.
- Setzen Sie auf Rotation. Ein Pool von Residential-IPs verteilt Anfragen auf viele Adressen echter Nutzer, sodass keine einzelne ein Rate-Limit auslöst. Die Crawling API erledigt das für Sie; wenn Sie Ihren eigenen Stack bauen, ist das der Teil, den Sie richtig hinbekommen müssen.
- Lesen Sie die Statuscodes. Ein Lauf, der anfängt, Challenges oder Fehler zurückzugeben, sagt Ihnen, dass die aktuelle Rate oder IP-Stufe nicht mehr ausreicht. Behandeln Sie das als Signal, sich zurückzunehmen, nicht als Lärm, den Sie ignorieren.
Für das umfassendere Playbook sehen Sie sich an, wie man Websites scrapt, ohne geblockt zu werden. Wenn Sie Ihren eigenen Traffic lieber durch einen rotierenden Pool leiten als die verwaltete API zu nutzen, gibt Ihnen der Smart AI Proxy dieselbe Residential-IP-Rotation als Drop-in-Proxy-Endpunkt; der proxy-orientierte Blick auf genau diese Seite wird in AliExpress-Proxy-Scraping behandelt. AliExpress ist auch ein häufiges Ziel für umfassendere E-Commerce-Web-Scraping-Arbeit, bei der dasselbe Abrufen-dann-Parsen-Muster über Seiten hinweg trägt, und die Preisfelder, die Sie hier sammeln, fließen direkt in Preisintelligenz ein.
Ist es legal, AliExpress zu scrapen?
Ob das Scrapen von AliExpress erlaubt ist, hängt von den Nutzungsbedingungen von AliExpress, Ihrer Jurisdiktion und davon ab, was Sie mit den Daten tun. Die Bedingungen von AliExpress schränken automatisierten Zugriff ein, sodass Scraping diesen Bedingungen zuwiderlaufen kann, unabhängig davon, wie sorgfältig Ihr Werkzeug ist. Nichts vom Code hier ändert das; er bringt nur den technischen Teil zum Funktionieren. Lesen Sie die Nutzungsbedingungen von AliExpress und seine robots.txt, und behandeln Sie beide als Grenze für das, was Sie erfassen.
Ein paar Leitlinien, an die es sich zu halten lohnt. Erfassen Sie nur öffentliche Suchdaten: den Produkttitel, Preis, die Bewertung, Bestellzahl und den Artikellink, die jeder ohne Konto sehen kann. Respektieren Sie die von AliExpress angegebenen Rate-Erwartungen und halten Sie Ihr Anfragevolumen niedrig genug, dass Sie seine Server nicht belasten. Vermeiden Sie persönliche Daten, einschließlich allem, was mit identifizierbaren Käufern oder Verkäufern verknüpft ist, über den öffentlichen Shop-Namen auf einer Karte hinaus, und verbreiten Sie nicht die Produktbilder oder Beschreibungen im großen Stil weiter, da diese die urheberrechtlich geschützten Medien der Verkäufer sind. Wenn Sie die Daten kommerziell weiterverwenden wollen, holen Sie eine Erlaubnis oder eine offizielle Vereinbarung ein, statt anzunehmen, dass Schweigen Zustimmung ist.
Für Volumen oder kommerzielle Nutzung bietet AliExpress über seinen Mutterkonzern Alibaba eine offizielle Affiliate- und Open-Platform-API an, und das ist das richtige Werkzeug, wenn Sie große Mengen, garantierte Struktur oder kommerzielle Rechte brauchen. Diese Anleitung ist bewusst auf öffentliche Such- und Angebotsseiten beschränkt, weil das die Linie ist, die die Arbeit vertretbar hält. Sie behandelt nichts hinter einem Login, keine persönlichen Käufer- oder Verkäuferdaten, keine privaten Nachrichten zwischen Nutzern, keine durch eine Anmeldung gesperrten Bestell- oder Kontodaten und keinen Versuch, eine Authentifizierung zu umgehen. Wenn Ihr Projekt mehr als öffentliche Angebote braucht, ist die offizielle API oder eine Datenvereinbarung der korrekte Weg, nicht ein cleverer Scraper.
Wichtigste Erkenntnisse
- AliExpress baut sein Raster clientseitig auf. Eine einfache Anfrage gibt eine leere Hülle zurück, also müssen Sie die Suchseite rendern, bevor Sie sie parsen.
-
Sie brauchen Rendering und eine vertrauenswürdige IP zusammen. Die Crawling API mit einem JS-Token erledigt beides in einem Aufruf;
ajax_waitundpage_waitsteuern, wie lange sie auf das Produktraster wartet. - cheerio erledigt die Extraktion. Wählen Sie jede Suchkarte aus, ordnen Sie dann Titel, Preis, Bewertung, Bestellungen und die Produkt-URL aktuellen Selektoren zu, und rechnen Sie damit, dass die gehashten Klassennamen von AliExpress driften.
-
Skalieren Sie, indem Sie den page-Parameter durchschleifen. Der Query-Parameter
pagedurchläuft die Ergebnisseiten, und derselbe Parser funktioniert über jede Seite hinweg, dann exportieren Sie die Zeilen nach JSON und CSV. - Bleiben Sie bei öffentlichen Daten. Respektieren Sie die ToS und robots.txt von AliExpress, bevorzugen Sie die offizielle Alibaba-API für Volumen oder kommerzielle Nutzung, und fassen Sie niemals Logins, persönliche Daten oder urheberrechtlich geschützte Medien an, die Sie weiterverbreiten würden.
Häufig gestellte Fragen
Warum gibt eine einfache Anfrage keine Produkte von AliExpress zurück?
Weil AliExpress seine Suchergebnisse im Browser mit JavaScript aufbaut. Das anfängliche HTML ist eine nahezu leere Hülle, bis die Skripte der Seite laufen und das Produktraster rendern, sodass eine reine HTTP-Anfrage Status 200 ohne brauchbare Produktdaten zurückgibt. Um eine vollständige Seite zu erhalten, müssen Sie sie zuerst rendern, was das JS-Token der Crawling API für Sie übernimmt.
Brauche ich für AliExpress das normale Token oder das JS-Token?
Verwenden Sie das JS-Token. Das normale Token holt statisches HTML, das bei AliExpress ohne Produkte zurückkommt. Das JS-Token rendert die Seite in einem echten Browser, bevor es das HTML zurückgibt, sodass die Produktkarten vorhanden sind, wenn cheerio sie parst.
Wie scrape ich mehrere Seiten von AliExpress-Suchergebnissen?
AliExpress macht die Seitennummer über den Query-Parameter page auf der Wholesale-Such-URL zugänglich. Erhöhen Sie ihn in einer Schleife, rufen Sie jede Seite über die Crawling API ab und führen Sie denselben Parser über jede Seite aus. Die Kartenstruktur ist über alle Seiten hinweg identisch, sodass ein Parser alle Zeilen sammelt, die Sie dann nach JSON oder CSV schreiben.
Meine Selektoren geben null zurück. Was hat sich geändert?
Mit ziemlicher Sicherheit das Markup von AliExpress. Seine Produktkarten verwenden gehashte Klassennamen wie multi--price-sale--U-S0jtj, die die Seite bei Deploys neu generiert, sodass Selektoren, die letzten Monat funktionierten, brechen können. Inspizieren Sie eine Live-Seite erneut in den Dev-Tools Ihres Browsers und aktualisieren Sie die Selektoren. Regelmäßige Selektorpflege ist für jeden Produktions-Scraper normal.
Kann ich persönliche Käufer- oder Verkäuferdaten von AliExpress scrapen?
Nein, und diese Anleitung behandelt das nicht. Käuferdetails, private Nachrichten und Kontodaten sitzen hinter einem Login, also sind sie keine öffentlichen Daten. Der öffentliche Shop-Name auf einer Produktkarte ist in Ordnung zu erfassen, aber das Scrapen von durch Login gesperrten Inhalten, persönlichen Daten oder das Umgehen der Authentifizierung, um sie zu erreichen, liegt hier außerhalb des Geltungsbereichs und läuft den Bedingungen von AliExpress zuwider. Für genehmigten Zugriff ist der korrekte Weg die offizielle Alibaba-API oder eine Lizenzvereinbarung.
Sollte ich die offizielle API nutzen oder die Seite scrapen?
Wenn Sie Volumen, garantierte Struktur oder kommerzielle Weiterverwendungsrechte brauchen, nutzen Sie die offizielle Alibaba-Open-Platform- oder Affiliate-API. Sie ist dafür gebaut und hält Sie auf der richtigen Seite der Bedingungen von AliExpress. Öffentliche Suchseiten mit dem Ansatz in dieser Anleitung zu scrapen passt zu kleinerer Recherche mit öffentlichen Daten, bei der kein API-Zugang vorhanden ist, solange Sie die ToS, robots.txt und Rate-Limits respektieren.
Crawlen Sie jede Website im großen Maßstab, ohne gegen die Infrastruktur zu kämpfen.
Crawlbase übernimmt Proxys, Fingerprints und CAPTCHAs, damit Ihr Team Datenpipelines ausliefert, statt Crawl-Infrastruktur zu pflegen. 1.000 Anfragen kostenlos, keine Karte erforderlich.

