Eine Produktseite zu scrapen ist ein Tutorial. Einige Millionen davon zu scrapen, jeden Tag, ohne dass Ihre Pipeline zum Stillstand kommt, ist ein Systemproblem. Large Scale E-Commerce Scraping betreibt Preisüberwachung, Katalog- und Sortimentsverfolgung, Wettbewerber-Benchmarking und Nachfragesignale: die Art der Analyse, die das gesamte Regal benötigt, nicht eine Stichprobe. Der Sprung von Hunderten von Seiten zu Millionen fügt nicht nur Arbeit hinzu, er verändert, was schiefgehen kann und wie man bauen muss.

Dieser Leitfaden beschränkt sich auf öffentliche Daten: Produktlistings, Preise, Verfügbarkeit, Bewertungen und Rezensionszahlen, die jeder ohne Login einsehen kann. Er behandelt keine Nutzerkonten, Warenkörbe, Bestellungen oder persönliche Daten. Wir werden durchgehen, warum Teams das tun, welche Herausforderungen nur bei Volumen auftreten, und eine Architektur, die standhält, mit der Crawlbase Crawling API, dem asynchronen Crawler und dem Smart AI Proxy als Skalierungsschicht.

Warum E-Commerce in großem Maßstab scrapen

Eine einzelne Produktseite sagt Ihnen, wie ein Preis gerade aussieht. Der Wert bei Skalierung kommt aus Breite und Geschichte: Tausende von SKUs, die über viele Händler hinweg verfolgt werden und häufig genug abgetastet werden, um Bewegungen zu sehen. Das ist es, was rohe Listings in Entscheidungen verwandelt. Vier Anwendungsfälle treiben die meisten Large Scale E-Commerce Scraping-Arbeiten an.

  • Preisüberwachung. Verfolgen Sie Wettbewerberpreise über einen Katalog hinweg im Laufe der Zeit, damit Sie neu bepreisen, Aktionen erkennen und Untergebote am Tag des Geschehens statt eine Woche später bemerken können.
  • Katalog- und Sortimentsverfolgung. Kartieren Sie, welche Produkte ein Händler führt, was auf Lager ist und wie Listings beschrieben werden, damit Sie Lücken in Ihrem eigenen Sortiment finden und beobachten können, wie Wettbewerber in neue Kategorien expandieren.
  • Wettbewerber-Benchmarking. Vergleichen Sie Ihre Preise, Bewertungen und Rezensionsgeschwindigkeit mit Konkurrenten bei denselben SKUs, um zu sehen, wo Sie gewinnen und wo Sie die Buy Box verlieren.
  • Nachfragesignale. Rezensionszahlen, Bewertungstrends und Lagerumschlag sind öffentliche Stellvertreter dafür, was sich verkauft. Sie über viele Geschäfte hinweg zu beobachten, bringt aufsteigende Produkte an die Oberfläche, bevor sie in Ihren eigenen Verkaufsdaten auftauchen.

Das ist dieselbe Form von Problem wie jede E-Commerce Web Scraping-Aufgabe. Der Unterschied bei Skalierung ist rein quantitativ, und Volumen ist genau dort, wo die einfachen Ansätze versagen.

Was sich ändert, wenn man von Hunderten zu Millionen von Seiten geht

Ein Skript, das ein paar hundert Seiten auf Ihrem Laptop scrapt, überlebt nicht, wenn es auf ein paar Millionen gerichtet wird. Die folgenden Probleme sind bei kleinem Volumen mild und werden bei großem Maßstab zur gesamten Arbeit.

Volumen und Nebenläufigkeit

Seiten einzeln abzurufen ist gut für eine Demo und hoffnungslos für einen Katalog. Millionen von Seiten bedeuten, dass Sie viele Anfragen gleichzeitig im Flug haben müssen, was Request-Scheduling, Gegendruck und einen Weg erfordert, keine Arbeit zu verlieren, wenn ein Worker mitten in einem Lauf stirbt. Das synchron von einem einzelnen Prozess aus zu tun ist das Erste, was bricht.

Anti-Bot-Abwehr

Große Händler betreiben ausgefeilte Bot-Erkennung. Rechenzentrum-IPs, repetitive Anfragemuster und fehlende Browser-Fingerprints werden mit CAPTCHAs herausgefordert oder direkt blockiert. Je mehr Seiten Sie abrufen, desto mehr Datenverkehr generieren Sie von einer bestimmten Quelle, und desto schneller lösen Sie diese Abwehr aus. Was bei hundert Anfragen funktionierte, bringt Sie bei hunderttausend zum Bann.

IP-Rotation

Die Antwort auf Blockierungen ist das Verteilen von Anfragen auf viele IPs, sodass keine einzelne Adresse missbräuchlich aussieht. Bei kleinem Maßstab reichen ein paar Proxys aus. Bei großem Maßstab benötigen Sie einen tiefen Pool von privaten Proxys und eine Rotationsstrategie, die jede einzelne IP unter den Ratenlimits hält, was echte Infrastruktur zum Aufbauen und Gesundhalten ist.

Frische

Preisdaten sind nur dann nützlich, wenn sie aktuell sind. Ein vollständiger Katalog-Crawl, der drei Tage dauert, gibt Ihnen Preise, die drei Tage veraltet sind, was für die Neubepreisung wertlos ist. Frische zwingt Sie, schnell und nach einem Zeitplan zu crawlen, was den Druck auf Nebenläufigkeit und Anti-Bot noch weiter erhöht.

Datenqualität

Bei Volumen werden ein kleiner Prozentsatz fehlerhafter Seiten, Layout-Varianten und partieller Ladevorgänge zu Tausenden schlechter Zeilen. Site-Strukturen unterscheiden sich zwischen Händlern und ändern sich ohne Vorankündigung, sodass eine Extraktion, die ein Layout angenommen hat, still leere Felder zurückgibt. Ohne Validierung und Monitoring werden Sie es nicht bemerken, bis die schlechten Daten bereits in einem Bericht sind.

Skalierung ist hauptsächlich ein Zuverlässigkeitsproblem

Bei hundert Seiten ist eine Fehlerrate von 5% fünf Wiederholungen, die Sie kaum bemerken. Bei einer Million Seiten sind es fünfzigtausend Fehler, die erkannt, wiederholt und abgeglichen werden müssen, ohne Daten zu verlieren oder doppelt zu zählen. Large Scale E-Commerce Scraping wird weit mehr durch Wiederholungen, Monitoring und Idempotenz gewonnen oder verloren als durch cleveres Parsen.

Die Architektur, die Skalierung bewältigt

Eine Pipeline, die Millionen von Seiten überlebt, teilt sich in vier Stufen auf, von denen jede unabhängig skalieren kann: URLs entdecken, Seiten abrufen, in strukturierte Zeilen parsen und mit Validierung speichern. Sie als ein monolithisches Skript zu behandeln ist das, was kleine Scraper unmöglich zu wachsen macht.

  • URL-Entdeckung. Navigieren Sie durch Kategorie- und Suchseiten, um die Liste der Produkt-URLs zu erstellen, die Sie benötigen. Das ist ein Crawl für sich und der Input für alles Nachgelagerte.
  • Abrufen. Rufen Sie jede URL hinter rotierenden IPs ab, mit Rendering wenn die Seite es benötigt, Wiederholungen bei Fehlern und genug Nebenläufigkeit, um Ihr Frischeziel zu erreichen.
  • Parsen. Verwandeln Sie HTML in saubere Zeilen: Name, Preis, Währung, Verfügbarkeit, Bewertung, Rezensionszahl. Entweder mit eigenen Selektoren oder mit Auto-Parsing.
  • Speicherung und Validierung. Schreiben Sie Zeilen in einen abfragbaren Speicher, validieren Sie sie beim Eingang und markieren Sie Anomalien, damit Qualitätsprobleme sofort sichtbar werden.

Die Abrufstufe ist der Ort, an dem die meisten Schwierigkeiten liegen, und es ist die Stufe, die Crawlbase zu absorbieren gebaut ist. Anstatt selbst eine Headless-Browser-Flotte und einen Proxy-Pool zu betreiben, machen Sie Aufrufe gegen die Crawling API und lassen sie Rendering, Rotation und Entsperrung serverseitig handhaben.

Ein Abruf mit der Crawling API

Hier ist ein einzelner synchroner Abruf einer öffentlichen Kategorieseite, gefolgt von einem Parse. Die Crawling API nimmt Ihr Token und die Ziel-URL, routet die Anfrage durch eine vertrauenswürdige IP und gibt das HTML zum Extrahieren zurück.

javascript
const { CrawlingAPI } = require('crawlbase')
const cheerio = require('cheerio')

const api = new CrawlingAPI({ token: 'YOUR_CRAWLBASE_TOKEN' })

const categoryURL = 'https://example-store.com/c/laptops?page=1'

async function scrapeCategory(url) {
  const response = await api.get(url, { ajax_wait: true, page_wait: 3000 })
  const $ = cheerio.load(response.body)
  const products = []

  $('.product-card').each((i, el) => {
    products.push({
      name: $(el).find('.product-title').text().trim(),
      price: $(el).find('.price').text().trim(),
      inStock: $(el).find('.availability').text().trim(),
      rating: $(el).find('.rating').attr('data-value'),
    })
  })

  return products
}

scrapeCategory(categoryURL).then((rows) => console.log(rows))

Die beiden Optionen sind für moderne Shops wichtig. ajax_wait weist die API an, auf asynchronen Inhalt zu warten, und page_wait hält eine feste Anzahl von Millisekunden an, damit spät gerenderte Preise erscheinen, bevor das HTML zurückkommt. Die Selektoren sind Platzhalter: Inspizieren Sie Ihr Ziel in den Entwicklertools und ordnen Sie jedes Feld einem echten zu.

Selektoren mit der Scraper API überspringen

Selektoren für jeden Händler zu schreiben und zu pflegen ist eine eigene Steuer. Die Crawlbase Crawling API gibt strukturiertes JSON für unterstützte E-Commerce-Seiten direkt zurück, sodass Sie Name, Preis, Verfügbarkeit und Bewertungen als Felder erhalten, ohne selbst HTML zu parsen. Bei Skalierung bedeuten weniger benutzerdefinierte Parser weniger Dinge, die still kaputt gehen, wenn eine Site ihr Markup ändert.

Crawlbase Crawling API

Large Scale E-Commerce Scraping benötigt Rendering, Rotation und Entsperrung bei jeder Anfrage, in großem Volumen. Die Crawling API führt die Seite hinter privaten IPs serverseitig aus und gibt fertiges HTML oder auto-geparsten JSON zurück, sodass Sie weder eine Headless-Flotte noch einen eigenen Proxy-Pool betreiben müssen. Richten Sie es zunächst auf eine öffentliche Kategorieseite im kostenlosen Tarif.

Mit dem Crawler asynchron gehen

Synchrone Aufrufe funktionieren für Tausende von Seiten. Für Millionen skaliert das Blockieren jeder Anfrage und das manuelle Verwalten von Wiederholungen nicht. Der asynchrone Crawler dreht das Modell um: Sie schieben URLs hinein, er crawlt sie im Hintergrund mit für Sie erledigter Rotation und Wiederholung, und er liefert jedes Ergebnis an einen von Ihnen kontrollierten Webhook, sobald es fertig ist. Ihr Code wartet nicht mehr auf Antworten und empfängt nur geparste Seiten.

javascript
const { CrawlingAPI } = require('crawlbase')

const api = new CrawlingAPI({ token: 'YOUR_CRAWLBASE_TOKEN' })

const urls = [
  'https://example-store.com/p/sku-1001',
  'https://example-store.com/p/sku-1002',
  'https://example-store.com/p/sku-1003',
]

async function queueAll(list) {
  for (const url of list) {
    await api.post(url, { callback: 'https://your-app.com/webhook' })
  }
}

queueAll(urls).then(() => console.log('Queued', urls.length, 'URLs'))

Das ist das Muster, das zu einem Frischezeitplan passt: Fügen Sie Ihre gesamte URL-Liste in die Warteschlange ein, lassen Sie den Crawler sie gleichzeitig durcharbeiten, und verarbeiten Sie Ergebnisse, sobald sie eintreffen. Fehlgeschlagene Seiten werden innerhalb des Dienstes wiederholt, sodass Ihr Webhook-Handler nur mit fertiger Arbeit umgeht. Das ist der Unterschied zwischen einem Skript und einer Pipeline.

Wenn Sie den Proxy, nicht den Parser wollen

Einige Teams haben bereits einen Scraping-Stack und benötigen nur die Entsperrungsschicht. Der Crawlbase Smart AI Proxy ist ein einzelner Endpunkt, der vor Ihrem bestehenden HTTP-Client oder Headless-Browser sitzt und Datenverkehr durch einen rotierenden privaten Pool routet, sodass Sie Ihren Code behalten und die Rotation gewinnen. Wenn Sie abwägen, wie Rotation unter der Haube funktioniert, erläutert rotierende private Proxys die Mechanismen.

Datenqualität bei Volumen hochhalten

Saubere Daten bei Skalierung sind ein Prozess, kein Parser. Einige Gewohnheiten halten einen großen Crawl vertrauenswürdig.

  • Beim Schreiben validieren. Lehnen Sie Zeilen mit einem fehlenden Preis, einer nicht parsebareren Währung oder einem leeren Namen ab oder kennzeichnen Sie sie, damit schlechte Seiten den Datensatz nicht verschmutzen.
  • Extraktionsrate verfolgen. Wenn der Anteil der Seiten, die einen vollständigen Datensatz liefern, sinkt, hat eine Site wahrscheinlich ihr Markup geändert. Alarmieren Sie darauf, anstatt es in einem Bericht zu entdecken.
  • Die Pipeline idempotent machen. Schlüsseln Sie Zeilen auf URL plus Zeitstempel, damit Wiederholungen und erneute Läufe nicht doppelt zählen, was wichtig wird, sobald Sie Wiederholungen hinzufügen.
  • Stichproben nehmen und manuell prüfen. Ziehen Sie regelmäßig eine Handvoll Zeilen gegen die Live-Seite, um zu bestätigen, dass Preise und Verfügbarkeit noch mit der Realität übereinstimmen.

Der ehrliche Teil: Nutzungsbedingungen und robots

Das Scraping großer kommerzieller Händler bewegt sich in einer rechtlichen Grauzone, und ob es erlaubt ist, hängt von den Nutzungsbedingungen der Plattform, Ihrer Rechtsordnung und dem ab, was Sie mit den Daten machen. Viele Händler schränken automatisierten Zugriff in ihren Nutzungsbedingungen ein, sodass Scraping gegen diese Bedingungen verstoßen kann, unabhängig davon, wie sorgfältig Ihr Tooling ist. Keines der Toolings hier ändert das; es macht nur den technischen Teil funktionsfähig.

Ein paar Grundsätze, die es wert sind, eingehalten zu werden. Sammeln Sie nur öffentliche Daten: Listings, Preise, Verfügbarkeit und Bewertungen, die jeder ohne Konto sehen kann. Respektieren Sie die robots.txt jeder Site und ihre angegebenen Ratenerwartungen, und halten Sie Ihr Anfragevolumen niedrig genug, dass Sie die Server von niemandem belasten. Sammeln Sie niemals persönliche Daten, etwas, das mit einzelnen Nutzerkonten verbunden ist, oder etwas hinter einem Login. Wenn Sie planen, die Daten kommerziell weiterzuverwenden, holen Sie sich eine Genehmigung oder eine offizielle Datenvereinbarung, anstatt Schweigen als Zustimmung zu behandeln. Für das breitere Vorgehen siehe wie man Websites scrapt, ohne blockiert zu werden.

Zusammenfassung

Wichtigste Erkenntnisse

  • Skalierung verändert das Problem. Der Wechsel von Hunderten zu Millionen von Seiten macht Scraping zu einem Zuverlässigkeitsproblem: Nebenläufigkeit, Wiederholungen, Frische und Idempotenz zählen mehr als Parsen.
  • Die schwierigen Teile sind Anti-Bot und Rotation. Große Händler blockieren Rechenzentrum-IPs und repetitive Muster, sodass ein tiefer privater Pool und intelligente Rotation bei Volumen unverzichtbar sind.
  • Die Pipeline in Stufen aufteilen. URLs entdecken, abrufen, parsen, dann mit Validierung speichern, damit jede Stufe für sich skalieren kann.
  • Crawlbase als Skalierungsschicht verwenden. Die Crawling API erledigt Rendering und Entsperrung, der asynchrone Crawler führt Millionen von URLs im Hintergrund mit Wiederholungen aus, und Smart AI Proxy bietet Rotation für einen bestehenden Stack.
  • Qualität kontinuierlich validieren. Zeilen beim Schreiben prüfen, Ihre Extraktionsrate beobachten und gegen Live-Seiten stichprobenartig überprüfen, damit schlechte Daten schnell auftauchen.
  • Auf öffentlichen Daten bleiben. Nutzungsbedingungen und robots.txt respektieren; keine Konten, keine persönlichen Daten, keine Aktionen hinter einem Login.

Häufig gestellte Fragen

Was gilt als Large Scale E-Commerce Scraping?

Es gibt keine harte Grenze, aber der Begriff bedeutet normalerweise das Crawlen von Produktkatalogen in einem Volumen, bei dem ein einzelnes Skript und ein paar Proxys aufhören zu funktionieren: Zehntausende bis Millionen von Seiten, nach einem Zeitplan aktualisiert. An diesem Punkt verlagert sich die Arbeit vom Schreiben von Selektoren zum Betreiben zuverlässiger Infrastruktur, wobei Nebenläufigkeit, IP-Rotation, Wiederholungen und Datenvalidierung die meiste Schwerstarbeit leisten.

Wie vermeide ich Blockierungen beim Scrapen von Millionen von Produktseiten?

Verteilen Sie Anfragen auf einen großen Pool rotierender privater IPs, sodass keine einzelne Adresse ein Ratenlimit auslöst, halten Sie Ihre Rate pro IP niedrig, und rendern Sie Seiten, wenn die Site JavaScript benötigt. Die Crawling API und Smart AI Proxy übernehmen Rotation und Entsperrung serverseitig; wenn Sie Ihren eigenen Stack aufbauen, ist das der Teil, in den man investieren sollte. Beobachten Sie Ihre Statuscodes und fahren Sie zurück, sobald Herausforderungen erscheinen.

Sollte ich die synchrone Crawling API oder den asynchronen Crawler verwenden?

Verwenden Sie die synchrone Crawling API für interaktive oder kleinere Aufgaben, bei denen Sie die Antwort sofort möchten. Verwenden Sie den asynchronen Crawler für große Batches: Sie schieben URLs hinein, er crawlt sie im Hintergrund mit für Sie erledigter Rotation und Wiederholung, und drückt jedes fertige Ergebnis an Ihren Webhook. Für Millionen von Seiten nach einem Frischezeitplan ist das asynchrone Modell das, was verhindert, dass Ihr Code bei jeder Anfrage blockiert.

Wie halte ich gescrapte Preisdaten frisch?

Crawlen Sie nach einem Zeitplan, der für Ihren Anwendungsfall eng genug ist, was für die Neubepreisung oft täglich oder schneller bedeutet. Frische erhöht die Nebenläufigkeit und den Anti-Bot-Druck, sodass ein Dienst, der Rotation und Wiederholungen übernimmt, Ihnen ermöglicht, den gesamten Katalog innerhalb Ihres Zeitfensters zu crawlen. Stellen Sie die gesamte URL-Liste in die Warteschlange des asynchronen Crawlers und verarbeiten Sie Ergebnisse, sobald sie eintreffen, anstatt auf einen seriellen Lauf zu warten.

Muss ich Parser für jeden Händler schreiben?

Nicht unbedingt. Die Scraper API gibt strukturiertes JSON für unterstützte E-Commerce-Seiten zurück, sodass Sie Name, Preis, Verfügbarkeit und Bewertungen als Felder erhalten, ohne Selektoren zu schreiben. Für Sites, die sie nicht abdeckt, rufen Sie das HTML mit der Crawling API ab und parsen Sie mit einer Bibliothek wie Cheerio. Weniger benutzerdefinierte Parser bedeuten weniger Dinge, die still brechen, wenn eine Site ihr Markup aktualisiert.

Es hängt von den Nutzungsbedingungen der Site, Ihrer Rechtsordnung und Ihrem Zweck ab, und viele Händler schränken automatisierten Zugriff ein. Halten Sie sich streng an öffentliche Listing-Daten, respektieren Sie robots.txt und Ratenerwartungen, und berühren Sie niemals Konten, persönliche Daten oder Aktionen hinter einem Login. Für kommerzielle Weiterverwendung holen Sie sich eine Genehmigung oder eine offizielle Datenvereinbarung, anstatt sich auf einen Scraper zu verlassen.

Jetzt loslegen

Crawlen Sie jede Website im großen Maßstab, ohne gegen die Infrastruktur zu kämpfen.

Crawlbase übernimmt Proxys, Fingerprints und CAPTCHAs, damit Ihr Team Datenpipelines ausliefert, statt Crawl-Infrastruktur zu pflegen. 1.000 Anfragen kostenlos, keine Karte erforderlich.

Self-Service · Kein Verkaufsgespräch erforderlich · Enterprise-Crawl-Volumen verfügbar