Produkt / Crawler

Crawler.
URLs pushen, Daten pullen, async im großen Maßstab.

Pushen Sie Millionen von URLs in eine verwaltete Push/Pull-Queue auf Basis der Crawling API und empfangen Sie die gerenderten Daten auf Ihrem Webhook oder im Cloud Storage.
Keine Queues, Retries oder Proxys zu betreiben.

99% ErfolgsrateAsync Push und PullWebhook oder Cloud Storage
URLs sendenDaten abrufensenden: beliebige URLcallback=trueCrawlerQueueRendernRetryWebhookCloud StorageLive-Monitoryour-server.com/hookstorage.crawlbase.comEchtzeit-Statistikin Queue · massenhaft gecrawlt · 200
Live-Crawler-Queue1.24M req/minStreaming
200crunchbase.com/discover/organization.companiesBR44ms
200amazon.com/s?k=laptops&page=1DE98ms
200amazon.com/s?k=laptops&page=1DE211ms
200glassdoor.com/Reviews/company-reviews.htmDE128ms
200booking.com/searchresults.html?offset=25BR216ms
200crunchbase.com/discover/organization.companiesBR207ms
200etsy.com/c/jewelry?page=4BR206ms
301etsy.com/c/jewelry?page=4CA207ms
200amazon.com/s?k=laptops&page=2NL135ms
200glassdoor.com/Reviews/company-reviews.htmFR208ms
200tripadvisor.com/Hotels-g60763-oa30IN99ms
200zillow.com/homes/for_sale/2_p/JP207ms
200bestbuy.com/site/searchpage.jsp?st=tvDE83ms
200zillow.com/homes/for_sale/2_p/AU114ms
200amazon.com/s?k=laptops&page=1CA201ms
200amazon.com/s?k=laptops&page=2IN173ms
200amazon.com/s?k=laptops&page=3SG110ms
200walmart.com/browse/electronics/3944GB167ms
200amazon.com/s?k=laptops&page=3IN158ms
200amazon.com/s?k=laptops&page=3DE67ms
404booking.com/searchresults.html?offset=25DE126ms
301zillow.com/homes/for_sale/2_p/JP96ms
200glassdoor.com/Reviews/company-reviews.htmBR57ms
200glassdoor.com/Reviews/company-reviews.htmSG98ms
200etsy.com/c/jewelry?page=4SG152ms
200bestbuy.com/site/searchpage.jsp?st=tvBR93ms
200crunchbase.com/discover/organization.companiesBR44ms
200amazon.com/s?k=laptops&page=1DE98ms
200amazon.com/s?k=laptops&page=1DE211ms
200glassdoor.com/Reviews/company-reviews.htmDE128ms
200booking.com/searchresults.html?offset=25BR216ms
200crunchbase.com/discover/organization.companiesBR207ms
200etsy.com/c/jewelry?page=4BR206ms
301etsy.com/c/jewelry?page=4CA207ms
200amazon.com/s?k=laptops&page=2NL135ms
200glassdoor.com/Reviews/company-reviews.htmFR208ms
200tripadvisor.com/Hotels-g60763-oa30IN99ms
200zillow.com/homes/for_sale/2_p/JP207ms
200bestbuy.com/site/searchpage.jsp?st=tvDE83ms
200zillow.com/homes/for_sale/2_p/AU114ms
200amazon.com/s?k=laptops&page=1CA201ms
200amazon.com/s?k=laptops&page=2IN173ms
200amazon.com/s?k=laptops&page=3SG110ms
200walmart.com/browse/electronics/3944GB167ms
200amazon.com/s?k=laptops&page=3IN158ms
200amazon.com/s?k=laptops&page=3DE67ms
404booking.com/searchresults.html?offset=25DE126ms
301zillow.com/homes/for_sale/2_p/JP96ms
200glassdoor.com/Reviews/company-reviews.htmBR57ms
200glassdoor.com/Reviews/company-reviews.htmSG98ms
200etsy.com/c/jewelry?page=4SG152ms
200bestbuy.com/site/searchpage.jsp?st=tvBR93ms
01 Live-Demo

Eine URL pushen. Ausgeliefert bekommen.

Der Crawler, live getippt. Pushen Sie eine URL in die Queue und empfangen Sie das gerenderte Ergebnis auf Ihrem Webhook. Fahren Sie mit der Maus darüber, um anzuhalten und mitzulesen.

bereit
Tasten 1-2 wechseln · klicken zum Pausiereneigene URL ausführen
Führen Sie Ihren ersten Request in Minuten aus. Bis zu 20,000 kostenlose Requests, keine Kreditkarte.Kostenlos starten
02 Funktionen

Crawling im großen Maßstab, Queues inklusive.

Alles, was große Crawls schwierig macht, für Sie erledigt: eine async Queue, Retries, Auslieferung und Monitoring, alles auf Basis der Crawling API.

async

Asynchrones Push und Pull

Pushen Sie so viele URLs, wie Sie möchten, und machen Sie weiter. Crawlbase reiht sie in die Queue ein, plant und rendert sie im Hintergrund, sodass Ihr Client nie blockiert.

built-on

Auf Basis der Crawling API

Jede Funktion der Crawling API bleibt erhalten: JavaScript-Rendering, Residential Proxys, Geotargeting, Parameter und Anti-Bot-Handling bei jedem Request.

deliver

Webhook-Auslieferung

Richten Sie den Crawler auf Ihren Endpoint aus, und jedes Ergebnis wird an ihn gepostet. Crawlbase überwacht Ihren Webhook, damit die Auslieferung präzise und zuverlässig bleibt.

storage

Cloud Storage

Lieber pullen? Behalten Sie jede gecrawlte Seite im Crawlbase Cloud Storage und rufen Sie sie nach Ihrem eigenen Zeitplan ab. Cloud Storage ansehen.

monitor

Individuelle Crawler, Live-Statistiken

Benennen Sie einen Crawler pro Workload und beobachten Sie ihn in Echtzeit. Prüfen Sie Statistiken über die API und pausieren oder setzen Sie fort, passend zu Ihrem Budget.

fresh

Frische Daten, weniger Retries

Jede Seite wird live gecrawlt, nichts wird gecacht. Das Push/Pull-System bringt die Erfolgsraten nahe an 100%, sodass clientseitige Retries so gut wie verschwinden.

03 So funktioniert es

Migrieren Sie mit zwei zusätzlichen Parametern.

Behalten Sie Ihre Crawling-API-Calls. Fügen Sie einen Callback und einen Crawler-Namen hinzu, und Sie sind async.

01

Einen Crawler erstellen

Öffnen Sie das Crawler-Dashboard, erstellen Sie einen benannten Crawler und richten Sie ihn auf Ihren Webhook oder Cloud Storage aus.

02

Die URLs pushen

Rufen Sie die Crawling API mit callback=true und crawler=YourCrawlerName auf, für eine URL oder Millionen.

03

Wir reihen ein und rendern

Crawlbase plant jeden Request, rotiert einen Residential Proxy, rendert die Seite und wiederholt fehlgeschlagene Versuche.

04

Das Ergebnis ausliefern

Jede gerenderte Seite wird an Ihren Webhook gepostet oder in Cloud Storage geschrieben, als HTML oder strukturiertes JSON.

05

Pullen und überwachen

Pullen Sie aus dem Storage, wenn bereit, und verfolgen Sie jeden Crawler live, mit Pause und Fortsetzen auf Abruf.

04 Anwendungsfälle

Was Teams mit dem Crawler bauen.

USE / 01Skalierung

Millionen von Seiten

Pushen Sie ganze Kataloge oder Sitemaps und lassen Sie die Queue sie abarbeiten, ganz ohne clientseitige Planung.

USE / 02Pipelines

Daten in Ihren Stack

Liefern Sie gerenderte Seiten direkt an einen Webhook oder Storage, bereit für Ihr Warehouse, Ihren Index oder Ihr Modell.

USE / 03Commerce

Kontinuierliches Monitoring

Crawlen Sie Preise, Bestände und Listings nach Zeitplan neu, mit frischen Daten bei jedem Durchlauf.

USE / 04AI

Trainings- und RAG-Korpora

Bauen Sie große, saubere Seitensets für Training und Retrieval auf, aus dem Storage im großen Umfang gepullt.

USE / 05Migration

Weg vom eigenen Crawler

Tauschen Sie Ihr Push/Pull-System gegen unseres mit zwei Parametern und lassen Sie Proxys, Queues und Retries fallen.

USE / 06Abdeckung

Millionen von Websites

Crawlen Sie über Millionen unterstützter Websites mit einem Crawler und einem Token.

05 Pricing

One rate card, shared with every product.

Crawler pushes bill exactly like Crawling API requests: the same credits on the same ladder, with async delivery and retries included.

Pay as you go$3.00 down to $0.02 per 1,000 successful requests

Only successful requests are billed, and rates fall as volume grows. Optional subscriptions from $99 / mo. Start free with up to 20,000 requests, no credit card.

06 Hinweise

Gut zu wissen.

Kostenlos testen

Bis zu 20,000 Requests sind kostenlos, ohne Kreditkarte. Derselbe Token funktioniert über den Crawler, die Crawling API und jeden Scraper.

Nutzungsbasierte Preise

Zahlen Sie für das, was Sie crawlen, keine langfristigen Verträge, jederzeit kündbar. Pausieren und fortsetzen, passend zu Ihrem Budget. Sehen Sie die vollständige Aufschlüsselung auf der Preisseite.

Vollständig dokumentiert

Das Erstellen von Crawlern, Callbacks und die Auslieferung werden alle in den Crawler-Docs behandelt, mit Copy-Paste-Beispielen.

GDPR- und CCPA-konform

Crawlbase wendet Verbraucherschutzstandards weltweit an, mit Fairness und Transparenz, die in den Umgang mit Daten eingebaut sind.

07 Warum Crawlbase

Gebaut, um das Web im großen Maßstab zu crawlen.

Der Crawler läuft auf demselben Netzwerk, das 70,000+ Entwickler und die anspruchsvollsten Crawling-Workloads der Welt bedient. Keine Queues zu betreiben, keine Proxys zu kaufen, nichts zu patchen, wenn sich eine Website ändert.

99%
Durchschnittliche Erfolgsrate der Requests
70K+
Kunden im Netzwerk
Async
Push und Pull, Queues erledigt
99.99%
Netzwerk-Verfügbarkeit

Ein Token über den Crawler, die Crawling API und jeden Scraper, mit Auslieferung an Ihren Webhook oder Storage.

08 FAQ

Fragen zum Crawler.

Ein asynchroner Crawler auf Basis der Crawling API. Sie pushen URLs in eine verwaltete Push/Pull-Queue und Crawlbase rendert jede Seite, wiederholt fehlgeschlagene Versuche und liefert das Ergebnis an Ihren Webhook oder an Cloud Storage, sodass Sie nie Queues, Retries oder Proxys verwalten.
Die Crawling API ist synchron, Sie erhalten die Response im selben Call. Der Crawler ist asynchron, Sie pushen URLs und die Daten werden später an Ihren Webhook oder Storage ausgeliefert. Er behält jede Funktion der Crawling API, einschließlich JavaScript-Rendering und Residential Proxys.
Erstellen Sie einen benannten Crawler im Dashboard und fügen Sie dann Ihrem Crawling-API-Call zwei Parameter hinzu, callback=true und crawler=YourCrawlerName. Das ist die einzige nötige Änderung, um synchrone Calls auf das async Push/Pull-System umzustellen.
Auf zwei Wegen. Richten Sie den Crawler auf Ihren Webhook-Endpoint aus und Crawlbase postet jedes Ergebnis an ihn, oder speichern Sie Ergebnisse in Cloud Storage und pullen Sie sie, wenn Sie bereit sind. Webhook-URLs werden überwacht, damit die Auslieferung zuverlässig bleibt.
Ja. Das Dashboard zeigt Live-Statistiken für jeden Crawler, und mit der Crawler API können Sie Statistiken prüfen und Crawls verwalten. Sie können das Crawling pausieren und fortsetzen, passend zu Ihrem Budget und Ihren Anforderungen.
Ja. Jede Seite wird zum Zeitpunkt des Requests live aus dem Internet gecrawlt. Nichts wird gecacht oder aus einem früheren Crawl bereitgestellt, sodass die Daten, die Sie erhalten, aktuell sind.

Crawlen Sie das Web asynchron.
URLs pushen, wir liefern die Daten.

Kostenlos beginnen mit bis zu 20,000 Requests. Ein Token für den Crawler, die Crawling API und jeden Scraper.