Das Versprechen eines No-Code-KI-Scrapers ist einfach: Beschreiben Sie die gewünschten Daten in normaler Sprache, und ein Workflow ruft die Seite ab, übergibt sie an ein Sprachmodell und liefert saubere strukturierte Zeilen zurück. Keine Selektoren, die gepflegt werden müssen, kein Scraping-Skript, das beaufsichtigt werden muss, und vor allem kein Ingenieur, der es betreibt. Diese Anleitung zeigt Ihnen, wie Sie genau das mit Crawlbase aufbauen: einen visuellen Workflow in n8n, der den Crawlbase Web MCP (oder die Crawling API) mit einem LLM verbindet, damit ein Nicht-Ingenieur echte Web-Daten scrapen und strukturieren kann.
Die Bausteine sind alle von der Stange. n8n bietet Ihnen eine Drag-and-Drop-Oberfläche, Crawlbase übernimmt den schwierigen Teil des eigentlichen Abrufens einer Seite, die sich gegen Bots wehrt, und das LLM verwandelt unübersichtliches HTML in die von Ihnen gewünschte JSON-Form. Das Einzige, was Sie selbst verfassen, ist eine kurze Anweisung und eine kleine Konfiguration. Am Ende haben Sie einen No-Code-KI-Scraper mit Crawlbase, den jeder in Ihrem Team auslösen und wiederverwenden kann.
Was ein No-Code-KI-Scraper tatsächlich tut
Es hilft, die Aufgabenteilung genau zu betrachten, denn das Zauberwort "KI" verbirgt drei unterschiedliche Aufgaben. Retrieval bedeutet, die gerenderte Seite trotz JavaScript, rotierender Proxys und Anti-Bot-Herausforderungen zu erhalten. Interpretation bedeutet, dieses HTML zu lesen und die relevanten Felder herauszuziehen. Orchestrierung bedeutet, diese Schritte so zu verbinden, dass sie nach einem Zeitplan oder einem Auslöser ausgeführt werden, ohne dass Sie jedes Mal Code anfassen müssen.
In diesem Build übernimmt Crawlbase das Retrieval, das LLM die Interpretation und n8n die Orchestrierung. Diese Grenzen klar zu halten ist das, was den Workflow zuverlässig macht. Das LLM ist gut darin, Inhalte zu lesen, und schlecht darin, Blockierungen zu umgehen, daher lassen Sie es niemals direkt eine URL abrufen. Crawlbase ist gut im Abrufen und gegenüber Bedeutung gleichgültig, daher lassen Sie es niemals eine Seite "verstehen". Jeder Knoten erledigt die eine Sache, die er am besten kann.
Die benötigten Tools
Drei Accounts und Sie sind bereit, von denen keiner Codewriting zur Konfiguration erfordert.
- n8n das No-Code/Low-Code-Workflow-Tool. Verwenden Sie n8n Cloud oder eine selbst gehostete Instanz; beide bieten die gleiche visuelle Oberfläche.
- Ein Crawlbase-Account für die Retrieval-Schicht. Nach der Anmeldung erhalten Sie einen normalen Token und einen JavaScript-Token (JS-Token) aus dem Dashboard. Verwenden Sie den JS-Token für Seiten, die clientseitig gerendert werden.
- Ein LLM-Anbieter wie Claude oder GPT, erreichbar entweder über die integrierten KI-Knoten von n8n oder einen einfachen HTTP-Knoten.
Sie können Crawlbase auf zwei Arten mit Ihrem Workflow verbinden. Der Web MCP-Server stellt Crawlbase als eine Reihe von Tools bereit, die ein KI-Agent selbst aufrufen kann. Das ist die sauberste Lösung, wenn Ihr No-Code-Tool einen nativen MCP- oder KI-Agenten-Knoten hat. Wenn Sie es lieber explizit halten möchten, ist die Crawling API ein einfacher HTTP-Endpunkt, den Sie von jedem HTTP-Knoten aus aufrufen können. Wir verwenden den Crawling-API-Knoten für die Hauptanleitung, da er in jeder Version von n8n funktioniert, und zeigen dann, wo der MCP-Server eingesetzt werden kann.
Der MCP-Server und die Crawling API erreichen dieselbe Retrieval-Engine. MCP ist für KI-Agenten konzipiert, die selbst entscheiden, welches Tool sie wann aufrufen; die Crawling API ist eine direkte Anfrage, die Sie Schritt für Schritt steuern. Wenn Ihr No-Code-Tool einen nativen MCP-Knoten hat, lässt der MCP-Pfad den Agenten selbst Seiten abrufen. Andernfalls liefert der HTTP-Knoten, der die Crawling API aufruft, das gleiche Ergebnis ohne zusätzlichen Aufwand.
Wie der Workflow aufgebaut ist
Der visuelle Ablauf besteht aus vier Knoten, von links nach rechts auf der n8n-Oberfläche. Ein Trigger startet den Lauf, entweder manuell, nach einem Zeitplan oder über einen Webhook. Ein HTTP-Request-Knoten ruft die Crawlbase Crawling API auf und erhält das gerenderte HTML zurück. Ein KI/LLM-Knoten empfängt dieses HTML mit Ihrer Extraktionsanweisung und gibt strukturiertes JSON zurück. Ein abschließender Knoten schreibt das Ergebnis an einen nützlichen Ort: ein Google Sheet, eine Datenbank, eine Slack-Nachricht oder einfach in die Workflow-Ausgabe.
Das ist das gesamte Bild. Jeder Schritt nach dem Trigger ist ein Knoten, den Sie auf die Oberfläche ziehen und mit einer Linie verbinden. Das Einzige, was Sie tippen, ist die URL, ein Token und ein Anweisungssatz.
Schritt 1: Einen Trigger hinzufügen
Starten Sie einen neuen Workflow und fügen Sie einen Trigger-Knoten ein. Für Ihren ersten Test ist der Manual Trigger am einfachsten, da Sie auf "Workflow ausführen" klicken und beobachten können, wie die Daten durchfließen. Sobald es funktioniert, ersetzen Sie ihn durch einen Schedule Trigger, um den Scrape jeden Morgen auszuführen, oder durch einen Webhook, damit ein anderes System ihn auslösen kann. Nachgelagerte Schritte ändern sich nicht, wenn Sie die Trigger wechseln, was der Sinn der getrennten Orchestrierung ist.
Schritt 2: Die Seite mit Crawlbase abrufen
Fügen Sie einen HTTP-Request-Knoten hinzu und verbinden Sie ihn mit dem Trigger. Dieser Knoten kommuniziert mit der Crawling API. Stellen Sie die Methode auf GET und richten Sie sie auf den Crawlbase-Endpunkt aus, und übergeben Sie Ihren Token, die Ziel-URL und das JS-Render-Flag für clientseitige Seiten. In n8n tragen Sie diese Werte in die Felder des Knotens ein, aber im Hintergrund ist es eine einzelne Anfrage, die so aussieht.
https://api.crawlbase.com/?token=YOUR_CRAWLBASE_JS_TOKEN&javascript=true&ajax_wait=true&url=https%3A%2F%2Fwww.ebay.com%2Fstr%2Fbestsellingproducts
Drei Dinge sind hier wichtig. Der token ist Ihr JS-Token, der Crawlbase anweist, die Seite in einem echten Browser zu rendern, bevor sie zurückgegeben wird. Das Flag javascript=true aktiviert dieses Rendering, und ajax_wait=true wartet auf asynchrone Inhalte, sodass spät ladende Einträge in der Antwort vorhanden sind. Die url ist Ihr Ziel, URL-kodiert. Crawlbase rotiert durch Residential-IPs und verarbeitet CAPTCHAs serverseitig, sodass der Knoten fertiges HTML statt einer leeren Hülle oder einer Blockseite erhält.
Im n8n HTTP-Request-Knoten fügen Sie diese als Abfrageparameter hinzu, anstatt die Zeichenkette von Hand zusammenzustellen. Speichern Sie den Token in einem Credential, damit er nie im Klartext auf der Oberfläche zu sehen ist, setzen Sie url auf einen Ausdruck, der vom Trigger liest, und Sie haben einen wiederverwendbaren Abruf-Schritt.
Schritt 3: Das HTML an das LLM übergeben
Fügen Sie als nächstes einen KI-Knoten hinzu, entweder den nativen AI-Agent-Knoten von n8n oder eine Basic LLM Chain, und verbinden Sie ihn mit dem HTTP-Request-Knoten. Hier findet die Interpretation statt. Sie füttern den Knoten mit dem HTML aus dem vorherigen Schritt plus einer klaren Anweisung, die die gewünschten Felder und die genaue JSON-Form beschreibt, die zurückgegeben werden soll. Ein Prompt wie der folgende funktioniert gut.
You are a data extraction assistant. From the HTML below, extract every product as an object with these keys: title (string), price (number), condition (string), seller (string), url (string). Return a JSON array only, no prose. If a field is missing, set it to null. If a product is out of stock, still include it and add availability: false. HTML: {{ $json.body }}
Der Ausdruck {{ $json.body }} zieht das vom Crawlbase-Knoten zurückgegebene HTML in den Prompt. Die Anweisung erledigt den Rest: Sie benennt die Schlüssel, legt ihre Typen fest und teilt dem Modell mit, wie es sich verhalten soll, wenn die Realität unordentlich ist. Da das LLM Inhalte semantisch liest, erkennt es Preise und Verkäuferdetails auch dann, wenn sich das Layout zwischen Einträgen verschiebt, was genau die Robustheit ist, die einem selektor-basierten Scraper fehlt.
Möchten Sie, dass der KI-Agent Seiten selbst abruft, anstatt einen festen HTTP-Schritt zu verwenden? Der Web-MCP-Server stellt Crawlbase als Tools bereit, die Ihr Agent aufrufen kann, sodass er selbst entscheidet, wann er crawlt, wann er neu rendert und wann er paginiert, alles hinter rotierenden Residential-IPs. Fügen Sie den MCP-Server in den Agenten-Knoten Ihres No-Code-Tools ein, und die Retrieval-Schicht wird zu einer der nativen Fähigkeiten des Modells. Beginnen Sie mit dem kostenlosen Tarif und richten Sie es zunächst auf eine öffentliche Seite.
Schritt 4: Die strukturierte Ausgabe speichern
Der KI-Knoten gibt nun ein sauberes JSON-Array aus. Fügen Sie einen abschließenden Knoten hinzu, um es irgendwo nutzbar zu machen. Ein Google Sheets-Knoten fügt jedes Produkt als Zeile hinzu, ein Postgres- oder MySQL-Knoten schreibt in eine Tabelle, und ein Slack- oder E-Mail-Knoten kann eine Zusammenfassung versenden. Da die Daten bereits strukturiert sind, ist die Zuordnung zu Spalten per Drag-and-Drop möglich: Verbinden Sie jeden JSON-Schlüssel mit dem Zielfeld und führen Sie den Workflow aus.
Das Ergebnis ist das, was der No-Code-KI-Scraper liefern sollte. Ein Nicht-Ingenieur klickt auf "Workflow ausführen", und ein sauberes Datensatz landet in einer Tabellenkalkulation, ohne HTML, ohne Selektoren und ohne ein Skript in Sicht.
Den Web-MCP-Server verwenden
Wenn Ihr No-Code-Tool MCP unterstützt, können Sie die Schritte 2 und 3 zu einem zusammenfassen. Anstatt eines festen HTTP-Knotens geben Sie Ihrem KI-Agenten Zugang zum MCP-Server und lassen ihn das Crawl-Tool selbst aufrufen. Der Agent liest Ihre Anweisung ("Holen Sie die meistverkauften Produkte von dieser eBay-Seite als JSON"), ruft das Crawlbase-Tool auf, um das gerenderte HTML abzurufen, und extrahiert dann die Felder im selben Schritt. Die Verbindung ist ein kleiner JSON-Block in den MCP-Einstellungen Ihres Tools.
{ "mcpServers": { "crawlbase": { "command": "npx", "args": ["-y", "@crawlbase/mcp"], "env": { "CRAWLBASE_TOKEN": "YOUR_CRAWLBASE_JS_TOKEN" } } } }
Mit dem registrierten Server behandelt der Agent das Crawling als eingebaute Fähigkeit. Dies ist die "No-Code"-Version des Builds, da Retrieval und Interpretation beide in einem KI-Schritt stattfinden und Sie es in n8n genauso wie zuvor orchestrieren. Eine vollständige Anleitung zu diesem Pfad finden Sie unter wie man n8n mit Crawlbase Web MCP verbindet, und den Hintergrund, warum das Einspeisen von Echtzeit-Seiten in ein Modell wichtig ist, lesen Sie in Einführung in Crawlbase MCP.
Anweisungen schreiben, die saubere Daten liefern
Der Workflow ist nur so gut wie die Anweisung, die Sie dem Modell geben. Dieselben Gewohnheiten, die jeden Prompt verbessern, gelten hier, und sie kosten nichts.
Felder und ihre Typen benennen
Ein vages "Holen Sie die Daten von dieser Seite" liefert inkonsistente Ausgaben. Benennen Sie jeden Schlüssel und seinen Typ, wie es der Prompt in Schritt 3 tut, und das Modell hält sich eng an das Schema. Geben Sie die genaue JSON-Form an, die Sie erwarten, anstatt zu hoffen, dass das Modell sie errät.
Fehlende oder ungewöhnliche Werte einplanen
Echte Seiten sind unordentlich. Teilen Sie dem Modell mit, was es tun soll, wenn ein Feld fehlt ("setzen Sie es auf null"), und wie es mit Sonderfällen umgehen soll ("wenn nicht vorrätig, trotzdem einschließen mit availability: false"). Das hält jede Zeile konsistent und erspart Ihnen später einen Bereinigungsdurchlauf.
Das JSON vor dem Speichern validieren
Fügen Sie vor dem Zielknoten einen kleinen Validierungsschritt ein, entweder das integrierte JSON-Parsing von n8n oder einen kurzen Function-Knoten, sodass eine fehlerhafte Antwort laut versagt, anstatt Unsinn in Ihr Sheet zu schreiben. Behandeln Sie die Ausgabe des LLM als nicht vertrauenswürdig, bis sie geparst wird.
Warum dies einem handcodierten Scraper für Nicht-Ingenieure überlegen ist
Der Reiz liegt nicht nur in "weniger Code", sondern darin, wer es betreiben kann. Sobald der Workflow existiert, kann ein Marketing- oder Analysemitarbeiter die Ziel-URL ändern, den Prompt anpassen und ihn erneut ausführen, ohne die Technik einzubeziehen. Das semantische Lesen des Modells bedeutet auch, dass kleine Layoutänderungen auf der Zielseite den Lauf nicht unterbrechen, wie es ein fragiler CSS-Selektor täte. Und da Crawlbase die gesamte Retrieval-Last trägt, JavaScript rendert, Residential-IPs rotiert und CAPTCHAs beseitigt, bleibt der Workflow gesund, ohne dass jemand Proxy-Pools tunen muss.
Für Teams, die Ansätze nach Kosten vergleichen, kostet KI-gestütztes Scraping typischerweise einen Bruchteil einer handgefertigten Pipeline, wenn man Ingenieur- und Wartungsstunden berücksichtigt, wobei viele Teams über das Jahr hinweg Einsparungen von rund 70 bis 90 Prozent berichten. Mehr darüber, wo dieses Muster passt, finden Sie im Leitfaden zu KI-Proxy-Anwendungsfällen. Wenn Sie eine noch aufwandsärmere Retrieval-Schicht benötigen, leitet der Smart AI Proxy jede Anfrage durch dieselbe Anti-Block-Infrastruktur, und die Crawling API gibt vorge-parstes JSON für gängige Website-Typen zurück, ganz ohne LLM.
Wichtigste Erkenntnisse
- Drei Aufgaben, drei Schichten. Crawlbase ruft ab, das LLM interpretiert, und n8n orchestriert. Diese Trennung ist das, was den Workflow zuverlässig macht.
- Der Build besteht aus vier Knoten. Trigger, HTTP-Request an die Crawling API, KI-Extraktion, dann ein Zielknoten. Das Einzige, was getippt wird, ist eine URL, ein Token und eine Anweisung.
-
Den JS-Token für gerenderte Seiten verwenden. Übergeben Sie
javascript=trueundajax_wait=true, damit Crawlbase fertiges HTML zurückgibt, keine leere Hülle. - Der Prompt ist der Parser. Benennen Sie jedes Feld und seinen Typ, und teilen Sie dem Modell mit, wie es mit fehlenden Daten umgehen soll, um konsistentes JSON zu erhalten.
- MCP fasst Abruf und Extraktion zusammen. Wenn Ihr Tool einen nativen Agenten-Knoten hat, lässt der Web-MCP-Server das Modell in einem Schritt selbst crawlen.
- Nicht-Ingenieure können es besitzen. Einmal gebaut, kann jeder die URL oder den Prompt ändern und erneut ausführen, ohne Selektoren zu pflegen.
Häufig gestellte Fragen
Muss ich programmieren können, um das aufzubauen?
Nein. Der gesamte Workflow wird durch das Ziehen von Knoten auf die n8n-Oberfläche und das Verbinden dieser zusammengestellt. Der einzige Text, den Sie verfassen, ist die Ziel-URL, Ihr Crawlbase-Token (als Credential gespeichert) und eine Anweisung in normaler Sprache für das LLM. Es gibt kein Scraping-Skript und keine Selektoren, die geschrieben oder gepflegt werden müssen.
Sollte ich den Web-MCP-Server oder die Crawling API verwenden?
Beide erreichen dieselbe Crawlbase-Retrieval-Engine. Verwenden Sie die Crawling API über einen HTTP-Knoten, wenn jeder Schritt explizit sein und in jeder Version Ihres Tools funktionieren soll. Verwenden Sie den Web MCP-Server, wenn Ihr No-Code-Tool einen nativen KI-Agenten- oder MCP-Knoten hat, sodass das Modell in einem einzigen Schritt abrufen und extrahieren kann, anstatt in zwei.
Warum die Seite durch Crawlbase leiten, anstatt das LLM die URL abrufen zu lassen?
Sprachmodelle sind gut darin, Inhalte zu lesen, und schlecht darin, Blockierungen zu umgehen. Die meisten kommerziellen Seiten rendern clientseitig und fordern automatisierten Traffic heraus, sodass ein direkter Abruf eine leere Hülle oder eine Blockseite zurückgibt. Crawlbase rendert die Seite in einem echten Browser hinter rotierenden Residential-IPs und löst CAPTCHAs, sodass das Modell vollständiges HTML zum Verarbeiten erhält.
Wie erhalte ich zuverlässigere strukturierte Ausgaben vom Modell?
Seien Sie im Prompt explizit: Benennen Sie jedes Feld und seinen Typ, geben Sie die genaue JSON-Form an und teilen Sie dem Modell mit, wie es mit fehlenden oder ungewöhnlichen Werten umgehen soll. Fügen Sie dann vor dem Zielknoten einen Validierungsschritt hinzu, damit fehlerhaftes JSON laut versagt, anstatt schlechte Zeilen zu schreiben. Behandeln Sie die Modellausgabe als nicht vertrauenswürdig, bis sie sauber geparst wird.
Kann ich das nach einem Zeitplan ausführen oder von einem anderen System auslösen lassen?
Ja. Ersetzen Sie den manuellen Trigger durch einen Schedule Trigger, um den Scrape in einem Intervall auszuführen, oder durch einen Webhook, damit eine andere Anwendung ihn starten kann. Nachgelagerte Schritte ändern sich nicht, da die Orchestrierung von Retrieval und Extraktion getrennt ist. Das ist es, was es einem Nicht-Ingenieur ermöglicht, wiederkehrende Datenerfassung einzurichten, ohne die Abruf- oder Parse-Logik zu berühren.
Welche Art von Daten kann ich so erfassen?
Alle öffentlichen Web-Daten, die der Workflow erreichen kann: Produktlisten und Preise, Marktplatzeninventare, Verzeichniseinträge oder aggregierte Inhalte aus mehreren Quellen. Halten Sie sich an öffentliche Seiten, respektieren Sie die Nutzungsbedingungen und Ratenanforderungen jeder Website, und vermeiden Sie Login-geschützte oder persönliche Daten. Für verwandte Muster behandelt der Leitfaden zu KI-Proxy-Anwendungsfällen angrenzende Workflows.
Crawlen Sie jede Website im großen Maßstab, ohne gegen die Infrastruktur zu kämpfen.
Crawlbase übernimmt Proxys, Fingerprints und CAPTCHAs, damit Ihr Team Datenpipelines ausliefert, statt Crawl-Infrastruktur zu pflegen. 1.000 Anfragen kostenlos, keine Karte erforderlich.

