Crawling API / Kaggle

Kaggle Scraper.
Datasets und Notebooks, vollständig gerendert.

Senden Sie eine beliebige Kaggle-URL und erhalten Sie das vollständig gerenderte HTML zurück, über Residential Proxys mit integriertem Anti-Bot-Handling.
Oder holen Sie strukturiertes JSON mit den Scrapern kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp und kaggle-notebook.

99 % Erfolgsrate140M Residential IPs30 Regionen
Kaggle URLHTML or JSONkaggle.com/datasets?search=...CrawlbaseRouteRendernExtrahierenGerendertes HTMLDatensatzsucheDatensatzNotebook-SucheNotebookcrawling-apikaggle-dataset-serpkaggle-datasetkaggle-notebook-serpkaggle-notebookkaggle.com · gerendert + geparst · 200
Live-Crawl-Feed · Kaggle1.24M req/minStreaming
200kaggle.com/code?searchQuery=xgboost&language=PythonAU163ms
200kaggle.com/code/alexisbcook/titanic-tutorialUS61ms
404kaggle.com/code?searchQuery=nlp&page=2DE133ms
200kaggle.com/datasets/zynicide/wine-reviewsFR189ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudDE119ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudUS52ms
200kaggle.com/code?searchQuery=xgboost&language=PythonDE44ms
200kaggle.com/datasets?search=image+classificationCA175ms
200kaggle.com/datasets?search=image+classificationCA79ms
200kaggle.com/code/startupsci/titanic-data-science-solutionsGB46ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudIN112ms
200kaggle.com/datasets?search=image+classificationNL195ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudES191ms
200kaggle.com/code/ldfreeman3/a-data-science-framework-to-achieve-99-accuracyES76ms
200kaggle.com/datasets/uciml/irisJP52ms
200kaggle.com/code/startupsci/titanic-data-science-solutionsNL193ms
200kaggle.com/datasetsJP187ms
200kaggle.com/code/alexisbcook/titanic-tutorialGB140ms
200kaggle.com/datasets?search=weather&page=2IN99ms
200kaggle.com/datasets?search=weather&page=2IN80ms
200kaggle.com/code/startupsci/titanic-data-science-solutionsGB77ms
200kaggle.com/code/ldfreeman3/a-data-science-framework-to-achieve-99-accuracyNL78ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudBR207ms
200kaggle.com/code?searchQuery=nlp&page=2ES123ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetES179ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetFR65ms
200kaggle.com/code?searchQuery=xgboost&language=PythonAU163ms
200kaggle.com/code/alexisbcook/titanic-tutorialUS61ms
404kaggle.com/code?searchQuery=nlp&page=2DE133ms
200kaggle.com/datasets/zynicide/wine-reviewsFR189ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudDE119ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudUS52ms
200kaggle.com/code?searchQuery=xgboost&language=PythonDE44ms
200kaggle.com/datasets?search=image+classificationCA175ms
200kaggle.com/datasets?search=image+classificationCA79ms
200kaggle.com/code/startupsci/titanic-data-science-solutionsGB46ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudIN112ms
200kaggle.com/datasets?search=image+classificationNL195ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudES191ms
200kaggle.com/code/ldfreeman3/a-data-science-framework-to-achieve-99-accuracyES76ms
200kaggle.com/datasets/uciml/irisJP52ms
200kaggle.com/code/startupsci/titanic-data-science-solutionsNL193ms
200kaggle.com/datasetsJP187ms
200kaggle.com/code/alexisbcook/titanic-tutorialGB140ms
200kaggle.com/datasets?search=weather&page=2IN99ms
200kaggle.com/datasets?search=weather&page=2IN80ms
200kaggle.com/code/startupsci/titanic-data-science-solutionsGB77ms
200kaggle.com/code/ldfreeman3/a-data-science-framework-to-achieve-99-accuracyNL78ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudBR207ms
200kaggle.com/code?searchQuery=nlp&page=2ES123ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetES179ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetFR65ms
01 Live-Demo

Vier Kaggle-Scraper. Ein sauberes JSON pro Stück.

Die vier Kaggle-Scraper, live getippt. kaggle-dataset-serp liest eine Dataset-Suchseite, kaggle-dataset holt ein Dataset mit seinen Dateien und seiner Lizenz, kaggle-notebook-serp liest ein Notebook-Listing, und kaggle-notebook gibt ein einzelnes Notebook mit seinen Stats und Inputs zurück. Tabs wechseln oder zum Pausieren und Lesen mit der Maus darüberfahren.

bereit
Tasten 1-4 wechseln · klicken zum Pausiereneigene URL ausführen
Starten Sie Ihre erste Anfrage in Minuten. Bis zu 20.000 kostenlose Anfragen, keine Kreditkarte.Kostenlos starten
02 Funktionen

Eine API, jeder Winkel von Kaggle.

Vier dedizierte Scraper decken die Seiten ab, die zählen: Dataset-Suche, einzelne Datasets, Notebook-Suche und einzelne Notebooks. Die Crawling API rendert jede Seite in einem echten Browser, erreicht sie über Residential IPs und liefert Ihnen sauberes HTML oder JSON.

Dataset-Suche

Jedes Dataset-Listing

kaggle-dataset-serp verwandelt eine Dataset-Suchseite in JSON: totalCount, page und hasNextPage, plus jede Karte mit ihrer Position, ihrem Titel, slug, Owner, Usability-Rating, ihrer Dateianzahl und ihrem Format, ihrer Größe, ihren Downloads, ihrer Notebook-Anzahl, ihren Votes und ihrer Medaille.

Datasets

Vollständige Dataset-Metadaten

kaggle-dataset gibt ein Dataset mit seinem Titel, Untertitel, seiner Markdown-Beschreibung, seiner Version, seinen Keywords, seinem Owner, seiner Lizenz, seiner Dateiliste mit Formaten und Byte-Größen und seinen Download-, View-, Vote- und Kommentar-Zählern zurück.

Notebook-Suche

Notebook-Listings

kaggle-notebook-serp gibt eine Notebook-Suchseite zurück, jede Zeile mit ihrer Position, ihrem Titel, slug, Autor und Koautoren, ihrem letzten Update, ihrer Kommentaranzahl, ihrem Competition- oder Dataset-Kontext, ihren Votes und ihrer Medaille.

Notebooks

Einzelne Notebooks

Fügen Sie scraper=kaggle-notebook hinzu, um ein Notebook mit seinem Autor, seiner Sprache, seiner Laufzeit, seiner Versionshistorie, seinen Views, Votes, Kopien, Kommentaren, seiner Medaille, seiner Lizenz und seinen Inputs zurückzugeben.

Proxys

140M Residential IPs

Jede Anfrage rotiert eine Residential IP über 30 Regionen und löst Bot-Prüfungen automatisch. Nichts zu lösen, nichts zu warten.

ein Token

Eine API für jede Seite

Die Crawling API funktioniert mit jeder URL, derselbe Token deckt also jedes Kaggle-Dataset und -Notebook und alles andere ab, was Sie crawlen. Live-Demo ansehen.

03 Ausgabe

Jedes Dataset-Feld, als sauberes JSON.

Senden Sie eine Dataset-URL mit scraper=kaggle-dataset und das Dataset kommt als typisiertes JSON zurück, Dateien und Lizenz inklusive. Tauschen Sie auf kaggle-dataset-serp, kaggle-notebook-serp oder kaggle-notebook um, für Listings und Notebooks.

{ "url": "https://www.kaggle.com/datasets/uciml/iris", "id": "19", "title": "Iris Species", "subtitle": "Classify iris plants into three species in this classic dataset", "description": "The famous Iris flower data set, first used by Sir R.A. Fisher.", "version": 2, "keywords": [ "subject", "earth and nature", "biology" ], "owner": { "name": "UCI Machine Learning", "url": "https://www.kaggle.com/organizations/uciml" }, "license": { "name": "CC0: Public Domain", "url": "https://creativecommons.org/publicdomain/zero/1.0/" }, "files": [ { "format": "zip", "sizeBytes": 3687, "downloadUrl": "https://www.kaggle.com/api/v1/datasets/download/uciml/iris", "requiresSubscription": true } ], "downloads": 907784, "views": 3131083, "votes": 4861, "commentCount": 33, "lastUpdated": "2016-09-27T07:38:05.44Z", "isAccessibleForFree": true }

Dataset

url · string  id · string  title · string  subtitle · string

Owner & Lizenz

owner.name · string  owner.url · string  license.name · string  license.url · string

Dateien

files[].format · string  files[].sizeBytes · number  files[].downloadUrl · string  files[].requiresSubscription · boolean

Engagement

downloads · number  views · number  votes · number  commentCount · number

Metadaten

description · string  keywords · array  lastUpdated · string  isAccessibleForFree · boolean

04 So funktioniert es

Von der URL zu Daten in einem Aufruf.

Jede Kaggle-Anfrage nimmt denselben Weg. Sie senden eine URL, wir betreiben alles dazwischen.

01

URL senden

Übergeben Sie eine beliebige öffentliche Kaggle-URL mit Ihrem Token: eine Dataset-Suchseite, ein Dataset, ein Notebook-Listing oder ein einzelnes Notebook.

02

Proxy rotieren

Eine Residential IP und Region, die die Site sauber erreichen, aus 140M IPs über 30 Regionen.

03

Seite rendern

Ein echter Browser lädt die Seite, sodass Suchergebnisse, Dataset-Karten und Notebook-Sidebars vor der Erfassung gerendert werden.

04

Anti-Bot überwinden

Die Bot-Prüfungen und Rate-Limits der Site werden automatisch gehandhabt. Nichts zu lösen, nichts zu warten.

05

HTML oder JSON zurückgeben

Das vollständig gerenderte HTML kommt zurück, oder typisiertes JSON, wenn Sie kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp oder kaggle-notebook hinzufügen.

05 Anwendungsfälle

Was Teams mit Kaggle-Daten bauen.

USE / 01Discovery

Dataset-Discovery

Durchlaufen Sie Dataset-Suchseiten nach Keyword und Seite, um einen durchsuchbaren Index davon aufzubauen, was existiert, wem es gehört und wie es lizenziert ist.

USE / 02Katalog

Datenkatalog-Sync

Spiegeln Sie Dataset-Titel, Untertitel, Beschreibungen, Keywords, Versionen, Dateiformate und Byte-Größen in einen internen Katalog und halten Sie ihn aktuell.

USE / 03Lizenzierung

Lizenz- und Zugriffsprüfungen

Lesen Sie Lizenzname und -URL, isAccessibleForFree und das requiresSubscription-Flag pro Datei, bevor ein Dataset in eine Pipeline eingeht.

USE / 04Recherche

Notebook- und Methoden-Recherche

Sammeln Sie Notebook-Listings und einzelne Notebooks, um zu sehen, mit welchen Sprachen, Laufzeiten und Competition-Kontexten die Community tatsächlich arbeitet.

USE / 05Ranking

Popularitäts-Tracking

Verfolgen Sie Downloads, Views, Votes, Kopien und Kommentaranzahlen über die Zeit, um zu sehen, welche Datasets und Notebooks an Zugkraft gewinnen.

USE / 06Abdeckung

Jede URL, eine API

Crawlen Sie Dataset-Suche, Datasets, Notebook-Suche und einzelne Notebooks, plus jede andere Site, die Sie brauchen.

06 Hinweise

Gut zu wissen beim Scrapen von Kaggle.

HTML standardmäßig, JSON auf Anfrage

Sie erhalten das vollständig gerenderte HTML. Fügen Sie scraper=kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp oder kaggle-notebook für geparstes JSON hinzu, oder parsen Sie das HTML selbst.

Notebook-Listings melden ein Label, keine Anzahl

Kaggle rendert im Notebook-Listing nur Results (100+), sodass totalCountLabel genau diesen String wortwörtlich zurückgibt statt einer erfundenen Zahl. Das Dataset-Listing liefert dagegen einen echten numerischen totalCount.

Notebook-Inhalte liegen in einem iframe

Das ausgeführte Notebook wird von einem separaten Origin innerhalb eines iframe ausgeliefert und ist damit nicht Teil des Seitendokuments. contentUrl adressiert diesen Frame und trägt ein kurzlebiges signiertes Token, holen Sie es also bald nach dem Crawl ab.

Listing-Stats kommen wie angezeigt

Auf einer Dataset-Karte ist size der String, den Kaggle mit seinen Einheiten anzeigt, etwa 6 kB, und die abgekürzte Download-Anzahl wird zurück auf eine schlichte Ganzzahl erweitert, sodass 362K als 362000 zurückkommt.

07 Warum Crawlbase

Gebaut, um Kaggle in großem Maßstab zu crawlen.

Die Crawling API läuft auf demselben Netzwerk, das über 46.000 zahlende Kunden und 70.000 Entwickler bedient. Keine Proxys zu kaufen, keine Browser zu betreiben, nichts zu patchen, wenn sich die Site ändert.

99%
Durchschnittliche Erfolgsrate der Anfragen
140M
Residential IPs, plus 98M Datacenter
30
Regionen für genaue lokale Ergebnisse
20/s
Anfragen pro Sekunde standardmäßig, mehr auf Anfrage

Ein Token, offizielle SDKs für Python, Node und Ruby und ein Netzwerk mit 99,99 % Uptime darunter.

08 FAQ

Fragen zum Scrapen von Kaggle.

Senden Sie eine beliebige Kaggle-URL mit Ihrem Token an die Crawlbase Crawling API. Crawlbase rotiert einen Residential Proxy, rendert die Seite in einem echten Browser, überwindet Bot-Prüfungen und gibt das vollständig gerenderte HTML zurück. Fügen Sie einen dedizierten Scraper (scraper=kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp oder kaggle-notebook) hinzu, um stattdessen strukturiertes JSON zu erhalten.
Ja. Standardmäßig gibt die Crawling API gerendertes HTML zurück; fügen Sie einen dedizierten Scraper hinzu, um strukturiertes JSON zu erhalten: kaggle-dataset-serp für eine Dataset-Suchseite, kaggle-dataset für ein einzelnes Dataset, kaggle-notebook-serp für ein Notebook-Listing und kaggle-notebook für ein einzelnes Notebook.
Dataset-Such- und -Listing-Seiten, einzelne Dataset-Seiten, Notebook-Such- und -Listing-Seiten und einzelne Notebook-Seiten auf kaggle.com. Dieselbe API funktioniert auch auf jeder anderen Site.
Crawlbase routet jede Anfrage über rotierende Residential IPs über 30 Regionen und überwindet Bot-Prüfungen automatisch, sodass der Zugriff konsistent bleibt und es nichts zu warten gibt, wenn die Site ihre Konfiguration ändert.
kaggle-dataset-serp gibt eine Dataset-Suchseite mit totalCount, Pagination und einer Karte pro Ergebnis zurück. kaggle-dataset gibt ein Dataset mit seiner Beschreibung, seinen Keywords, seinem Owner, seiner Lizenz, seinen Dateien und seinen Zählern zurück. kaggle-notebook-serp gibt ein Notebook-Listing mit Autor, Koautoren, Kontext, Votes und Medaille pro Zeile zurück. kaggle-notebook gibt ein einzelnes Notebook mit seiner Sprache, seiner Laufzeit, seinen Versionen, Views, Votes, Kopien, seiner Lizenz und seinen Inputs zurück.
Der kaggle-notebook Scraper gibt die Notebook-Metadaten zurück: Autor, Sprache, Laufzeit, Versionsanzahl, Views, Votes, Kopien, Kommentare, Medaille, Lizenz und Inputs. Der ausgeführte Notebook-Inhalt wird in einem separaten iframe ausgeliefert und ist daher nicht im Seitendokument; der Scraper gibt contentUrl zurück, das diesen Frame adressiert und ein kurzlebiges signiertes Token trägt, das Sie direkt nach dem Crawl abrufen können.
Starten Sie kostenlos mit bis zu 20.000 Anfragen und ohne Kreditkarte. Bezahlpläne skalieren mit der Nutzung, und derselbe Token funktioniert über die Crawling API und jeden Crawlbase-Scraper.

Starten Sie das Scrapen von Kaggle.
Sparen Sie sich Proxys und Rate-Limits.

Kostenlos zu beginnen mit bis zu 20.000 Anfragen. Ein Token für die Crawling API und jeden Scraper.