Kaggle Scraper.
Datasets und Notebooks, vollständig gerendert.
Senden Sie eine beliebige Kaggle-URL und erhalten Sie das vollständig gerenderte HTML zurück, über Residential Proxys mit integriertem Anti-Bot-Handling.
Oder holen Sie strukturiertes JSON mit den Scrapern kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp und kaggle-notebook.
Vier Kaggle-Scraper. Ein sauberes JSON pro Stück.
Die vier Kaggle-Scraper, live getippt. kaggle-dataset-serp liest eine Dataset-Suchseite, kaggle-dataset holt ein Dataset mit seinen Dateien und seiner Lizenz, kaggle-notebook-serp liest ein Notebook-Listing, und kaggle-notebook gibt ein einzelnes Notebook mit seinen Stats und Inputs zurück. Tabs wechseln oder zum Pausieren und Lesen mit der Maus darüberfahren.
Eine API, jeder Winkel von Kaggle.
Vier dedizierte Scraper decken die Seiten ab, die zählen: Dataset-Suche, einzelne Datasets, Notebook-Suche und einzelne Notebooks. Die Crawling API rendert jede Seite in einem echten Browser, erreicht sie über Residential IPs und liefert Ihnen sauberes HTML oder JSON.
Jedes Dataset-Listing
kaggle-dataset-serp verwandelt eine Dataset-Suchseite in JSON: totalCount, page und hasNextPage, plus jede Karte mit ihrer Position, ihrem Titel, slug, Owner, Usability-Rating, ihrer Dateianzahl und ihrem Format, ihrer Größe, ihren Downloads, ihrer Notebook-Anzahl, ihren Votes und ihrer Medaille.
Vollständige Dataset-Metadaten
kaggle-dataset gibt ein Dataset mit seinem Titel, Untertitel, seiner Markdown-Beschreibung, seiner Version, seinen Keywords, seinem Owner, seiner Lizenz, seiner Dateiliste mit Formaten und Byte-Größen und seinen Download-, View-, Vote- und Kommentar-Zählern zurück.
Notebook-Listings
kaggle-notebook-serp gibt eine Notebook-Suchseite zurück, jede Zeile mit ihrer Position, ihrem Titel, slug, Autor und Koautoren, ihrem letzten Update, ihrer Kommentaranzahl, ihrem Competition- oder Dataset-Kontext, ihren Votes und ihrer Medaille.
Einzelne Notebooks
Fügen Sie scraper=kaggle-notebook hinzu, um ein Notebook mit seinem Autor, seiner Sprache, seiner Laufzeit, seiner Versionshistorie, seinen Views, Votes, Kopien, Kommentaren, seiner Medaille, seiner Lizenz und seinen Inputs zurückzugeben.
140M Residential IPs
Jede Anfrage rotiert eine Residential IP über 30 Regionen und löst Bot-Prüfungen automatisch. Nichts zu lösen, nichts zu warten.
Eine API für jede Seite
Die Crawling API funktioniert mit jeder URL, derselbe Token deckt also jedes Kaggle-Dataset und -Notebook und alles andere ab, was Sie crawlen. Live-Demo ansehen.
Jedes Dataset-Feld, als sauberes JSON.
Senden Sie eine Dataset-URL mit scraper=kaggle-dataset und das Dataset kommt als typisiertes JSON zurück, Dateien und Lizenz inklusive. Tauschen Sie auf kaggle-dataset-serp, kaggle-notebook-serp oder kaggle-notebook um, für Listings und Notebooks.
Dataset
url · string id · string title · string subtitle · string
Owner & Lizenz
owner.name · string owner.url · string license.name · string license.url · string
Dateien
files[].format · string files[].sizeBytes · number files[].downloadUrl · string files[].requiresSubscription · boolean
Engagement
downloads · number views · number votes · number commentCount · number
Metadaten
description · string keywords · array lastUpdated · string isAccessibleForFree · boolean
Von der URL zu Daten in einem Aufruf.
Jede Kaggle-Anfrage nimmt denselben Weg. Sie senden eine URL, wir betreiben alles dazwischen.
URL senden
Übergeben Sie eine beliebige öffentliche Kaggle-URL mit Ihrem Token: eine Dataset-Suchseite, ein Dataset, ein Notebook-Listing oder ein einzelnes Notebook.
Proxy rotieren
Eine Residential IP und Region, die die Site sauber erreichen, aus 140M IPs über 30 Regionen.
Seite rendern
Ein echter Browser lädt die Seite, sodass Suchergebnisse, Dataset-Karten und Notebook-Sidebars vor der Erfassung gerendert werden.
Anti-Bot überwinden
Die Bot-Prüfungen und Rate-Limits der Site werden automatisch gehandhabt. Nichts zu lösen, nichts zu warten.
HTML oder JSON zurückgeben
Das vollständig gerenderte HTML kommt zurück, oder typisiertes JSON, wenn Sie kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp oder kaggle-notebook hinzufügen.
Was Teams mit Kaggle-Daten bauen.
Dataset-Discovery
Durchlaufen Sie Dataset-Suchseiten nach Keyword und Seite, um einen durchsuchbaren Index davon aufzubauen, was existiert, wem es gehört und wie es lizenziert ist.
Datenkatalog-Sync
Spiegeln Sie Dataset-Titel, Untertitel, Beschreibungen, Keywords, Versionen, Dateiformate und Byte-Größen in einen internen Katalog und halten Sie ihn aktuell.
Lizenz- und Zugriffsprüfungen
Lesen Sie Lizenzname und -URL, isAccessibleForFree und das requiresSubscription-Flag pro Datei, bevor ein Dataset in eine Pipeline eingeht.
Notebook- und Methoden-Recherche
Sammeln Sie Notebook-Listings und einzelne Notebooks, um zu sehen, mit welchen Sprachen, Laufzeiten und Competition-Kontexten die Community tatsächlich arbeitet.
Popularitäts-Tracking
Verfolgen Sie Downloads, Views, Votes, Kopien und Kommentaranzahlen über die Zeit, um zu sehen, welche Datasets und Notebooks an Zugkraft gewinnen.
Jede URL, eine API
Crawlen Sie Dataset-Suche, Datasets, Notebook-Suche und einzelne Notebooks, plus jede andere Site, die Sie brauchen.
Gut zu wissen beim Scrapen von Kaggle.
HTML standardmäßig, JSON auf Anfrage
Sie erhalten das vollständig gerenderte HTML. Fügen Sie scraper=kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp oder kaggle-notebook für geparstes JSON hinzu, oder parsen Sie das HTML selbst.
Notebook-Listings melden ein Label, keine Anzahl
Kaggle rendert im Notebook-Listing nur Results (100+), sodass totalCountLabel genau diesen String wortwörtlich zurückgibt statt einer erfundenen Zahl. Das Dataset-Listing liefert dagegen einen echten numerischen totalCount.
Notebook-Inhalte liegen in einem iframe
Das ausgeführte Notebook wird von einem separaten Origin innerhalb eines iframe ausgeliefert und ist damit nicht Teil des Seitendokuments. contentUrl adressiert diesen Frame und trägt ein kurzlebiges signiertes Token, holen Sie es also bald nach dem Crawl ab.
Listing-Stats kommen wie angezeigt
Auf einer Dataset-Karte ist size der String, den Kaggle mit seinen Einheiten anzeigt, etwa 6 kB, und die abgekürzte Download-Anzahl wird zurück auf eine schlichte Ganzzahl erweitert, sodass 362K als 362000 zurückkommt.
Gebaut, um Kaggle in großem Maßstab zu crawlen.
Die Crawling API läuft auf demselben Netzwerk, das über 46.000 zahlende Kunden und 70.000 Entwickler bedient. Keine Proxys zu kaufen, keine Browser zu betreiben, nichts zu patchen, wenn sich die Site ändert.
Ein Token, offizielle SDKs für Python, Node und Ruby und ein Netzwerk mit 99,99 % Uptime darunter.
Fragen zum Scrapen von Kaggle.
Starten Sie das Scrapen von Kaggle.
Sparen Sie sich Proxys und Rate-Limits.
Kostenlos zu beginnen mit bis zu 20.000 Anfragen. Ein Token für die Crawling API und jeden Scraper.