Kommentare zu einem öffentlichen TikTok-Video sind ein Fenster darin, wie ein Publikum reagiert: die verwendete Sprache, die transportierte Stimmung und die immer wiederkehrenden Themen. Forscher, Analysten und Content-Teams lesen dieses Signal aggregiert, um Trends zu verstehen, nicht um die schreibenden Personen zu verfolgen. Diese Anleitung zeigt Ihnen, wie Sie öffentliche TikTok-Kommentare mit Python scrapen, auf eine Weise, die tatsächlich gegen eine JavaScript-gerenderte Seite funktioniert.
Um von vornherein klar zu sein: Alles hier ist auf öffentliche Kommentare zu öffentlichen Videos beschränkt. Das Ziel ist aggregierte Analyse: Kommentartext, Like-Zählungen und Antwort-Zählungen, die Sie zu Stimmungs- und Themenzusammenfassungen zusammenfassen können. Es geht nicht darum, Profile einzelner Kommentierenden aufzubauen. Benutzernamen und die Wörter, die Menschen schreiben, sind personenbezogene Daten, sodass der gesamte Walkthrough sie sorgfältig behandelt, und der Abschnitt zur Rechtslage am Ende deckt die Regeln ab, bevor Sie dies auf etwas Echtes anwenden. Wenn Sie zuerst die umfassendere Anleitung möchten, lesen Sie unseren Guide zu TikTok scrapen.
Was Sie bauen werden
Ein kleines Python-Skript, das eine öffentliche TikTok-Video-URL entgegennimmt, die vollständig gerenderte Seite über die Crawling API mit einem JavaScript-Token abruft, scrollt, um weitere Kommentare zu laden, und eine Handvoll öffentlicher, größtenteils aggregierter Felder parst:
- Kommentartext die sichtbaren Wörter jedes öffentlichen Kommentars.
- Like-Zählung die aggregierte Anzahl der Likes, die ein Kommentar anzeigt, nicht die dahinterstehenden Personen.
- Antwort-Zählung die aggregierte Anzahl der Antworten, die ein Kommentar erhalten hat.
- Video-Metadaten die öffentliche Video-URL, zu der die Kommentare gehören, zur Zuordnung.
Beachten Sie, was in der Analyseausgabe bewusst fehlt: keine Kommentar-Profile, keine Followerdaten, kein Versuch, einen Benutzernamen mit einer echten Identität zu verknüpfen. Das sind personenbezogene Daten von Einzelpersonen, und deren Erhebung liegt hier bewusst außerhalb des Geltungsbereichs. Wir lesen einen Benutzernamen von der Seite, weil das Markup ihn trägt, aber der Abschnitt zum Datenschutz erklärt, warum Sie ihn nicht mit der Identität verknüpft speichern oder veröffentlichen sollten.
Warum eine einfache Anfrage bei TikTok scheitert
Fordern Sie eine öffentliche TikTok-Video-URL mit einem einfachen HTTP-Client an und Sie erhalten eine technisch erfolgreiche und praktisch leere Antwort. TikTok rendert seinen Inhalt clientseitig: Das echte Markup, einschließlich Kommentare, erscheint erst, nachdem das JavaScript der Seite in einem Browser ausgeführt wird und Daten von internen Endpunkten abruft. Eine einzelne statische Anfrage führt dieses JavaScript nie aus, sodass die gewünschten Kommentare einfach nicht im Body vorhanden sind.
Zudem lädt TikTok Kommentare asynchron und verzögert beim Scrollen, und es kennzeichnet scraper-ähnlichen Datenverkehr schnell. Datacenter-IP-Bereiche, fehlendes Browser-Verhalten und repetitive Muster werden ratenlimitiert oder herausgefordert, bevor interessante Inhalte jemals geladen werden. Ein funktionierender Kommentar-Scraper benötigt also zwei Dinge in derselben Anfrage: einen echten Browser, der die Seite rendert und scrollt, und eine IP-Adresse, die die Plattform als gewöhnlichen Besucher liest. Sie können das selbst mit einem Headless-Browser und einem Pool rotierender Residential-Proxys aufbauen, aber diesen Stack gesund zu halten ist der Großteil der Arbeit. Die Crawling API fasst beides in einem einzigen Aufruf zusammen: Sie senden eine URL mit einem JavaScript-Token, sie rendert und scrollt hinter einer vertrauenswürdigen Residential-IP und gibt fertiges HTML zurück, das Sie parsen können. Zu den zugrundeliegenden Mechanismen lesen Sie JavaScript-Websites crawlen.
Crawlbase bietet zwei Token-Typen an. Das normale Token ruft statisches HTML ab; das JavaScript-Token (JS-Token) rendert die Seite zuerst in einem echten Browser. TikTok ist stark clientseitig gerendert, daher benötigen Sie hier das JS-Token. Das normale Token gibt dieselbe nahezu leere Hülle zurück wie ein einfacher Abruf, ohne Kommentare zum Parsen.
Voraussetzungen
Zunächst ein paar Dinge zu erledigen. Keines davon dauert lange.
Grundlegende Python-, HTML- und CSS-Kenntnisse. Sie sollten in der Lage sein, ein Skript auszuführen, Pakete mit pip zu installieren und CSS-Selektoren zu lesen, damit Sie die Kommentar-Selektoren anpassen können, wenn Temus Markup sich verschiebt.
Python 3.8 oder höher. Überprüfen Sie mit python --version. Falls nicht vorhanden, installieren Sie es von python.org und stellen Sie sicher, dass pip in Ihrem PATH ist.
Ein Crawlbase-Konto und JS-Token. Registrieren Sie sich, öffnen Sie Ihr Dashboard und kopieren Sie Ihr JavaScript-Token (JS-Token) von der Konto-Docs-Seite. Der kostenlose Tarif enthält bis zu 20.000 Anfragen, was ausreicht, um mitzumachen. Behandeln Sie das Token wie ein Passwort: Es authentifiziert Ihre Anfragen, also halten Sie es aus der Versionskontrolle heraus.
Das Projekt einrichten
Erstellen Sie eine isolierte virtuelle Umgebung und installieren Sie dann die Bibliotheken, die der Scraper benötigt.
python --version python -m venv tiktok_env source tiktok_env/bin/activate pip install crawlbase beautifulsoup4 pandas
Unter Windows aktivieren Sie mit tiktok_env\Scripts\activate statt der source-Zeile. Drei Abhängigkeiten erledigen die Arbeit: crawlbase ist der offizielle Client für die Crawling API, beautifulsoup4 parst das zurückgegebene HTML, damit Sie Felder per Selektor extrahieren können, und pandas hilft Ihnen, die Ergebnisse später für aggregierte Analysen zusammenzuführen.
Schritt 1: Die gerenderte Videoseite abrufen
Beginnen Sie damit, die fertige Seite zu laden. Importieren Sie CrawlingAPI, initialisieren Sie es mit Ihrem JS-Token und fordern Sie eine öffentliche Video-URL an. Zwei Optionen sind für ein clientseitig gerendertes Ziel wichtig: ajax_wait weist die API an, auf asynchrone Inhalte zu warten, bis sie fertig geladen sind, und page_wait hält für eine feste Anzahl von Millisekunden, damit spät rendernde Kommentare vor der Erfassung erscheinen. Überprüfen Sie den Status vor dem Parsen, damit Fehler laut statt stumm bleiben.
from crawlbase import CrawlingAPI crawling_api = CrawlingAPI({"token": "YOUR_CRAWLBASE_TOKEN"}) options = { "ajax_wait": "true", "page_wait": 10000, "user_agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/123.0.0.0 Safari/537.36", } def fetch_html(url): try: response = crawling_api.get(url, options) if response["headers"]["cb_status"] == "200": return response["body"].decode("utf-8") print(f"Failed to fetch. Crawlbase status: {response['headers']['cb_status']}") return None except Exception as e: print(f"An error occurred: {str(e)}") return None if __name__ == "__main__": video_url = "https://www.tiktok.com/@nasa/video/7255327059302419738" html = fetch_html(video_url) print(html[:500] if html else "No HTML returned")
Die Crawling API liest cb_status (legacy pc_status) aus den Antwort-Headern, was das vorgelagerte Abrufergebnis unabhängig vom Proxy-Transport meldet. Zehn Sekunden page_wait sind ein vernünftiger Ausgangspunkt für TikTok; erhöhen Sie es, wenn Kommentare leer zurückkommen. Das Beispiel zeigt auf einen öffentlichen Organisationsaccount, genau weil er öffentlich und unpersönlich ist. Führen Sie das Skript aus und Sie sollten echtes gerendertes Markup sehen, was bestätigt, dass das Rendering funktioniert, bevor Sie einen einzigen Selektor schreiben.
TikTok benötigt eine gerenderte, gescrollte Seite hinter einer vertrauenswürdigen IP, in einem einzigen Aufruf. Die Crawling API nimmt ein JS-Token, führt die Seite in einem echten Browser aus, scrollt, um lazy geladene Kommentare zu laden, und rotiert serverseitig durch Residential-IPs, sodass Sie kein eigenes Headless-Browser-Fleet und keinen Proxy-Pool betreiben müssen. Richten Sie es zunächst auf ein öffentliches Video im kostenlosen Tarif.
Schritt 2: Kommentare in strukturierte Daten parsen
Mit dem gerenderten HTML in der Hand laden Sie es in BeautifulSoup und extrahieren die öffentlichen Felder. TikTok markiert seine Komponenten mit stabilen data-e2e-Attributen, die weitaus langlebiger sind als die Jagd nach tief verschachtelten, häufig umbenannten CSS-Klassennamen. Die Kommentarliste befindet sich in einem Kommentar-Container; jedes Kommentarelement trägt seinen Text, eine Like-Zählung und eine Antwort-Zählung. Wir lesen auch den Benutzernamen des Video-Autors vom Seitenkopf für den Attributionskontext.
from bs4 import BeautifulSoup def text_or_none(node): return node.text.strip() if node else None def scrape_video_info(soup): username = soup.select_one("span[data-e2e='browse-username']") return {"Video Author": text_or_none(username)} def scrape_comments_listing(soup): return soup.select( "div[data-e2e='search-comment-container'] > " "div[class*='CommentListContainer'] > " "div[class*='DivCommentItemContainer']" ) def parse_comment(comment): text = comment.select_one( "div[class*='DivCommentContentContainer'] " "p[data-e2e='comment-level-1'] > span" ) likes = comment.select_one("div[class*='DivLikeContainer'] span") replies = comment.select_one("div[class*='DivReplyContainer']") return { "Comment Text": text_or_none(text), "Like Count": text_or_none(likes), "Reply Count": text_or_none(replies), }
Jeder Helfer schützt gegen einen fehlenden Knoten, sodass ein umbenanntes oder fehlendes Element None zurückgibt, anstatt eine Exception auszulösen. Der Kommentarlisten-Selektor spiegelt TikToks verschachtelte Struktur wider: einen Kommentar-Container, dann einen Listen-Container, dann individuelle Kommentarelemente. Von jedem Element extrahieren wir den Kommentartext, die Like-Zählung und die Antwort-Zählung. Die letzten beiden sind aggregierte Zahlen, genau die Art von nicht-persönlichem Signal, das Sie für Themen- und Stimmungsanalysen möchten.
TikTok ändert sein Markup und obfuskierte Klassennamen ohne Ankündigung, weshalb dieser Code auf stabile data-e2e-Attribute und partielle class*=-Übereinstimmungen statt auf spröde exakte Klassen setzt. Wenn ein Feld als None zurückkommt, inspizieren Sie die Live-Seite in den Dev Tools Ihres Browsers und aktualisieren Sie den Selektor. Periodische Wartung ist bei jedem Produktions-Scraper normal.
Schritt 3: Kommentar-Paginierung mit Scrollen behandeln
TikTok verwendet Infinite Scrolling, um mehr Kommentare dynamisch zu laden, sodass ein einzelnes Rendering nur den ersten Stapel erfasst. Die Crawling API bietet einen scroll-Parameter, der den Headless-Browser anweist, die Seite zu scrollen und mehr Inhalte zu laden, bevor er zurückgibt. Standardmäßig beträgt das Scroll-Intervall 10 Sekunden; der scroll_interval-Parameter ermöglicht es Ihnen, es zu verlängern, damit mehr Kommentar-Stapel geladen werden. Fügen Sie diese Optionen einem paginierten Abruf hinzu.
def fetch_html_with_scroll(url): scroll_options = { "ajax_wait": "true", "user_agent": options["user_agent"], "scroll": "true", "scroll_interval": 20000, } try: response = crawling_api.get(url, scroll_options) if response["headers"]["cb_status"] == "200": return response["body"].decode("utf-8") print(f"Failed to fetch. Crawlbase status: {response['headers']['cb_status']}") return None except Exception as e: print(f"An error occurred: {str(e)}") return None
Ein scroll_interval von 20 Sekunden gibt lazy geladenen Kommentaren Zeit, zwischen den Scrolls zu rendern. Längere Intervalle laden mehr Kommentare, kosten aber mehr Wartezeit pro Anfrage, also stimmen Sie es darauf ab, wie viele Stapel Sie tatsächlich benötigen. Halten Sie das Volumen moderat: Eine repräsentative Stichprobe reicht für aggregierte Analysen in der Regel aus, und Sie benötigen selten jeden Kommentar zu einem Video.
Schritt 4: Den vollständigen Scraper zusammenstellen
Verbinden Sie nun Abrufen, Scrollen und Parsen in einem lauffähigen Skript. Es rendert die Videoseite mit Scrollen, liest den öffentlichen Video-Autor für den Kontext, parst jeden geladenen Kommentar in Text, Like-Zählung und Antwort-Zählung und gibt sauberes JSON aus, das Sie in Analysen einspeisen können.
import json from crawlbase import CrawlingAPI from bs4 import BeautifulSoup crawling_api = CrawlingAPI({"token": "YOUR_CRAWLBASE_TOKEN"}) options = { "ajax_wait": "true", "user_agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/123.0.0.0 Safari/537.36", } def fetch_html_with_scroll(url): scroll_options = {**options, "scroll": "true", "scroll_interval": 20000} try: response = crawling_api.get(url, scroll_options) if response["headers"]["cb_status"] == "200": return response["body"].decode("utf-8") print(f"Failed to fetch. Crawlbase status: {response['headers']['cb_status']}") return None except Exception as e: print(f"An error occurred: {str(e)}") return None def text_or_none(node): return node.text.strip() if node else None def scrape_comments_listing(soup): return soup.select( "div[data-e2e='search-comment-container'] > " "div[class*='CommentListContainer'] > " "div[class*='DivCommentItemContainer']" ) def parse_comment(comment): text = comment.select_one( "div[class*='DivCommentContentContainer'] " "p[data-e2e='comment-level-1'] > span" ) likes = comment.select_one("div[class*='DivLikeContainer'] span") replies = comment.select_one("div[class*='DivReplyContainer']") return { "Comment Text": text_or_none(text), "Like Count": text_or_none(likes), "Reply Count": text_or_none(replies), } def main(): video_url = "https://www.tiktok.com/@nasa/video/7255327059302419738" html = fetch_html_with_scroll(video_url) if not html: return soup = BeautifulSoup(html, "html.parser") comments = [parse_comment(c) for c in scrape_comments_listing(soup)] output = {"Video URL": video_url, "Comments": comments} print(json.dumps(output, indent=2, ensure_ascii=False)) if __name__ == "__main__": main()
Das Skript verschlüsselt seine Ausgabe anhand der Video-URL und nicht anhand einer Einzelperson, was der richtige Standard für aggregierte Arbeit ist. Jeder Kommentar-Datensatz enthält nur Text und zwei Zählungen. Wenn Sie Ergebnisse persistieren möchten, schreiben Sie sie in eine CSV oder Datenbank, aber lesen Sie zuerst den Datenschutzabschnitt: Kommentartext und Benutzernamen sind personenbezogene Daten, und wie lange Sie diese aufbewahren und was Sie damit tun, ist eine rechtliche Frage, nicht nur eine technische.
Wie die Ausgabe aussieht
Führen Sie das vollständige Skript aus und Sie erhalten einen sauberen Datensatz öffentlicher Kommentarfelder, bereit für Sentiment- oder Themenanalysen.
{ "Video URL": "https://www.tiktok.com/@nasa/video/7255327059302419738", "Comments": [ { "Comment Text": "this is incredible", "Like Count": "1243", "Reply Count": "18" }, { "Comment Text": "how was this filmed?", "Like Count": "87", "Reply Count": "4" } ] }
Von hier aus ist Aggregation das entscheidende Wort. Gruppieren Sie den Kommentartext, um häufige Themen zu identifizieren, führen Sie Sentiment über das Korpus aus, um die allgemeine Reaktion zu messen, und gewichten Sie nach Like- und Antwort-Zählungen, um herauszufinden, welche Stimmungen Anklang fanden. Das sagt Ihnen, wie ein Publikum reagiert hat, ohne ein Dossier über einen einzelnen Kommentierenden zu erstellen. Wenn Sie das in ein Modell einspeisen möchten, deckt unser Leitfaden zu Strukturieren und Bereinigen von Web-Scraping-Daten für AI und ML die Normalisierung und De-Identifikation von Text vor dem Training ab.
Unblockiert bleiben
Auch bei durch die Crawling API gehandhabtem Rendering beobachtet TikTok scraper-ähnlichen Datenverkehr. Einige Gewohnheiten halten einen Lauf gesund, und sie gelten für jedes schwere, gut verteidigte Ziel.
- Dosieren Sie Ihre Anfragen. Scroll-Renderings dauern länger als statische Abrufe, also feuern Sie sie nicht in einer engen Schleife ab. Verteilen Sie sie und widerstehen Sie aggressivem Parallelisieren.
- Setzen Sie auf Rotation. Ein Pool von Residential-IPs verteilt Anfragen über viele echte Nutzeradressen, sodass keine einzelne ein Ratenlimit auslöst. Die Crawling API übernimmt das für Sie; wenn Sie Ihren eigenen Stack aufbauen, ist das der Teil, den Sie richtig machen müssen.
- Lesen Sie die Statuscodes. Ein Lauf, der anfängt, Herausforderungen oder Fehler zurückzugeben, signalisiert Ihnen, dass die aktuelle Rate oder IP-Stufe nicht mehr ausreicht. Weichen Sie zurück, anstatt härter zu drücken.
- Halten Sie das Volumen niedrig. Eine repräsentative Stichprobe von Kommentaren reicht für aggregierte Analysen in der Regel aus. Sie benötigen selten jeden Kommentar zu einem viralen Video.
Das umfassendere Playbook finden Sie unter Websites scrapen ohne blockiert zu werden. Wenn Sie lieber Ihren eigenen Datenverkehr durch einen rotierenden Pool leiten möchten statt die verwaltete API zu nutzen, gibt Ihnen der Smart AI Proxy dieselbe Residential-Rotation als Drop-in-Proxy-Endpunkt.
Ist es legal, TikTok-Kommentare zu scrapen?
Das ist der Abschnitt, den Sie lesen sollten, bevor Sie Produktionscode schreiben. Scraping ist nicht von vornherein illegal, und öffentliche Kommentare zu einem öffentlichen Video sind für jeden ohne Anmeldung sichtbar. Aber TikToks Nutzungsbedingungen schränken die automatisierte Sammlung ein, und Kommentare sind personenbezogene Daten: Sie sind Inhalte, die von identifizierbaren Personen geschrieben wurden, oft verknüpft mit einem Benutzernamen. Daher dreht sich Legalität hier weniger darum, ob die Daten öffentlich sind, als darum, was Sie sammeln, warum und was Sie danach damit tun. Lesen Sie TikToks Nutzungsbedingungen und dessen robots.txt, und behandeln Sie beides als Grenze für das, was Sie berühren.
Wenn Sie Daten über Personen in der EU oder im Vereinigten Königreich verarbeiten, gilt die DSGVO, und Kaliforniens CCPA gilt für Einwohner Kaliforniens. Beide behandeln Benutzernamen und von Nutzern geschriebene Kommentare als personenbezogene Daten, auch wenn sie öffentlich sind. In der Praxis bedeutet das, dass Sie eine Rechtsgrundlage für die Verarbeitung benötigen, das, was Sie aufbewahren, minimieren sollten und Löschungs- und Widerspruchsanfragen erfüllen müssen. Die sicherste Haltung für diese Art von Arbeit ist aggregierte Analyse: Stimmung, Themen und Zählungen ableiten, dann die rohen Kommentare und Benutzernamen verwerfen oder de-identifizieren. Erstellen Sie keine Profile einzelner Kommentierenden, veröffentlichen Sie den Kommentar einer Person nicht verknüpft mit ihrer Identität und speichern Sie keine Benutzernamen verknüpft mit Meinungen, die Sie über sie abgeleitet haben. Das Skript in dieser Anleitung liest einen Benutzernamen, weil die Seite ihn offenlegt, aber Sie sollten ihn nicht mit Identität verknüpft aufbewahren.
Bleiben Sie strikt auf der öffentlichen Seite und gehen Sie nie darüber hinaus. Scrapen Sie keine privaten Accounts, login-gesperrte Inhalte, Direktnachrichten oder irgendetwas hinter einem Follower-Gate. Umgehen Sie keine Authentifizierung oder Ratenlimits und verbreiten Sie keine urheberrechtlich geschützten Videos oder Medien. Für jede echte, fortlaufende oder kommerzielle Nutzung ist die offizielle TikTok API das richtige Werkzeug, einschließlich der Research API, wenn Sie sich qualifizieren. Es ist der genehmigte Weg, gibt Ihnen definierte Bedingungen und Struktur und hält Sie in TikToks Regeln. Dieser Artikel ist ein technischer Walkthrough, der auf öffentliche Kommentare für aggregierte Analysen beschränkt ist, kein Befürworten massenhafter personenbezogener Datenerhebung.
Wichtigste Erkenntnisse
- TikTok ist clientseitig gerendert und bot-verteidigt. Eine einfache Anfrage gibt eine nahezu leere Hülle ohne Kommentare zurück, also müssen Sie die Seite rendern und scrollen, bevor Sie parsen.
-
Rendering, Scrollen und eine vertrauenswürdige IP gehören in einen einzigen Aufruf. Die Crawling API mit einem JS-Token erledigt alle drei;
ajax_wait,page_waitundscroll_intervalsteuern, wie lange sie wartet und lädt. -
Stabile Signale parsen. TikToks
data-e2e-Attribute und partielleclass*=-Übereinstimmungen sind langlebiger als spröde obfuskierte Klassennamen. - Aggregieren, nicht profilieren. Kommentartext, Like-Zählungen und Antwort-Zählungen für Sentiment- und Themenanalysen extrahieren; niemals Profile einzelner Kommentierender erstellen oder Benutzernamen mit Identität verknüpft speichern.
- Regeln respektieren und die offizielle API bevorzugen. TikToks ToS schränkt Scraping ein, DSGVO und CCPA behandeln Kommentare als personenbezogene Daten, und die offizielle TikTok API ist der genehmigte Weg für alles Echte.
Häufig gestellte Fragen
Warum gibt eine einfache Anfrage keine Kommentare von TikTok zurück?
Weil TikTok seinen Inhalt clientseitig mit JavaScript rendert und Kommentare lazy beim Scrollen lädt. Das initiale HTML ist eine Hülle, die sich erst füllt, nachdem die Skripte der Seite in einem Browser ausgeführt wurden, sodass eine rohe HTTP-Anfrage einen nahezu leeren Body zurückgibt. Um echte öffentliche Kommentare zu erhalten, müssen Sie die Seite rendern und scrollen, was das JS-Token der Crawling API und der scroll-Parameter für Sie übernehmen.
Benötige ich das normale Token oder das JS-Token für TikTok?
Das JS-Token. Das normale Token ruft statisches HTML ab, was auf TikTok dieselbe leere Hülle wie ein einfacher Abruf ist. Das JS-Token rendert die Seite in einem echten Browser, bevor es das HTML zurückgibt, sodass die Kommentarelemente vorhanden sind, wenn BeautifulSoup sie parst.
Wie lade ich mehr als den ersten Stapel Kommentare?
Übergeben Sie scroll: "true" an die Crawling API, damit der Headless-Browser die Seite scrollt und TikToks Infinite Loading auslöst. Der scroll_interval-Parameter steuert in Millisekunden, wie lange er zwischen den Scrolls wartet; ein längeres Intervall lädt mehr Kommentar-Stapel auf Kosten von mehr Wartezeit pro Anfrage. Stimmen Sie es darauf ab, wie viele Kommentare Sie tatsächlich benötigen, und halten Sie das Volumen moderat.
Welche TikTok-Kommentardaten sind sicher zu sammeln?
Nur öffentliche Kommentare zu öffentlichen Videos, und idealerweise nur aggregiert: Kommentartext zu Themen und Stimmungen zusammengefasst, plus Like- und Antwort-Zählungen als Zahlen. Private Accounts, login-gesperrte Inhalte, Direktnachrichten und jeder Versuch, einzelne Kommentierenden zu profilieren, sind verboten. Benutzernamen und Kommentartext sind personenbezogene Daten, also minimieren Sie das, was Sie aufbewahren, und de-identifizieren Sie, wo möglich.
Sollte ich statt Scraping die offizielle TikTok API verwenden?
Für jede echte, fortlaufende oder kommerzielle Nutzung ja. Die offizielle TikTok API, einschließlich der Research API, wenn Sie sich qualifizieren, ist der genehmigte Weg: Sie gibt definierte Bedingungen, garantierte Struktur und hält Sie in TikToks Regeln. Das Scrapen einer kleinen Stichprobe öffentlicher Kommentare eignet sich für leichtgewichtige, aggregierte Recherchen ohne API-Zugang, solange Sie die Bedingungen, robots.txt, Ratenlimits und das Datenschutzrecht respektieren.
Wie vermeide ich das Blockieren beim Scrapen von TikTok-Kommentaren?
Halten Sie Ihre IP-Anfragerate niedrig, verteilen Sie Ihre Scroll-Renderings statt sie eng zu schleifen, halten Sie das Volumen bei einer repräsentativen Stichprobe und leiten Sie über rotierende Residential-IPs weiter, sodass keine einzelne Adresse ein Ratenlimit auslöst. Die Crawling API verwaltet Rotation und einen vertrauenswürdigen IP-Pool für Sie. Beobachten Sie die cb_status-Werte und weichen Sie zurück, sobald Sie anfangen, Herausforderungen zu sehen. Für eine tiefere Übersicht lesen Sie unsere Zusammenstellung der besten TikTok-Scraper zur Datenerhebung.
Crawlen Sie jede Website im großen Maßstab, ohne gegen die Infrastruktur zu kämpfen.
Crawlbase übernimmt Proxys, Fingerprints und CAPTCHAs, damit Ihr Team Datenpipelines ausliefert, statt Crawl-Infrastruktur zu pflegen. 1.000 Anfragen kostenlos, keine Karte erforderlich.
