business-Seiten auf theguardian.com scrapen

Der Aufruf, der heute business-Seiten von theguardian.com liefert, mit den Parametern, Mustern und Fehlerbildern aus dem Request-Log seit 14 Aug 2026.

99.8% Erfolg · Aug 2026Browser bei 28% der CallsStandard-Preis · 1 Credit

Gemessen auf Crawlbase

Erfolgsquote über jeden Request jedes Accounts im August 2026: 99.8%. Muster, Länder und Fehler stammen aus dem Request-Log seit 14 Aug 2026; 27.9% der erfolgreichen Aufrufe nutzten den JavaScript-Token, die mittlere Antwort dauerte 4.8s.

Unter den 74 Nachrichten und Medien-Websites im Cookbook steht theguardian.com nach Erfolgsrate auf Platz 16 von 74; der Median der Kategorie liegt bei 98.9%. Die mittlere Antwort von 4.8s ist langsamer als der Kategorie-Median von 2.3s. 58 der 74 nehmen den einfachen Token an; diese Website nur auf manchen Seiten.

Der Call

Artikelseiten sind die Form, die die Accounts hier am häufigsten abrufen, mit dem Land und dem Token, die am häufigsten Erfolg haben. Ersetzen Sie den Platzhalterpfad durch eine echte Artikel-URL der Website.

Im Playground ausführen
curl "https://api.crawlbase.com/?token=YOUR_TOKEN&url=https%3A%2F%2Fwww.theguardian.com%2Fbusiness%2F1234567%2Fexample-page"

Parameter, die zählen

ParameterWertWarum
countrynicht setzenDie meisten erfolgreichen Calls setzen kein country (88.0%) und sind zu 100% erfolgreich.
javascriptnicht setzenCalls mit normalem Token sind zu 100% erfolgreich, Calls mit JavaScript-Token zu 99.6%. Beides funktioniert; beginnen Sie ohne Browser und wechseln Sie pro URL-Muster dort, wo die Tabelle unten es zeigt.

URL-Muster, die Accounts abrufen

MusterAnteil der ErfolgeJavaScript-TokenCountryQuery-Parameter
/business/{id}/{slug}12.3%0.0%keinekeine
/world/{id}/{slug}11.5%4.3%keinekeine
/us-news/{id}/{slug}10.5%4.8%keinekeine
/technology/{id}/{slug}7.5%6.7%keinekeine
/football/{id}/{slug}6.0%66.7%keinekeine
/football/{slug}/{id}5.5%95.5%keinepage
/australia-news/{id}/{slug}5.0%0.0%keinekeine
/{slug}/{id}/{slug}3.5%7.1%keinekeine

Felder, die Sie bekommen

Eine Artikelseite trägt Überschrift, Datum und Autor, meist in einem ld+json-Article-Block, und den Text im HTML. Der Block nennt oft auch das Ressort.

Was kaputtgeht, und die Lösung

Bei den Fehlern seit 14 Aug 2026 hat die Website geantwortet mit:

591: 100% der Fehler Ein 5xx ist ein Fehler der Website, nicht des Abrufs. Wiederholen Sie nach einer Minute.

Nach Zeitplan ausführen

Nachrichten bewegen sich stündlich. Fragen Sie das Ressort oder die Sitemap nach neuen Links ab und übergeben Sie die Artikel-URLs dann mit Callback an den Crawler, damit die Abrufe getaktet werden. Die mittlere Antwort auf dieser Website liegt bei 4.8s.

Fragen

Brauche ich einen Browser, um theguardian.com zu scrapen?

Das hängt von der Seite ab. Calls mit normalem Token sind zu 100% erfolgreich, Calls mit JavaScript-Token zu 99.6%; die Tabelle der URL-Muster zeigt, welche Pfade Accounts mit Browser abrufen.

Was kostet eine theguardian.com-Seite auf Crawlbase?

1 Credit ohne Browser. theguardian.com liegt in der Stufe standard.

Welches country sollte ich für theguardian.com setzen?

Keines nötig: Die meisten erfolgreichen Calls lassen es ungesetzt.

Website-Namen bezeichnen die Seiten, die ein Rezept abruft. Crawlbase ist mit keiner gelisteten Website verbunden. Nutzen Sie Rezepte im Rahmen der Nutzungsrichtlinie.Gemessene Zahlen aus August 2026, monatlich aktualisiert