Eine Aggregator-Website erledigt eine Aufgabe gut: Sie zieht viele verstreute Quellen an einem einzigen Ort zusammen, den ein Leser in einer Sitzung überfliegen kann. Google News sammelt Schlagzeilen von Tausenden von Medien, Indeed und Jooble bündeln Stellenanzeigen aus dem gesamten Web, und Seiten wie Trivago stellen Angebote von Dutzenden von Anbietern gegenüber. Jede von ihnen nimmt Informationen, die Sie sonst dazu zwingen würden, zwanzig Tabs zu öffnen, und präsentiert sie als einen organisierten Feed.
Dieser Leitfaden erklärt von Grund auf, wie diese Websites aufgebaut sind. Sie erfahren, was ein Aggregator wirklich ist, wie Sie eine Nische und vertrauenswürdige Quellen auswählen, wie Sie die Daten mit einem Crawler oder einer API erfassen, wie Sie sie normalisieren und deduplizieren, damit Einträge von verschiedenen Seiten übereinstimmen, wie Sie sie speichern und planmäßig aktualisieren, wie Sie sie präsentieren und wie Sie all das verantwortungsvoll tun. Am Ende sollten Sie in der Lage sein, die Architektur Ihres eigenen Nachrichten-, Jobs-, Produkt-, Immobilien- oder Angebots-Aggregators zu skizzieren.
Was ist eine Aggregator-Website?
Eine Aggregator-Website ist eine Seite, die Inhalte oder Einträge aus mehreren externen Quellen sammelt und sie unter einem Dach zusammen anzeigt, geordnet nach Thema, Kategorie oder Filter. Der Aggregator besitzt in der Regel nicht die zugrunde liegenden Inhalte. Er sammelt, strukturiert und verlinkt auf sie, wobei er Mehrwert durch Abdeckung, Organisation, Suche und Aktualität schafft, nicht durch originäre Berichterstattung.
Das Muster taucht in vielen Nischen auf. Nachrichtenaggregatoren (Google News, Feedly, Flipboard, Apple News) sammeln Artikel nach Thema. Jobaggregatoren (Indeed, Jooble) bündeln Stellenanzeigen von Unternehmens-Karriereseiten und anderen Boards. Produkt- und Angebotseiten (Groupon für zeitlich begrenzte Angebote, BoardGameOracle für Händlerpreise, Preisvergleichsseiten generell) stellen dasselbe Produkt über viele Shops hinweg gegenüber. Immobilienportale sammeln Immobilienanzeigen, und Reiseseiten wie Tripadvisor begannen als Tarifaggregatoren, bevor sie sich ausdehnten. Gemeinschaften wie Reddit sind Aggregatoren sozialer Art, die Links oberflächlich darstellen, die die Masse lesenswert findet.
Der Grund, warum Unternehmen und Leser diese Seiten schätzen, ist einfach: Sie ersetzen einen Haufen separater Tools und Tabs durch eine einzige umfassende Ansicht. Diese eine Ansicht macht es einfacher, Trends zu erkennen, Optionen zu vergleichen und zu einem Thema auf dem Laufenden zu bleiben, ohne jede ursprüngliche Quelle von Hand zu besuchen. Derselbe Vorteil ist der Grund, warum Unternehmen interne Aggregatoren aufbauen, um Wettbewerber, Preise und Marktsignale zu beobachten, eine Nutzung, die wir im Artikel zu Web Crawling zur Lead-Generierung behandeln.
Eine Nische und Ihre Quellen wählen
Bevor Sie Code schreiben, entscheiden Sie, was Ihr Aggregator abdeckt und woher seine Daten kommen. Eine fokussierte Nische schlägt fast immer eine allgemeine. "Remote-Datentechnik-Jobs", "Brettspielpreise im Vereinigten Königreich" oder "Mietanzeigen in einem Ballungsraum" gibt Ihnen eine klare Menge von Quellen, ein klares Publikum und einen vertretbaren Existenzgrund neben den Giganten. Der Versuch, "alle Nachrichten" oder "alle Produkte" zu aggregieren, stellt Sie von Tag eins gegen Google.
Sobald die Nische festgelegt ist, erstellen Sie eine Quellenliste. Bevorzugen Sie für jede Kandidatenquelle in dieser Reihenfolge: eine offizielle API, dann einen RSS- oder Atom-Feed, dann einen veröffentlichten Datenexport und erst dann das Scrapen von Seiten. Viele Nachrichtenquellen veröffentlichen RSS, Job-Boards und Marktplätze stellen oft APIs oder Partner-Feeds bereit, und Immobiliendaten sind häufig über lizenzierte MLS-Feeds verfügbar. Feeds und APIs zuerst zu wählen ist nicht nur einfacher zu warten; es ist der zuverlässigste und respektvollste Weg, und es hält Sie auf der richtigen Seite der meisten Nutzungsbedingungen. Behalten Sie das Scrapen für Quellen, die wirklich keinen strukturierten Zugriff bieten, und sammeln Sie selbst dann nur die öffentlichen Eintragsfelder, die Sie benötigen.
Was auch immer die Quelle ist, prüfen Sie sie auf Qualität. Ein Aggregator erbt den Ruf dessen, was er oberflächlich zeigt, also schützt das Vertrauen in glaubwürdige, gut gepflegte Quellen Sie davor, veraltete oder falsche Informationen zu verbreiten. Schreiben Sie pro Quelle auf, welche Felder Sie abrufen werden (für eine Stelle: Titel, Unternehmen, Ort, Gehaltsspanne, Link; für eine Immobilie: Preis, Schlafzimmer, Badezimmer, Quadratmeter, Ort, Anzeigenlink), damit der spätere Normalisierungsschritt eine Zielform hat, in die er abbilden kann.
Wie ein Aggregator Schritt für Schritt aufgebaut wird
Hinter der Startseite ist jeder Aggregator dieselbe kurze Pipeline: Von jeder Quelle sammeln, die Ergebnisse in eine Form normalisieren, deduplizieren, speichern, planmäßig aktualisieren und präsentieren. Die folgenden Schritte gehen jeden Schritt in der Reihenfolge durch, in der Sie ihn aufbauen würden.
Daten mit einem Crawler oder einer API erfassen
Die Erfassung ist der Schritt, der jede Quelle wiederkehrend abruft. Für Feeds und APIs ist dies eine höfliche, geplante Anfrage, die strukturierte Datensätze zurückgibt, die Sie direkt parsen können. Für Quellen, die nur als Webseiten existieren, benötigen Sie einen Crawler, der das HTML abruft, und einen Parser, der Ihre Zielfelder mit CSS-Selektoren oder XPath extrahiert. Viele moderne Eintragsseiten (Immobilienportale, Job-Boards, Marktplätze) rendern ihre Inhalte mit JavaScript, sodass ein einfacher HTTP-Abruf eine leere Hülle zurückgibt. Diese Seiten benötigen einen Crawler, der JavaScript ausführt, was der Punkt ist, an dem die meisten selbst erstellten Aggregatoren zu kämpfen beginnen.
In kleinem Maßstab können Sie das selbst mit einer Bibliothek wie Requests und BeautifulSoup oder einem Headless-Browser betreiben. Wenn Sie Quellen hinzufügen und sie häufig betreiben, verstärken sich drei Probleme: Seiten, die einen echten Browser zum Rendern benötigen, IP-basierte Ratenbeschränkungen und Blockierungen und gelegentliche CAPTCHAs. Diese zuverlässig über viele Seiten hinweg zu lösen, ist laufende Infrastrukturarbeit, die nichts mit Ihrem eigentlichen Produkt zu tun hat. Wenn Sie hier zwischen Eigenbau und Kauf abwägen, gehen unsere Hinweise zum Aufbau einer skalierbaren Web-Datenpipeline tiefer auf den Aufwand ein.
Die Erfassungsschicht eines Aggregators muss JavaScript-Seiten rendern, IPs rotieren und Blockierungen für jede Quelle überwinden, die Sie hinzufügen, was genau die Klempnerarbeit ist, die diese Projekte aufhält. Die Crawlbase Crawling API übernimmt Rendering, Proxy-Rotation und CAPTCHA-Verarbeitung serverseitig und gibt saubere Seiten zurück, und der asynchrone Crawler stellt große Jobs in Warteschlangen, sodass Sie viele Quellen im Maßstab aktualisieren können. Starten Sie mit bis zu 20.000 kostenlosen Anfragen, keine Kreditkarte erforderlich, und zahlen Sie nur für erfolgreiche Anfragen.
Daten in eine Form normalisieren
Jede Quelle beschreibt dieselbe Sache anders. Ein Job-Board nennt es job_title, ein anderes position; eine Immobiliensite listet den Preis als "$450,000" und eine andere als 450000; Datumsangaben kommen in einem Dutzend Formaten an. Normalisierung ist der Schritt, der jede Quelle in ein konsistentes Schema abbildet, auf das sich Ihre Site verlassen kann. Sie definieren vorab eine einzige Datensatzform, dann schreiben Sie für jede Quelle eine kleine Zuordnung, die jedes Feld in diese Form zieht, Zahlen und Datumsangaben in reale Typen parst und Leerzeichen und herumhängendes Markup entfernt.
Hier bereinigen Sie auch. Entfernen Sie Tracking-Parameter aus Links, standardisieren Sie Ortsnamen, konvertieren Sie Währungen, wenn Sie über Regionen hinweg aggregieren, und entscheiden Sie sich für Einheiten, damit "3 bd" und "3 beds" zum gleichen Wert werden. Die Ausgabe dieses Schritts ist ein sauberer, einheitlicher Satz von Datensätzen, der identisch aussieht, unabhängig davon, von welcher Seite er stammt. Wenn Ihr Aggregator schließlich Suche oder Empfehlungen speist, ist diese Konsistenz das, was das möglich macht; dieselbe Disziplin liegt jeder guten Datenpipeline-Architektur zugrunde.
Deduplizieren, damit jeder Eintrag einmal erscheint
Aggregatoren ziehen überlappende Quellen, sodass derselbe Job, Artikel oder dieselbe Immobilie routinemäßig mehr als einmal erscheint. Ohne Deduplizierung sieht Ihr Feed aufgebläht und unglaubwürdig aus. Der praktische Ansatz besteht darin, eine stabile Identität für jeden Datensatz zu berechnen und Wiederholungen zu löschen oder zusammenzuführen. Wo eine Quelle eine kanonische URL oder eine Eintrags-ID liefert, verwenden Sie diese. Wo nicht, erstellen Sie einen Fingerabdruck aus den Feldern, die einen Eintrag einzigartig machen, zum Beispiel ein normalisierter Titel plus Unternehmen plus Ort für einen Job oder Adresse plus Preis plus Schlafzimmeranzahl für eine Immobilie, und behandeln Sie übereinstimmende Fingerabdrücke als denselben Eintrag.
Wenn zwei Quellen einen Eintrag beschreiben, möchten Sie in der Regel zusammenführen statt verwerfen: Behalten Sie den reichhaltigeren Datensatz, bevorzugen Sie die maßgeblichste Quelle für den kanonischen Link und vermerken Sie, dass der Eintrag an mehreren Stellen erschien. Dies gut zu machen, ist ein kleines Datenabgleichsproblem, und es richtig zu machen, ist das, was einen sauberen Aggregator von einem unordentlichen unterscheidet.
Speichern und planmäßig aktualisieren
Die normalisierten, deduplizierten Datensätze landen in einem Speicher, typischerweise einer Datenbank, aus dem das Frontend liest. Zwei Designentscheidungen sind hier wichtig. Erstens: Behalten Sie für jeden Eintrag eine stabile Kennung, damit Sie beim erneuten Erfassen einer Quelle einen vorhandenen Datensatz aktualisieren können, anstatt ein Duplikat einzufügen. Zweitens: Verfolgen Sie die Aktualität: Speichern Sie, wann jeder Eintrag zuerst und zuletzt gesehen wurde, damit Sie Einträge als neu markieren, sie ausblenden können, wenn sie aus der Quelle verschwinden, und vermeiden, Jobs anzuzeigen, die abgelaufen sind, oder Angebote, die verfallen sind.
Aktualisierungsläufe laufen planmäßig entsprechend der Nische. Ein Breaking-News-Aggregator kann Feeds alle paar Minuten abfragen; ein Immobilien-Board kann sich ein paarmal täglich aktualisieren; eine wöchentliche Deals-Zusammenfassung kann nächtlich laufen. Ein einfacher Scheduler (ein Cron-Job, eine Queue oder ein verwalteter Task-Runner) löst die Erfassung jeder Quelle aus, die neuen Ergebnisse fließen durch Normalisierung und Deduplizierung, und der Speicher wird aktualisiert. Diese geplante Aktualisierung ist der Herzschlag des gesamten Systems: Es ist das, was den Aggregator aktuell hält, ohne dass jemand ihn von Hand berührt.
Den aggregierten Feed präsentieren
Mit sauberen Daten in einem Speicher ist das Frontend vergleichsweise unkompliziert. Wählen Sie eine Plattform, die zu Ihren Fähigkeiten und Ihrem Maßstab passt: ein CMS wie WordPress mit einem benutzerdefinierten Feed, ein Site-Builder oder ein Framework, das Sie kontrollieren. Die Oberfläche selbst entscheidet, ob Leser zurückkehren. Organisieren Sie Einträge in klare Kategorien, geben Sie Lesern Filter und Suche, die zur Nische passen (Ort und Gehalt für Jobs, Preis und Schlafzimmer für Immobilien, Thema für Nachrichten), und machen Sie es schnell auf einem Telefon, da ein großer Anteil des Nachrichten- und Eintragsverkehrs mobil ist.
Entscheidend: Jeder aggregierte Eintrag sollte auf seine ursprüngliche Quelle zurückverlinken. Dieser Link ist sowohl der Weg des Lesers zu den vollständigen Inhalten als auch Ihre Zuschreibung an den Herausgeber. Zeigen Sie genug von jedem Eintrag, um nützlich zu sein, eine Überschrift, einen Ausschnitt, ein Miniaturbild, Schlüsseleintragsfelder, und senden Sie den Klick dann weiter. Eine begleitende mobile App oder ein E-Mail-Digest kann die Reichweite erweitern, indem sie Benutzern ermöglicht, Kategorien zu folgen und Benachrichtigungen zu erhalten, wenn neue Einträge erscheinen, aber die Website ist der Kern. Dasselbe Sammel-Backend kann alle diese Oberflächen antreiben, da sie alle aus dem einen normalisierten Speicher lesen.
Inhalte verantwortungsvoll aggregieren
Ein Aggregator lebt von den Inhalten anderer, daher ist ein verantwortungsvoller Umgang damit nicht optional; er hält die Website legal und nachhaltig. Respektieren Sie die Nutzungsbedingungen jeder Quelle und ihre robots.txt, und halten Sie Ihre Anfragerate vernünftig, damit Sie die Server, auf die Sie angewiesen sind, nie belasten. Bevorzugen Sie offizielle Feeds und APIs gegenüber dem Scrapen, wo immer eine Quelle diese anbietet, sowohl weil sie zuverlässiger sind als auch weil sie den Zugriffsweg darstellen, den der Herausgeber ausdrücklich sanktioniert hat. Für lizenzierte Daten wie Immobilien-MLS-Feeds oder Partner-Job-APIs verwenden Sie das richtige Programm, anstatt es zu umgehen.
Zuschreibung ist die Kernethik der Aggregation. Nennen Sie immer die ursprüngliche Quelle und verlinken Sie direkt auf den vollständigen Eintrag, sodass Leser und Traffic zurück zum Herausgeber gehen, anstatt ihn einzufangen. Veröffentlichen Sie keine vollständigen urheberrechtlich geschützten Artikel, Fotos oder Einträge; zeigen Sie eine Überschrift, einen kurzen Ausschnitt und ein Miniaturbild und verlinken Sie dann hinaus. Das ist die Grenze zwischen einem legitimen Aggregator, den Herausgeber tolerieren und sogar willkommen heißen, und einer Scraper-Seite, die einfach kopiert. Schließlich, wenn ein Eintrag personenbezogene Daten berührt, behandeln Sie diese gemäß den relevanten Datenschutzregeln (DSGVO, CCPA) und beschränken Sie sich auf öffentliche, nicht-personenbezogene Eintragsfelder. So gemacht, ist Aggregation eine lange anerkannte, vertretbare Praxis; nachlässig gemacht, riskiert man Deindexierung und Schlimmeres.
Wichtigste Erkenntnisse
- Ein Aggregator macht aus vielen Quellen einen Feed. Er sammelt Inhalte oder Einträge aus externen Quellen, organisiert sie und verlinkt zurück, wobei er durch Abdeckung und Aktualität Mehrwert schafft, nicht durch originäre Inhalte.
- Wählen Sie eine enge Nische und prüfen Sie Ihre Quellen. Ein fokussiertes Thema schlägt den Wettbewerb mit den Giganten, und die Qualität der Quellen entscheidet über die Glaubwürdigkeit der gesamten Website. Bevorzugen Sie offizielle APIs und Feeds gegenüber dem Scrapen.
- Der Aufbau ist eine kurze Pipeline. Mit einem Crawler oder einer API sammeln, in ein Schema normalisieren, deduplizieren, speichern und planmäßig aktualisieren, bevor man präsentiert.
- Normalisierung und Deduplizierung sind der Ort, an dem Qualität entsteht. Jede Quelle in eine Form zu bringen und Wiederholungen zu entfernen, ist das, was Einträge von verschiedenen Seiten übereinstimmen lässt und vertrauenswürdig erscheinen lässt.
- Verantwortungsvoll aggregieren. Respektieren Sie Nutzungsbedingungen und robots.txt, bevorzugen Sie offizielle Feeds, schreiben Sie jeder Quelle zu und verlinken Sie auf sie, und veröffentlichen Sie niemals vollständige urheberrechtlich geschützte Inhalte.
Häufig gestellte Fragen
Was ist eine Aggregator-Website einfach erklärt?
Es ist eine Seite, die Inhalte oder Einträge aus vielen externen Quellen sammelt und sie zusammen an einem organisierten Ort anzeigt. Nachrichtenaggregatoren bündeln Schlagzeilen, Jobaggregatoren bündeln Stellenanzeigen, und Produkt- oder Angebots-Aggregatoren stellen dasselbe Produkt über viele Shops hinweg gegenüber. Der Aggregator besitzt in der Regel nicht die Inhalte; er sammelt, strukturiert und verlinkt auf sie.
Wie kommen Aggregator-Websites an ihre Daten?
Über eine Sammelschicht, die jede Quelle planmäßig abruft. Die besten Quellen sind offizielle APIs und RSS- oder Atom-Feeds, die strukturierte Daten direkt zurückgeben. Für Quellen, die nur als Webseiten existieren, ruft ein Crawler das HTML ab und ein Parser extrahiert die Zielfelder. Viele Eintragsseiten rendern mit JavaScript, daher benötigen sie einen Crawler, der einen echten Browser ausführt.
Was bedeutet es, aggregierte Daten zu normalisieren und zu deduplizieren?
Normalisierung bildet jede Quelle in eine konsistente Datensatzform ab, sodass ein Feld namens position auf einer Seite und job_title auf einer anderen an derselben Stelle landen, mit Preisen und Datumsangaben, die in reale Typen geparst werden. Deduplizierung entfernt die Wiederholungen, die auftreten, wenn überlappende Quellen denselben Eintrag auflisten, üblicherweise durch Abgleich einer kanonischen ID oder eines Fingerabdrucks, der aus den Feldern erstellt wurde, die einen Eintrag einzigartig machen.
Wie oft sollte ein Aggregator seinen Inhalt aktualisieren?
Das hängt von der Nische ab. Ein Breaking-News-Aggregator kann Feeds alle paar Minuten abfragen, ein Immobilien-Board ein paarmal täglich und eine wöchentliche Deals-Zusammenfassung nächtlich. Ein Scheduler löst die Erfassung jeder Quelle aus, die Ergebnisse fließen durch Normalisierung und Deduplizierung, und der Speicher wird aktualisiert. Das Verfolgen, wann jeder Eintrag zuerst und zuletzt gesehen wurde, ermöglicht es Ihnen, neue Einträge zu markieren und verschwundene Einträge auszublenden.
Ist es legal, eine Aggregator-Website aufzubauen?
Aggregation ist eine lang anerkannte Praxis, wenn sie verantwortungsvoll betrieben wird. Respektieren Sie die Nutzungsbedingungen und robots.txt jeder Quelle, halten Sie die Anfrageraten vernünftig, bevorzugen Sie offizielle Feeds und APIs und verwenden Sie lizenzierte Programme für lizenzierte Daten wie MLS-Feeds. Schreiben Sie der ursprünglichen Quelle immer zu und verlinken Sie auf sie, und veröffentlichen Sie niemals vollständige urheberrechtlich geschützte Inhalte; zeigen Sie eine Überschrift, einen Ausschnitt und ein Miniaturbild und verlinken Sie dann hinaus. Behandeln Sie alle personenbezogenen Daten gemäß DSGVO und CCPA.
Muss ich meinen eigenen Scraper schreiben, um anzufangen?
Nicht unbedingt. Sie können Ihre eigenen Collector bauen, aber im Maßstab müssen Sie JavaScript-Rendering, rotierende IPs und CAPTCHAs für jede Quelle handhaben, was erhebliche laufende Arbeit ist. Eine Scraping-API wie die Crawlbase Crawling API verwaltet diese Infrastruktur und gibt saubere Seiten zurück, sodass Sie Ihre Zeit darauf verwenden können, welche Quellen zu aggregieren sind und wie Sie diese normalisieren und präsentieren.
Crawlen Sie jede Website im großen Maßstab, ohne gegen die Infrastruktur zu kämpfen.
Crawlbase übernimmt Proxys, Fingerprints und CAPTCHAs, damit Ihr Team Datenpipelines ausliefert, statt Crawl-Infrastruktur zu pflegen. 1.000 Anfragen kostenlos, keine Karte erforderlich.
