Open Data ist einer der stillen Vorteile moderner Analytik. Regierungen, Forschungseinrichtungen und gemeinnützige Organisationen veröffentlichen riesige, frei nutzbare Datensätze, und die meisten Teams schöpfen diese nie aus. Richtig eingesetzt, speist Open Data die Trendanalyse, misst die Auswirkungen von Sozialpolitik, schärft Produktentscheidungen und stützt ein Modell auf echte Zahlen statt auf Vermutungen.

Dieser Leitfaden sammelt solide, wirklich kostenlose Open-Data-Quellen, gruppiert nach Thema, damit Sie direkt zu dem springen können, was Ihr Projekt benötigt: Wirtschaft und Finanzen, Regierung, Gesundheit, Wissenschaft, Akademie, Umwelt, Kriminalität, Unternehmensverzeichnis, Medien, Soziales sowie einige Sammel-Repositorien. Zu jeder Quelle erfahren Sie, was sie bietet und wie sie typischerweise genutzt wird, plus eine kurze Anmerkung am Ende zum verantwortungsvollen Umgang mit Open Data.

Was ist Open Data?

Open Data sind Daten, auf die jeder zugreifen, die jeder nutzen und teilen kann, ohne dafür zu bezahlen oder eine besondere Genehmigung einzuholen. In der Praxis beruht das auf drei Ideen. Jeder kann darauf zugreifen, d.h. die Dateien sind öffentlich zugänglich und nicht hinter abgelehnten Anfragen oder längst veralteten Formaten versteckt. Jeder kann sie nutzen, d.h. Einzelpersonen, Unternehmen und Regierungen dürfen darauf frei aufbauen, und sie schließen die sensiblen persönlichen Informationen aus, die niemals öffentlich sein sollten. Jeder kann sie teilen, d.h. die Daten können weitergenutzt und weitergegeben werden.

Behörden und gemeinnützige Organisationen hosten den Großteil davon, weil die Speicherung und Bereitstellung von Daten in großem Maßstab kostspielig ist und sie dies bereits als Teil ihres Auftrags tun. Vieles davon trägt eine Lizenz wie Creative Commons, die es ermöglicht, die Daten frei zu nutzen, und gleichzeitig vorgibt, wie die Quelle anzugeben ist. Diese Lizenz ist der Teil, den die meisten Menschen überspringen, und es ist der Teil, der Ihre Nutzung sauber hält. Lesen Sie sie also, bevor Sie auf einem Datensatz aufbauen.

Viele Quellen, ein Projekt. Regierungs-, wissenschaftliche, Finanz- und Gesundheitsportale veröffentlichen jeweils offene Datensätze, die Sie in einem einzigen Projekt kombinieren können, solange Sie jede Lizenz respektieren.

Wirtschafts- und Finanzdaten

Märkte, Handelsströme und makroökonomische Indikatoren, nützlich für Forschung, Dashboards und alles, was eine zuverlässige Basiszahl benötigt.

Global Financial Data

GFD bietet kostenlose Abonnements, die globale Markt- und Wirtschaftsdaten eröffnen, zusammen mit Periodika, Büchern und einem umfangreichen Archiv historischer Reihen. Es ist ein guter Ausgangspunkt, wenn Sie lange Zeiträume statt nur aktueller Zahlen benötigen.

U.N. Comtrade Database

Kuratiert von Comtrade Labs, deckt diese kostenlose Datenbank den globalen Handel ab und stellt ihn über ein API bereit, sodass Sie Zahlen programmgesteuert abrufen können, anstatt Tabellenkalkulationen von Hand herunterzuladen. Sie enthält auch Werkzeuge zur Visualisierung und Extraktion der Daten.

World Bank Open Data

Eine der besten Einzelquellen für BIP, Logistik, globalen Energieverbrauch sowie die Auszahlung und Verwaltung globaler Mittel. Sie wird regelmäßig aktualisiert, und einige Datensätze werden mit eigenen Visualisierungswerkzeugen geliefert.

Financial Times

Obwohl es sich als Online-Zeitung präsentiert, ist die Financial Times auch eine breite Informationsquelle zu globalen Märkten in Nord- und Südamerika, Europa, Afrika und Asien, was sie für qualitatives Kontextwissen rund um die Rohdaten nützlich macht.

Regierungs- und globale Daten

Nationale Statistikämter und zwischenstaatliche Organisationen veröffentlichen einige der reichhaltigsten offenen Daten überhaupt, die alles von Kriminalität bis Demografie abdecken.

Data.gov.uk

Das britische Gegenstück zum amerikanischen data.gov, das Kategorien von Kriminalität und Justiz bis hin zu Verteidigung und Staatsausgaben umfasst. Eine praktische erste Anlaufstelle für alle, die mit britischen öffentlichen Daten arbeiten.

U.K. Data Service

Eine Ergänzung zu Data.gov.uk mit aktuellen Datensätzen zu sozialen Trends, Politik, Finanzen und internationalen Beziehungen, die stärker auf die Forschungsgemeinschaft ausgerichtet ist.

Open Data Network

Eine Suchmaschine für offene Datensätze mit erweiterten Filtern, die helfen, Daten zu öffentlicher Sicherheit, Finanzen, Infrastruktur, Wohnen und Entwicklung schnell zu finden, anstatt Seite für Seite zu durchsuchen.

UNICEF

Offene Datensätze, die weltweite Entwicklungen bei Kindern und Frauen überwachen und dokumentieren, einschließlich Krankheitsausbrüchen, Geschlecht und Bildung sowie Einstellungen zu sozialen Normen.

Data.gov

Eines der umfassendsten Open-Data-Portale der Welt, das von Wissenschaft und Forschung bis hin zu Fertigung und Klima reicht. Die Daten liegen in CSV, JSON und XML vor, und die Metadaten werden regelmäßig aktualisiert, sodass Sie darauf vertrauen können, dass das, was Sie abrufen, aktuell ist. Wenn Sie die Daten in eine Tabellenkalkulation oder Datenbank laden möchten, helfen unsere Hinweise zu JSON versus CSV bei der Wahl des richtigen Formats.

U.S. Census Bureau

Die maßgebliche offene Quelle für demografische Daten zu US-Einwohnern, zusammengestellt aus Bundes-, Landes- und Kommunalregierungen sowie privaten Unternehmen. Unverzichtbar für Bevölkerungs-, Wohnungs- und wirtschaftsdemografische Arbeiten.

Gesundheitsdaten

Öffentliche Gesundheitsbehörden und Forschungsinstitute veröffentlichen detaillierte Gesundheitsdatensätze, die für Forscher, politische Entscheidungsträger und alle, die Tools im Gesundheitsbereich entwickeln, wertvoll sind.

HealthData.gov

Ein Repository mit mehr als 3.000 Datensätzen, die über 125 Jahre umfassen und Unternehmern, Forschern und politischen Entscheidungsträgern Zugang zu hochwertigen Gesundheitsdaten bieten.

Broad Institute

Eine klare, übersichtlich strukturierte Quelle offener Gesundheits- und wissenschaftlicher Forschungsdaten mit besonderer Tiefe bei verschiedenen Krebsarten.

Food and Drug Administration (FDA)

Die FDA veröffentlicht Daten zu lebensmittelbedingten Erkrankungen und Kontaminanten, Rückrufen sowie Neuigkeiten über Nahrungsergänzungsmittel in den Vereinigten Staaten.

National Cancer Institute

Teil der National Institutes of Health und eine Ergänzung zum Broad Institute mit erweiterten Filtern, mit denen Sie auf spezifische krebsbezogene Datensätze eingrenzen können.

Weltgesundheitsorganisation

Eines der umfassendsten globalen Repositorien für Sterblichkeitsraten, Krankheitsausbrüche, psychische Erkrankungen und Gesundheitsfinanzierung.

Center for Disease Control

Das CDC bietet eine breite Palette kostenloser Datensätze zu chronischen Erkrankungen, Krebs, Herzerkrankungen, angeborenen Erkrankungen und vielem mehr.

NHS Digital

Ein einfach zu nutzender kostenloser Dienst, der hochwertige Datensätze zum Zustand der Gesundheits- und Sozialpflegesysteme in England bereitstellt.

Wissenschaftliche Daten

Erd-, Weltraum- und interdisziplinäre Forschungsdaten, oft in sehr großem Maßstab.

NASA Earth Data

Kostenlose Erdwissenschaftsdaten der NASA mit Messungen aus der Atmosphäre, der Kryosphäre, dem Land, dem Ozean und der kalibrierten Strahlungsintensität der Sonne.

Open Science Data Cloud

Das OSDC hält mehr als ein Petabyte an großen Datensätzen und ermöglicht es wissenschaftlichen Forschern, offene Daten über viele Disziplinen hinweg effizient zu verwalten, zu teilen und zu analysieren.

NASA Planetary Data System

Tausende offene Datensätze über die Planeten in unserem Sonnensystem, verfügbar für Forscher, Pädagogen, Studierende und die breite Öffentlichkeit.

Akademische Daten

Bildungsstatistiken, Umfrageforschung und wissenschaftliche Arbeiten, nützlich für Institutionen, Sozialwissenschaftler und Literaturrecherchen.

National Center for Education Statistics

Das NCES veröffentlicht Datensätze, die Bildungseinrichtungen nutzen, um Verbleib- und Abschlussquoten zu verbessern und zu verstehen, wie Studierende lernen.

Pew Research Center

Eine der größten offenen Datenquellen des Landes, die hochwertige Umfragedatensätze aggregiert. Umfragedaten werden typischerweise zwei Jahre nach der Veröffentlichung des Berichts freigegeben, und für den Zugang erstellen Sie ein kostenloses Konto.

Google Scholar

Die Suche nach Datensätzen hier funktioniert ähnlich wie bei einer normalen Suchmaschine und gibt Ihnen Zugang zu einem breiten Pool an pädagogischen, begutachteten Quellen.

Umweltdaten

Energie-, Klima- und Umweltgesundheitsdatensätze für Nachhaltigkeitsforschung und Berichterstattung.

IEA Atlas of Energy

Offene Datensätze der Internationalen Energieagentur, die es ermöglichen, globale Verbrauchsraten für Energie und Strom einzusehen.

Climate Data Online

CDO ist eine starke Quelle für historische und nahezu Echtzeit-Klimadaten weltweit, einschließlich Tageszusammenfassungen, Meeresdaten und Wetterradar.

National Center for Environmental Health

Kuratiert vom CDC, hebt dieses Repository nationale Datensysteme hervor, die öffentliche Gesundheits- und Umweltdaten aus einer landesweiten Perspektive erheben.

Crawlbase Crawling API

Viele dieser Portale stellen APIs bereit, doch zahlreiche nützliche öffentliche Daten befinden sich noch immer auf gewöhnlichen Webseiten, die mit JavaScript gerendert werden oder den Datenverkehr bei hoher Last drosseln. Wenn die Quelle eine Website statt eines sauberen Downloads ist, ruft die Crawlbase Crawling API die Seite für Sie ab und gibt das HTML zurück, übernimmt dabei das JavaScript-Rendering, die IP-Rotation und CAPTCHAs, damit die Erfassung nicht ins Stocken gerät. Sie behalten Ihren eigenen Parse-Code und starten mit bis zu 20.000 kostenlosen Anfragen.

Kriminalitäts- und Drogendaten

Strafjustiz- und Suchtmissbrauchs-Datensätze, hauptsächlich von US-Bundesbehörden und den Vereinten Nationen.

National Archive of Criminal Justice Data

Das NACJD stellt öffentliche und zugangsbeschränkte Datensätze zu Rückfälligkeit, Bandengewalt, Terrorismus, Hassverbrechen und mehr bereit.

National Institute on Drug Abuse

NIDA hostet Datensätze, die für jeden relevant sind, der Tabak-, Alkohol-, Drogen- und Opioidmissbrauch in den Vereinigten Staaten untersucht.

Uniform Crime Reporting Program

Das FBI aggregiert Statistiken von mehr als 18.000 Städten, Hochschulen, Landkreisen, Bundesstaaten und Stämmen durch dieses Programm.

Bureau of Justice Statistics

Über arretierungsbezogene Todesfälle hinaus erhebt das BJS Kennzahlen wie jährliche Notaufnahmedaten und Schusswaffenanfragen.

Büro der Vereinten Nationen für Drogen- und Verbrechensbekämpfung

Das UNODC veröffentlicht regelmäßig Datensätze zu Drogenproduktion und -handel, Mordraten, Korruption und organisierter Kriminalität.

Unternehmensverzeichnis-Daten

Unternehmensdaten und Bewertungsdaten, nützlich für Marktforschung, Wettbewerbsanalyse und Lead-Generierung.

Open Corporates

Eine der weltgrößten offenen Unternehmensdatenbanken mit Hunderten von Millionen Unternehmensdatensätzen aus nahezu jedem Land.

Glassdoor

Jobbewertungsseiten enthalten eine überraschende Menge an offenen Daten. Auf Glassdoor finden Sie Analysen zur Geschlechterlohnlücke, monatliche Gehaltsberichte und lokale Gehaltsberichte.

Yelp

Die offenen Datensätze von Yelp enthalten Millionen von Unternehmensbewertungen, die Sie analysieren können, um Muster und Trends in der Unternehmenswahrnehmung aufzudecken.

Medien- und Journalismusdaten

Nachrichtenarchive und datenjournalistische Quellen, oft über Entwickler-APIs verfügbar.

Associated Press Developer

Die Entwicklerdienste der AP ermöglichen es, Integrationen rund um Nachrichteninhalte, Umfragedaten und Metadaten zu erstellen, ähnlich wie beim Entwicklernetzwerk der New York Times.

FiveThirtyEight

Eine weithin respektierte datenjournalistische Quelle, die Themen von Politik bis Sport abdeckt und Datensätze bereitstellt, die ihre veröffentlichten Analysen unterstützen.

The New York Times Developer Network

Registrieren Sie eine App und Sie können auf NYT-Abstracts, Links, Multimedia, Bücher, Listen und Geschichten zugreifen, mit Texten die bis 1851 zurückreichen.

Marketing- und Social-Media-Daten

Echtzeit-Sentiment, Suchinteresse und Social-Graph-Daten für Vermarkter und Analysten.

Social Mention

Eine Suchmaschine für Echtzeit-Sozialdaten, die Sentiment, Keyword-Nutzung, Nutzer und Hashtags in großem Maßstab aufzeigt.

Google Trends zeigt, wonach die Welt sucht, was es Vermarktern ermöglicht, Kampagnen rund um wachsendes Interesse zu terminieren, anstatt zu raten.

Graph API

Das Graph API ist eine Sammlung von APIs, die es Apps ermöglichen, Daten aus dem Facebook Social Graph zu lesen und zu schreiben. Betrachten Sie es als strukturiertes Fenster in öffentliche Facebook-Daten, und beachten Sie, dass der Zugang durch Facebooks eigene Nutzungsbedingungen geregelt wird.

Weitere Repositorien und Aggregatoren

Sammelquellen, die viele der oben genannten Datensätze und einige ungewöhnliche konsolidieren.

Google Public Data Explorer

Viele der Quellen auf dieser Liste sind hier konsolidiert, was es zu einem ausgezeichneten Ausgangspunkt macht, wenn Sie nicht wissen, wo Sie suchen sollen. Google Dataset Search ergänzt ihn als kostenlose Möglichkeit, Datensätze im Internet zu finden.

Datasets SubReddit

Eine Reddit-Community, in der Menschen interessante Datensätze teilen, die oft in Sprachen wie R gescrapt oder zusammengestellt wurden, nützlich zum Finden von Nischendaten abseits ausgetretener Pfade.

DBpedia

Stellen Sie sich Wikipedia als Datenbank statt als Website vor. DBpedia ermöglicht es, Millionen von Wikipedia-Einträgen und die Beziehungen zwischen ihnen über eine einzige Abfrageschnittstelle zu erkunden, weshalb es KI-Projekte bei Unternehmen wie Apple, Google und IBM unterstützt hat.

Ist Big Data Open Source?

Ein wachsender Anteil der Big-Data-Werkzeuge ist Open Source, darunter Datenbanksysteme wie MongoDB, ein skalierbarer NoSQL-Speicher, der gut für Big-Data-Workloads geeignet ist. Open-Source-Komponenten decken auch den Rest der Pipeline ab, von der Datenerfassung und -aufnahme über die Verarbeitung bis zur Speicherung, sodass Sie einen vollständigen Stack ohne proprietäre Lizenzierung zusammenstellen können. Offene Werkzeuge und offene Daten passen gut zusammen: Kostenlose Datensätze liefern die Eingabe, und Open-Source-Systeme bieten den Ort, an dem sie gespeichert werden.

Open Data verantwortungsvoll nutzen

Kostenlos bedeutet nicht bedingungslos. Die meisten offenen Datensätze tragen eine Lizenz, oft Creative Commons, die Ihnen mitteilt, wie Sie die Daten verwenden dürfen und wie Sie die Quelle angeben müssen. Lesen Sie diese und geben Sie die Quelle korrekt an. Wenn eine Quelle ein API bereitstellt, bevorzugen Sie dieses gegenüber dem Scraping der Seite und halten Sie die Ratenlimits und Nutzungsbedingungen ein. Wenn ein Datensatz personenbezogene Informationen berührt, behandeln Sie ihn unter Regeln wie DSGVO und CCPA, auch wenn die Daten technisch öffentlich sind. Wenn Sie von Webseiten statt von Downloads erfassen, halten Sie Ihre Anfragerate angemessen und respektieren Sie die robots.txt jeder Seite. Das Ziel ist, ein guter Akteur im Open-Data-Commons zu sein, von dem Sie profitieren. Sobald die Daten vorliegen, helfen Ihnen unsere Leitfäden zum Strukturieren und Bereinigen von Daten und zum Analysieren mit pandas, Rohdateien in Erkenntnisse umzuwandeln.

Zusammenfassung

Wichtigste Erkenntnisse

  • Open Data bedeutet Zugriff, Nutzung und Weitergabe. Ein Datensatz gilt als offen, wenn jeder ihn erreichen, darauf aufbauen und ihn frei weitergeben kann, in der Regel unter einer Lizenz wie Creative Commons.
  • Beginnen Sie mit der Kategorie, die Sie benötigen. Wirtschaft, Regierung, Gesundheit, Wissenschaft, Akademie, Umwelt, Kriminalität, Wirtschaft, Medien und Soziales haben jeweils etablierte kostenlose Quellen. Wählen Sie die Gruppe vor der Quelle.
  • Regierungs- und zwischenstaatliche Portale sind das Rückgrat. Data.gov, das U.S. Census Bureau, die Weltbank, die WHO und ähnliche Einrichtungen veröffentlichen einige der tiefsten und am besten gepflegten offenen Daten überhaupt.
  • Aggregatoren sparen Recherchezeit. Google Public Data Explorer, Google Dataset Search und DBpedia konsolidieren viele Quellen, was der schnellste Einstieg ist, wenn Sie nicht wissen, wo Sie suchen sollen.
  • Respektieren Sie die Lizenz und die Regeln. Lesen Sie die Lizenz, geben Sie die Quelle an, bevorzugen Sie APIs gegenüber Scraping, und wenden Sie Datenschutzrecht an, wenn personenbezogene Daten betroffen sind.

Häufig gestellte Fragen

Was ist der Unterschied zwischen Open Data und kostenlosen Daten?

Alle Open Data sind kostenlos zu erhalten, aber Open Data geht weiter: Sie müssen auch frei nutzbar und weitergebbar sein, in der Regel unter einer expliziten Lizenz. Einige Daten sind kostenlos einsehbar, aber in ihrer Nutzung oder Weitergabe eingeschränkt. Prüfen Sie daher die Lizenz, anstatt anzunehmen, dass kostenlos offen bedeutet.

Mit welcher Open-Data-Quelle soll ich beginnen?

Beginnen Sie mit Ihrem Thema. Für breite US-Regierungsdaten ist Data.gov der natürliche Einstiegspunkt; für globale Wirtschaft die Weltbank; für Demografie das U.S. Census Bureau; für Gesundheit die WHO oder HealthData.gov. Wenn Sie nicht wissen, wo Sie suchen sollen, aggregieren Google Public Data Explorer und Google Dataset Search viele Quellen an einem Ort.

Kann ich Open Data in einem kommerziellen Produkt verwenden?

Oft ja, aber es hängt vollständig von der Lizenz ab, die dem jeweiligen Datensatz beigefügt ist. Viele offene Lizenzen, einschließlich der meisten Creative-Commons-Varianten, erlauben kommerzielle Nutzung, solange Sie die Quelle korrekt angeben. Lesen Sie stets die Lizenzbedingungen für jeden Datensatz, bevor Sie etwas darauf Aufgebautes veröffentlichen.

Muss ich Open Data scrapen oder kann ich ihn herunterladen?

Die meisten großen Portale bieten direkte Downloads in CSV, JSON oder XML oder ein API an, und das sollte immer Ihre erste Wahl sein. Scraping kommt nur dann in Frage, wenn nützliche öffentliche Daten auf Webseiten ohne Download oder API zu finden sind. Erfassen Sie diese in diesem Fall höflich und im Rahmen der Nutzungsbedingungen der Seite.

Ist Big Data dasselbe wie Open Data?

Nein. Big Data beschreibt den Umfang und die Komplexität von Datensätzen, während Open Data deren Lizenzierung und Zugänglichkeit beschreibt. Ein Datensatz kann offen sein, ohne groß zu sein, und große Datensätze sind häufig proprietär. Sie überschneiden sich, wenn ein großer Datensatz auch offen veröffentlicht wird, wie es bei mehreren Quellen auf dieser Liste der Fall ist.

Wie halte ich meine Open-Data-Nutzung konform?

Lesen und befolgen Sie die Lizenz jedes Datensatzes, geben Sie die Quelle wie gefordert an, bevorzugen Sie offizielle APIs gegenüber Scraping, und respektieren Sie Ratenlimits und robots.txt, wenn Sie von Seiten erfassen. Wenn die Daten personenbezogene Informationen enthalten, behandeln Sie sie unter den geltenden Datenschutzgesetzen wie DSGVO und CCPA, obwohl die Daten öffentlich sind.

Jetzt loslegen

Crawlen Sie jede Website im großen Maßstab, ohne gegen die Infrastruktur zu kämpfen.

Crawlbase übernimmt Proxys, Fingerprints und CAPTCHAs, damit Ihr Team Datenpipelines ausliefert, statt Crawl-Infrastruktur zu pflegen. 1.000 Anfragen kostenlos, keine Karte erforderlich.

Self-Service · Kein Verkaufsgespräch erforderlich · Enterprise-Crawl-Volumen verfügbar