Daten finden und nutzen

Daten sind wertvoll. Nicht nur ist ihre Gewinnung meist zeit- und kostenintensiv (Experimentaldaten, abgeleitete Daten) – auch sind sie oft nicht oder nur schwer reproduzierbar (Beobachtungsdaten). Nicht zuletzt aus forschungsökonomischen Gründen wird daher der Nachnutzung von Daten wachsende Bedeutung beigemessen.

Von einer Nachnutzung von Daten spricht man, wenn bereits erhobene Forschungsdaten für spätere Forschungen im Rahmen anderer Projekte und / oder anderer Fragestellungen verwendet werden.

Potential zur Nachnutzung besteht bereits innerhalb von Instituten, Forschergruppen oder Projekten, wo leider oft genug nach Abschluss von Projekten oder mit dem Ausscheiden von Mitarbeitenden Daten und/oder notwendige Informationen für deren Nutzung verloren gehen. Damit Daten uneingeschränkt nachgenutzt werden können, müssen sie verständlich und interpretierbar sein. Erreichen kann man dies unter anderem durch:

  • Hinzufügen beschreibender Dokumente zur intellektuellen Einordnung der Daten
  • Klare Beschreibung der Nutzungsbedingungen (Lizenzbestimmungen)
  • Provenienz-Informationen als Basis einer Bewertung der Daten
  • Aufbereitung nach (Fach-)Standards

Möchten Sie selbst Daten von Dritten nutzen, etwa für Meta-Analysen, Erweiterung des eigenen wissenschaftlichen Schwerpunkts, Optimierung eigener Studiendesigns, Modellkalibrierungen u.v.m. stehen Sie oft vor der Herausforderung, nachnutzbare Daten zu finden (vgl. FAQ Wo finde ich Forschungsdaten?).

Für die Nachnutzung selbst müssen Sie unbedingt die jeweiligen Rechte (Lizenzen, ggf. Nutzungsverträge) beachten. Sie können u.a. festlegen, wer die Daten zu welchem Zweck und für welche Zeit nutzen darf.

Im Sinne der Guten Wissenschaftlichen Praxis muss eine Datennutzung außerdem äquivalent zu einer Textzitation dokumentiert werden (vgl. Wie zitiere ich Forschungdaten?)

FAQ

Bereits vorhandene Forschungsdaten können eine wertvolle Grundlage für die eigene Forschung sein. Vor der Erhebung neuer Daten lohnt es sich daher zu prüfen, ob geeignete Datensätze bereits verfügbar sind. Da es keinen zentralen Nachweis für alle Forschungsdaten gibt, empfiehlt sich eine Kombination verschiedener Suchwege.

Eine gute erste Anlaufstelle sind Angebote aus dem eigenen Fachgebiet, beispielsweise institutionelle oder fachliche Repositorien. Dort sind Forschungsdaten häufig nach fachspezifischen Standards erschlossen und können gezielter recherchiert werden. Geeignete Repositorien können Sie – nach Fachgebiet aufgeschlüsselt – beispielsweise über re3data recherchieren (↗ Wie finde ich ein passendes Repositorium?).

Darüber hinaus besteht die Möglichkeit, Forschungsdaten mithilfe fachübergreifender Suchdienste über mehrere Repositorien hinweg zu recherchieren. Dabei ist zu beachten, dass solche Suchdienste die detaillierten Metadatenschemata ihrer Quellen nicht immer vollständig abbilden können.

Zu den bekanntesten Angeboten gehören:

  • BASE – Bielefeld Academic Search Engine – Fachübergreifende wissenschaftliche Suchmaschine. Forschungsdaten sind unter anderem über die Dokumentart „Primärdaten“ zu finden.
  • B2FIND – Ermöglicht die Suche nach Forschungsdaten aus zahlreichen Repositorien und Forschungsinfrastrukturen.
  • DataCite Commons – Ermöglicht die Recherche nach Forschungsobjekten, darunter Datensätzen, die über DataCite mit einem DOI registriert wurden.
  • OpenAIRE Explore – Ermöglicht die Suche nach Publikationen, Forschungsdaten, Software, Projekten und weiteren Forschungsergebnissen.
  • Google Dataset Search (proprietär)
  • GESIS Search – Suche nach Forschungsdaten und weiteren Forschungsinformationen insbesondere aus den Sozialwissenschaften.
  • Verbund Forschungsdaten Bildung – Suche nach Studien, Forschungsdaten und Instrumenten der empirischen Bildungsforschung.

Nicht alle Forschungsdaten sind unmittelbar über Repositorien und übergreifende Suchdienste auffindbar. Es kann sich daher lohnen, auch ausgehend von einschlägigen Publikationen, Forschungsprojekten oder bereits bekannten Datensätzen nach zugehörigen oder weiterführenden Forschungsdaten zu suchen.

Weiterführender Tipp: Einen ausführlichen und praxisnahen Überblick über unterschiedliche Suchstrategien bietet Mareike König in ihrem Beitrag „Forschungsdaten? Gibt’s doch schon! Strategien für die Recherche nach vorhandenen Forschungsdaten“. Der Schwerpunkt liegt auf den Geschichtswissenschaften, viele der vorgestellten Suchwege und Angebote lassen sich jedoch auch auf andere Fachgebiete übertragen.

Für die Nachnutzung selbst sind die jeweiligen Rechte (Lizenzen, ggf. Nutzungsverträge) bindend. Sie können unter anderem festlegen, wer die Daten zu welchem Zweck und für welche Zeit nutzen darf (↗ Rechtliche Aspekte).

Um Forschungsdaten nachnutzen zu können, ist vor allem die Qualität der Daten entscheidend. Datenqualität im Forschungsdatenmanagement umfasst insbesondere folgende Bereiche:

  • Datenformat (spezielle Speicherformate wissenschaftlicher Daten, wie z.B. Vektorformat, Rasterformat und Eigenschaftsformat, etc.)
  • Datenvollständigkeit und Datenrichtigkeit

Derzeit ist ein kostenfreier Prototyp des Leibniz Data Managers verfügbar, der hier exemplarisch für ähnliche Tools steht:

Leibniz Data Manager ermöglicht die Visualisierung verschiedener Forschungsdatenformate, wodurch das 'Screening' von Datensätzen auf ihren potentiellen Nutzen möglich wird. Als Visualisierungs- und Management-Tool unterstützt es die Verwaltung und den Zugriff auf heterogene Forschungsdatenpublikationen, und somit die Forscherinnen und Forscher bei der Auswahl relevanter Datensätze für ihre jeweiligen Disziplinen.

Um die (Nach-)Nutzung von eigenen und fremden Forschungsdaten im Sinne der Guten Wissenschaftlichen Praxis adäquat zu dokumentieren, ist eine korrekte Datenzitation unerlässlich.

Im Falle von Fremddaten wird hierdurch außerdem die wissenschaftliche Leistung ihrer ‚Urheber‘ gewürdigt. Wie bei der Zitation von anderen Publikationen können die Konventionen zur Zitation von Daten formal abweichen. Inhaltlich verbindet sie jedoch der Anspruch einer eindeutigen Identifizierbarkeit der Datenquelle. Die FORCE11 Data Citation Synthesis Group hat Empfehlungen zur Datenzitation erarbeitet. Ihnen zufolge umfasst eine vollständige Datenzitation

Autor(en), Jahr, Titel der Forschungsdaten, Datenrepositorium oder Archiv, Version, weltweit Persistenter Identifikator

Weitere optionale Angaben, die im Rahmen einer Zitation sinnvoll sein können, sind Edition, Feature name and Uniform Resource Identifier (URI), Resource type, Publisher, Unique Numeric Fingerprint (UNF) und Location (vgl. Alex Ball & Monica Duke (2015). How to Cite Datasets and Link to Publications).


Sofern nicht anderweitig gekennzeichnet sind alle Texte dieser Seite und ihrer Unterseiten lizenziert unter einer Creative Commons Namensnennung 4.0 International Lizenz.