Datenqualität bewerten: Der Ansatz von NFDI4Culture
Abstract
Der Report beschreibt die Einrichtung eines speziell zugeschnittenen Qualitätsmanagements nach den FAIR-Prinzipien am Ende der ersten Förderphase von NFDI4Culture und gibt einen kurzen Ausblick auf die anvisierten Maßnahmen zur Bewertung und Sicherung der Datenqualität.
Full text
1 Datenqualität bewerten – der Ansatz von NFDI4Culture Melanie Gruß, Angela Kailus, Celia Krause Inhalt 1. Einleitung ............................................................................................................................................. 2 2. Allgemeines zu Datenqualität .............................................................................................................. 3 2.1 Relevanz von Datenqualität ......................................................................................................... 3 2.2 Bewertung von Datenqualität ....................................................................................................... 4 3. Handlungsrahmen und Leitlinien für Forschungsdatenqualität ........................................................... 5 4. Dimensionen von Datenqualität .......................................................................................................... 7 5. FAIR-Prinzipien ................................................................................................................................... 8 5.1 FAIR in der NFDI .......................................................................................................................... 9 6. Charakterisierung der Datenangebote: Repositorien und Datenportale aus fünf Fachdomänen ...... 10 6.1 Multimodale Forschungsdaten ................................................................................................... 11 6.2 Maßeinheit Datenelement .......................................................................................................... 13 6.3 Erweiterte Nutzungskontexte für Forschungsdaten zu Kulturgütern .......................................... 14 6.4 Heterogene Praktiken und Umsetzungsstände .......................................................................... 14 7. Stufenmodelle zur Datenqualitätsmessung ....................................................................................... 15 7.1 EOSC Data Quality Framework ................................................................................................. 15 7.2 Europeana Publishing Framework ............................................................................................. 16 7.3 Projekt Metadatenqualität der Deutschen Digitalen Bibliothek .................................................. 17 7.4 FAIR Data Maturity Model .......................................................................................................... 17 8. Aufbau eines Data Quality Assessment in NFDI4Culture ................................................................. 18 8.1 Technische Voraussetzungen .................................................................................................... 19 8.2. Erste Umsetzungsstufe für Datenqualität: FAIR Makro-Analyse .............................................. 20 8.2.1 Ergebnis der FAIR-Makro-Analyse .................................................................................... 22 8.2.2 Aufnahme der Datenangebote ........................................................................................... 23 8.3 Zweite Umsetzungsstufe für Datenqualität: FAIR Mikro-Analyse .............................................. 25 8.3.1 Kombination der Stufenmodelle ......................................................................................... 26 8.3.2 Erweiterung der Prüfmerkmale (Defined Terms) ............................................................... 26 8.3.3 Anbieterfragebogen und Datenanalyse über den Culture Knowledge Graph .................... 29 9. Ausblick und zukünftige Entwicklung ................................................................................................ 30 10. Verwendete Literatur ....................................................................................................................... 32 Danksagung .......................................................................................................................................... 35
2 1. Einleitung Ein zentrales Ziel von NFDI4Culture ist es, ein qualitativ hochwertiges Angebot an Forschungsdaten und Forschungsinformationen seiner Konsortialpartner bereitzustellen, bei gleichzeitig größtmöglicher Offenheit für alle Datenangebote aus den im Konsortium vertretenen Domänen. Diese Angebote sollten auch Informationen über ihre Herkunft, ihre Eigenschaften und ihre Datenqualität vermitteln, um die Anschlussfähigkeit der darin enthaltenen Daten für die Nutzenden zu garantieren. Hierzu ist sowohl ein strukturiertes als auch transparentes Qualitätsmanagement erforderlich. Zielsetzung des Konsortiums in seiner ersten Förderphase (2020–2025) war es zunächst, mit dem Culture Information Portal ein Forschungsinformationssystem (Current Research Information System, CRIS) aufzubauen, das es erlaubt, die vielseitigen Datenangebote der Partner fächerübergreifend zu beschreiben und in ein gemeinsames Dienste-Portfolio zu integrieren. Die Metadaten des Portals bilden gleichzeitig auch die Grundlage für die Aufnahme externer Datenangebote in den Culture Knowledge Graph. Beide Strukturen, das CRIS wie auch der Culture Knowledge Graph, wurden in der ersten Phase von NFDI4Culture Schritt für Schritt entwickelt, wobei der Aufbau dieser technischen Infrastruktur und die Integration von ersten Datenangeboten Hand in Hand liefen (vgl. Kapitel 8.1). Parallel dazu erarbeiteten wir ein Konzept zur Bewertung der Datenqualität, was sich in konkreten Definitionen, in der Sondierung von Methoden, Arbeitsschritten und bereits bewährten Maßnahmen innerhalb unserer Domänen niedergeschlagen hat. Daneben ging es auch um Sensibilisierung der beteiligten Communities. Datenqualität ist daher in diesem Kontext auch als Prozess der Auseinandersetzung zu verstehen (vgl. Kapitel 6 bis Kapitel 8). Der vorliegende Report fasst unsere Überlegungen und den Prozess der Einrichtung eines effizienten, speziell zugeschnittenen Qualitätsmanagements zum Abschluss der ersten Förderphase zusammen und gibt einen kurzen Ausblick auf die daraus resultierenden anvisierten Maßnahmen zur Bewertung und Sicherung der Datenqualität im Rahmen der zweiten Phase. Er wendet sich vor allem an folgende Zielgruppen oder Stakeholder, die mit Forschungsdaten umgehen: • Für Nutzende (v. a. digital Forschende) erhöht sich die Transparenz der Angebote. Sie können besser und schneller beurteilen, ob Daten gebrauchstauglich und für den intendierten Zweck brauchbar sind. Die Reproduzierbarkeit von Forschungsergebnissen wird durch eine standardgebundene hohe Datenqualität verbessert. Die Nutzenden sind häufig auch Datenproduzierende, weshalb auch für sie die Vorgaben für Datenanbieter relevant sind. • Datenanbieter (v. a. aus GLAM-Einrichtungen) erhalten konkrete Unterstützung bei der Aufgabe, die Nachhaltigkeit, Anschlussund Zukunftsfähigkeit der Repositorien und Datenplattformen zu sichern und sich dabei an den Interessen der Nutzenden in den zunehmend interdisziplinär und international vernetzten Forschungsdatenräumen zu orientieren. Sie können außerdem die Qualitätsanforderungen an die Datenproduzierenden vermitteln, so dass sie bereits in den ersten Stadien des Datenlebenszyklus berücksichtigt werden können. Kann eine Institution ein qualitativ hochwertiges Angebot und passende Datenmanagement-Kompetenzen vorweisen, erhöht das die Förderfähigkeit bei der Einwerbung von zusätzlichen Mitteln.
3 • Förderinstitutionen können beurteilen, wie die Datensammlungen einzuordnen sind. Die übergreifende Darstellung des Qualitätsniveaus in ganzen Communities kann Anlass für die Entwicklung bestimmter Förderlinien sein. Außerdem können sie die Ergebnisse geförderter Projekte leichter gegen die ursprünglichen Projektziele oder Datenmanagementpläne abgleichen. Der Report vermittelt transparent die erfolgten Arbeitsschritte, indem er • den Handlungsrahmen und die Leitlinien sowie die Relevanz und die Dimensionen von Datenqualität im Forschungskontext beschreibt (vgl. Kapitel 2 bis Kapitel 4), • die spezifischen Datenangebote in NFDI4Culture charakterisiert (vgl. Kapitel 6), • Referenzmodelle zur Messung von Datenqualität erläutert (vgl. Kapitel 7), • die technischen Voraussetzungen für qualitativ hochwertige Daten im Culture Information Portal und im Culture Knowledge Graph vorstellt (vgl. Kapitel 8.1), • eine erste erfolgte FAIR-Makro-Analyse der Datenangebote und deren Ergebnisse schildert (vgl. Kapitel 8.2 und 8.2.1), • einen Workflow zur Aufnahme von Datenangeboten entwickelt (vgl. Kapitel 8.2.2) und • einen kurzen Ausblick auf die daraus resultierenden anvisierten Maßnahmen zur Bewertung und Sicherung der Datenqualität im Rahmen der zweiten Förderphase gibt (vgl. Kapitel 8.3 bis Kapitel 9). 2. Allgemeines zu Datenqualität Die Qualität von Daten bestimmt heutzutage nicht nur zunehmend die Qualität von Wissenschaft und die Transparenz ihrer Ergebnisse, sondern gilt im besonderen Maße auch für Datenanbieter, deren kuratierte Angebote möglichst nachhaltig verwendbar und in flexiblen Kontexten nachnutzbar sein sollen. Gerade deshalb ist der Aufbau homogener und spartenübergreifender KulturerbeSammlungen unerlässlich, wenn ihre Objekte im vollen Umfang ihrer Funktionalität auch im Rahmen digitaler Projekte genutzt werden sollen. Zwei Aspekte erscheinen in diesem Zusammenhang gleich zu Beginn lohnenswert für eine nähere Betrachtung in einem größeren Kontext: Warum ist Datenqualität überhaupt relevant und auf welche Weise lässt sie sich messen bzw. beurteilen, verbessern und sichern? 2.1 Relevanz von Datenqualität Datenqualität spielt eine zentrale Rolle im Rahmen von multidisziplinären ForschungsdatenInfrastrukturen auf nationaler und internationaler Ebene. Für die entstehende European Open Science Cloud (EOSC) erläutert die Task Force FAIR Metrics and Data Quality der EOSC Association grundlegende Konzepte rund um den Begriff Datenqualität, um in diesem Kontext die Basis für ein gemeinsames Verständnis zu schaffen. 1 Ihr zufolge ist Datenqualität von entscheidender Bedeutung, um die Glaubwürdigkeit, Legitimität und praktische Einsetzbarkeit der Ressourcen innerhalb der EOSC zu gewährleisten. 1 Vgl. Lacagnina, C. / David, R. / Nikiforova, A. / Kuusniemi, M. E. / Cappiello, C. / Biehlmaier, O. / Wright, L. / Schubert, C. / Bertino, A. / Thiemann, H./ Dennis, R.: TOWARDS A DATA QUALITY FRAMEWORK FOR EOSC (1.0.0, 2023) https://doi.org/10.5281/zenodo.7515816.
4 In Anlehnung an die Definition im ISO-Standard 8000, dem internationalen Standard für Datenqualität und Stammdaten, verstehen die Autorinnen unter Datenqualität den Grad, in dem ein Satz inhärenter Merkmale von Daten bestimmte Anforderungen erfüllt. Da der Abgleich der faktischen Datenmerkmale mit den gewünschten Anforderungen erfolgt, hängt die Qualität vom Kontext sowie von den Beteiligten ab, die an deren Festlegung mitwirken. Die Anforderungen wiederum müssen einen klaren Zielaspekt und ein zu erreichendes Niveau aufweisen. Dabei gibt es einerseits nicht-funktionale Anforderungen, die sich zunächst auf die Zuverlässigkeit und Gebrauchstauglichkeit der Daten ohne einen bestimmten Anwendungskontext beziehen (fit for use). Funktionale Anforderungen zielen dagegen auf die Zweckdienlichkeit von Daten in einem bestimmten Nutzungskontext (fit for purpose). Das Datenqualitätsmanagement stellt sicher, dass wertvolle Informationen zum Verständnis der Daten verfügbar und diese zunächst gebrauchstauglich sind, auf der nächsten Stufe aber auch zweckdienlich, also im gewünschten Nachnutzungskontext, eingesetzt werden können. Dieser kann weit vom ursprünglichen Erstellungszweck der Daten entfernt sein. 2 Daher müssen ausreichend Informationen bereitgestellt werden, damit die Nutzenden die Eignung für ihren Zweck selbst einschätzen können. 2.2 Bewertung von Datenqualität Die Bewertung der Datenqualität erfordert Standards, anhand derer die Daten geprüft werden können. Solche in den Fachgemeinschaften geteilten Standards, die die Bereitstellung und Nutzung von Daten gemäß den FAIR-Prinzipien erst ermöglichen, müssen identifiziert oder ggf. etabliert, erweitert und verstärkt werden. Die Task Force der EOSC empfiehlt zunächst die Entwicklung von Kriterien für eine Matrix 3 , die den Reifegrad einer Community im Umgang mit Datenqualität misst. Daraus können passende Ansätze für die Verankerung von Datenqualitätsmanagement und -bewertung in der Community entwickelt werden, die an den Bedürfnissen der Nutzenden auszurichten sind. Um die Qualität von Forschungsdaten beschreiben, messen und einordnen zu können, sind für die einzelnen Kriterien spezifische Indikatoren erforderlich, die sich auf inhaltliche, formale und technische Merkmale beziehen können und die im Voraus festgelegt werden müssen. Das ‚Messen‘ ist nützlich, um einen Gradmesser für die Tauglichkeit von Daten in Bezug auf beide Arten von Anforderungen – fit for use und fit for purpose – zu haben. Als ‚gut genug‘ wird empfunden, was einem bestimmten Qualitätslevel entspricht und damit in der Breite funktionsgerecht anwendbar ist. Ein Service für das Messen von Datenqualität zeigt demnach, wie weit die Merkmale von Daten von einer festgelegten Skala abweichen. Die Qualität von Daten wird somit quantifizierbar gemacht. Eine gleichbleibend hohe Datenqualität gewährleistet, dass Ergebnisse reproduzierbar sind – ein zentrales Prinzip in der Wissenschaft. Außerdem sorgt sie für eine verbesserte interdisziplinäre Nutzung und Weitergabe von Daten, macht sie also zukunftsfähig. Wie wichtig das Thema mittlerweile für alle Sparten ist, zeigen die Ausführungen des Rates für Informationsinfrastrukturen 2 Innerhalb der datengetriebenen Forschung sind dies beispielsweise der Einsatz Künstlicher Intelligenz/Machine Learning, korpuslinguistische Verfahren/Stilometrie, Text Mining (Topic Modeling, Natural Language Processing), Linked Data-Projekte und Netzwerkanalysen. 3 Vgl. Lacagnina, C. et al. (2023) https://doi.org/10.5281/zenodo.7515816, S. 56.
5 (RfII) 4 und der Deutschen Forschungsgemeinschaft (DFG) 5 , die auch digitale Bestände von Museen und Sammlungen ausdrücklich als Forschungsdaten auffassen, die demnach in die Prozesse der Qualitätssicherung einzubeziehen seien. 6 3. Handlungsrahmen und Leitlinien für Forschungsdatenqualität Für Datenproduzierende wichtige Hilfsmittel zur Sicherstellung von Datenqualität können allgemeine oder institutionsspezifische Leitlinien, Forschungsdaten-Policies oder anerkannte generische Prinzipien sein. Bei der Umsetzung können darüber hinaus Datenmanagementpläne 7 , die Anwendung bestimmter Standards und Normen 8 , die Befolgung spezieller Empfehlungen 9 oder die Anwendung von Zertifizierungsverfahren, wie beispielsweise Gütesiegel für die Bewertung der Qualität von Forschungsdatenrepositorien bzw. Langzeitarchiven, helfen. Zu den bekanntesten dieser Zertifikate gehört das Core Trust Seal, das in seiner jüngsten Form auch Anforderungen zum Digital Object Management integriert, darunter die Quality Assurance (R10) der archivierten digitalen Objekte. 10 Im Gegensatz dazu evaluiert das Nestor-Siegel die „vom digitalen Langzeitarchiv eingesetzten Lösungen, nicht jedoch die Qualität der zu archivierenden Inhalte“ 11 . Für die korrekte und einheitliche Datenerfassung in Infrastruktureinrichtungen dienen im Allgemeinen verbindliche Regelwerke und Schreibanweisungen. Zur qualitativen Analyse der Daten selbst bieten sich technische Werkzeuge für den Abgleich von Werten, für Fehlersuchen, Dublettenprüfungen, Konsistenzund Plausibilitätschecks an, oder das Erfassungssystem unterstützt Datenqualität durch maschinelle Prüfungen (Schema-Validierung, Obligatoriken, Eingabehilfen etc.). Manche Parameter sind wiederum nicht ohne Weiteres in den Daten selbst überprüfbar und können nur über Befragungen von Portalbetreibern etc. herausgefunden werden. 4 Vgl. Rat für Informationsinfrastrukturen: Bestandsbezogene Forschung gestalten: zukunftsfähige Verschränkungen von „digital“ und „analog“. Ein Diskussionsimpuls zur wissenschaftlichen, wissenschaftsnahen und kulturellen Nutzbarkeit von Sammlungen, Göttingen 2021, https://rfii.de/?p=7339; Rat für Informationsinfrastrukturen: Sammlungen als multimodale Infrastrukturen. Analog und digital für die verknüpfte Nutzung erschließen, Göttingen 2024, https://rfii.de/?p=11282. 5 Vgl. Deutsche Forschungsgemeinschaft: Leitlinien zum Umgang mit Forschungsdaten, 2015, https://www.dfg.de/resource/blob/172112/leitlinien-forschungsdaten.pdf. 6 Relevant für unsere Communities sind weitere exemplarische Veröffentlichungen wie beispielsweise Franke-Maier, Michael / Kasprzik, Anna / Ledl, Andres / Schürmann, Hans (Hg.): Qualität in der Inhaltserschließung, Berlin/Boston 2021, https://doi.org/10.1515/9783110691597; Király, Peter: Measuring Data Quality, Göttingen 2019,; Király, Peter / Brase, Jan: Qualitätsmanagement, in: Putnings, Markus / Neuroth, Heike / Neumann, Janna: Praxishandbuch Forschungsdatenmanagement, Berlin/Boston 2021, https://doi.org/10.1515/9783110657807, S. 357–379. 7 Ein wichtiges Tool auf nationaler Ebene ist hier der z. B. Research Data Management Organizer (RDMO), vgl. https://rdmorganiser.github.io/. 8 z. B. CIDOC CRM: ISO 21127:2023 als Referenz-Ontologie für den Austausch von Informationen über das kulturelle Erbe ISO 25964-1:2011, ISO 25964-2:2013 für den Aufbau von Thesauri und Interoperabilität mit anderen Vokabularen, ISO 14721:2025 für das Referenzmodell für ein offenes Archivinformationssystem (OAIS). 9 z. B. J. Paul Getty Trust, Categories for the Description of Works of Art, Visual Resources Association, Cataloging Cultural Objects, DFG-Praxisregeln 2022, Anhänge A–C, die Minimaldatensatz-Empfehlung für Museen und Sammlungen. 10 Vgl. CoreTrustSeal Standards and Certification Board. CoreTrustSeal Requirements 2023–2025 (V01.00). Zenodo. https://doi.org/10.5281/zenodo.7051012, S. 14 f. 11 nestor – Kompetenznetzwerk Langzeitarchivierung (2024). Erläuterungen zum Nestor-Siegel für vertrauenswürdige digitale Langzeitarchive – Version 2.2, https://d-nb.info/1334021635/34, S. 7.
6 Einen Handlungsrahmen für qualitätsfördernde Verhaltensweisen bieten die Leitlinien zur Sicherung guter wissenschaftlicher Praxis der Deutschen Forschungsgemeinschaft (DFG). Untrennbar damit verbunden ist eine „kontinuierliche, forschungsbegleitende Qualitätssicherung“ 12 . Gemeint sind bestimmte Verhaltensweisen, die den Forschungsprozess objektiv nachvollziehbar machen, z. B. die Einhaltung fachspezifischer Standards, Methoden und Verfahren bei der Erhebung, Verarbeitung und Analyse von Daten und die Verwendung geeigneter und verfügbarer Hardund Software. 13 Die DFG hat noch weitere wichtige Maßnahmen in die Wege geleitet, um die Qualität wissenschaftlicher Daten zu fördern. Zu den bekanntesten Empfehlungen auf nationaler Ebene zählen die DFG-Praxisregeln „Digitalisierung“ 14 . Sie beinhalten einige grundsätzliche Qualitätsvorgaben für unstrukturierte Daten (Bilder, OCR-Texte, 3D-Objekte) und Kerndatensatz-Empfehlungen für die beschreibenden Metadaten, aber keinen konkreten Vorschlag bezüglich deren Messbarkeit, auch wenn sich daraus Messparameter ableiten ließen. 15 Die DFG-Checkliste zum Umgang mit Forschungsdaten in DFG-Projekten enthält im Fragenkatalog zum Forschungsdatenmanagement, der mittlerweile als Datenmanagementplan in der Instanz des Research Data Management Organiser (RDMO) von NFDI4Culture zur Verfügung steht, ebenfalls Anforderungen zur Sicherung der Datenqualität. Darüber hinaus gibt es für die NFDI-Konsortien das Ergänzende Datenblatt, mit dem diese periodisch bestimmte Kennzahlen an die DFG liefen müssen. Mit Blick auf die Forschungsdaten und deren Datenqualität sind darin im Wesentlichen zwei Indikatoren relevant: 1. die Anzahl der von den Datenanbietern bereitgestellten Datensets 16 , die Art dieser Daten und ihre Zusammensetzung (Indikator 3001), 2. die Anzahl der Datensets, welche die vom Konsortium festgelegten Qualitätskriterien erfüllen (Indikator 3002). Die Indikatoren für die geforderten Kennzahlen sind sehr allgemein formuliert, was den Konsortien die Möglichkeit eröffnet, ihre Qualitätskriterien domänenspezifisch zu definieren. Die Kriterien sollten jedoch nachvollziehbar und messbar sein und sind zu belegen und/oder zu beschreiben. 17 Darüber hinaus gilt die Auflage, dass jedes Konsortium unter Bezug auf allgemein anerkannte Referenzsysteme ein Rahmenwerk zur Prüfung und Sicherung seiner Datenqualität benennt oder entwickelt. 12 Deutsche Forschungsgemeinschaft (2025). Leitlinien zur Sicherung guter wissenschaftlicher Praxis. Kodex. https://doi.org/10.5281/zenodo.14281892. Leitlinie 7: Phasenübergreifende Qualitätssicherung, S. 14. 13 Vgl. ebd. 14 Altenhöner, R. / Berger, A. / Bracht, C. / Klimpel, P. / Meyer, S. / Neuburger, A. / Stäcker, T. / Stein, R.: DFGPraxisregeln "Digitalisierung". Aktualisierte Fassung 2022, 2023, https://doi.org/10.5281/zenodo.7435724. 15 Vgl. ebd. Abs. 3.3, S. 26–30. 16 Zur Definition von Datensets im Vergleich zu Datensätzen siehe Kapitel 6.2. „Bereitgestellt“ bezieht sich hier auf Datensets, die das Konsortium als Teil seiner eigenen Datendomäne betrachtet und gemäß den FAIR-Prinzipien entweder innerhalb des Konsortiums und/oder über eine assoziierte Einrichtung in der Rolle eines Antragstellers, Mitantragstellers oder Participants auffindbar, zugänglich, interoperabel und/oder wiederverwendbar macht. 17 Vgl. Guide to filling out the Supplementary data sheet for consortia of the National Research Data Infrastructure (NFDI).
7 4. Dimensionen von Datenqualität Datenqualität lässt sich in mehreren Dimensionen beschreiben, die vor allem intrinsische, extrinsische und technische Faktoren umfassen. Deren Definition und Abgrenzung ist in der umfangreichen Literatur zu diesem Thema nicht einheitlich. Die wichtigsten Aspekte dieser Dimensionen seien nachfolgend in Anlehnung an die Ergebnisse aus dem für NFDI4Culture relevanten Projekt Kontinuierliches Qualitätsmanagement von dynamischen Forschungsdaten zu Objekten der materiellen Kultur (KONDA) dargestellt: Intrinsische Faktoren betreffen die Datenwerte in ihrem Kern sowie ihre Struktur, d. h. die logische Gliederung der Informationen. Sind diese konsistent, syntaktisch und semantisch korrekt, genau, eindeutig und vollständig? Ist ihre Darstellung konzise und konsistent? Zu den typischen Fehlerkategorien bei Vollständigkeit (Completeness) gehören z. B. Lücken, fehlende Elemente und Referenzen in den Daten, etwa wenn keine Einträge in Pflichtfeldern vorhanden sind, Verlinkungen zu Normdaten oder Quellenangaben fehlen. Genauigkeit (Accuracy) bezieht sich auf den Grad, mit dem Daten reale Informationen richtig darstellen, auf die Exaktheit und Stimmigkeit der Angaben. Diese Dimension wird manchmal in Korrektheit (Correctness) und Prägnanz (Precision) unterteilt, um differenzierte Datenanalysen zu ermöglichen. Prägnanz und Eindeutigkeit (Uniqueness) sind nicht gegeben, wenn z. B. die Informationen nicht exakt genug sind, verschiedene Informationen in einem Datenfeld stehen, Maßeinheiten von Objekten voneinander abweichen. Auch zweifelhafte Werte, Abkürzungen, widersprüchliche und uneinheitliche Angaben von unsicherem Wissen und Redundanzen/Dubletten gehören dazu. Zu grobe oder falsch platzierte Werte und Angaben unzureichender Granularität verletzen die Prägnanz und die syntaktische und semantische Korrektheit der Daten, ebenso wie die Wahl eines falschen Datentyps, eine Missachtung der Datenstruktur (Hierarchien) oder Abhängigkeitsfehler (Missachtung von Datenfeld-Dependenzen, widersprüchliche Bezüge/Relationen). Die Konsistenz (Consistency) ist beeinträchtigt, wenn es unterschiedliche bzw. uneinheitliche Schreibweisen von Datumsangaben gibt, bei fehlerhafter Sprachkennzeichnung oder bei Falschschreibung. 18 Die Gruppe der extrinsischen oder kontextuellen Qualitätsmerkmale leitet sich von der Verwendbarkeit der Daten für Dritte ab und weist daher in Teilen auch Ähnlichkeiten mit den 2016 formulierten FAIR-Prinzipien auf. Faktoren wie Zugänglichkeit (Zugriff und Abruf von Daten durch autorisierte Personen oder Maschinen), Verständlichkeit (z. B. Verwendung bekannter und innerhalb der Community anerkannter Terminologien in Wertelisten, Lesbarkeit der Daten auch für Menschen), Vertrauenswürdigkeit (kuratierte, fachliche geprüfte Datenbestände aus bekannten Einrichtungen oder zertifizierten Angeboten), Nachvollziehbarkeit (bei ausreichender Dokumentation der Datenbestände mit Meta-Informationen), Relevanz (Kontextbezogenheit, Zweckmäßigkeit in bestimmten Nutzungsszenarien), Aktualität und Darstellbarkeit spielen hier eine Rolle. 19 18 Vgl. Kesper, A. / Wenz, V. / Taentzer, G.: Detecting quality problems in research data: a model-driven approach, in: Association for Computing Machinery. Proceedings of the 23rd ACM/IEEE International Conference on Model Driven Engineering Languages and Systems (MODELS '20), New York 2020, pp. 354–364, https://doi.org/10.1145/3365438.3410987; Stein, R. / Taentzer. G.: How to Define the Quality of Data and Data Models? A Perspective from the Cultural Heritage Domain, 2023, https://doi.org/10.5281/zenodo.7705014. 19 Vgl. die Übersichten zu typischen Qualitätsmerkmalen bei Király, P. / Brase. J. (2021). 4.3 Qualitätsmanagement, in: Putnings, M., Neuroth, H., Neumann, J. Praxishandbuch Forschungsdatenmanagement, Berlin/Boston 2021, https://doi.org/10.1515/9783110657807, S. 361 f.; Rat für Informationsinfrastrukturen (2019). Herausforderung Datenqualität – Empfehlungen zur Zukunftsfähigkeit von Forschung im digitalen Wandel, Göttingen, https://rfii.de/?p=4043 A12–A14.
8 Die Beurteilung und Sicherung der wissenschaftlichen Qualität von Dateninhalten gehört zu den anspruchsvollsten Aufgaben im Datenqualitätsmanagement. Wissenschaftliche Qualität von Kulturdaten unterscheidet sich von den genannten objektiv messbaren Qualitätsdimensionen, da sie stark an den jeweiligen epistemischen Rahmen, den gegebenen Kontext und an individuelle Fragestellungen gebunden ist. Was in einem Fall als wertvoll, innovativ und relevant gilt, kann in einem anderen nur bedingt nutzbar oder sogar unbrauchbar sein. So kann etwa ein Datenbestand, der für linguistische Analysen ausreichend ist, für allgemeine kulturhistorische Fragen unzureichend erscheinen und umgekehrt. Dimensionen wie Aktualität, methodische Nachvollziehbarkeit, Vertrauenswürdigkeit und Erschließungstiefe variieren und können nicht universell als Maßstab angewandt werden. Wissenschaftliche Qualität ist nicht Gegenstand des vorliegenden Reports, da sie im Gegensatz zu intrinsischen Kriterien wie Vollständigkeit oder Korrektheit nicht automatisiert und fachübergreifend geprüft werden kann. Allerdings sollte gemäß EOSC-Empfehlungen beim Datenanbieter eine fachliche Beurteilung der Daten vorgenommen und in einer Meta-Dokumentation strukturiert beschrieben werden. 20 Aspekte wie die Validität von Erhebungsund Aufbereitungsmethoden, die Angemessenheit der vergebenen Klassifikationen und die Konsistenz der Metadaten im Hinblick auf aktuelle Fachstandards sind dann entscheidend für eine Bewertung. Aus technischer Sicht ist es wichtig, dass Daten nicht nur gut dokumentiert und valide sind, sondern auch effektiv maschinell durchsucht, verarbeitet und verknüpft werden können. Der Zugang zu ihnen (gemäß maschinenlesbarer Lizenz oder Authentifizierung) sowie die Möglichkeit zur software-unabhängigen Ausund Verwertung und zur Darstellung (geeignete Formate), sollten gegeben sein. Die Formate zeichnen sich dadurch aus, dass sie möglichst international etabliert und langlebig (Pflege und Weiterentwicklung) sind und dass sie sich gut für die Langzeitarchivierung eignen. Wie sich die genannten Qualitätsdimensionen zu der allgemein geforderten guten wissenschaftlichen Praxis verhalten, muss spekulativ bleiben, da der DFG-Kodex von 2019 nicht explizit auf intrinsische Aspekte von Datenqualität oder die Prüfbarkeit und Herstellung von Datenqualität im Speziellen eingeht. Es wird lediglich darauf hingewiesen, dass Fehler bei der Datenerhebung durch die Anwendung von fachgerechten Methoden beim Einsatz von Geräten („das Kalibrieren von Geräten, (...) sowie (...) das Führen von Laborbüchern“ 21 ) vermieden werden können. 5. FAIR-Prinzipien Die Methoden und Metriken zur Quantifizierung von Forschungsdatenqualität weisen eine erhebliche disziplinäre Diversität und kontextuelle Spezifika auf. Auch die zugrunde liegenden Ansätze zur Messung und Steigerung der Datenqualität in Bezug auf die jeweiligen Datenwerte differieren nicht nur in ihrer methodischen Ausgestaltung, sondern auch hinsichtlich der relevanten Paradigmen, Messverfahren und evaluativen Maßstäbe der jeweiligen Forschungsbereiche. 22 20 Wissenschaftliche Qualität setzt Expertenurteile mit einem Transparenzgebot voraus: Es sollte ersichtlich sein, welcher Akteur zu welchem Zeitpunkt auf welcher fachlichen Grundlage eine solche Bewertung vorgenommen hat. Die fachliche Beurteilung kann in Form von Gutachten durch Fachredaktionen, Peer-Reviews, projektbezogenen Datenblättern oder begleitenden Berichten realisiert werden, die auf die jeweilige Domäne und den Forschungszweck zugeschnitten sind; vgl. Lacagnina, C. et al. (2023) https://doi.org/10.5281/zenodo.7515816., S. 53. 21 Deutsche Forschungsgemeinschaft (2025). Leitlinien zur Sicherung guter wissenschaftlicher Praxis. Kodex. https://doi.org/10.5281/zenodo.14281892. Leitlinie 7: Phasenübergreifende Qualitätssicherung, S. 14. 22 Vgl. Király, P. / Brase. J. (2021), https://doi.org/10.1515/9783110657807, S. 361.
9 Vor diesem Hintergrund erscheint die Etablierung eines disziplinenübergreifenden, einheitlichen Verfahrens zur Sicherung von Datenqualität weder praktikabel noch wünschenswert. Ebenso vielfältig ist die Landschaft an technischen Werkzeugen zur Messung, Analyse und Korrektur von Datenwerten, da die verfügbaren Werkzeuge meist eng auf bestimmte Qualitätskriterien, Datentypen und -formate zugeschnitten sind und folglich auf die spezifischen Anwendungskontexte angepasst werden müssen. 23 Zur Bewältigung dieser disziplinären und instrumentellen Vielfalt bieten die seit 2016 etablieren FAIR-Prinzipien 24 einen konzeptionellen Rahmen, der die Verankerung eines generischen Qualitätsmanagements erlaubt, ohne eine rigide Vereinheitlichung der konkreten Umsetzungspraktiken zu verlangen. Die FAIR-Prinzipien („Findable, Accessible, Interoperable, Reusable“) benennen als international anerkannte Leitlinie prägnante Grundsätze für ein gutes Management und die Nachnutzbarkeit wissenschaftlicher Daten. Sie sind Bestandteil sowohl der DFG-Praxisregeln „Digitalisierung“ in der jüngsten Fassung von 2022 (Publikation: 2023) als auch der DFG-Leitlinien zur Sicherung guter wissenschaftlicher Praxis in der Fassung von 2025 (vgl. dazu Kapitel 3). Die FAIR-Prinzipien umfassen 15 allgemein gefasste Leitsätze, um Forschungsdaten besser auffindbar, zugänglich, interoperabel und nachnutzbar zu machen, d. h. sie zielen primär auf die Verwaltbarkeit und Wiederverwendbarkeit von Forschungsdaten ab und fokussieren damit eher auf kontextuelle und organisatorische Qualitätsmerkmale, wie z. B. Metadatenstruktur, Auffindund Zugriffsmechanismen, Durchsuchbarkeit und Austauschfähigkeit, als auf die eigentlichen intrinsischen Qualitätsmerkmale. Sie setzen jedoch korrekte, valide Daten voraus, wie auch umgekehrt Mängel in der Einhaltung der FAIR-Prinzipien sich negativ auf den Bereich der intrinsischen Merkmale auswirken. FAIRness und intrinsische Qualität sind demnach eng miteinander verbunden und bauen aufeinander auf, auch wenn jeweils unterschiedliche Aspekte des Datenmanagements angesprochen sind. 5.1 FAIR in der NFDI Um eine bessere Vernetzung und interdisziplinäre Nutzungsmöglichkeiten zu erreichen, ist ein standardisiertes Datenmanagement nach den FAIR-Prinzipien unabdingbar. Im Mittelpunkt steht die Anforderung einer Gebrauchstauglichkeit (fit for use) für die Nachnutzung. Eine besondere Herausforderung besteht darin, Daten so bereitzustellen, dass sie sowohl für Menschen als auch für Maschinen optimiert verwendbar sind. Es ist entscheidend, dass die FAIR-Prinzipien über die eigentlichen Daten hinausgehen und auch die Bedingungen, Werkzeuge und Arbeitsabläufe umfassen, die zu deren Erzeugung beitragen. Transparenz, Reproduzierbarkeit und Wiederverwendbarkeit sind gewährleistet, wenn alle Komponenten der im Forschungsprozess entstehenden Daten dokumentiert und zugänglich gemacht werden. Für eine ausführlichere Darstellung sei auf die von NFDI4Culture bereitgestellte Handreichung für ein FAIRes Management kulturwissenschaftlicher Forschungsdaten verwiesen. Ein Hilfsmittel für eine erste Einschätzung der FAIRness eines bestimmten Datenangebots ist der ebenfalls vom Konsortium angebotene FAIR-Check. Die 2018 von der Gemeinsamen Wissenschaftskonferenz (GWK) herausgegebene BundLänder-Vereinbarung stellt den Auftakt zum Aufbau der NFDI dar. Um das Ziel der Stärkung eines datensouveränen und international anschlussfähigen deutschen Wissenschaftssystems zu 23 Beispiele: OpenRefine (https://openrefine.org/), Validierung von XML-Daten mittels Schemadatei, von RDF-Daten mit SHACL. 24 Wilkinson, Mark D. / Dumontier, Michel / Aalbersberg, IJsbrand et al.: The FAIR Guiding Principles for scientific data management and stewardship, Sci Data 3, 2016, https://doi.org/10.1038/sdata.2016.18.
16 • Aussagen über Stärken, Schwächen und bekannte Probleme Weitere Punkte akzentuieren bestimmte FAIR-Empfehlungen, so z. B.: • die Anforderung von aussagekräftigen Datenprovenienzinformationen • eine thematische Beschreibung und Verschlagwortung des Datensets • Nutzungsbedingungen in Form von Lizenzen • die Einhaltung von Metadatenstandards 27 Im EOSC Interoperability Framework findet sich eine Empfehlung für einen Metadatenkatalog zur Dokumentation der geforderten Informationen. 28 7.2 Europeana Publishing Framework Als Aggregator von Metadaten zu den Beständen einer Vielzahl von Galerien, Bibliotheken, Archiven und Museen aus ganz Europa begann Europeana vor etwa 10 Jahren mit der Entwicklung und aktiven Vermittlung einer Datenqualitäts-Strategie, die mittlerweile auch die Umsetzung der FAIR-Prinzipien einschließt. Seitdem stellt das Portal einen Publikationsleitfaden für seine Datenlieferanten zur Verfügung, der kontinuierlich weiterentwickelt wird. Der Europeana Publishing Guide beschreibt die Bedingungen, unter denen Daten (Bilder/Videos/AV/3D) und Metadaten aus Kultureinrichtungen in das Portal integriert werden können. Alle Indikatoren sind darin sogenannten Quality Tiers (= Qualitätsstufen) zugeordnet. Enthalten sind Qualitätsindikatoren für digitale Repräsentationen von Kulturgütern der Typen Bild, 3D, Audio, Video und Text (content) in vier Stufen gemäß der Auflösung des Digitalisats, begleitet von zunehmend qualifizierten und offenen Stufen der Lizenzierung. Für die zugehörigen Metadaten gibt es drei Stufen. Je höher die Stufe, desto mehr Suchkriterien/Datenfeldern sind im Datensatz besetzt und umso mehr Metadatenelemente können mehrsprachig durchsucht werden. Höhere Stufen bedeuten demnach verlässlichere und differenziertere Suchen nach Schlagworten, Akteuren, Zeitund Ortsangaben. Bedingung für die beiden höchsten Stufen ist außerdem, dass eine bestimmte Anzahl dieser Kriterien (contextual groups) mit URIs aus kontrolliertem Vokabular besetzt ist. Der Ansatz ist gleichzeitig modular und flexibel, denn er erlaubt optionale Schwerpunkte für die Dokumentation, wie es der Vielfalt der kulturellen Objekte und den Spartenkonventionen angemessen ist. Interessant an diesem Modell ist, dass die Qualitätsfaktoren für Metadaten ausgehend von den Bedarfen der Nutzenden formuliert wurden, die Europeana als reine Suchplattform (einfaches Auffinden von Material), als Erkundungsplattform (Verwendung in thematischen Sammlungen mit Bezug zu anderen Sammlungen) oder als Wissensplattform (Verwendung in Bildung und Forschung, Apps und Diensten, Kreativwirtschaft) nutzen wollen. Ein Dashboard bietet einen visuellen Überblick über die qualitative Einordnung der aktuellen Europeana-Bestände und der (Teil-)Lieferungen der teilnehmenden Institutionen. Als konkretes Werkzeug für 27 Ebd. S. 53. 28 Vgl. EOSC interoperability framework – Report from the EOSC Executive Board Working Groups FAIR and Architecture, Publications Office, 2021, S. 51-56, https://data.europa.eu/doi/10.2777/620649.
17 die eigene Messung dient die Metis Sandbox zur Überprüfung von lokalen Datenbeständen vor der Einlieferung. 29 7.3 Projekt zu Metadatenqualität der Deutschen Digitalen Bibliothek Auskunft über Qualitätskriterien von Metadaten aus dem Kulturbereich bieten auch die Ergebnisse des Projekts Verbesserung der Qualität der Metadaten und der Prozesse der Verarbeitung in der Deutschen Digitalen Bibliothek (DDB), das in den Jahren 2020–2022 durchgeführt wurde. 30 Wesentliches Produkt war ein Feedback-Tool für die Qualitätsmessung, das auf einer zuvor entwickelten Matrix für die Bewertung der Metadatenqualität basierte. Diese Matrix, in der 40 Qualitätsindikatoren nach den FAIR-Prinzipien gruppiert sind, bildete wiederum die Grundlage für ein Dashboard, auf dem die Qualität der Datensätze visualisiert wird. Den Indikatoren wurden außerdem bestimmte Scoringwerte nach einem Punktesystem 31 zugewiesen, die auf die Wichtigkeit des jeweiligen Indikators hindeuten. Vier Kriterien sind Mindestanforderungen, also Pflichtkriterien der DDB für die Einlieferung von Datensätzen. Auch wenn die Überführung der Projektergebnisse in den operativen Betrieb noch aussteht, finden sich darin doch wertvolle, granular strukturierte Ansätze für die Qualitätsprüfung, die auf die zukünftige Ausbaustufe der Qualitätsmessung in NFDI4Culture übertragbar erscheinen. 7.4 FAIR Data Maturity Model Um ein einheitliches Verständnis der FAIR-Prinzipien zu fördern, wurde das FAIR Data Maturity Model 32 2020 von der gleichnamigen RDA Working Group entwickelt. Es enthält ein Set von Kernkriterien für die Bewertung von FAIRness von Datenangeboten. Ihnen werden Indikatoren zugeordnet, aus deren Priorisierung und Umsetzungsgrad anhand von jeweils im Fachkontext definierten Prüfmerkmalen sich eine Reifegradbestimmung des jeweiligen Datenangebots ableiten lässt. Das Modell wurde mit dem Ziel entwickelt, verbindliche Bewertungskriterien und Levels für FAIRness zu benennen, die als Vorlage für standardisierte Messverfahren oder bei der Entwicklung von Prüftools dienen können. Es besteht aus drei Elementen: 1. Indikatoren für die Bewertung jedes der vier FAIR-Prinzipien, jeweils differenziert für Daten und Metadaten. Die Erläuterung jedes Indikators wird von Hinweisen begleitet, wie man für die jeweils zu prüfenden Datensets Bewertungskriterien oder Prüfmerkmale gewinnt. 2. Prioritäten in drei Stufen (wesentlich, wichtig, nützlich), die angeben, wie verbindlich die Umsetzung des jeweiligen Indikators für die Bewertung der FAIRness ist. 3. Verschiedene Bewertungsmethoden: Vorgeschlagen werden außerdem konkrete Messansätze, so die Angabe des Fortschritts der FAIRification (= Reifegradbestimmung für die Umsetzung von FAIR) in fünf Implementierungsstufen (0–4), das Erreichen oder 29 Das Open Data Portal der Europäischen Kommission macht Daten des öffentlichen Sektors zugänglich. Das Portal unterstützt Anbieter in der Prüfung ihrer Metadatenqualität und bietet Verbesserungsvorschläge an. Die Gewichtung der Qualitätskriterien erfolgt in diesem Fall über ein Punktesystem. Ein Dashboard gibt auch hier einen Überblick über den aktuellen Stand hinsichtlich der Metadaten-Qualität. Das Portal bietet zusätzlich einen Dienst an, mit dem die Umsetzung der wesentlichen Kriterien in vier Qualitätsstufen vor dem Harvesting der Daten mittels SHACL validiert werden kann. 30 Vgl. Berichte zum Projekt: https://wiki.deutsche-digitale-bibliothek.de/pages/viewpage.action?pageId=78512330. 31 -9, -6, -3, 0, +3, +6, +9. 32 Vgl. RDA FAIR Data Maturity Model Working Group: Das FAIR Data Maturity Model. Spezifikation und Leitlinien, 2020, https://doi.org/10.5281/zenodo.5834115; engl.: https://doi.org/10.15497/rda00050.
18 Nichterreichen von FAIRness-Levels (Pass or Fail) und eine Kombination aus beiden Ansätzen. Das Modell bietet mit seinen Prioritätensetzungen einen übergreifenden Ansatz zur Bewertung der Datenqualität aller Angebote im Sinne des fit for use. Wegen des Reifegrad-Ansatzes und der zahlreichen konkreten Vorschläge zur Ableitung von Prüfkriterien stellt es in unserem Konsortium einen wichtigen Ausgangspunkt für das Konzept zur Qualitätsmessung dar. Verschiedene Initiativen bewerben die FAIR-Prinzipien und deren Umsetzung (Methoden, Tools etc.) in unterschiedlichen Sparten, Wissenschaftsbereichen und Data Communities. Aus einigen Projekten sind Tools für das FAIR Assessment und zum Messen von FAIRness hervorgegangen. 33 Die Bandbreite reicht von automatisierten Prüfverfahren bis hin zu (semi-)manuellen Checklisten oder Fragenkatalogen. Automatisiert arbeitende Tools sind in der Regel generisch angelegt und müssen an die jeweiligen Charakteristika der Repositorien, der Daten und der Prüfbedingungen angepasst werden. 34 Ein Werkzeug, das die Messung der FAIRness einer heterogenen und komplexen Datenlandschaft wie der von NFDI4Culture unterstützen könnte, steht bislang nicht zur Verfügung. Die Konfiguration verfügbarer Tools für unsere Einzelangebote wäre sehr aufwendig und die Vergleichbarkeit der Ergebnisse nicht ausreichend gewährleistet. 35 8. Aufbau eines Data Quality Assessment in NFDI4Culture In der Zusammenführung bestehender Datenangebote liegt ein wesentliches Ziel des Konsortiums. Dabei formulieren wir keine grundsätzlichen Ausschlusskriterien aufgrund von Qualitätsmängeln, denn es steht vor allem die inhaltliche Relevanz eines Datenangebots für unsere Fachcommunities im Zentrum. In der Phase des Aufbaus des Konsortiums und seiner Infrastruktur ging es zunächst darum, die existierenden Datenangebote unserer institutionellen Partner nach und nach zu kartieren. Hierbei galt zu berücksichtigen, dass für die in NFDI4Culture erstmals in einem Infrastrukturverbund zusammenarbeitenden Fachdisziplinen noch nicht auf eine übergreifende Dateninfrastruktur zurückgegriffen werden konnte. Diese wurde in Form des Culture Information Portals sowie des Culture Knowledge Graphs in kontinuierlichem Abgleich mit der Kartierung der Datenlandschaft entwickelt. Ein für NFDI4Culture geeigneter Ansatz zur Qualitätsbewertung muss folgende Herausforderungen berücksichtigen: • Für eine durch große Bandbreite, Diversität und Komplexität charakterisierte Menge von Datenangeboten sollte eine übergreifende bzw. generische Bewertungsformel gefunden werden. • Für einige Komponenten, z. B. die Dokumentation von Datenprovenienzen oder die der wissenschaftlichen Qualität, gibt es in unserem Bereich noch keine standardisierten, anerkannten Vorlagen oder eingeführten Praktiken. Sie müssen zuerst mit unserer Community zusammen entwickelt und etabliert werden. 33 Vgl. https://fairassist.org/; https://fairassist.org/tools. 34 Zu diesen Werkzeugen gehört z. B. das F-UJI-Tool. Zugänglich sind Beta-Versionen eines domänenunspezifischen und zweier sozialwissenschaftlicher Profile. Die Erstellung weiterer Profile wird nicht mehr vorangetrieben zugunsten lokaler Konfigurationen des Tools in den jeweiligen dezentralen Anwendungskontexten. 35 Vgl. Wilkinson, M. D. / Sansone, S.-A. / Grootveld, M. / Nordling, J. / Dennis, R. / Hecker, D.: FAIR Assessment Tools: Towards an "Apples to Apples" Comparisons, 2022, https://doi.org/10.5281/zenodo.7463421.
19 Mit Blick auf die vorrangig zu bestimmende Gebrauchstauglichkeit (fit for use) eines Angebots entschieden wir uns daher für einen Ansatz, der zuerst den FAIR-Reifegrad eines Angebots bestimmt. Um angesichts der komplexen Datenlandschaft wirklich aussagekräftig zu werden, muss dieses Verfahren dann graduell ausgebaut und verfeinert werden. 8.1 Technische Voraussetzungen Die technisch-infrastrukturelle Basis für die Verankerung der Datenangebote des Konsortiums bildet das Culture Information Portal, das als Forschungsinformationssystem (CRIS) basierend auf dem CERIF Datenmodell des euroCRIS entwickelt wird. Hier werden alle relevanten Forschungsinformationen aus der Datendomäne von NFDI4Culture erfasst, so etwa beteiligte Forschende und Kulturschaffende, mitwirkende Organisationen wie auch Angebote und Ergebnisse der interdisziplinären Zusammenarbeit im Verbund. Diese unterteilen sich in Nachrichten und Veranstaltungen, Beiträge (Guidelines, Software, Veröffentlichungen usw.) und Services (Helpdesk, Datenportale, Repositorien usw.). Über Verknüpfungen werden Beziehungen zwischen Entitäten ausgedrückt und durch Rollenangaben näher spezifiziert. So kann beispielsweise ausgesagt werden, dass eine Organisation ein Datenangebot betreibt. Darüber hinaus ermöglicht ein an kontrollierten Vokabularen ausgerichtetes Verschlagwortungssystem mit sogenannten Defined Terms die tiefere Erschließung von Entitäten, etwa durch die Zuweisung von Fachdisziplinen zu Personen oder die Erfassung von Themen von Veranstaltungen. Auf der Ebene der Forschungsinformationen im Culture Information Portal haben wir in der ersten Projektphase eine vollständige Umsetzung der FAIR-Prinzipien erreicht. Für alle erfassten Entitäten, wie Dienste, Datenportale, Repositorien, Software, Leitlinien, Spezifikationen, Berichte und andere Ergebnisse haben wir persistente Identifikatoren eingeführt. Diese machen alle im Culture Information Portal verzeichneten Entitäten dauerhaft auffindbar und referenzierbar. Auf Basis der NFDIcore Ontology werden umfangreiche Metadaten für alle im Culture Information Portal erfassten Forschungsinformationen erzeugt. Durch die Nutzung der NFDIcore Ontology, die eine zentrale Rolle bei der konsortiumsübergreifenden Strukturierung und Integration von Forschungsdaten spielt und eine effiziente Datenverwaltung und -wiederverwendung in verschiedenen Disziplinen ermöglichen soll, wird die Interoperabilität der erzeugten Metadaten mit anderen NFDI-Konsortien sichergestellt. Die so modellierten Metadaten werden über eine REST-Schnittstelle in verschiedenen RDF-Serialisierungen bereitgestellt. Die Metadaten enthalten Lizenzund Herkunftsinformationen, um möglichst breit nachnutzbar zu sein. Neben der Bereitstellung der Metadaten über die REST-Schnittstelle werden zu allen Forschungsinformationen im Culture Information Portal strukturierte Metadaten nach schema.org in die HTML Repräsentation der Ressourcen im Portal selbst eingebettet, um die Auffindbarkeit derselben durch Suchmaschinen zu erhöhen. Zusätzlich werden Metadaten zu Datenportalen und Repositorien in Wikidata erfasst und über eine eigene Wikidata Property mit den persistenten Identifikatoren des Culture Information Portals gemappt, um die Vernetzung mit Metadaten aus anderen in Wikidata verzeichneten Quellen zu ermöglichen. Die im Culture Information Portal erfassten Forschungsinformationen werden in den Culture Knowledge Graph integriert und so mit Metadaten zu den konkreten Forschungsdaten aus den Datenportalen und Repositorien zusammengeführt. Bei der Verzeichnung von Forschungsinformationen im Culture Information Portal muss mitgedacht werden, dass diese auch für übergeord-
20 nete Zwecke bereitgestellt werden, so etwa für das in regelmäßigen Abständen bei der DFG einzureichende Datenblatt mit quantitativen Informationen zum Output des Konsortiums oder im Rahmen der geplanten Integration von Metadaten in europäische Systeme wie etwa den Resource Hub der European Open Science Cloud (EOSC). Die NFDIcore Ontology wird durch domänenspezifische Module der einzelnen Konsortien ergänzt, die den jeweiligen Standards, Praktiken, Interessen und Bedarfen der einzelnen Konsortien und ihrer Communities Rechnung tragen. Für NFDI4Culture wird dies in der NFDI4Culture Ontology (CTO) abgebildet. Forschungsdaten im engeren Sinne finden sich in den Datenportalen und Repositorien der NFDI4Culture Communities, die über die Erfassung in der Culture Registry für Forschungswerkzeuge und Datendienste im Culture Information Portal erstmals über einen einheitlichen Zugriffspunkt auffindbar und durch Verlinkungen zugänglich gemacht wurden. Durch die Integration von Metadaten zu den einzelnen Ressourcen der Datengebenden in Form von sogenannten Data Feeds wird zudem mit dem Culture Knowledge Graph eine semantische Datenintegrationsschicht über die verteilten multimodalen Datensätze der NFDI4Culture Communities hinweg geschaffen, um diese föderiert über einen SPARQL-Endpunkt und eine in das Culture Information Portal integrierte Data Search zusammen auffindbar und zugänglich zu machen. Bedingung für die Integration von einzelnen Data Feeds sind eine Reihe von Kriterien, die in der Handreichung Datenintegration in den Culture Knowledge Graph beschrieben sind. Ein Ansatz zur Messung und Bewertung der Datenqualität innerhalb von NFDI4Culture sollte Angebote mit und ohne Knowledge-Graph-Integration berücksichtigen und erfassen können. 8.2. Erste Umsetzungsstufe für Datenqualität: FAIR Makro-Analyse Mit der Verzeichnung aller Datenangebote der Konsortiums mit zugehörigen Metadaten begannen gleichzeitig Überlegungen, wie dabei auch die Qualität der Daten in den jeweiligen Datenportalen und Repositorien erfasst werden kann. Aufgrund der großen Breite des zu analysierenden Datenspektrums war im ersten Schritt ein pragmatisches Vorgehen notwendig. Deshalb haben wir zunächst stellvertretend je einen wesentlichen Indikator aus den vier FAIRPrinzipien herausgegriffen, mit dem die FAIRness zunächst grob auf einer Makroebene beschrieben werden kann: 1. die Verwendung von Persistenten Identifikatoren (PIDs) für Daten und/oder Metadaten (Findable 1) 2. die Bereitstellung von Daten über APIs (Accessible 1), 3. die Verwendung bestimmter Normdaten und kontrollierter Vokabulare pro Portal (Interoperable 2) und 4. die Nutzung von Metadaten-Standardformaten aus unserem Bereich (Reusable 1.3). Im Sinne des EOSC Data Quality Frameworks sind mit den vier Kriterien grundlegende Mindestanforderungen abgedeckt: 36 Wenn diese fehlen, ist das Datenangebot zumindest für maschinelle Auswertungen nicht oder nur sehr eingeschränkt nutzbar oder verstehbar, seine Gebrauchstauglichkeit ist dementsprechend limitiert. Die Erfüllung der Mindestanforderungen garantiert eine ausreichende, aber nicht unbedingt optimale Qualität des Datensatzes. 36 Lacagnina, C. et al. (2023) https://doi.org/10.5281/zenodo.7515816, S. 24; vgl. zudem hier Kap. 6.1.
21 Danach wurden für jeden Indikator bestimmte Prüfmerkmale festgelegt, die jeweils in Wertelisten festgehalten sind. Die Auswahl der Merkmale trägt den in unseren Communities verbreiteten Standards Rechnung, ist aber gleichzeitig so breit aufgestellt, dass die Unterschiedlichkeit der Angebote berücksichtigt ist. 1. Auffindbarkeit: Persistenter Identifier Anerkannt und verbreitet und damit als Prüfmerkmal gesetzt sind in unseren Domänen: ● ARK (Archival Resource Key) ● DOI (Digital Object Identifier) ● EPIC (European Persistent Identifier Consortium) ● Handle ● Permalink ● PURL (Persistent Uniform Resource Locator) ● URN (Uniform Resource Name) 2. Zugänglichkeit: Schnittstellen (API – Application Programming Interface) Folgende Standardschnittstellen werden von den NFDI4Culture-Datenangeboten genutzt: ● GraphQL ● IIIF Image API ● IIIF Presentation API ● OAI-PMH (Open Archives Initiative - Protocol for Metadata Harvesting) ● REST (Representational State Transfer) ● SPARQL (SPARQL Protocol And RDF Query Language) ● SRU (Search/Retrieve via URL) 3. Interoperabilität: Normdaten und kontrollierte Vokabulare In unseren Datenangeboten werden folgende weit verbreitete Vokabulare, die selbst FAIR sind, verwendet bzw. bereitgestellt: ● AAT (Getty Art and Architecture Thesaurus) ● BNF (Vokabulare der Bibliothèque nationale de France) ● GeoNames ● GND (Gemeinsame Normdatei) ● Iconclass ● LC (Vokabulare der Library of Congress) ● VIAF (Virtual International Authority File) ● Wikidata 4. Wiederverwendbarkeit: Metadatenstandards Folgende, in unseren Communities häufig verwendete Standards haben wir in den Datenangeboten identifiziert: ● CERIF (Common European Research Information Format) ● CIDOC CRM (CIDOC Conceptual Reference Model) ● DataCite ● Dublin Core ● EDM (Europeana Data Model) ● IIIF (International Image Interoperability Framework) ● LIDO (Lightweight Information Describing Objects) ● MARC21 (Machine-Readable Cataloging) ● MEI (Music Encoding Initiative) ● METS (Metadata Encoding & Transmission Standard)
22 ● MODS (Metadata Object Description Schema) ● RDF (Resource Description Framework) ● Schema.org ● TEI (Text Encoding Initiative) ● XMP (Extensible Metadata Platform) Ein weiterer, separat bewerteter und gleichrangig zu den vier anderen gewichteter Indikator ist die Bereitstellung von Daten zur Integration in den Culture Knowledge Graph, oder deren erfolgreiche Umsetzung. Dieses Kriterium ist vor allem für das FAIR-Prinzip der Auffindbarkeit, aber auch für die Interoperabilität und die Nachnutzbarkeit relevant. Datenbestände aus den verschiedenen Domänen, wie digitale Musikeditionen oder Repräsentationen materieller Kulturgüter, werden zwar nie vollständig interoperabel sein, können aber über den Culture Knowledge Graph miteinander verbunden und disziplinenübergreifend nachgenutzt werden. Dieser Indikator kann in der Regel nicht von den Datenanbietenden allein, sondern nur in Zusammenarbeit mit dem Konsortium realisiert werden. Die Umsetzung wird erheblich erleichtert, wenn das Datenangebot hinsichtlich der zuvor genannten und von den FAIR-Prinzipien abgeleiteten Indikatoren von guter Qualität ist. Ergab die Analyse der Datenangebote, dass mindestens ein Prüfmerkmal im Bereich eines jeden Indikators vorhanden war oder die Daten für den Culture Knowledge Graph bereit waren, so galt der Indikator als umgesetzt. Die Erfüllung mehrerer Prüfmerkmale für einen Indikator führte nicht zu einer Höherbewertung des Angebots. Dazu zwei Beispiele: ● Ein Repositorium, das DOIs anbietet, eine REST-API aufweist, Daten im DataCite-Format bereitstellt, Personen mit ORCID referenziert und in den Culture Knowledge Graph integriert wurde, bekommt 5 Punkte. ● Eine Datenplattform mit Permalinks, verfügbar über OAI-PMH, mit Datenangebot in Dublin Core und im LIDO-Format, GNDund GeoNames-Normdatenreferenzen sowie Culture Knowledge Graph-Integration bekommt ebenfalls 5 Punkte. Technisch wird diese Makro-Analyse nun im Culture Information Portal folgendermaßen verankert: Die einzelnen Prüfmerkmale aus den Listen werden als Defined Terms angelegt und können bei der Datenerfassung zukünftig als Metadaten zu den Datenangeboten ausgewählt werden. Sie können auch im Frontend des Portals ausgespielt werden, so dass die Nutzenden wichtige Informationen zur Qualität der Daten in den Datenportalen und Repositorien erhalten. 8.2.1 Ergebnis der FAIR-Makro-Analyse Die Ergebnisse dieser FAIR-Makro-Analyse, bei der wir stellvertretend für jedes der vier FAIRPrinzipien einen zentralen Indikator bei der Gesamtzahl von 74 Angeboten (Stand Juli 2024) überprüften, haben wir in unserem öffentlich zugänglichen Culture Data Dashboard visualisiert. Die Analyse der Datenportale und Repositorien auf die Prüfmerkmale hin erfolgte durch NFDI4Culture-Mitarbeitende zunächst noch per Autopsie in händisch-intellektueller Arbeit. Oft waren die Informationen zu den Qualitätskriterien auf den Websites der Angebote nicht leicht zu finden. Sie sind damit auch für die Nutzenden nur schwer ermittelbar. Eine Zusammenstellung
23 der so erhobenen Merkmale ließ eine erste grobe Einschätzung zum Umsetzungsstand der FAIRPrinzipien durch die jeweiligen Datenangebote zu. Im Ergebnis zeigte sich, wie Abbildung 3 veranschaulicht, dass rund 34% der Datenangebote vier bis fünf Kriterien umsetzen, etwa 50% bereits zwei bis drei Kriterien. Daraus wird deutlich, dass das Bewusstsein für FAIR schon weit verbreitet ist. Mit etwa 66% an Portalen und Repositorien, die maximal 3 Kriterien umsetzen, gibt es jedoch noch viel zu tun, um die Umsetzung von FAIRness bei unseren Partnern zu erhöhen und eine wirklich interoperable Föderation in unserem Bereich erreichen zu können. Viele der Angebote weisen gleich mehrere Merkmale pro FAIRKategorie auf, indem sie z. B. sowohl GND als auch Wikidata zur Referenzierung ihrer Daten nutzen. Dieser Umstand wurde bislang nicht berücksichtigt, soll aber künftig in die Bewertung eingehen. Abb. 3 Implementierungsstand von FAIR gemäß Makro-Analyse, Stand Juli 2024 (https://nfdi4culture.de/go/cdd) Prototypisch konnte mit der Makro-Analyse die erste Umsetzungsstufe einer DatenqualitätsMessung implementiert werden. Diese Form einer grundlegenden Messung mithilfe von wenigen Prüfmerkmalen soll aber noch ergänzt und verfeinert werden, um differenzierte Aussagen über das Profil und die Reifegrade der Angebote machen zu können. 8.2.2 Aufnahme der Datenangebote Datenportale stellen zusammen mit Datenrepositorien das übergreifende Datenportfolio dar, das über NFDI4Culture für die Communities (Forschende und Kultursektor) verfügbar gemacht wird. In der ersten Projektphase wurde daher unter Nutzung der entwickelten technischen Infrastruktur (vgl. Kapitel 8.1) ein Workflow für die Aufnahme neuer Datenangebote entwickelt, dargestellt in Abbildung 4.
24 Grundsätzlich nehmen wir die für NFDI4Culture relevanten Datenangebote unserer institutionellen Partner in unser Diensteportfolio auf und integrieren sie neben Software und Webanwendungen in die Culture Registry für Forschungswerkzeuge und Datendienste. Angebote anderer Institutionen können auf Antrag und nach Prüfung durch das Culture Spokesperson Committee (CSC) ebenfalls integriert werden. Die Aufnahme von neuen Datenangeboten erfolgt in mehreren Schritten: 1. Verzeichnung im Projektmanagement-System OpenProject (= Dokumentation und Qualitätssicherung) 2. Aufnahme in das Culture Information Portal und in die Culture Registry (= Sichtbarmachung, vgl. Kapitel 8.1) 3. Wenn möglich: Integration von Data Feeds des jeweiligen Datenangebots in den Culture Knowledge Graph (= Verfügbarmachung, vgl. Kapitel 8.1) 4. Erhebung von Kennzahlen und regelmäßige Auswertung für das DFG-Datenblatt (= Reporting, vgl. Kapitel 3) Abb. 4 Workflow zur Aufnahme von Datenangeboten als NFDI4Culture-Service Der erste Schritt zur Aufnahme eines Datenportals oder Repositoriums ist dessen Erfassung in unserem internen Dokumentationssystem OpenProject. Zur Regelung und Vereinheitlichung des Workflows wurde ein interner Erfassungsleitfaden für Datenportale entwickelt. Damit dokumentieren wir zugleich die Aufnahme und kontinuierliche Kuratierung der Metadaten zu den Datenangeboten als zentralen Bausteinen des übergreifenden Datenportfolios von NFDI4Culture. Bei Bitte um Aufnahme wird zunächst ein Ticket in der Kategorie SERVICE erstellt, in dem die Basisdaten (Kontaktadresse usw.) erfasst und alle weiteren Arbeitsschritte dokumentiert werden.
25 Danach wird geprüft, ob das Angebot der NFDI-Dienste-Definition 37 und den NFDI-Dienste-Kategorien 38 entspricht und ob es von einem NFDI4Culture-Partner angeboten wird. Nachdem der Partner die mit der Aufnahme seines Dienstes verbundene Verpflichtung zur Erhebung und Lieferung von Kennzahlen für das Ergänzende Datenblatt der DFG schriftlich bestätigt hat, beginnt die eigentliche Qualitätssicherung. Im Ticket werden das Intervall für das nächste Reporting, die DFG-Kennung und die DFG-Kategorie für das Datenblatt vermerkt. Nach der Verzeichnung in OpenProject wird das Datenangebot im Culture Information Portal angelegt und eine IRI dafür erzeugt. Hier sind wir in der Lage, differenzierte Informationen zur FAIRness der Daten und deren Qualität pro Datenportal nach den oben bereits genannten Kategorien in den Metadaten zu erfassen. Die einzelnen umgesetzten Prüfmerkmale werden über die Defined Terms (vgl. Kapitel 8.1) dokumentiert. Abschließend wird das Datenportal auch in der Culture Registry verzeichnet und der Metadatensatz zweisprachig im Culture Portal veröffentlicht. Nicht alle Datenangebote sind aus technischen oder qualitativen Gründen bereits für eine Integration in den Culture Knowledge Graph geeignet. Ob dies möglich ist, entscheidet sich durch eine technische Analyse der Schnittstellen, der bereitgestellten Exportformate und ggf. durch Absprachen zwischen den Datenanbietern und dem Team. Die Voraussetzungen für die Integration der Datenangebote in den Culture Knowledge Graph werden auch in der Handreichung Datenintegration in den Culture Knowledge Graph beschrieben. Ist ein Datenportal einmal in das Diensteportfolio aufgenommen, sind die Anbieter zur regelmäßigen Angabe von Kennzahlen für das Reporting von NFDI4Culture und für das Ergänzende Datenblatt der DFG verpflichtet. 8.3 Zweite Umsetzungsstufe für Datenqualität: FAIR Mikro-Analyse Nachdem die erste Stufe (= FAIR-Makro-Analyse) konzeptionell und technisch erfolgreich umgesetzt wurde, besteht die Aufgabe für das Konsortium nun darin, auf dieser Basis eine detailliertere Lösung für die Messung von FAIRness und Datenqualität zu entwickeln. Brauchen wir weitere Prüfmerkmale? Wie granular soll geprüft werden? Wie kann der quantitative Umsetzungsgrad bestimmter Merkmale (z. B. der Einsatz von kontrollierten Vokabularen pro Entität) berücksichtigt werden? Welche messbaren Werte sind insgesamt relevant, d. h. geben am besten Aufschluss über die Qualität eines Angebots und wie sollen diese jeweils gewichtet werden? Um einen Überblick über die Qualitätskriterien der in Kapitel 7 beschriebenen Stufenmodelle zu gewinnen, haben wir diese zunächst für jedes Modell einzeln aufgelistet und sondiert, welche der gesammelten Kriterien auf welche Weise überprüft werden können, etwa durch • einfache Ja/Nein-Angaben der Anbieter, • qualifizierte, differenzierte Angaben der Anbieter, 37 Vgl. Konsortialversammlung des Vereins Nationale Forschungsdateninfrastruktur (NFDI) e.V. (2022). Stellungnahme der NFDI-Konsortien zu Basisdiensten. Zenodo. https://doi.org/10.5281/zenodo.6091657. 38 Vgl. Amelung, L. / Anthofer, V. / Danabalan, R. / Demandt, É. / Ebert, B. / Elschner, E. / Espinoza, S. / Eufinger, J. / Fuchsloch, S. / Götz, B. / Henzen, C. / Hunold, J. / Idda, T. / Jansen, L. / Krieger, U. / Rodrigues, C. M. / Meister, M. / Miller, B. / Pitroff, S. / Zinke, W: White Paper: Interim Report Reference, 2023, https://doi.org/10.5281/zenodo.7688729, S. 16 ff.
32 10. Verwendete Literatur Offizielle Papiere und Empfehlungen: Bund-Länder-Vereinbarung zu Aufbau und Förderung einer Nationalen Forschungsdateninfrastruktur (NFDI) vom 26. November 2018, https://www.gwkbonn.de/fileadmin/Redaktion/Dokumente/Papers/NFDI.pdf. Deutsche Forschungsgemeinschaft: Leitlinien zum Umgang mit Forschungsdaten, 2015, https://www.dfg.de/resource/blob/172112/leitlinien-forschungsdaten.pdf. Deutsche Forschungsgemeinschaft: Leitlinien zur Sicherung guter wissenschaftlicher Praxis. Kodex, September 2024 / korrigierte Version 1.2 https://doi.org/10.5281/zenodo.14281892. Lacagnina, Carlo / David, Romain / Nikiforova, Anastasija et al.: TOWARDS A DATA QUALITY FRAMEWORK FOR EOSC (1.0.0), 2023, https://doi.org/10.5281/zenodo.7515816. EOSC interoperability framework – Report from the EOSC Executive Board Working Groups FAIR and Architecture, Publications Office, 2021, https://data.europa.eu/doi/10.2777/620649. Konsortialversammlung des Vereins Nationale Forschungsdateninfrastruktur (NFDI) e. V.: Stellungnahme der NFDI-Konsortien zu Basisdiensten, 2022, https://doi.org/10.5281/zenodo.6091657. Rat für Informationsinfrastrukturen: Herausforderung Datenqualität – Empfehlungen zur Zukunftsfähigkeit von Forschung im digitalen Wandel, Göttingen 2019, https://rfii.de/?p=4043. Rat für Informationsinfrastrukturen: Bestandsbezogene Forschung gestalten: zukunftsfähige Verschränkungen von „digital“ und „analog“. Ein Diskussionsimpuls zur wissenschaftlichen, wissenschaftsnahen und kulturellen Nutzbarkeit von Sammlungen, Göttingen 2021, https://rfii.de/?p=7339. Rat für Informationsinfrastrukturen: Sammlungen als multimodale Infrastrukturen. Analog und digital für die verknüpfte Nutzung erschließen, Göttingen 2024, https://rfii.de/?p=11282. Amelung, Lisa / Anthofer, Verena / Danabalan, Renita et al.: White Paper: Interim Report Reference, 2023,. https://doi.org/10.5281/zenodo.7688729. Altenhöner, Reinhard / Berger, Andreas / Bracht, Christian et al.: DFG-Praxisregeln "Digitalisierung". Aktualisierte Fassung 2022, 2023, https://doi.org/10.5281/zenodo.7435724. Spezielle Leitlinien und Standards: CoreTrustSeal Standards and Certification Board, CoreTrustSeal Requirements 2023–2025 (V01.00), https://doi.org/10.5281/zenodo.7051012. DataCite Metadata Working Group: DataCite Metadata Schema Documentation for the Publication and Citation of Research Data. Version 4.3. DataCite e.V. 2019, https://doi.org/10.14454/7xq3-zf69.
33 Europeana Publishing Guide. A guide to the metadata and Content requirements for data partners Publishing material in Europeana Collections, Europeana Foundation, https://europeana.atlassian.net/wiki/spaces/EF/pages/2059763713/Publishing+guide; Version von 2019: https://travesia.mcu.es/server/api/core/bitstreams/69537a27-3662-4e8d8443-119446f85be3/content. Alkemade, Henk / Claeyssens, Steven / Colavizza, Giovanni et al.: Datasheets for Digital Cultural Heritage Datasets (Version 1), 2023, https://doi.org/10.5281/zenodo.8375034; https://pro.europeana.eu/project/datasheets-for-digital-cultural-heritage-working-group Kailus, Angela: Handreichung für ein FAIRes Management kulturwissenschaftlicher Forschungsdaten. NFDI4Culture 2023, https://nfdi4culture.de/id/E3625. nestor – Kompetenznetzwerk Langzeitarchivierung. Erläuterungen zum Nestor-Siegel für vertrauenswürdige digitale Langzeitarchive, Version 2.2., Frankfurt 2024, https://dnb.info/1334021635/34. Projekt Verbesserung der Qualität der Metadaten und der Prozesse der Verarbeitung in der DDB: https://wiki.deutsche-digitalebibliothek.de/spaces/DDBDOK/pages/78512325/Verbesserung+der+Qualit%C3%A4t+der+ Metadaten+und+der+Prozesse+der+Verarbeitung+in+der+DDB RDA FAIR Data Maturity Model Working Group: Das FAIR Data Maturity Model. Spezifikation und Leitlinien, 2020, https://doi.org/10.5281/zenodo.5834115; engl.: https://doi.org/10.15497/rda00050. Sonstige Literatur: Bruns, Sasha / Büttner, Alexandra / Fliegl, Heike et al.: Data integration into the Culture Knowledge Graph (1.1.0). NFDI4Culture 2025, https://nfdi4culture.de/id/E6283. Franke-Maier, Michael / Kasprzik, Anna / Ledl, Andres / Schürmann, Hans (Hg.): Qualität in der Inhaltserschließung, Berlin/Boston 2021, https://doi.org/10.1515/9783110691597. Kesper, Arno / Wenz, Viola / Taentzer, Gabriele: Detecting quality problems in research data: a model-driven approach, in: Association for Computing Machinery. Proceedings of the 23rd ACM/IEEE International Conference on Model Driven Engineering Languages and Systems (MODELS '20), New York 2020, S. 354–364, https://doi.org/10.1145/3365438.3410987. Király, Peter: Measuring Data Quality, Göttingen 2019, http://dx.doi.org/10.53846/goediss7578. Király, Peter / Brase, Jan: 4.3 Qualitätsmanagement, in: Putnings, Markus / Neuroth, Heike / Neumann, Janna: Praxishandbuch Forschungsdatenmanagement, Berlin/Boston 2021, S. 357–379, https://doi.org/10.1515/9783110657807. Stein, Regine / Taentzer, Gabriele: How to Define the Quality of Data and Data Models? A Perspective from the Cultural Heritage Domain, 2023, https://doi.org/10.5281/zenodo.7705014. Wilkinson, Mark D. / Dumontier, Michel / Aalbersberg, IJsbrand et al.: The FAIR Guiding Principles for scientific data management and stewardship, Sci Data 3, 2016, https://doi.org/10.1038/sdata.2016.18.
34 Wilkinson, Mark D. / Sansone, Susanna-Assunta / Grootveld, Marjan et al.: FAIR Assessment Tools: Towards an "Apples to Apples" Comparisons, 2022, https://doi.org/10.5281/zenodo.7463421.
35 Danksagung Die Autorinnen sprechen folgenden Personen ihren Dank aus – für wichtigen inhaltlichen Input und Ergänzungen, aber auch für das Korrekturlesen und die technische Unterstützung bei der Publikation: Martin Albrecht-Hohmaier, Katharina Bergmann, Christian Bracht, Alexander Faschon, Desiree Mayer, Frodo Podschwadek, Patrick Primavesi, Torsten Schrade, Linnaea Söhn, Martha Stellmacher und Barbara Wiermann.