Die ethischen Implikationen von Prozessdaten: Eine systematische Literaturanalyse von Datenethik und Process Mining
Abstract
EconStor is a publication server for scholarly economic literature, provided as a non-commercial public service by the ZBW.
Full text
Gabdoulline, Gulnara; Kern, Christopher Julian; Krönung, Julia Article — Published Version Die ethischen Implikationen von Prozessdaten: Eine systematische Literaturanalyse von Datenethik und Process Mining HMD Praxis der Wirtschaftsinformatik Provided in Cooperation with: Springer Nature Suggested Citation: Gabdoulline, Gulnara; Kern, Christopher Julian; Krönung, Julia (2023) : Die ethischen Implikationen von Prozessdaten: Eine systematische Literaturanalyse von Datenethik und Process Mining, HMD Praxis der Wirtschaftsinformatik, ISSN 2198-2775, Springer Fachmedien Wiesbaden GmbH, Wiesbaden, Vol. 61, Iss. 1, pp. 252-265, https://doi.org/10.1365/s40702-023-01027-2 This Version is available at: https://hdl.handle.net/10419/318416 Standard-Nutzungsbedingungen: Die Dokumente auf EconStor dürfen zu eigenen wissenschaftlichen Zwecken und zum Privatgebrauch gespeichert und kopiert werden. Sie dürfen die Dokumente nicht für öffentliche oder kommerzielle Zwecke vervielfältigen, öffentlich ausstellen, öffentlich zugänglich machen, vertreiben oder anderweitig nutzen. Sofern die Verfasser die Dokumente unter Open-Content-Lizenzen (insbesondere CC-Lizenzen) zur Verfügung gestellt haben sollten, gelten abweichend von diesen Nutzungsbedingungen die in der dort genannten Lizenz gewährten Nutzungsrechte. Terms of use: Documents in EconStor may be saved and copied for your personal and scholarly purposes. You are not to copy documents for public or commercial purposes, to exhibit the documents publicly, to make them publicly available on the internet, or to distribute or otherwise use the documents in public. If the documents have been made available under an Open Content Licence (especially Creative Commons Licences), you may exercise further usage rights as specified in the indicated licence. http://creativecommons.org/licenses/by/4.0/deed.de
SCHWERPUNKT https://doi.org/10.1365/s40702-023-01027-2 HMD Praxis der Wirtschaftsinformatik (2024) 61:252–265 Die ethischen Implikationen von Prozessdaten: Eine systematische Literaturanalyse von Datenethik und Process Mining Gulnara Gabdoulline · Christopher Julian Kern · Julia Krönung Eingegangen: 25. August 2023 / Angenommen: 26. November 2023 / Online publiziert: 19. Dezember 2023 © The Author(s) 2023 Zusammenfassung Process Mining (PM) stellt eine wachsende Disziplin dar, die aufgrund ihres Potenzials zur Verbesserung von Geschäftsprozessen immer mehr Aufmerksamkeit von Forschern und Anwendern auf sich zieht. Wie jede neue Technologie gibt es jedoch auch im Kontext von PM-Bedenken hinsichtlich der ethischen Anwendung. Gerade bezogen auf Erhebung, Verarbeitung und Nutzung von Daten kann es hierbei zu Problemen kommen. Dieser Artikel zielt daher darauf ab, anhand einer Literaturanalyse ethische Implikationen im Process Mining herauszuarbeiten. Dabei wurden 39 Artikel aus sechs Zeitschriften im Bereich PM und 24 Artikel aus vier Zeitschriften im Bereich Datenethik analysiert. Die Ergebnisse zeigen das wachsende Interesse an der Datenethik und PM, aber es befasst sich nur ein geringer Anteil der analysierten PM-Artikel mit datenethischen Grundsätzen. Weitere Forschung ist in Bereichen bestimmter datenethischer Grundsätze, wie Datenqualität und der informierten Zustimmung, erforderlich. Insgesamt bietet diese Studie einen Ausgangspunkt für weitere Forschungen zur ethischen Nutzung von Daten bei der Anwendung von PM und verdeutlicht, dass diesem Bereich mehr Aufmerksamkeit gewidmet werden sollte. Schlüsselwörter Datenethik · Prozessdaten · Process Mining · Literaturanalyse · Ethische Richtlinien Gulnara Gabdoulline · Christopher Julian Kern · Julia Krönung Fernuniversität in Hagen, 58097 Hagen, Deutschland E-Mail: [email protected] Christopher Julian Kern E-Mail: [email protected] Julia Krönung E-Mail: [email protected] K
Die ethischen Implikationen von Prozessdaten: Eine systematische Literaturanalyse von... 253 The Ethical Implications of Process Data: A Systematic Literature Review of Data Ethics and Process Mining Abstract Process Mining (PM) is of increasing attention for researchers and practitioners alike, especially in regards of the potential to improve business processes in their efficiency. However, like any new data-driven technology, PM raises ethical concerns about the collection, processing, and use of data. The purpose of this paper is to demonstrate ethical implications in process mining by conducting a literature review. To do so, 39 articles from six journals in the field of PM and 24 articles from four journals in the field of data ethics were analyzed. The results show that despite there being growing interest in data ethics and PM, only a small percentage of the PM articles analyzed address data ethical principles. This highlights the need for clear ethical guidelines for use in PM. Further research is needed in areas of specific data ethics principles such as data quality and informed consent. As a result, this review provides a foundation for further research on the ethical use of data in the application of PM. Keywords Data Ethics · Process Data · Process Mining · Literature Review · Ethical guidelines 1 Einleitung Immer mehr Unternehmen und Organisationen verlassen sich zunehmend auf Datengestützte Systeme und Geschäftsmodelle, um fundierte Entscheidungen zu treffen und einen Wettbewerbsvorteil zu erlangen (Elgendy und Elragal 2014). Der rechtskonforme Umgang mit Daten wird hierbei vorausgesetzt. Eine steigende Zahl an Initiativen zeigt, dass dieser nicht ausreicht, sondern ein ethischer Umgang mit Technologie im Allgemeinen (bspw. Spiekermann 2015; Spiekermann et al. 2022;D.E. 2023) und mit Daten im Speziellen (Floridi und Taddeo 2016) auf gesellschaftliches Interesse stößt. Das neue Forschungsfeld „Digital Responsibility“ (Trier et al. 2023) befasst sich mit der verantwortungsvollen Gestaltung von digitalen Technologien und umfasst dabei auch deren ethische Implikationen. Gerade mit diesem Gedanken und dem der verantwortungsvollen Innovation (Stahl et al. 2014) ist der ethische Umgang mit Daten und datengetriebenen Geschäftsmodellen sowohl für Praktiker als auch für Wissenschaftler von Interesse. Um aus den Daten der Geschäftsprozesse einen zusätzlichen Mehrwert generieren zu können, bietet sich Process Mining (PM), an – wodurch die Verbesserung von Geschäftsprozessen durch die Analyse von Ereignisprotokollen ermöglicht wird (van der Aalst 2011). Allerdings existieren auch hier ethische Bedenken: Unternehmen sollten bei den gesammelten Daten, die verarbeitet und gespeichert werden, Datenschutz, Datensicherheit und Transparenz berücksichtigen (van der Aalst 2016). Besonders Bedenken hinsichtlich des potenziellen Missbrauchs sensibler Daten wie bspw. persönlicher Informationen sind bei der Anwendung von PM präsent (van der Aalst 2016). K
254 G. Gabdoulline et al. Dieser Artikel analysiert die ethischen Implikationen von PM-Anwendungen und leitet daraus Richtlinien und bewährte Verfahren zur Sicherstellung von verantwortungsvoller Datennutzung ab. Durch die ethische Nutzung von Daten kann Vertrauen geschaffen, die individuellen Rechte der Nutzer und deren Interessen geschützt werden (Alt et al. 2021). Um diesem Forschungsbereich zu erweitern wurde eine systematische Literaturanalyse durchgeführt. Hierfür wurden die folgenden Forschungsfragen gewählt: FF 1: Wie ist der aktuelle Forschungsstand ethischer Implikationen in Process Mining? FF 2: Wie werden datenethische Fragen betrachtet und welche bewährten Verfahren können ethisches Verhalten im Zusammenhang mit Process Mining unterstützen? Dieser Artikel ist in mehrere Abschnitte unterteilt. Abschn. 1, die Einleitung betrachtet die wachsende Bedeutung datengestützter Systeme, insbesondere unter Berücksichtigung ethischer Aspekte. Der theoretische Hintergrund in Abschn. 2 beleuchtet Datenethik und Process Mining. Abschn. 3 erläutert die angewandte Forschungsmethode der Literaturanalyse. Die Ergebnisse werden in Abschn. 4, jeweils separat für Datenethik in Abschn. 4.1 und Process Mining in Abschn. 4.2 präsentiert. In der Diskussion in Abschn. 5, werden die ethische Implikationen gegenübergestellt. In der Zusammenfassung in Abschn. 6 werden die Hauptergebnisse zusammengefasst, und Impulse für die praxisnahe Implementierung von PM und Datenmanagement abgeleitet. 2 Theoretischer Hintergrund 2.1 Datenethik Floridi und Taddeo (2016) definieren Datenethik als den Zweig der Ethik, der moralische Probleme im Zusammenhang mit Daten und Algorithmen untersucht und bewertet, um moralisch gute Lösungen zu formulieren. Die meisten ethischen Fragen in Zusammenhang mit Daten beziehen sich auf Daten über Menschen (Hand 2018). Datenethik bildet einen wesentlichen Bestandteil eines verantwortungsvollen Datenmanagements und stellt sicher, dass Daten zum Wohle der Allgemeinheit verwendet werden (Mittelstadt und Floridi 2016). Zu den wichtigsten ethischen Grundsätzen gehören Datenschutz (Floridi 2014), Transparenz (Turilli und Floridi 2009), die Vermeidung von Voreingenommenheit, Verzerrung und Diskriminierung durch Daten (Mehrabi et al. 2022), Verantwortung (Slussareff 2022), Informierte Zustimmung (Mittelstadt und Floridi 2016), sowie Datenqualität (Cai und Zhu 2015). 2.2 Process Mining PM ist ein datengesteuerter Ansatz zur Analyse und Optimierung von Geschäftsprozessen, bei dem Informationen aus Ereignisprotokollen extrahiert werden, um Mus- K
Die ethischen Implikationen von Prozessdaten: Eine systematische Literaturanalyse von... 255 ter in Aktivitäten zu erkennen und die Prozessleistung zu messen (van der Aalst und Weijters 2004). PM bietet Vorteile wie die Identifizierung von Prozessineffizienzen, die Kostenreduktion und die Verbesserung der Prozessqualität (Rozinat und van der Aalst 2006). Zu den drei Haupttechniken im PM gehören die Prozessentdeckung (Process Discovery), die Konformitätsprüfung (Conformance Checking) und die Verbesserung (Enhancement) (van der Aalst 2011). PM weist verschiedene Perspektiven auf, darunter Kontrollfluss-, Fall-, Zeit-, Organisations-, Ressourcen-, Prozess- und Datenperspektiven. Jede Perspektive ermöglicht spezifische Analyse- und Visualisierungsmöglichkeiten (van der Aalst 2011). Bei der Anwendung von PM müssen bestimmte Datenanforderungen berücksichtigt werden (van der Aalst et al. 2010). Die Datenqualität kann sich auf die Genauigkeit und Gültigkeit der durch PM erzielten Ergebnisse auswirken, so dass es wichtig ist, sicherzustellen, dass die verwendeten Daten für den Zweck geeignet sind (Dustdar et al. 2006). 3 Methodik Um die Forschungsfragen zu beantworten, wurde in dieser Arbeit eine Literaturanalyse nach Webster und Watson (2002) durchgeführt. Die Auswahl dieser Methodik erfolgte aufgrund ihrer strukturierten und systematischen Vorgehensweise, die eine adäquate Identifikation, Auswahl und kritische Bewertung relevanter Literatur ermöglicht. Für den Suchbegriff „Data Ethics“ wurden ausschließlich englischsprachige Zeitschriften im Bereich der Philosophie in Betracht gezogen. Die Auswahl erfolgte auf Basis des SCImago Journal Rank (SJR) (SCImago o.J.), um relevante Literatur zu identifizieren. Der SJR ist ein Indikator, der die wissenschaftliche Bedeutung von Zeitschriften anhand von Zitationsdaten bewertet. Die Top-26-Zeit- schriften gemäß SJR-Ranking wurden mittels des Suchbegriffs „Data Ethics“, ohne zeitliche Einschränkungen, einer Volltextsuche unterzogen, was zu 33 Treffern führte. Durch sorgfältiges Screening der Volltexte wurden irrelevante Artikel eliminiert, sodass schließlich 24 Publikationen als relevant identifiziert wurden. Dabei wurde darauf geachtet, dass die ausgewählten Publikationen das Thema nicht nur erwähnen, sondern einen aktiven Forschungsansatz damit verfolgen, oder das Thema zumindest prominent behandeln. Exkludiert hingegen wurden solche Artikel, die das Thema Datenethik nur grob streifen, oder aber lediglich namentlich erwähnen Tab. 1. Tab. 1 Dokumentation der analysierten Zeitschriften: Datenethik Zeitschrift Zeitraum1Analysiert Berücksichtigt Minds and Machines 2019–2022 9 7 Philosophy & Technology 2017–2022 18 15 Science Technology and Human Values 2020 2 1 Synthese 2022 1 1 Gesamt 2017–2022 33 24 1Der Zeitraum beschreibt deskriptiv die zeitliche Abdeckung der gefundenen Artikel und stellt keine Einschränkung bei der Suche dar K
256 G. Gabdoulline et al. Tab. 2 Dokumentation der analysierten Zeitschriften: Process Mining Zeitschrift Zeitraum 1Analysiert Berücksichtigt TOP IS-Zeit- schriften Tier 1 (Lowry et al. 2013) MIS Quarterly (MISQ) 2016–2021 2 2 Information Systems Research (ISR) 2014–2018 2 1 Journal of Management Information Systems (JMIS) 2018 1 0 TOP IS-Zeit- schriften Tier 2 (Lowry et al. 2013) Decision Support Systems (DSS) 2006–2022 71 32 European Journal of Information Systems (EJIS) 2006–2017 2 0 Information & Management (I&M) 2019–2021 2 1 International Journal of Electronic Commerce (IJEC) 2014 1 0 Information Systems Journal (ISJ) – 0 0 Journal of the Association for Information Systems (JAIS) 2020–2022 6 2 Journal of Information Technology (JIT) 2010 1 0 Journal of Strategic Information Systems (JSIS) 2022 2 1 Gesamt –2006–2022 90 39 1Der Zeitraum beschreibt deskriptiv die zeitliche Abdeckung der gefundenen Artikel und stellt keine Einschränkung bei der Suche dar Für den Suchbegriff „Process Mining“ wurden die vorgeschlagenen englischsprachigen Top-Tier Zeitschriften der Wirtschaftsinformatik von Lowry et al. (2013)bis Rang 2, ohne zeitliche Einschränkungen, untersucht. Lowry et al. verwenden Clusteranalysen, um ihre Stichprobe von 21 Top-Tier-Fachzeitschriften für den Bereich Information Systems in verschiedene Ebenen zu unterteilen, um deren Einfluss zu bewerten. Die Auswahl erfolgte aufgrund ihrer Reputation und ihres Einflusses in der Forschungsgemeinschaft. Für den Suchbegriff „Process Mining“ wurden 90 Publikationen identifiziert und nach Screening der Volltexte auf ihre Relevanz überprüft. Irrelevante Artikel wurden eliminiert, und nur Publikationen, die aktiv auf PM eingehen wurden inkludiert. Exkludiert wurden solche Artikel, die das Thema zwar nannten, sich aber nicht auf einer inhaltlichen Ebene damit befassten. Insgesamt wurden 39 relevante Publikationen für die Analyse berücksichtigt. Eine vollständige Liste aller berücksichtigten Artikel ist auf Anfrage bei den Autoren verfügbar Tab. 2. 4 Ergebnisse der Literaturanalyse 4.1 Datenethik Die vorliegende Konzeptmatrix in Tab. 3präsentiert eine Übersicht über verschiedene datenethische Grundsätze, wie sie in ausgewählten relevanten Artikeln des Datenethik-Datensatzes identifiziert wurden. Im weiteren Verlauf erfolgt eine detaillierte Analyse bestimmter Grundsätze. Die in der Matrix aufgeführten Artikel K
Die ethischen Implikationen von Prozessdaten: Eine systematische Literaturanalyse von... 257 Tab. 3 Konzeptmatrix Datenethik Publikation Datenethische Grundsätze Datenqualität Datenschutz Informierte Zustimmung Transparenz Verantwortung Verzerrung Voreingenom- menheit Diskriminie- rung Aggarwal und Floridi (2020) –xx xx–– – Chomanski (2021) –x– –––x x Floridi (2018) xx– –––– x Floridi et al. (2019) –x– x––– x Hagendorff (2020) –xx x––x x Laat (2021)x x– xx xx x Lee und Floridi (2021) ––– x–xx x Loi (2019)– x– –– x– x Mökander et al. (2022) xx– x––– – Morley et al. (2021) –x– xxxx – Ratti und Graves (2021) x–– x––x – Saetra und Danaher (2022) –xx xx–– – Symons und Alvarado (2022) –x– –xxx x Taylor (2021) –xx –––– – repräsentieren dabei diejenigen, die im nachfolgenden Text einer eingehenden Untersuchung unterzogen werden. Die datenethischen Grundsätze wurden mittels einer induktiven Inhaltsanalyse der als relevant betrachteten Publikationen mit Fokus auf Datenethik ermittelt. Die Analyse zielte darauf ab, durch die Identifizierung von Schwerpunkten in den Publikationen Grundsätze zu erkennen, die für den adäquaten Einsatz datengetriebener Systeme von Bedeutung sind. Datenqualität: Datenverständnis, -beschreibung und -bereinigung sind entscheidend, um Probleme in Bezug die Genauigkeit und Korrektheit von Aussagen zu vermeiden (Ratti und Graves 2021). Digital Governance ermöglicht Prozesse zur Verbesserung von Datenqualität, -zuverlässigkeit, -sicherheit und -zugänglichkeit K
258 G. Gabdoulline et al. und fördert somit die Entwicklung effektiver Entscheidungsverfahren und Mechanismen zur Rechenschaftspflicht in datenbezogenen Prozessen (Floridi 2018). Datenschutz: Die Nutzung von KI kann zu erheblichen Herausforderungen im Datenschutz, wie Datenlecks oder fehlerhaft trainierten Algorithmen, führen (Hagendorff 2020; Chomanski 2021; Morley et al. 2021). Die Datenschutzgrundverordnung (DSGVO) wird dabei als entsprechender rechtlicher Rahmen erachtet (Loi 2019; Saetra und Danaher 2022), wobei der bestehende Schutz personenbezogener Daten möglicherweise nicht ausreicht, um Diskriminierung von nicht identifizierten Personen zu verhindern. Resultierend daraus ergibt sich eine vertiefte Diskussion über die die Wahrung der Privatsphäre, der wissenschaftlichen Gültigkeit und den Eigentumsrechten (Loi 2019). Informierte Zustimmung:Die ethische Verpflichtung zur Einholung der Zustimmung zur Veröffentlichung anonymisierter Daten besteht, trotz fehlender DSGVO- Vorschriften für anonymisierte oder pseudonymisierte Daten. Die Schwierigkeiten bei der Erlangung informierter Zustimmung werden ebenfalls untersucht (Aggarwal und Floridi 2020). Es wird in Frage gestellt, wie man sicherstellen kann, dass Personen den Zweck der gemeinsamen Datennutzung verstehen. Dabei wird betont, dass ohne Vertrauen informierte Zustimmung nicht möglich ist, was alternative Wege zur Sicherung der Rechtmäßigkeit erfordert (Taylor 2021). Transparenz:Eine Möglichkeit für die verständliche Offenlegung zur Datenerfassung, -nutzung und -weitergabe besteht in der Durchführung von Audits, um das Vertrauen in KI-basierte Systeme zu stärken (Mökander et al. 2022). Gleichzeitig wird Kritik über mangelnde Transparenz in KI-Forschung und -Entwicklung, mit negativen Auswirkungen auf Nutzerzustimmung, Datenschutz und Rechenschaftspflicht, geäußert (Hagendorff 2020). Verschiedene Strategien zur Verbesserung der Transparenz werden vorgeschlagen, darunter die Veröffentlichung einer Liste von Verstößen durch Nutzer und technische Lösungen (Floridi et al. 2019). Verantwortung: Eine der bedeutendsten ethischen Fragen im Zusammenhang mit dem Einsatz von Technologie betrifft die Verantwortung von Softwareentwicklern gegenüber den Personen, die von der Technologie beeinflusst werden (Saetra und Danaher 2022), wobei die Verantwortung für voreingenommene Daten nicht allein bei den Entwicklern der Algorithmen, sondern auch bei den für die Daten zuständigen Personen liegt (Symons und Alvarado 2022). Verzerrung:Es wird vorgeschlagen, Datensatz-Datenblätter zu erstellen, um eine verantwortungsbewusste Datenverarbeitung zu gewährleisten. Diese sollen Informationen zur Datensatzqualität und möglichen Verzerrungen enthalten. Darüber hinaus wird auf die Notwendigkeit neuer Techniken und Software-Tools hingewiesen, die Verzerrungen, Erklärbarkeit und Robustheit berücksichtigen sollen (Laat 2021). K
Die ethischen Implikationen von Prozessdaten: Eine systematische Literaturanalyse von... 259 Voreingenommenheit:Die Forschung konzentriert sich darauf, die Auswirkungen von Voreingenommenheit auf rassische Minderheiten zu verstehen und Maßnahmen zur Beseitigung von Voreingenommenheit in Algorithmen zu ergreifen (Lee und Floridi 2021; Symons und Alvarado 2022). Diskriminierung:Ein konkretes Beispiel für Diskriminierung ist der Cambridge- Analytica-Skandal, der die Problematik von Datenmissbrauch und schädlicher Vorurteile durch große Technologieunternehmen aufzeigt (Chomanski 2021). Eine mögliche Lösung hierfür ist die Einführung standardisierter Trainingsdatensätze (Hagendorff 2020). 4.2 Process Mining Ähnlich wie in Abschn. 4.1 bei der Identifikation der datenethischen Grundsätze, wurden die für PM und Datenethik als relevant erachteten Publikationen mittels Inhaltsanalyse hinsichtlich ihrer Erwähnung datenethischer Grundsätze betrachtet. Zusätzlich wurde hier untersucht, ob die jeweilige Publikation eine Prozess- bzw. eine Datensichtweise einnimmt. Zur Darstellung des gegenwärtigen Forschungsstands bezüglich ethischer Implikationen im Bereich des PM wird hervorgehoben, dass mit 7 der 39 analysierten PM-Publikationen nur eine begrenzte Anzahl spezifische Grundsätze der Datenethik oder relevante datenethische Fragestellungen thematisiert. Im Kontext des PM werden verschiedene Analyseansätze aus einer Datenperspektive betrachtet – darunter ein Qualitätsbewertungsansatz, der die Datenqualität aus zwei Hauptperspektiven bewertet: der Eignung der Daten für ihre Verwendung im PM und die Erkenntnisfähigkeit der Datenanalyse (Andrews et al. 2020). Weitere Perspektiven sind die Datenprozessperspektive (Caron et al. 2013), die die während eines Prozesses verwendeten, erzeugten oder manipulierten Informationen und ihre Beziehungen darstellt und in verschiedene Perspektiven unterteilt, sowie die Kontrollflussperspektive, die Datenflussperspektive und die organisatorische Perspektive (Suriadi et al. 2017). In den Publikationen zu PM ließen sich einige datenethische Grundsätze identifizieren. So spielen Datenschutz und individuelle Rechte in Unternehmensanwendungen eine Rolle (Breuker et al. 2016). Einwilligung und Transparenz bei der Datenverarbeitung (Kratsch et al. 2022), sowie die Identifizierung von Datenqualitätsdimensionen und deren Bedeutung für PM (Andrews et al. 2020)werdenals relevant angesehen. Datenschutzbedenken, insbesondere im Gesundheitswesen, werden bspw. im Fall von RFID-Etiketten hervorgehoben (Zhou und Piramuthu 2010). Die Erhebung ausreichender Daten für das PM ist mit Herausforderungen verbunden, insbesondere hinsichtlich Sicherheitsaspekten wie der Anonymisierung von Daten. Dabei ist die Wichtigkeit der Einhaltung datenethischer Grundsätze bei der Datenerhebung und -verwendung für die Analyse zu beachten (Cho et al. 2017). Die Signifikanz der Nutzung von Simulationen basierend auf realistischen Patientenmodellen wird ebenfalls betont, insbesondere für die Untersuchung von Behandlungsstrategien, die in realen Studien ethische Bedenken aufwerfen könnten (Meyer et al. 2014). K