Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen Konzepts und Implikationen für die Nutzung außergesetzlicher Merkmale bei qualifizierten Mietspiegeln
Abstract
EconStor is a publication server for scholarly economic literature, provided as a non-commercial public service by the ZBW.
Full text
Bothmann, Ludwig; Peters, Kristina Article — Published Version Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen Konzepts und Implikationen für die Nutzung außergesetzlicher Merkmale bei qualifizierten Mietspiegeln AStA Wirtschaftsund Sozialstatistisches Archiv Provided in Cooperation with: Springer Nature Suggested Citation: Bothmann, Ludwig; Peters, Kristina (2024) : Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen Konzepts und Implikationen für die Nutzung außergesetzlicher Merkmale bei qualifizierten Mietspiegeln, AStA Wirtschaftsund Sozialstatistisches Archiv, ISSN 1863-8163, Springer, Berlin, Heidelberg, Vol. 18, Iss. 2, pp. 185-201, https://doi.org/10.1007/s11943-024-00346-0 This Version is available at: https://hdl.handle.net/10419/315638 Standard-Nutzungsbedingungen: Die Dokumente auf EconStor dürfen zu eigenen wissenschaftlichen Zwecken und zum Privatgebrauch gespeichert und kopiert werden. Sie dürfen die Dokumente nicht für öffentliche oder kommerzielle Zwecke vervielfältigen, öffentlich ausstellen, öffentlich zugänglich machen, vertreiben oder anderweitig nutzen. Sofern die Verfasser die Dokumente unter Open-Content-Lizenzen (insbesondere CC-Lizenzen) zur Verfügung gestellt haben sollten, gelten abweichend von diesen Nutzungsbedingungen die in der dort genannten Lizenz gewährten Nutzungsrechte. Terms of use: Documents in EconStor may be saved and copied for your personal and scholarly purposes. You are not to copy documents for public or commercial purposes, to exhibit the documents publicly, to make them publicly available on the internet, or to distribute or otherwise use the documents in public. If the documents have been made available under an Open Content Licence (especially Creative Commons Licences), you may exercise further usage rights as specified in the indicated licence. http://creativecommons.org/licenses/by/4.0/deed.de
ORIGINALVERÖFFENTLICHUNG https://doi.org/10.1007/s11943-024-00346-0 AStA Wirtschaftsund Sozialstatistisches Archiv (2024) 18:185–201 Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen Konzepts und Implikationen für die Nutzung außergesetzlicher Merkmale bei qualifizierten Mietspiegeln Ludwig Bothmann · Kristina Peters Eingegangen: 13. April 2023 / Angenommen: 23. Juli 2024 / Online publiziert: 23. August 2024 © The Author(s) 2024 Zusammenfassung Mit der verstärkten Nutzung von Modellen des Maschinellen Lernens (ML) innerhalb von Systemen der automatisierten Entscheidungsfindung wachsen die Anforderungen an die Qualität von ML-Modellen. Die reine Prognosegüte ist nicht länger das alleinige Qualitätskriterium; insbesondere wird vermehrt gefordert, dass Fairnessaspekte berücksichtigt werden. Dieser Beitrag verfolgt zwei Ziele. Zum einen werden die aktuelle Fairnessdiskussion im Bereich ML (fairML) zusammengefasst und die aktuellsten Entwicklungen, insbesondere in Bezug auf die philosophischen Grundlagen des Fairnessbegriffs innerhalb ML, beschrieben. Zum anderen wird die Frage behandelt, inwiefern sogenannte „außergesetzliche“ Merkmale bei der Erstellung qualifizierter Mietspiegel genutzt werden dürfen. Ein aktueller Vorschlag von Kauermann und Windmann (AStA Wirtschaftsund Sozialstatistisches Archiv, Band 17, 2023) zur Nutzung außergesetzlicher Merkmale in qualifizierten Mietspiegeln beinhaltet eine modellbasierte Imputationsmethode, welche wir den gesetzlichen Anforderungen gegenüberstellen. Schließlich zeigen wir auf, welche Alternativen aus dem Bereich fairML genutzt werden könnten und legen dar, welche unterschiedlichen philosophischen Grundannahmen hinter den verschiedenen Verfahren stehen. Schlüsselwörter Amtliche Statistik · Automatisierte Entscheidungsfindung · Fairness · Maschinelles Lernen · Mietspiegel Ludwig Bothmann Department of Statistics, LMU Munich, München, Deutschland E-Mail: [email protected] Munich Center for Machine Learning (MCML), München, Deutschland Kristina Peters Faculty of Law, LMU Munich, München, Deutschland E-Mail: [email protected] K
186 L. Bothmann, K. Peters Fairness as a quality criterion in machine learning – Reconstruction of the philosophical concept and implications for the use of extra-legal features in qualified rent indices Abstract With the increased use of machine learning (ML) models within automated decision-making systems, the demands on the quality of ML models are growing. Pure prediction quality is no longer the sole quality criterion; in particular, there is an increasing demand to consider fairness aspects. This paper pursues two goals. First, it summarizes the current fairness discussion in the field of ML (fairML) and describes the most recent developments, especially with respect to the philosophical foundations of the concept of fairness within ML. On the other hand, the question is addressed to what extent so-called ‘extra-legal’ characteristics may be used in the compilation of qualified rent indices. A recent proposal by Kauermann and Windmann (AStA Wirtschaftsund Sozialstatistisches Archiv, Volume 17, 2023) on using extra-legal features in qualified rent indices includes a model-based imputation method, which we contrast with the legal requirements. Finally, we show which alternatives from the field of fairML could be used and outline the different basic philosophical assumptions behind the various methods. Keywords Official Statistics · Automated Decision Making · Fairness · Machine Learning · Rent Indices 1 Fairness im Maschinellen Lernen Systeme der automatisierten Entscheidungsfindung (automated decision making – ADM) werden immer populärer; sie werden beispielsweise zur Bewertung von Kreditrisiken, zur vorausschauenden Gefahrenabwehr (Predictive Policing) oder zur Zulassung von Bewerber:innen zu einem Universitätsstudium eingesetzt.1Diese ADMSysteme können direkt individuelle Lebensumstände beeinflussen. Eine naheliegende Forderung in Bezug auf die Qualität dieser Systeme ist daher, dass sie „fair“ sein sollen. Da eine Kernkomponente eines ADM-Systems ein Modell Maschinellen Lernens (ML-Modell) sein kann, überträgt sich die Forderung nach Fairness auf das ML-Modell. In diesem Beitrag wollen wir aktuelle Entwicklungen in der Debatte um Fairness im Maschinellen Lernen (ML) systematisieren, die damit zusammenhängenden Überlegungen in die deutsche Diskussion einbringen und aufzeigen, welche Implikationen diese für die Nutzung außergesetzlicher Merkmale bei der Erstellung qualifizierter Mietspiegel hat. Als Beispiel zur Darstellung der Debatte um Fairness in ML in Abschn. 2nutzen wir COMPAS (Correctional Offender Management Profiling for Alternative Sanctions).2Dieses von Northpointe entwickelte System soll Richter:innen bei ver1siehe https://algorithmwatch.org/en/wp-content/uploads/2019/02/Automating_Society_Report_2019. pdf (Aufrufdatum 31.01.2024) für einen aktuellen Überblick über ADM-Systeme in einigen EU-Ländern. 2https://s3.documentcloud.org/documents/2840784/Practitioner-s-Guide-to-COMPAS-Core.pdf (Aufrufdatum 31.01.2024). K
Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen... 187 schiedenen gerichtlichen Entscheidungen unterstützen. Die Grundidee ist – vereinfacht dargestellt –, dass ein ML-Modell die Wahrscheinlichkeit .i/ DP.y.i/ D 1jHi/vorhersagen soll, dass die angeklagte Person iin den kommenden zwei Jahren „rückfällig“ wird ( y.i/ 2f0,1g), also eine Ordnungswidrigkeit oder eine Straftat begehen wird. Hierbei beschreibt Hidie Menge aller Charakteristika und der Vorgeschichte des Individuums i– welche in einem empirischen Anwendungsfall durch einen Kovariablenvektor x.i/ lediglich angenähert werden kann. Die Behandlung t.i/ der Person (also die gerichtliche Entscheidung) basiert dann auf der vorhergesagten Wahrscheinlichkeit b.x.i//. COMPAS wurde vorgeworfen, es sei unfair in dem Sinne, dass das System unter anderem einen Bias bezüglich Schwarzer Menschen hat (Angwin et al. 2016); diesem Vorwurf trat Northpointe entgegen und legte dar, wieso dies aus ihrer Sicht nicht der Fall sei; einen guten Einblick in die Debatte gibt (Corbett-Davies et al. 2016). Der Dissens in dieser Frage rührt daher, dass der Begriff „Fairness“ unterschiedlich verstanden wird, und dass deshalb unterschiedliche Metriken zur Messung von Fairness zugrunde gelegt werden. FairML. Der Bereich des Fairness-bewussten ML (fairness-aware ML – fairML) setzt sich genau mit der Frage auseinander, wie man die ML-bezogene Unfairness in einem ADM-System messen und abmildern kann. Die Relevanz des Themas spiegelt sich in einer Fülle von aktuellen Beiträgen zu den großen ML-Konferenzen; auch hat sich etwa mit der „Conference on Fairness, Accountability, and Transparency“ (FAccT) eine Konferenz etabliert, die sich speziell mit den Themen Fairness, Verantwortlichkeit und Transparenz beschäftigt.3 Typischerweise haben Beiträge in diesem Bereich zwei Ziele, nämlich (a) eine Metrik vorzuschlagen, mit der die (Un-)Fairness eines ML-Modells gemessen wird, und (b) eine Methode vorzuschlagen, mit der sichergestellt werden soll, dass das resultierende ML-Modell einen guten Wert bezüglich dieser Metrik erreicht. Dabei haben sich zwei Gruppen von Metriken herauskristallisiert. Auf der einen Seite stehen die gruppenbasierten Fairnessmetriken: Hier werden oft bedingte Wahrscheinlichkeiten in bestimmten Subgruppen verglichen. Wenn Adie geschützten Merkmale (protected attributes – PA) bezeichnet (also die in besonderer Weise geschützten Merkmale wie im COMPAS-Beispiel die als binär angenommene Ethnie [b: Black / w: White]), Xandere Merkmale, Cvorhergesagte Wahrscheinlichkeitsscores und bydie vorhergesagte Zielgröße, können einige Fairnessmetriken wie folgt definiert werden (siehe Verma und Rubin 2018, für einen ausführlichen Überblick): Statistische Parität (Statistical parity – SP): P.byD1jADw/DP.byD1jAD b/. Bedingte SP (Conditional SP): P.byD1jADw;X Dx/ DP.byD1jAD b;X Dx/. Wohlkalibrierung (Well-calibration): P.y D1jADw;C Dc/ DP.y D1jAD b;C Dc/ Dc. 3https://facctconference.org/2024/ (Aufrufdatum 31.01.2024). K
188 L. Bothmann, K. Peters Auf der anderen Seite stehen die individuellen Fairnessmetriken, von denen wir zwei besonders erwähnen möchten. Fairness durch Aufmerksamkeit (Fairness through awareness, Dwork et al. 2012) verfolgt die Idee, dass ähnliche Individuen ähnlich behandelt werden sollten („similar individuals should be treated similarly“). Kontrafaktische Fairness (Counterfactual fairness, Kusner et al. 2017) führt den Begriff der Kausalität in die Diskussion ein und definiert Behandlungen als fair „if it is the same in (a) the actual world and (b) a counterfactual world where the individual belonged to a different demographic group“. Das Konzept der Kausalität ist seither stark in die Fairnessdebatte eingebunden, siehe Makhlouf et al. (2022)für einen Überblick. Wenig überraschend ist, dass es Kompatibilitätsprobleme gibt, also dass nicht bezüglich aller Metriken gleichzeitig Fairness erreicht werden kann. Ebensowenig überrascht, dass es in Bezug auf die gängigsten Fairnessmetriken einen Tradeoff zwischen Fairness und Vorhersagegüte gibt. Vielmehr war letzteres zu erwarten, da das ML-Modell durch Forderungen wie (bedingte) statistische Parität in seiner Flexibilität (stark) eingeschränkt wird. Für den vorliegenden Beitrag relevanter ist jedoch der Umstand, dass zwar viele Fairnessmetriken vorgeschlagen werden – also Messinstrumente bezüglich des Konzeptes „Fairness“; die Frage, was Fairness konkret bedeutet – was also die philosophische Basis des Konzepts Fairness ist –, wurde im Bereich fairML bis vor kurzem aber kaum beleuchtet. Insbesondere aus diesem Grund stehen die vorgeschlagenen Metriken relativ unverbunden nebeneinander. Zudem ist oft nicht klar ersichtlich, auf welches Konzept die verschiedenen Metriken abzielen; wenn das zu messende Konzept aber nicht klar definiert ist, ist es schwierig zu evaluieren inwiefern die Metrik zur Messung dieses Konzepts überhaupt geeignet ist. Um einen tragfähigen Beitrag zur gesellschaftlichen Diskussion bezüglich des Einsatzes von ADM-Systemen leisten zu können, muss aus unserer Sicht diese Auseinandersetzung und die Anbindung der Fairnessmetriken an ein anschlussfähiges philosophisches Konzept stattfinden. Die Überführung der verschiedenen Ansätze in ein einheitliches Konzept hat auch zum Ziel, den Dialog zwischen denjenigen zu erleichtern, die sich um Fairness von ADM-Systemen bemühen. Ohne einen solchen Dialog besteht die Gefahr, dass sich die Diskussion im Bereich ML von der gesellschaftlichen Debatte entfernt und als „technische Fingerübung“ keine Relevanz mehr für die real existierenden Fragestellungen hat. Im nächsten Abschnitt werden wir das von Bothmann et al. (2024) vorgestelle Konzept der Fairness in ML und dessen Implikationen für ML-Modelle in fairen ADM-Systemen erläutern. Daran anschließend werden wir in Abschn. 3intensiv auf die Nutzung außergesetzlicher Merkmale bei der Erstellung von Mietspiegeln eingehen. Hierbei werden wir zunächst die gesetzliche Grundlage beleuchten, dann aktuell vorgeschlagene Methoden diesbezüglich darstellen und die Bezüge zur Fairnessdebatte in ML aufzeigen. Schließlich legen wir dar, wie ein Mietspiegel erstellt werden müsste, der ebendiese Fairnessaspekte als Qualitätsanforderungen berücksichtigt. K
Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen... 189 2 Philosophische Grundlagen und Übertragung auf ML In Bothmann et al. (2024) wurde der Versuch unternommen, die philosophischen Grundlagen des Konzepts Fairness zu formalisieren und daraus Implikationen für die weitere Beschäftigung mit dem Thema innerhalb der fairML abzuleiten. Im Folgenden wollen wir die Ergebnisse dieser Überlegungen kurz zusammenfassen, um diese für die Diskussion über den Umgang mit außergesetzlichen Merkmalen nutzen zu können. Für eine ausführliche Darstellung sei auf die Originalquelle (Bothmann et al. 2024) verwiesen. 2.1 Grundkonzept der Fairness Die Idee von Fairness lässt sich bis zu Aristoteles zurückverfolgen (Aristoteles 1831). Demnach ist eine Handlung fair, wenn gilt: „Gleiche werden gleich behandelt, Ungleiche werden ungleich behandelt.“ Das allgemeine Verständnis von Fairness ist regelmäßig dadurch geprägt, dass es um eine Behandlung von Menschen durch Menschen geht. Hieraus folgt, dass ein ML-Modell per se nicht fair oder unfair sein kann; als fair oder unfair können nur die Handlungen bezeichnet werden, die basierend auf den ML-Prognosen ausgeführt werden. Die Konkretisierung dessen, was mit „Fairness“ bezeichnet wird, hängt davon ab, was den Bezugspunkt der Bewertung bilden soll: Soll (a) eine Sache oder ein sonstiges Gut verteilt werden, ohne dass es auf die betroffenen Personen ankommen soll? Oder soll hierbei (b) berücksichtigt werden, welche Individuen konkret betroffen sind? Während im ersten Fall die Fairness mittels einer einfachen Rechnung ermittelt werden kann – Aristoteles spricht hier von der arithmetischen Proportionalität –, hängt sie im zweiten Fall von der Beurteilung der Personen ab. In diesem zweiten Fall muss die von Aristoteles sogenannte „Würdigkeit“ der Personen festgelegt werden (man kann dies als task-spezifische Gleichheit interpretieren), um sodann die sogenannte geometrische Proportionalität zu ermitteln. Die Behandlung t.i/ einer Person isoll dann proportional zu ihrer Würdigkeit w.i/ sein, also t.i/ Dkw.i/:(1) Im Fall der arithmetischen Proportionalität wird davon ausgegangen, dass die natürliche Unterschiedlichkeit der betroffenen Person für ihre Behandlung keine Rolle spielt – beispielsweise bei Kaufverträgen, bei denen sich der Preis nur aus der Ware bestimmt und nicht zusätzlich aus den Merkmalen der Käuferin –, also t.i/ Dk8i2f1; :::; ng:(2) Das Konzept der geometrischen Proportionalität kann verallgemeinert werden, indem für die Behandlungsfunktion s./nicht nur lineare Funktionen der Würdigkeit zugelassen werden, sondern allgemein monotone Funktionen, so dass t.i/ Ds.w.i//; s./monoton:(3) K
190 L. Bothmann, K. Peters Darüber hinaus könnte sogar strenge Monotonie gefordert werden, damit wirklich immer Ungleiche ungleich behandelt werden. In der Realität haben sich aber Konstellationen durchgesetzt, in denen Plateaupunkte als fair angesehen werden, wenn z.B. der Steuersatz mit dem Einkommen zunächst steigt, ab einer gewissen Grenze aber konstant ist. In diesem Zusammenhang sind zwei normative Entscheidungen zu treffen, nämlich (a) wie die Würdigkeit oder task-spezifische Gleichheit im vorliegenden Fall zu definieren ist und (b) wie die Behandlungsfunktion s.w.i//konkret ausgestaltet ist. Gemäß Bothmann et al. (2024) kann eine faire Behandlung also wie folgt definiert werden: Definition 1 (Fair treatment) Die Behandlung t.i/ eines Individuums iwird fair genannt, genau dann wenn sie als normative Funktion der Würdigkeit des Individuums w.i/ abgeleitet ist, also, 9s./sodass t.i/ Ds.w.i//, wobei s./eine (streng) monotone Funktion ist. Die Aufgabe von ML oder der Statistik ist es nun, die Würdigkeit w.i/ – als Entscheidungsgrundlage für eine Behandlung – möglichst gut zu schätzen; typischerweise wird die Würdigkeit eine (Funktion einer) Erfolgswahrscheinlichkeit .i/ oder ein(es) Erwartungswert(s) .i/ sein. Wie bereits erwähnt, kann ML-Modell also per se nicht unfair sein, kann aber – durch schlechte Schätzung – Unfairness induzieren, wie Bothmann et al. (2024) wie folgt begründen: Durch die Reduktion der (potentiell unendlichdimensionalen) Information bezüglich eines Individuums auf eine endliche Menge von Variablen x.i/ einerseits und über die Schätzung des Zusammenhangs dieser Variablen mit der Würdigkeit, also der Schätzung von .x.i//andererseits, wird Unschärfe eingeführt. Dies kann dazu führen, dass die vorhergesagte Würdigkeit einer Person b.x.i//nicht der wahren Würdigkeit .i/ entspricht, also .i/ ¤b.x.i//, was bei streng monotonem s./ notwendig zu einer unfairen Behandlung t.i/ Ds.b.x.i/// führt. Bothmann et al. (2024) definieren in diesem Zusammenhang den Begriff der individuellen Wohlkalibrierung (individual well-calibration), die eingehalten ist, wenn .i/ Db.x.i//. Natürlich kann in der Praxis aufgrund der genannten Unschärfen strikte individuelle Wohlkalibrierung nie erreicht werden, weshalb im Grunde jede Behandlung, die auf einem ML-Modell basiert, als unfair angesehen werden muss. Die Definition einer gewissen, normativ als unproblematisch eingestuften Differenz zwischen .i/ und b.x.i//kann hier Abhilfe schaffen. 2.2 Behandlung geschützter Merkmale Einen besonderen Stellenwert nehmen in fairML die PAs ein, die sich beispielsweise aus Art. 3 GG ergeben können. Dies sind Merkmale, auf Basis derer Individuen nicht diskriminiert werden dürfen. Nun ist es natürlich inhärentes Ziel eines MLModells, unterschiedlichen Individuen unterschiedliche Scores b.x.i//zuzuweisen – die möglichst nah an den wahren Scores .i/ sind –, basierend auf den vorhandenen Merkmalen, also in einem nicht wertenden Sinn zu diskriminieren. Die von Bothmann et al. (2024) gegebenen Definitionen der deskriptiv bzw. normativ unfairen Behandlung bringen Klarheit darüber, was den Kern der PAs formal K
Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen... 191 ausmacht (wie oben werden PAs mit Abezeichnet, während Xandere, nicht geschützte Merkmale bezeichnet): Definition 2 (Deskriptiv unfaire Behandlung) Nehmen wir ein Paar von Individuen iund jan, die sich nur in Bezug auf das Merkmal Xunterscheiden. Angenommen, das Merkmal Xist kein kausaler Grund für einen Unterschied in den wahren Wahrscheinlichkeiten, d.h. .i/ D.j /. Eine Behandlung wird deskriptiv unfair in Bezug auf das Merkmal Xgenannt, wenn diese Individuen in einem Prozess – aufgrund von unterschiedlichen geschätzten individuellen Wahrscheinlichkeiten b.i/ ¤b.j / – unterschiedlich behandelt werden, d.h. t.i/.Ds.b.i/// ¤t.j /.Ds.b.j ///. Im Zusammenhang mit COMPAS kann das beispielsweise bedeuten: Zwei Individuen iund junterscheiden sich ausschließlich bezüglich der Herkunft X. Sollte (a) die Herkunft nicht kausal sein für einen Unterschied in der Rückfallwahrscheinlichkeit, also .i/ D.j /, dann wäre eine Behandlung aufgrund b.i/ ¤b.j / unfair. Sollte (b) die Herkunft allerdings kausal sein, also .i/ ¤.j /, dann wäre eine Behandlung aufgrund b.i/ ¤b.j / nicht als unfair anzusehen – Ungleiche würden ungleich behandelt werden. Den Kern der Idee geschützter Merkmale macht allerdings aus, dass auch obiger Fall (b) normativ als unfair angesehen werden kann. Beispielsweise soll der Umstand (so er denn wahr sein sollte), dass Herkunft einen kausalen Effekt auf die Rückfallwahrscheinlichkeit hat, nicht zulasten der betroffenen Individuen gehen; möglicherweise ist dieser Zusammenhang Folge von historischem Rassismus, für welchen die Mitglieder der benachteiligten Gruppe nicht die Verantwortung tragen sollen. Wie Bothmann et al. (2024) zeigen, passt allerdings auch diese Idee in das Framework, und zwar mittels Vorstellung einer fiktiven, normativ gewünschten Welt, in der diese ungewünschte Kausalität nicht existiert: Definition 3 (Normativ unfaire Behandlung) Nehmen wir ein Paar von Individuen iund jan, die sich nur in Bezug auf das Merkmal Aunterscheiden. Nehmen wir ferner an, dass Merkmal Aein kausaler Grund für einen Unterschied in den wahren Wahrscheinlichkeiten ist, d.h. .i/ ¤.j /, und dass Merkmal Aein PA ist. Eine Behandlung wird normativ unfair in Bezug auf das Merkmal Agenannt, wenn diese Individuen in einem Prozess aufgrund unterschiedlicher geschätzter individueller Wahrscheinlichkeiten b.i/ ¤b.j / unterschiedlich behandelt werden, d.h. t.i/.Ds.b.i/// ¤t.j /.Ds.b.j ///, da Merkmal Anicht herangezogen werden darf für die Bestimmung der Gleichheit, d.h. der Entscheidungsgrundlage für die Behandlung. Im Beispiel mit COMPAS ist .i/ die Rückfallwahrscheinlichkeit in der wahren Welt, e.i/ die Rückfallwahrscheinlichkeit in der fiktiven Welt (in der die Herkunft nicht kausal auf die Rückfallwahrscheinlichkeit wirkt). Wir betrachten wieder Individuen iand j, die sich nur bezüglich der Herkunft Aunterscheiden. Wenn diese sich bezüglich der Rückfallwahrscheinlichkeiten .i/ ¤.j / unterscheiden, wäre eine ungleiche Behandlung aus normativen Gründen dennoch unfair. Die wahre korrigierte Rückfallwahrscheinlichkeit e.i/ De.j / wäre aber identisch (selbst K
192 L. Bothmann, K. Peters wenn die Herkunft in der wahren Welt kausal wäre). Eine Entscheidung sollte also auf Grundlage der Schätzungen der e.i/ getroffen werden. Eine methodische Herausforderung bleibt die Frage, wie aus vorhandenem Datenmaterial die korrigierten Rückfallwahrscheinlichkeiten in der fiktiven Welt geschätzt werden sollen. Hierzu geben Bothmann et al. (2024) erste Hinweise auf konkrete Algorithmen, die in Bothmann et al. (2023) detaillierter ausgeführt sind und uns hier aber zunächst nicht weiter beschäftigen sollen. Wenden wir uns nun der Thematik des Mietspiegels zu, bei der wir die außergesetzlichen Merkmale als PA definieren werden. 3 Implikationen für qualifizierte Mietspiegel In Deutschland unterscheidet das Gesetz sogenannte „einfache“ und „qualifizierte“ Mietspiegel. Während an einen einfachen Mietspiegel kaum Anforderungen gestellt werden, ist ein qualifizierter Mietspiegel „nach anerkannten wissenschaftlichen Grundsätzen erstellt“4. Ferner wird unterschieden zwischen Tabellenund Regressionsmietspiegeln, wobei wir uns im Folgenden ausschließlich auf Regressionsmietspiegel fokussieren (für einen methodischen Vergleich dieser Mietspiegelarten siehe etwa Kauermann und Windmann 2016). Eine besondere Rolle nehmen die sogenannten „außergesetzlichen Merkmale“ ein, die für die Feststellung der ortsüblichen Vergleichsmiete nicht genutzt werden dürfen (zur Begriffsdefinition siehe unten). Wir fassen zunächst in Abschn. 3.1 die aktuell gültige Rechtslage zusammen, beschreiben in Abschn. 3.2 das in Kauermann und Windmann (2023) vorgeschlagene statistische Vorgehen zur Behandlung außergesetzlicher Merkmale zur Erstellung eines qualifizierten Mietspiegels, beleuchten in Abschn. 3.3 inwieweit und mit welchen Mitteln die gesetzlichen Anforderungen bei diesem Vorgehen umgesetzt werden und beschreiben schließlich in Abschn. 3.4, wie der aktuelle Forschungsstand im Bereich FairML für die Erstellung qualifizierter Regressionsmietspiegel nutzbar gemacht werden kann. 3.1 Gesetzliche Forderung Den gesetzlichen Rahmen für die Bildung der ortsüblichen Vergleichsmiete bildet §558 Absatz 2 BGB (Bürgerliches Gesetzbuch):5 „Die ortsübliche Vergleichsmiete wird gebildet aus den üblichen Entgelten, die in der Gemeinde oder einer vergleichbaren Gemeinde für Wohnraum vergleichbarer Art, Größe, Ausstattung, Beschaffenheit und Lage einschließlich der energetischen Ausstattung und Beschaffenheit in den letzten sechs Jahren vereinbart [...] worden sind.“ 4BGB §558d, https://www.gesetze-im-internet.de/bgb/__558d.html (Aufrufdatum 31.01.2024). 5BGB §558, https://www.gesetze-im-internet.de/bgb/__558.html (Aufrufdatum 31.01.2024). K
Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen... 199 formal das Geschlecht nicht „direkt“ berücksichtigen, aber indirekt eben schon und damit genauso diskriminieren (für diese Person) wie wenn zur Prognose direkt das wahre Geschlecht verwendet worden wäre. Dieses Beispiel mag sehr plakativ sein und in Fragen des Mietspiegels mag es eine solche direkte Verbindung von gesetzlichen und außergesetzlichen Merkmalen möglicherweise nicht geben. Dennoch können solche Proxyinformationen auch hier zum Prognosezeitpunkt einfließen, falls eine modellbasierte Imputation der außergesetzlichen durch die gesetzlichen Merkmale hinreichend gut möglich ist. Wenn dies nicht möglich ist, hat die modellbasierte Imputation gegenüber der Mittelwertimputation keine prognostischen Vorteile. Anders ausgedrückt: Wenn die modellbasierte Imputation gegenüber der Mittelwertimputation prognostische Vorteile hat, ist davon auszugehen, dass Proxyeffekte eine Rolle spielen. Kausale Fairness. Wenn diese indirekte Nutzung der Informationen der PA nicht gewünscht sein sollte, könnte beipielsweise das oben beschriebene Framework der kausalen Fairness verwendet werden. Hierfür müssten folgende Schritte ausgeführt werden – die zweifelsohne bedeutend aufwändiger sind als die anderen bisher beschriebenen Methoden – siehe Bothmann et al. (2024) für eine detailliertere Erklärung: 1. Das kausale Modell der wahren Welt wird mittels Methoden der causal discovery und causal inference in Verbindung mit Fachwissen geschätzt. 2. Ein Mapping der Daten von der wahren Welt in die normativ gewünschte Welt – in der die PA keinen Einfluss auf die Zielvariable haben – wird basierend auf dem obigen kausalen Modell definiert. 3. Die Trainingsdaten werden mit diesem Mapping in die normativ gewünschte Welt „übersetzt“. 4. Das ML-Modell wird mit den gemappten Daten trainiert. 5. Zum Prognosezeitpunkt werden die Features zunächst in die normativ gewünschte Welt gemappt und dann mit dem dort trainierten Modell vorhergesagt. So wird sichergestellt, dass es im finalen Modell auch keine indirekten Einflüsse der PA gibt. Vergleich der Ansätze. Der Unterschied bei Verwendung der kausalen Fairness und der Imputationsmethode ist, dass bei ersterer die Information bezüglich der PA weder direkt noch indirekt benutzt wird, während bei letzterer nur die direkte, jedoch nicht die indirekte Nutzung ausgeschlossen wird. Es ist nun eine normative Entscheidung, welche Anforderungen ein qualifizierter Mietspiegel erfüllen soll. Diesem Beitrag sind zwei Dinge wichtig, nämlich (a) herauszuarbeiten, welcher Unterschied zwischen einer direkten und einer indirekten Nutzung der PA besteht, und (b) aufzuzeigen, dass es für beide Forderungen mögliche Lösungsansätze gibt (wenn auch das Entfernen der indirekten Effekte deutlich komplexer ist als das Entfernen der direkten Effekte). Hiermit soll die Gesetzgebung in die Lage versetzt werden, eine fundierte Entscheidung bezüglich der gesetzlichen Anforderungen an qualifizierte Mietspiegel zu treffen – im vollen Wissen um die unterschiedlichen Implikationen möglicher Gesetzesformulierungen. K
200 L. Bothmann, K. Peters 4 Zusammenfassung und Ausblick Die Erstellung qualifizierter Mietspiegel unterliegt strengen gesetzlichen Anforderungen. Ein besonderes Augenmerk liegt hierbei auf außergesetzlichen Merkmalen, die zwar mietpreisrelevant sein können, aber für die Feststellung der ortsüblichen Vergleichsmiete nicht herangezogen werden dürfen – wie zum Beispiel die Mietdauer. In diesem Beitrag haben wir einen Vorschlag zur modellbasierten Imputation der außergesetzlichen Merkmale von Kauermann und Windmann (2023) genauer beleuchtet und den gesetzlichen Anforderungen gegenübergestellt. Es stellte sich heraus, dass die Idee der modellbasierten Imputation einerseits den gesetzlichen Rahmenbedingungen entspricht und andererseits qualitative Vorteile gegenüber anderen Ansätzen (Mittelwertimputation, Nichtberücksichtigung) hat. Die Frage der Behandlung außergesetzlicher Merkmale weist starke Parallelen zur Fairnessdebatte in ML auf. Daher haben wir die Grundzüge dieser Debatte skizziert, eine aktuelle Neuentwicklung von Bothmann et al. (2024) vorgestellt und die Verbindungen zur Mietspiegelfrage aufgezeigt. Wir haben erläutert, inwiefern auch das Vorgehen der modellbasierten Imputation indirekt Informationen der außergesetzlichen Merkmale nutzt und wie mit der Methode der kausalen Fairness ein Mietspiegel erstellt werden könnte, der auch indirekt diese Informationen nicht nutzen würde – bei gleichzeitig ungleich höherem Modellierungsaufwand. Diese Darstellung soll konzeptionelle Klarheit bringen, welche es wiederum der Gesetzgebung ermöglichen kann, noch genauer festzulegen, welche Kriterien ein qualifizierter Mietspiegel erfüllen soll. Hiervon ausgehend lässt sich auch die Praxis zur Umsetzung von Diskriminierungsfreiheit in anderen Bereichen evaluieren. Beispielsweise ist die Nichtberücksichtigung von geschützten Merkmalen wie zum Beispiel Geschlecht bei der Erstellung von Versicherungstarifen ebenso wenig dafür geeignet, geschlechtsbezogene Diskriminierung auszuschließen. Dieser und andere, ähnlich gelagerte Fälle, sind relevante Anwendungsfälle von fairML und interessante Ansatzpunkte für künftige Forschungsarbeiten bezüglich der Qualität von ADM-Systemen. Funding Open Access funding enabled and organized by Projekt DEAL. Interessenkonflikt Die Autor:innen haben keine Interessenkonflikte zu erklären. Open Access Dieser Artikel wird unter der Creative Commons Namensnennung 4.0 International Lizenz veröffentlicht, welche die Nutzung, Vervielfältigung, Bearbeitung, Verbreitung und Wiedergabe in jeglichem Medium und Format erlaubt, sofern Sie den/die ursprünglichen Autor(en) und die Quelle ordnungsgemäß nennen, einen Link zur Creative Commons Lizenz beifügen und angeben, ob Änderungen vorgenommen wurden. Die in diesem Artikel enthaltenen Bilder und sonstiges Drittmaterial unterliegen ebenfalls der genannten Creative Commons Lizenz, sofern sich aus der Abbildungslegende nichts anderes ergibt. Sofern das betreffende Material nicht unter der genannten Creative Commons Lizenz steht und die betreffende Handlung nicht nach gesetzlichen Vorschriften erlaubt ist, ist für die oben aufgeführten Weiterverwendungen des Materials die Einwilligung des jeweiligen Rechteinhabers einzuholen. Weitere Details zur Lizenz entnehmen Sie bitte der Lizenzinformation auf http://creativecommons.org/ licenses/by/4.0/deed.de. K
Fairness als Qualitätskriterium im Maschinellen Lernen – Rekonstruktion des philosophischen... 201 Literatur Angwin J, Larson J, Mattu S, Kirchner L (2016) Machine bias: there’s software used across the country to predict future criminals. and it’s biased against blacks. ProPublica. https://www.propublica.org/ article/machine-bias-risk-assessments-in-criminal-sentencing. Zugegriffen: 31. Jan. 2024 Aristoteles (1831) Aristotelis Opera Bd. 2. de Gruyter, S Book V (I. Bekker, Hrsg) Bothmann L, Dandl S, Schomaker M (2023) Causal Fair Machine Learning via Rank-Preserving Interventional Distributions. In: Proceedings of the 1st Workshop on Fairness and Bias in AI co-located with 26th European Conference on Artificial Intelligence (ECAI 2023). CEUR Workshop Proceedings. https://ceur-ws.org/Vol-3523/ Bothmann L, Peters K, Bischl B (2024) What is fairness? On the role of protected attributes and fictitious worlds. arXiv. https://doi.org/10.48550/arXiv.2205.09622 Corbett-Davies S, Pierson E, Feller A, Goel S (2016) A computer program used for bail and sentencing decisions was labeled biased against blacks. It’s actually not that clear. Washington Post. https://www. washingtonpost.com/news/monkey-cage/wp/2016/10/17/can-an-algorithmbe-racist-our-analysis-ismore-cautious-than-propublicas/. Zugegriffen: 31. Jan. 2024 Dwork C, Hardt M, Pitassi T, Reingold O, Zemel R (2012) Fairness through awareness. In: Proceedings of the 3rd Innovations in Theoretical Computer Science Conference, S 214–226 https://doi.org/10. 1145/2090236.2090255 Grgic-Hlaca N, Zafar MB, Gummadi KP, Weller A (2016) The case for process fairness in learning: feature selection for fair decision making. In: Symposium on Machine Learning and the Law at the 29th Conference on Neural Information Processing Systems. https://api.semanticscholar.org/CorpusID: 13633339 Kauermann G, Windmann M (2016) Mietspiegel heute. AStA Wirtsch Sozialstat Arch 10(4):205–223. https://doi.org/10.1007/s11943-016-0197-x Kauermann G, Windmann M (2023) Die Berücksichtigung von außergesetzlichen Merkmalen bei der Mietspiegelerstellung – Kausalität versus Vorhersage. AStA Wirtsch Sozialstat Arch 17(2):145–160. https://doi.org/10.1007/s11943-023-00321-1 Kusner MJ, Loftus J, Russell C, Silva R (2017) Counterfactual fairness. In: Guyon I, Luxburg UV, Bengio S, Wallach H, Fergus R, Vishwanathan S, Garnett R (Hrsg) Advances in neural information processing systems. Curran Associates, (https://proceedings.neurips.cc/paper/2017/file/ a486cd07e4ac3d270571622f4f316ec5Paper.pdf) Makhlouf K, Zhioua S, Palamidessi C (2022) Survey on causal-based machine learning fairness notions. arXiv. https://doi.org/10.48550/arXiv.2010.09553 v. Malottki C, Krapp M-C, Vaché M (2018) Außergesetzliche Mietpreisdeterminanten im Mietspiegel – Auswirkungen und statistische Behandlung. Wohnungswirt Mietrecht 71(11):665–675 Verma S, Rubin J (2018) Fairness definitions explained. In: Proceedings of the International Workshop on Software Fairness https://doi.org/10.1145/3194770.3194776 Zafar MB, Valera I, Rogriguez MG, Gummadi KP (2017) Fairness constraints: mechanisms for fair classification. In: Proceedings of the 20th International Conference on Artificial Intelligence and Statistics, 962–970. https://proceedings.mlr.press/v54/zafar17a.html Hinweis des Verlags Der Verlag bleibt in Hinblick auf geografische Zuordnungen und Gebietsbezeichnungen in veröffentlichten Karten und Institutsadressen neutral. K