Full text
Kann ein KI-basierter Chatbot Menschen mit Leseund Rechtschreibstörung in der Kompetenz Textverstehen in der Schule unterstützen? Eine Interventionsstudie Masterarbeit an der HFH vorgelegt von Baur Simon Eingereicht bei Marius Haffner Winterthur, 1. 5. 2025
S. 2 Abstract Untersucht wurde, ob SiebtklässlerInnen, deren Textverständniskompetenz im Bereich der Leseund Rechtschreibstörung lag, in der Kompetenz Textverständnis mit einem KI-basierten Chatbot unterstützt werden können, um für sie in Text kodierte Informationen besser zugänglich zu machen. Dies wurde mit einem Vortest-NachtestStudiendesign mit Versuchsgruppe (N = 21) und unabhängiger Kontrollgruppe (N = 21) gemacht. Die Versuchsgruppe erhielt 90 Minuten Training zur Bedienung des KI-Chatbots und verwendete ihn im Nachtest. Der KI-Chatbot führte vier verschiedene Funktionen (Vorlesen, Zusammenfassen, Blockdiagramm, Frage & Antwort) aus. In den Nachtestund Befragungsdaten der Versuchsgruppe konnten Verdachtsmomente für einen positiven Einfluss des KI-Chatbots auf die Nachtestdaten der Versuchsgruppe erhärtet werden. Es konnte jedoch kein Beweis eines Einflusses des KI-Chatbots auf die Nachtestdaten der Versuchsgruppe gefunden werden.
S. 3 Inhaltsverzeichnis Abstract .................................................................................................................... 2 1. Einleitung .............................................................................................................. 6 2. Fragestellung ........................................................................................................ 6 3. Theoretische Grundlage ........................................................................................ 7 3.1. Definition und Diagnostik von Lese -und Rechtschreibstörung .................................. 7 3.1.1. Prozess des Leseverstehens ............................................................................................ 10 3.1.2. Verlauf von LRS .............................................................................................................. 13 3.1.3. Verschiedene LRS Ausprägungen .................................................................................... 15 3.1.4. Wirksame Förderansätze ................................................................................................ 17 3.1.5. Nachteilsausgleich .......................................................................................................... 23 4. Technische Grundlagen: Der KI-Chatbot und der Server ..................................... 25 4.1. Hardware ................................................................................................................. 26 4.2. Software .................................................................................................................. 27 4.2.1. Ubuntu Server 24 lts ....................................................................................................... 27 4.2.2. Docker ........................................................................................................................... 27 4.2.3. Open webUI ................................................................................................................... 27 4.2.4. Ollama ........................................................................................................................... 28 4.2.5. Large Language Model LLM ............................................................................................ 28 4.2.6. LLM Training .................................................................................................................. 31 4.2.7. Prompt, Systemprompt und Promptengineering ............................................................. 32 5. Thesen und Hypothesen ...................................................................................... 35 6. Methoden, Forschungsdesign, Datenschutz, Abgrenzung .................................. 38 6.1. Methoden und Forschungsdesign ............................................................................ 38 6.1.1. Die Stichproben: Versuchsgruppe (N=21) und Kontrollgruppe (N=21) ............................. 39 6.2. Datenschutz ............................................................................................................. 39 6.3. Abgrenzung .............................................................................................................. 39 7. Die Funktionen des KI-basierten Chatbots .......................................................... 40 7.1. Das Verhalten des KI-Chatbots ................................................................................. 41 7.1.1 Der Systemprompt des KI-Chatbots ................................................................................. 41
S. 4 7.2. Das Vorlesen ............................................................................................................ 41 7.2.1 Der Prompt für die Funktion Vorlesen ............................................................................. 41 7.3. Zusammenfassen ..................................................................................................... 41 7.3.1. Der Prompt für die Funktion Zusammenfassen ............................................................... 42 7.4. Das Erzeugen von Blockdiagrammen durch den KI Chat bot .................................... 42 7.4.1 Der Prompt für die Funktion Blockdiagramm ................................................................... 43 7.5. Textbezogene Frage & Antwort-Chatkonversation .................................................. 43 7.5.1 Der Prompt für die Funktion Frage & Antwort ................................................................. 44 8. Der vorgesehene Chatverlauf ............................................................................. 44 8.1. Abbildung des Konstruktionsprozesses im vorgesehenen Chatverlauf .................... 44 9. Versuchsgruppentraining im Umgang mit dem KI-Chatbot ................................ 46 9.1. Zugang zum KI-Chatbot und den Trainingsaufgaben ................................................ 46 9.2. Trainingsaufgaben.................................................................................................... 46 9.3. Beobachtungen aus dem Training und dem Nachtest mit KI-Chatbot ...................... 46 10. Resultate ........................................................................................................... 48 10.1. Testresultate der Textverständnisvortests und der Textverständnisnachtests ...... 48 Abbildung 4: Testergebnisse der Vortests und Nachtests in Prozenträngen als Boxplots dargestellt. (Vgl. Datentabelle im Anhang 5) .................................................................. 48 10.1.1. Beschreibung der Textverständnistestergebnisse der Gruppen im Vortest .................... 49 10.1.2. Vergleich der Textverständnistestergebnisse der Gruppen im Vortest ........................... 50 10.1.3. Vergleich der Textverständnistestergebnisse der Gruppen im Nachtest ........................ 51 10.1.4. Vergleich der Testergebnisse im Vortest und Nachtest.................................................. 53 10.2. Resultate der Probandinnen und Probandenbefragung ......................................... 56 10.2.1. Bewerteten die Probandinnen und Probanden den KI-Chatbot für das Verstehen der Texte als hilfreich? ................................................................................................................... 56 10.2.2. Funktionsbeurteilung des KI-Chatbots durch die Probandinnen und Probanden ............ 57 11. Diskussion der Resultate ................................................................................... 58 11.1. Bewertung und Abwägung der Resultate aus den Textverständnistests ................ 58 11.2. Bewertung und Abwägung der Befragungsresultate .............................................. 59 12. Antwort auf die Forschungsfrage und Fazit ...................................................... 60
S. 5 12.1. Schlussfolgerungen aus den Hypothesentests zu These und Antithese A .............. 61 12.2. Schlussfolgerungen aus den Hypothesentests zu These und Antithese B ............... 62 12.3. Schlussfolgerungen aus den Hypothesentests zu These und Antithese C ............... 62 12.4. Beantwortung der Forschungsfrage ....................................................................... 62 12.5. Fazit ....................................................................................................................... 63 12.6. Ausblick .................................................................................................................. 65 14. Quellen ............................................................................................................. 66 15. Abbildungsverzeichnis ...................................................................................... 68 16. Danksagungen .................................................................................................. 69 17. Urheberbestätigung ......................................................................................... 70 18. Anhang ............................................................................................................. 71 Anhang 1: Systemprompttest ......................................................................................... 71 Anhang 2: Beispielhafter Chatverlauf ............................................................................. 73 Anhang 3: Trainingsaufgaben ......................................................................................... 79 Anhang 4: Aufruf der Prompts und typischer Chatverlauf .............................................. 91 Anhang 5: Datentabellen ................................................................................................ 97 Anhang 6: Statistische Tests............................................................................................ 98
S. 6 1. Einleitung Künstliche Intelligenz ist in aller Munde. ChatGPT oder DeepSeek werden von Jugendlichen auf der Sekundarstufe regelmässig verwendet. Somit ist die neue Technologie längstens in der Schule angekommen. Diese muss als bahnbrechende neue Technologie sehr ernst genommen werden. Daher stellt sich die Frage, welche Chancen und Risiken sich daraus ergeben. Aus diesem Grund wird aktuell viel zu diesem Thema veröffentlicht und diskutiert. In dieser Arbeit geht es darum zu erforschen, was die Verwendung von KI-basierten Chatbots in der Schule bedeutet und ob sich dadurch die Inklusion durch den Abbau von Informationszugangsbarrieren an Schulen verbessern lässt. Um diese Frage zu verfolgen und das weite Themenfeld einzugrenzen, wird der Fokus dieser Arbeit auf den Bedürfnissen von Jugendlichen mit diagnostizierter Leseund Rechtschreibstörung liegen. Auf Grund des inklusiven Gedankens und der geringen Dichte von Jugendlichen mit diagnostizierter Leseund Rechtschreibstörung, werden auch Jugendliche ohne diagnostizierte Leseund Rechtschreibstörung mit in den Blick genommen. Damit ein KI-Chatbot mit verschiedenen Funktionen gestaltet und mit Schülerinnen und Schülern (SuS) getestet werden kann, wird ein Server aufgebaut, auf dem der KI-Chatbot läuft. 2. Fragestellung Kann ein KI-basierter Chatbot Menschen mit Leseund Rechtschreibstörung in der Kompetenz Textverstehen in der Schule unterstützen? Diese Fragestellung kann nur beantwortet werden, wenn ein KI-Chatbot zusammen mit Jugendlichen, welche eine Leseund Rechtschreibstörung haben, getestet wird. Dazu muss eine technische Lösung für die Gestaltung und Bereitstellung des KIChatbots mit seinen Funktionen gefunden werden. Ob und welche Funktionen für die Unterstützung von Jugendlichen mit Leseund Rechtschreibstörung für die Unterstützung in der Kompetenz Textverstehen in Frage kommen, muss anhand von theoretischen Überlegungen geschlossen werden.
S. 7 3. Theoretische Grundlage In diesem Kapitel werden zentrale Begriffe definiert und wichtige Konzepte erläutert. Die Grundlage dafür ist durch Peer-Review fachinhaltlich gesicherte Fachliteratur. Fachfremdes Informatikwissen zu den Programmen Ubuntu, Docker, Ollama und Open Web User Interface, welches auf Wikipedia beschrieben ist, wurde als Allgemeinwissen eingestuft und daher ohne Quellenangabe beschrieben. 3.1. Definition und Diagnostik von Lese -und Rechtschreibstörung Der Begriff Leseund Rechtschreibstörung (LRS) wird in der Literatur durch zahlreiche Begriffe beschrieben. Daher sei an dieser Stelle vorausgeschickt, dass unter den Bezeichnungen Lese-Rechtschreibstörung, Leseund Rechtschreibstörung Legasthenie, besondere Schwierigkeiten im Erlernen des Lesens und Rechtschreibens, Dyslexie, Entwicklungs-Dyslexie, isolierte Rechtschreibstörung oder Schriftspracherwerbsstörung stets das verstanden werden kann, was in dieser Arbeit als LRS bezeichnet wird. Im Umgang mit der begrifflichen Vielfalt folgt diese Arbeit dem Vorbild der Publikation von Meyer (2021). Bei der Sichtung unterschiedlicher Werke zum Thema, begegnen einem neben den zahlreichen Begriffen für diese Entwicklungsstörung auch zahlreiche unterschiedliche Definitionen dafür. Aus diesem Grund wird der Begriff an dieser Stelle vergleichend diskutiert und anschliessend mit Begründung definiert. Einig sind sich die publizierenden Fachleute weitgehend darüber, dass die Basis zur Definition des Begriffs LRS das internationale Klassifikationssystem der ICD-10 nach Dilling et al. (2011) bildet. Es existiert zwar bereits eine neuere Version, der ICD-11, welcher jedoch noch nicht auf Deutsch übersetzt ist und daher laut Ebner et al. (2023) erst ab 2027 als Definitionsund Diagnostikgrundlage den ICD-10 ablösen soll. Im ICD-10 ist die LRS unter der Rubrik „Umschriebene Entwicklungsstörungen schulischer Fertigkeiten“ geführt. Diese definieren sich aus folgendem Wortlaut: „Umschriebene Entwicklungsstörungen schulischer Fertigkeiten Es handelt sich um Störungen, bei denen die normalen Muster des Fertigkeitserwerbs von frühen Entwicklungsstadien an gestört sind. Dies ist nicht einfach Folge eines Mangels an Gelegenheit zu lernen; es ist auch nicht allein als Folge einer Intelligenzminderung oder irgendeiner erworbenen Hirnschädigung oder -krankheit aufzufassen.“ (Dilling 2011, Internetquelle)
S. 8 Die LRS wird den umschriebenen Entwicklungsstörungen schulischer Fertigkeiten mit folgendem Wortlaut untergeordnet: „Leseund Rechtschreibstörung Das Hauptmerkmal ist eine umschriebene und bedeutsame Beeinträchtigung in der Entwicklung der Lesefertigkeiten, die nicht allein durch das Entwicklungsalter, Visusprobleme oder unangemessene Beschulung erklärbar ist. Das Leseverständnis, die Fähigkeit, gelesene Worte wieder zu erkennen, vorzulesen und Leistungen, für welche Lesefähigkeit nötig ist, können sämtlich betroffen sein. Bei umschriebenen Lesestörungen sind Rechtschreibstörungen häufig und persistieren oft bis in die Adoleszenz, auch wenn einige Fortschritte im Lesen gemacht werden. Umschriebenen Entwicklungsstörungen des Lesens gehen Entwicklungsstörungen des Sprechens oder der Sprache voraus. Während der Schulzeit sind begleitende Störungen im emotionalen und Verhaltensbereich häufig.“ (Dilling 2011, Internetquelle) Dem Themenkomplex angehörig ist auch die isolierte Rechtschreibstörung (IR). Diese wird wie folgt definiert: „Isolierte Rechtschreibstörung Es handelt sich um eine Störung, deren Hauptmerkmal in einer umschriebenen und bedeutsamen Beeinträchtigung der Entwicklung von Rechtschreibfertigkeiten besteht, ohne Vorgeschichte einer Lesestörung. Sie ist nicht allein durch ein zu niedriges Intelligenzalter, durch Visusprobleme oder unangemessene Beschulung erklärbar. Die Fähigkeiten, mündlich zu buchstabieren und Wörter korrekt zu schreiben, sind beide betroffen. Umschriebene Verzögerung der Rechtschreibfähigkeit (ohne Lesestörung)“ (Dilling 2011, Internetquelle) Wichtig ist an dieser Stelle, dass die Entwicklungsstörungen schulischer Fertigkeiten und somit sowohl die LRS als auch die IR nicht als Folge einer Intelligenzminderung aufzufassen sind. Dies bedeutet, dass Menschen mit hoher, mittlerer oder tiefer Intelligenz von LRS oder IR betroffen sein können. Für die Definition und demzufolge für die Diagnostizierung, wird dies im schulischen Kontext zentral wichtig. Denn die
S. 9 Aufgabe der Schule ist es, allen Lernenden im Rahmen ihrer Möglichkeiten zur Entfaltung ihrer Kompetenzpotenziale zu verhelfen und in diesem Sinne für Menschen mit Behinderung Barrieren durch entsprechende Förderung und Nachteilsausgleich aufzulösen. Dies entspricht einer Kernidee für eine inklusiven Gesellschaft. Gesetzlich ist diese Kernidee im Behindertengleichstellungsgesetz, welches seit 2002 in Kraft ist, festgehalten: „Artikel 1 Zweck 1) Das Gesetz hat zum Zweck, Benachteiligungen zu verhindern, zu verringern oder zu beseitigen, denen Menschen mit Behinderung ausgesetzt sind. 2) Es setzt Rahmenbedingungen, die es Menschen mit Behinderungen erleichtern, am gesellschaftlichen Leben teilzunehmen und insbesondere selbstständig soziale Kontakte zu pflegen, sich ausund fortzubilden und eine Erwerbstätigkeit auszuüben.“ (Bildungsdirektion Kanton Zürich, 2022, S. 14) Klar wird aus diesem Zusammenhang, dass für die Diagnostizierung im Sinne des IDC-10 ein IQ-Test notwendig ist. Das einfache Diskrepanzkriterium im statistischen Peervergleich zu der fraglichen Kompetenz würde laut dieser Definition zur Diagnostizierung nicht ausreichen. Hier sei kurz erläutert, dass die statistischen Anforderungen zur Erfüllung des einfachen Diskrepanzkriteriums je nach Test unterschiedlich sind. Die genannten Standardabweichungen und Prozentränge, die eine Diagnose begründen, liegen zwischen einer Standardabweichung von 1 bis 2 und einem Prozentrangäquivalent zwischen ca. 15% und ca. 7%. Trotzdem argumentiert Meyer (2021) in seiner Begriffsdefinition für LRS, dass das einfache Diskrepanzkriterium für die Diagnose ausreichen würde. Dies würde bedeuten, dass Menschen mit einem hohen IQ und im Verhältnis dazu sehr schlechten Fähigkeiten in einer gefragten Kompetenz (Lesen, Schreiben, Mathe) nicht als entwicklungsgestört diagnostiziert würden, wenn sie im Peervergleich nicht auf den Prozenträngen zwischen 1% bis ca. 15% (Standardabweichungsäquivalent zu 1.5) eingestuft werden. Dies hätte zur Folge, dass sie im Selektionsprozess der Schule nicht ihrem IQ entsprechend anerkannt würden. Somit würden Menschen mit hohem IQ und im Verhältnis dazu unterdurchschnittlichen Leistungen in einer der Schlüsselkompetenzen durch den Selektionsprozess der Schule in ihrer
S. 16 Zudem eignen sich Lesende Textsortenwissen an, was sowohl die Kontextualisierung der gelesenen Informationen unterstützt und zusätzlich die schriftliche Ausdruckskompetenz verbessert. Probleme beim Rechtschreiben Bezeichnung: Isolierte Rechtschreibschwierigkeit Orthographie: Sehr viele Fehler Exaktes Nachsprechen: Probleme bei Pseudowörtern bis 4. Klasse Probleme beim Leseverstehen Bezeichnungen: Verschiedene Symptomausprägungen: Isoliertes Leseverständnisproblem Zu prüfen: Merkund Hörverständnis problem Hyperlexie Vorlesetempo: Normal bis schnell Normal bis schnell Fehlerhäufigkeit beim Vorlesen: normal normal Leseverständnis: Sehr schlecht, Antworten auf Fragen direkt nach Textlektüre falsch. Können keine Fragen beantworten, welche aus dem Kontext geschlossen werden müssen. Können sich zeitliche Abfolgen von Ereignissen im Text nicht merken. Schlecht, können keine Fragen beantworten, welche aus dem Kontext geschlossen werden müssen. Schriftlicher Ausdruck: Schlecht auf Grund Leseverständnisproblem Hörverständnis: Kann ein Kind auch gehörte Texte nicht verstehen und referieren, dann liegt ein Problem mit der Merkfähigkeit vor.
S. 17 Probleme im schriftlichen Ausdruck Bezeichnungen: Isolierte Lesegeschwindigkeitsschwierigkeit (Verschiedene Symptomausprägungen: Vorlesetempo: Sehr langsam, stockend normal Fehlerhäufigkeit beim Vorlesen: gering Sehr hoch Leseverständnis: sehr schlecht Schlecht bis sehr schlecht Probleme in der Lesegeläufigkeit Bezeichnung: Isolierte Lesegeschwindigkeitsschwierigkeit Vorlesetempo: Sehr langsam, stockend normal Fehlerhäufigkeit beim Vorlesen: gering Sehr hoch Leseverständnis: sehr schlecht Schlecht bis sehr schlecht 3.1.4. Wirksame Förderansätze Konsultiert man die Literatur, um Förderansätze für LRS-betroffene Jugendliche zu finden, so begegnet man unzähligen Förderprogrammvorschlägen und zahllosen verschiedenen Förderansätzen. Um diese auf ihre Wirksamkeit hin zu evaluieren und für meine Trainingsintervention eine möglichst passende Form zu finden, werden die Erkenntnisse einer Metaanalyse von Ise et al. (2012) miteinbezogen. Diese metaanalytische Studie berücksichtigte 53 LRS-Förderprogramme, welche bis zum Erscheinungszeitpunkt im Rahmen von Studien publiziert worden sind. Die Effektstärken der untersuchten LRS-Förderprogramme wurden untereinander verglichen und bewertet. Dabei wurden die Auswirkungen der Parameter auf die zwei Kompetenzen Lesen und Schreiben voneinander isoliert untersucht. Die Parameter, welche Ise et al. (2012) in der Metastudie auswerteten, sind die folgenden: Die Art der Intervention (1) Hierbei wurden Funktionsund Wahrnehmungstrainings sowie daraus kombinierte Interventionen von symptomspezifischen Interventionen unterschieden. Trainingsmethoden (2) Hier wurde laut Ise et al. (2012) Lesetraining, Rechtschreibtraining, LeseRechtschreibtraining, Phonologie-Training, Training auditiver Funktionen, Training
S. 18 visueller Funktionen, Training auditiver Funktionen, Training visueller Funktionen, Training der audio-visuellen Integration sowie die Kombination verschiedener Ansätze auf ihre Wirksamkeit hin untersucht. Interventionsleiter (3) Je nachdem, wer die Fördermassnahme mit den Kindern und Jugendlichen durchführte, wurde nach Studienleiter, Lehrperson, Lernende (SuS), Studierende oder Institutmitarbeitenden unterschieden. Wenn die Probandinnen und Probanden das Förderprogramm am Computer selbstständig ausführten, wurde dies von Ise et al. (2012) als „kein Interventionsleiter“ kodiert. Dauer der Förderung (4) Die Dauer der Förderung bezeichnet die Zeitperiode einschliesslich der Zwischenzeiten zwischen den einzelnen Fördereinheiten. Zur Unterscheidung der Dauer der Förderung wurden drei Gruppen erstellt. Studien mit einer Dauer der Förderung von zehn Wochen oder kürzer, Studien mit einer Dauer der Förderung von zehn bis maximal zwanzig Wochen und Studien mit einer Dauer der Förderung von mehr als zwanzig Wochen. Umfang der Förderung (5) Mit dem Umfang der Förderung ist die Unterrichtszeit während der Förderintervention in Minuten gemeint. Setting (6) Unter Setting ist die Sozialform, mit der während dem Förderprogramm gearbeitet wurde, gemeint. Unterschieden wurde Einzelarbeit und Gruppenarbeit. Token (7) Ausserdem wurde untersucht, ob Verstärker (Token) während des Förderprogramms eingesetzt wurden. Token werden von Ise et al. (2012) als verhaltenstherapeutische Massnahmen zur Steigerung der Motivation von Lernenden beschreiben. Auf Grund der beschriebenen Effektstärken in der Studie von Ise et al. (2012), können für den Entwurf eines LRS-Förderprogramms einige Schlussfolgerungen abgeleitet werden. Diese werden nun zusammen mit den Studienergebnissen im Hinblick auf das Vorhaben einen KI-Chatbot förderlich für LRS-betroffene SuS einzusetzen, entlang der metaanalytischen Parameter (1) bis (7) diskutiert.
S. 19 Die wichtigsten Befunde der Studie werden von Ise et al. (2012) wie folgt beschrieben: „LRS-Föderprogramme führen zu einer deutlichen Verbesserung der Rechtschreibleistung. Die mittlere Effektstärke der Studien, in denen die Entwicklung der Rechtschreibleistung überprüft wurde (N=37), beträgt g’= 0.61. Die mittlere Effektstärke der Studien, in denen die Entwicklung der Leseleistung überprüft wurde (N=16), ist deutlich geringer (g’= 0.33).“ (Ise et al. 2012, S. 132) Diese generelle Aussage wird wie folgt präzisiert: „Die Wirksamkeit von LRS-Förderprogrammen wird durch bestimmte Merkmale beeinflusst. […] Eine dieser moderierenden Variablen ist die Interventionsform. Symptomspezifische Förderprogramme führen zu einer deutlich stärkeren Verbesserung der Leseund Rechtschreibleistung als Funktionsund Wahrnehmungstrainings. (Ise et al. 2012, S. 132) Dies bedeutet, dass ein LRS-Förderprogramm auf das Training von Lesen und Schreiben ausgerichtet sein sollte. In Bezug auf den Parameter (3) wurde folgendes festgestellt: „Auch der Interventionsleiter beeinflusst die Effektivität der Förderung. Erfolgte die Förderung durch Lehrkräfte, so zeigten sich signifikante Verbesserungen im Lesen und Schreiben. Wurde die Förderung durch den Autor der jeweiligen Arbeit durchgeführt, zeigte sich zudem eine signifikante Verbesserung der Rechtschreibleistung. Die Wirksamkeit anderer Interventionsleiter und computerbasierter Förderung konnte nicht statistisch abgesichert werden, bzw. konnte aufgrund eines Mangels an Interventionsstudien nicht überprüft werden. Die Überlegenheit von Lehrkräften gegenüber computerbasierter Förderung ist in Übereinstimmung mit dem Befund einer Metaanalyse zur Wirksamkeit von Interventionen für rechenschwache Kinder (Kroesbergen & van Luit, 2003, siehe jedoch Ise et al., in Druck, für vergleichbare Fördereffekte).“ (Ise et al. 2012, S. 132)
S. 20 Dass Lehrkräfte (3) lernwirksam sind, ist sicherlich plausibel. Über den Grund, weswegen bei Studien, bei denen die studienleitende Person das LRSFörderprogramm durchführte, die besten Rechtschreibfortschritte erzielt wurden, kann nur spekuliert werden. Ein Erklärungsansatz könnte sein, dass die studienleitende Person „Teaching to the Test“ betrieben hat, da sie ein Eigeninteresse am Erfolg des LRS-Förderprogrammes gehabt haben könnte. Die Aussage, dass die Wirksamkeit von computerbasierten Programmen nicht evaluiert werden konnte, da die existierende Datenlage nicht ausreichend gewesen ist, belegt den Forschungsbedarf rund um computerbasierte Förderprogramme. Weitere wichtige Aussagen machen Ise et al. (2012) im folgenden Abschnitt: „Eine weitere moderierende Variable ist die Dauer der Förderung. Förderprogramme, die über einen Zeitraum von mehr als 20 Wochen durchgeführt werden, führen zu einer deutlich stärkeren Verbesserung der Leseund Rechtschreibleistung als Förderprogramme, die einen kürzeren Zeitraum umfassen. Ein ähnliches Bild zeigt sich hinsichtlich des Umfangs der Förderung. Mit steigendem Umfang (Anzahl und Dauer der Trainingseinheiten) steigt die berichtete Wirksamkeit. Ein moderierender Einfluss der Variablen Setting (Einzelvs. Gruppenförderung) und Verstärker (Token) konnte nicht nachgewiesen werden. Allerdings zeigte sich, dass die mittlere Effektstärke der Studien, in denen Token eingesetzt wurden, fast doppelt so groß ist wie die mittlere Effektstärke der Studien, in denen keine Verstärker eingesetzt wurden.“ (Ise et al. 2012, S. 132) Bei Studien, welche die Schreibkompetenz förderten, zeigte sich, dass die mittlere Effektstärke des Parameters (4) für jene Studien, welche über einen längeren Zeitraum als 20 Wochen liefen, eine annähernd doppelt so hohe Effektstärke erreichten, wie die Studien, welche kürzer waren (länger als 20 Wochen), Effektstärke (g`= 0.82, zwischen 20 und 10 Wochen), Effektstärke (g`= 0.42) und weniger als 10 Wochen Effektstärke (g`= 0.41). Bei Studien, welche die Lesekompetenz förderten, zeigte sich, dass die mittlere Effektstärke des Parameters (4) für jene Studien, welche über einen längeren Zeitraum als 20 Wochen liefen, eine Effektstärke von (g`= 0.70) errichten. Für Studien mit kürzeren Förderzeiträumen als 20 Wochen konnten keine statistisch abgesicherten Verbesserungseffekte festgestellt werden. Aus diesen Befunden kann
S. 21 geschlussfolgert werden, dass die Effekte, welche das Üben von Lesen und Schreiben erzeugt, langfristig stärker sichtbar werden als kurzfristig. In Bezug auf das Einsetzen von Lesefortschritten nach einem Lesetraining kann sogar gesagt werden, dass kurzfristig keine Lesekompetenzfortschritte erzielt werden können. Die Effekte von Lesetraining können erst nach einem Zeitraum von mehr als 20 Wochen gemessen werden. Daraus kann für den Entwurf einer KI-basierten Intervention abgeleitet werden, dass es wichtig ist, ein digitales Werkzeug zur interaktiven und niveaubinnendifferenzierten Textverund -bearbeitung zu gestalten. Die Bedienung des Werkzeuges soll das Lesen und das Schreiben im wechselseitigen interaktiven Austausch mit der KI erfordern. Ein weiterer wichtiger Punkt, der im oben angeführten Zitatabschnitt festgestellt wird ist, dass LRS-Förderprogramme, welche verhaltenstherapeutische Massnahmen zur Steigerung der Motivation von Lernenden als Verstärker (7) beinhalteten, mit einer Effektstärke von (g`= 0.81) fast doppelt so gute Ergebnisse erzielten wie Studien, welche keine Verstärker integriert hatten. Für eine KI-basierte Intervention bedeutet dies, dass die Gamification, also die Implementierung von Trainingsspielen, Scores oder spielähnlichen, emotionalen Trainingsaktivitäten, wahrscheinlich einen stark positiven Effekt auf die Lernwirksamkeit haben könnten. Da die Intervention im Rahmen dieser Masterarbeit aus pragmatischen Gründen eine kürzere Dauer (4) als zehn Wochen haben wird, müssen spezifisch dafür beschriebene Komponenten beachtet werden. Klicpera et al. (2020) empfiehlt für LRS-Lesefördertrainings auf der Sekundarstufe zwei fundamentale Bausteine: Erstens soll ein Advanced Organizer verwendet werden und zweitens soll das LRS-Lesefördertraining eine explizite Übung sein. Durch die Hervorhebung zentraler Konzepte im Text, soll dieser mit Informationen verdichtet werden. Danach werden die Wirkungsbeziehungen zwischen den Konzepten modelliert, sodass die Fakten, Konzepte und Wirkungsbeziehungen als gedankliches Gesamtsystem Sinn ergeben. Damit die SuS neue Lernstrategien anwenden, muss die neue Lernstrategie intensiv und unter Anleitung geübt werden. Dies ist mit expliziter Übung gemeint. Swanson und Dashler (2003) beschreiben, dass zur Einführung neuer Lernstrategien extra für diesen Zweck konzipierte Unterrichtsmaterialien erstellt werden müssen. Die Unterrichtssequenz, so beschreiben sie weiter, soll in vier Schritten erfolgen. Diese sind wie folgt von Klicpera et al. (2020) beschrieben: • „Verbale Praxis, bei der die Schüler über die Zielsetzung jedes Schritts diskutieren und jeden Schritt anwenden können.
S. 22 • Kontrollierte Praxis und Feedback: Strategien auf nicht zu schwierige Materialien anwenden, damit sie den Umgang erlernen und praktizieren. • Fortgeschrittene Praxis und Feedback: Strategien auf Materialien anwenden, die ihrer aktuellen Schulstufe entsprechen. • Generalisierung: die Strategie auf eine breite Palette von neuen Materialien und Bedingungen anwenden.“ (Klicpera et al. 2020, S. 281) Souvignier und Antoniou (2007) fanden in einer Metaanalyse von 81 Interventionsstudien, welche die Effektstärken der Förderprogrammparaemeter bei Lernschwierigkeiten evaluierte, dass vier Merkmale besonders effektiv gewesen sind. Diese beschrieben Klicpera et al. (2020) wie folgt: • „Zusammenfassen üben, • Hauptideen von Texten identifizieren, • Selbstüberwachung, d. h. selbstreflexives Lernen, und schließlich die • explizite Vermittlung als Unterrichtsmethode.“ (Klicpera et al., 2020, S. 282) Diese vier Punkte sind nicht nur in Teilen identisch mit den Zielen der beiden fundamentalen Bausteine (Advanced Organizer und der expliziten Übung), welche als Basis für ein LRS-Leseförderprogramm dienen. Sie empfehlen ergänzend die Arbeitsmethode des Zusammenfassens. Da die Metaanalyse von Ise et al. (2012) später als Referenz zur Einordnung der Ergebnisse der hier vorliegenden Studie dienen könnte, muss hier erwähnt werden, dass Ise et al. (2012) nicht ausschliesslich Studien mit LRS-betroffenen Lernenden, sondern Studien mit Schülerinnen und Schülern, die in einem statistischen Peervergleich auf den Prozenträngen zwischen 1% und 50% lagen, berücksichtigte. Für die spätere Vergleichbarkeit wird also eine vergleichbare Probandinnenund Probandengruppe gewählt. Und dies bedeutet, dass neben Jugendlichen mit LRS auch ein nicht unerheblicher Anteil Jugendlicher mit Lernschwierigkeiten darunter sein sollte. Um auch für diese Zielgruppe ein ansprechendes Förderprogramm zu entwickeln, dienen die vier Punkte als richtungweisend.
S. 23 3.1.5. Nachteilsausgleich Für LRS ist im Kanton Zürich kein Nachteilsausgleich vorgesehen, wie aus dem folgenden Zitat hervorgeht: „Folgende Beeinträchtigungen führen in den untenstehenden Fachbereichen nicht zu einem Nachteilsausgleich, weil das Potenzial zur Erreichung einzelner oder mehrerer Lernziele aufgrund der Beeinträchtigung nicht besteht: - Schüler im Rollstuhl: Sport - Schüler mit Rechenschwäche: Mathematik - Schülerin mit Lese-/Rechtschreib-Störung: Rechtschreibung und Leseverständnis in Deutsch und allen Fremdsprachen - Unmusikalischer Schüler: Musik - Schülerin mit einer geistigen Behinderung: alle kognitiven Fächer In diesen Fällen können angepasste Lernziele und ein Verzicht auf Benotung oder in Ausnahmefällen eine Dispensation für ein Fach vereinbart werden. “ (Bildungsdirektion Kanton Zürich, 2022, S. 7) Begründet wird dies damit, dass auf Grund der Beeinträchtigung das Potenzial zur Erreichung gewisser Lernziele nicht gegeben ist. Es ist jedoch sinnvoll Massnahmen zu ergreifen, um die Tragfähigkeit der Schulsituation für Menschen mit Beeinträchtigung zu erhöhen. Daher erlaubt die Bildungsdirektion die unter dem Titel unspezifische Massnahmen aufgeführten Massnahmen zur Unterstützung von Menschen mit Beeinträchtigung im Rahmen des Unterrichts auch ohne formelles Anrecht auf Nachteilsausgleich umzusetzen: „5.1. Unspezifische Massnahmen - Zeit: Zeitzuschläge bei Prüfungen, individuell gestaltete Pausenregelungen usw. - Formen: Abnahme der Prüfung in mehreren Etappen, mündliche anstelle von schriftlichen Prüfungen (und umgekehrt), alternative Präsentation von Aufgaben und Ergebnissen (visuell – auditiv) usw. - Hilfsmittel: Begleitung durch Assistenzpersonen, Zulassen persönlicher technischer Hilfsmittel, Einsatz ITHilfsmittel usw.
S. 24 - Raum: Prüfungsdurchführung in separatem Zimmer, individuell angepasster Sitzplatz, Ruheplatz in Nebenraum usw. - Verhaltensregeln: Essen und Trinken möglich, Anpassung sozialer Regeln usw. “ (Bildungsdirektion Kanton Zürich, 2022, S. 9) Für die Anwendung von KI im Sinne eines IT-Hilfsmittels in diesem Rahmen, eröffnet sich ein Spannungsfeld. KI basierte Chatbots sind in der Lage bessere Texte zu produzieren als die meisten Lernenden der Sekundarstufe. Daher müssen zwei Effekte diskutiert werden. Zum einen könnte es dazu führen, dass wenn einzelne Lernende mit KI-Chatbots für den Unterricht ausgerüstet werden, dies von den Anderen als ungerecht empfunden wird. Zweitens können KI-Chatbots typische Schulaufgaben, wie Zusammenfassen oder Texte zu vorgegebenen Themen verfassen derart gut lösen, dass angenommen werden muss, dass sich die mit KIChatbot ausgerüsteten Lernenden weniger mit Herausforderungen (z.B. dem Verfassen einer Zusammenfassung oder einer eigenen Antwort.) beschäftigen würden. Die Entlastung durch einen KI-Chatbot könnte also so gross sein, dass er ausschliesslich eine entlastende, nicht jedoch eine Funktion zur Kompetenzförderung (z.B. Lesen und Schreiben) erhielte. Ein KI-Chatbot, der in der Schule eingesetzt werden soll, müsste daher so in seinen Fähigkeiten spezifiziert werden, dass die Lernenden, welche ihn verwenden bei der Bearbeitung so weit unterstützt werden, dass sie von Aufgaben, wie Zusammenfassen oder Fachtextlektüre lesen, nicht überfordert, jedoch trotzdem gefordert wären. Dazu müsste sich der KI-Chatbot z.B. durch die Anpassung der Textlänge und Sprachkomplexität, die er auf einen Prompt des Lernenden ausgibt, an dessen Sprachniveau anpassen. Ausserdem müsste das Verhalten des KI-Chatbots so modelliert werden, dass er Probleme, wie das Schreiben eines Textes, nicht für den User löst, sondern durch Scaffolding oder das schrittweise Bearbeiten der Teilprobleme einer Aufgabe, die User auf ihrem eigenen Lösungsweg unterstützt und zum Ziel leitet. Ausserdem ist es wichtig, dass der KI-Chatbot generell keine Lösungen, sondern Konzepte vermittelt. Die Fähigkeiten von KI-Chatbots müssen also so eingesetzt werden, dass sie die Lernenden in ihrem Lernprozess unterstützen und nicht die zu diesem Zweck von Lehrpersonen und Pädagogen sorgfältig konzipierten Lernaufgaben an Stelle der Lernenden lösen. KI-Chatbots müssen also als neues, interaktives Medium begriffen werden, welches einen neuen und zu den Kompetenzen des Users adaptiven Zugang zu Textarbeit ermöglicht. Mit Textarbeit ist Lesen und Verstehen, sowie Schreiben gemeint. Denn ein grosses Problem des in der Schule vorherrschenden Mediums Text ist, dass dieser so wie er
S. 25 vom Autor verfasst wurde fixiert ist und sich folglich nicht dynamisch an die Bedürfnisse des Lesers anpasst. Es geht also darum mit der Hilfe des KI-Chatbots in Text kodierte Fachinhalte nutzerspezifisch zu binnendifferenzieren und interaktive Zugänge zu den Inhalten zu gestalten. So soll der Zugang zu in Text kodierten Fachinhalten von Lernenden, die von längeren Fachtexten in ihrer Lesekompetenz überfordert wären, einen anderen Zugang zu den Informationen erhalten. 4. Technische Grundlagen: Der KI-Chatbot und der Server Der Begriff KI-Chatbot bezeichnet eine Benutzeroberfläche, welche Informationen zwischen dem User und einem Large Language Model (LLM) austauscht. Das LLM verarbeitet die Eingabe des Nutzers, indem es die wahrscheinlichste Antwort auf die vom User eingegebene Aufgabe berechnet und diese dann über das Userinterface als Text ausgibt. Um LLMs und ein Userinterface zwischen einem User und einem LLM betreiben zu können, wird ein Server benötigt. Der Betrieb von LLMs ist sehr rechenintensiv, sodass der Server dafür über einen leistungsstarken Graphikprozessor (GPU) mit einer möglichst hohen Anzahl schneller VideoRam (VRam) verfügen muss. Im Rahmen dieser Arbeit wird aus drei Gründen ein eigener Server betrieben. Erstens kann dadurch verhindert werden, dass sensible Daten zu Firmen mit kritischen Datenschutzbestimmungen gelangen. Zweitens können alle durch die Probandinnen und Probanden generierten Daten anonymisiert gespeichert werden. Drittens können die beiden vielversprechenden Funktionen Vorlesen und Textinhalte als Blockdiagramm darstellen den Probandinnen und Probanden zur Verfügung gestellt werden, während diese Funktionen von ChatGPT und anderen KI-Plattformen noch nicht als Paket angeboten werden. Damit der in dieser Masterarbeit verwendete Server für andere Forschende als technische KI-Forschungsplattform reproduzierbar wird, wird er in den folgenden Unterkapiteln dokumentiert. Die Folgende Abbildung ist eine Visualisierung des Servers.
S. 32 Sprachmodellarchitektur wird bestimmt. Eine der häufigsten Architekturen ist laut Le Chat (2025) die Transformer-Architektur, welche Self-Attendion-Mechanismen verwendet. Diese ermöglicht es, Beziehungen zwischen Wörtern, welche in Sätzen weit voneinander entfernt sind, festzustellen. Danach erfolgt das Training. Dieses hat zum Ziel, dass das Programm auf Grund der Datenbasis mit einer Wahrscheinlichkeitsrechnung das nächste Wort berechnen und somit die Ausgabe als Sprachmodellierung ausgeben kann. Danach erfolgen noch einige Optimierungsund Validierungsschritte. Am Ende des Trainingsprozesses kann das Modell noch für spezifische Aufgaben feingetunt werden. Das Fine-Tuning findet laut Le Chat (2025) anhand eines für eine spezifische Aufgabe relevanten Datensatzes statt, sodass sich die Leistung des Modells für die Bewältigung spezifischer Aufgaben verbessert. Das Fine-Tuning kann auch von Verbrauchern oder zu Forschungszwecken mit verhältnismässig geringer Rechenkapazität gemacht werden. Wenn es darum geht, wirksames Fine-Tuning zu machen, ist es die Herausforderung, die dazu erforderlichen Daten mit entsprechender Qualität zu erhalten. 4.2.7. Prompt, Systemprompt und Promptengineering Wie zu Beginn des Kapitels erwähnt, ist ein Prompt eine Eingabe des Users, welchen das LLM verstehen und ausführen kann. Je nachdem, ob und wie gut das LLM den Prompt versteht, berechnet es die Antwort auf den Prompt und gibt sie an den User aus. Grundsätzlich lassen sich zwei Sorten von Prompts unterscheiden. Einerseits den Prompt, welcher vom User des LLMs geschrieben wird, um zu bezwecken, dass das LLM etwas Bestimmtes tut. Andererseits jene Prompts, welche dem System LLM eine Anleitung geben, dass es sich auf eine gewisse Art und Weise dem User gegenüber verhalten soll. Die Systemprompts formen also das generelle Verhalten des LLMs. Sie setzen ethische Richtlinien, erklären dem LLM, in welchem Kontext der Text generiert oder in welchem Format er an den User ausgegeben werden soll (vergleiche dazu Park et al. (2024)). Dies zeigt das enorme Potential, welches in der Gestaltung der Prompts steckt, da ein guter Prompt das LLM zu dem erwünschten Verhalten führen kann. Somit kann es überflüssig werden, den Aufwand für ein LLM-Fine-Tuning oder Training zu betreiben. Doch welcher Prompt führt zum intendierten Verhalten? Diese Frage wird aktuell in der internationalen Forschungsgemeinschaft diskutiert. Das Problem ist, dass die Vorgänge im LLM nicht eindeutig vorhersagbar sind, sodass die Rechenkiste LLM als Blackbox bezeichnet werden muss. Um die Auswirkungen von Prompts auf das LLM zu evaluieren und zu verbessern, sind grosse Anstrengungen nötig, die man als Promptengineering bezeichnet. Um die Frage zu beantworten, welcher von zwei Prompts der bessere ist, existieren zwei Ansätze. Der erste Ansatz
S. 33 gibt Usern das LLM mit zu testendem Systemprompt zum Testen und befragt sie danach, um dann anhand der Usererfahrungen den Prompt zu optimieren. Der zweite Ansatz zur Promptevaluierung ist technischer Art. Anstatt menschlicher User generiert z.B. ChatGPT eine grosse Anzahl Prompts, welche nach den Vorgaben des Entwicklers erstellt werden. Diese Prompts werden dann automatisiert an das zu testende LLM mit dem zu evaluierenden Systemprompt gefüttert. Die Antworten werden in eine Liste eingefügt, sodass man diese danach ebenfalls mit der Hilfe von KI-Chatbots wie z.B. Le Chat auf gewisse Kriterien hin auswerten kann. So wird es möglich, in kurzer Zeit eine enorme Menge an Testläufen für ein LLM und seinen Systemprompt zu machen. So werden statistisch belastbare Aussagen möglich. Mit der Hilfe der KI-gestützten Auswertung kann dann für jeden Testlauf ein Score errechnet werden, sodass das Herumprobieren mit Prompts in grosse und statistisch relevante Zahlen skaliert werden kann. Dieses Testverfahren kann mit dem Programm ChainForge, welches am MIT von Arawjo et al. (2024) entwickelt und veröffentlicht wurde, durchgeführt werden. Es kann in einen Dockercontainer auf einem Server installiert werden und mit Ollama interagieren. Um einen Prompt optimieren zu können, ist es wichtig über erfolgreiche Promptstrategien informiert zu sein. Eine Promptstrategie, welche in der aktuellen Diskussion als sehr vielversprechend gilt, ist die Chain of Tahaught-Strategie (CoT). Dabei geht es darum, dass die durch den Prompt gestellte Aufgabe in kleine Teilschritte aufgegliedert wird und so das LLM in kleinen Schritten anweist, was es zu tun hat. Vergleiche dazu Park et al. (2024), Gao (2023), Arvidsson und Axell (2023), Xu et al. (2024) und White et al. (2024). Da jedoch LLMs momentan noch eine Blackbox sind, existieren die Bestrebungen, LLM-Agenten zu gestalten. Dies bedeutet, dass die einzelnen Teilaufgaben, wie sie beim CoT Prompt gestellt werden an einzelne LLMs innerhalb eines Agenten zur Ausführung übergeben werden. Die Ausgaben zu den jeweiligen Teilaufgaben der einzelnen LLMs können dann unter der Aufsicht eines evaluierenden LLMs zu einer finalen Antwort für den User weiterverarbeitet werden. Erst im Januar 2024 wurde eine Pythonbibliothek namens LangGraph veröffentlicht, die es ermöglicht, dass die einzelnen LLMs innerhalb eines KI-Agenten miteinander kommunizieren können und somit in Loops, if-Funktionen oder anderen Programmfunktionen arbeiten können, bis eine bestimmte Aufgabe erfüllt ist. Die Aufgabenaufteilung der LLMs innerhalb eines KI-Agenten führt dazu, dass jedes LLM nur einen einfachen und somit eindeutigen Prompt ausführen muss. Dadurch werden die einzelnen Arbeitsschritte im Arbeitsablauf besser kontrollierbar und
S. 34 Halluzinationen des LLMs, also unsinnige oder falsche Antworten werden im Vergleich zu komplexen und mehrstufigen Prompts reduziert. Die Programmierung eines mehrstufigen KI-Agenten zur Lösung einer Aufgabe ist also eine Möglichkeit, wie KIbasierte Systeme besser modelliert werden können. Für diese Arbeit sind zwei Artikel, welche im Rahmen eines Projekts in Südkorea entstanden sind, zentral wichtig. Es ist ein von der Regierung in Auftrag gegebenes Forschungsprojekt, welches die Entwicklung und Testung von KI-Lehrmitteln in der Schule beinhaltet. Park et al. (2024) beschrieben in ihrem Artikel, wie LLMs für den Englischunterricht ausgerichtet werden können. Ein zweiter wichtiger Artikel von Xu et al. (2024) beschreibt, wie ein KI-Agent mit verschiedenen Funktionen Mathe lehrt und wie die LLMs im Zusammenspiel ein Lernprogramm ergeben. In beiden der Artikel spielen Prompts eine zentrale Rolle. Xu et al. (2024) schreiben in ihrem Artikel über ihr Dialogsystemdesign das Folgende: „However, how to interact effectively with users remains a critical challenge. In the process of educating students, it is not advisable to directly provide the complete error analysis and answers. Instead, it is more beneficial to guide students step by step to discover the issues themselves, thereby enhancing the learning effect. To achieve this, we have designed specific prompts for the large model. Similar to the initial error analysis stage, we input the problem, explanation, student’s answer, and the model’s error analysis and suggestions into the LLM. However, unlike the former, we impose a series of requirements on the LLM in this stage: 1) Avoid directly providing the answers; instead, guide students to find the answers themselves through questions and hints. 2) Adhere to a guided and heuristic teaching approach, encouraging students to engage in selfdirected learning and critical thinking. 3) Maintain relevance in the dialogue, focusing on the issues and challenges the student is currently facing. 4) Respect the student’s learning pace, avoiding overly rapid progression. 5) Refrain from discussing topics unrelated to learning. With these requirements in place, our dialogue system can provide guided instruction to students, building upon the foundation of error analysis.“ (Xu et al., 2024, 5)
S. 35 Es wird zwar im Artikel nicht explizit geschrieben, dass die 5 Anweisungen für die BotUserinteraktion der Systemprompt ist. Dies kann jedoch aus dem Zusammenhang geschlossen werden. Es wird deutlich, dass die Frage, wie der KI-Chatbot mit dem User interagiert und welche Rolle er dabei einnimmt, zentral für das erfolgreiche Lehren ist. Die zentrale Frage ist also: Was ist die Rolle der Lehrperson? Wie verhält sie sich in einem Gespräch mit Lernenden und anhand von welchem Lernendenfeedback tut sie dies? Der Fokus des Projekts von Xu et al. (2024) liegt in der Feedbackgestaltung, welche anhand von erkannten Fehlern in den Kontext eines mathematischen Lösungswegs gesetzt wird und dadurch den Lernenden vermittelt, welches Konzept zur Lösung des fehlerhaften Teilproblems für die vorliegende Matheaufgabe benötigt wird. Die Vermutung, dass das Chatverhalten eines KI-basierten Chatbots durch die Modellierung des Leseverständnisvorgangs besser abgebildet werden kann als mit fünf Sätzen in einem Systemprompt, liegt nahe. Um dieses Ziel besser zu erreichen, müsste ein AI-Agent programmiert werden. 5. Thesen und Hypothesen 5.1. Thesen LLM basierte KI ist in der Lage, allgemeinwissensbasierte Textverarbeitung und Textarbeit zu leisten. Damit ist das Vorlesen von Texten, das Zusammenfassen von Texten, das Generieren von Texten und das Darstellen von Texten in Diagrammen oder das Chatten über Allgemeinwissen gemeint. Diese Fähigkeiten der KI sind Fähigkeiten, welche Menschen mit LRS in einem gewissen oder grösseren Masse fehlen. Daher leiten sich folgende Thesen ab: A) Der KI-Chatbot mit den vier Funktionen Vorlesen, Zusammenfassen, Blockdiagramm und Frage & Antwort hilft Jugendlichen mit geringer Lesekompetenz in Text kodierte Informationen zu verstehen. B) Der KI-Chatbot mit den vier Funktionen Vorlesen, Zusammenfassen, Blockdiagramm und Frage & Antwort wird von den Lernenden als hilfreich beim Verstehen von Texten wahrgenommen.
S. 36 C) Der KI Chat bot ermöglicht individualisierten Zugang zu in Text kodierten Informationen. 5.2. Antithesen Die Antithesen besagen das Gegenteil der Thesen: A) Der KI-Chatbot mit den vier Funktionen Vorlesen, Zusammenfassen, Blockdiagramm und Frage & Antwort hilft Jugendlichen mit geringer Lesekompetenz, nicht in Text kodierte Informationen zu verstehen. B) Der KI-Chatbot mit den vier Funktionen Vorlesen, Zusammenfassen, Blockdiagramm und Frage & Antwort wird von den Lernenden nicht als hilfreich beim Verstehen von Texten wahrgenommen. C) Der KI-Chatbot ermöglicht keinen individualisierten Zugang zu in Text kodierten Informationen. 5.3. Hypothesen Die Hypothesen leiten sich aus den Thesen ab und sind als einzelne Aussagen beweisoder widerlegbar: HA1.0) Die Versuchsgruppe unterscheidet sich in ihren Vortestresultaten nicht von den Vortestresultaten der Kontrollgruppe. HA1.1) Die Versuchsgruppe unterscheidet sich in ihren Vortestresultaten von den Vortestresultaten der Kontrollgruppe. HA2.0) Die Versuchsgruppe unterscheidet sich in ihren Nachtestresultaten nicht von den Nachtestresultaten der Kontrollgruppe. HA2.1) Die Versuchsgruppe unterscheidet sich in ihren Nachtestresultaten von den Nachtestresultaten der Kontrollgruppe. HA2.2) Die Kontrollgruppe erzielt im Vortest und im Nachtest Resultate, die sich nicht unterscheiden.
S. 37 HA3.0.) Die Kontrollgruppe erzielt im Vortest und im Nachtest Resultate, die sich unterscheiden. HA4.0) Die Versuchsgruppe erzielt im Vortest und im Nachtest Resultate, die sich nicht unterscheiden. HA4.1) Die Versuchsgruppe erzielt im Vortest und im Nachtest Resultate, die sich unterscheiden. HA5.0) Die Prozentrangdifferenzen von Nachtestergebnis minus Vortestergebnis der Individuen unterscheiden sich zwischen der Versuchsgruppe und der Kontrollgruppe nicht. HA5.1) Die Prozentrangdifferenzen von Nachtestergebnis minus Vortestergebnis der Individuen unterscheiden sich zwischen der Versuchsgruppe und der Kontrollgruppe. HB1.0) Die Probandinnen und Probanden beantworten die Frage, ob ihnen der KIChatbot beim Verstehen der Texte geholfen hat so häufig mit «Ja», dass kein Unterschied zur Zufallsverteilung mit p = 0.5 angenommen werden kann. HB1.1) Die Probandinnen und Probanden beantworten die Frage, ob ihnen der KI Chat bot beim Verstehen der Texte geholfen hat so häufig mit «Ja», dass ein Unterschied zur Zufallsverteilung mit p = 0.5 angenommen werden kann. HC1.0) Eine der vier Funktionen des KI-Chatbots wird von den Probandinnen und Probanden nie auf Rang 1 gewählt. HC1.1) Alle vier Funktionen des KI-Chatbots werden von mindestens einem der Probandinnen oder Probanden als die nützlichste Funktion auf Rang 1 gewählt.
S. 38 6. Methoden, Forschungsdesign, Datenschutz, Abgrenzung 6.1. Methoden und Forschungsdesign Das Forschungsdesign entspricht einer Vortest-Nachtest-Versuchsanordnung. Getestet werden zwei unabhängige Stichproben. Die Versuchsgruppe erhält das Training im Umgang mit dem KI-Chatbot während 90 Minuten. Die Kontrollgruppe erhält kein Training. Laut Klicpera et al. (2020) ist es nicht zu erwarten, dass nach der Zeitperiode von zwei Wochen eine statistisch signifikante Veränderung der Textverständniskompetenz bei den Jugendlichen der Versuchsgruppe oder der Kontrollgruppe zu erwarten ist. Sollten also im Nachtest statistisch signifikante Veränderungen in der Textverständniskompetenz einer der Gruppen nachgewiesen werden können, dann kann dies auf einen externen Faktor zurückgeführt werden. Dieser externe Faktor ist der KI-Chatbot, den die Versuchsgruppe nach absolviertem Anwendungstraining im Nachtest verwenden kann. Im Vortest steht der KI-basierte Chatbot der Versuchsgruppe nicht zur Verfügung. Die Kontrollgruppe schreibt den Vortest und den Nachtest regulär nach der Anweisung des Manuals, also ohne Hilfsmittel. Damit die Nachtestergebnisse nicht durch memorierte Lösungen vom Vortest verfälscht werden können, kommt im Vortest der ELFE II Test von Lenhardt et al. (2018) und im Nachtest der Lesen-6-7-Test von Bäuerlein et al. (2012) zur Anwendung. Beide Tests sind standardisiert und weisen den jeweils erzielten Testergebnissen einen Prozentrang zwischen 0% und 100% zu. Dadurch werden die Testergebnisse von Vortest und Nachtest vergleichbar. Mit den so entstehenden Vorund Nachtestdaten können die formulierten Hypothesen HA getestet werden. Zur Verwerfung einer Nullhypothese, welche jeweils davon ausgeht, dass kein Unterschied besteht, kommen statistische Tests mit a = 0.05 zum Einsatz. Nach dem Training und dem Nachtest wird die Versuchsgruppe zu den Hypothesen HB und HC mit einem Fragebogen befragt. Um die Jugendlichen der Versuchsgruppe und der Kontrollgruppe dafür zu motivieren, sich in den Vorund Nachtests anzustrengen, wurden nach der Ankündigung, dass Probandinnen und Probanden, die sich besonders anstrengten, höhere Chancen auf einen Gewinn hätten: Zwölf Kinotickets und Trostpreise werden verlost.
S. 39 6.1.1. Die Stichproben: Versuchsgruppe (N=21) und Kontrollgruppe (N=21) Die Versuchsgruppe besteht aus 17 Jugendlichen der 1. Sek B und 4 Jugendlichen der 1. Sek C. Von den Jugendlichen der Sek B haben zwei eine diagnostizierte LRS. Von den Jugendlichen der Sek C ist eine Person darunter, welche die Diagnose LRS hat. Die Kontrollgruppe besteht aus 17 Jugendlichen der 1. Sek B und 4 Jugendlichen der 1. Sek C. In der Kontrollgruppe ist keine Person, welche die Diagnose LRS hat. Die 1. Sek entspricht dem 7. Schuljahr. Sek C bezeichnet das schwächste Leistungsniveau und Sek B das mittlere Leistungsniveau. (Höhere Leistungsniveaus sind Sek A und Gymnasium.) 6.2. Datenschutz Da die Daten, welche im Zusammenhang mit der Interaktion von Probandinnen und Probanden und KI-Chatbot ausschliesslich auf einem Server gespeichert werden, welcher unter der Kontrolle des Interventionsleiters steht, gelangen grundsätzlich keine Daten in andere Hände. Damit die Daten auf dem Server im Falle eines Hackerangriffs keinen Rückschluss auf die Identität der Probandinnen und Probanden zulassen, werden die Loginnamen und Loginpasswörter zu den OI-Accounts der Probandinnen so gewählt, dass kein Rückschluss auf deren Identität möglich ist. Die Zuordnung der Klarnamen zu den Logindaten wird auf einem vom Server isolierten Gerät erstellt und aufbewahrt. (Vgl. Anhanng XXX) 6.3. Abgrenzung In dieser Masterarbeit wird kein Lesetraining zur Verbesserung der Lesekompetenz entwickelt. Von den bekannten Lesetrainingsmethoden wie der Markierung von Schlüsselwörtern, der Erstellung von Randnotizen oder verschiedener Lesetechniken, die das Textverständnis verbessern können, ist diese Arbeit abgegrenzt. In dieser Masterarbeit geht es darum zu erforschen, ob ein KI-basierter Chatbot mit seinen Funktionen Menschen mit schlechten Textverständniskompetenzen dabei helfen kann, in Text kodierte Informationen zu erschliessen und zu verstehen. Dabei wird die Kodierung der Information in Textform als Zugangsbarriere zu der Information interpretiert. Für Menschen mit LRS kann sich diese Zugangsbarriere zu notenrelevanten Informationen negativ auf ihre Laufbahn auswirken. Deswegen wird über eine technische Lösung nachgedacht, wie in Text kodierte Informationen mit Hilfe von KI unterschiedlich repräsentiert werden können und so multiple Zugänge zu den Informationen ermöglicht werden.
S. 40 Ein weiteres wichtiges Thema, welches momentan in den Medien diskutiert wird, ist die Frage, ob die KI dadurch, dass sie gewisse Sprachaufgaben lösen kann, Menschen derart entlastet, dass sie die fraglichen Kompetenzen zur Lösung jener gewissen Sprachaufgaben nicht mehr erlernen müssen. Zu dieser Frage kann diese Arbeit keine Aussage machen. Weil kein Lesetraining, sondern ein KI-Chatbot mit vier vielversprechenden Funktionen gestaltet, sowie ein Training im Umgang mit KI-Werkzeugen entwickelt und daraufhin erprobt wurde, ob mit Hilfe des KI-Cahtbots ein Textverständnistest besser als ohne KI-Unterstützung bearbeitet werden kann, muss explizit darauf hingewiesen werden, dass dies keinesfalls als Plädoyer zur Abschaffung von Lesetraining verstanden werden darf. Lesetraining im Rahmen der Schule ist für alle Lernenden essentiell und unverzichtbar. KI-Anwendungen haben das Potential, bestehende Arbeitsund Lernmethoden zu ergänzen und die Arbeitsmöglichkeiten mit Texten dadurch methodisch zu erweitern. Einen sinnvollen Umgang mit KI-gestützter Technologie für die Anwendung im Unterricht zu finden, ist ein Ziel dieser Arbeit. Auf Grund des Zeitlimits im Rahmen dieser Masterarbeit konnte ein KI-Chatbot mit verschiedenen Funktionen, welche durch vorgefertigte Prompts aufrufbar sind realisiert werden. Eine technische Verbesserung der Funktionen könnte, wie mehrfach beschreiben, durch die Programmierung eines KI-Agenten erreicht werden. Dies war jedoch auf Grund der Programmierkomplexität und dem Zeitbudget als Rahmen der Masterarbeit nicht möglich. 7. Die Funktionen des KI-basierten Chatbots Der Chatbot hat vier Funktionen, welche dabei helfen könnten, dass in Text kodierte Informationen mit alternativen Methoden zugänglich gemacht werden können. Der Chatbot kann dem Nutzer Texte vorlesen. Anhand von Text können Diagramme generiert werden. Aus den Texten können vom Chatbot zentrale Schlüsselkonzepte exzerpiert und dem Nutzer angezeigt werden. Zu den zentralen Schlüsselkonzepten des Textes kann der Chatbot ein Frage-Antwort-Chatgespräch leiten. All diese Funktionen können mit einem vorgefertigten Prompt von den SuS entweder über das Texteingabefeld mit der Tastenkombination #+7 zu jeder Zeit des Chatgesprächs mit dem Bot aufgerufen werden. Zahlreiche weitere Funktionen wie z.B. Texte in einfache Sprache umformulieren oder durch Rückfragen unbekannte
S. 41 Wörter umschreiben oder definieren sowie die Textübersetzung in andere Sprachen sind unter anderem möglich. 7.1. Das Verhalten des KI-Chatbots Der KI-Chatbot für die Lernenden soll Deutsch sprechen, sich wie eine Lehrperson verhalten und nicht über sexuelle, rassistische oder hasserfüllte Themen sprechen. Ausserdem soll er den User mit Du ansprechen und die Prompts exakt ausführen, damit die Funktionen möglichst zuverlässig funktionieren. Der Systemprompt wurde auf seine Funktion hin getestet. (Vergleiche Anhang 1.) 7.1.1 Der Systemprompt des KI-Chatbots SYSTEM “““ 1.**Write in fluent, native level DE-DE** 2. **Verhalte dich wie ein Lehrer** 3. **Sprich nicht über intime oder sexuelle Themen** 4. **Sprich nicht über Hass oder rassistische Themen** 5. **Schreibe in Du Form** 6. **Führe Prompts exakt aus** ““” 7.2. Das Vorlesen Der Prompt «Vorlesen» weist den Chatbot an, einen Text, der vom Nutzer in das Textfeld hineinkopiert wird, als identische Kopie an den Nutzer auszugeben. Danach kann der Text vom Bot per Knopfdruck vorgelesen werden. Dies ermöglicht es SuS über das Hören die in Text kodierten Informationen zu erhalten. 7.2.1 Der Prompt für die Funktion Vorlesen Gib eine exakte Kopie dieses Textes aus. 7.3. Zusammenfassen Mit einem vorgefertigten Prompt generiert der Chatbot eine zusammenfassende Liste der Schlüsselkonzepte, Schlüsselbegriffe und der Zusammenhänge zwischen den Schlüsselkonzepten. Dadurch, so die Vermutung, entlastet der Chatbot die Lernenden von der Aufgabe, die im Text beschriebenen Schlüsselkonzepte von weniger wichtigen Informationen im Text zu unterscheiden. Somit, so kann angenommen werden, sind mehr kognitive Kapazitäten für das Verstehen und Merken der Schlüsselkonzepte bei den Lernenden vorhanden, sodass diese für das Erbringen der Memorierungsleistung
S. 48 10. Resultate In diesem Kapitel werden die ausgewerteten Daten dargestellt und beschrieben. Der Bezug zu den Hypothesen wird danach hergestellt. Wenn ein T-Test verwendet wurde, sind die Daten zuvor mit dem Kolmogorov-Smirnov-Test auf Normalverteilung getestet worden. Die Nullhypothesen wurden mit α = 0.05 statistisch getestet. 10.1. Testresultate der Textverständnisvortests und der Textverständnisnachtests Abbildung 4: Testergebnisse der Vortests und Nachtests in Prozenträngen als Boxplots dargestellt. (Vgl. Datentabelle im Anhang 5) Die Abbildung zeigt die erreichten Prozentränge der Jugendlichen mit LRS, die gesamte Versuchsgruppe und die gesamte Kontrollgruppe im Vortest und im Nachtest als Boxplots. Prozentrang Textverständnistests 0 10 20 30 40 50 60 70 80 90 100 TESTERGEBNISSE TEXTVERSTEHEN IM VORTEST UND NACHTEST VERSUCHSGRUPPE (N=21) KONTROLLGRUPPE (N=21) Textverständisprozentränge von Personen mit diagnostizierter LRS: Vortest ELFE II (N = 3 & Teil der Versuchsgruppe) Textverständisprozentränge der Versuchsgruppe: Vortest ELFE II (N = 21) Textverständisprozentränge der Kontrollgruppe: Vortest ELFE II (N = 21) Textverständisprozentränge von Personen mit diagnostizierter LRS: Nachtest Lesen 6-7 (N = 3 & Teil der Versuchsgruppe) Textverständisprozentränge der Versuchsgruppe: Nachtest Lesen 6-7 (N = 21) Textverständisprozentränge der Kontrollgruppe: Nachtest Lesen 6-7 (N = 21)
S. 49 10.1.1. Beschreibung der Textverständnistestergebnisse der Gruppen im Vortest Die Ergebnisse des Vortests der Gruppe mit drei Jugendlichen mit diagnostizierter LRS werden im Boxplot links in blau dargestellt. Sie bilden im Vortest drei Datenpunkte. Das erste Quartil liegt beim Prozentrang 8.1, der Median beim Prozentrang 13.6 und das dritte Quartil beim Prozentrang 24.2. Der Mittelwert lag bei 15.3 Prozenträngen. Die Ergebnisse des Vortests der Versuchsgruppe (N=21) werden im zweiten Boxplot von links in schwarz dargestellt. Die untere Antenne liegt bei 0.8 Prozenträngen. Das erste Quartil liegt beim Prozentrang 6.8, der Median beim Prozentrang 13.6 und das dritte Quartil beim Prozentrang 24.2. Der Mittelwert lag bei 16.4 Prozenträngen. Die obere Antenne liegt bei 42.1 Prozenträngen. Die Ergebnisse des Vortests der Kontrollgruppe (N=21) werden im zweiten Boxplot von links in Rot dargestellt. Die untere Antenne liegt bei 1.4 Prozenträngen. Das erste Quartil liegt beim Prozentrang 13.65, der Median beim Prozentrang 42.1 und das dritte Quartil beim Prozentrang 65.5. Der Mittelwert lag bei 41.18 Prozenträngen. Die obere Antenne liegt bei 86.4 Prozenträngen. Die Ergebnisse des Nachtests der Gruppe mit drei Jugendlichen mit diagnostizierter LRS werden im vierten Boxplot von links in blau dargestellt. Sie bilden im Nachtest drei Datenpunkte. Das erste Quartil liegt beim Prozentrang 7, der Median beim Prozentrang 16 und das dritte Quartil beim Prozentrang 26. Der Mittelwert lag bei 16.33 Prozenträngen. Die Ergebnisse des Nachtests der Versuchsgruppe (N=21) werden im fünften Boxplot von links in schwarz dargestellt. Die untere Antenne liegt bei 1 Prozentrang. Das erste Quartil liegt beim Prozentrang 7, der Median beim Prozentrang 16 und das dritte Quartil beim Prozentrang 26. Der Mittelwert lag bei 18.48 Prozenträngen. Die obere Antenne liegt bei 41 Prozenträngen. Die Ergebnisse des Nachtests der Kontrollgruppe (N=21) werden im sechsten Boxplot von links in Rot dargestellt. Die untere Antenne liegt bei 0 Prozenträngen. Das erste Quartil liegt beim Prozentrang 5.5, der Median beim Prozentrang 21 und das dritte Quartil beim Prozentrang 26. Der Mittelwert lag bei 19.52 Prozenträngen. Die obere Antenne liegt bei 54 Prozenträngen.
S. 50 10.1.2. Vergleich der Textverständnistestergebnisse der Gruppen im Vortest Die Verteilung der erzielten Prozentränge in der Versuchsgruppe stellt sich wie folgt dar: Abbildung 5: Verteilung der erzielten Prozentränge in der Versuchsgruppe. (Vgl. Datentabelle im Anhang 5) Es kann angenommen werden, dass die erzielten Daten normalverteilt sind. Dazu wurde ein Kolmogorov-Smirnov-Test gemacht. Zur Verwerfung der Nullhypothese, welche besagt, dass die Daten normalverteilt sind, müsste in der Teststatistik für α = 0.05 die maximal zulässige Abweichung von 0.2872 überschritten werden. Die getesteten Daten weisen eine maximale Abweichung von 0.1942 auf, sodass die Nullhypothese beibehalten werden muss. 0 0.5 1 1.5 2 2.5 3 3.5 4 4.5 0 2 4 6 8 10 12 14 16 18 20 22 24 26 28 30 32 34 36 38 40 42 44 46 48 50 52 54 56 58 60 62 64 66 68 70 72 74 76 78 80 82 84 86 88 90 92 94 96 98 100 Personen Prozentränge Vortestergebnisse Textverstehen Versuchsgruppe (N=21)
S. 51 Die Verteilung der erzielten Prozentränge in der Kontrollgruppe stellt sich wie folgt dar: Abbildung 6: Verteilung der erzielten Prozentränge in der Kontrollgruppe. (Vgl. Datentabelle im Anhang 5) Es kann angenommen werden, dass die erzielten Daten normalverteilt sind. Dazu wurde ein Kolmogorov-Smirnov-Test gemacht. Zur Verwerfung der Nullhypothese, welche besagt, dass die Daten normalverteilt sind, müsste in der Teststatistik für α = 0.05 die maximal zulässige Abweichung von 0.2872 überschritten werden. Die getesteten Daten weisen eine maximale Abweichung von 0.1381 auf, sodass die Nullhypothese beibehalten werden muss. Die Versuchsgruppe unterscheidet sich in ihren Prozentrangergebnissen im Vortest von den Prozentrangergebnissen der Kontrollgruppe im Vortest statistisch signifikant. Zum Beleg dieser Aussage wurde ein zweiseitiger T-Test für unabhängige Stichproben gemacht (p = 0.001). Der Median der Versuchsgruppe lag im Vortest bei 13.6 Prozenträngen und der Median der Kontrollgruppe im Vortest bei 42.1 Prozenträngen. Somit kann gesagt werden, dass die Kontrollgruppe am Vortest statistisch signifikant besser abschnitt, als die Versuchsgruppe. HA1.0 muss verworfen werden und HA1.1 (Die Versuchsgruppe unterscheidet sich in ihren Vortestresultaten von den Vortestresultaten der Kontrollgruppe) wird angenommen. 10.1.3. Vergleich der Textverständnistestergebnisse der Gruppen im Nachtest Die Verteilung der erzielten Prozentränge in der Versuchsgruppe stellt sich wie folgt dar: 0 0.5 1 1.5 2 2.5 3 3.5 4 4.5 0 2 4 6 8 10 12 14 16 18 20 22 24 26 28 30 32 34 36 38 40 42 44 46 48 50 52 54 56 58 60 62 64 66 68 70 72 74 76 78 80 82 84 86 88 90 92 94 96 98 100 Personen Prozentrang Vortestergebnisse Textverstehen Kontrollgruppe (N=21)
S. 52 Abbildung 7: Verteilung der erzielten Prozentränge in der Versuchsgruppe. (Vgl. Datentabelle im Anhang 5) Es kann angenommen werden, dass die erzielten Daten normalverteilt sind. Dazu wurde ein Kolmogorov-Smirnov-Test gemacht. Zur Verwerfung der Nullhypothese, welche besagt, dass die Daten normalverteilt sind, müsste in der Teststatistik für α = 0.05 die maximal zulässige Abweichung von 0.2872 überschritten werden. Die getesteten Daten weisen eine maximale Abweichung von 0.1290 auf, sodass die Nullhypothese beibehalten werden muss. Die Verteilung der erzielten Prozentränge in der Kontrollgruppe stellt sich wie folgt dar: Abbildung 8: Verteilung der erzielten Prozentränge in der Kontrollgruppe. (Vgl. Datentabelle im Anhang 5) Es kann angenommen werden, dass die erzielten Daten normalverteilt sind. Dazu wurde ein Kolmogorov-Smirnov-Test gemacht. Zur Verwerfung der Nullhypothese, welche besagt, dass die Daten normalverteilt sind, müsste in der Teststatistik für α = 0 1 2 3 4 5 6 7 0246810 12 14 16 18 20 22 24 26 28 30 32 34 36 38 40 42 44 46 48 50 52 54 56 58 60 62 64 66 68 70 72 74 76 78 80 82 84 86 88 90 92 94 96 98 100 Personen Prozentränge Nachtestergebnisse Textverstehen Versuchsgruppe (N=21) 0 0.5 1 1.5 2 2.5 3 3.5 4 4.5 0246810 12 14 16 18 20 22 24 26 28 30 32 34 36 38 40 42 44 46 48 50 52 54 56 58 60 62 64 66 68 70 72 74 76 78 80 82 84 86 88 90 92 94 96 98 100 Personen Prozentränge Nachtestergebnisse Textverstehen Kontrollgruppe (N=21)
S. 53 0.05 die maximal zulässige Abweichung von 0.2872 überschritten werden. Die getesteten Daten weisen eine maximale Abweichung von 0.1435 auf, sodass die Nullhypothese beibehalten werden muss. Die Versuchsgruppe unterscheidet sich in ihren Prozentrangergebnissen im Nachtest von den Prozentrangergebnissen der Kontrollgruppe im Nachtest statistisch nicht signifikant. Zum Beleg dieser Aussage wurde ein zweiseitiger T-Test für unabhängige Stichproben gemacht (p = 0.838). Der Interquartilsabstand der Versuchsgruppe im Nachtest lag zwischen dem Prozentrang 7 und dem Prozentrang 26. Der Median der Versuchsgruppe lag im Nachtest beim Prozentrang 16. Der Interquartilsabstand der Kontrollgruppe im Nachtest lag zwischen dem Prozentrang 5.5 und dem Prozentrang 26. Der Median der Kontrollgruppe lag im Nachtest beim 21. Prozentrang. HA2.0 (Die Versuchsgruppe unterscheidet sich in ihren Nachtestresultaten nicht von den Nachtestresultaten der Kontrollgruppe) wird angenommen und HA2.1 muss verworfen werden. 10.1.4. Vergleich der Testergebnisse im Vortest und Nachtest Die Verteilung der erzielten Prozentrangveränderungen in der Versuchsgruppe stellt sich wie folgt dar. Die Prozentrangveränderung wurde berechnet, indem der jeweils von einem Probanden oder einer Probandin erzielte Vortestprozentrang vom erzielten Nachtestprozentrang subtrahiert wurde. Abbildung 9: Verteilung der Prozentrangdifferenz der Versuchsgruppe. Die Prozentrangdifferenz berechnet sich aus NachtestVortestprozentrang. Negative Werte weisen eine Prozentrangverschlechterung im Nachtest aus. Positive Werte weisen eine Prozentrangverbesserung im Nachtest aus. (Vgl. Datentabelle im Anhang 5) Es kann angenommen werden, dass die erzielten Daten normalverteilt sind. Dazu wurde ein Kolmogorov-Smirnov-Test gemacht. Zur Verwerfung der Nullhypothese, 0 0.5 1 1.5 2 2.5 -51 -49 -47 -45 -43 -41 -39 -37 -35 -33 -31 -29 -27 -25 -23 -21 -19 -17 -15 -13 -11 -9 -7 -5 -3 -1 1357911 13 15 17 19 21 23 25 27 Probanden Prozentrangdifferenz Versuchsgruppe Nachtest -Vortest Prozentrangdifferenz (N=21)
S. 54 welche besagt, dass die Daten normalverteilt sind, müsste in der Teststatistik für α = 0.05 die maximal zulässige Abweichung von 0.2872 überschritten werden. Die getesteten Daten weisen eine maximale Abweichung von 0.1355 auf, sodass die Nullhypothese beibehalten werden muss. Die Nachtestergebnisse der Versuchsgruppe unterscheiden sich nicht statistisch signifikant von den Vortestergebnissen der Versuchsgruppe. Zum Beleg dieser Aussage wurde ein zweiseitiger T-Test für gepaarte Stichproben gemacht (p = 0.6300). HA4.0 (Die Versuchsgruppe erzielt im Vortest und im Nachtest Resultate, die sich nicht unterscheiden) muss angenommen werden und HA4.1 wird verworfen. Die Verteilung der erzielten Prozentrangdifferenz in der Kontrollgruppe stellt sich wie folgt dar. Die Prozentrangveränderung wurde berechnet, indem der jeweils von einem Probanden oder einer Probandin erzielte Vortestprozentrang vom erzielten Nachtestprozentrang subtrahiert wurde. Abbildung 10: Verteilung der Prozentrangdifferenz der Kontrollgruppe. Die Prozentrangdifferenz berechnet sich aus NachtestVortestprozentrang. Negative Werte weisen eine Prozentrangverschlechterung im Nachtest aus. Positive Werte weisen eine Prozentrangverbesserung im Nachtest aus. (Vgl. Datentabelle im Anhang 5) Es kann angenommen werden, dass die erzielten Daten normalverteilt sind. Dazu wurde ein Kolmogorov-Smirnov-Test gemacht. Zur Verwerfung der Nullhypothese, welche besagt, dass die Daten normalverteilt sind, müsste in der Teststatistik für α = 0.05 die maximal zulässige Abweichung von 0.2872 überschritten werden. Die getesteten Daten weisen eine maximale Abweichung von 0.0946 auf, sodass die Nullhypothese beibehalten werden muss. 0 0.5 1 1.5 2 2.5 3 3.5 -66 -65 -64 -63 -62 -61 -60 -59 -58 -57 -56 -55 -54 -53 -52 -51 -50 -49 -48 -47 -46 -45 -44 -43 -42 -41 -40 -39 -38 -37 -36 -35 -34 -33 -32 -31 -30 -29 -28 -27 -26 -25 -24 -23 -22 -21 -20 -19 -18 -17 -16 -15 -14 -13 -12 -11 -10 -9 -8 -7 -6 -5 -4 -3 -2 -1 0 1 2 3 4 5 6 Probanden Prozentrangdifferenz Kontrollgruppe Nachtest-Vortest Prozentrangdifferenz (N=21)
S. 55 Die Nachtestergebnisse der Kontrollgruppe unterscheiden sich statistisch signifikant von den Vortestergebnissen der Kontrollgruppe. Zum Beleg dieser Aussage wurde ein zweiseitiger T-Test für gepaarte Stichproben gemacht (p = 0.00003). HA3.0 muss verworfen werden und HA3.1 (Die Kontrollgruppe erzielt im Vortest und im Nachtest Resultate, die sich unterscheiden) muss angenommen werden. Vergleicht man die erzielten Prozentrangdifferenzen der Versuchsgruppe mit den Prozentrangdifferenzen der Kontrollgruppe, stellen sich die Daten wie folgt dar. Abbildung 11: Vergleich der Prozentrangdifferenz der Versuchsgruppe und der Kontrollgruppe. Die Prozentrangdifferenz berechnet sich aus Nachtest-Vortestprozentrang. (Vgl. Datentabelle im Anhang 5) Ein positiver Wert bedeutet, dass das Nachtestergebnis ein höherer Prozentrang war als das Vortestergebnis des Probanden oder der Probandin. Ein negativer Wert eines Probanden oder einer Probandin bedeutet, dass das Nachtestergebnis tiefer war als das Vortestergebnis. Die Prozentrangdifferenzen zwischen dem Nachtest und dem Vortest der Versuchsgruppe unterscheiden sich statistisch signifikant von den Prozentrangdifferenzen zwischen dem Nachtest und dem Vortest der Kontrollgruppe. Zum Beleg dieser Aussage wurde ein zweiseitiger T-Test für unabhängige Stichproben gemacht (p = 0.0002). HA5.0 muss verworfen werden und HA5.1 (Die Prozentrangdifferenzen von Nachtestergebnis minus Vortestergebnis der Individuen unterscheiden sich zwischen der Versuchsgruppe und der Kontrollgruppe) muss angenommen werden. Die Versuchsgruppe verbesserte sich insgesamt um +42.7 Prozentränge. Die Kontrollgruppe verschlechterte sich insgesamt um -454.8 Prozentränge. -65.4 -52.8 -39.5 -39.5 -39.1 -30.5 -29 -26.4 -26.1 -24.5 -21.1 -20.4 -13.6 -11.5 -9 -8.7 -6.4 -1.4 -1.1 5.6 5.6 -50.9 -20.2 -17.4 -17.2 -16.1 -8.2 -7.1 -2.7 -0.6 2.9 7.4 7.9 12.4 12.4 15.2 16.3 16.4 20.4 20.5 23.9 27.4 -80 -60 -40 -20 0 20 40 12345678910 11 12 13 14 15 16 17 18 19 20 21 Prozentrangveränderung Probanden N =21 VERÄNDERUNG* DER TESTRESULTATE VON VERSUCHSGRUPPE (N=21) UND KONTROLLGRUPPE (N=21) * VERÄNDERUNG = NACHTESTRESULTAT -VORTESTRESULTAT Kontrollgruppe Nachtest - Vortest Differenz Versuchsgruppe Nachtest - Vortest Differenz
S. 56 10.2. Resultate der Probandinnen und Probandenbefragung Um die Erfahrungen der Probandinnen und Probanden mit dem KI-Chatbot zu dokumentieren, wurden sie nach der Intervention mit einem Fragebogen befragt. Darin sollten die Funktionen des Chatbots als Rangliste dargestellt werden. Ausserdem wurde gefragt, ob der KI-Chatbot beim Verstehen der Texte hilfreich war. 10.2.1. Bewerteten die Probandinnen und Probanden den KI-Chatbot für das Verstehen der Texte als hilfreich? Die Antworten auf die Frage, ob die Probandinnen und Probanden den KI-Chatbot als nützlich beim Verstehen der Texte empfanden, stellen sich wie folgt dar: Abbildung 12: Antworten auf die Frage, ob der KI-Chatbot den Probandinnen und Probanden beim Verstehen der Texte geholfen hat. Es wird ersichtlich, dass 20 von 21 Probandinnen und Probanden die Frage, ob ihnen der KI-Chatbot beim Verstehen der Texte geholfen hat, mit Ja beantworteten. Eine/r der 21 Probandinnen und Probanden beantwortete die Frage mit Nein. An der 0 5 10 15 20 25 Ja Nein Probanden BEURTEILUNG NÜTZLICHKEIT JA/NEIN (N=21) Hat dir die KI beim Verstehen der Texte geholfen?
S. 57 erwarteten Verteilung der Antworten bei einer unabhängigen Zufallsverteilung mit p = 0.5 für Ja und Nein, ergab der zweiseitige Binomialveteilungstest eine Wahrscheinlichkeit von p = 0.00002 für das beobachtete Resultat. Somit ist das Resultat statistisch signifikant vom erwarteten Wert unterscheidbar. HB1.0 muss verworfen werden und HB1.1 (Die Probandinnen und Probanden beantworten die Frage, ob ihnen der KI-Chatbot beim Verstehen der Texte geholfen hat so häufig mit «Ja», dass ein Unterschied zur Zufallsverteilung mit p = 0.5 angenommen werden kann.) muss angenommen werden. 10.2.2. Funktionsbeurteilung des KI-Chatbots durch die Probandinnen und Probanden Die Auswertung der Ranglisten der Funktionen des KI-Chatbots ergibt folgendes Bild: Abbildung 13: Auswertung der Funktionsranglisten, welche die Probandinnen und Probanden im Rahmen der Befragung erstellten. Jede Funktion wurde von mindestens einem Probanden oder einer Probandin auf Rang 1 gewählt. Die Funktion Vorlesen kommt auf Rang 1 am häufigsten vor und hat insgesamt mit 74 Punkten am besten bei der Bewertung durch die Probandinnen und Probandengruppe abgeschnitten. Am zweithäufigsten kommt die Funktion Zusammenfassen auf dem Rang 1 vor. Diese Funktion hat insgesamt mit 64 Punkten am zweitbesten beim Ranking abgeschnitten. Die Funktionen Blockdiagramm erstellen und Frage & Antwort kamen auf Rang 3 und 4 am häufigsten vor. In der Gesamtwertung des Rankings teilen sich die zwei Funktionen den 3. Rang mit jeweils 36 Punkten. HC1.0 muss verworfen werden und HC1.1 (Alle vier Funktionen des KI-Chatbots werden von mindestens einem Probanden oder einer Probandin als die nützlichste Funktion auf Rang 1 gewählt.) wird angenommen. 13 6 2 0 74 61.90% 28.57% 9.52% 0.00% 35.24% 6 10 5 0 64 28.57% 47.62% 23.81% 0.00% 30.48% 1 3 6 11 36 4.76% 14.29% 28.57% 52.38% 17.14% 1 2 8 10 36 4.76% 9.52% 38.10% 47.62% 17.14% RANG 1 = 4P RANG 2 = 3P RANG 3 = 2P RANG 4 = 1P PUNKTE PERSONEN BEURTEILUNG FUNKTIONEN (N=21) Vorlesen Zusammenfassen Blockdiagramm Frage & Antwort
S. 64 Prozentrangveränderung der Textverständniskompetenz der Probandinnen und Probanden zu erwarten ist. Die Versuchsgruppe verschlechterte sich im Nachtest im Unterschied zur Kontrollgruppe trotz des höheren Schwierigkeitsgrades des Nachtests jedoch nicht statistisch signifikant im Vergleich zu ihren Vortestergebnissen. Im Gegenteil schnitt die Kontrollgruppe in ihren Nachtestergebnissen statistisch nicht signifikant besser als in den Vortestergebnissen ab. Daher kann ein positiver Effekt des KI-Chatbots auf die Nachtestresultate der Versuchsgruppe für die Erklärung der unterschiedlichen Messungen zwischen Vortest und Nachtest als eher wahrscheinlich angenommen werden. Ein weiteres Indiz, welches für einen positiven Effekt des KI-Chatbots auf die Nachtestresultate der Versuchsgruppe hinweist, sind die Resultate der Befragung der Probandinnen und Probanden nach der Versuchsdurchführung. Die Probandinnenund Probandenbefragung ergab, dass 20 von 21 Probandinnen und Probanden die Frage, ob ihnen der KI-Chatbot beim Verstehen der Texte geholfen habe, mit «Ja» beantworteten. Diese Befragungsdaten stützen die Vermutung, dass der KI-Chatbot einen positiven Effekt auf die Nachtestresultate gehabt haben könnte. Ein didaktisch interessantes Resultat dieser Studie ist, dass mit dem KI-basierten Chatbot vier durch einen Prompt erzeugte Funktionen (Vorlesen, Zusammenfassen, Blockdiagramm, Frage & Antwort) getestet wurden, welche individuell von den Probandinnen und Probanden für die Arbeit mit Texten genutzt werden konnten. In der Probandinnenund Probandenbefragung stellte sich heraus, dass jede der Funktionen mindestens einmal auf Rang 1 für die grösste Nützlichkeit gewählt wurde. Damit konnte gezeigt werden, dass die Funktionsvielfalt des KI-Chatbots für das individualisierte Erschliessen von Textinhalten im Unterricht zu den weit verbreiteten Textbearbeitungsund Lesemethoden ergänzende Möglichkeiten bietet und dadurch die Methodenvielfalt im Unterricht für das Erschliessen von in Text kodierten Informationen der Versuchsgruppe erweitert werden konnte. Ausserdem konnte durch das Nützlichkeitsranking der vier getesteten Funktionen in der Probandinnenund Probandenbefragung festgestellt werden, dass die Funktion Vorlesen im Vergleich zwischen den vier Funktionen am besten abgeschnitten hat. Die Möglichkeit, über das Hören Informationen wahrzunehmen und sie zu lesen, baut für Jugendliche mit einem Textverständniskompetenzniveau im Bereich von LRS (wie es der Versuchsgruppe entsprach) eine nicht zu unterschätzende Barriere zu in Text kodierten Informationen ab, sodass die Partizipation am Bildungsprogramm der Schule für sie durch die Nutzung von KI, möglicherweise in Zukunft im Rahmen einer allgemeinen Massnahme, erleichtert werden könnte.
S. 65 Die Bereitstellung und Gestaltung des KI-Chatbots mit den vier Funktionen führten im Rahmen dieser Masterarbeit an die Grenzen des technisch in diesem Rahmen machbaren, da kein Informatiker mit entsprechender Programmiererfahrung zur Gestaltung von KI-Agenten involviert war. Die funktionstaugliche Bereitstellung und Gestaltung des KI-Chatbots als technische Basis für die gemachte Forschung ist ebenfalls ein wichtiges Ergebnis dieser Arbeit. Es konnte aufgezeigt und getestet werden, wie die technische Grundlage zur Forschung mit KI-Chatbots für den Forschungsrahmen einer Masterarbeit aufgebaut werden kann. 12.6. Ausblick Während der Recherche für diese Studie entwickelten sich die technischen Möglichkeiten für die Entwicklung von KI-Agenten rasant weiter. Die Beobachtung der technischen Weiterentwicklungen von Open Source Werkzeugen für die Gestaltung von Programmen mit LLMs im Loop lässt erahnen, dass eine Revolution in der Funktionsweise der digitalen Welt unmittelbar bevorsteht. Die gigantischen Anstrengungen von Meta, Google, OpenAI, Mistral und Co. breit angelegte Rechenpower für den cloudbasierten Betrieb von LLMs bilden die Infrastruktur dafür. Die neuen Möglichkeiten, Sprachdaten automatisiert zu verarbeiten und zu bewerten, wird für sämtliche Kommunikationsbereiche, in denen individuelle Sprachdatenauswertung gefordert ist, neue Anwendungsmöglichkeiten eröffnen. Ein Schlüssel für zukünftige Innovation wird es sein, Forschungsinfrastruktur für den Betrieb von LLMs für interdisziplinäre Teams aus Programmierern und Bildungsexperten zusammenzubringen, damit KI-gestützte Anwendungen im Bildungssektor für Menschen mit Beeinträchtigung sinnvoll konzipiert werden können. Die im Rahmen dieser Arbeit entwickelten Prompts zur Ausführung der vier Funktionen (Vorlesen, Zusammenfassen, Blockdiagramm, Frage & Antwort) können für Menschen mit LRS als Werkzeug zur Zugangserleichterung zu in Text kodierten Informationen dienen, wenn eine Lehrperson die Verwendung eines Tablets in der fraglichen Unterrichtssituation zulässt. Die vier Funktionen als KI-Agenten zu programmieren und dadurch den Chatbot dazu zu bringen, dass er im Chatgespräch die zentralen Schlüsselkonzepte und Schlüsselbegriffe autonom und mit Hilfe der vier Funktionen interaktiv und individualisiert mit einem Nutzer erarbeitet, wird ein weiterführendes Projekt sein. Um zu beweisen, dass Menschen mit LRS durch KI im Umgang mit Texten unterstützt werden können, müssen noch Studien mit grösserer Probandinnenund Probandenzahl oder anderem Studiendesign durchgeführt werden.
S. 66 14. Quellen Arvidsson, S. & Axell, J. (2023). Prompt engineering guidelines for LLMs in Requirements Engineering. Verfügbar unter: https://gupea.ub.gu.se/handle/2077/77967 Bäuerlein, K., Lenhard, W., Schneider, W. (2012). Lesetestbatterie für die Klassenstufen 6–7 (LESEN 6–7). Göttingen: Hogrefe. Bildungsdirektion Kanton Zürich. (2022). Nachteilsausgleich bei der Leistungsbeurteilung von Schülerinnen und Schülern mit Behinderung in der Volksschule. Zürich: Volksschulamt ChatGPT 4. (2024). Verfügbar unter: https://chatgpt.com/ Dilling, H., Mombour, W. & Schmidt, M. H. (Hrsg.) (2011). Internationale Klassifikation psychischer Störungen. ICD-10 Kapitel V (F) – Klinisch diagnostische Leitlinien. Verfügbar unter: https://klassifikationen.bfarm.de Ebner, G., Bosshart, H., Hatzinger, M., Mager, R., Rota, F., Seifritz, E., Stieglitz, R.D., Herzog-Zwitter, I. (2023). ICD-11 – Empfehlung zur Verwendung in der Psychiatrie. Schweizerische Ärztezeitung 104(10), 34-35. Verfügbar unter: https://www.swiss-insurance-medicine.ch Gao, A. (2023). Prompt Engineering for Large Language Models. A brief guide with examples for non-technical readers. Verfügbar unter: https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4504303 Gold, A. (2018). Lernschwierigkeiten: Ursachen, Diagnostik, Intervention. Stuttgart: Verlag W. Kohlhammer. Haffner, J., Zerahn-Hartung, C., Pfüller, U., Parzer, P., Strehlow, U., Resch, F. (1998). Auswirkungen und Bedeutung spezifischer Rechtschreibprobleme bei jungen Erwachsenen – empirische Befunde in einer epidemiologischen Stichprobe. Zeitschrift für Kinderund Jugendpsychiatrie 26, 124–135. Hellendoorn, J., Ruijssenaars, W. (2000). Personal Experiences and Adjustment of Dutch Adults with Dyslexia. Remedial and Special Education 21, 227–239. Hunziker, H. (2006). Im Auge des Lesers. Foveale und periphere Wahrnehmung – vom Buchstabieren zur Lesefreude. Zürich: Transmedia Stäubli Ise, E., Engel, R., Schulte-Körne, G. (2012). Was hilft bei der Lese Rechtschreibstörung?. Ergebnisse einer Metaanalyse zur Wirksamkeit deutschsprachiger Förderansätze. Kindheit und Entwicklung, 21(2), 122-136. Kintsch, W. (1998). Comprehension: a paradigm for cognition. Cambridge: Cambridge: Universal Press.
S. 67 Klicpera, C., Schabmann, A., Gasteiger-Klicpera, B., Schmidt, B. (2020). Legasthenie – LRS. Modell, Diagnose, Therabie und Förderung. München: Ernst Reinhardt. Klicpera, C., Gasteiger-Klicpera, B., Schabmann, A. (1993). Lesen und Schreiben – Entwicklung und Schwierigkeiten. Die Wiener Längsschnittuntersuchungen über die Entwicklung, den Verlauf und die Ursachen von Leseund Schreibschwierigkeiten in der Pflichtschulzeit. Bern: Huber. Le Chat. (2025). Verfügbar unter: https://chat.mistral.ai/chat Lenhard, W., Lenhard A., Schneider, W. (2018). ELFE II Manual. Ein Leseverständnistest für Erstbis Siebtklässler – Version II. Göttingen: Hogrefe Verlag GmbH&Co. Mähler, C. (2021). Diagnostik von Lernstörungen: Zeit zum Umdenken. Zeitschrift für Pädagogische Psychologie, 35, 217–227. Maughan, B., Hagell, A. (1996). Poor Readers in Adulthood: Psychosocial Functioning. Development and Psychopathology 8, 457–476. Meyer, A. (2021). Lese-Rechtschreibstörungen (LRS). München: Ernst Reinhardt Verlag. Ossimitz, G. (2000). Entwicklung systemischen Denkens. Theoretische Konzepte und empirische Untersuchungen. München: Profil. Park, J., Bae, J., Lee, U., Ahn, T., Lee, S., Kim, D., ... , Kim, H. (2024). How to Align Large Language Models for Teaching English? Designing and Developing LLM based – Chatbot for Teaching English Conversation in EFL, Findings and Limitations. Verfügbar unter: https://arxiv.org/abs/2409.04987 Souvignier, E., Antoniou, F. (2007). Förderung des Leseverständnisses bei Schülerinnen und Schülern mit Lernschwierigkeiten – eine Metaanalyse. VHN 76, 46–62. Thellmann, K., Fromm, M., Stadler, B., Schulze Bischoff, J., Jude, A., Barth, F., ... , Ali, M. (2024). Towards Multilingual LLM Evaluation for European Languages. Verfügbar unter: https://arxiv.org/abs/2410.08928 White, J., Fu, Q., Hays, S., Sandborn, M., Olea, C.,Gilbert, H., … , Schmidt, D. (2024). A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT. Verfügbar unter: https://arxiv.org/abs/2302.11382v1 Xu, T., Zhang, Y., Chu, Z., Wang, S., Wen, Q. (2024). AI-Driven Virtual Teacher for Enhanced Educational Efficiency: Leveraging Large Pretrained Models for Autonomous Error Analysis and Correction. Verfügbar unter: https://arxiv.org/abs/2409.09403
S. 68 15. Abbildungsverzeichnis Abbildung 1: Schematische Darstellung des Servers mit Hardware und Software... 26 Abbildung 2: Präzisionsresultate der EU21: Testaufgaben von vier mittelgrossen LLMs aus der Studie von Thellmann et al. (2024). ........................................... 30 Abbildung 3: Blockdiagramm, welches vom KI-Chatbot auf Grund des Hilu Textes von Ossimitz (2000) generiert wurde. Das Blockdiagtamm zeigt ein in Text kodiertes System mit zyklischen, verzweigten und verketteten Zusammenhängen. .......................................................................................... 43 Abbildung 4: Testergebnisse der Vortests und Nachtests in Prozenträngen als Boxplots dargestellt. (Vgl. Datentabelle im Anhang 5) ...................................... 48 Abbildung 5: Verteilung der erzielten Prozentränge in der Versuchsgruppe. (Vgl. Datentabelle im Anhang 5) ............................................................................... 50 Abbildung 6: Verteilung der erzielten Prozentränge in der Kontrollgruppe. (Vgl. Datentabelle im Anhang 5) ............................................................................... 51 Abbildung 7: Verteilung der erzielten Prozentränge in der Versuchsgruppe. (Vgl. Datentabelle im Anhang 5) ............................................................................... 52 Abbildung 8: Verteilung der erzielten Prozentränge in der Kontrollgruppe. (Vgl. Datentabelle im Anhang 5) ............................................................................... 52 Abbildung 9: Verteilung der Prozentrangdifferenz der Versuchsgruppe. Die Prozentrangdifferenz berechnet sich aus Nachtest-Vortestprozentrang. Negative Werte weisen eine Prozentrangverschlechterung im Nachtest aus. Positive Werte weisen eine Prozentrangverbesserung im Nachtest aus. (Vgl. Datentabelle im Anhang 5) ............................................................................... 53 Abbildung 10: Verteilung der Prozentrangdifferenz der Kontrollgruppe. Die Prozentrangdifferenz berechnet sich aus Nachtest-Vortestprozentrang. Negative Werte weisen eine Prozentrangverschlechterung im Nachtest aus. Positive Werte weisen eine Prozentrangverbesserung im Nachtest aus. (Vgl. Datentabelle im Anhang 5) ............................................................................... 54 Abbildung 11: Vergleich der Prozentrangdifferenz der Versuchsgruppe und der Kontrollgruppe. Die Prozentrangdifferenz berechnet sich aus NachtestVortestprozentrang. (Vgl. Datentabelle im Anhang 5) ....................................... 55 Abbildung 12: Antworten auf die Frage, ob der KI-Chatbot den Probandinnen und Probanden beim Verstehen der Texte geholfen hat. ........................................ 56 Abbildung 13: Auswertung der Funktionsranglisten, welche die Probandinnen und Probanden im Rahmen der Befragung erstellten. ............................................. 57
S. 69 16. Danksagungen Für das Gegenlesen der Arbeit bedanke ich mich bei Christian Urech und für die Betreuung bei Marius Haffner.
S. 71 18. Anhang Anhang 1: Systemprompttest
S. 72
S. 73 Anhang 2: Beispielhafter Chatverlauf
S. 74
S. 81
S. 82
S. 83
S. 84
S. 85
S. 86
S. 87
S. 88
S. 89
S. 90
S. 97 Anhang 5: Datentabellen
S. 98 Anhang 6: Statistische Tests
S. 99
S. 100
S. 101
S. 102
S. 103