Full text
Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 24 Wissenschaftliche Artikel/Artículos Científicos ChatGPT en la creación de exámenes de alemán como lengua extranjera ChatGPT in creating exams on German as a foreign language Celia Llabrés Llovet Universitat de les Illes Balears [email protected] https://orcid.org/0009-0002-8692-8135 Recibido: 09/07/2024 Aceptado: 10/11/2024 DOI: https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 Resumen: ChatGPT se disfraza de ser humano. Por este motivo, se pretende comprobar si esta interfaz es capaz de crear pruebas de evaluación de alemán como lengua extranjera de calidad. El principal objetivo de esta investigación es evidenciar si ChatGPT tiene la capacidad de sustituir la labor docente de crear exámenes. La metodología del presente estudio ha consistido en el envío de dos encuestas similares, una a profesorado y otra a alumnado de alemán del ámbito universitario, para comprobar si son capaces de distinguir entre textos producidos por humanos, específicamente exámenes de la Escuela Oficial de Idiomas, o textos similares creados por ChatGPT. En ocasiones, ChatGPT comete errores y expresa incoherencias, lo cual no puede permitirse en la evaluación de conocimientos de lenguas extranjeras, sobre todo, si los humanos son capaces de crear esos mismos exámenes de manera más eficiente y rápida. Palabras clave: ChatGPT, EOI, coherencia, profesorado, alumnado Abstract: ChatGPT pretends to be a person. Therefore, the aim of this article is to prove if the chatbot can create quality exams on German as a foreign language. The main purpose of the investigation is to prove if ChatGPT is able to substitute the professors’ task of creating exams and, consequently, substitute them in this specific duty. The methodology conducted has consisted of two similar surveys sent to German professors and university students, one to each, in order to observe if they are capable of distinguishing between texts written by humans, specifically exams from the Spanish Official School of Languages, or similar texts written by ChatGPT. Aside from the personal views of the participants, ChatGPT both makes mistakes and is occasionally incoherent, which cannot be permitted in the assessment of foreign language knowledge, mainly if humans can create these same exams in a faster and more efficient manner. Keywords: ChatGPT, Spanish Official School of Languages, coherence, professors, students
Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 25 E Generative Pre-trained Transformer desarrollado por la empresa OpenAI, fue inminente, superando en pocos meses las cifras que las plataformas que lideraban los récords del momento, TikTok e Instagram, habían tardado años en conseguir (Ichbiah 2023: s.p.). La diferencia notoria es el formato conversacional de esta interfaz inteligente, pues da la impresión de que se trate de una persona experta en cualquier tema debido a la coherencia y a la cohesión de la mayoría de sus respuestas, aunque hay que tener en cuenta que realmente no entiende el mensaje que comunica (ibid), sino que se nutre de muchísimas bases de datos, con las cuales intenta proporcionar la respuesta que aparenta ser más natural en el idioma que se le pide, no necesariamente correcta. La gran novedad es que ChatGPT «can generate new content rather than simply analyze existing data» (Baker 2023: s.p.), lo cual se equipara a lo que, hasta el momento, se entendía que solo podía hacer un humano: crear nuevo contenido «desde cero». Su mayor objetivo es la cohesión, mientras que «en muchos temas es poco precisa» (Fernández 2024: s.p.). 1.1. La aplicación de ChatGPT en la educación En particular, el campo de la educación convive con esta nueva realidad: ChatGPT se utiliza a diario en las aulas con el fin de facilitar el trabajo. Por ello, es urgente el estudio de sus beneficios, inconvenientes y limitaciones; para poder, así, incluirlo en el aula de manera beneficiosa a todos los participantes del proceso educativo. Al analizar el rendimiento de otras herramientas que se habían diseñado «para llevar a cabo tareas pedagógicas» (Sabzalieva & Valentini 2023: 29), hasta ahora siempre se resaltaba el papel fundamental que, a cualquier nivel en cualquier ámbito educativo, tiene el profesorado. En cuanto al estudiante, para conseguir información valiosa por parte de ChatGPT, Baker (2023: s.p.) menciona que debe preguntar a la interfaz la respuesta correcta, lo cual implica un análisis crítico previo por parte del alumnado que desee utilizar dicha herramienta como ayuda en sus labores. De hecho, Engelke & Engelke (2023: s.p.) enfatizan la importancia del uso de estas tecnologías en clase, ya que argumentan que los alumnos que no se vean impulsados a utilizarlas se verán rezagados frente aquellos que sí aprovechen los beneficios de su uso porque «a major AI service like ChatGPT has the potential to be a great educational tool if utilized well» (Kim 2023: s.p.). ¿Pero qué ocurrirá con los profesores: dejarán de hacer (parte de) su trabajo? ¿Se reducirá plantilla en las instituciones educativas? De ahí surge una creciente preocupación. Ahora bien, la respuesta a esta incógnita tan solo nos la podrá dar el tiempo; así y todo, estudios como el de Loos et al. (2023) concluyen que ChatGPT no es capaz de reemplazar al maestro: «The answers given by ChatGPT seemed correct, but they were also superficial» (2023: 13). La mayoría de participantes de otras investigaciones como la de Alenizi et al. (2023: 17) recomiendan no reemplazar la enseñanza personal y el apoyo individualizado, sino que la IA sirva de suplemento. No se debe olvidar que ChatGPT comete errores ocasionalmente, lo cual podría evitarse con la preeminencia de un profesor. Asimismo, «al menos por ahora, ChatGPT no puede sustituir a la creatividad humana y [a]l pensamiento crítico» (Sabzalieva & Valentini 2023: 14); no es capaz —por lo menos, de momento— de proporcionar «feedback», guiar o animar individualmente a los alumnos, además de carecer de las habilidades que debería tener un profesor como la empatía o la inevitable interacción humana (CE Noticias Financieras 2023: 1-3). Mondal et al. (2023: 204) describen el proceso de aprendizaje como una posible experiencia emocional, en la cual los estudiantes podrían necesitar un profesor que les apoye y oriente. De lo que parece no caber duda es que «the role of humans will change as technology advances» (Kim 2023: s.p.), aunque Baker (2023) es firme en la convicción de que «educators are the ones who move a society forward and enable it to adapt» (s.p.). Otras investigaciones (Sabzalieva & Valentini 2023: 13) sugieren evaluaciones presenciales o l 30 de noviembre de 2022 los humanos nos despertamos con una nueva realidad, con una idea de la que pocos habían oído hablar y que, desde entonces, no para de repetirse en todos los medios e instituciones: ChatGPT había llegado para quedarse, el mayor exponente de la inteligencia artificial (IA) actual. 1. El concepto de ChatGPT El éxito de ChatGPT, un
Wissenschaftliche Artikel/Artículos Científicos Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 26 mundo profesional del docente es el alemán, al tratarse de un idioma cada vez más hablado y, por ende, estudiado; y que, además, en cierta medida, se aleja del constante foco de estudio de lenguas extranjeras que se centra en el inglés. Así, mediante el presente trabajo, se pretende analizar los puntos fuertes y débiles de los exámenes de nivel B1 de alemán que crea ChatGPT con los mismos enunciados que un examen modelo de una Escuela Oficial de Idiomas de España mediante variables cuantitativas y cualitativas por parte de profesores que imparten esta lengua y alumnos o exalumnos que han recibido clases de la misma. La hipótesis previa al estudio es positiva para las TICS, a la vez que negativa para el sector profesional: la autora espera que ChatGPT sea capaz de crear exámenes a partir de instrucciones claras y específicas. Esto podría suponer una reducción del trabajo de los docentes en lo que, hasta ahora, formaba parte de su jornada laboral. No obstante, se parte de la premisa de que habría que revisar las propuestas de ChatGPT, es decir, podría caber la posibilidad de que hubiera que realizar pequeñas modificaciones —teniendo en cuenta que la corrección de los exámenes no debería suponer un mayor consumo de tiempo que el de confeccionarlas—. El método seguido por este estudio es, por orden cronológico, el envío de un cuestionario a profesores y otro similar a alumnos de lengua alemana en niveles educativos superiores. En segundo lugar, se indicarán y analizarán las respuestas recibidas. Por último, se concluirá con los principales hallazgos y con las limitaciones que se han dado en esta investigación y sus circunstancias en concreto. 3. Metodología 3.1. Los cuestionarios Con la finalidad de comparar los resultados que proporciona ChatGPT con los que ha creado un humano, se pidió a esta interfaz la realización de ejercicios similares a los que aparecieron en el examen de la Escuela Oficial de Idiomas de La Rioja en 2022 del nivel B1 de alemán (de acuerdo con el Marco Común Europeo de Referencia para las lenguas MCER), disponible en su sitio web (véase enlace en el «Anexo I»). Se eligió este determinado nivel (y no uno superior) porque una mayor dificultad alargaría el tiempo modificaciones del tipo o del formato de preguntas para aprovechar ChatGPT en las instituciones educativas, en vez de prohibirlo tajantemente. Incluso, Ray (2023: s.p.) recoge diferentes prácticas relacionadas con la docencia que puede llevar a cabo ChatGPT con seguridad, como la enseñanza personalizada mediante materiales y actividades y el apoyo al docente a través de recomendaciones del plan de estudios. En resumen, los estudios mencionados se centran en las capacidades que ChatGPT puede tener a la hora de enseñar; sin embargo, no tienen en cuenta aspectos que también juegan un papel fundamental en esta profesión: la evaluación de la materia que se ha enseñado previamente en el aula. 2. El presente trabajo Ante estas innovaciones recientes se hace necesario investigar de qué manera el profesorado puede aprovechar la IA en la evaluación del alumnado. En este trabajo en concreto, se ha elegido analizar la puesta en práctica de ChatGPT por dos razones en especial: por su popularidad extendida a prácticamente todas las naciones y a todos los grupos de edad y sociales, y por ser la evidente demostración de hasta dónde puede llegar la IA (Ichbiah 2023: s.p.). Es, indudablemente, la aplicación de la IA de la que más han hablado los medios, probablemente, por la incertidumbre que genera y, consecuentemente, por el pánico que puede llegar a causar. Asimismo, se ha trabajado con la versión gratuita de ChatGPT pues, de esta manera, está al alcance de cualquiera, independientemente del nivel socioeconómico del individuo. Hay que tener en cuenta que la versión de pago de ChatGPT tiene un mejor motor (se trata de GPT-4, en vez del modelo GPT-3.5 de la versión gratuita), además de un «acceso prioritario a nuevas funciones» (Fernández 2023: s.p.). Además, este trabajo se centra en la enseñanza de lenguas extranjeras, ya que el desempeño del trabajo de profesores de lenguas extranjeras afecta prácticamente a todas las personas, independientemente de su campo de especialización en el mundo laboral, pues todos aprendemos, hemos aprendido o aprenderemos algún idioma diferente a nuestra lengua materna. En este caso, el posible uso de ChatGPT para evaluar las competencias aprendidas en el aula también afecta al alumnado. Específicamente, la lengua extranjera con la que se va a investigar el desempeño de ChatGPT en el
Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 27 que había creado quién, junto a su debida justificación. Sin embargo, se dirigió, por una parte, un cuestionario a profesores y, por otra parte, otro a alumnos, en el que la diferencia radicaba en las preguntas demográficas, que se explicarán más adelante, en esta misma sección de Metodología. necesario para rellenarlo debidamente. En segundo lugar, tres estudiantes que han cumplimentado la encuesta se encuentran actualmente cursando clases de alemán B1+; de esta manera, se ampliaba el número de participantes del cuestionario. Por último y más importante, ChatGPT se negó, en repetidas ocasiones, a proveer textos de una longitud considerable, propios de niveles superiores a B1. De hecho, como se comentará más adelante, se le tuvo que solicitar que aumentara la extensión de los textos porque, de lo contrario, los participantes de los cuestionarios hubiesen sabido, sin necesidad de reflexión, qué texto había creado ChatGPT y qué otro, la EOI. Adicionalmente, los exámenes para alcanzar los certificados de los niveles a partir del B1 «están regulad[o]s y organizad[o]s por las administraciones educativas de acuerdo a unos principios comunes» (EDUCAGOB s.f.). En consecuencia, dicho nivel se podría considerar el mínimo para poder investigar, ya que cumple ciertos requisitos establecidos por las autoridades españolas. Además, se seleccionó esta determinada Escuela Oficial española de manera aleatoria. De los cinco participantes que han trabajado en una Escuela Oficial de Idiomas en territorio español, dos de ellos se encontraban en Castilla y León, uno en Córdoba, otro en Madrid y un último participante en las Islas Baleares, Cataluña y La Rioja. Únicamente uno de ellos ejercía en el momento en el que se realizó el estudio. La comunicación con ChatGPT fue en español en todo momento. Para cada una de las partes que se solicitaba se iniciaba un nuevo chat para que no hubiese interferencias con el resto de resultados, es decir, se evitó en todo momento que el hilo de la conversación que se estaba manteniendo con ChatGPT pudiese influir en la creación de las nuevas pruebas. En cuanto al procedimiento, se proveía a ChatGPT del enunciado exacto de que constaba cada una de las partes del examen original; seguidamente, se solicitaba que crease una actividad de la misma índole con ese mismo enunciado. En la mayoría de casos, era necesario solicitarle en repetidas ocasiones que alargara el texto o añadiera huecos en blanco o preguntas para igualarlo al ejercicio de la EOI original y que, consecuentemente, la diferencia entre ambos fuera mínima. Ambos cuestionarios, de Formularios de Google, recogían las mismas secciones con las mismas preguntas comparando los exámenes de la EOI y de ChatGPT, en las cuales se debía contestar cuál se creía [ ] Aparte de las preguntas personales, cada una de las partes del cuestionario eran las diferentes secciones del examen: la comprensión de textos escritos, la prueba de mediación escrita en alemán y en español, la producción y coproducción de textos escritos y la producción y coproducción de textos orales. Igualmente, se han descartado la comprensión de textos orales y la prueba de mediación oral, ya que ChatGPT no es capaz de crear contenido multimedia, es decir, audios e infografías respectivamente, las cuales aparecían en el examen seleccionado para la investigación. A la hora de solicitarle dichas secciones, su respuesta fue la siguiente: «Lo siento, pero como modelo de texto, no puedo proporcionar archivos de audio. Sin embargo, puedo ofrecerte transcripciones […]» (OpenAI 2023, 31 de diciembre). Las respuestas cualitativas se han formateado de manera libre, es decir, los participantes podían extenderse en sus justificaciones cuanto quisieran y no estaban obligados a contestar en ningún caso; en otras palabras, las preguntas se contestaban sin un mínimo ni máximo de caracteres de manera voluntaria, ya que se pretendía que cada participante enfocase la respuesta a su manera y sin ninguna idea preconcebida. No obstante, algunos participantes se han limitado a contestar si creían que ChatGPT o la EOI había creado el examen sin explicar el porqué en algunas de las preguntas, lo cual supone una limitación para este trabajo. La investigación tan solo ha tenido Ambos cuestionarios, uno dirigido a profesores y otro a alumnos, comparaban el examen de la EOI y el de ChatGPT.
Wissenschaftliche Artikel/Artículos Científicos Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 28 en cuenta las respuestas de calidad, es decir, las que incluían justificaciones que reflejaban de manera clara una reflexión. Es pertinente aclarar que las instrucciones y las preguntas de ambos cuestionarios se escribieron tanto en español como en inglés, ya que se anticipó la participación de docentes y alumnos que no fuesen exclusivamente de nacionalidad española. Paralelamente, se debe mencionar que no todos los participantes han contestado en el apartado de mediación escrita en español dado que son extranjeros y no entienden el idioma español o sus conocimientos son limitados e insuficientes para responder adecuadamente. En este caso, tan solo se han tenido en cuenta las respuestas de los participantes que entendieron la tarea y la han respondido. Finalmente, se optó por recabar los datos de la investigación por medio de cuestionarios, ya que se trata de una metodología asincrónica, es decir, los participantes pueden responder donde y cuando puedan, además de tomarse el tiempo que consideren necesario. Se debe tener en cuenta que la mayoría de los participantes se encontraban en diferentes lugares de España a la hora de rellenar el formulario o, incluso, otros se hallaban en Alemania o Canadá, por mencionar dos países a modo de ejemplo. Por lo tanto, la flexibilidad fue una prioridad a la hora de optar por este método de investigación. Asimismo, una encuesta aseguraba que constara por escrito el anonimato de los participantes y la única y exclusiva finalidad de los datos proporcionados para el objeto de investigación. En el «Anexo II» se adjunta el cuestionario enviado al profesorado, mientras que el «Anexo III» está dedicado al cuestionario enviado al alumnado, con sus respectivos enlaces. 3.1.1. Cuestionario dirigido al profesorado En primer lugar, es preciso puntualizar que este cuestionario en concreto estuvo disponible a través de un enlace durante enero y febrero de 2024, y que respondieron dieciséis mujeres y cuatro hombres. En un primer momento, se contactó con 82 profesores universitarios en total, mayoritariamente de universidades públicas españolas, aunque también de universidades alemanas y canadienses y de algunas privadas españolas, de forma aleatoria. En un segundo momento, se envió el enlace a las dos responsables de las Áreas de Filología Alemana y de Traducción e Interpretación del Departamento de Filología y Traducción de la Universidad Pablo de Olavide (UPO), con la petición de que hiciesen llegar el enlace a ambas áreas en su conjunto. Cuando esto ocurrió, una de las profesoras, perteneciente a la Asociación de Germanistas de Andalucía (AGA), trasladó la petición de que se rellenase la encuesta a los miembros de dicha asociación. En cuanto al medio de contacto por el cual se envió dicho cuestionario, se trató del correo electrónico. En la mayoría de los casos, no se obtuvo respuesta ninguna por parte de los docentes. Incluso, hubo repuestas de profesores que no se consideraban aptos para dicha investigación por diferentes motivaciones. Todos los encuestados son o han sido profesores de alemán que ejercen o han ejercido su profesión en la universidad, mayoritariamente en el ámbito público (a excepción de tres, que tan solo han puntualizado ejercer en secundaria y bachillerato). Sin embargo, este no es o ha sido necesariamente su único trabajo. En cuanto al país en el que han trabajado, en total, veinticuatro de los participantes alguna vez han desempeñado un empleo en territorio español, aunque cinco han ejercido únicamente en España. A este quinteto se le une un participante, sumando seis en total, que no ha trabajado nunca en un país de habla alemana. En la sección de preguntas personales, también se les preguntó por la incorporación de la IA en sus clases. Prácticamente la mitad de los participantes, doce, nunca la utilizaron por falta de interés, de necesidad, de información y/o de tiempo o de fiabilidad. Una de las participantes contestó que apenas la había utilizado. Once docentes habían utilizado la herramienta a veces y solo dos la utilizaban con frecuencia en o para sus clases. Los usos que más se repiten entre las respuestas son la traducción automática y la creación de materiales, como ejercicios de gramática o de redacción. De entre todos los participantes, catorce comprenden el rango de edad de 50 a 65 años; mientras que once, de 31 a 50. Tan solo uno es menor de 30. 3.1.2. Cuestionario dirigido al alumnado Los participantes totales de este cuestionario fueron doce; la mitad, hombres y la otra mitad, mujeres. El rango de edad comprendía de los 20 a los 26 años. Cinco de los encuestados llevaban más de cinco años aprendiendo el idioma alemán y otros cinco, entre tres y cinco años; mientras que dos, entre uno y dos años. Estos dos últimos, sorprendentemente, no
Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 29 estaban incluidos en los tres que consideraban tener un nivel de B1 en la lengua. También tres participantes consideraban tener un nivel B2; y dos, un C2. Finalmente, cuatro de ellos valoraron su conocimiento en un C1. Con relación a los estudios universitarios que cursaban, ocho participantes estudiaban Grados que incorporan el alemán, como Traducción e Interpretación, mientras que cuatro estudiaban Medicina, aunque habiendo cursado clases de alemán en la universidad en varias ocasiones. El enlace de acceso al cuestionario se distribuyó a través de la aplicación WhatsApp y los mensajes directos de Instagram; estuvo disponible en enero y febrero de 2024. 4. Discusión de los resultados Con la finalidad de analizar los resultados obtenidos en los cuestionarios, se expondrán en gráficos los porcentajes de respuestas correctas e incorrectas de los participantes (además de «NS/NC» (No sabe/ No contesta), lo cual corresponde a todo tipo de ambigüedades) a la hora de reconocer qué exámenes estaban creados por la EOI y qué otros, por ChatGPT, teniendo en cuenta el total de respuestas, es decir, conjuntamente tanto de la encuesta de profesorado como también la de alumnado. Cada figura corresponderá a una sección del examen diferente. Tras exponer los datos cuantitativos, se analizarán las justificaciones que se han dado al respecto. 4.1. Comprensión de textos escritos En todas las partes de «Comprensión de textos escritos», más de la mitad de los participantes ha identificado correctamente si se trataba de una máquina o de un humano (véase Figuras 1, 2 y 3). Además, esta sección contiene un alto número de respuestas y un bajo número de «NS/NC». Probablemente esto se deba a que es la sección inicial. Igualmente, es el apartado con mayor variedad de respuestas, ya que en secciones posteriores algunos participantes han repetido las mismas justificaciones que indicaron en esta sección. Figura 1. Comprensión de textos escritos 1 Figura 2. Comprensión de textos escritos 2 Figura 3. Comprensión de textos escritos 3
Wissenschaftliche Artikel/Artículos Científicos Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 30 4.1.1. Respuestas correctas La mayoría de los participantes que han elegido la opción correcta se han justificado por los errores que comete ChatGPT (ortográficos, gramaticales, de vocabulario e, incluso, incoherencias), sobre todo en la primera tarea de la comprensión escrita, pero también encontramos ejemplos en la parte 3, en la que conviene destacar que las soluciones a los huecos estaban escritas en el propio texto, a continuación del propio hueco. Se debe mencionar que algunos de los que han contestado (erróneamente) que dicho texto era de la EOI se han dado cuenta de estos errores también; sin embargo, han seguido optando por la opción incorrecta, probablemente, por otros matices que han considerado más desventajosos y que se comentarán más adelante. Precisamente, relacionado con dichos errores, uno de los encuestados que ha elegido la opción correcta ha puntualizado que una desventaja de utilizar esta interfaz es que «el proceso de revisión, a veces, resulta más largo que el de búsqueda de textos ya terminados». Paradójicamente a lo comentado en la sección de «Introducción» del presente trabajo, un considerable número de participantes encuentran que el texto de ChatGPT resulta «carente de cohesión», no solo en esta sección, sino que se repite en la mayoría de ellas; algunos añaden que esto es debido a la falta de conectores, lo cual atenta contra uno de los principales objetivos de ChatGPT: la coherencia a la que Ichbiah (2023) aludía, con la que nos hace pensar que se trata de un humano. Otras justificaciones de entre los que distinguieron adecuadamente los autores de los textos son que la prueba de ChatGPT resulta estereotipada a causa de «aspectos muy concretos fáciles de localizar en el texto» o una «típica división en párrafos, cada uno con un título» sin «progresión temática o argumental». Al contrario de la EOI, que desarrolla una historia, la IA «constantemente […] menciona las mismas ideas». Por añadidura, se acusa en diversas ocasiones a la IA de desarrollar el tema de forma muy general. De igual forma, se ha calificado como «demasiado plano», «superficial y trivial», «monótono, con el mismo tipo de frases», de «formulación artificial», «demasiado objetivo y descriptivo» y de «lengua […] neutra». Una de las razones por las que ChatGPT genera este tipo de textos es, según dos participantes, la falta de «adornos literarios que sí están presentes en el otro texto». Además, la EOI ha incluido, según otro par de encuestados, «elementos culturales clave», que ChatGPT ha omitido. Otras calificaciones del texto son simplicidad e, incluso, en una ocasión, brevedad. En el plano léxico, se ha definido como «muy descriptivo y narrativo». Hay quienes consideran que no siempre se ha elegido adecuadamente. Además, un encuestado puntualizaba que una desventaja de los exámenes que crea la IA es que «you don’t have full control of the vocabulary included». Incluso, quienes ya habían observado el modus operandi de ChatGPT en un pasado han remarcado que no suele incluir discurso directo, referencias reales ni utilizar «comillas para proponer expresiones pronunciadas por otras personas». Varios participantes han seguido la línea de uno de ellos, que comentaba: «No me parece posible que un chatbot sea capaz de escribir tan convincentemente tomando el punto de vista de un personaje público y conocido». De hecho, a ChatGPT le delata su impersonalidad, «generalidades y sin ninguna referencia clara a personas o lugares concretos», tan solo «un cúmulo de lugares comunes». Otro usuario añadía que ChatGPT suele presentar la información «a modo de lista o mediante ‘bullet points’ […] teniendo la desventaja de que suele fallar en originalidad». Estos mismos participantes elogiaban los exámenes de la EOI poniendo en valor virtudes, de las cuales consideran que ChatGPT, en consecuencia, carece. Las respuestas, en este caso, eran más unánimes. La que más se repetía eran la mayor dedicación al texto, lo cual se reflejaba en el hecho de que el examinando se vea obligado a invertir un mayor esfuerzo en la comprensión porque «debe tener capacidad de interpretación», de «relacionar unas partes con otras»; de la misma manera que «no está tan focalizado en la comprensión de una sola palabra concreta» y «puede reflejar mejor el grado de comprensión que pueda haber tenido el estudiante o la estudiante», con lo cual «evalúa el contenido». En cambio, la IA escaseaba de «razonamiento lógico, una deducción por contexto o ir un poco más allá de la literalidad» porque «las preguntas se han tomado del texto al pie de la letra y no hay ninguna ‘trampa’». Más de uno añadía que el orden las respuestas de ChatGPT tenía una «conexión muy directa entre el comienzo de cada párrafo y la respuesta que le corresponde». Igualmente, en varias ocasiones se repitió la diferencia de nivel entre el texto y las preguntas de ChatGPT, es decir, la mayor
Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 31 complejidad del texto comparado con la simplicidad de las preguntas. Por añadidura, se destacaba con frecuencia la naturalidad del texto de la EOI: la cercanía «al habla del día a día», «a la realidad y a la persona», con un «registro muy coloquial y cultural» y la espontaneidad. Otros adjetivos que también describen este segundo punto han sido «lebendig» (dinámico) y «humano». Mientras que ChatGPT mostraba una «sencilla y repetitiva estructura y contenido» o un «lenguaje tipo máquina». Incluso, un encuestado que no acertó de quién era el texto afirmaba que el texto de la EOI (que pensaba que era de ChatGPT) «busca gramática correcta según manuales y no tanto con instinto nativo». Otro participante mencionaba que precisamente los «giros lingüísticos» eran los que delataban a la máquina. Otro punto que delataba a la EOI era el ejercicio 0 que se suele escribir al principio a modo de ejemplo para que el estudiante se sitúe y entienda qué se le está pidiendo exactamente, que ChatGPT no incluyó en su examen. Por último, entre las respuestas correctas, los temas de los textos de la EOI se consideraban de actualidad, lo cual no sucedía en el caso de la IA. De entre los que sí reconocieron la autoría de los textos, uno de los participantes acusaba a ChatGPT de sintético, mientras que otro elogiaba a la EOI por eso mismo. 4.1.2. Respuestas erróneas En cambio, los participantes que se equivocaron dudaban en muchos casos y sus argumentos para defender su elección no eran tan sólidos como los de sus compañeros. No obstante, en una respuesta (errónea), se utilizaba «clearly» para indicar la convicción de la respuesta (incorrecta); por lo tanto, no en todos los casos se dudó de la elección, aun cuando esta fue incorrecta. Respecto al léxico, este grupo de participantes creyeron que el examen de la IA era de la EOI por el nivel de vocabulario descrito como variado, «más homogéneo y bastante cercano a los potenciales estudiantes» o «advanced». A diferencia del grupo de respuestas correctas, la relativa sencillez se ha considerado un rasgo positivo. Quienes lo han justificado comentaban que «en ellas [las preguntas] los alumnos no se ven obligados a construir frases completas, sino que solamente deben realizar una tarea de elección múltiple entre tres posibles respuestas». Asimismo, de entre estas respuestas, se resaltaba positivamente la estructura, la claridad, la fluidez y, por extraño que parezca, la cohesión del texto de ChatGPT. De la misma manera, se valoraba positivamente el uso de conectores «habitualmente empleados en los cursos de alemán» y «a variety of advanced grammatical structures». Por lo que se refiere a la generalización y a la división por apartados con su respectivo título, que las respuestas correctas tanto reprochaban, han sido objeto de elogio en este conjunto de contestaciones. Otro punto que un encuestado ha matizado es el uso por parte de ChatGPT de «expresiones típicas que se buscan reconocer en ambientes didácticos», es decir, el uso de conectores compuestos o de verbos junto a preposiciones, que se usan en ciertos niveles y están, por lo tanto, aplicados en el examen. De la EOI, teniendo en cuenta que creían que se trataba de ChatGPT, han criticado el uso de anglicismos y abuso de genitivos, pero, sobre todo, una mayor complejidad y longitud del texto. En último lugar, cinco participantes acusaban a la EOI de falta de un hilo conductor. Uno incluso se dejó engañar y pensaba que «it sounds like if it were a translation of an English text». 4.2. Mediación escrita en alemán En este apartado, las respuestas han sido más breves, comparadas con las de la «Comprensión de textos escritos». A ello se suma que la naturaleza de esta actividad es diferente: de participación más activa por parte del alumnado que realiza la prueba y, por lo tanto, mucho más corta. A pesar de ello, el número de contestaciones correctas continúa siendo más de la mitad.
Wissenschaftliche Artikel/Artículos Científicos Magazin 32 Llabrés Llovet, Celia: ChatGPT en la creación de exámenes de alemán como lengua extranjera Magazin 32, ISSN 1136-677X. 2024/25, pp. 24-38. https://dx.doi.org/10.12795/mAGAzin.2024.i32.03 32 decantado por la opción correcta. En relación a esto, se añadía que la información de la EOI es relevante y clara para realizar el ejercicio, además de haber «más matices, más instrucciones», a la par que se expresa en «frases más comprimidas», mientras que un participante se atrevió a calificar de «infantil» el texto de ChatGPT. 4.2.2. Respuestas erróneas De entre las respuestas incorrectas, por un lado, cuatro han considerado que las mayúsculas a las que se acaba de hacer mención «quitan seriedad y profesionalidad al texto» y no parecen adecuadas en este contexto. Además, consideraban que el «kurz» agravaba la informalidad: «¿por qué ‘kurz’ si ya se indica el número de palabras?». Como resultado, en su conjunto, «las instrucciones finales son indeterminadas y redundantes»; además, opinaban que podía generar confusión: «the exercise isn’t formulated very clearly». En cuanto al léxico, «while both Tipps and Tips may be correct, no person writing would include both spellings in a single sentence». Adicionalmente, dos participantes lo consideraban erróneo: «Uso incoherente de la palabra Tipps (correcto es con dos p)», afirmación que puede interpretarse como que hay quienes relacionan la incoherencia con la autoría de ChatGPT —debe puntualizarse que la palabra con una sola “p” es obsoleta—. Adicionalmente, las respuestas erróneas de la encuesta han considerado que ChatGPT destacaba por claridad y concisión: «students […] are told exactly what to do». Asimismo, encuentran que el tema es alltagsbezogen (sobre el día a día), que «empatiza con el estudiante y traslada la tarea a su mundo cotidiano (ej.: la fiesta de cumpleaños de una amiga)». Finalmente, se ha criticado la elección del tema (puestos de trabajo y el mundo laboral), al tratarse de una «situación [que] no es tan habitual para los estudiantes que a menudo van a las EEOOII; muchos de ellos son todavía adolescentes y están por lo tanto alejados del mundo laboral […]». Sin embargo, este argumento se desvaloriza cuando se lee el siguiente apartado, cuyos exámenes, tanto el de la EOI como el de la IA, tratan precisamente la misma temática. 4.3. Mediación escrita en español En esta sección, la cifra de respuestas correctas disminuye a poco menos de la mitad, mientras que la de Figura 4. Mediación escrita en alemán 4.2.1. Respuestas correctas Entre las respuestas correctas, se comentaba que ChatGPT era de «frases demasiado largas» y, aun siendo un fragmento breve, dos participantes han identificado errores en el texto que produjo la IA. Los puntos nuevos que aportan cuatro encuestados que han identificado con éxito la autoría de los textos son el hecho de que no se trata de un ejercicio de mediación verdaderamente: «No se cumple el objetivo de la mediación (aclarar/explicar/resumir una idea de un texto en un idioma a otro). Aquí, ChatGPT pide una redacción». Por tanto, la máquina carece, claramente, de adecuación en el caso de la mediación en alemán. Por el contrario, el texto de la EOI «permite al alumno expresar ideas originales y mostrar conocimientos en un área más especializada», lo cual «busca una implicación más personal [u] original». La mayor ventaja que parecía mostrar el examen de la EOI era una anotación al final en mayúsculas: «Schreiben Sie ihr eine E-Mail (100-120 Wörter), in der Sie ihr KURZ DAS WICHTIGSTE erklären». Seis participantes han destacado este rasgo como el mayor indicador de que «se percibe una mano humana reparando o previniendo problemas que ya ha vivido en otras ocasiones previas». A diferencia de las demás respuestas correctas, dos participantes (que, además, habían contestado correctamente en todas las partes de la sección anterior) admitían que, esta vez, les parecía más difícil que en la «Comprensión de textos escritos» identificar a ChatGPT. Sin embargo, ha sido la ya mencionada anotación en mayúsculas al final la razón por la que uno de ellos se ha