JorGPT : Instructor-Aided Grading of Programming Assignments with Large Language Models (LLMs)
Identifiers
Publication date
Start date of the public exhibition period
End date of the public exhibition period
Advisors
Journal Title
Journal ISSN
Volume Title
Publisher
Share
Abstract
Este artículo explora la aplicación de grandes modelos de lenguaje (LLM) para automatizar la evaluación de trabajos de programación en una asignatura de grado de «Introducción a la Programación». Este estudio aborda los desafíos de la corrección manual, incluidas las limitaciones de tiempo y las posibles inconsistencias, proponiendo un sistema que integra varios LLM para agilizar el proceso de evaluación. El sistema utiliza una interfaz gráfica para procesar las entregas de los estudiantes, lo que permite a los profesores seleccionar un LLM y personalizar la rúbrica de calificación. Un análisis comparativo, utilizando LLM de OpenAI, Google, DeepSeek y ALIBABA para evaluar las entregas de código de los estudiantes, reveló una fuerte correlación entre las calificaciones generadas por los LLM y las asignadas por los profesores humanos. En concreto, el modelo reducido que utiliza variables estadísticamente significativas demuestra un alto poder explicativo, con una R2 ajustada de 0,9156 y un Error Absoluto Medio de 0,4579, lo que indica que los LLM pueden replicar eficazmente la corrección humana. Los hallazgos sugieren que los LLM pueden automatizar la corrección cuando se combinan con supervisión humana, reduciendo drásticamente la carga de trabajo del profesorado, transformando una tarea estimada en más de 300 h de trabajo manual en menos de 15 min de procesamiento automatizado y mejorando la eficiencia y la coherencia de la evaluación en la educación en informática. [Traducción automática al español; idioma original: inglés.]


