Benefits of Chain-of-Thought Prompting for Clinical Record Rubric Evaluation in Undergraduate Medical Education : Experimental Evaluation Study With Medical Faculty
Identifiers
Publication date
Start date of the public exhibition period
End date of the public exhibition period
Advisors
Journal Title
Journal ISSN
Volume Title
Publisher
Share
Abstract
Antecedentes: Los modelos de lenguaje grandes en inteligencia artificial han estado entre las herramientas con un impacto significativo y real en la vida diaria de las personas. En este sentido, sirven como apoyo en campos específicos, como la educación, ayudando a los educadores con tareas engorrosas como las evaluaciones periódicas. Objetivo: Este estudio se centró en analizar los beneficios de los modelos de lenguaje grandes, particularmente la estrategia de cadena de pensamiento (CoT), para la tarea de evaluar la redacción de historias clínicas en español por parte de estudiantes. El objetivo fue doble: primero, intentamos ahorrar tiempo y recursos, y segundo, utilizamos el razonamiento de la estrategia CoT para evaluar las rúbricas y sus interpretaciones. Métodos: La solución propuesta evaluó la aplicación de 2 modelos—Llama 3.1 y Claude 3.5—en combinación con one-shot y CoT para evaluar cómo los estudiantes de medicina escriben historias clínicas en español. Primero, se aplicaron métricas de aprendizaje automático para medir el rendimiento de las soluciones. Luego, se realizaron diferentes análisis estadísticos a nivel de historia clínica y de ítem. Finalmente, se estudió en profundidad las diferencias entre los modelos propuestos y los evaluadores. Resultados: Se evaluó un máximo de 3807 ítems. Claude obtuvo la mejor precisión con ligeras diferencias entre one-shot y CoT (86,4 % y 85,0 %, respectivamente). Sin embargo, Claude con CoT superó al resto de las combinaciones en todas las métricas complementarias, alcanzando inicialmente una sensibilidad del 94,2 %, especificidad del 59,5 %, precisión del 85,8 % y puntuación F1 del 89,6 %. La revisión experta del razonamiento de CoT determinó que el 63,8 % de las discrepancias fueron aciertos del modelo, elevando la precisión final de Claude al 94,6 % (DE 4,3 %). En la fase final, la sensibilidad fue del 98,0 % (DE 2,3 %), la especificidad mejoró al 83,3 % (DE 14,3 %) y la puntuación F1 alcanzó el 96,2 % (DE 3,3 %). El análisis por secciones mostró mayores dificultades en la sección «Historia de la enfermedad actual» (n=125 discordancias). Conclusiones: CoT demostró un fuerte potencial para apoyar la evaluación de historias clínicas escritas en español por estudiantes de medicina y proporcionarles retroalimentación. Más importante aún, mostró una promesa significativa para asistir a los profesores al evaluar la calidad de sus rúbricas e identificar posibles errores. [Traducción automática al español; idioma original: inglés.]



