Benefits of Chain-of-Thought Prompting for Clinical Record Rubric Evaluation in Undergraduate Medical Education : Experimental Evaluation Study With Medical Faculty

Loading...
Thumbnail Image
Identifiers

Publication date

Start date of the public exhibition period

End date of the public exhibition period

Advisors

Journal Title

Journal ISSN

Volume Title

Publisher

Metrics
Google Scholar
Share
Export

Research Projects

Organizational Units

Journal Issue

Abstract

Antecedentes: Los modelos de lenguaje grandes en inteligencia artificial han estado entre las herramientas con un impacto significativo y real en la vida diaria de las personas. En este sentido, sirven como apoyo en campos específicos, como la educación, ayudando a los educadores con tareas engorrosas como las evaluaciones periódicas. Objetivo: Este estudio se centró en analizar los beneficios de los modelos de lenguaje grandes, particularmente la estrategia de cadena de pensamiento (CoT), para la tarea de evaluar la redacción de historias clínicas en español por parte de estudiantes. El objetivo fue doble: primero, intentamos ahorrar tiempo y recursos, y segundo, utilizamos el razonamiento de la estrategia CoT para evaluar las rúbricas y sus interpretaciones. Métodos: La solución propuesta evaluó la aplicación de 2 modelos—Llama 3.1 y Claude 3.5—en combinación con one-shot y CoT para evaluar cómo los estudiantes de medicina escriben historias clínicas en español. Primero, se aplicaron métricas de aprendizaje automático para medir el rendimiento de las soluciones. Luego, se realizaron diferentes análisis estadísticos a nivel de historia clínica y de ítem. Finalmente, se estudió en profundidad las diferencias entre los modelos propuestos y los evaluadores. Resultados: Se evaluó un máximo de 3807 ítems. Claude obtuvo la mejor precisión con ligeras diferencias entre one-shot y CoT (86,4 % y 85,0 %, respectivamente). Sin embargo, Claude con CoT superó al resto de las combinaciones en todas las métricas complementarias, alcanzando inicialmente una sensibilidad del 94,2 %, especificidad del 59,5 %, precisión del 85,8 % y puntuación F1 del 89,6 %. La revisión experta del razonamiento de CoT determinó que el 63,8 % de las discrepancias fueron aciertos del modelo, elevando la precisión final de Claude al 94,6 % (DE 4,3 %). En la fase final, la sensibilidad fue del 98,0 % (DE 2,3 %), la especificidad mejoró al 83,3 % (DE 14,3 %) y la puntuación F1 alcanzó el 96,2 % (DE 3,3 %). El análisis por secciones mostró mayores dificultades en la sección «Historia de la enfermedad actual» (n=125 discordancias). Conclusiones: CoT demostró un fuerte potencial para apoyar la evaluación de historias clínicas escritas en español por estudiantes de medicina y proporcionarles retroalimentación. Más importante aún, mostró una promesa significativa para asistir a los profesores al evaluar la calidad de sus rúbricas e identificar posibles errores. [Traducción automática al español; idioma original: inglés.]

Doctoral program

Description

Publisher Copyright: © Alberto Nogales, Sophia Denizon, Alonso Mateos Rodriguez, Javier Cervera Cordero, Gonzalo Pandelet Barainca, Enrique Aranguren Moliner, Emilio Cervera Barba.

Citation

Nogales, A, Denizon, S, Mateos Rodriguez, A, Cervera Cordero, J, Pandelet Barainca, G, Aranguren Moliner, E & Cervera Barba, E 2026, 'Benefits of Chain-of-Thought Prompting for Clinical Record Rubric Evaluation in Undergraduate Medical Education : Experimental Evaluation Study With Medical Faculty', JMIR Medical Education, vol. 12, e88652. https://doi.org/10.2196/88652