Nogales, AlbertoDenizon, SophiaMateos Rodriguez, AlonsoCervera Cordero, JavierPandelet Barainca, GonzaloAranguren Moliner, EnriqueCervera Barba, Emilio2026-09-302026-09-302026Nogales, A, Denizon, S, Mateos Rodriguez, A, Cervera Cordero, J, Pandelet Barainca, G, Aranguren Moliner, E & Cervera Barba, E 2026, 'Benefits of Chain-of-Thought Prompting for Clinical Record Rubric Evaluation in Undergraduate Medical Education : Experimental Evaluation Study With Medical Faculty', JMIR Medical Education, vol. 12, e88652. https://doi.org/10.2196/886522369-3762PubMedCentral: PMC13395432https://hdl.handle.net/10641/8384Publisher Copyright: © Alberto Nogales, Sophia Denizon, Alonso Mateos Rodriguez, Javier Cervera Cordero, Gonzalo Pandelet Barainca, Enrique Aranguren Moliner, Emilio Cervera Barba.Antecedentes: Los modelos de lenguaje grandes en inteligencia artificial han estado entre las herramientas con un impacto significativo y real en la vida diaria de las personas. En este sentido, sirven como apoyo en campos específicos, como la educación, ayudando a los educadores con tareas engorrosas como las evaluaciones periódicas. Objetivo: Este estudio se centró en analizar los beneficios de los modelos de lenguaje grandes, particularmente la estrategia de cadena de pensamiento (CoT), para la tarea de evaluar la redacción de historias clínicas en español por parte de estudiantes. El objetivo fue doble: primero, intentamos ahorrar tiempo y recursos, y segundo, utilizamos el razonamiento de la estrategia CoT para evaluar las rúbricas y sus interpretaciones. Métodos: La solución propuesta evaluó la aplicación de 2 modelos—Llama 3.1 y Claude 3.5—en combinación con one-shot y CoT para evaluar cómo los estudiantes de medicina escriben historias clínicas en español. Primero, se aplicaron métricas de aprendizaje automático para medir el rendimiento de las soluciones. Luego, se realizaron diferentes análisis estadísticos a nivel de historia clínica y de ítem. Finalmente, se estudió en profundidad las diferencias entre los modelos propuestos y los evaluadores. Resultados: Se evaluó un máximo de 3807 ítems. Claude obtuvo la mejor precisión con ligeras diferencias entre one-shot y CoT (86,4 % y 85,0 %, respectivamente). Sin embargo, Claude con CoT superó al resto de las combinaciones en todas las métricas complementarias, alcanzando inicialmente una sensibilidad del 94,2 %, especificidad del 59,5 %, precisión del 85,8 % y puntuación F1 del 89,6 %. La revisión experta del razonamiento de CoT determinó que el 63,8 % de las discrepancias fueron aciertos del modelo, elevando la precisión final de Claude al 94,6 % (DE 4,3 %). En la fase final, la sensibilidad fue del 98,0 % (DE 2,3 %), la especificidad mejoró al 83,3 % (DE 14,3 %) y la puntuación F1 alcanzó el 96,2 % (DE 3,3 %). El análisis por secciones mostró mayores dificultades en la sección «Historia de la enfermedad actual» (n=125 discordancias). Conclusiones: CoT demostró un fuerte potencial para apoyar la evaluación de historias clínicas escritas en español por estudiantes de medicina y proporcionarles retroalimentación. Más importante aún, mostró una promesa significativa para asistir a los profesores al evaluar la calidad de sus rúbricas e identificar posibles errores. [Traducción automática al español; idioma original: inglés.]Background: Large language models in artificial intelligence have been among the tools with a significant and real impact on people’s daily lives. In this regard, they serve as an aid in specific fields, such as education, helping educators with cumbersome tasks such as periodic evaluations. Objective: This study focused on analyzing the benefits of large language models, particularly the chain-of-thought (CoT) strategy, for the task of evaluating students’ Spanish-language medical record writing. The aim was 2-fold: first, we attempted to save time and resources, and second, we used the reasoning of the CoT strategy to evaluate the rubrics and their interpretations. Methods: The proposed solution assessed the application of 2 models—Llama 3.1 and Claude 3.5—in combination with one-shot and CoT to evaluate how medical students write medical records in Spanish. First, machine learning metrics were applied to measure the performance of the solutions. Then, different statistical analyses were performed at the clinical record and item levels. Finally, differences between the proposed models and evaluators were studied in depth. Results: A maximum of 3807 items were evaluated. Claude obtained the best accuracy with slight differences between one-shot and CoT (86.4% and 85.0%, respectively). However, Claude with CoT outperformed the rest of the combinations on all complementary metrics, initially achieving a sensitivity of 94.2%, specificity of 59.5%, precision of 85.8%, and F1-score of 89.6%. Expert review of CoT reasoning determined that 63.8% of the discrepancies were model hits, raising Claude’s final accuracy to 94.6% (SD 4.3%). In the final phase, sensitivity was 98.0% (SD 2.3%), specificity improved to 83.3% (SD 14.3%), and F1-score reached 96.2% (SD 3.3%). Sectional analysis showed greater difficulties in the “History of present illness” section (n=125 discordances). Conclusions: CoT demonstrated strong potential for supporting the evaluation of clinical records written in Spanish by medical students and providing feedback to them. More importantly, it showed significant promise in assisting professors by assessing the quality of their rubrics and identifying possible errors.175274339enghttp://creativecommons.org/licenses/by-nc-nd/4.0/chain-of-thoughtclinical competenceformative feedbacklarge language modelsmedical recordsmedical studentsJournal ArticleYesBenefits of Chain-of-Thought Prompting for Clinical Record Rubric Evaluation in Undergraduate Medical Education : Experimental Evaluation Study With Medical FacultyBeneficios del Prompting de Cadena de Pensamiento para la Evaluación de Rúbricas en Registros Clínicos en la Educación Médica de PregradoEstudio de evaluación experimental con la facultad de medicinajournal articleopen access10.2196/88652https://www.scopus.com/pages/publications/105048302541https://www.scopus.com/pages/publications/105048302541#tab=citedBy