REACH Investigators2026-10-012026-10-012026-04REACH Investigators 2026, 'Large language models for automated and audience-tailored labeling of latent classes', JAMIA Open, vol. 9, no. 2, ooag058. https://doi.org/10.1093/jamiaopen/ooag0582574-2531PubMedCentral: PMC13127414https://hdl.handle.net/10641/8444Publisher Copyright: © The Author(s) 2026. Published by Oxford University Press on behalf of the American Medical Informatics Association. This is an Open Access article distributed under the terms of the Creative Commons Attribution License (https://creativecommons.org/licenses/by/4.0/), which permits unrestricted reuse, distribution, and reproduction in any medium, provided the original work is properly cited.Objetivo: Este estudio compara múltiples LLM, incluyendo ChatGPT, DeepSeek y Llama, para generar etiquetas significativas y adaptadas a la audiencia para las clases latentes existentes entre pacientes con dolor lumbar crónico (cLBP). Métodos: Los fenotipos se derivaron de datos basales de dos cohortes dentro del consorcio NIH HEAL BACPAC: BACKHOME, una gran e-cohorte nacional (conjunto de entrenamiento: N = 3025), y COMEBACK, una cohorte de fenotipado profundo (conjunto de prueba: N = 450). El análisis incluyó características del dolor, factores psicosociales, hábitos de estilo de vida y determinantes sociales de la salud. Se aplicaron ChatGPT-4o (OpenAI), DeepSeek-R1 y Llama 3.3 (Meta) para generar etiquetas de clase para cada combinación de audiencia (clínico, paciente y cuidador), tono (formal, empático e informal) y tecnicidad (alta, media y baja). Resultados: El modelo de clases latentes (LCM) identificó cuatro fenotipos conductuales distintos en pacientes con cLBP: Alta Angustia y Conductas Desadaptativas, Afrontamiento Resiliente y Adaptativo, Patrones Desadaptativos Intermedios, y Regulación Emocional con Alta Carga de Dolor. Previamente validados por expertos del dominio, estos perfiles sirvieron de base para el etiquetado automatizado utilizando tres LLM (ChatGPT-4o, DeepSeek-R1 y Llama 3.3). Utilizando diferentes tonos y niveles de complejidad, cada modelo produjo etiquetas de clase específicas para clínicos, pacientes y cuidadores. Los nombres de clase generados por todos los LLM coincidieron estrechamente con los rasgos definidos por los expertos, como la regulación emocional, la resiliencia y la alta angustia, lo que indica una fuerte alineación conceptual y la capacidad de los LLM para generar etiquetas precisas y específicas para la audiencia en perfiles conductuales y psicológicos complejos. Conclusiones: Estos resultados destacan la posibilidad de integrar el etiquetado impulsado por LLM en la investigación y la práctica clínica, ayudando a lograr una traducción del conocimiento más transparente, una mejor toma de decisiones y una atención personalizada. [Traducción automática al español; idioma original: inglés.]Objective: This study compares multiple LLMs, including ChatGPT, DeepSeek, and Llama, to generate meaningful, audience-adapted labels for the existing latent classes among patients with chronic low back pain (cLBP). Methods: Phenotypes were derived from baseline data from two cohorts within the NIH HEAL BACPAC consortium: BACKHOME, a large nationwide e-cohort (train set: N = 3025), and COMEBACK, a deep phenotyping cohort (test set: N = 450). The analysis included pain characteristics, psychosocial factors, lifestyle habits, and social determinants of health. ChatGPT-4o (OpenAI), DeepSeek-R1, and Llama 3.3 (Meta) were applied to generate class labels for each combination of audience (clinician, patient, and caregiver), tone (formal, empathetic, and informal), and technicality (high, medium, and low). Results: Latent Class Model (LCM) identified four distinct behavioral phenotypes in patients with cLBP: High Distress and Maladaptive Behaviors, Resilient and Adaptive Coping, Intermediate Maladaptive Patterns, and Emotionally Regulated with High Pain Burden. Previously validated by domain experts, these profiles served as the basis for automated labeling using three LLMs (ChatGPT-4o, DeepSeek-R1, and Llama 3.3). Using different tones and complexity levels, each model produced class labels specific to clinicians, patients, and caregivers. The generated class names for all LLMs closely matched expert-defined traits like emotional regulation, resilience, and high distress, indicating strong conceptual alignment and the capacity of LLMs to generate precise, audience-specific labels for intricate behavioral and psychological profiles. Conclusions: These results highlight the possibility of integrating LLM-driven labeling into research and clinical practice, helping to achieve more transparent knowledge translation, improved decision-making, and personalized care.101361569enghttp://creativecommons.org/licenses/by-nc-nd/4.0/LLaMA-3LangChainLarge language models (LLMs)Latent Class Model (LCM)artificial intelligence (AI)chronic low back pain (cLBP)orthopedic surgeryretrieval-augmented generation (RAG)Health InformaticsSDG 3 - Good Health and Well-beingJournal ArticleYesLarge language models for automated and audience-tailored labeling of latent classesModelos de lenguaje grandes para el etiquetado automatizado y adaptado a la audiencia de clases latentesjournal articleopen access10.1093/jamiaopen/ooag058https://www.scopus.com/pages/publications/105039396691https://www.scopus.com/pages/publications/105039396691#tab=citedBy