Explainable Machine Learning to Understand the Social and Biological Determinants of Type 2 Diabetes in Mexico.

Introduction. Type 2 diabetes mellitus (T2DM) is a multifactorial disease associated not only with clinical factors but also with social determinants such as income, education, and access to healthcare. Its global prevalence continues to rise, particularly in low- and middle-income countries, making...

Descripción completa

Detalles Bibliográficos
Publicado en:Revista de Investigación e Innovación en Ciencias de la Salud (RIICS) Vol. 8; no. 2; pp. 1 - 16
Autores principales: Daniel Cervantes-Guerrero, Mario, Galván-Tejada, Carlos E., Cruz, Miguel, Galván-Tejada, Jorge I., Barros, Rodrigo C., Kupssinskü, Lucas
Formato: research tables/charts Journal Article
Publicado: Fundacion Universitaria Maria Cano 2026
Acceso en línea:Ver este registro en EBSCOhost
fields @attributes:
  recordID: 1
pdfLink:
plink: https://search.ebscohost.com/login.aspx?direct=true&db=ccm&AN=197034453&site=ehost-live
header:
  @attributes:
    shortDbName: ccm
    uiTerm: 197034453
    longDbName: CINAHL Complete
    uiTag: AN
  controlInfo:
    bkinfo:
    dissinfo:
    jinfo:
      jid:
        26652056
        MLN5
      jtl: Revista de Investigación e Innovación en Ciencias de la Salud (RIICS)
      issn: 26652056
      maglogo: N
    pubinfo:
      dt: 2026
      vid: 8
      iid: 2
      pid: 58645
      pub: Fundacion Universitaria Maria Cano
    artinfo:
      ui:
        197034453
        197034453
        197034453
        10.46634/riics.535
        197034453
      ppf: 1
      ppct: 15
      formats:
        fmt:
          @attributes:
            type: P
      tig:
        atl: Explainable Machine Learning to Understand the Social and Biological Determinants of Type 2 Diabetes in Mexico.
      aug:
        au:
          Daniel Cervantes-Guerrero, Mario
          Galván-Tejada, Carlos E.
          Cruz, Miguel
          Galván-Tejada, Jorge I.
          Barros, Rodrigo C.
          Kupssinskü, Lucas
        affil: Unidad Académica de Ingeniería Eléctrica, Universidad Autónoma de Zacatecas, Zacatecas, Mexico
      sug:
        subj:
          Diabetes Mellitus Risk Factors
          Risk Assessment
          Social Determinants of Health Evaluation
          Machine Learning Utilization
          Prediction Models
          Socioeconomic Factors Evaluation
          Predictive Validity Evaluation
          Human
          Male
          Female
          Adult
          Middle Age
          Aged
          Aged, 80 and Over
          Cross Sectional Studies
          Prospective Studies
          Mexico
          Diabetes Mellitus Epidemiology
          Logistic Regression
          Support Vector Machine
          Decision Trees
          Random Forest
          Boosting Machine Learning Algorithms
          Blood Glucose Analysis
          Blood Pressure
          Age Factors
          Income
          Educational Status
          Tertiary Health Care
          Anthropometry
          Sphygmomanometers
          Multivariate Analysis
          ROC Curve
          Correlational Studies
          Body Mass Index
          Decision Support Techniques
          Descriptive Statistics
          Adult: 19-44 years
          Middle Aged: 45-64 years
          Aged: 65+ years
          Aged, 80 & over
          Male
          Female
      ab:
        Introduction. Type 2 diabetes mellitus (T2DM) is a multifactorial disease associated not only with clinical factors but also with social determinants such as income, education, and access to healthcare. Its global prevalence continues to rise, particularly in low- and middle-income countries, making early detection and equitable management a public health priority. Objective. To evaluate and interpret the performance of machine learning models that incorporate both clinical and socioeconomic data to predict the presence of type 2 diabetes in a Mexican population. Methods. A dataset including 898 diabetic patients and 889 non-diabetic individuals randomly selected from the Hospital de Especialidades Siglo XXI (IMSS, Mexico City) was analyzed. Ten supervised algorithms (logistic regression, SVM, decision tree, random forest, KNN, naive bayes, AdaBoost, LightGBM, CatBoost, and XGBoost) were trained and validated using stratified 10-fold cross-validation. Data preprocessing included multiple imputation by chained equations (MICE), normalization, and encoding of categorical variables. Model interpretability was evaluated using SHapley Additive exPlanations (SHAP) to identify the most influential predictors. Results. Ensemble methods, particularly XGBoost and LightGBM, achieved the best performance (accuracy = 0.94, AUC > 0.95). Glucose, diastolic blood pressure, and age were the strongest predictors, while socioeconomic variables such as income and education contributed additional predictive value. The integration of contextual variables improved model interpretability without reducing accuracy. Conclusions. Explainable machine learning models integrating both clinical and socioeconomic data can enhance diagnostic precision and promote equity in diabetes detection. These tools offer potential applications in public health programs, facilitating the early identification of at-risk populations and supporting more equitable prevention and care strategies.
        Introducción. La diabetes mellitus tipo 2 (DM2) es una enfermedad multifactorial asociada no solo a factores clínicos, sino también a determinantes sociales como el ingreso, la educación y el acceso a los servicios de salud. Su prevalencia global continúa en aumento, especialmente en países de ingresos bajos y medios, lo que convierte su detección temprana y su manejo equitativo en una prioridad de salud pública. Objetivo. Evaluar e interpretar el desempeño de modelos de aprendizaje automático que integran datos clínicos y socioeconómicos para predecir la presencia de diabetes tipo 2 en una población mexicana. Método. Se analizó un conjunto de datos conformado por 898 pacientes con diabetes y 889 individuos no diabéticos seleccionados aleatoriamente del Hospital de Especialidades Siglo XXI (IMSS, Ciudad de México). Se entrenaron y validaron diez algoritmos supervisados (regresión logística, SVM, árbol de decisión, bosque aleatorio, KNN, naive Bayes, AdaBoost, LightGBM, CatBoost y XGBoost) mediante validación cruzada estratificada de 10 pliegues. El preprocesamiento incluyó imputación múltiple por ecuaciones encadenadas (MICE), normalización y codificación de variables categóricas. La interpretabilidad del modelo se analizó mediante SHapley Additive exPlanations (SHAP) para identificar los predictores más influyentes. Resultados. Los métodos de ensamble, particularmente XGBoost y LightGBM, mostraron el mejor desempeño (exactitud = 0.94, AUC > 0.95). La glucosa, la presión arterial diastólica y la edad fueron los predictores más relevantes, mientras que las variables socioeconómicas como ingreso y educación aportaron valor predictivo complementario. La integración de variables contextuales mejoró la interpretabilidad sin comprometer el rendimiento predictivo. Conclusiones. Los modelos explicables de aprendizaje automático que integran información clínica y socioeconómica pueden mejorar la precisión diagnóstica y promover la equidad en la detección de la diabetes. Estas herramientas ofrecen un alto potencial para su aplicación en programas de salud pública, facilitando la identificación temprana de poblaciones en riesgo y fortaleciendo estrategias de prevención y atención más equitativas.
      pubtype: Academic Journal
      doctype:
        research
        tables/charts
        Journal Article
      ougenre: Article
    language: English
    refInfo:
    holdings:
      @attributes:
        islocal: N