Explainable Machine Learning to Understand the Social and Biological Determinants of Type 2 Diabetes in Mexico.
Introduction. Type 2 diabetes mellitus (T2DM) is a multifactorial disease associated not only with clinical factors but also with social determinants such as income, education, and access to healthcare. Its global prevalence continues to rise, particularly in low- and middle-income countries, making...
| Publicado en: | Revista de Investigación e Innovación en Ciencias de la Salud (RIICS) Vol. 8; no. 2; pp. 1 - 16 |
|---|---|
| Autores principales: | , , , , , |
| Formato: | research tables/charts Journal Article |
| Publicado: |
Fundacion Universitaria Maria Cano
2026
|
| Acceso en línea: | Ver este registro en EBSCOhost |
| fields | @attributes: recordID: 1 pdfLink: plink: https://search.ebscohost.com/login.aspx?direct=true&db=ccm&AN=197034453&site=ehost-live header: @attributes: shortDbName: ccm uiTerm: 197034453 longDbName: CINAHL Complete uiTag: AN controlInfo: bkinfo: dissinfo: jinfo: jid: 26652056 MLN5 jtl: Revista de Investigación e Innovación en Ciencias de la Salud (RIICS) issn: 26652056 maglogo: N pubinfo: dt: 2026 vid: 8 iid: 2 pid: 58645 pub: Fundacion Universitaria Maria Cano artinfo: ui: 197034453 197034453 197034453 10.46634/riics.535 197034453 ppf: 1 ppct: 15 formats: fmt: @attributes: type: P tig: atl: Explainable Machine Learning to Understand the Social and Biological Determinants of Type 2 Diabetes in Mexico. aug: au: Daniel Cervantes-Guerrero, Mario Galván-Tejada, Carlos E. Cruz, Miguel Galván-Tejada, Jorge I. Barros, Rodrigo C. Kupssinskü, Lucas affil: Unidad Académica de Ingeniería Eléctrica, Universidad Autónoma de Zacatecas, Zacatecas, Mexico sug: subj: Diabetes Mellitus Risk Factors Risk Assessment Social Determinants of Health Evaluation Machine Learning Utilization Prediction Models Socioeconomic Factors Evaluation Predictive Validity Evaluation Human Male Female Adult Middle Age Aged Aged, 80 and Over Cross Sectional Studies Prospective Studies Mexico Diabetes Mellitus Epidemiology Logistic Regression Support Vector Machine Decision Trees Random Forest Boosting Machine Learning Algorithms Blood Glucose Analysis Blood Pressure Age Factors Income Educational Status Tertiary Health Care Anthropometry Sphygmomanometers Multivariate Analysis ROC Curve Correlational Studies Body Mass Index Decision Support Techniques Descriptive Statistics Adult: 19-44 years Middle Aged: 45-64 years Aged: 65+ years Aged, 80 & over Male Female ab: Introduction. Type 2 diabetes mellitus (T2DM) is a multifactorial disease associated not only with clinical factors but also with social determinants such as income, education, and access to healthcare. Its global prevalence continues to rise, particularly in low- and middle-income countries, making early detection and equitable management a public health priority. Objective. To evaluate and interpret the performance of machine learning models that incorporate both clinical and socioeconomic data to predict the presence of type 2 diabetes in a Mexican population. Methods. A dataset including 898 diabetic patients and 889 non-diabetic individuals randomly selected from the Hospital de Especialidades Siglo XXI (IMSS, Mexico City) was analyzed. Ten supervised algorithms (logistic regression, SVM, decision tree, random forest, KNN, naive bayes, AdaBoost, LightGBM, CatBoost, and XGBoost) were trained and validated using stratified 10-fold cross-validation. Data preprocessing included multiple imputation by chained equations (MICE), normalization, and encoding of categorical variables. Model interpretability was evaluated using SHapley Additive exPlanations (SHAP) to identify the most influential predictors. Results. Ensemble methods, particularly XGBoost and LightGBM, achieved the best performance (accuracy = 0.94, AUC > 0.95). Glucose, diastolic blood pressure, and age were the strongest predictors, while socioeconomic variables such as income and education contributed additional predictive value. The integration of contextual variables improved model interpretability without reducing accuracy. Conclusions. Explainable machine learning models integrating both clinical and socioeconomic data can enhance diagnostic precision and promote equity in diabetes detection. These tools offer potential applications in public health programs, facilitating the early identification of at-risk populations and supporting more equitable prevention and care strategies. Introducción. La diabetes mellitus tipo 2 (DM2) es una enfermedad multifactorial asociada no solo a factores clínicos, sino también a determinantes sociales como el ingreso, la educación y el acceso a los servicios de salud. Su prevalencia global continúa en aumento, especialmente en países de ingresos bajos y medios, lo que convierte su detección temprana y su manejo equitativo en una prioridad de salud pública. Objetivo. Evaluar e interpretar el desempeño de modelos de aprendizaje automático que integran datos clínicos y socioeconómicos para predecir la presencia de diabetes tipo 2 en una población mexicana. Método. Se analizó un conjunto de datos conformado por 898 pacientes con diabetes y 889 individuos no diabéticos seleccionados aleatoriamente del Hospital de Especialidades Siglo XXI (IMSS, Ciudad de México). Se entrenaron y validaron diez algoritmos supervisados (regresión logística, SVM, árbol de decisión, bosque aleatorio, KNN, naive Bayes, AdaBoost, LightGBM, CatBoost y XGBoost) mediante validación cruzada estratificada de 10 pliegues. El preprocesamiento incluyó imputación múltiple por ecuaciones encadenadas (MICE), normalización y codificación de variables categóricas. La interpretabilidad del modelo se analizó mediante SHapley Additive exPlanations (SHAP) para identificar los predictores más influyentes. Resultados. Los métodos de ensamble, particularmente XGBoost y LightGBM, mostraron el mejor desempeño (exactitud = 0.94, AUC > 0.95). La glucosa, la presión arterial diastólica y la edad fueron los predictores más relevantes, mientras que las variables socioeconómicas como ingreso y educación aportaron valor predictivo complementario. La integración de variables contextuales mejoró la interpretabilidad sin comprometer el rendimiento predictivo. Conclusiones. Los modelos explicables de aprendizaje automático que integran información clínica y socioeconómica pueden mejorar la precisión diagnóstica y promover la equidad en la detección de la diabetes. Estas herramientas ofrecen un alto potencial para su aplicación en programas de salud pública, facilitando la identificación temprana de poblaciones en riesgo y fortaleciendo estrategias de prevención y atención más equitativas. pubtype: Academic Journal doctype: research tables/charts Journal Article ougenre: Article language: English refInfo: holdings: @attributes: islocal: N |
|---|