[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-121440-en":3,"doc-seo-121440-105":30,"detail-sidebar-cat-0-en-105":91},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":20,"is_downloadable":20,"audit_status":20,"page_count":21,"language":22,"language_code":23,"site_id":24,"html_lang":23,"table_of_contents":25,"faqs":26,"seo_title":27,"seo_description":14,"update_tm":28,"read_time":29},121440,962075114101,"Seraphina","https://ap-avatar.wpscdn.com/avatar/e000253a75eb197efd?x-image-process=image/resize,m_fixed,w_180,h_180&k=1780044092746381165",8,"Research & Report","Classifying Heart Disease through Fusion of Multi-Source Datasets - Integration of Feature Selection and Explainable Machine Learning Techniques","Research examines heart disease classification using integrated feature selection and explainable machine learning, based on three datasets with 4,728 participants and 11 features, containing 4.27% missing values. XGBoost achieves 0.95 accuracy with one feature, while Random Forest reaches 0.92 and 0.99 for the remaining two-feature settings. Across 11 models, RF and XGBoost yield 0.97 and 0.99 accuracy using all features. SpFSR shows RF attains 0.99 with four key variables, and XAI (Permutation Importance, SHAP) quantifies each feature’s predictive impact.","Classifying Heart Disease through Fusion of Multi-Source Datasets: Integration of Feature Selection and Explainable Machine Learning Techniques  \nKasiful Aprianto*1, Mila Desi Anasanti2  \n1,2Computer Science Master's Study Program, Nusa Mandiri University, Jakarta, Indonesia e-mail:*[1](114220022@nusamandiri.ac.id)[14220022@nusamandiri.ac.id](114220022@nusamandiri.ac.id), *[2](2mila.mld@nusamandiri.ac.id)[mila.mld@nusamandiri.ac.id](2mila.mld@nusamandiri.ac.id)  \nAbstrak  \nPenelitian ini mengkaji klasifikasi penyakit jantung melalui seleksi fitur terintegrasi dan metodologi pembelajaran mesin, menggunakan tiga set data yang terdiri dari 4.728 partisipan dan 11 fitur, dengan 4,27% data yang hilang. Dengan menggunakanpembelajaran mesin, kami menggunakan XGBoost untuk mencapai akurasi 0,95 untuk satu fitur, sementara Random Forest (RF) menunjukkan akurasi 0,92 dan 0,99 untuk duafitur yang tersisa. Dalam membandingkan 11 model klasifikasi, RF dan XGBoost mengklasifikasikanpenyakit jantung dengan akurasi 0,97 dan 0,99, masing-masing, menggunakan semuafitur yang tersedia. Penerapan Eliminasi Fitur dengan Seleksi dan Peringkat Fitur Simultan Perturbation (SpFSR) mengungkapkan bahwa RF mencapai akurasi 0,99 dengan memilih hanya empat fitur (tingkat kolesterol, usia, pengukuranelektrokardiografi istirahat, dan denyut jantung maksimum), sementara XGBoost turun menjadi 0,91. Pembuatan model RF dengan empat fitur meningkatkan interpretabilitas tanpa mengorbankan akurasi. Teknik Pembelajaran Mesin yang Dapat Dijelaskan (XAI), termasuk Permutation Importance dan analisis SHAP Summary Plot, mengukur dampakfitur padaprediksipenyakit jantung. Fitur pengukuran elektrokardiografi istirahat memiliki nilai tertinggi (0,40 ± 0,01), diikuti oleh denyut jantung maksimum (0,32 ± 0,01), tingkat kolesterol (0,28 ± 0,01), dan usia (0,26 ± 0,005). Hasil ini menekankan pentingnya masing-masing fitur dalam mendiagnosis penyakit jantung melaluipembelajaran mesin.  \nKata kunci—Klasifikasipenyakit jantung, Penggabungan dataset, Pengisian nilai yang hilang, Pembelajaran mesin, Ekstraksi fitur, Machine Learning yang dapat dijelaskan, XGBoost, Random Forest.  \nAbstract  \nThis study delves into heart disease classification through integrated feature selection and machine learning methodologies, utilizing three datasets comprising 4,728 participants and 11 features, with 4.27% missing data. Employing machine learning, we used XGBoost to achieve 0.95 accuracy for one feature, while Random Forest (RF) demonstrated accuracies of 0.92 and 0.99 for the remaining two features. Comparing 11 classification models, RF and XGBoost classified heart disease with 0.97 and 0.99 accuracy, respectively, using all available features. Applying Feature Elimination with Simultaneous Perturbation Feature Selection and Ranking (SpFSR) revealed that RF attained 0.99 accuracy by selecting only four features (cholesterol level, age, resting electrocardiographic measurements, and maximum heart rate), while XGBoost dropped to 0.91. Constructing an RF model with four features enhanced interpretability without compromising accuracy. Explainable Machine Learning (XAI) techniques, including Permutation Importance and SHAP Summary Plot analyses, gauged feature impact on heart disease prediction. The resting electrocardiographic measurements feature held the highest value (0.40 ± 0.01), followed by maximum heart rate (0.32 ± 0.01), cholesterol level (0.28 ± 0.01), and age  \n(0.26 ± 0.005). These results underscore the significance of each feature in diagnosing heart disease via machine learning.  \nKeywords—Heart disease classification, Dataset fusion, Imputation, Machine learning, Feature extraction, Explainable Machine Learning, XGBoost, Random Forest.  \n1. INTRODUCTION  \nNoncommunicable diseases (NCDs) account for 75% of deaths worldwide, particularly prevalent in developing regions like South Asia and Sub-Saharan Africa [1] . NCD prevention involves managing risk factors for obesity, diabetes, ","cbCaio3E0025LhGo","https://ap.wps.com/l/cbCaio3E0025LhGo","pdf",465381,1,12,"English","en",105,"# Introduction\n## Machine learning for cardiovascular disease prediction\n## Dataset and feature handling overview\n## Feature selection and ranking approach\n## Explainable machine learning (XAI) methods\n## Results and feature importance analysis","[{\"question\":\"What datasets and features are used for heart disease classification?\",\"answer\":\"The study uses three datasets containing 4,728 participants and 11 features, with 4.27% missing data.\"},{\"question\":\"Which machine learning models and accuracies are reported?\",\"answer\":\"XGBoost reaches 0.95 accuracy for one-feature input, while Random Forest achieves 0.92 and 0.99 for the remaining two-feature setups. Using all features, RF and XGBoost attain 0.97 and 0.99 accuracy respectively.\"},{\"question\":\"How does feature selection with SpFSR affect performance and interpretability?\",\"answer\":\"SpFSR reveals RF achieves 0.99 accuracy using only four features (cholesterol level, age, resting electrocardiographic measurements, maximum heart rate). Building an RF model with these four features improves interpretability without sacrificing accuracy.\"}]","Classifying Heart Disease through Fusion of Multi-Source Datasets - Integration of Feature Selection and Explainable Machine Learning Techniques | PDF",1785735671,30,{"code":4,"msg":31,"data":32},"ok",{"site_id":24,"language":23,"slug":33,"title":13,"keywords":34,"description":14,"schema_data":35,"social_meta":86,"head_meta":88,"extra_data":90,"updated_unix":28},"classifying-heart-disease-through-fusion-of-multi-source-datasets-integration-of-feature-selection-and-explainable-machine-learning-techniques","",{"@graph":36,"@context":85},[37,54,68],{"@type":38,"itemListElement":39},"BreadcrumbList",[40,44,48,51],{"item":41,"name":42,"@type":43,"position":20},"https://docshare.wps.com","Home","ListItem",{"item":45,"name":46,"@type":43,"position":47},"https://docshare.wps.com/document/","Document",2,{"item":49,"name":12,"@type":43,"position":50},"https://docshare.wps.com/document/research-report/",3,{"item":52,"name":13,"@type":43,"position":53},"https://docshare.wps.com/document/classifying-heart-disease-through-fusion-of-multi-source-datasets-integration-of-feature-selection-and-explainable-machine-learning-techniques/121440/",4,{"url":52,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":23,"description":14,"dateModified":62,"datePublished":62,"encodingFormat":61,"isAccessibleForFree":63,"interactionStatistic":64},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":41,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-03",true,{"@type":65,"interactionType":66,"userInteractionCount":20},"InteractionCounter",{"@type":67},"ViewAction",{"@type":69,"mainEntity":70},"FAQPage",[71,77,81],{"name":72,"@type":73,"acceptedAnswer":74},"What datasets and features are used for heart disease classification?","Question",{"text":75,"@type":76},"The study uses three datasets containing 4,728 participants and 11 features, with 4.27% missing data.","Answer",{"name":78,"@type":73,"acceptedAnswer":79},"Which machine learning models and accuracies are reported?",{"text":80,"@type":76},"XGBoost reaches 0.95 accuracy for one-feature input, while Random Forest achieves 0.92 and 0.99 for the remaining two-feature setups. Using all features, RF and XGBoost attain 0.97 and 0.99 accuracy respectively.",{"name":82,"@type":73,"acceptedAnswer":83},"How does feature selection with SpFSR affect performance and interpretability?",{"text":84,"@type":76},"SpFSR reveals RF achieves 0.99 accuracy using only four features (cholesterol level, age, resting electrocardiographic measurements, maximum heart rate). Building an RF model with these four features improves interpretability without sacrificing accuracy.","https://schema.org",{"og:url":52,"og:type":87,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":89,"canonical":52},"index,follow",{"doc_id":7,"site_id":24},{"code":4,"msg":5,"data":92},[93,97,101,105,110,115,120,122,127,130,134],{"id":20,"doc_module":4,"doc_module_name":46,"category_name":94,"show_sort_weight":95,"slug":96},"Story & Novel",90,"story-novel",{"id":47,"doc_module":4,"doc_module_name":46,"category_name":98,"show_sort_weight":99,"slug":100},"Literature",80,"literature",{"id":53,"doc_module":4,"doc_module_name":46,"category_name":102,"show_sort_weight":103,"slug":104},"Exam",70,"exam",{"id":106,"doc_module":4,"doc_module_name":46,"category_name":107,"show_sort_weight":108,"slug":109},5,"Comic",60,"comic",{"id":111,"doc_module":4,"doc_module_name":46,"category_name":112,"show_sort_weight":113,"slug":114},6,"Technology",50,"technology",{"id":116,"doc_module":4,"doc_module_name":46,"category_name":117,"show_sort_weight":118,"slug":119},7,"Healthcare",40,"healthcare",{"id":11,"doc_module":4,"doc_module_name":46,"category_name":12,"show_sort_weight":29,"slug":121},"research-report",{"id":123,"doc_module":4,"doc_module_name":46,"category_name":124,"show_sort_weight":125,"slug":126},9,"Religion & Spirituality",20,"religion-spirituality",{"id":125,"doc_module":4,"doc_module_name":46,"category_name":128,"show_sort_weight":125,"slug":129},"World Cup","world-cup",{"id":131,"doc_module":4,"doc_module_name":46,"category_name":132,"show_sort_weight":131,"slug":133},10,"Lifestyle","lifestyle",{"id":135,"doc_module":4,"doc_module_name":46,"category_name":136,"show_sort_weight":106,"slug":137},19,"General","general"]