[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-120235-en":3,"doc-seo-120235-105":30,"detail-sidebar-cat-0-en-105":91},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":4,"is_deleted":4,"is_public":20,"is_downloadable":20,"audit_status":20,"page_count":21,"language":22,"language_code":23,"site_id":24,"html_lang":23,"table_of_contents":25,"faqs":26,"seo_title":27,"seo_description":14,"update_tm":28,"read_time":29},120235,7971461740886,"Theodore","https://ap-avatar.wpscdn.com/davatar_3d24733baf745e90a7e4bdd5f77d97b2",7,"Healthcare","Machine Learning-Based Approach for HIV/AIDS Prediction - Feature Selection and Data Balancing Strategy","HIV/AIDS remains a critical global health challenge that requires reliable predictive models to support early detection and clinical decision-making. Building effective predictors is hindered by epidemiological data imbalance and irrelevant features that can reduce classification accuracy, especially for minority classes. This study improves AIDS infection prediction by combining feature selection with data balancing and multi-algorithm machine learning classification. Feature selection uses Pearson Correlation, Mutual Information, and Chi-Square, while Random Oversampling, SMOTE, and ADASYN mitigate imbalance.","Machine Learning-Based Approach for HIV/AIDS Prediction: Feature  \nSelection and Data Balancing Strategy  \nAbd Mizwar A. Rahim 1*, Bambang Pilu Hartato 2*, Ahmad Ridwan 3*, Firman Asharudin4**  \n*Informatika, Universitas Amikom Yogyakarta  \n**Teknik Informatika, Universitas AMIKOM Yogyakarta  \n[abdulmizwar@amikom.ac.id](abdulmizwar@amikom.ac.id1)[1](abdulmizwar@amikom.ac.id1), [ahmadridwan@amikom.ac.id](ahmadridwan@amikom.ac.id2)[2](ahmadridwan@amikom.ac.id2), [bambang.pilu@amikom.ac.id](bambang.pilu@amikom.ac.id3)[3](bambang.pilu@amikom.ac.id3), [firman_asharudin@amikom.ac.id](firman_asharudin@amikom.ac.id4)[4](firman_asharudin@amikom.ac.id4)  \nArticle history:  \nReceived 2025-01-29 Revised 2025-02-19 Accepted 2025-02-20  \nKeyword:  \nMachine Learning, Feature Selection, Data Balancing, HIV/AIDS Prediction, Classification.  \nHIV/AIDS remains a significant global health challenge, requiring accurate predictive models for early detection and improved clinical decision-making. However, developing an effective predictive model faces challenges such as data imbalance and the presence of irrelevant features, which can compromise model accuracy. This study aims to enhance the performance of AIDS infection prediction models by integrating feature selection, data balancing, and machine learning classification techniques. Feature selection is conducted using Pearson Correlation, Mutual Information, and Chi-Square tests to retain only the most relevant features. Random Oversampling, SMOTE, and ADASYN are employed to address data imbalance and improve model robustness. Nine machine learning algorithms, including Decision Tree, Random Forest, XGBoost, LightGBM, Gradient Boosting, Support Vector Machine, AdaBoost, and Logistic Regression, are tested for classification. Performance evaluation using confusion matrix, precision, recall, F1-score, and AUC-ROC shows that tree-based models (Random Forest, Extra Trees, and XGBoost) achieve the best results, particularly in handling minority class predictions. The study concludes that combining feature selection, data balancing, and machine learning techniques significantly improves predictive performance, making it a valuable approach for early detection and clinical decision support in HIV/AIDS diagnosis. Future research may explore hyperparameter tuning and realworld clinical data integration to enhance practical applicability.  \nThis is an open access article under the CC–BY-SA license.  \nArticle Info ABSTRACT  \nI. PENDAHULUAN  \nAcquired Immunodeficiency Syndrome (AIDS), yang disebabkan oleh Human Immunodeficiency Virus (HIV), tetap menjadi salah satu tantangan kesehatan global yang mendesak [1]. Organisasi Kesehatan Dunia (WHO) melaporkan bahwa pada tahun 2022, sekitar 39 juta orang di seluruh dunia hidup dengan HIV, dengan lebih dari 1,3 jutakasus baru per tahun. Tingginya tingkat morbiditas dan mortalitas terutama terjadi di negara-negara berkembang, dimana akses terhadap layanan kesehatan dan pengobatan masih terbatas [2]. Dalam konteks ini, pengembangan model machine learning untuk prediksi HIV/AIDS menjadi penting guna mendukung upaya pencegahan dan penanganan yanglebih efektif. [3] .  \nSalah satu tantangan utama dalam membangun model prediksi HIV/AIDS adalah ketidakseimbangan data epidemiologi, di manajumlah kasus positif (AIDS) jauh lebihsedikit dibandingkan dengan jumlah kasus negatif [4]. Ketidakseimbangan data ini dapat menghambat kinerja model machine learning, menyebabkan bias terhadap kelas mayoritas, dan mengurangi akurasi prediksi pada kelas minoritas [5]. Oleh karena itu, diperlukan strategi penyeimbangan data, seperti Random Over Sampling dan Synthetic Minority Oversampling Technique (SMOTE), untuk meningkatkan representasi data minoritas sertamemperbaiki distribusi kelas [6] .  \nBeberapa penelitian sebelumnya telah mengeksplorasi metode prediksi HIV/AIDS menggunakan machine learning. Salah satunya menyelidiki penggunaan oversampling seperti  \nSMOTE, ADASYN, dan Random Oversam","cbCairdFW8ntUrhs","https://ap.wps.com/l/cbCairdFW8ntUrhs","pdf",879878,1,10,"English","en",105,"# PENDAHULUAN\n## Tantangan ketidakseimbangan data\n## Tinjauan penelitian sebelumnya\n## Kebutuhan penelitian dan tujuan studi\n# Metodologi yang diusulkan\n## Seleksi fitur\n## Strategi balancing data\n## Evaluasi kinerja model","[{\"question\":\"Mengapa prediksi HIV/AIDS dengan machine learning sering sulit dilakukan?\",\"answer\":\"Karena data epidemiologi umumnya tidak seimbang (kelas positif lebih sedikit), dan adanya fitur yang kurang relevan dapat menurunkan akurasi serta menyebabkan bias ke kelas mayoritas.\"},{\"question\":\"Bagaimana fitur dipilih agar model lebih akurat?\",\"answer\":\"Penelitian menggunakan beberapa metode seleksi fitur, yaitu Pearson Correlation, Mutual Information, dan Chi-Square untuk mempertahankan fitur yang paling relevan.\"},{\"question\":\"Strategi apa digunakan untuk mengatasi ketidakseimbangan data?\",\"answer\":\"Model menggunakan Random Oversampling serta teknik synthetic seperti SMOTE dan ADASYN untuk meningkatkan representasi kelas minoritas dan memperbaiki distribusi data.\"}]","Machine Learning-Based Approach for HIV/AIDS Prediction - Feature Selection and Data Balancing Strategy | PDF",1785728908,25,{"code":4,"msg":31,"data":32},"ok",{"site_id":24,"language":23,"slug":33,"title":13,"keywords":34,"description":14,"schema_data":35,"social_meta":86,"head_meta":88,"extra_data":90,"updated_unix":28},"machine-learning-based-approach-for-hivaids-prediction-feature-selection-and-data-balancing-strategy","",{"@graph":36,"@context":85},[37,54,68],{"@type":38,"itemListElement":39},"BreadcrumbList",[40,44,48,51],{"item":41,"name":42,"@type":43,"position":20},"https://docshare.wps.com","Home","ListItem",{"item":45,"name":46,"@type":43,"position":47},"https://docshare.wps.com/document/","Document",2,{"item":49,"name":12,"@type":43,"position":50},"https://docshare.wps.com/document/healthcare/",3,{"item":52,"name":13,"@type":43,"position":53},"https://docshare.wps.com/document/machine-learning-based-approach-for-hivaids-prediction-feature-selection-and-data-balancing-strategy/120235/",4,{"url":52,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":23,"description":14,"dateModified":62,"datePublished":62,"encodingFormat":61,"isAccessibleForFree":63,"interactionStatistic":64},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":41,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-03",true,{"@type":65,"interactionType":66,"userInteractionCount":4},"InteractionCounter",{"@type":67},"ViewAction",{"@type":69,"mainEntity":70},"FAQPage",[71,77,81],{"name":72,"@type":73,"acceptedAnswer":74},"Mengapa prediksi HIV/AIDS dengan machine learning sering sulit dilakukan?","Question",{"text":75,"@type":76},"Karena data epidemiologi umumnya tidak seimbang (kelas positif lebih sedikit), dan adanya fitur yang kurang relevan dapat menurunkan akurasi serta menyebabkan bias ke kelas mayoritas.","Answer",{"name":78,"@type":73,"acceptedAnswer":79},"Bagaimana fitur dipilih agar model lebih akurat?",{"text":80,"@type":76},"Penelitian menggunakan beberapa metode seleksi fitur, yaitu Pearson Correlation, Mutual Information, dan Chi-Square untuk mempertahankan fitur yang paling relevan.",{"name":82,"@type":73,"acceptedAnswer":83},"Strategi apa digunakan untuk mengatasi ketidakseimbangan data?",{"text":84,"@type":76},"Model menggunakan Random Oversampling serta teknik synthetic seperti SMOTE dan ADASYN untuk meningkatkan representasi kelas minoritas dan memperbaiki distribusi data.","https://schema.org",{"og:url":52,"og:type":87,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":89,"canonical":52},"index,follow",{"doc_id":7,"site_id":24},{"code":4,"msg":5,"data":92},[93,97,101,105,110,115,118,123,128,131,134],{"id":20,"doc_module":4,"doc_module_name":46,"category_name":94,"show_sort_weight":95,"slug":96},"Story & Novel",90,"story-novel",{"id":47,"doc_module":4,"doc_module_name":46,"category_name":98,"show_sort_weight":99,"slug":100},"Literature",80,"literature",{"id":53,"doc_module":4,"doc_module_name":46,"category_name":102,"show_sort_weight":103,"slug":104},"Exam",70,"exam",{"id":106,"doc_module":4,"doc_module_name":46,"category_name":107,"show_sort_weight":108,"slug":109},5,"Comic",60,"comic",{"id":111,"doc_module":4,"doc_module_name":46,"category_name":112,"show_sort_weight":113,"slug":114},6,"Technology",50,"technology",{"id":11,"doc_module":4,"doc_module_name":46,"category_name":12,"show_sort_weight":116,"slug":117},40,"healthcare",{"id":119,"doc_module":4,"doc_module_name":46,"category_name":120,"show_sort_weight":121,"slug":122},8,"Research & Report",30,"research-report",{"id":124,"doc_module":4,"doc_module_name":46,"category_name":125,"show_sort_weight":126,"slug":127},9,"Religion & Spirituality",20,"religion-spirituality",{"id":126,"doc_module":4,"doc_module_name":46,"category_name":129,"show_sort_weight":126,"slug":130},"World Cup","world-cup",{"id":21,"doc_module":4,"doc_module_name":46,"category_name":132,"show_sort_weight":21,"slug":133},"Lifestyle","lifestyle",{"id":135,"doc_module":4,"doc_module_name":46,"category_name":136,"show_sort_weight":106,"slug":137},19,"General","general"]