[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-125498-en":3,"doc-seo-125498-105":30,"detail-sidebar-cat-0-en-105":91},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":20,"is_downloadable":20,"audit_status":20,"page_count":21,"language":22,"language_code":23,"site_id":24,"html_lang":23,"table_of_contents":25,"faqs":26,"seo_title":27,"seo_description":14,"update_tm":28,"read_time":29},125498,13056703020460,"Valentina","https://ap-avatar.wpscdn.com/avatar/be000253dac470eee5d?_k=1778207105932848923",8,"Research & Report","Sentiment Classification Analysis of Tokopedia Reviews Using TF-IDF, SMOTE, and Traditional Machine Learning Models","Study sentiment classification for Tokopedia user reviews using TF-IDF feature extraction and SMOTE to address class imbalance. From nearly one million Bahasa Indonesia e-commerce reviews sourced from Kaggle, preprocessing filters reduce the dataset to 6,477 relevant entries with 5,213 positive and 1,264 negative reviews. SMOTE balances classes to 10,426 samples (1:1) for training. Five traditional models—Naive Bayes, Logistic Regression, SVM, Decision Tree, and Random Forest—are evaluated via stratified 80:20 split and 5-fold cross-validation using accuracy, precision, recall, F1-score, ROC-AUC, and runtime. Random Forest and tuned SVM show the strongest performance.","Sentiment Classification Analysis of Tokopedia Reviews Using TF-IDF, SMOTE, and Traditional Machine Learning Models  \nHerianta Barus 1*, Ika Nur Fajri 2*, Yoga Pristyanto3*  \n* Sistem Informasi,UniversitasAmikomYogyakarta  \n[heriantabarus@students.amikom.ac.id](heriantabarus@students.amikom.ac.id1)[1](heriantabarus@students.amikom.ac.id1), [fajri@amikom.ac.id](fajri@amikom.ac.id2)[2](fajri@amikom.ac.id2), [yoga.pristyanto@amikom.ac.id](yoga.pristyanto@amikom.ac.id3)[3](yoga.pristyanto@amikom.ac.id3)  \n\n| Article history:\u003Cbr>Received 2025-07-28 Revised 2025-09-03 Accepted 2025-09-10 | This study explores sentiment classification on Tokopedia user reviews using TFIDF for feature extraction and SMOTE to handle class imbalance. From nearly one million raw reviews sourced from Kaggle (\"E-Commerce Ratings and Reviews in Bahasa Indonesia\"), a final set of 6,477 relevant entries was obtained after rigorous preprocessing, including case folding, noise removal (emojis, URLs, numbers), normalization to KBBI standards, tokenization, stopword removal, and stemming with Sastrawi. The dataset consisted of 5,213 positive and 1,264 negative reviews (80.4% positive) . SMOTE balanced the classes to 10,426 reviews with a 1:1 ratio for training. Five traditional machine learning models were evaluated: Naive Bayes, Logistic Regression, Support Vector Machine (SVM), Decision Tree, and Random Forest. Assessments were based on accuracy, precision, recall, F1-score, ROC-AUC, and computational time, using an 80:20 stratified split and 5-fold cross-validation. Random Forest achieved the best overall performance (accuracy: 0.9163, F1-score: 0.9133, ROC-AUC: 0.9784), while tuned SVM (C=10, RBF kernel) attained the highest accuracy of 0.9473 and F1-score of 0.9321. Cross-validation on Naive Bayes showed consistent results with an average accuracy of 88.09% . Further analysis using Logistic Regression coefficients identified influential features: positive sentiment associated with words like \"mantap\", \"mudah\", and \"sukses\", while negative sentiment correlated with \"kecewa\", \"parah\", and \"lemot\". These insights provide practical value for Tokopedia's teams to enhance user experience, such as improving app speed and addressing complaints. The findings demonstrate the effectiveness and efficiency of traditional machine learning techniques for sentiment analysis in Bahasa Indonesia contexts.\u003Cbr>\u003Cbr>This is an open access article under the CC–BY-SA license. |\n| --- | --- |\n| Keyword:\u003Cbr>Sentiment Analysis, Tokopedia,\u003Cbr>E-commerce, Naïve Bayes, Random Forest,\u003Cbr>Support Vector Machine (SVM), Logistic Regression,\u003Cbr>Decision Tree, TF-IDF, SMOTE. |  |\n\nArticle Info ABSTRACT  \nI. PENDAHULUAN  \nPertumbuhan pesat e-commerce di Indonesia telah mengubah pola konsumsi masyarakat. Marketplace seperti Tokopedia, Shopee, Lazada, Blibli, dan Bukalapak menjadi platform utama untuk transaksi digital [1], [2] . Tokopedia, dengan 157 juta pengunjung bulanan pada 2021 [3], menghadapi tantangan dalam menjaga kepuasan pelanggan. Ulasan pengguna, yang mencerminkan pengalaman, kepuasan, dan keluhan, merupakan sumber penting untuk memahami persepsi pelanggan [4] . Analisis sentimenterhadap ulasan ini penting untuk meningkatkan kualitas layanan dan menyusun strategi bisnis yang akurat [5] . Penelitian sebelumnya banyak menggunakan metode  \nmachine learning, seperti Naive Bayes dan SVM, untukanalisis sentimen e-commerce [6], [7] . Namun, pendekatan ini sering mengabaikan ketidakseimbangan kelas, di manaulasan positif mendominasi (80-90%) dibandingkan ulasan negatif, menyebabkan bias klasifikasi dan akurasi rendahpada kelas minoritas (F1-score \u003C 70% pada kelas negatifdalam [8]) . Selain itu, kompleksitas morfologi Bahasa Indonesia, seperti slang (misalnya, \"gak\" untuk \"tidak\"), idiom lokal (misalnya, \"mantap\"), dan struktur kalimat nonstandar, mempersulit representasi teks tanpa preprocessing yang memadai, seperti normalisasi dan stemming [9] . Banyak studi juga jarang mengintegrasikan t","cbCaiijtN55yjfRq","https://ap.wps.com/l/cbCaiijtN55yjfRq","pdf",665663,1,10,"English","en",105,"# Pendahuluan\n## Tantangan ketidakseimbangan kelas dan kompleksitas Bahasa Indonesia\n# Metode\n## Tahapan pengumpulan data dan prapemrosesan\n## Representasi teks dan penyimbangan kelas\n## Pemodelan dan evaluasi model\n# Hasil dan Pembahasan\n## Perbandingan kinerja model\n## Interpretasi fitur dan implikasi untuk layanan Tokopedia","[{\"question\":\"Penelitian ini menggunakan metode apa untuk mengubah teks ulasan Tokopedia menjadi fitur?\",\"answer\":\"TF-IDF digunakan untuk mengekstraksi fitur dari teks ulasan. Tahap prapemrosesan seperti case folding, normalisasi, tokenisasi, stopword removal, dan stemming dilakukan sebelum pemodelan.\"},{\"question\":\"Bagaimana penelitian ini mengatasi masalah ketidakseimbangan antara ulasan positif dan negatif?\",\"answer\":\"SMOTE diterapkan untuk menyeimbangkan kelas sehingga dataset latih menjadi 1:1. Penyeimbangan dilakukan setelah dataset yang relevan diperoleh dari proses preprocessing.\"},{\"question\":\"Model mana yang memberikan performa terbaik dan bagaimana cara mengukurnya?\",\"answer\":\"Random Forest memberikan performa keseluruhan terbaik berdasarkan metrik seperti accuracy, F1-score, dan ROC-AUC, sementara SVM yang dituning mencapai accuracy tertinggi. Evaluasi menggunakan stratified 80:20 split dan 5-fold cross-validation dengan metrik akurasi, precision, recall, F1-score, ROC-AUC, serta waktu komputasi.\"}]","Sentiment Classification Analysis of Tokopedia Reviews Using TF-IDF, SMOTE, and Traditional Machine Learning Models | PDF",1785899345,25,{"code":4,"msg":31,"data":32},"ok",{"site_id":24,"language":23,"slug":33,"title":13,"keywords":34,"description":14,"schema_data":35,"social_meta":86,"head_meta":88,"extra_data":90,"updated_unix":28},"sentiment-classification-analysis-of-tokopedia-reviews-using-tf-idf-smote-and-traditional-machine-learning-models","",{"@graph":36,"@context":85},[37,54,68],{"@type":38,"itemListElement":39},"BreadcrumbList",[40,44,48,51],{"item":41,"name":42,"@type":43,"position":20},"https://docshare.wps.com","Home","ListItem",{"item":45,"name":46,"@type":43,"position":47},"https://docshare.wps.com/document/","Document",2,{"item":49,"name":12,"@type":43,"position":50},"https://docshare.wps.com/document/research-report/",3,{"item":52,"name":13,"@type":43,"position":53},"https://docshare.wps.com/document/sentiment-classification-analysis-of-tokopedia-reviews-using-tf-idf-smote-and-traditional-machine-learning-models/125498/",4,{"url":52,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":23,"description":14,"dateModified":62,"datePublished":62,"encodingFormat":61,"isAccessibleForFree":63,"interactionStatistic":64},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":41,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-05",true,{"@type":65,"interactionType":66,"userInteractionCount":20},"InteractionCounter",{"@type":67},"ViewAction",{"@type":69,"mainEntity":70},"FAQPage",[71,77,81],{"name":72,"@type":73,"acceptedAnswer":74},"Penelitian ini menggunakan metode apa untuk mengubah teks ulasan Tokopedia menjadi fitur?","Question",{"text":75,"@type":76},"TF-IDF digunakan untuk mengekstraksi fitur dari teks ulasan. Tahap prapemrosesan seperti case folding, normalisasi, tokenisasi, stopword removal, dan stemming dilakukan sebelum pemodelan.","Answer",{"name":78,"@type":73,"acceptedAnswer":79},"Bagaimana penelitian ini mengatasi masalah ketidakseimbangan antara ulasan positif dan negatif?",{"text":80,"@type":76},"SMOTE diterapkan untuk menyeimbangkan kelas sehingga dataset latih menjadi 1:1. Penyeimbangan dilakukan setelah dataset yang relevan diperoleh dari proses preprocessing.",{"name":82,"@type":73,"acceptedAnswer":83},"Model mana yang memberikan performa terbaik dan bagaimana cara mengukurnya?",{"text":84,"@type":76},"Random Forest memberikan performa keseluruhan terbaik berdasarkan metrik seperti accuracy, F1-score, dan ROC-AUC, sementara SVM yang dituning mencapai accuracy tertinggi. Evaluasi menggunakan stratified 80:20 split dan 5-fold cross-validation dengan metrik akurasi, precision, recall, F1-score, ROC-AUC, serta waktu komputasi.","https://schema.org",{"og:url":52,"og:type":87,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":89,"canonical":52},"index,follow",{"doc_id":7,"site_id":24},{"code":4,"msg":5,"data":92},[93,97,101,105,110,115,120,123,128,131,134],{"id":20,"doc_module":4,"doc_module_name":46,"category_name":94,"show_sort_weight":95,"slug":96},"Story & Novel",90,"story-novel",{"id":47,"doc_module":4,"doc_module_name":46,"category_name":98,"show_sort_weight":99,"slug":100},"Literature",80,"literature",{"id":53,"doc_module":4,"doc_module_name":46,"category_name":102,"show_sort_weight":103,"slug":104},"Exam",70,"exam",{"id":106,"doc_module":4,"doc_module_name":46,"category_name":107,"show_sort_weight":108,"slug":109},5,"Comic",60,"comic",{"id":111,"doc_module":4,"doc_module_name":46,"category_name":112,"show_sort_weight":113,"slug":114},6,"Technology",50,"technology",{"id":116,"doc_module":4,"doc_module_name":46,"category_name":117,"show_sort_weight":118,"slug":119},7,"Healthcare",40,"healthcare",{"id":11,"doc_module":4,"doc_module_name":46,"category_name":12,"show_sort_weight":121,"slug":122},30,"research-report",{"id":124,"doc_module":4,"doc_module_name":46,"category_name":125,"show_sort_weight":126,"slug":127},9,"Religion & Spirituality",20,"religion-spirituality",{"id":126,"doc_module":4,"doc_module_name":46,"category_name":129,"show_sort_weight":126,"slug":130},"World Cup","world-cup",{"id":21,"doc_module":4,"doc_module_name":46,"category_name":132,"show_sort_weight":21,"slug":133},"Lifestyle","lifestyle",{"id":135,"doc_module":4,"doc_module_name":46,"category_name":136,"show_sort_weight":106,"slug":137},19,"General","general"]