[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"detail-sidebar-cat-0-id-113":3,"doc-seo-202317-113":53,"doc-detail-202317-id":132},{"code":4,"msg":5,"data":6},0,"success",[7,13,17,21,25,29,33,37,41,45,49],{"id":8,"doc_module":4,"doc_module_name":9,"category_name":10,"show_sort_weight":11,"slug":12},55,"Document","Agama & Spiritualitas",60,"religion-spirituality",{"id":14,"doc_module":4,"doc_module_name":9,"category_name":15,"show_sort_weight":11,"slug":16},48,"Cerita & Novel","story-novel",{"id":18,"doc_module":4,"doc_module_name":9,"category_name":19,"show_sort_weight":11,"slug":20},56,"Gaya Hidup","lifestyle",{"id":22,"doc_module":4,"doc_module_name":9,"category_name":23,"show_sort_weight":11,"slug":24},51,"Komik","comic",{"id":26,"doc_module":4,"doc_module_name":9,"category_name":27,"show_sort_weight":11,"slug":28},53,"Layanan Kesehatan","healthcare",{"id":30,"doc_module":4,"doc_module_name":9,"category_name":31,"show_sort_weight":11,"slug":32},54,"Penelitian & Laporan","research-report",{"id":34,"doc_module":4,"doc_module_name":9,"category_name":35,"show_sort_weight":11,"slug":36},49,"Sastra","literature",{"id":38,"doc_module":4,"doc_module_name":9,"category_name":39,"show_sort_weight":11,"slug":40},52,"Teknologi","technology",{"id":42,"doc_module":4,"doc_module_name":9,"category_name":43,"show_sort_weight":11,"slug":44},50,"Ujian","exam",{"id":46,"doc_module":4,"doc_module_name":9,"category_name":47,"show_sort_weight":11,"slug":48},57,"Umum","general",{"id":50,"doc_module":4,"doc_module_name":9,"category_name":51,"show_sort_weight":4,"slug":52},181,"Formulir","formulir",{"code":4,"msg":54,"data":55},"ok",{"site_id":56,"language":57,"slug":58,"title":59,"keywords":60,"description":61,"schema_data":62,"social_meta":125,"head_meta":127,"extra_data":129,"updated_unix":131},113,"id","chapter-4-research-results-and-discussion-dataset-description-text-preprocessing-and-feature-engineering","Bab IV - Hasil Penelitian dan Pembahasan - Deskripsi Dataset, Pra-pemrosesan Teks, dan Feature Engineering","","Bab IV membahas hasil penelitian dan pembahasan terkait penyusunan dataset, pra-pemrosesan teks, serta feature engineering untuk klasifikasi intent berbasis chatbot layanan Balai Bahasa Provinsi Lampung (BBPL). Dataset disusun melalui discovery, augmentation, dan generation dengan total 445 sampel dan 9 intent. Pra-pemrosesan dilakukan menggunakan case folding, cleansing, stopword removal, dan stemming memakai NLTK serta Sastrawi. Representasi numerik dibangun menggunakan TF-IDF dengan matriks 434×749 untuk mendukung performa model Multinomial Naïve Bayes.",{"@graph":63,"@context":124},[64,81,103],{"@type":65,"itemListElement":66},"BreadcrumbList",[67,72,75,78],{"item":68,"name":69,"@type":70,"position":71},"https://docshare.wps.com","Home","ListItem",1,{"item":73,"name":9,"@type":70,"position":74},"https://docshare.wps.com/id/document/",2,{"item":76,"name":31,"@type":70,"position":77},"https://docshare.wps.com/id/document/penelitian-laporan/",3,{"item":79,"name":59,"@type":70,"position":80},"https://docshare.wps.com/id/document/chapter-4-research-results-and-discussion-dataset-description-text-preprocessing-and-feature-engineering/202317/",4,{"url":79,"name":59,"@type":82,"image":83,"author":88,"headline":59,"publisher":91,"fileFormat":94,"inLanguage":57,"description":61,"dateModified":95,"datePublished":96,"encodingFormat":94,"isAccessibleForFree":97,"interactionStatistic":98},"DigitalDocument",{"url":84,"@type":85,"width":86,"height":87},"https://docshare.wps.com/thumbnails/chapter-4-research-results-and-discussion-dataset-description-text-preprocessing-and-feature-engineering/202317.png","ImageObject",300,407,{"name":89,"@type":90},"Skyler","Person",{"url":68,"name":92,"@type":93},"DocShare","Organization","application/pdf","2026-10-05","2026-09-04",true,{"@type":99,"interactionType":100,"userInteractionCount":102},"InteractionCounter",{"@type":101},"ViewAction",9,{"@type":104,"mainEntity":105},"FAQPage",[106,112,116,120],{"name":107,"@type":108,"acceptedAnswer":109},"Bagaimana dataset penelitian disusun dan berapa total sampelnya?","Question",{"text":110,"@type":111},"Dataset diperoleh melalui tiga tahap pengumpulan data: data discovery, data augmentation, dan data generation. Hasil akhirnya berisi 445 sampel data latih yang terbagi ke dalam 9 intent.","Answer",{"name":113,"@type":108,"acceptedAnswer":114},"Apa tujuan pra-pemrosesan teks pada penelitian ini?",{"text":115,"@type":111},"Pra-pemrosesan bertujuan membersihkan dan mentransformasi data mentah menjadi format terstruktur untuk mengurangi noise, menyeragamkan format kata, menekan fitur tidak relevan, sehingga akurasi dan efisiensi model meningkat.",{"name":117,"@type":108,"acceptedAnswer":118},"Tahapan pra-pemrosesan teks apa saja yang digunakan?",{"text":119,"@type":111},"Tahapan utama meliputi case folding, cleansing (penghapusan angka dan tanda baca serta spasi berlebih), stopword removal, stemming, dan tokenisasi, dengan NLTK untuk stopword bahasa Indonesia dan Sastrawi untuk stemming.",{"name":121,"@type":108,"acceptedAnswer":122},"Bagaimana feature engineering dibangun dan hasil ukuran matriks TF-IDF-nya?",{"text":123,"@type":111},"Feature engineering menggunakan metode Term Frequency–Inverse Document Frequency (TF-IDF). Dihasilkan matriks TF-IDF berukuran 434×749, yang menunjukkan 434 dokumen dan 749 fitur (unigram maupun bigram).","https://schema.org",{"og:url":79,"og:type":126,"og:title":59,"og:site_name":92,"og:description":61},"article",{"robots":128,"canonical":79},"index,follow",{"doc_id":130,"site_id":56},202317,1788544584,{"code":4,"msg":5,"data":133},{"doc_id":130,"user_id":134,"nickname":89,"user_avatar":135,"doc_module":4,"category_id":30,"category_name":31,"doc_title":59,"doc_description":61,"doc_content":136,"file_id":137,"file_url":138,"file_type":139,"file_size":140,"view_count":102,"is_deleted":4,"is_public":71,"is_downloadable":71,"audit_status":71,"page_count":141,"language":142,"language_code":57,"site_id":56,"html_lang":57,"table_of_contents":143,"faqs":144,"seo_title":145,"seo_description":61,"update_tm":131,"read_time":146},2336464648746,"https://ap-avatar.wpscdn.com/davatar_276721f389ce27ea32af1340a28f341c","BAB IV  \nHASIL PENELITIAN DAN PEMBAHASAN  \n4.1 Deskripsi Dataset  \nDataset yang digunakan dalam penelitian ini merupakan korpus teks berisipasangan pertanyaan dan jawaban seputar layanan Balai Bahasa Provinsi Lampung (BBPL) . Dataset diperoleh melalui tiga tahap pengumpulan data, yaitu data discovery, data augmentation, dan data generation.  \nHasil akhir penyusunan dataset terdiri dari 445 sampel data latih yang terbagike dalam 9 intent berbeda. Setiap intent merepresentasikan kategori atau topik pertanyaan spesifik yang dapat dipahami chatbot. Distribusi jumlah patterns (contoh pertanyaan) dan responses (jawaban chatbot) ditampilkan pada Tabel 4.1.  \nKesembilan intent tersebut mencakup topik mulai dari sapaan (salam), informasi umum, hingga penutup percakapan (bye). Distribusijumlah patterns dan responses pada masing-masing intent ditampilkan pada Tabel 4.1.  \nTabel 4. 1 Distribusi Sampel (Patterns) dan (Responses) per Intent  \n\n| No. | Nama Intent (Tag) | Jumlah\u003Cbr>Patterns | Jumlah\u003Cbr>Responses |\n| --- | --- | --- | --- |\n| 1 | Salam | 48 | 48 |\n| 2 | Informasi_Umum | 49 | 49 |\n| 3 | Syarat_UKBI | 50 | 50 |\n| 4 | Konsultasi_Bahasa_dan_Sastra | 50 | 50 |\n| 5 | Permohonan_Layanan | 49 | 49 |\n\n\n| 6 | Penyuluhan_Program_Bahasa | 49 | 49 |\n| --- | --- | --- | --- |\n| 7 | Pengaduan_Masyarakat | 50 | 50 |\n| 8 | Kemampuan_Chatbot | 50 | 50 |\n| 9 | Bye | 50 | 50 |\n|  | Total Sampel | 445 | 445 |\n\nDistribusi tersebut divisualisasikan dalam Gambar 4.1 untuk memperlihatkanvariasijumlah data pada tiap intent.  \nGambar 4. 1 Diagram Batang Distribusi Patterns dan Responses per Intent  \nSecara keseluruhan, meskipun terdapat variasi jumlah data, distribusi yang dihasilkan masih dapat dianggap seimbang untuk proses pelatihan model Multinomial Naïve Bayes. Dengan adanya representasi data pada tiap intent, model diharapkan dapat mempelajari pola pertanyaan yang bervariasi dan menghasilkan prediksi yang lebih akurat saat berinteraksi dengan pengguna.  \n4.2 Pra-pemrosesan Teks (Text Preprocessing)  \nPra-pemrosesan teks merupakan tahapan penting untuk membersihkan dan  \nmentransformasi data mentah menjadi format yang lebih terstruktur serta siap digunakan dalam klasifikasi teks. Tujuannya adalah mengurangi noise, menyeragamkan format kata, dan menekan fitur yang tidak relevan sehinggadapat meningkatkan akurasi sekaligus efisiensi model.  \nDalam penelitian ini, pra-pemrosesan dilakukan menggunakan fungsi kustombersihkan_teks yang diimplementasikan pada Google Colaboratory. Fungsi ini mengintegrasikan tahapan case folding, penghapusan karakter khusus, stopword removal, dan stemming. Library NLTK digunakan untuk daftar stopword Bahasa Indonesia, sedangkan Sastrawi digunakan untuk proses stemming.  \nGambar 4. 2 Proses Preprocssing  \nFungsi pada Gambar 4.2 (bersihkan_text) bekerja dengan menerima input berupa teks mentah, kemudian mengembalikannya dalam bentuk string yang  \ntelah dibersihkan. Proses pembersihan dilakukan melalui beberapa tahapanutama, yaitu case folding, cleansing, stopword removal, stemming, dan tokenisasi. Berikut uraian tiap tahapannya:  \n1. Case folding  \nSeluruh huruf dalam teks diubah menjadi huruf kecil (lowercase) . Tahap ini menghilangkan perbedaan antara kata yang sama tetapi ditulis dengan kapital, misalnya “UKBI” dan “ukbi”.  \nTabel 4. 2 Contoh Hasil Case Folding  \n\n| Sebelum | Setelah |\n| --- | --- |\n| Halo, bagaimana cara Mendaftar UKBI? | halo, bagaimana caramendaftarukbi? |\n\n2. Cleansing (Penghapusan Angka dan Tanda Baca)  \nPada tahap ini dilakukan penghapusan angka, tanda baca, serta spasi berlebih. Elemen-elemen tersebut dianggap tidak memiliki makna penting dalam prosesklasifikasi teks.  \nTabel 4. 3 Contoh Hasil Cleansing  \n\n| Sebelum | Setelah |\n| --- | --- |\n| No HP saya adalah 0812-3456- 7890!!! | nohpsayaadalah |\n\n3. Contoh Hasil Cleansing  \nStopwords adalah kata-kata umum yang sering muncul namun tidak memberikan kontribusi berarti terhadap pemahaman konteks, seperti “yang”,“dan”, atau “di”. Kata-kata ini dihap","cbCaiskeSJ9xKwBl","https://ap.wps.com/l/cbCaiskeSJ9xKwBl","pdf",913706,28,"Indonesian","# 4.1 Deskripsi Dataset\n## Distribusi Sampel per Intent\n# 4.2 Pra-pemrosesan Teks (Text Preprocessing)\n## Case Folding\n## Cleansing (Penghapusan Angka dan Tanda Baca)\n## Stopword Removal\n## Stemming\n# 4.3 Hasil Feature Engineering\n## Proses Ekstrasi TF-IDF","[{\"question\":\"Bagaimana dataset penelitian disusun dan berapa total sampelnya?\",\"answer\":\"Dataset diperoleh melalui tiga tahap pengumpulan data: data discovery, data augmentation, dan data generation. Hasil akhirnya berisi 445 sampel data latih yang terbagi ke dalam 9 intent.\"},{\"question\":\"Apa tujuan pra-pemrosesan teks pada penelitian ini?\",\"answer\":\"Pra-pemrosesan bertujuan membersihkan dan mentransformasi data mentah menjadi format terstruktur untuk mengurangi noise, menyeragamkan format kata, menekan fitur tidak relevan, sehingga akurasi dan efisiensi model meningkat.\"},{\"question\":\"Tahapan pra-pemrosesan teks apa saja yang digunakan?\",\"answer\":\"Tahapan utama meliputi case folding, cleansing (penghapusan angka dan tanda baca serta spasi berlebih), stopword removal, stemming, dan tokenisasi, dengan NLTK untuk stopword bahasa Indonesia dan Sastrawi untuk stemming.\"},{\"question\":\"Bagaimana feature engineering dibangun dan hasil ukuran matriks TF-IDF-nya?\",\"answer\":\"Feature engineering menggunakan metode Term Frequency–Inverse Document Frequency (TF-IDF). Dihasilkan matriks TF-IDF berukuran 434×749, yang menunjukkan 434 dokumen dan 749 fitur (unigram maupun bigram).\"}]","Bab IV - Hasil Penelitian dan Pembahasan - Deskripsi Dataset, Pra-pemrosesan Teks, dan Feature Engineering | PDF",43]