[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"detail-sidebar-cat-1-id-113":3,"doc-seo-190811-113":41,"doc-detail-190811-id":114},{"code":4,"msg":5,"data":6},0,"success",[7,13,17,21,25,29,33,37],{"id":8,"doc_module":9,"doc_module_name":10,"category_name":11,"show_sort_weight":4,"slug":12},178,1,"Template","Faktur","faktur",{"id":14,"doc_module":9,"doc_module_name":10,"category_name":15,"show_sort_weight":4,"slug":16},192,"Formulir","formulir-192",{"id":18,"doc_module":9,"doc_module_name":10,"category_name":19,"show_sort_weight":4,"slug":20},180,"Media Sosial","media-sosial",{"id":22,"doc_module":9,"doc_module_name":10,"category_name":23,"show_sort_weight":4,"slug":24},179,"Poster","poster",{"id":26,"doc_module":9,"doc_module_name":10,"category_name":27,"show_sort_weight":4,"slug":28},176,"Presentasi","presentasi",{"id":30,"doc_module":9,"doc_module_name":10,"category_name":31,"show_sort_weight":4,"slug":32},177,"Resume","resume",{"id":34,"doc_module":9,"doc_module_name":10,"category_name":35,"show_sort_weight":4,"slug":36},182,"Surat","surat-a95d00d3aaf04f3b854ecf140f00d385",{"id":38,"doc_module":9,"doc_module_name":10,"category_name":39,"show_sort_weight":4,"slug":40},183,"Umum","umum-07d1ff437201438088836b2b1ed3c90f",{"code":4,"msg":42,"data":43},"ok",{"site_id":44,"language":45,"slug":46,"title":47,"keywords":48,"description":49,"schema_data":50,"social_meta":107,"head_meta":109,"extra_data":111,"updated_unix":113},113,"id","comparison-of-image-captioning-model-training-and-evaluation-results","Image Captioning模型训练与评估结果对比","","Dokumen ini merangkum perbandingan beberapa model untuk tugas image captioning, termasuk arsitektur InceptionV3, Xception, dan EfficientNetV2S serta pendekatan berbasis LSTM/GRU (LSTM, GRU, Bi-LSTM, Bi-GRU). Disajikan metrik ukuran model, waktu ekstraksi, performa pada fase training dan validation (loss, akurasi, best loss, best acc), serta kualitas teks yang dihasilkan menggunakan BLEU-1 sampai BLEU-4 dan Meteor. Bagian contoh menampilkan caption prediksi vs caption target untuk kasus terbaik, terburuk, dan pilihan acak, menunjukkan variasi ketepatan deskripsi.",{"@graph":51,"@context":106},[52,68,89],{"@type":53,"itemListElement":54},"BreadcrumbList",[55,59,62,65],{"item":56,"name":57,"@type":58,"position":9},"https://docshare.wps.com","Home","ListItem",{"item":60,"name":10,"@type":58,"position":61},"https://docshare.wps.com/id/template/",2,{"item":63,"name":27,"@type":58,"position":64},"https://docshare.wps.com/id/template/presentasi/",3,{"item":66,"name":47,"@type":58,"position":67},"https://docshare.wps.com/id/template/comparison-of-image-captioning-model-training-and-evaluation-results/190811/",4,{"url":66,"name":47,"@type":69,"image":70,"author":75,"headline":47,"publisher":78,"fileFormat":81,"inLanguage":45,"description":49,"dateModified":82,"datePublished":83,"encodingFormat":81,"isAccessibleForFree":84,"interactionStatistic":85},"DigitalDocument",{"url":71,"@type":72,"width":73,"height":74},"https://docshare.wps.com/thumbnails/comparison-of-image-captioning-model-training-and-evaluation-results/190811.png","ImageObject",442,249,{"name":76,"@type":77},"Sage","Person",{"url":56,"name":79,"@type":80},"DocShare","Organization","application/pdf","2026-09-13","2026-09-03",true,{"@type":86,"interactionType":87,"userInteractionCount":9},"InteractionCounter",{"@type":88},"ViewAction",{"@type":90,"mainEntity":91},"FAQPage",[92,98,102],{"name":93,"@type":94,"acceptedAnswer":95},"Model apa saja yang dibandingkan untuk image captioning?","Question",{"text":96,"@type":97},"InceptionV3, Xception, dan EfficientNetV2S dibandingkan untuk model utama, serta LSTM, GRU, Bi-LSTM, dan Bi-GRU untuk pendekatan sekuensial.","Answer",{"name":99,"@type":94,"acceptedAnswer":100},"Metrik apa yang digunakan untuk menilai kualitas caption yang dihasilkan?",{"text":101,"@type":97},"Kualitas caption dinilai menggunakan BLEU (B1 sampai B4) dan Meteor, dengan membandingkan caption prediksi terhadap caption target.",{"name":103,"@type":94,"acceptedAnswer":104},"Apa yang ditunjukkan pada bagian contoh terbaik, terburuk, dan pilihan acak?",{"text":105,"@type":97},"Bagian tersebut menampilkan caption prediksi dan caption target untuk contoh best score, worst score, serta random image choice, sehingga terlihat perbedaan tingkat akurasi deskripsi gambar.","https://schema.org",{"og:url":66,"og:type":108,"og:title":47,"og:site_name":79,"og:description":49},"article",{"robots":110,"canonical":66},"index,follow",{"doc_id":112,"site_id":44},190811,1788405081,{"code":4,"msg":5,"data":115},{"doc_id":112,"user_id":116,"nickname":76,"user_avatar":117,"doc_module":9,"category_id":26,"category_name":27,"doc_title":47,"doc_description":49,"doc_content":118,"file_id":119,"file_url":120,"file_type":121,"file_size":122,"view_count":9,"is_deleted":4,"is_public":9,"is_downloadable":9,"audit_status":9,"page_count":123,"language":124,"language_code":45,"site_id":44,"html_lang":45,"table_of_contents":125,"faqs":126,"seo_title":127,"seo_description":49,"update_tm":113,"read_time":67},687197207057,"https://ap-avatar.wpscdn.com/davatar_29158cc5080c5b710cf443261637dec0","| Model | Size (MB) | Parameters (M) | Input size | Output size | Extraction time |\n| --- | --- | --- | --- | --- | --- |\n| InceptionV3 | 96.1 | 21.8 | 299 x 299 x 3 | 2048 | 8 min 7s |\n| Xception | 91.8 | 20.8 | 299 x 299 x 3 | 2048 | 7 min 5s |\n| EfficientNetV2S | 87.5 | 20.3 | 384 x 384 x 3 | 1280 | 9 min 30s |\n\n| Model | Training |  | Validation |  |  |  |\n| --- | --- | --- | --- | --- | --- | --- |\n|  | Loss | Acc | Val Loss | Val Acc | Best Loss | Best Acc |\n| InceptionV3 | 1.1549 | 0.6651 | 7.3334 | 0.2642 | 4.7718 | 0.2802 |\n| Xception | 0.8460 | 0.7500 | 7.2090 | 0.2164 | 4.8841 | 0.2735 |\n| EfficientNetV2S | 0.5043 | 0.8293 | 6.6415 | 0.2828 | 4.6918 | 0.3227 |\n\n\n| Model | BLEU |  |  |  | Meteor |\n| --- | --- | --- | --- | --- | --- |\n|  | B1 | B2 | B3 | B4 |  |\n| InceptionV3 | 0.3459 | 0.1608 | 0.1112 | 0.0559 | 0.2508 |\n| Xception | 0.3934 | 0.1980 | 0.1396 | 0.0727 | 0.2834 |\n| EfficientNetV3S | 0.4721 | 0.2847 | 0.2125 | 0.1224 | 0.3624 |\n\n\n| Model | Training |  | Validation |  |  |  |\n| --- | --- | --- | --- | --- | --- | --- |\n|  | loss | acc | val loss | val acc | best loss | best acc |\n| LSTM | 0,7415 | 0,7503 | 6,2567 | 0,2988 | 4,7971 | 0,3252 |\n| GRU | 0,5043 | 0,8293 | 6,6415 | 0,2828 | 4,6918 | 0,3227 |\n| Bi-LSTM | 0,8072 | 0,7302 | 6,1327 | 0,3015 | 4,8809 | 0,3253 |\n| Bi-GRU | 0,6287 | 0,7852 | 6,6776 | 0,2882 | 4,7034 | 0,3293 |\n\n\n| Model | BLEU |  |  |  | Meteor |\n| --- | --- | --- | --- | --- | --- |\n|  | B1 | B2 | B3 | B4 |  |\n| LSTM | 0.4600 | 0.2761 | 0.2052 | 0.1174 | 0.3618 |\n| GRU | 0.4721 | 0.2847 | 0.2125 | 0.1224 | 0.3624 |\n| Bi-LSTM | 0.4687 | 0.2815 | 0.2104 | 0.1229 | 0.3596 |\n| Bi-GRU | 0.4714 | 0.2912 | 0.2207 | 0.1292 | 0.3648 |\n\n| Model | Training |  | Validation |  |  |  | Time/ epoch (s) |\n| --- | --- | --- | --- | --- | --- | --- | --- |\n|  | loss | acc | val loss | val acc | best loss | best acc |  |\n| 117 | 0.6287 | 0.7852 | 6.6776 | 0.2882 | 4.7034 | 0.3293 | 16 |\n| 256 | 0.6873 | 0.7726 | 6.5999 | 0.3099 | 4.5578 | 0.3089 | 36 |\n| 512 | 0.9137 | 0.7120 | 6.1890 | 0.2976 | 4.2148 | 0.3104 | 71 |\n| 1024 | 1.3186 | 0.6177 | 5.2130 | 0.3016 | 3.8268 | 0.3169 | 141 |\n| 2048 | 1.7510 | 0.5330 | 4.3817 | 0.3241 | 0.3555 | 0.3363 | 254 |\n| 4096 | 2.2066 | 0.4527 | 3.6821 | 0.3528 | 3.3398 | 0.3580 | 574 |\n| 6000 | 2.4194 | 0.4232 | 3.5041 | 0.3513 | 3.2450 | 0.3585 | 847 |\n\n| No | Image, BLEU-1 and Meteor Score | Predicted and Target Caption |\n| --- | --- | --- |\n| 1 | \u003Cbr>Best Score:\u003Cbr>BLEU-1 = 1.0, Meteor = 0.9609 | Predicted caption:\u003Cbr>seorang anak laki-laki bermain di slide merah Target caption:\u003Cbr>1. seorang anak di slide merah\u003Cbr>2. seorang anak laki-laki duduk di seluncuran ditaman bermain\u003Cbr>3. seorang anak lelaki menggeser slide pembuka botol berwarna merah cerah\u003Cbr>4. seorang anak laki-laki menggeser slide merah\u003Cbr>5. seorang anak lelaki mengenakan pakaian biru meluncur turun slide merah |\n| 2 | \u003Cbr>Worst score:\u003Cbr>BLEU-1 = 0.0811, Meteor = 0. 2701 | Predicted caption:\u003Cbr>seorang anak melarikan diri melarikan dirimelarikan diri melarikan diri melarikan diri\u003Cbr>melarikan diri melarikan diri melarikan diri\u003Cbr>melarikan diri melarikan diri melarikan diri\u003Cbr>melarikan diri melarikan diri melarikan diri\u003Cbr>melarikan diri melarikan diri melarikan diri Target caption:\u003Cbr>1. seorang anak laki-laki menendang tumpukandaun\u003Cbr>2. seorang anak laki-laki dengan kemeja birumenendang daun mati dari tumpukan daun\u003Cbr>3. seorang anak dengan atasan biru melompat ke tumpukan daun di depan pohon\u003Cbr>4. seorang bocah lelaki berbaju biru berlari melewati tumpukan daun cokelat\u003Cbr>5. seorang anak lelaki berdiri dengan kakiterangkat di tumpukan besar daun |\n| 3 | \u003Cbr>Random image choice:\u003Cbr>BLEU-1 = 0. 7118, Meteor = 0. 5512 | Predicted caption:\u003Cbr>seekor anjing cokelat dan putih bermain tenis Target caption:\u003Cbr>1. seekor anjing besar berdiri di atas kakinya ketika bola tenis dilemparkan ke arahnya\u003Cbr>2. seekor anjing cokelat dan putih di depangubuk kewalahan oleh serangan bola tenis\u003Cbr>3. seekor anj","cbCaicyQUTNxMmdi","https://ap.wps.com/l/cbCaicyQUTNxMmdi","pdf",473642,12,"Indonesian","# Model dan ukuran\n## Perbandingan arsitektur\n# Pelatihan dan validasi\n## Loss dan akurasi\n# Kualitas caption\n## BLEU dan Meteor\n# Contoh prediksi\n## Best score, worst score, dan random choice","[{\"question\":\"Model apa saja yang dibandingkan untuk image captioning?\",\"answer\":\"InceptionV3, Xception, dan EfficientNetV2S dibandingkan untuk model utama, serta LSTM, GRU, Bi-LSTM, dan Bi-GRU untuk pendekatan sekuensial.\"},{\"question\":\"Metrik apa yang digunakan untuk menilai kualitas caption yang dihasilkan?\",\"answer\":\"Kualitas caption dinilai menggunakan BLEU (B1 sampai B4) dan Meteor, dengan membandingkan caption prediksi terhadap caption target.\"},{\"question\":\"Apa yang ditunjukkan pada bagian contoh terbaik, terburuk, dan pilihan acak?\",\"answer\":\"Bagian tersebut menampilkan caption prediksi dan caption target untuk contoh best score, worst score, serta random image choice, sehingga terlihat perbedaan tingkat akurasi deskripsi gambar.\"}]","Image Captioning模型训练与评估结果对比 | PDF"]