[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-124723-pt":3,"doc-seo-124723-112":31,"detail-sidebar-cat-0-pt-112":92},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":21,"is_downloadable":21,"audit_status":21,"page_count":22,"language":23,"language_code":24,"site_id":25,"html_lang":24,"table_of_contents":26,"faqs":27,"seo_title":28,"seo_description":14,"update_tm":29,"read_time":30},124723,962084925502,"Lucas Martin","https://ap-avatar.wpscdn.com/davatar_6f874abed73319feea01a86fa6f0fab8",32,"Pesquisa e Relatórios","Classificação de Câncer de Pâncreas - utilizando Técnicas de Imputação de Dados Faltantes e Undersampling Baseado em Clusterização","Dados faltantes e desbalanceamento de classes são problemas frequentes em bases de dados de cenários reais, inclusive na classificação de câncer. Quando não tratados adequadamente antes da análise, afetam o desempenho de modelos de Machine Learning (ML). Este trabalho propõe uma abordagem combinada com imputação de dados faltantes por kNN e undersampling baseado em clusterização por k-means, voltada à classificação do câncer de pâncreas. Subconjuntos foram gerados por combinações de pré-processamento e avaliados em um pipeline que executa dez classificadores, apresentando melhorias significativas (p\u003C0,05).","CLASSIFICAÇÃO DE CÂNCER DE PÂNCREAS UTILIZANDOTÉCNICAS DE IMPUTAÇÃO DE DADOS FALTANTES EUNDERSAMPLING BASEADO EM CLUSTERIZAÇÃO: uma análise comparativa com diferentes algoritmos de Machine Learning  \nPANCREATIC CANCER CLASSIFICATION USING MISSING DATA IMPUTATION AND CLUSTER-BASED UNDERSAMPLING METHODS: a comparative analysis with multiple Machine Learning algorithms  \nWanessa Layssa Batista de Sena  \n[wlbs@a.recife.ifpe.edu.br](wlbs@a.recife.ifpe.edu.br)  \nRenata Freire de Paiva Neves  \n[renatafreire@recife.ifpe.edu.br](renatafreire@recife.ifpe.edu.br)  \nRESUMO  \nDados faltantes e desbalanceamento de classes são problemas frequentementeobservados em bases de dados associadas a cenários reais, o que inclui a classificação de câncer. Caso estes problemas não sejam endereçados de forma adequada antes da análise, impactos no desempenho de modelos de Machine Learning (ML) podem ser observados. Neste artigo, é proposta uma soluçãocombinada a partir da inserção de dados faltantes utilizando a técnica de kNN (k vizinhos mais próximos) e undersampling baseado em clusterização utilizando kmeans , com foco na classificação do câncer de pâncreas. Diferentes subconjuntos de dados foram gerados a partir da combinação de diferentes métodos de pré processamento e o desempenho analisado utilizando um pipeline de análise de ML de um estudo prévio. Este pipeline executa dez algoritmos de ML, incluindo Random Forest, Máquina de Vetores de Suporte e Redes Neurais Artificiais. Todos os subconjuntos de dados gerados apresentaram um aumento significativo (p\u003C0,05 comteste-t de Student) no desempenho para a maioria dos algoritmos de ML quando comparados aos resultados obtidos anteriormente quando o pipeline foi avaliadopela primeira vez. Os resultados sugerem que kNN e k-means são métodos que podem ser utilizados na fase de pré-processamento dos dados para solucionar problemas de dados faltantes e desbalanceamento de classes e melhorar a acurácia da classificação.  \nPalavras-chave: Machine Learning; Clusterização k-means; kNN; Undersampling; Imputação de dados faltantes; Classificação.  \nABSTRACT  \nMissing values and class imbalance are issues frequently found in databases from real-world scenarios, including cancer classification. Impacts on the performance of Machine Learning (ML) models can be observed if these issues are not properly addressed prior to the analysis. In this paper, a combined solution with missing data imputation using kNN (k-nearest neighbors) and cluster-based undersampling using k-means is proposed, focusing on pancreatic cancer classification. Different data subsets were generated by combining different preprocessing methods and the performance was analyzed using a ML analysis pipeline from a previous study. This pipeline implements ten ML classifiers, including Random Forest, Support Vector Machine and Artificial Neural Network. All data subsets presented a significant improvement (p\u003C0 .05 with Student’s T-Test) in the performance of most ML algorithms when compared with the results obtained when the pipeline was first evaluated. Results suggest that kNN and k-means can be used in the data preprocessing phase to overcome missing values and class imbalance issues and improve the classification accuracy.  \nKeywords: Machine Learning; K-means clustering; kNN; Undersampling; Missing data imputation; Classification.  \n1 INTRODUÇÃO  \nO câncer de pâncreas é a sétima causa de morte por câncer em ambos os gêneros, apresentando taxas de incidência e mortalidade semelhantes – 495.773 novos casos e 466.003 mortes registradas em 2020, de acordo com Sung et al.(2021) . Projeções indicam que o câncer de pâncreas se tornará a terceira causa de morte por câncer até 2025, ultrapassando o câncer de mama (SUNG et al. , 2021) . Além das características biológicas inerentes ao câncer de pâncreas, que conferemum comportamento agressivo e um alto potencial metastático a esses tumores, odiagnóstico continua a ser um desafio devido à ausência de métodos","cbCaibJlkeoahAMU","https://ap.wps.com/l/cbCaibJlkeoahAMU","pdf",574092,2,1,15,"Portuguese","pt",112,"# Introdução\n## Problema: desbalanceamento e dados faltantes\n## Objetivo do trabalho\n## Estrutura do artigo","[{\"question\":\"Quais problemas afetam a classificação de câncer de pâncreas em modelos de Machine Learning?\",\"answer\":\"O documento destaca dois problemas principais: valores ausentes (dados faltantes) e desbalanceamento de classes, comuns em bases reais ligadas a registros médicos.\"},{\"question\":\"Qual abordagem combinada é proposta para tratar dados faltantes e desbalanceamento?\",\"answer\":\"É proposta uma solução que combina imputação de dados faltantes com kNN e undersampling baseado em clusterização usando k-means.\"},{\"question\":\"Como o trabalho avalia o impacto dos métodos nos modelos?\",\"answer\":\"São gerados diferentes subconjuntos de dados a partir de combinações de pré-processamento, e o desempenho é analisado por um pipeline de ML que executa dez algoritmos, comparando resultados com uma avaliação inicial.\"}]","Classificação de Câncer de Pâncreas - utilizando Técnicas de Imputação de Dados Faltantes e Undersampling Baseado em Clusterização | PDF",1785894111,23,{"code":4,"msg":32,"data":33},"ok",{"site_id":25,"language":24,"slug":34,"title":13,"keywords":35,"description":14,"schema_data":36,"social_meta":87,"head_meta":89,"extra_data":91,"updated_unix":29},"pancreatic-cancer-classification-using-missing-data-imputation-and-cluster-based-undersampling","",{"@graph":37,"@context":86},[38,54,69],{"@type":39,"itemListElement":40},"BreadcrumbList",[41,45,48,51],{"item":42,"name":43,"@type":44,"position":21},"https://docshare.wps.com","Home","ListItem",{"item":46,"name":47,"@type":44,"position":20},"https://docshare.wps.com/pt/document/","Document",{"item":49,"name":12,"@type":44,"position":50},"https://docshare.wps.com/pt/document/pesquisa-e-relatórios/",3,{"item":52,"name":13,"@type":44,"position":53},"https://docshare.wps.com/pt/document/pancreatic-cancer-classification-using-missing-data-imputation-and-cluster-based-undersampling/124723/",4,{"url":52,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":24,"description":14,"dateModified":62,"datePublished":63,"encodingFormat":61,"isAccessibleForFree":64,"interactionStatistic":65},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":42,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-14","2026-08-05",true,{"@type":66,"interactionType":67,"userInteractionCount":20},"InteractionCounter",{"@type":68},"ViewAction",{"@type":70,"mainEntity":71},"FAQPage",[72,78,82],{"name":73,"@type":74,"acceptedAnswer":75},"Quais problemas afetam a classificação de câncer de pâncreas em modelos de Machine Learning?","Question",{"text":76,"@type":77},"O documento destaca dois problemas principais: valores ausentes (dados faltantes) e desbalanceamento de classes, comuns em bases reais ligadas a registros médicos.","Answer",{"name":79,"@type":74,"acceptedAnswer":80},"Qual abordagem combinada é proposta para tratar dados faltantes e desbalanceamento?",{"text":81,"@type":77},"É proposta uma solução que combina imputação de dados faltantes com kNN e undersampling baseado em clusterização usando k-means.",{"name":83,"@type":74,"acceptedAnswer":84},"Como o trabalho avalia o impacto dos métodos nos modelos?",{"text":85,"@type":77},"São gerados diferentes subconjuntos de dados a partir de combinações de pré-processamento, e o desempenho é analisado por um pipeline de ML que executa dez algoritmos, comparando resultados com uma avaliação inicial.","https://schema.org",{"og:url":52,"og:type":88,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":90,"canonical":52},"index,follow",{"doc_id":7,"site_id":25},{"code":4,"msg":5,"data":93},[94,99,103,107,111,115,119,121,125,129],{"id":95,"doc_module":4,"doc_module_name":47,"category_name":96,"show_sort_weight":97,"slug":98},26,"Contos e Romances",60,"story-novel",{"id":100,"doc_module":4,"doc_module_name":47,"category_name":101,"show_sort_weight":97,"slug":102},46,"Estilo de Vida","lifestyle",{"id":104,"doc_module":4,"doc_module_name":47,"category_name":105,"show_sort_weight":97,"slug":106},28,"Exames","exam",{"id":108,"doc_module":4,"doc_module_name":47,"category_name":109,"show_sort_weight":97,"slug":110},47,"Geral","general",{"id":112,"doc_module":4,"doc_module_name":47,"category_name":113,"show_sort_weight":97,"slug":114},29,"Histórias em Quadrinhos","comic",{"id":116,"doc_module":4,"doc_module_name":47,"category_name":117,"show_sort_weight":97,"slug":118},27,"Literatura","literature",{"id":11,"doc_module":4,"doc_module_name":47,"category_name":12,"show_sort_weight":97,"slug":120},"research-report",{"id":122,"doc_module":4,"doc_module_name":47,"category_name":123,"show_sort_weight":97,"slug":124},33,"Religião e Espiritualidade","religion-spirituality",{"id":126,"doc_module":4,"doc_module_name":47,"category_name":127,"show_sort_weight":97,"slug":128},31,"Saúde e Cuidados","healthcare",{"id":130,"doc_module":4,"doc_module_name":47,"category_name":131,"show_sort_weight":97,"slug":132},45,"Tecnologia","technology"]