[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-117466-en":3,"doc-seo-117466-105":30,"detail-sidebar-cat-0-en-105":92},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":20,"is_downloadable":20,"audit_status":20,"page_count":21,"language":22,"language_code":23,"site_id":24,"html_lang":23,"table_of_contents":25,"faqs":26,"seo_title":27,"seo_description":14,"update_tm":28,"read_time":29},117466,1374391975076,"Riley","https://ap-avatar.wpscdn.com/avatar/14000253ca4ec9f6853?x-image-process=image/resize,m_fixed,w_180,h_180&k=1783305029341752051",8,"Research & Report","Machine Learning in Used Car Pricing - Development of a Database for Regression Models","The buying and selling of used cars is vital to the Brazilian economy and urban mobility, yet setting an accurate used-car price remains challenging. The project applies machine learning to improve pricing accuracy by building a comprehensive dataset from OLX Brazil using web scraping with Scrapy. After exploratory data analysis, the work performs data cleaning and preparation to train supervised regression models. Results are promising, particularly with the Random Forest model, achieving strong fit and low prediction error.","Aprendizado de Mquina na Precificac¸ o de Carros Usados: desenvolvimento de uma base de dados para modelos de regresso  \nMachine Learning in Used Car Pricing: Development of a Database  \nfor Regression Models  \nPedro P. O. Moura 1 , Raphael Barbosa Holmes 1 , Sheyla Natlia de Medeiros 1  \n1 Anlise e Desenvolvimento de Sistemas – Instituto Federal de Pernambuco  \nPaulista – PE – Brasil  \n[ppom@discente.ifpe.edu.br](ppom@discente.ifpe.edu.br) , [rhb@discente.ifpe.edu.br](rhb@discente.ifpe.edu.br) ,  \n[sheyla.medeiros@paulista.ifpe.edu.br](sheyla.medeiros@paulista.ifpe.edu.br)  \nResumo. A compra e venda de carros usados e´ uma atividade vital para a economia brasileira e para o acesso a` mobilidade urbana, especialmente em um cen a´rio de aumentodos prec¸os de veı´culos novos. No entanto, determinar o prec¸o de um carro usado pode ser desafiador. Este trabalho explora o uso de t e´cnicas de aprendizado de ma´quina para aprimorar a acura´cia na precificac¸ a˜o de automo´veis usados. Desenvolveu-se um conjunto de dados abrangente, extra ´ıdo da plataforma OLX Brasil por meio de raspagem de dadosutilizando Scrapy. A seguir, realizou-se uma ana´lise explorato´ria dos dados, ale´m de limpeza e preparac¸ ˜ao para o treinamento de diversos modelos de aprendizado supervisionado voltados para regressa˜o. Os resultados mostraram-se promissores, especialmente com o modelo de Floresta Aleat o´ ria, que alcanc¸ou um coeficiente de determinac¸ a˜o de 0,9434 eum erro me´dio absoluto de 4855,27. Estes resultados indicam que modelos de regress a˜opodem ser eficazes na previsa˜o de prec¸os de veı´culos com base em suas caracter ı´sticas, esugerem a necessidade de investigac¸ es adicionais para aprimorar ainda mais as te´cnicas de precificac¸ a˜o de carros usados.  \nPalavras-chave: Aprendizado de M˜ quina, Aprendizado Supervisionado, Raspagem de  \nDados, Anlise de Dados, Regressao  \nAbstract. The buying and selling of used cars is a vital activity for the Brazilian economy and for access to urban mobility, especially in a scenario of rising new vehicle prices. However, determining the fair price of a used car can be challenging. This final year project explores the use of Machine Learning techniques to improve the accuracy of used car pricing. A comprehensive dataset was developed, extracted from the OLX Brazil platform through Web Scraping using Scrapy. Subsequently, exploratory data analysis was carried out, as well as cleaning and preparation for training various supervised learning models focused on regression. The results were promising, especially with the Random Forest model, which achieved a determination coefficient of 0 . 9434 and a mean absolute error of 4855.27. These results indicate that regression models can be effective in predicting vehicle prices based on their characteristics, and suggest the need for further investigations to further improve used car pricing techniques.  \nKeywords: Machine Learning, Supervised Learning, Web Scraping, Data Analysis, Re gression  \nInstituto Federal de Educac¸ o, Cincias e Tecnologia de Pernambuco. Campus Paulista. Curso de 1 Anlise e Desenvolvimento de Sistemas. 4 de Novembro de 2024 .  \n1. Introduc¸ o  \nA compra de ve´ıculos usados oferece uma altern˜ativa mais acess´ıvel para quem busca mobilidade, sendo essencial para a aut˜onomia em diversas regioes do Brasil. Em 2024, as vendas de carros usados  \ncresceram 14% em relac¸ao ao ano anterior, totalizando 766.558 unidades em janeiro, enquanto oscarros novos somaram apenas 118.507 no mesmo per´ıodo, quase sete vezes menos (DREHMER, 2024) . Essa disparidade reflete a alta demanda por ve´ıculos mais acess´ıveis no mercado automotivo brasileiro.  \nNesse contexto, a tabela FIPE desempenha um papel crucial. Criada para fornecer uma referncia confivel na determinac¸ o do valor de mercado˜ de ve´ıculos usados, a tabela˜ FIPE  atualizadamensalm˜ente com base em dados coletados de transac¸oes reais. Esta ferramenta nao s influencia as  \nnegociac¸oes comerci","cbCaipbBetH9gtLf","https://ap.wps.com/l/cbCaipbBetH9gtLf","pdf",589871,1,20,"English","en",105,"# Introduction\n## Context: used vs. new car demand in Brazil\n## FIPE table and its limitations\n## Role of data scraping and machine learning","[{\"question\":\"Why is used car pricing considered challenging in this work?\",\"answer\":\"The document explains that fair pricing is difficult because market price estimation often lacks individual vehicle-specific details.\"},{\"question\":\"How was the dataset for the regression models created?\",\"answer\":\"A comprehensive dataset was extracted from OLX Brazil using web scraping implemented with Scrapy.\"},{\"question\":\"Which regression model performed best and what were its results?\",\"answer\":\"The Random Forest model delivered the most promising outcome, with a determination coefficient of 0.9434 and a mean absolute error of 4855.27.\"}]","Machine Learning in Used Car Pricing - Development of a Database for Regression Models | PDF",1785675991,50,{"code":4,"msg":31,"data":32},"ok",{"site_id":24,"language":23,"slug":33,"title":13,"keywords":34,"description":14,"schema_data":35,"social_meta":87,"head_meta":89,"extra_data":91,"updated_unix":28},"machine-learning-in-used-car-pricing-development-of-a-database-for-regression-models","",{"@graph":36,"@context":86},[37,54,69],{"@type":38,"itemListElement":39},"BreadcrumbList",[40,44,48,51],{"item":41,"name":42,"@type":43,"position":20},"https://docshare.wps.com","Home","ListItem",{"item":45,"name":46,"@type":43,"position":47},"https://docshare.wps.com/document/","Document",2,{"item":49,"name":12,"@type":43,"position":50},"https://docshare.wps.com/document/research-report/",3,{"item":52,"name":13,"@type":43,"position":53},"https://docshare.wps.com/document/machine-learning-in-used-car-pricing-development-of-a-database-for-regression-models/117466/",4,{"url":52,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":23,"description":14,"dateModified":62,"datePublished":63,"encodingFormat":61,"isAccessibleForFree":64,"interactionStatistic":65},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":41,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-05","2026-08-02",true,{"@type":66,"interactionType":67,"userInteractionCount":20},"InteractionCounter",{"@type":68},"ViewAction",{"@type":70,"mainEntity":71},"FAQPage",[72,78,82],{"name":73,"@type":74,"acceptedAnswer":75},"Why is used car pricing considered challenging in this work?","Question",{"text":76,"@type":77},"The document explains that fair pricing is difficult because market price estimation often lacks individual vehicle-specific details.","Answer",{"name":79,"@type":74,"acceptedAnswer":80},"How was the dataset for the regression models created?",{"text":81,"@type":77},"A comprehensive dataset was extracted from OLX Brazil using web scraping implemented with Scrapy.",{"name":83,"@type":74,"acceptedAnswer":84},"Which regression model performed best and what were its results?",{"text":85,"@type":77},"The Random Forest model delivered the most promising outcome, with a determination coefficient of 0.9434 and a mean absolute error of 4855.27.","https://schema.org",{"og:url":52,"og:type":88,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":90,"canonical":52},"index,follow",{"doc_id":7,"site_id":24},{"code":4,"msg":5,"data":93},[94,98,102,106,111,115,120,123,127,130,134],{"id":20,"doc_module":4,"doc_module_name":46,"category_name":95,"show_sort_weight":96,"slug":97},"Story & Novel",90,"story-novel",{"id":47,"doc_module":4,"doc_module_name":46,"category_name":99,"show_sort_weight":100,"slug":101},"Literature",80,"literature",{"id":53,"doc_module":4,"doc_module_name":46,"category_name":103,"show_sort_weight":104,"slug":105},"Exam",70,"exam",{"id":107,"doc_module":4,"doc_module_name":46,"category_name":108,"show_sort_weight":109,"slug":110},5,"Comic",60,"comic",{"id":112,"doc_module":4,"doc_module_name":46,"category_name":113,"show_sort_weight":29,"slug":114},6,"Technology","technology",{"id":116,"doc_module":4,"doc_module_name":46,"category_name":117,"show_sort_weight":118,"slug":119},7,"Healthcare",40,"healthcare",{"id":11,"doc_module":4,"doc_module_name":46,"category_name":12,"show_sort_weight":121,"slug":122},30,"research-report",{"id":124,"doc_module":4,"doc_module_name":46,"category_name":125,"show_sort_weight":21,"slug":126},9,"Religion & Spirituality","religion-spirituality",{"id":21,"doc_module":4,"doc_module_name":46,"category_name":128,"show_sort_weight":21,"slug":129},"World Cup","world-cup",{"id":131,"doc_module":4,"doc_module_name":46,"category_name":132,"show_sort_weight":131,"slug":133},10,"Lifestyle","lifestyle",{"id":135,"doc_module":4,"doc_module_name":46,"category_name":136,"show_sort_weight":107,"slug":137},19,"General","general"]