[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-123709-es":3,"doc-seo-123709-110":30,"detail-sidebar-cat-0-es-110":92},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":20,"is_downloadable":20,"audit_status":20,"page_count":21,"language":22,"language_code":23,"site_id":24,"html_lang":23,"table_of_contents":25,"faqs":26,"seo_title":27,"seo_description":14,"update_tm":28,"read_time":29},123709,962084925502,"Lucas Martin","https://ap-avatar.wpscdn.com/davatar_6f874abed73319feea01a86fa6f0fab8",41,"Investigación e Informes","Máster Interuniversitario en Ciencia de Datos - Análisis del rendimiento de modelos de aprendizaje automático sobre datos anonimizados","La gran cantidad de datos abiertos disponibles exige técnicas que garanticen su seguridad antes del tratamiento y análisis posterior. El estudio se centra en la anonimización, analizando la distribución de cuasi-identificadores y atributos sensibles en una base de datos. Se exploran tres técnicas clásicas—k-anonimato, l-diversidad y t-cercanía—y se estudian los ataques que cada una previene. Además, se evalúa una batería de modelos de Machine Learning sobre datos anonimizados, variando técnica y nivel de anonimización. El código se desarrolla en Python y los datasets se anonimizan con ARX.","Máster Interuniversitario en Ciencia de Datos  \nANÁLISIS DEL RENDIMIENTO DEMODELOS DE APRENDIZAJE  \nAUTOMÁTICO SOBRE DATOS ANONIMIZADOS (Analyzing the performance of machine learning models on anonymized data)  \nTrabajo de Fin de Master para acceder al  \nMÁSTER EN CIENCIA DE DATOS  \nAutora: Carmen Marcos Sánchez de la Blanca  \nDirectora: Judith Sáinz-Pardo Díaz  \nCo-Director: Álvaro López García Julio-2023  \nResumen  \nLa gran cantidad de datos abiertos disponibles hace necesario el estudio y desarrollo detécnicas que garanticen la seguridad de dichos datos para su posterior tratamiento y análisis. En concreto, el estudio de las técnicas de anonimización se centra en el análisis dela distribución de los cuasi-identificadores y atributos sensibles en una base de datos. Existen muchas técnicas que pueden aplicarse, cada una de de ellas pueden evitar distintostipos de ataques.  \nEn este estudio se exploran tres técnicas de anonimización clásicas, su bases teóricasy diferentes tipos de ataques que previenen: k-anonimato, l-diversidad y t-cercania. Además, se utilzan diferentes herramientas para garantizar la fiabilidad de estas técnicas, que son aplicadas a diferentes niveles sobre dos conjuntos de datos en abierto, tras pre definir diferentes jerarquías sobre los cuasi-identificadores.  \nA continuación, se estudiará el rendimiento de una batería de modelos de Machine Learning aplicado en los datos anonimizados presentados anteriormente. Se generarán un amplio rango de resultados experimentales, variando la técnica de anonimización empleada, así como el nivel establecido.  \nTodo el código es desarrollado en Python, y distribuido mediante un repositorio de datos en abierto. Además, los datasets han sido anonimizados utilizando el Software ARX.  \nPalabras clave: anonimización, aprendizaje automático, análisis de rendimiento, privacidad, k-anonimato.  \nAbstract  \nThe large amount of open data available makes it necessary to study and develop techniques that guarantee its security for processing and analysis. Specifically, the study of anonymization techniques focuses on analyzing the distribution of the quasi-identifiersand sensitive attributes in a database. There are numerous techniques that can be applied, each of which can prevent different types of attacks.  \nThe present study explores three classical anonymity techniques, their theoretical basis and the kind of attacks they prevent: k-anonymity, ℓ-diversity and t-closeness. Specifically, different tools are used to ensure the reliability of these techniques which are applied at various levels on two open-access datasets, after pre-defining different hierarchies for the quasi-identifiers.  \nNext, the performance of a battery of machine learning models applied on the anonymized data is studied. A wide range of experimental results is carried out, varying the anonymization technique employed, as well as the level established.  \nAll the code developed is written in Python and is distributed through an open source repository. In addition, the datasets were anonymized using the ARX Software.  \nKeywords: anonymization, machine learning, performance analysis, privacy, k-anonymity.  \nAcronyms  \nAB Adaptive Boosting.  \nANN Artificial Neural Network.  \nAUC Area under the ROC Curve.  \nDL Deep Learning.  \nGB Gradient Boosting.  \nGDPR General Data Protection Regulation.  \nKNN k-nearest neighbors algorithm.  \nKRR Kernel Ridge Regression.  \nML Machine Learning.  \nQI Quasi-identifier.  \nRF Random Forest.  \nROC Curve Receiver operating characteristic Curve.  \nSA Sensible attribute.  \nSVM Support vector machine.  \nContents  \n1 Introduction 1  \n1.1 Motivation and objectives .......................... 1  \n1.2 State of the art ................................ 1  \n1.2.1 Data anonymization ........................ 2  \n1.2.2 Machine Learning Models ..................... 3  \n1.2.3 Performance analysis over ML models ............... 4  \n1.3 Structure of the work ............................ 4  \n2 Classic ","cbCaitZ8nPIRpT2u","https://ap.wps.com/l/cbCaitZ8nPIRpT2u","pdf",1677704,1,62,"Spanish","es",110,"# Introducción\n## Motivación y objetivos\n## Estado del arte\n### Anonimización de datos\n### Modelos de Machine Learning\n### Análisis del rendimiento sobre modelos de ML\n## Estructura del trabajo\n# Herramientas clásicas de anonimización\n## Conceptos principales\n## Técnicas de anonimización más utilizadas\n### k-anonimato\n### l-diversidad\n### t-cercanía\n# Metodología y desarrollo\n## Conjuntos de datos analizados\n### Caso de uso 1: Diabetes Dataset\n### Caso de uso 2: Bank Marketing Dataset\n## Modelos bajo estudio\n## Software utilizado y disponibilidad del código\n### Herramienta ARX de anonimización de datos\n### Entorno de cómputo\n# Resultados y análisis\n## Caso de uso 1: Diabetes Dataset\n### Proceso de anonimización\n### Curado y limpieza de datos\n### Modelos de aprendizaje automático: resultados y discusión\n## Caso de uso 2: Bank Dataset\n### Proceso de anonimización\n### Tratamiento de datos desbalanceados\n### Modelos de aprendizaje automático: resultados y discusión\n# Conclusiones y trabajo futuro\n## Bibliografía","[{\"question\":\"¿En qué se centra el estudio sobre anonimización y privacidad?\",\"answer\":\"Analiza técnicas de anonimización estudiando la distribución de cuasi-identificadores y atributos sensibles. El objetivo es reducir el riesgo frente a distintos tipos de ataques.\"},{\"question\":\"¿Qué técnicas de anonimización se evalúan y qué ataques previenen?\",\"answer\":\"Se exploran tres técnicas clásicas: k-anonimato, l-diversidad y t-cercanía. Para cada una se consideran su base teórica y los ataques que ayuda a prevenir.\"},{\"question\":\"¿Cómo se estudia el rendimiento de los modelos de Machine Learning?\",\"answer\":\"Se aplica una batería de modelos de Machine Learning a datos anonimizados y se generan resultados experimentales. Los experimentos varían la técnica de anonimización y el nivel establecido, tras definir jerarquías para los cuasi-identificadores.\"}]","Máster Interuniversitario en Ciencia de Datos - Análisis del rendimiento de modelos de aprendizaje automático sobre datos anonimizados | PDF",1785818125,95,{"code":4,"msg":31,"data":32},"ok",{"site_id":24,"language":23,"slug":33,"title":13,"keywords":34,"description":14,"schema_data":35,"social_meta":87,"head_meta":89,"extra_data":91,"updated_unix":28},"interuniversity-master-in-data-science-performance-analysis-of-machine-learning-models-on-anonymized-data","",{"@graph":36,"@context":86},[37,54,69],{"@type":38,"itemListElement":39},"BreadcrumbList",[40,44,48,51],{"item":41,"name":42,"@type":43,"position":20},"https://docshare.wps.com","Home","ListItem",{"item":45,"name":46,"@type":43,"position":47},"https://docshare.wps.com/es/document/","Document",2,{"item":49,"name":12,"@type":43,"position":50},"https://docshare.wps.com/es/document/investigación-e-informes/",3,{"item":52,"name":13,"@type":43,"position":53},"https://docshare.wps.com/es/document/interuniversity-master-in-data-science-performance-analysis-of-machine-learning-models-on-anonymized-data/123709/",4,{"url":52,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":23,"description":14,"dateModified":62,"datePublished":63,"encodingFormat":61,"isAccessibleForFree":64,"interactionStatistic":65},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":41,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-17","2026-08-04",true,{"@type":66,"interactionType":67,"userInteractionCount":20},"InteractionCounter",{"@type":68},"ViewAction",{"@type":70,"mainEntity":71},"FAQPage",[72,78,82],{"name":73,"@type":74,"acceptedAnswer":75},"¿En qué se centra el estudio sobre anonimización y privacidad?","Question",{"text":76,"@type":77},"Analiza técnicas de anonimización estudiando la distribución de cuasi-identificadores y atributos sensibles. El objetivo es reducir el riesgo frente a distintos tipos de ataques.","Answer",{"name":79,"@type":74,"acceptedAnswer":80},"¿Qué técnicas de anonimización se evalúan y qué ataques previenen?",{"text":81,"@type":77},"Se exploran tres técnicas clásicas: k-anonimato, l-diversidad y t-cercanía. Para cada una se consideran su base teórica y los ataques que ayuda a prevenir.",{"name":83,"@type":74,"acceptedAnswer":84},"¿Cómo se estudia el rendimiento de los modelos de Machine Learning?",{"text":85,"@type":77},"Se aplica una batería de modelos de Machine Learning a datos anonimizados y se generan resultados experimentales. Los experimentos varían la técnica de anonimización y el nivel establecido, tras definir jerarquías para los cuasi-identificadores.","https://schema.org",{"og:url":52,"og:type":88,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":90,"canonical":52},"index,follow",{"doc_id":7,"site_id":24},{"code":4,"msg":5,"data":93},[94,99,103,107,111,113,117,121,125,129],{"id":95,"doc_module":4,"doc_module_name":46,"category_name":96,"show_sort_weight":97,"slug":98},39,"Cómic",60,"comic",{"id":100,"doc_module":4,"doc_module_name":46,"category_name":101,"show_sort_weight":97,"slug":102},43,"Estilo de Vida","lifestyle",{"id":104,"doc_module":4,"doc_module_name":46,"category_name":105,"show_sort_weight":97,"slug":106},38,"Examen","exam",{"id":108,"doc_module":4,"doc_module_name":46,"category_name":109,"show_sort_weight":97,"slug":110},44,"General","general",{"id":11,"doc_module":4,"doc_module_name":46,"category_name":12,"show_sort_weight":97,"slug":112},"research-report",{"id":114,"doc_module":4,"doc_module_name":46,"category_name":115,"show_sort_weight":97,"slug":116},37,"Literatura","literature",{"id":118,"doc_module":4,"doc_module_name":46,"category_name":119,"show_sort_weight":97,"slug":120},22,"Relatos y Novelas","story-novel",{"id":122,"doc_module":4,"doc_module_name":46,"category_name":123,"show_sort_weight":97,"slug":124},42,"Religión y Espiritualidad","religion-spirituality",{"id":126,"doc_module":4,"doc_module_name":46,"category_name":127,"show_sort_weight":97,"slug":128},40,"Salud y Atención Médica","healthcare",{"id":130,"doc_module":4,"doc_module_name":46,"category_name":131,"show_sort_weight":97,"slug":132},24,"Tecnología","technology"]