[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"detail-sidebar-cat-0-fr-114":3,"doc-seo-292472-114":48,"doc-detail-292472-fr":123},{"code":4,"msg":5,"data":6},0,"success",[7,13,18,21,24,28,32,36,40,44],{"id":8,"doc_module":4,"doc_module_name":9,"category_name":10,"show_sort_weight":11,"slug":12},67,"Document","Général",61,"general",{"id":14,"doc_module":4,"doc_module_name":9,"category_name":15,"show_sort_weight":16,"slug":17},66,"Art de vivre",60,"lifestyle",{"id":11,"doc_module":4,"doc_module_name":9,"category_name":19,"show_sort_weight":16,"slug":20},"Bande dessinée","comic",{"id":16,"doc_module":4,"doc_module_name":9,"category_name":22,"show_sort_weight":16,"slug":23},"Examen","exam",{"id":25,"doc_module":4,"doc_module_name":9,"category_name":26,"show_sort_weight":16,"slug":27},59,"Littérature","literature",{"id":29,"doc_module":4,"doc_module_name":9,"category_name":30,"show_sort_weight":16,"slug":31},64,"Recherche & Rapport","research-report",{"id":33,"doc_module":4,"doc_module_name":9,"category_name":34,"show_sort_weight":16,"slug":35},58,"Récits & Romans","story-novel",{"id":37,"doc_module":4,"doc_module_name":9,"category_name":38,"show_sort_weight":16,"slug":39},65,"Religion & Spiritualité","religion-spirituality",{"id":41,"doc_module":4,"doc_module_name":9,"category_name":42,"show_sort_weight":16,"slug":43},63,"Santé & Soins","healthcare",{"id":45,"doc_module":4,"doc_module_name":9,"category_name":46,"show_sort_weight":16,"slug":47},62,"Technologie","technology",{"code":4,"msg":49,"data":50},"ok",{"site_id":51,"language":52,"slug":53,"title":54,"keywords":55,"description":56,"schema_data":57,"social_meta":116,"head_meta":118,"extra_data":120,"updated_unix":122},114,"fr","scenario-missing-data-imputation","Scénario - Imputation de données manquantes","","Analyse des méthodes d’imputation de données manquantes sous R à partir de deux jeux de données : un jeu intégralement quantitatif puis un jeu combinant variables quantitatives et qualitatives. Plusieurs approches sont comparées et leur précision ainsi que leur robustesse sont évaluées quand le taux de valeurs manquantes augmente progressivement de 10% à 80%. La démarche inclut la transformation des variables, la création contrôlée de données manquantes et la mesure d’erreur sur un échantillon test.",{"@graph":58,"@context":115},[59,76,98],{"@type":60,"itemListElement":61},"BreadcrumbList",[62,67,70,73],{"item":63,"name":64,"@type":65,"position":66},"https://docshare.wps.com","Home","ListItem",1,{"item":68,"name":9,"@type":65,"position":69},"https://docshare.wps.com/fr/document/",2,{"item":71,"name":30,"@type":65,"position":72},"https://docshare.wps.com/fr/document/recherche-rapport/",3,{"item":74,"name":54,"@type":65,"position":75},"https://docshare.wps.com/fr/document/scenario-missing-data-imputation/292472/",4,{"url":74,"name":54,"@type":77,"image":78,"author":83,"headline":54,"publisher":86,"fileFormat":89,"inLanguage":52,"description":56,"dateModified":90,"datePublished":91,"encodingFormat":89,"isAccessibleForFree":92,"interactionStatistic":93},"DigitalDocument",{"url":79,"@type":80,"width":81,"height":82},"https://docshare.wps.com/thumbnails/scenario-missing-data-imputation/292472.png","ImageObject",300,407,{"name":84,"@type":85},"WPS_1786070896","Person",{"url":63,"name":87,"@type":88},"DocShare","Organization","application/pdf","2026-10-01","2026-09-17",true,{"@type":94,"interactionType":95,"userInteractionCount":97},"InteractionCounter",{"@type":96},"ViewAction",5,{"@type":99,"mainEntity":100},"FAQPage",[101,107,111],{"name":102,"@type":103,"acceptedAnswer":104},"Quel est l’objectif principal du scénario d’imputation de données manquantes ?","Question",{"text":105,"@type":106},"Tester et comparer plusieurs méthodes d’imputation sur des cas-types, en évaluant à la fois la précision et la robustesse des meilleures lorsque le taux de données manquantes augmente.","Answer",{"name":108,"@type":103,"acceptedAnswer":109},"Comment les données manquantes sont-elles créées pour l’évaluation ?",{"text":110,"@type":106},"Le scénario se limite au cas MCAR et retire artificiellement une proportion de valeurs, puis compare la complétion obtenue aux données retirées sur un échantillon test.",{"name":112,"@type":103,"acceptedAnswer":113},"Quelles méthodes sont identifiées comme les plus précises et comment leur robustesse est-elle étudiée ?",{"text":114,"@type":106},"SVD, missForest et AmeliaII donnent les meilleurs résultats. Leur comportement est ensuite analysé quand la quantité de données manquantes augmente de 10% à 80%.","https://schema.org",{"og:url":74,"og:type":117,"og:title":54,"og:site_name":87,"og:description":56},"article",{"robots":119,"canonical":74},"index,follow",{"doc_id":121,"site_id":51},292472,1790476470,{"code":4,"msg":5,"data":124},{"doc_id":121,"user_id":125,"nickname":84,"user_avatar":126,"doc_module":4,"category_id":29,"category_name":30,"doc_title":54,"doc_description":56,"doc_content":127,"file_id":128,"file_url":129,"file_type":130,"file_size":131,"view_count":97,"is_deleted":4,"is_public":66,"is_downloadable":66,"audit_status":66,"page_count":97,"language":132,"language_code":52,"site_id":51,"html_lang":52,"table_of_contents":133,"faqs":134,"seo_title":135,"seo_description":56,"update_tm":136,"read_time":137},549768072016,"https://ap-avatar.wpscdn.com/davatar_155a257f0dc6eb9ab79c44ca47cae57d","Scénario: Imputation de données manquantes  \nRésumé  \nExemples d'imputation de données manquantes sous R, sur deux de données. Un premier dont les variables sont toutes quantitativespuis un deuxième avec des variables quantitatives et qualitatives.  \nPlusieurs méthodes sont comparées, la robustesse des méthodes qui donne les meilleurs résultats est analysée en augmentant progressi vement le taux de données manquantes.  \n1 Objectif  \nTester des méthodes d'imputation de données manquantes sur des cas-types faciles à aborder. Comparer la précision des méthodes et la robustesse des meilleures. On commencera par un jeu de données quantitatif sur lesquellestoutes les méthodes d'imputation peuvent être testées. Nous passerons dans un second temps à des données hétérogènes, plus fréquemment rencontrées en cas concret.  \n2 Données quantitatives  \nOn s'intéresse dans un premier temps à un jeu de données quantitatives sur lesquelles on va pouvoir comparer un maximum de méthodes d'imputation. Ce jeu de données regroupe le cours des actifs boursiers sur la place de Paris de 2000 à 2005 . On considère 349 cours d'entreprises ou indices régulièrement cotés sur cette période.  \nLes données sont disponibles dans le ﬁchier Paris .dat ; les charger avant d'exécuter les lignes de code R.  \n2.1 Lecture des données  \n\\# lecture des données  \ndat=read .table (\"Paris2005 .dat\")  \nA noter que la plupart des méthodes d'imputation font des hypothèses de normalité . Une transformation des variables est souvent nécessaire :  \n\\# Les données ne sont visiblement pas gaussiennes boxplot (dat)  \nhist (dat[,1])  \nhist (dat[,50])  \n\\# Passage au log pour s ' en approcher  \ndat=log (dat+1)  \n\\# Vérification visuelle  \nboxplot (dat)  \nhist (dat[,1])  \nhist (dat[,50])  \n2.2 Création de données manquantes  \nEn se limitant au cas MCAR, on crée artiﬁciellement des données manquantes. On pourra ensuite comparer les résultats de la complétion avec les données retirées.  \n\\# initialisation du générateur  \nset .seed(42)  \n\\# Ratio de données manquantes  \ntest .ratio=0 .1  \n\\# Indices de l ' échantillon test  \nIND=which(! [is](is.na)[.](is.na)[na](is.na) (dat),arr.ind=TRUE) ntest=ceiling (dim (dat)[1] *test .ratio) ind.test=IND[ sample (1:dim (IND)[1],ntest),]  \n\\# Création des données manquantes  \ndat .test=dat[ind .test] dat .train=dat  \ndat .train[ind .test]=NA  \n2.3 Imputation  \n2.3.1 LOCF  \n\\# chargement de la bibliothèque library (zoo)  \ndat .locf=na .locf(dat .train,na .rm=FALSE)  \ndat .locf=na .locf(dat .locf,na .rm=FALSE, fromLast=TRUE)  \n\\# calcul de l ' erreur  \nerr .locf=abs (dat .test-dat .locf[ind .test])  \n2.3.2 Par la moyenne  \n\\# chargement de la bibliothèque  \nlibrary (Hmisc)  \ndat .moy=impute(dat .train, fun=mean)  \nerr .moy=abs (dat .test-as .matrix (dat .moy)[ind.test])  \n2.3.3 Par la médiane  \nmed=apply (dat .train,1,median ,na .rm=TRUE) [dat.med=dat.train](dat.med=dat.train)  \n[ind.](ind.na=which)[na](ind.na=which)[=](ind.na=which)[which](ind.na=which) ( [is](is.na)[.](is.na)[na](is.na) ([dat.med](dat.med) ),arr.ind=TRUE) [dat.med](dat.med) [ [ind.](ind.na)[na](ind.na)]=med[ [ind.](ind.na)[na](ind.na) [,1]] [err.med=](err.med=abs)[abs](err.med=abs) ([dat.test-dat.med](dat.test-dat.med) [ind .test])  \n2.3.4 k plus proches voisins kNN  \n\\# chargement de la bibliothèque  \nlibrary (VIM)  \ndat .kNN=kNN(dat .train, k=5, imp_var=FALSE) err .kNN=abs (dat .test-dat .kNN[ind .test])  \n2.3.5 LOESS  \n\\# chargement de la bibliothèque  \nlibrary (locfit)  \ndat .imputed=rbind ( colnames (dat .train),dat .train) indices=1:nrow (dat .train)  \ndat .loess= apply (dat .imputed, 2, function (j) {  \npredict (locfit(j[-1] ~ indices), indices)})  \nerr .loess=abs (dat .test-dat .loess[ind .test])  \n2.3.6 SVD  \n\\# chargement de la bibliothèque  \nlibrary (bcv)  \ndat .SVD=impute .svd (dat .train,k=3,maxiter=1000) $x err .svd=abs (dat .test-dat .SVD[ind .test])  \n2.3.7 missForest  \n\\# chargement de la bibliothèque  \nlibrary (missForest)  \ndat .missForest\u003C-missForest(dat.train,ma","cbCaioMT1AMGC3qI","https://ap.wps.com/l/cbCaioMT1AMGC3qI","pdf",237205,"French","# Objectif\n# Données quantitatives\n## Lecture des données\n## Création de données manquantes\n## Imputation\n### LOCF\n### Par la moyenne\n### Par la médiane\n### k plus proches voisins kNN\n### LOESS\n### SVD\n### missForest\n### AmeliaII\n# Comparaison des résultats\n# Robustesse des méthodes","[{\"question\":\"Quel est l’objectif principal du scénario d’imputation de données manquantes ?\",\"answer\":\"Tester et comparer plusieurs méthodes d’imputation sur des cas-types, en évaluant à la fois la précision et la robustesse des meilleures lorsque le taux de données manquantes augmente.\"},{\"question\":\"Comment les données manquantes sont-elles créées pour l’évaluation ?\",\"answer\":\"Le scénario se limite au cas MCAR et retire artificiellement une proportion de valeurs, puis compare la complétion obtenue aux données retirées sur un échantillon test.\"},{\"question\":\"Quelles méthodes sont identifiées comme les plus précises et comment leur robustesse est-elle étudiée ?\",\"answer\":\"SVD, missForest et AmeliaII donnent les meilleurs résultats. Leur comportement est ensuite analysé quand la quantité de données manquantes augmente de 10% à 80%.\"}]","Scénario - Imputation de données manquantes | PDF",1789651788,8]