[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-122586-fr":3,"doc-seo-122586-114":31,"detail-sidebar-cat-0-fr-114":92},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":21,"is_downloadable":21,"audit_status":21,"page_count":22,"language":23,"language_code":24,"site_id":25,"html_lang":24,"table_of_contents":26,"faqs":27,"seo_title":28,"seo_description":14,"update_tm":29,"read_time":30},122586,962084925290,"Ophelia","https://ap-avatar.wpscdn.com/davatar_085a072bc5b1113ac321206ff7593b45",64,"Recherche & Rapport","Machine Learning for Information Retrieval","Dans cette thèse, l’apprentissage automatique est mobilisé pour la recherche d’information, en particulier pour le problème d’ad-hoc retrieval consistant à ordonner les documents d’un grand corpus selon leur pertinence à une requête. L’approche vise à apprendre des algorithmes discriminants capables de généraliser à des documents et à des requêtes non vus pendant l’entraînement, malgré des erreurs non additivement décomposables et une forte asymétrie de pertinence. Le travail couvre l’apprentissage de mesures de similarité textuelle via transfert, l’optimisation orientée performance pour la recherche d’images à partir de requêtes textuelles, puis l’application au repérage de mots-clés, avec un critère directement lié à l’AUC ROC.","T  \nI D I A P R E S E A R C H R E P O R  \nMachine Learning for Information Retrieval  \nDavid Grangier 1,2 IDIAP–RR 08-34  \n2008  \npublished in  \nTh`ese de l'cole Polytechnique F􀀓ed􀀓erale de Lausanne (EPFL), no. 4088, Facult􀀓e des Sciences et Techniques de l'Ing􀀓enieur (STI) .  \nThesis Committee Members:  \nDr. Samy Bengio 3 , thesis advisor. Prof. Herv􀀓e Bourlard 1,2 , thesis advisor.  \nDr. Jean C􀀓edric Chappelier 2 , internal expert. Dr. Yves Grandvalet 4 , external expert. Prof. Thomas Hofmann 5,6 , external expert.  \n1 IDIAP Research Institute, Martigny, Switzerland.  \n2 ´Ecole Polytechnique F´ed´erale de Lausanne (EPFL), Switzerland.  \n3 Google Inc. , Mountain View, CA, USA.  \n4 Universit´e de Technologie de Compi`egne, France.  \n5 Google Inc. , Z¨urich, Switzerland.  \n6 Brown University, Providence, RI, USA.  \nIDIAP Research Institute [www.idiap.ch](www.idiap.ch)  \nAv. des Prés Beudin 20 P.O. Box 592 1920 Martigny − Switzerland Tel: +41 27 721 77 11 Fax: +41 27 721 77 12 Email: [info@idiap.ch](info@idiap.ch)  \nRsum  \nDans cette th`ese, nous explorons l'utilisation de techniques d'apprentissage automatique pour la recherche d'information. Plus pr􀀓ecis􀀓ement, nous nous int􀀓eressons au probl`eme de l'ad-hoc retrieval qui consiste `a chercher les documents pertinents `a une requ^ete dans de grands corpus. Ce probl`eme est g􀀓en􀀓eralement r􀀓esolu `a travers une t^ache d'ordonnancement. tant donn􀀓ee une requ^ete, le syst`eme de recherche d'information ordonne les documents du corpus avec l'objectif de produire une liste ordonn􀀓ee dans laquelle les documents pertinents apparaissent avant les autres.  \nDans un contexte d'apprentissage automatique, nous nous sommes int􀀓eress􀀓es `a proposer des algorithmes d'apprentissage qui puissent b􀀓en􀀓e􀀌cier de donn􀀓eesd'entra^ınement a􀀌n d'identi􀀌er un ordonnateur capable d'atteindre une performance 􀀓elev􀀓ee pour des documents et des requ^etes non disponibles lors de l'apprentissage. Ce probl`eme pr􀀓esente des d􀀓e􀀌s nouveaux compar􀀓e aux probl`emes traditionnels d'apprentissage automatique, tels que la cat􀀓egorisation ou bien la r􀀓egression. En e􀀋et, notre t^ache est un probl`eme d'ordonnancement, ce qui implique que la mesure de l'erreur pour une requ^ete ne peut ^etre exprim􀀓ee comme la somme des co^uts reli􀀓es `a chaque document. galement, notre t^ache correspond `a un probl`eme d􀀓es􀀓equilibr􀀓e puisque seulement une tr`es petite partie du corpus est pertinente pour chaque requ^ete. De plus, l'ad-hoc retrieval pr􀀓esente un double probl`eme de g􀀓en􀀓eralisation puisque le mod`ele doit `a la fois ^etre appliqu􀀓e `a de nouveaux documents mais 􀀓egalement `a de nouvelles requ^etes. Finalement, notre t^ache pr􀀓esente aussi des contraintes d'e􀀎cacit􀀓e decalcul puisque l'ad-hoc retrieval est g􀀓en􀀓eralement appliqu􀀓e `a de grands corpus.  \nL'objectif premier de cette th`ese est l'apprentissage discriminant de mod`eles pour l'ad-hoc retrieval. Dans ce contexte, nous proposons plusieurs approches bas􀀓ees sur des machines `a noyaux ou sur des r􀀓eseaux de neurones sp􀀓eci􀀌quement  \nadapt􀀓es `a di􀀋􀀓erents probl`emes de recherche d'information. Les mod`eles propos􀀓es sont bas􀀓es sur di􀀋􀀓erents algorithmes d'apprentissage en ligne permettantun apprentissage e􀀎cace sur de grands ensembles de donn􀀓ees.  \nLa premi`ere partie de ce document s'int􀀓eresse `a la recherche d'information textuelle. Pour ce faire, nous adoptons une formulation classique de cettet^ache, et ordonnons les documents selon une estimation de leur similarit􀀓e avec la requ^ete. La mesure de la similarit􀀓e entre textes est donc un aspect crucial dans ce cadre. Nous proposons donc une approche pour apprendre une mesure de similarit􀀓e entre textes. Notre strat􀀓egie d'apprentissage ne repose pas sur un large ensemble de requ^etes et de documents pertinents correspondants car ce type de donn􀀓ees 􀀓etant particuli`erement co^uteux `a annoter est rare. Au lieu de cela, nous proposons d'utiliser un corpus hypertexte, dont les hyperliens fournissent une ","cbCainPmIzN1ugRV","https://ap.wps.com/l/cbCainPmIzN1ugRV","pdf",8266095,4,1,134,"French","fr",114,"# Résumé\n## Problème d’ad-hoc retrieval et ordonnancement\n## Apprentissage discriminant et généralisation\n## Recherche textuelle et apprentissage de similarité\n## Recherche d’images à partir de requêtes textuelles\n## Repérage de mots-clés et critère basé sur l’AUC ROC","[{\"question\":\"Quel est le problème central étudié dans cette thèse ?\",\"answer\":\"La thèse se concentre sur l’ad-hoc retrieval, qui consiste à chercher et surtout à ordonner les documents pertinents à partir d’une requête dans de grands corpus.\"},{\"question\":\"Pourquoi l’entraînement pour l’ad-hoc retrieval est-il difficile ?\",\"answer\":\"La mesure d’erreur ne se décompose pas comme une somme par document, la pertinence est rare (déséquilibre) et il existe un double défi de généralisation vers de nouveaux documents et de nouvelles requêtes.\"},{\"question\":\"Quelles sont les applications de recherche d’information abordées ?\",\"answer\":\"Le document couvre la recherche textuelle via l’apprentissage d’une mesure de similarité, la recherche d’images à partir de requêtes textuelles en optimisant un critère d’ordonnancement, et le repérage de mots-clés dans des séquences de parole.\"}]","Machine Learning for Information Retrieval | PDF",1785811519,206,{"code":4,"msg":32,"data":33},"ok",{"site_id":25,"language":24,"slug":34,"title":13,"keywords":35,"description":14,"schema_data":36,"social_meta":87,"head_meta":89,"extra_data":91,"updated_unix":29},"machine-learning-for-information-retrieval","",{"@graph":37,"@context":86},[38,54,69],{"@type":39,"itemListElement":40},"BreadcrumbList",[41,45,49,52],{"item":42,"name":43,"@type":44,"position":21},"https://docshare.wps.com","Home","ListItem",{"item":46,"name":47,"@type":44,"position":48},"https://docshare.wps.com/fr/document/","Document",2,{"item":50,"name":12,"@type":44,"position":51},"https://docshare.wps.com/fr/document/recherche-rapport/",3,{"item":53,"name":13,"@type":44,"position":20},"https://docshare.wps.com/fr/document/machine-learning-for-information-retrieval/122586/",{"url":53,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":24,"description":14,"dateModified":62,"datePublished":63,"encodingFormat":61,"isAccessibleForFree":64,"interactionStatistic":65},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":42,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-19","2026-08-04",true,{"@type":66,"interactionType":67,"userInteractionCount":20},"InteractionCounter",{"@type":68},"ViewAction",{"@type":70,"mainEntity":71},"FAQPage",[72,78,82],{"name":73,"@type":74,"acceptedAnswer":75},"Quel est le problème central étudié dans cette thèse ?","Question",{"text":76,"@type":77},"La thèse se concentre sur l’ad-hoc retrieval, qui consiste à chercher et surtout à ordonner les documents pertinents à partir d’une requête dans de grands corpus.","Answer",{"name":79,"@type":74,"acceptedAnswer":80},"Pourquoi l’entraînement pour l’ad-hoc retrieval est-il difficile ?",{"text":81,"@type":77},"La mesure d’erreur ne se décompose pas comme une somme par document, la pertinence est rare (déséquilibre) et il existe un double défi de généralisation vers de nouveaux documents et de nouvelles requêtes.",{"name":83,"@type":74,"acceptedAnswer":84},"Quelles sont les applications de recherche d’information abordées ?",{"text":85,"@type":77},"Le document couvre la recherche textuelle via l’apprentissage d’une mesure de similarité, la recherche d’images à partir de requêtes textuelles en optimisant un critère d’ordonnancement, et le repérage de mots-clés dans des séquences de parole.","https://schema.org",{"og:url":53,"og:type":88,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":90,"canonical":53},"index,follow",{"doc_id":7,"site_id":25},{"code":4,"msg":5,"data":93},[94,99,104,107,110,114,116,120,124,128],{"id":95,"doc_module":4,"doc_module_name":47,"category_name":96,"show_sort_weight":97,"slug":98},67,"Général",61,"general",{"id":100,"doc_module":4,"doc_module_name":47,"category_name":101,"show_sort_weight":102,"slug":103},66,"Art de vivre",60,"lifestyle",{"id":97,"doc_module":4,"doc_module_name":47,"category_name":105,"show_sort_weight":102,"slug":106},"Bande dessinée","comic",{"id":102,"doc_module":4,"doc_module_name":47,"category_name":108,"show_sort_weight":102,"slug":109},"Examen","exam",{"id":111,"doc_module":4,"doc_module_name":47,"category_name":112,"show_sort_weight":102,"slug":113},59,"Littérature","literature",{"id":11,"doc_module":4,"doc_module_name":47,"category_name":12,"show_sort_weight":102,"slug":115},"research-report",{"id":117,"doc_module":4,"doc_module_name":47,"category_name":118,"show_sort_weight":102,"slug":119},58,"Récits & Romans","story-novel",{"id":121,"doc_module":4,"doc_module_name":47,"category_name":122,"show_sort_weight":102,"slug":123},65,"Religion & Spiritualité","religion-spirituality",{"id":125,"doc_module":4,"doc_module_name":47,"category_name":126,"show_sort_weight":102,"slug":127},63,"Santé & Soins","healthcare",{"id":129,"doc_module":4,"doc_module_name":47,"category_name":130,"show_sort_weight":102,"slug":131},62,"Technologie","technology"]