[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-126154-es":3,"doc-seo-126154-110":31,"detail-sidebar-cat-0-es-110":92},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":21,"is_downloadable":21,"audit_status":21,"page_count":22,"language":23,"language_code":24,"site_id":25,"html_lang":24,"table_of_contents":26,"faqs":27,"seo_title":28,"seo_description":14,"update_tm":29,"read_time":30},126154,687207022233,"Riley","https://ap-avatar.wpscdn.com/davatar_155a257f0dc6eb9ab79c44ca47cae57d",24,"Tecnología","Lectura de labios en videos sin audio mediante Dynamic Time Warping y Machine Learning","Este trabajo desarrolla un sistema de lectura de labios basado en visión por computador y aprendizaje automático para transcribir palabras pronunciadas en videos sin audio. El enfoque emplea Mediapipe para detectar los labios, descriptores de Fourier para describir su movimiento, Dynamic Time Warping (DTW) para medir similitudes entre secuencias temporales y K-Nearest Neighbors (KNN) para la clasificación. Los resultados muestran alta precisión en entornos controlados, pero limitaciones al generalizar entre hablantes y ante cambios de orientación de la cabeza. Se concluye la necesidad de robustecer el modelo para su uso en contextos reales y diversos.","This is the published version of the bachelor thesis:  \nMatienzo Reyes, Sanny Jheremmy; Antens, Coen Jocobus tut. Lectura de labios en videos sin audio mediante Dynamic Time Warping y Machine Learning. 2025.(Enginyeria Informàtica)  \nThis version is available at [https://ddd.uab.cat/record/308778](https://ddd.uab.cat/record/308778)[ ](https://ddd.uab.cat/record/308778)under the terms of the  license  \nLectura de labios en videos sin audio mediante Dynamic Time Warping y Machine Learning  \nSanny Jheremmy Matienzo Reyes  \nResumen—Este trabajo presenta el desarrollo de un sistema de lectura de labios basado en Visión por Computador y Machine Learning, con el objetivo de transcribir palabras pronunciadas en videos sin audio. Este sistema busca facilitar la comunicación para personas con dificultades auditivas y explorar nuevas aplicaciones en contextos donde el sonido no es una opción viable. Para su desarrollo, se ha utilizado la librería Mediapipe para la detección de los labios, descriptores de Fourier para representar su movimiento, Dynamic Time Warping (DTW) para medir similitudes entre secuencias temporales y K-Nearest Neighbors (KNN) para la clasificación de palabras. Los resultados muestran que el sistema logra una alta precisión en entornos controlados, pero presenta dificultades al generalizar a diferentes hablantes y cambios en la orientación de la cabeza. Este estudio confirma el potencial de la lectura de labios automatizada y destaca la necesidad de mejorar la robustez del modelo para su aplicación en entornos más diversos.  \nPalabras clave—Inteligencia Artificial, Visión por Computador, Lectura de Labios, Dynamic Time Warping (DTW), Descriptores de Fourier, K-Nearest Neighbors (KNN), Mediapipe.  \nAbstract—This work presents the development of a lip-reading system based on Computer Vision and Machine Learning, aiming to transcribe spoken words from videos without audio. This system seeks to facilitate communication for individuals with hearing impairments and explore new applications in scenarios where audio is not a viable option. The development process involved Mediapipe for lip detection, Fourier descriptors for movement representation, Dynamic Time Warping (DTW) to measure temporal sequence similarities, and K-Nearest Neighbors (KNN) for word classification. The results indicate that the system achieves high accuracy in controlled environments but struggles to generalize across different speakers and variations in head orientation. This study highlights the potential of automated lip reading and the need to enhance model robustness for broader real-world applications.  \nIndex Terms—Artificial Intelligence, Computer Vision, Lip Reading, Dynamic Time Warping (DTW), Fourier Descriptors, KNearest Neighbors (KNN), Mediapipe.  \n  ◆    \n1 INTRODUCCIÓN  \nLa comunicación es una herramienta fundamental en nuestras vidas. Muchas personas ni siquiera pensamos encómo sería nuestra vida si perdiéramos la capacidad de comunicarnos. Sin embargo, existen personas que luchan díaa día contra este problema, como, por ejemplo, las personas sordomudas. Para las personas sordomudas, ésta es una realidad con la que viven todos los días. No pueden escuchar ni hablar de la misma forma que el resto, así que tienen que buscar maneras diferentes de expresarse.  \nEn la mayoría de los casos, las personas sordomudas no pueden desarrollar el habla porque nacieron sin la capacidad de oír, lo que afecta el aprendizaje del habla. Sin embargo, también existen enfermedades que pueden limitar la capacidad del habla. Por ejemplo, si nos vamos a un caso  \n• E-mail de [contacto: jheremmymatienzo@gmail.com](contacto: jheremmymatienzo@gmail.com)  \n• Mención realizada: Computación  \n• Trabajo tutorizado por: Coen Antens  \n• Curso 2024/25  \nFigura 1: Retrato de Bruce Willis  \nmediático, podemos hablarde Bruce Willis, a quien se le diagnosticó afasia, un trastorno del lenguaje causado por daños en las áreas del cerebro responsables de la comunicación. Otro c","cbCaipyJAs7GtfAM","https://ap.wps.com/l/cbCaipyJAs7GtfAM","pdf",1376885,4,1,15,"Spanish","es",110,"# Introducción\n## Motivación y contexto\n## Técnicas de lectura de labios y aplicaciones\n## Avances con Inteligencia Artificial y Visión por Computador\n# Metodología (descripción general)","[{\"question\":\"Cuál es el objetivo del sistema de lectura de labios propuesto?\",\"answer\":\"Transcribir palabras pronunciadas en videos sin audio, facilitando la comunicación en situaciones donde el sonido no es una opción viable.\"},{\"question\":\"Qué herramientas y técnicas se usan para detectar y clasificar palabras?\",\"answer\":\"Mediapipe para la detección de labios, descriptores de Fourier para representar el movimiento, DTW para comparar secuencias temporales y KNN para la clasificación de palabras.\"},{\"question\":\"Qué limitaciones muestra el sistema según los resultados?\",\"answer\":\"Logra alta precisión en entornos controlados, pero presenta dificultades para generalizar a diferentes hablantes y ante variaciones en la orientación de la cabeza.\"}]","Lectura de labios en videos sin audio mediante Dynamic Time Warping y Machine Learning | PDF",1785903437,23,{"code":4,"msg":32,"data":33},"ok",{"site_id":25,"language":24,"slug":34,"title":13,"keywords":35,"description":14,"schema_data":36,"social_meta":87,"head_meta":89,"extra_data":91,"updated_unix":29},"silent-lip-reading-in-videos-using-dynamic-time-warping-and-machine-learning","",{"@graph":37,"@context":86},[38,54,69],{"@type":39,"itemListElement":40},"BreadcrumbList",[41,45,49,52],{"item":42,"name":43,"@type":44,"position":21},"https://docshare.wps.com","Home","ListItem",{"item":46,"name":47,"@type":44,"position":48},"https://docshare.wps.com/es/document/","Document",2,{"item":50,"name":12,"@type":44,"position":51},"https://docshare.wps.com/es/document/tecnología/",3,{"item":53,"name":13,"@type":44,"position":20},"https://docshare.wps.com/es/document/silent-lip-reading-in-videos-using-dynamic-time-warping-and-machine-learning/126154/",{"url":53,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":24,"description":14,"dateModified":62,"datePublished":63,"encodingFormat":61,"isAccessibleForFree":64,"interactionStatistic":65},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":42,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-15","2026-08-05",true,{"@type":66,"interactionType":67,"userInteractionCount":20},"InteractionCounter",{"@type":68},"ViewAction",{"@type":70,"mainEntity":71},"FAQPage",[72,78,82],{"name":73,"@type":74,"acceptedAnswer":75},"Cuál es el objetivo del sistema de lectura de labios propuesto?","Question",{"text":76,"@type":77},"Transcribir palabras pronunciadas en videos sin audio, facilitando la comunicación en situaciones donde el sonido no es una opción viable.","Answer",{"name":79,"@type":74,"acceptedAnswer":80},"Qué herramientas y técnicas se usan para detectar y clasificar palabras?",{"text":81,"@type":77},"Mediapipe para la detección de labios, descriptores de Fourier para representar el movimiento, DTW para comparar secuencias temporales y KNN para la clasificación de palabras.",{"name":83,"@type":74,"acceptedAnswer":84},"Qué limitaciones muestra el sistema según los resultados?",{"text":85,"@type":77},"Logra alta precisión en entornos controlados, pero presenta dificultades para generalizar a diferentes hablantes y ante variaciones en la orientación de la cabeza.","https://schema.org",{"og:url":53,"og:type":88,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":90,"canonical":53},"index,follow",{"doc_id":7,"site_id":25},{"code":4,"msg":5,"data":93},[94,99,103,107,111,115,119,123,127,131],{"id":95,"doc_module":4,"doc_module_name":47,"category_name":96,"show_sort_weight":97,"slug":98},39,"Cómic",60,"comic",{"id":100,"doc_module":4,"doc_module_name":47,"category_name":101,"show_sort_weight":97,"slug":102},43,"Estilo de Vida","lifestyle",{"id":104,"doc_module":4,"doc_module_name":47,"category_name":105,"show_sort_weight":97,"slug":106},38,"Examen","exam",{"id":108,"doc_module":4,"doc_module_name":47,"category_name":109,"show_sort_weight":97,"slug":110},44,"General","general",{"id":112,"doc_module":4,"doc_module_name":47,"category_name":113,"show_sort_weight":97,"slug":114},41,"Investigación e Informes","research-report",{"id":116,"doc_module":4,"doc_module_name":47,"category_name":117,"show_sort_weight":97,"slug":118},37,"Literatura","literature",{"id":120,"doc_module":4,"doc_module_name":47,"category_name":121,"show_sort_weight":97,"slug":122},22,"Relatos y Novelas","story-novel",{"id":124,"doc_module":4,"doc_module_name":47,"category_name":125,"show_sort_weight":97,"slug":126},42,"Religión y Espiritualidad","religion-spirituality",{"id":128,"doc_module":4,"doc_module_name":47,"category_name":129,"show_sort_weight":97,"slug":130},40,"Salud y Atención Médica","healthcare",{"id":11,"doc_module":4,"doc_module_name":47,"category_name":12,"show_sort_weight":97,"slug":132},"technology"]