[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-detail-120351-en":3,"doc-seo-120351-105":30,"detail-sidebar-cat-0-en-105":91},{"code":4,"msg":5,"data":6},0,"success",{"doc_id":7,"user_id":8,"nickname":9,"user_avatar":10,"doc_module":4,"category_id":11,"category_name":12,"doc_title":13,"doc_description":14,"doc_content":15,"file_id":16,"file_url":17,"file_type":18,"file_size":19,"view_count":20,"is_deleted":4,"is_public":20,"is_downloadable":20,"audit_status":20,"page_count":21,"language":22,"language_code":23,"site_id":24,"html_lang":23,"table_of_contents":25,"faqs":26,"seo_title":27,"seo_description":14,"update_tm":28,"read_time":29},120351,1099514067438,"River Wang","https://ap-avatar.wpscdn.com/avatar/100002539ee87300030?x-image-process=image/resize,m_fixed,w_180,h_180&k=1780474512215547542",8,"Research & Report","Machine Learning Applied to Biological Sequence Comparison - an Alignment-free Approach","Biological sequence comparison is commonly carried out using alignment-based algorithms, which can face limitations in accuracy and efficiency for many practical tasks. Alignment-free approaches address these issues by transforming biological sequences into k-mer subsequences and leveraging word statistics or comparisons. For polypeptides, feature extraction can also incorporate amino-acid physicochemical properties. Recent work combines k-mer occurrences or frequencies with machine learning to improve prediction and classification. This article provides an initial, comprehensive guide to the alignment-free pipeline plus machine learning models, including core concepts, procedures, and a brief systematic literature review with three interactive online tutorials.","Revista de Informtica Terica e Aplicada-RITA-ISSN 2175-2745  \nVol. 32, Num. 2 (2025) 22-35  \nRESEARCH ARTICLE  \nMachine Learning Applied to Biological Sequence Comparison: an Alignment-free Approach  \nAprendizado de Mquina Aplicado a Comparac¸ o de Sequncias Biolgicas: uma Abordagem Livre de Alinhamento  \nThaizy Aparecida Vicentini 1 , Luiz Carlos Bertucci Barbosa 1 *  \nAbstract: Biological sequence comparison is traditionally performed using algorithms that fall into the category of alignment approaches. These algorithms, however, have some limitations that can be overcome by alignment-free sequence comparison methods. Most of these alternative methods are based on word statistics or word comparison, after the biological sequences have been transformed into a set of subsequences of size k, called k-mer. For polypeptide sequences, feature extraction can also be done from the physicochemical qualities of the amino acids that compose them. Recently, many authors have used k-mer occurrences or k-mer frequencies, as well as physicochemical characteristics of amino acids, to train machine learning models. In this context, this work aimed to provide a comprehensive and initial guide to the use of the alignment-free approach, combined with machine learning algorithms, for the comparison of biological sequences. This article discusses the basic concepts and procedures of the alignment-free approach and machine learning, as well as provides a brief systematic review of recent literature to provide examples in the field. In addition, this guide is accompanied by 3 interactive online tutorials.  \nKeywords: Alignment-free Method—k-mer—Machine Learning—Bioinformatics  \nResumo: A comparac¸o de sequncias biolgicas  tradicionalmente realizada utilizando-se algoritmos que se enq˜uadram na categoria de abordagem por alinhamento. Estes al˜goritmos, entretanto, possuem algumas limitac¸oes as quais podem ser superadas por mtodos de comparac¸ao de sequncias livres d˜e alinhamento.  \nA maioria desses mtodos alternativos  baseada em estatısticas de palavras ou compara´c¸ao de palavras, aps as sequncias biolgicas terem sido transformadas em u˜ m conjunto de subsequncias de tamanho k, chamadas de k-mer. Para sequncias polipeptıdicas, a extra´c¸˜ao de caractersticas tambm pode ser feita a  \npartir das qualidades fısico´-quımicas dos amino´cidos as compoe. Recentemente, muitos autores tm utilizadoocorrncias ou frequncias de k-mer, assim como caractersticas fısico´-quımicas de amino´cidos, para treinar modelos de aprendizado de mquina. Neste contexto, este trabalho objetivou fornecer um guia abrangentee inicial ao u˜so da abordagem livre de alinhamento, aliad˜a aos algoritmos de aprendizado de mquina, para a comparac¸ao de sequncias biolgicas. Neste artigo, sao discutidos os conceitos e procedimentos bsico˜ s  \nsobre a abordagem livre de alinhamento e sobre o aprendizado de mquina, alm de realizar uma breve revisaosistemtica da literatura recente para trazer exemplos na rea. Alm disso, este guia  acompanhado por 3 tutoriais online interativos.  \nPalavras-Chave: Abordagem Livre de Alinhamento—k-mer—Aprendizado de Mquina—Bioinformtica  \n1 Instituto de Recursos Naturais, Universidade Federal de Itajuba´ (UNIFEI), Brasil  \n*Corresponding author: [luizcbb@unifei.edu.br](luizcbb@unifei.edu.br)  \nDOI: [http://dx.doi.org/10.22456/2175-2745.141585](http://dx.doi.org/10.22456/2175-2745.141585) • Received: 30/07/2024 • Accepted: 05/10/2024  \nCC BY-NC-ND 4 .0 - This work is licensed under a Creative Commons Attribution-NonCommercial-NoDerivatives 4 . 0 International License.  \n1. Introduc¸ o  \nA vida na ˜Terra  caracterizada por uma diversidade de for  \nmas, func¸oes e comportamentos. Por trs dessa diversidade reside uma intrincada linguagem˜ gentica que governa os  \nprocessos biolgicos. A informac¸ao gentica na clula  primariamente codificada no DNA como sequncias de desoxir-  \nribonucleot´ıdeos. Essa informac¸o pode fluir para sequncias de ribonucleot´ıdeos, na for","cbCaiiNc6n73SuUn","https://ap.wps.com/l/cbCaiiNc6n73SuUn","pdf",1026431,1,14,"English","en",105,"# Introdução\n## Contexto e importância da comparação de sequências biológicas\n## Objetivos e estrutura do artigo\n# Abordagem livre de alinhamento\n## Conceitos e procedimentos básicos\n## Representação por k-mer e extração de características\n# Aprendizado de máquina aplicada ao problema\n## Modelos treinados com ocorrências/frequências de k-mer\n## Uso de qualidades físico-químicas de aminoácidos\n# Revisão sistemática e exemplos\n## Literatura recente e aplicações\n# Tutoriais online interativos","[{\"question\":\"O que caracteriza a abordagem livre de alinhamento em comparação de sequências biológicas?\",\"answer\":\"Ela evita o uso direto de alinhamentos e transforma sequências em representações baseadas em subsequências de tamanho k (k-mer), explorando estatísticas ou comparações entre essas unidades.\"},{\"question\":\"Como os k-mers são usados em modelos de aprendizado de máquina para comparar sequências?\",\"answer\":\"As frequências ou ocorrências de k-mers, extraídas após a transformação das sequências, são utilizadas como base para treinar modelos de aprendizado de máquina.\"},{\"question\":\"Quais características adicionais podem ser consideradas para sequências de polipeptídeos?\",\"answer\":\"Além dos k-mers, podem ser extraídas características a partir das qualidades físico-químicas dos aminoácidos que compõem a sequência.\"}]","Machine Learning Applied to Biological Sequence Comparison - an Alignment-free Approach | PDF",1785729616,35,{"code":4,"msg":31,"data":32},"ok",{"site_id":24,"language":23,"slug":33,"title":13,"keywords":34,"description":14,"schema_data":35,"social_meta":86,"head_meta":88,"extra_data":90,"updated_unix":28},"machine-learning-applied-to-biological-sequence-comparison-an-alignment-free-approach","",{"@graph":36,"@context":85},[37,54,68],{"@type":38,"itemListElement":39},"BreadcrumbList",[40,44,48,51],{"item":41,"name":42,"@type":43,"position":20},"https://docshare.wps.com","Home","ListItem",{"item":45,"name":46,"@type":43,"position":47},"https://docshare.wps.com/document/","Document",2,{"item":49,"name":12,"@type":43,"position":50},"https://docshare.wps.com/document/research-report/",3,{"item":52,"name":13,"@type":43,"position":53},"https://docshare.wps.com/document/machine-learning-applied-to-biological-sequence-comparison-an-alignment-free-approach/120351/",4,{"url":52,"name":13,"@type":55,"author":56,"headline":13,"publisher":58,"fileFormat":61,"inLanguage":23,"description":14,"dateModified":62,"datePublished":62,"encodingFormat":61,"isAccessibleForFree":63,"interactionStatistic":64},"DigitalDocument",{"name":9,"@type":57},"Person",{"url":41,"name":59,"@type":60},"DocShare","Organization","application/pdf","2026-08-03",true,{"@type":65,"interactionType":66,"userInteractionCount":20},"InteractionCounter",{"@type":67},"ViewAction",{"@type":69,"mainEntity":70},"FAQPage",[71,77,81],{"name":72,"@type":73,"acceptedAnswer":74},"O que caracteriza a abordagem livre de alinhamento em comparação de sequências biológicas?","Question",{"text":75,"@type":76},"Ela evita o uso direto de alinhamentos e transforma sequências em representações baseadas em subsequências de tamanho k (k-mer), explorando estatísticas ou comparações entre essas unidades.","Answer",{"name":78,"@type":73,"acceptedAnswer":79},"Como os k-mers são usados em modelos de aprendizado de máquina para comparar sequências?",{"text":80,"@type":76},"As frequências ou ocorrências de k-mers, extraídas após a transformação das sequências, são utilizadas como base para treinar modelos de aprendizado de máquina.",{"name":82,"@type":73,"acceptedAnswer":83},"Quais características adicionais podem ser consideradas para sequências de polipeptídeos?",{"text":84,"@type":76},"Além dos k-mers, podem ser extraídas características a partir das qualidades físico-químicas dos aminoácidos que compõem a sequência.","https://schema.org",{"og:url":52,"og:type":87,"og:title":13,"og:site_name":59,"og:description":14},"article",{"robots":89,"canonical":52},"index,follow",{"doc_id":7,"site_id":24},{"code":4,"msg":5,"data":92},[93,97,101,105,110,115,120,123,128,131,135],{"id":20,"doc_module":4,"doc_module_name":46,"category_name":94,"show_sort_weight":95,"slug":96},"Story & Novel",90,"story-novel",{"id":47,"doc_module":4,"doc_module_name":46,"category_name":98,"show_sort_weight":99,"slug":100},"Literature",80,"literature",{"id":53,"doc_module":4,"doc_module_name":46,"category_name":102,"show_sort_weight":103,"slug":104},"Exam",70,"exam",{"id":106,"doc_module":4,"doc_module_name":46,"category_name":107,"show_sort_weight":108,"slug":109},5,"Comic",60,"comic",{"id":111,"doc_module":4,"doc_module_name":46,"category_name":112,"show_sort_weight":113,"slug":114},6,"Technology",50,"technology",{"id":116,"doc_module":4,"doc_module_name":46,"category_name":117,"show_sort_weight":118,"slug":119},7,"Healthcare",40,"healthcare",{"id":11,"doc_module":4,"doc_module_name":46,"category_name":12,"show_sort_weight":121,"slug":122},30,"research-report",{"id":124,"doc_module":4,"doc_module_name":46,"category_name":125,"show_sort_weight":126,"slug":127},9,"Religion & Spirituality",20,"religion-spirituality",{"id":126,"doc_module":4,"doc_module_name":46,"category_name":129,"show_sort_weight":126,"slug":130},"World Cup","world-cup",{"id":132,"doc_module":4,"doc_module_name":46,"category_name":133,"show_sort_weight":132,"slug":134},10,"Lifestyle","lifestyle",{"id":136,"doc_module":4,"doc_module_name":46,"category_name":137,"show_sort_weight":106,"slug":138},19,"General","general"]