[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"detail-sidebar-cat-0-pt-112":3,"doc-seo-134966-112":49,"doc-detail-134966-pt":115},{"code":4,"msg":5,"data":6},0,"success",[7,13,17,21,25,29,33,37,41,45],{"id":8,"doc_module":4,"doc_module_name":9,"category_name":10,"show_sort_weight":11,"slug":12},26,"Document","Contos e Romances",60,"story-novel",{"id":14,"doc_module":4,"doc_module_name":9,"category_name":15,"show_sort_weight":11,"slug":16},46,"Estilo de Vida","lifestyle",{"id":18,"doc_module":4,"doc_module_name":9,"category_name":19,"show_sort_weight":11,"slug":20},28,"Exames","exam",{"id":22,"doc_module":4,"doc_module_name":9,"category_name":23,"show_sort_weight":11,"slug":24},47,"Geral","general",{"id":26,"doc_module":4,"doc_module_name":9,"category_name":27,"show_sort_weight":11,"slug":28},29,"Histórias em Quadrinhos","comic",{"id":30,"doc_module":4,"doc_module_name":9,"category_name":31,"show_sort_weight":11,"slug":32},27,"Literatura","literature",{"id":34,"doc_module":4,"doc_module_name":9,"category_name":35,"show_sort_weight":11,"slug":36},32,"Pesquisa e Relatórios","research-report",{"id":38,"doc_module":4,"doc_module_name":9,"category_name":39,"show_sort_weight":11,"slug":40},33,"Religião e Espiritualidade","religion-spirituality",{"id":42,"doc_module":4,"doc_module_name":9,"category_name":43,"show_sort_weight":11,"slug":44},31,"Saúde e Cuidados","healthcare",{"id":46,"doc_module":4,"doc_module_name":9,"category_name":47,"show_sort_weight":11,"slug":48},45,"Tecnologia","technology",{"code":4,"msg":50,"data":51},"ok",{"site_id":52,"language":53,"slug":54,"title":55,"keywords":56,"description":57,"schema_data":58,"social_meta":108,"head_meta":110,"extra_data":112,"updated_unix":114},112,"pt","linguistic-subsidies-for-automatic-text-classification-of-user-generated-content-paper","Subsídios Linguísticos para classificação automática de textos de User-Generated Content - Artigo","","Este estudo propõe a classificação automática de textos de User-Generated Content (UGC) a partir do corpus DANTE-stocks, composto por tweets sobre o mercado financeiro. Os textos foram analisados manualmente com base em critérios semânticos, coesivos e de coerência, considerando sua estrutura linguística. Os resultados organizam o material em três classes: bem estruturado, mediamente estruturado e mal estruturado, fornecendo base para aplicações em Processamento de Linguagem Natural voltadas a UGC.",{"@graph":59,"@context":107},[60,77,98],{"@type":61,"itemListElement":62},"BreadcrumbList",[63,68,71,74],{"item":64,"name":65,"@type":66,"position":67},"https://docshare.wps.com","Home","ListItem",1,{"item":69,"name":9,"@type":66,"position":70},"https://docshare.wps.com/pt/document/",2,{"item":72,"name":35,"@type":66,"position":73},"https://docshare.wps.com/pt/document/pesquisa-e-relatórios/",3,{"item":75,"name":55,"@type":66,"position":76},"https://docshare.wps.com/pt/document/linguistic-subsidies-for-automatic-text-classification-of-user-generated-content-paper/134966/",4,{"url":75,"name":55,"@type":78,"image":79,"author":84,"headline":55,"publisher":87,"fileFormat":90,"inLanguage":53,"description":57,"dateModified":91,"datePublished":92,"encodingFormat":90,"isAccessibleForFree":93,"interactionStatistic":94},"DigitalDocument",{"url":80,"@type":81,"width":82,"height":83},"https://docshare.wps.com/thumbnails/linguistic-subsidies-for-automatic-text-classification-of-user-generated-content-paper/134966.png","ImageObject",300,407,{"name":85,"@type":86},"Jake","Person",{"url":64,"name":88,"@type":89},"DocShare","Organization","application/pdf","2026-09-26","2026-08-21",true,{"@type":95,"interactionType":96,"userInteractionCount":76},"InteractionCounter",{"@type":97},"ViewAction",{"@type":99,"mainEntity":100},"FAQPage",[101],{"name":102,"@type":103,"acceptedAnswer":104},"O que o estudo propõe para textos de User-Generated Content (UGC)?","Question",{"text":105,"@type":106},"O trabalho propõe classificar a estrutura de textos de UGC, usando o corpus DANTE-stocks e critérios semânticos, coesivos e de coerência.","Answer","https://schema.org",{"og:url":75,"og:type":109,"og:title":55,"og:site_name":88,"og:description":57},"article",{"robots":111,"canonical":75},"index,follow",{"doc_id":113,"site_id":52},134966,1787301969,{"code":4,"msg":5,"data":116},{"doc_id":113,"user_id":117,"nickname":85,"user_avatar":118,"doc_module":4,"category_id":34,"category_name":35,"doc_title":55,"doc_description":57,"doc_content":119,"file_id":120,"file_url":121,"file_type":122,"file_size":123,"view_count":76,"is_deleted":4,"is_public":67,"is_downloadable":67,"audit_status":67,"page_count":124,"language":125,"language_code":53,"site_id":52,"html_lang":53,"table_of_contents":126,"faqs":127,"seo_title":128,"seo_description":57,"update_tm":114,"read_time":129},962084928904,"https://ap-avatar.wpscdn.com/davatar_155a257f0dc6eb9ab79c44ca47cae57d","Subsídios Linguísticos para classificação automática de textos  \nde User-Generated Content  \nMateus Araújo Pereira1, Jackson Wilke da Cruz Souza 1  \n1 Instituto de Letras (ILUFBA)– Universidade Federal da Bahia (UFBA)–  \nSalvador/BA  \n2 Programa de Pós-Graduação em Língua e Cultura (PPGLinC) Universidade Federal da Bahia (UFBA)– Salvador/BA  \n[pereiramateus@ufba.br](pereiramateus@ufba.br), [jackcruzsouza@gmail.com](jackcruzsouza@gmail.com)  \nAbstract: This study aims to classify the structures of User-Generated Content (UGC) texts using the DANTE-stocks corpus, which consists of tweets about the financial market. The texts were manually analyzed and classified based on semantic, cohesive, and coherence criteria according to their linguistic structure, resulting in three classes: (i) well-structured, (ii) moderately structured, and (iii) poorly structured. The integration of these approaches provides a foundation for developing applications in the field of Natural Language Processing related to UGC texts.  \nResumo: Este estudo visa classificar as estruturas de textos User-Generated Content (UGC), usando o corpus DANTE-stocks, compostopor tweets sobre o mercado financeiro. Os textos foram analisados e classificados manualmente com critérios semânticos, coesivos e de coerência em função da estruturalinguística, resultando em três classes: (i) bem, (ii) mediamente e (iii) malestruturado. A integração dessas abordagens oferece embasamento para odesenvolvimento de aplicações no âmbito do Processamento de Linguagem Natural com relação a textos de UGC.  \n1. Introdução  \nKrumm, Davies e Narayanaswami (2008) definem User-Generated Content (UGC), como quaisquer conteúdos criados por usuário em uma plataforma online, integrando um conjunto de formatos, como textos, fotos, vídeos, comentários em fóruns ou redes sociais. Essa definição enfatiza o ambiente participativo e colaborativo da UGC, destacando conteúdos, em sua espontaneidade, produzidos por usuários devido à permissividade do ambiente e do gênero textual em que esses textos são produzidos. AUGC é caracterizada por uma variedade de fenômenos linguísticos, como o uso deabreviações, neologismo e estruturas não convencionais, como corrobora Di-Felippo et al.,(2021) .  \nA maior parte das pesquisas em Processamento de Linguagem Natural (PLN), até o momento, tem se concentrado na análise de textos formais, em detrimento de textos de UGC. Em virtude da diversidade e informalidade presentes nesses textos, exigem de abordagens direcionadas a compreender suas características únicas. Para que seja possível realizar análises linguísticas considerando particularidades do gênero textual e da linguagem em textos de UGC, objetivamos neste trabalho propor classes que levem em conta aspectos semânticos e estruturais. Nesse sentido, serão  \napresentados os resultados do estudo piloto de classificação do corpus [Di-Felippo et al. 2021] . O estudo teve foco na identificação e categorização dos tweets em três classes, a saber: bem estruturado, mediamente estruturado e mal estruturado. Ademais, detalharemos a metodologia aplicada, as abordagens linguísticas adotadas durante oprocesso, e os resultados preliminares alcançados.  \nPara tanto, utilizou-se como conjunto de dados o corpus DANTE-stocks [DiFelippo et al., 2021], que é composto por aproximadamente 6,700 posts/tweets extraídos da plataforma X/Twitter, pertencentes ao domínio do mercado financeiro. Esses textos são caracterizados por uma linguagem curta e direta, contendo jargões eobservações específicas ao contexto de uso e suportes midiáticos e abordaminformações sobre ações, investimentos, notícias econômicas e análises de mercado das bolsas de valores.  \nEste trabalho está organizado em 3 seções, além desta introdução e da consideração final. Na seção 2, apresentamos uma visão sobre a literatura com estudos que abordam a análise da linguagem em textos de UGC, destacando seus fenômenos linguísticos específicos do gênero textual. Na seção 3, detal","cbCaim9ik3MMftqV","https://ap.wps.com/l/cbCaim9ik3MMftqV","pdf",231072,5,"Portuguese","# Introdução\n## Definição e caracterização de UGC\n## Objetivo e organização do trabalho\n# Trabalhos relacionados\n## Linguagem em SMS e redes sociais\n## Inovação lexical e interação online\n## Técnicas de PLN em UGC","[{\"question\":\"O que o estudo propõe para textos de User-Generated Content (UGC)?\",\"answer\":\"O trabalho propõe classificar a estrutura de textos de UGC, usando o corpus DANTE-stocks e critérios semânticos, coesivos e de coerência.\"}]","Subsídios Linguísticos para classificação automática de textos de User-Generated Content - Artigo | PDF",8]