[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"detail-sidebar-cat-0-pt-112":3,"doc-seo-134961-112":49,"doc-detail-134961-pt":124},{"code":4,"msg":5,"data":6},0,"success",[7,13,17,21,25,29,33,37,41,45],{"id":8,"doc_module":4,"doc_module_name":9,"category_name":10,"show_sort_weight":11,"slug":12},26,"Document","Contos e Romances",60,"story-novel",{"id":14,"doc_module":4,"doc_module_name":9,"category_name":15,"show_sort_weight":11,"slug":16},46,"Estilo de Vida","lifestyle",{"id":18,"doc_module":4,"doc_module_name":9,"category_name":19,"show_sort_weight":11,"slug":20},28,"Exames","exam",{"id":22,"doc_module":4,"doc_module_name":9,"category_name":23,"show_sort_weight":11,"slug":24},47,"Geral","general",{"id":26,"doc_module":4,"doc_module_name":9,"category_name":27,"show_sort_weight":11,"slug":28},29,"Histórias em Quadrinhos","comic",{"id":30,"doc_module":4,"doc_module_name":9,"category_name":31,"show_sort_weight":11,"slug":32},27,"Literatura","literature",{"id":34,"doc_module":4,"doc_module_name":9,"category_name":35,"show_sort_weight":11,"slug":36},32,"Pesquisa e Relatórios","research-report",{"id":38,"doc_module":4,"doc_module_name":9,"category_name":39,"show_sort_weight":11,"slug":40},33,"Religião e Espiritualidade","religion-spirituality",{"id":42,"doc_module":4,"doc_module_name":9,"category_name":43,"show_sort_weight":11,"slug":44},31,"Saúde e Cuidados","healthcare",{"id":46,"doc_module":4,"doc_module_name":9,"category_name":47,"show_sort_weight":11,"slug":48},45,"Tecnologia","technology",{"code":4,"msg":50,"data":51},"ok",{"site_id":52,"language":53,"slug":54,"title":55,"keywords":56,"description":57,"schema_data":58,"social_meta":117,"head_meta":119,"extra_data":121,"updated_unix":123},112,"pt","typology-of-orthographic-and-lexical-phenomena-in-ugc-decline-of-financial-market-tweets","Tipologia de fenômenos ortográficos e lexicais em CGU: ocaso dos tweets do mercado financeiro","","O texto apresenta uma descrição sistemática de fenômenos ortográficos e lexicais em um corpus de tweets do mercado financeiro em português, voltado a apoiar tarefas de PLN. O trabalho propõe uma tipologia que contribui para definir diretrizes de anotação no quadro Universal Dependencies, além de orientar o desenvolvimento de aplicações para desambiguação de termos e ordenação probabilística de opções, como ocorre em sugestões de corretor ortográfico. A análise considera a linguagem não padronizada do UGC, marcada por erros, variações e expressões de domínio.",{"@graph":59,"@context":116},[60,77,99],{"@type":61,"itemListElement":62},"BreadcrumbList",[63,68,71,74],{"item":64,"name":65,"@type":66,"position":67},"https://docshare.wps.com","Home","ListItem",1,{"item":69,"name":9,"@type":66,"position":70},"https://docshare.wps.com/pt/document/",2,{"item":72,"name":35,"@type":66,"position":73},"https://docshare.wps.com/pt/document/pesquisa-e-relatórios/",3,{"item":75,"name":55,"@type":66,"position":76},"https://docshare.wps.com/pt/document/typology-of-orthographic-and-lexical-phenomena-in-ugc-decline-of-financial-market-tweets/134961/",4,{"url":75,"name":55,"@type":78,"image":79,"author":84,"headline":55,"publisher":87,"fileFormat":90,"inLanguage":53,"description":57,"dateModified":91,"datePublished":92,"encodingFormat":90,"isAccessibleForFree":93,"interactionStatistic":94},"DigitalDocument",{"url":80,"@type":81,"width":82,"height":83},"https://docshare.wps.com/thumbnails/typology-of-orthographic-and-lexical-phenomena-in-ugc-decline-of-financial-market-tweets/134961.png","ImageObject",300,407,{"name":85,"@type":86},"Margaret","Person",{"url":64,"name":88,"@type":89},"DocShare","Organization","application/pdf","2026-10-01","2026-08-21",true,{"@type":95,"interactionType":96,"userInteractionCount":98},"InteractionCounter",{"@type":97},"ViewAction",5,{"@type":100,"mainEntity":101},"FAQPage",[102,108,112],{"name":103,"@type":104,"acceptedAnswer":105},"Qual é o objetivo principal do artigo sobre tweets do mercado financeiro?","Question",{"text":106,"@type":107},"O artigo descreve de forma sistemática fenômenos ortográficos e lexicais presentes em tweets do domínio financeiro em português e usa essa descrição para sustentar diretrizes de anotação e aplicações de PLN.","Answer",{"name":109,"@type":104,"acceptedAnswer":110},"Por que a linguagem dos tweets torna a anotação e o processamento mais desafiadores?",{"text":111,"@type":107},"Os tweets apresentam linguagem não padronizada, com possíveis sentenças agramaticais, sequências sintáticas curtas, ortografia não convencional e expressões específicas do domínio.",{"name":113,"@type":104,"acceptedAnswer":114},"Como a tipologia proposta se conecta ao modelo Universal Dependencies?",{"text":115,"@type":107},"A tipologia é utilizada como base para apoiar a definição de diretrizes de anotação-UD, ajudando a tratar os fenômenos identificados no corpus.","https://schema.org",{"og:url":75,"og:type":118,"og:title":55,"og:site_name":88,"og:description":57},"article",{"robots":120,"canonical":75},"index,follow",{"doc_id":122,"site_id":52},134961,1787301908,{"code":4,"msg":5,"data":125},{"doc_id":122,"user_id":126,"nickname":85,"user_avatar":127,"doc_module":4,"category_id":34,"category_name":35,"doc_title":55,"doc_description":57,"doc_content":128,"file_id":129,"file_url":130,"file_type":131,"file_size":132,"view_count":98,"is_deleted":4,"is_public":67,"is_downloadable":67,"audit_status":67,"page_count":133,"language":134,"language_code":53,"site_id":52,"html_lang":53,"table_of_contents":135,"faqs":136,"seo_title":137,"seo_description":57,"update_tm":123,"read_time":138},137451207643,"https://ap-avatar.wpscdn.com/davatar_3d24733baf745e90a7e4bdd5f77d97b2","Tipologia de fenômenos ortográficos e lexicais em CGU: ocaso dos tweets do mercado financeiro  \nClarissa Lenina Scandarolli 1,2, Ariani Di Felippo 1,2, Norton Trevisan Roman 1,3  \nThiago A. S. Pardo 1,4  \n1Núcleo Interinstitucional de Linguística Computacional – NILC 2Departamento de Letras – Universidade Federal de São Carlos – UFSCar Caixa Postal 676 – CEP 13565-905 – São Carlos – SP – Brasil 3Escola de Artes, Ciências e Humanidades –Universidade de São Paulo (USP) CEP 03828-000 – São Paulo – SP, Brasil  \n4Instituto de CiênciasMatemáticas e de Computação – Universidade de São Paulo (USP) Caixa Postal 668 –13566-970 – São Carlos –SP –Brasil  \n[clarissa.scandarolli@estudante.ufscar.br](clarissa.scandarolli@estudante.ufscar.br), [arianidf@gmail.com](arianidf@gmail.com),  \n[norton@usp.br](norton@usp.br), [taspardo@icmc.usp.br](taspardo@icmc.usp.br)  \nAbstract. Twitter is an attractive source of information for several Natural Language Processing (NLP) applications, especially sentiment analysis and opinion mining. In this paper, we present a systematic description of orthographic and lexical phenomena in a corpus of tweets from the stock market domain in Portuguese. As a result, we propose a typology of the phenomena that could support the definition of annotation guidelines for their treatment within the Universal Dependencies framework of syntactic analysis and the development of NLP applications that realize term disambiguation or probabilistic ordering of options, as is the case with suggestions presented to users by spelling checkers.  \nResumo. Twitter é uma fonte atrativa de informação para várias aplicações do Processamento Automático das Línguas Naturais (PLN), especialmenteanálise de sentimento e mineração de opinião. Neste artigo, apresenta-se uma descrição de fenômenos ortográficos e lexicais em um corpus de tweets do mercado financeiro em português. Como resultado, propõe-se uma tipologia dos fenômenos que pode auxiliar na definição de diretrizes de anotaçãosegundo o modelo gramatical Universal Dependencies e no desenvolvimentode aplicações de PLN quefaçam a desambiguação de termos ou a ordenaçãoprobabilística de opções, como ocorre com a escolha das sugestões ortográficas apresentadas ao usuário em um corretor ortográfico.  \n1. Introdução  \nO Twitter é uma fonte de informações valiosas para diferentes segmentos da sociedade devido principalmente à influência dessas informações. Por conseguinte, aplicações linguístico-computacionais (p.ex.: análise de sentimento e mineração de opinião) que processam o conteúdo gerado pelos usuários (CGU) do Twitter têm sido muito desenvolvidas no Processamento Automático das Línguas Naturais (PLN) [Sanguinetti et al. 2022] . E esse desenvolvimento é desafiador devido à linguagem não-padronizada  \ndos tweets, que pode ter sentenças agramaticais, sequências de sintagmáticas curtas, palavras com ortografia não convencional e expressões específicas de domínio. Para odesenvolvimento das aplicações, já há etiquetadores morfossintáticos (taggers) eanalisadores sintáticos (parsers) . Tal ferramental, aliás, tem sido construído com base nos treebanks ou corpora anotados (comumente com informações morfossintáticas e sintáticas) [Sanguinetti et al. 2022] . Os tweebanks mais recentes possuem anotaçãosegundo o modelo gramatical Universal Dependencies (UD) [Nivre et al. 2016] .  \nMotivados pela necessidade de criação de diretrizes para a anotação-UD detweebanks, autores como Sanguinetti et al. (2022) focaram em descrever asidiossincrasias linguísticas mais gerais dos CGUs, propondo uma tipologia. Isso porque, mesmo o CGU sendo um contínuo de subdomínios textuais que variam de acordo com (i) convenções e limitações específicas impostas pela plataforma utilizada (como blog, fórum de discussão, chat online, microblog, etc.), (ii) grau de “canonicidade” em relaçãoa uma linguagem mais padronizada e (iii) dispositivos linguísticos adotados para transmitir uma mensagem, há fenômenos comuns a esse espectr","cbCaitXD1dM13Vfu","https://ap.wps.com/l/cbCaitXD1dM13Vfu","pdf",687509,9,"Portuguese","# Introdução\n## Trabalhos relacionados","[{\"question\":\"Qual é o objetivo principal do artigo sobre tweets do mercado financeiro?\",\"answer\":\"O artigo descreve de forma sistemática fenômenos ortográficos e lexicais presentes em tweets do domínio financeiro em português e usa essa descrição para sustentar diretrizes de anotação e aplicações de PLN.\"},{\"question\":\"Por que a linguagem dos tweets torna a anotação e o processamento mais desafiadores?\",\"answer\":\"Os tweets apresentam linguagem não padronizada, com possíveis sentenças agramaticais, sequências sintáticas curtas, ortografia não convencional e expressões específicas do domínio.\"},{\"question\":\"Como a tipologia proposta se conecta ao modelo Universal Dependencies?\",\"answer\":\"A tipologia é utilizada como base para apoiar a definição de diretrizes de anotação-UD, ajudando a tratar os fenômenos identificados no corpus.\"}]","Tipologia de fenômenos ortográficos e lexicais em CGU: ocaso dos tweets do mercado financeiro | PDF",14]