[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"doc-seo-209822-112":3,"detail-sidebar-cat-0-pt-112":80,"doc-detail-209822-pt":123},{"code":4,"msg":5,"data":6},0,"ok",{"site_id":7,"language":8,"slug":9,"title":10,"keywords":11,"description":12,"schema_data":13,"social_meta":73,"head_meta":75,"extra_data":77,"updated_unix":79},112,"pt","an-approach-based-on-simulation-with-large-language-models-validating-enem-question-difficulty-using-irt","Uma Abordagem Baseada em Simulaç o com Grandes Modelos de Linguagem - Validaç ão de Dificuldade de Questões do ENEM a partir da TRI","","A criação e a calibração de itens avaliativos dependem de estimativas precisas de dificuldade, o que costuma exigir tempo e conhecimento pedagógico. O trabalho propõe usar Grandes Modelos de Linguagem (LLMs) para estimar o parâmetro b da Teoria de Resposta ao Item (TRI) em questões do ENEM, simulando respostas de estudantes em diferentes níveis de habilidade. Prompts foram comparados, e um mostrou desempenho promissor ao inferir b a partir do texto e das alternativas. As métricas de erro indicaram discrepâncias pequenas sem afetar a classificação em níveis, com acurácia acima de 50% em três níveis, demonstrando viabilidade para avaliação automatizada.",{"@graph":14,"@context":72},[15,34,55],{"@type":16,"itemListElement":17},"BreadcrumbList",[18,23,27,31],{"item":19,"name":20,"@type":21,"position":22},"https://docshare.wps.com","Home","ListItem",1,{"item":24,"name":25,"@type":21,"position":26},"https://docshare.wps.com/pt/document/","Document",2,{"item":28,"name":29,"@type":21,"position":30},"https://docshare.wps.com/pt/document/pesquisa-e-relatórios/","Pesquisa e Relatórios",3,{"item":32,"name":10,"@type":21,"position":33},"https://docshare.wps.com/pt/document/an-approach-based-on-simulation-with-large-language-models-validating-enem-question-difficulty-using-irt/209822/",4,{"url":32,"name":10,"@type":35,"image":36,"author":41,"headline":10,"publisher":44,"fileFormat":47,"inLanguage":8,"description":12,"dateModified":48,"datePublished":49,"encodingFormat":47,"isAccessibleForFree":50,"interactionStatistic":51},"DigitalDocument",{"url":37,"@type":38,"width":39,"height":40},"https://docshare.wps.com/thumbnails/an-approach-based-on-simulation-with-large-language-models-validating-enem-question-difficulty-using-irt/209822.png","ImageObject",300,407,{"name":42,"@type":43},"Rizky","Person",{"url":19,"name":45,"@type":46},"DocShare","Organization","application/pdf","2026-09-28","2026-09-05",true,{"@type":52,"interactionType":53,"userInteractionCount":26},"InteractionCounter",{"@type":54},"ViewAction",{"@type":56,"mainEntity":57},"FAQPage",[58,64,68],{"name":59,"@type":60,"acceptedAnswer":61},"Como os Grandes Modelos de Linguagem são usados para estimar a dificuldade nas questões do ENEM?","Question",{"text":62,"@type":63},"Os LLMs simulam respostas de estudantes em diferentes níveis de habilidade e, a partir dessas simulações, permitem calcular o parâmetro b da TRI para cada questão.","Answer",{"name":65,"@type":60,"acceptedAnswer":66},"O que o parâmetro b da TRI representa neste trabalho?",{"text":67,"@type":63},"O parâmetro b indica o nível de habilidade no qual a probabilidade de acerto é de 50%, funcionando como um indicador quantitativo da dificuldade do item.",{"name":69,"@type":60,"acceptedAnswer":70},"Os prompts testados conseguem reproduzir os níveis de dificuldade observados em questões reais?",{"text":71,"@type":63},"Sim. As métricas de erro mostraram discrepâncias pequenas e não comprometeram a classificação em níveis de dificuldade, alcançando mais de 50% de acurácia nos três níveis avaliados.","https://schema.org",{"og:url":32,"og:type":74,"og:title":10,"og:site_name":45,"og:description":12},"article",{"robots":76,"canonical":32},"index,follow",{"doc_id":78,"site_id":7},209822,1790566228,{"code":4,"msg":81,"data":82},"success",[83,88,92,96,100,104,108,111,115,119],{"id":84,"doc_module":4,"doc_module_name":25,"category_name":85,"show_sort_weight":86,"slug":87},26,"Contos e Romances",60,"story-novel",{"id":89,"doc_module":4,"doc_module_name":25,"category_name":90,"show_sort_weight":86,"slug":91},46,"Estilo de Vida","lifestyle",{"id":93,"doc_module":4,"doc_module_name":25,"category_name":94,"show_sort_weight":86,"slug":95},28,"Exames","exam",{"id":97,"doc_module":4,"doc_module_name":25,"category_name":98,"show_sort_weight":86,"slug":99},47,"Geral","general",{"id":101,"doc_module":4,"doc_module_name":25,"category_name":102,"show_sort_weight":86,"slug":103},29,"Histórias em Quadrinhos","comic",{"id":105,"doc_module":4,"doc_module_name":25,"category_name":106,"show_sort_weight":86,"slug":107},27,"Literatura","literature",{"id":109,"doc_module":4,"doc_module_name":25,"category_name":29,"show_sort_weight":86,"slug":110},32,"research-report",{"id":112,"doc_module":4,"doc_module_name":25,"category_name":113,"show_sort_weight":86,"slug":114},33,"Religião e Espiritualidade","religion-spirituality",{"id":116,"doc_module":4,"doc_module_name":25,"category_name":117,"show_sort_weight":86,"slug":118},31,"Saúde e Cuidados","healthcare",{"id":120,"doc_module":4,"doc_module_name":25,"category_name":121,"show_sort_weight":86,"slug":122},45,"Tecnologia","technology",{"code":4,"msg":81,"data":124},{"doc_id":78,"user_id":125,"nickname":42,"user_avatar":126,"doc_module":4,"category_id":109,"category_name":29,"doc_title":10,"doc_description":12,"doc_content":127,"file_id":128,"file_url":129,"file_type":130,"file_size":131,"view_count":26,"is_deleted":4,"is_public":22,"is_downloadable":22,"audit_status":22,"page_count":132,"language":133,"language_code":8,"site_id":7,"html_lang":8,"table_of_contents":134,"faqs":135,"seo_title":136,"seo_description":12,"update_tm":137,"read_time":138},962085564807,"https://ap-avatar.wpscdn.com/davatar_6f874abed73319feea01a86fa6f0fab8","XIV Congresso Brasileiro de Informática na Educação (CBIE 2025)  \nAnais do III Workshop de Aplicações Práticas de Learning Analytics e Inteligência Artificial no Brasil (WAPLA 2025)  \nUma Abordagem Baseada em Simulac¸ o com Grandes Modelos de Linguagem para Validac¸ o de Dificuldade de Questes do ENEM a partir da TRI  \nJssica Alves de Souza, Ebony Rodrigues, Roberta Gouveia, Gabriel Alves  \n1Departamento de Estat´ıstica e Informtica (DEINFO) Universidade Federal Rural de Pernambuco (UFRPE)  \n{jessica.alvess,ebony.marquesr,roberta.gouveia,gabriel.alves}@ufrpe .br  \nAbstract. The creation of assessment items is a complex task, especially in defi ning their difficulty level. This study proposes the use of Large Language Models (LLMs) to estimate the difficulty parameter b of the Item Response Theory (IRT) for ENEM questions. The LLMs simulate student responses at different ability levels, allowing the calculation of b and comparison with the known parameters of ENEM items. Different prompts were tested, and one of them showed promising results by estimating b solely based on the question text and answer options.  \nError metrics indicated minor discrepancies, without compromising the classifi cation into difficulty levels, achieving over 50% accuracy across the three levels.  \nThe analysis demonstrated that this strategy is feasible for automated difficulty assessment.  \nResumo. A criac¸ a˜o de questo˜es avaliativas e´ uma tarefa complexa, especialmente na definic¸ a˜o do nı´vel de dificuldade. Este trabalho propo˜e o uso de Grandes Modelos de Linguagem (LLMs) para estimar o par aˆmetro de dificuldadeb da Teoria de Resposta ao Item (TRI) em quest o˜es do ENEM. Os LLMs simulam respostas de estudantes com diferentes habilidades, permitindo calcularb e comparar com os par aˆmetros conhecidos de questo˜es do ENEM. Diferentes prompts foram testados, e um deles apresentou resultados promissores esti mando b apenas com base no texto e alternativas da quest a˜o. As me´tricas deerro indicaram pequenas discrep aˆncias, sem comprometer a classificac¸ a˜o em nı´veis de dificuldade, com acura´cia acima dos 50%, para os 3 n ı´veis de dificuldade. A ana´lise mostrou que a estrate´gia e´ via´vel para avaliac¸ a˜o automatizadada dificuldade.  \n1. Introduc¸ o  \nA criac¸ o de questes avaliativas˜  uma tarefa complexa, que exige tempo, conhecimentopedaggico e cuidado na definic¸ ao, entre ou˜tras variveis, do n´ıvel de dificuldade de cada item. A dificuldade em˜ estimar com precisao esse n´ıvel pode gerar problema˜s significativos, como a elaborac¸ao de itens excessivamente fceis ou dif´ıceis, vieses nao intenci˜ onais e falta de consistncia entre diferentes provas, impactando a validade ˜das avaliac¸ oes  \n[Kurdi et al. 2020, Mulla and Gharpure 2023] . Nesse contexto, a utilizac¸ao de Grandes Modelos de Linguagem (LLMs, do ingls Large Language Mod˜ els) pode contribuir para  \na eficincia e a escalabilidade do processo de anlise de questoes a fim de determinar asua dificuldade.  \nDOI: 10.5753/wapla.2025.16245 91  \nXIV Congresso Brasileiro de Informática na Educação (CBIE 2025)  \nAnais do III Workshop de Aplicações Práticas de Learning Analytics e Inteligência Artificial no Brasil (WAPLA 2025)  \nA Teoria de Resposta ao Item (TRI) fornece um arcabouc¸o estat´ıstico robusto para estimar parmetros que descrevem o desempenho esperado dos respondentes [Baker 2001] . Em particular, o parmetro b, que indica o n´ıvel de habilidade no qual a probabilidade de acerto  de 50%, constitui um indicador quantitativo da dificuldade do item. O Instituto Nacional de Estudos e Pesquisas Educacio˜ nais An´ısio Teixeira (INEP) dispo  \nnibiliza publicamente os parmetros da TRI das questoes aplicadas no Exame Nacional do Ensino Mdio (ENEM), oferecendo uma˜referncia para calibrar mtodos automatizados  \nde estimativa de dificuldade nessas questoes [Tomikawa and Uto 2024] .  \nEste trabalho p˜ rope a utilizac¸ o de LLMs para estimar˜ a dificuldade das questes, em˜ pregando as qu","cbCaikJYCVHr2nse","https://ap.wps.com/l/cbCaikJYCVHr2nse","pdf",372147,9,"Portuguese","# Introdução\n## Trabalhos Relacionados\n## Metodologia e estimativa do parâmetro b (TRI)","[{\"question\":\"Como os Grandes Modelos de Linguagem são usados para estimar a dificuldade nas questões do ENEM?\",\"answer\":\"Os LLMs simulam respostas de estudantes em diferentes níveis de habilidade e, a partir dessas simulações, permitem calcular o parâmetro b da TRI para cada questão.\"},{\"question\":\"O que o parâmetro b da TRI representa neste trabalho?\",\"answer\":\"O parâmetro b indica o nível de habilidade no qual a probabilidade de acerto é de 50%, funcionando como um indicador quantitativo da dificuldade do item.\"},{\"question\":\"Os prompts testados conseguem reproduzir os níveis de dificuldade observados em questões reais?\",\"answer\":\"Sim. As métricas de erro mostraram discrepâncias pequenas e não comprometeram a classificação em níveis de dificuldade, alcançando mais de 50% de acurácia nos três níveis avaliados.\"}]","Uma Abordagem Baseada em Simulaç o com Grandes Modelos de Linguagem - Validaç ão de Dificuldade de Questões do ENEM a partir da TRI | PDF",1788633758,14]