[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"detail-sidebar-cat-0-pt-112":3,"doc-seo-213725-112":49,"doc-detail-213725-pt":127},{"code":4,"msg":5,"data":6},0,"success",[7,13,17,21,25,29,33,37,41,45],{"id":8,"doc_module":4,"doc_module_name":9,"category_name":10,"show_sort_weight":11,"slug":12},26,"Document","Contos e Romances",60,"story-novel",{"id":14,"doc_module":4,"doc_module_name":9,"category_name":15,"show_sort_weight":11,"slug":16},46,"Estilo de Vida","lifestyle",{"id":18,"doc_module":4,"doc_module_name":9,"category_name":19,"show_sort_weight":11,"slug":20},28,"Exames","exam",{"id":22,"doc_module":4,"doc_module_name":9,"category_name":23,"show_sort_weight":11,"slug":24},47,"Geral","general",{"id":26,"doc_module":4,"doc_module_name":9,"category_name":27,"show_sort_weight":11,"slug":28},29,"Histórias em Quadrinhos","comic",{"id":30,"doc_module":4,"doc_module_name":9,"category_name":31,"show_sort_weight":11,"slug":32},27,"Literatura","literature",{"id":34,"doc_module":4,"doc_module_name":9,"category_name":35,"show_sort_weight":11,"slug":36},32,"Pesquisa e Relatórios","research-report",{"id":38,"doc_module":4,"doc_module_name":9,"category_name":39,"show_sort_weight":11,"slug":40},33,"Religião e Espiritualidade","religion-spirituality",{"id":42,"doc_module":4,"doc_module_name":9,"category_name":43,"show_sort_weight":11,"slug":44},31,"Saúde e Cuidados","healthcare",{"id":46,"doc_module":4,"doc_module_name":9,"category_name":47,"show_sort_weight":11,"slug":48},45,"Tecnologia","technology",{"code":4,"msg":50,"data":51},"ok",{"site_id":52,"language":53,"slug":54,"title":55,"keywords":56,"description":57,"schema_data":58,"social_meta":120,"head_meta":122,"extra_data":124,"updated_unix":126},112,"pt","cartas-investigacao-performance-of-generative-artificial-intelligence-models-in-the-theoretical-exam-for-the-dermatology-specialist-title-ted-comparative-study","Cartas - Investigação - Desempenho de modelos de inteligência artificial generativa na prova teórica do Título de Especialista em Dermatologia (TED) - estudo comparativo","","Desempenho comparativo de modelos de inteligência artificial generativa na prova teórica do Título de Especialista em Dermatologia (TED) 2025, conduzido com estudo observacional, transversal e retrospectivo de abordagem quantitativa. A prova, com 80 questões de múltipla escolha, foi resolvida por oito modelos com prompt padronizado e, quando aplicável, suporte limitado ao upload de imagens. As respostas foram confrontadas com o gabarito oficial, calculando-se acurácia por proporção de acertos. Claude Sonnet 4 liderou (72/80), com heterogeneidade global detectada pelo teste de Cochran’s Q (p=0,0119), sem superioridade pareada robusta, e desempenho consistente acima do acaso, sugerindo potencial complementar no raciocínio clínico dermatológico.",{"@graph":59,"@context":119},[60,77,98],{"@type":61,"itemListElement":62},"BreadcrumbList",[63,68,71,74],{"item":64,"name":65,"@type":66,"position":67},"https://docshare.wps.com","Home","ListItem",1,{"item":69,"name":9,"@type":66,"position":70},"https://docshare.wps.com/pt/document/",2,{"item":72,"name":43,"@type":66,"position":73},"https://docshare.wps.com/pt/document/saúde-e-cuidados/",3,{"item":75,"name":55,"@type":66,"position":76},"https://docshare.wps.com/pt/document/cartas-investigacao-performance-of-generative-artificial-intelligence-models-in-the-theoretical-exam-for-the-dermatology-specialist-title-ted-comparative-study/213725/",4,{"url":75,"name":55,"@type":78,"image":79,"author":84,"headline":55,"publisher":87,"fileFormat":90,"inLanguage":53,"description":57,"dateModified":91,"datePublished":92,"encodingFormat":90,"isAccessibleForFree":93,"interactionStatistic":94},"DigitalDocument",{"url":80,"@type":81,"width":82,"height":83},"https://docshare.wps.com/thumbnails/cartas-investigacao-performance-of-generative-artificial-intelligence-models-in-the-theoretical-exam-for-the-dermatology-specialist-title-ted-comparative-study/213725.png","ImageObject",300,407,{"name":85,"@type":86},"WPS_1786070896","Person",{"url":64,"name":88,"@type":89},"DocShare","Organization","application/pdf","2026-09-25","2026-09-07",true,{"@type":95,"interactionType":96,"userInteractionCount":73},"InteractionCounter",{"@type":97},"ViewAction",{"@type":99,"mainEntity":100},"FAQPage",[101,107,111,115],{"name":102,"@type":103,"acceptedAnswer":104},"Qual foi o objetivo do estudo sobre IA generativa e o TED 2025?","Question",{"text":105,"@type":106},"Avaliar e comparar o desempenho de múltiplas ferramentas de IA generativa na resolução da prova teórica do TED 2025, contribuindo para discutir seu potencial como instrumento complementar na formação e no raciocínio clínico dermatológico.","Answer",{"name":108,"@type":103,"acceptedAnswer":109},"Como as respostas dos modelos foram obtidas e avaliadas?",{"text":110,"@type":106},"Um prompt inicial padronizado foi usado para todos os modelos; o enunciado completo de cada questão, com alternativas e imagens quando disponíveis, foi fornecido à IA. As respostas foram registradas e comparadas com o gabarito oficial, calculando-se a acurácia como proporção de acertos.",{"name":112,"@type":103,"acceptedAnswer":113},"Quais foram os principais achados de desempenho entre os modelos?",{"text":114,"@type":106},"Claude Sonnet 4 obteve 72/80 acertos, seguido por Gemini 2.5 Flash (71/80) e GPT-4.5 (69/80). O desempenho variou entre 59/80 e 72/80, mantendo taxas superiores a 70% na maioria dos modelos.",{"name":116,"@type":103,"acceptedAnswer":117},"O estudo encontrou diferenças estatisticamente significantes entre os modelos?",{"text":118,"@type":106},"O teste de Cochran’s Q indicou diferença estatisticamente significante entre os oito modelos (p=0,0119). Contudo, comparações pareadas com McNemar e ajuste de Holm não identificaram diferenças significantes entre pares específicos, sugerindo heterogeneidade global sem superioridade consistente comprovada.","https://schema.org",{"og:url":75,"og:type":121,"og:title":55,"og:site_name":88,"og:description":57},"article",{"robots":123,"canonical":75},"index,follow",{"doc_id":125,"site_id":52},213725,1788766477,{"code":4,"msg":5,"data":128},{"doc_id":125,"user_id":129,"nickname":85,"user_avatar":130,"doc_module":4,"category_id":42,"category_name":43,"doc_title":55,"doc_description":57,"doc_content":131,"file_id":132,"file_url":133,"file_type":134,"file_size":135,"view_count":73,"is_deleted":4,"is_public":67,"is_downloadable":67,"audit_status":67,"page_count":73,"language":136,"language_code":53,"site_id":52,"html_lang":53,"table_of_contents":137,"faqs":138,"seo_title":139,"seo_description":57,"update_tm":126,"read_time":140},549768072016,"https://ap-avatar.wpscdn.com/davatar_155a257f0dc6eb9ab79c44ca47cae57d","CARTAS - INVESTIGA¸CÃO  \nDesempenho de modelos de inteligência artiﬁcial generativana prova teórica do Título de Especialista em Dermatologia (TED): estudo comparativo􀀂 ,􀀂􀀂  \nPrezado Editor,  \nModelos de linguagem baseados em Inteligência Artiﬁcial (IA), como o ChatGPT, têm sido amplamente explorados na Medicina, demonstrando desempenho comparável ao demédicos e estudantes em exames nacionais e internacionais (USMLE, PLAB, HKMLE, NMLE e Revalida) . Metanálisestambém indicam que alguns desses sistemas apresentamacurácia média estatisticamente inferior à de especialistas, mas comparável à de médicos não especialistas.1---4 Em Dermatologia, modelos de IA têm sido avaliados em diversos contextos, avaliando sua acurácia diagnóstica frente a casosclínicos publicados, em exames de especialidade norte--americanos e no próprio Exame de Título de Especialista em Dermatologia (TED) aplicado pela Sociedade Brasileira de Dermatologia (SBD).5---7Apesar da crescente produc¸ão cientí ﬁca na área, ainda são escassas as comparac¸ões sistemáticasentre diferentes plataformas de IA generativa. Diante disso, o presente estudo tem como objetivo avaliar e comparar odesempenho de múltiplas ferramentas de IA generativa na resoluc¸ão da prova teórica do TED 2025, a ﬁm de contribuir para a discussão sobre seu potencial papel como instrumento complementar na formac¸ão médica especializada e no raciocínio clínico dermatológico.  \nRealizamos um estudo observacional, transversal eretrospectivo, com abordagem quantitativa, realizado para avaliar o desempenho de diferentes modelos de IA generativa na prova teórica do TED 2025, composta por 80 questões de múltipla escolha com quatro alternativas (A, B, C, D) euma única correta, abrangendo temas diversos da Dermato-  \nDOI referente ao artigo:  \n[https://doi.org/10.1016/j.abd.2026.501326](https://doi.org/10.1016/j.abd.2026.501326)  \n􀀂 Como citar este artigo: Pacheco MA, Martini APS. Performance of generative artiﬁcial intelligence models in the theoretical exam for the Dermatology Specialist Title (TED): a comparative study. An Bras Dermatol. 2026;101:501326 .  \n􀀂􀀂 Estudo realizado no Hospital Universitário, Universidade Federal de Santa Catarina, Florianópolis, SC, Brasil.  \nlogia. Foram incluídos oito modelos de IA generativa; suascaracterísticas estão descritas na tabela 1.  \nO prompt inicial foi o mesmo para todos os modelos:‘‘Você está realizando a prova de Título de Especialista em Dermatologia (TED) --- primeira fase. Esta é uma questão demúltipla escolha com quatro alternativas (A, B, C ou D) . Leia atentamente a pergunta e selecione apenas a alternativa correta. Não explique o motivo da sua resposta. Sua resposta deve conter somente uma letra maiúscula: A, B, C ou D’’.  \nAs interac¸ões foram realizadas em julho de 2025. Para cada questão, o enunciado completo --- incluindo texto, alternativas e, quando aplicável, imagens suplementares (nos modelos que suportavam upload de imagens) --- foi fornecido à IA. Apenas uma questão exigia interpretac¸ão de imagem. Não foram fornecidas informac¸ões adicionais além do conteúdo original da prova. As respostas geradas foram registradas e confrontadas com o gabarito oﬁcial divulgadopela banca. A acurácia foi calculada como a proporão derespostas corretas em relac¸ão ao total de questões.  \nAs análises foram realizadas na plataforma Julius AI, utilizando teste de Cochran’s Q para comparaão global e McNemar com ajuste de Holm para comparac¸ões pareadas.  \nClaude Sonnet 4 liderou com 72/80 acertos, seguido por Gemini 2.5 Flash (71/80) e GPT-4.5 (69/80) . DeepSeek V3, Meta LLaMA 4, GPT-3.5 e Grok 3 obtiveram entre 63---64 acertos. Le Chat Mistral AI teve o menor desempenho (59/80)(ﬁg. 1) .  \nA diferena entre o modelo mais preciso e o menos preciso foi de 16,25 pontos percentuais, evidenciando heterogeneidade de performance entre as plataformas. Apesardessa variac¸ão, todos os modelos apresentaram taxa de acerto superior a 70%, o que indica capacidade de resoluc¸ão consist","cbCaitTVBZ5vOPd7","https://ap.wps.com/l/cbCaitTVBZ5vOPd7","pdf",298017,"Portuguese","# Desempenho na prova do TED 2025\n## Metodologia e desenho do estudo\n## Prompt, execução e avaliação\n## Modelos avaliados e resultados\n## Análises estatísticas e interpretação","[{\"question\":\"Qual foi o objetivo do estudo sobre IA generativa e o TED 2025?\",\"answer\":\"Avaliar e comparar o desempenho de múltiplas ferramentas de IA generativa na resolução da prova teórica do TED 2025, contribuindo para discutir seu potencial como instrumento complementar na formação e no raciocínio clínico dermatológico.\"},{\"question\":\"Como as respostas dos modelos foram obtidas e avaliadas?\",\"answer\":\"Um prompt inicial padronizado foi usado para todos os modelos; o enunciado completo de cada questão, com alternativas e imagens quando disponíveis, foi fornecido à IA. As respostas foram registradas e comparadas com o gabarito oficial, calculando-se a acurácia como proporção de acertos.\"},{\"question\":\"Quais foram os principais achados de desempenho entre os modelos?\",\"answer\":\"Claude Sonnet 4 obteve 72/80 acertos, seguido por Gemini 2.5 Flash (71/80) e GPT-4.5 (69/80). O desempenho variou entre 59/80 e 72/80, mantendo taxas superiores a 70% na maioria dos modelos.\"},{\"question\":\"O estudo encontrou diferenças estatisticamente significantes entre os modelos?\",\"answer\":\"O teste de Cochran’s Q indicou diferença estatisticamente significante entre os oito modelos (p=0,0119). Contudo, comparações pareadas com McNemar e ajuste de Holm não identificaram diferenças significantes entre pares específicos, sugerindo heterogeneidade global sem superioridade consistente comprovada.\"}]","Cartas - Investigação - Desempenho de modelos de inteligência artificial generativa na prova teórica do Título de Especialista em Dermatologia (TED) - estudo comparativo | PDF",5]