Informações do Trabalho
Titulo
Detecção de Fraude Assistida por Modelos de Linguagem em Dissertações Argumentativas
Subtítulo
Autor
MARCOS PAULO RODRIGUES DA SILVA
Orientador
JAIRO FRANCISCO DE SOUZA
Resumo
A popularização dos grandes modelos de linguagem introduziu desafios sem precedentes para a integridade acadêmica, deslocando o foco do plágio tradicional para a geração sintética de textos. Em ambientes de avaliação supervisionados, esse cenário foi agravado pelo surgimento do copy-typing, um comportamento dissimulado no qual estudantes transcrevem manualmente textos gerados por inteligência artificial, inserindo ruídos, anomalias e edições intencionais com o objetivo de mascarar sua origem automática e dificultar a detecção por sistemas convencionais de identificação de plágio e autoria sintética. Diante dessa problemática, este trabalho tem como objetivo desenvolver uma solução computacional capaz de detectar fraudes em textos dissertativo-argumentativos e modelar padrões híbridos de autoria textual. Neste contexto, este estudo propõe uma abordagem computacional para a detecção de fraudes educacionais baseada em um problema de classificação multiclasse, capaz de distinguir três categorias distintas de autoria: textos produzidos por seres humanos, textos gerados integralmente por inteligência artificial e textos resultantes de copy-typing. Para isso, foi desenvolvido um pipeline de processamento de linguagem natural baseado no modelo pré-treinado BERTimbau. Adicionalmente, investigou-se uma arquitetura híbrida baseada em late fusion, que incorpora características estilométricas extraídas a priori dos textos. Os experimentos foram conduzidos em dois corpora distintos possibilitando avaliar o impacto da variabilidade dos dados na capacidade de generalização dos modelos. Os resultados demonstraram que o aumento da diversidade amostral produziu ganhos substanciais de desempenho. Além das métricas tradicionais de classificação, foram empregadas técnicas de calibração probabilística, ajuste de limiares de decisão e análise de incerteza, permitindo avaliar o comportamento probabilístico das predições e identificar cenários de elevada ambiguidade. Por fim, foram incorporadas técnicas de inteligência artificial explicável, utilizando SHAP, LIME e Integrated Gradients para interpretar o processo de decisão e investigar os padrões linguísticos mais relevantes para a classificação. Os resultados indicam que a abordagem proposta constitui uma alternativa promissora para a identificação de conteúdos produzidos ou assistidos por inteligência artificial, contribuindo para o desenvolvimento de ferramentas de auditoria acadêmica mais transparentes, interpretáveis e alinhadas às novas demandas impostas pela inteligência artificial generativa.
Ano:
2026
Palavras-Chave
Inteligência artificial, processamento de linguagem natural, detecção de fraude, copy-typing, BERTimbau, fusão tardia, inteligência artificial explicável.
Obter PDF
Obter arquivos extras
Obter Bibtex