
Detectores de IA erram tanto que já minam a confiança na educação
Ferramentas usadas por professores para flagrar textos gerados por IA têm taxa de falso positivo de até 15% — e penalizam desproporcionalmente estudantes estrangeiros e neurodivergentes.
Por Elias Brandão · Analista de IA e ética
O problema, em bom português
Detector de IA promete uma coisa simples: apontar se um texto foi escrito por humano ou por máquina. Na prática, funciona mais como um detector de mentiras dos anos 1970 — dá resultado, mas o resultado erra com frequência incômoda demais para decidir a vida acadêmica de alguém.
Estudos independentes apontam taxa de falso positivo entre 4% e 15%, variando conforme o detector e o contexto do texto avaliado. Parece pouco, até fazer a conta: uma universidade com 75 mil trabalhos avaliados por ano, aplicando 1% de falso positivo, gera cerca de 750 acusações indevidas por ano. Foi esse cálculo que levou a Universidade Vanderbilt a desligar a função de detecção de IA do Turnitin em 2023 — e o problema não foi resolvido desde então.
Os dois lados
De um lado, professores lidam com uma onda real de trabalhos gerados por IA sem citação, e precisam de alguma ferramenta de triagem — não dá pra avaliar cada um dos milhares de textos manualmente à procura de padrões de escrita artificial. Do outro lado, o próprio funcionamento estatístico dos detectores é o problema: eles procuram previsibilidade e repetição de vocabulário, e é exatamente isso que caracteriza a escrita de quem aprendeu inglês como segunda língua ou tem uma condição como TDAH, dislexia ou autismo.
Um levantamento com redações do exame TOEFL encontrou taxa de falso positivo de 61,3% para estudantes chineses, contra 5,1% para estudantes americanos no mesmo teste. Ou seja: o detector não está identificando "texto de IA" com precisão — está identificando um jeito de escrever, e penalizando quem escreve diferente do padrão que o treinou.
O que isso quebra
O resultado é uma epidemia de desconfiança. Estudantes descrevem a sensação de escrever com medo, guardando rascunhos e histórico de edição como prova de inocência antecipada. Pesquisas mostram que as próprias instituições já tratam o resultado do detector como indício, não como prova — o que é o comportamento correto, mas exige julgamento humano em cada caso, o que anula boa parte do ganho de eficiência que a ferramenta prometia entregar.