Os detectores de escrita de IA realmente funcionam? 5 ferramentas testadas quanto à precisão

9

Vivemos em uma época em que uma simples navegação nas redes sociais pode desencadear paranóia. Um humano escreveu isso? Ou um LLM cuspiu isso?

A resposta é importante. Esteja você avaliando redações, contratando escritores ou apenas cansado de ler conteúdo estéril online, você quer saber a verdade. Supostamente, a IA deixa impressões digitais. O travessão é o suspeito de sempre. Tom monótono. O outro.

Mas as ferramentas podem realmente detectar esses tiques de forma confiável?

Executei cinco detectores de IA populares em um experimento controlado. De um lado: quatro artigos que escrevi à mão (sem bots). Por outro lado: introduções de 150 palavras geradas por ChatGPT, Gemini e Claude com base nos títulos dos meus artigos.

Os resultados? Algumas ferramentas acertaram em cheio. Outros erraram o alvo com força.

Pangram: O verificador confiante

Pangram afirma ser o detector que “realmente funciona”. Não é gratuito para sempre, mas o nível gratuito permite quatro cheques por dia. Os planos pagos começam em US$ 20.

Aqui está o que aconteceu:
*Minha escrita: 100% Humana. Alta confiança.
* Texto ChatGPT/Claude: 100% IA.

Pangram identificou corretamente cada amostra. Ele ainda destacou brindes específicos, como a estrutura repetitiva “a partir do momento em que você…” nas amostras de IA.

Veredicto: 4/4 correto.

Grammarly: O gigante da gramática entra no chat

Você provavelmente usa Grammarly para erros de digitação. Agora também sinaliza IA. As contas gratuitas recebem três cheques diariamente. Os planos pagos custam US$ 12.

Minhas amostras? Zero por cento de IA. Sem padrões. Ficha limpa.

As amostras de IA? Não como preto e branco.
* Claude: 68% IA.
* Gêmeos: 66% IA.

Identificou gramaticalmente as impressões digitais da IA. Mas não estava totalmente convencido. Ele viu os padrões, mas hesitou no veredicto. Ainda assim, acertou a ligação.

Veredicto: 4/4 correto.

GPTZero: Preservando o humano

A missão do GPTZero é “preservar o que é humano”. Os usuários gratuitos podem digitalizar 10.000 palavras por mês. Os planos pagos começam em torno de US$ 24.

Na terceira ferramenta, eu estava ficando arrogante. Meu estilo de escrita deve ser distintamente não-IA. GPTZero concordou. “Altamente confiante de que este texto é inteiramente humano.”

Quando alimentado com amostras de IA, ele também as pegou. Ele até apontou quais frases pareciam mais robóticas. Eu me esforcei para ver o padrão. Talvez esteja lá. Talvez não. Mas a ferramenta não os perdeu.

Veredicto: 4/4 correto.

Scribbr: O valor discrepante gratuito

O Scribbr oferece serviços de edição e um detector gratuito. Nenhuma conta é necessária. Basta colar e verificar.

Minha escrita? Liberado como 100% humano. Bom.

As amostras de IA? Também marcado como 100% escrito por humanos.

Foi aqui que quebrou. O Scribbr afirmou que os textos do ChatGPT e do Claude eram totalmente humanos. A ferramenta parecia muito confiante em sua resposta errada. Seja qual for o seu algoritmo, ele precisa de uma atualização.

Veredicto: 2/4 correto.

Copyleaks: o candidato meio certo

Copyleaks verifica texto, imagens e vídeo. Quatro varreduras gratuitas. Os níveis pagos começam em US$ 17.

Meu texto? 100% livre de humanos.

O teste de IA? Saco misto.
* Gêmeos: 100% IA (Correto).
* Claude: 0% IA (Incorreto).

Copyleaks pegou um bot, mas deixou o outro passar. Parece haver dificuldades com a calibração dependendo do modelo que você está testando.

Veredicto: 3/4 ​​correto.

A lição final

Eu não tinha certeza do que esperar. É por isso que os testei. Mas agora? É mais claro.

Os detectores de IA não são perfeitos.

Eles trabalharam consistentemente para identificar minha escrita humana. Cada ferramenta sinalizou meu texto como humano. Parece mais fácil confirmar o que não é IA do que o que é.

O inverso não era verdade. O Scribbr falhou gravemente. Copyleaks perdeu metade dos bots. Os outros foram perfeitos nesta pequena amostra.

Se você quer realmente capturar a escrita de IA, não confie em uma ferramenta. Use dois ou três em conjunto. Procure padrões. E talvez atualize para obter um raciocínio detalhado se os riscos forem altos.

Existe uma indicação definitiva? Talvez. Ou talvez seja apenas um jogo de gato e rato que muda a cada atualização do modelo.

Divulgação: a empresa controladora da Popular Science processou a OpenAI em abril de 2024 por violação de direitos autorais. Este contexto pode influenciar o cenário, embora os resultados dos testes acima reflitam o desempenho das ferramentas isoladamente.

Попередня статтяComo a otimização de IA corre o risco de piorar a estagnação da pontuação NAEP