¿Funcionan realmente los detectores de escritura de IA? 5 herramientas probadas para su precisión

7

Vivimos en una era en la que un simple desplazamiento por las redes sociales puede desencadenar paranoia. ¿Un humano escribió esto? ¿O un LLM lo escupió?

La respuesta importa. Ya sea que esté calificando ensayos, contratando escritores o simplemente cansado de leer contenido estéril en línea, quiere saber la verdad. Supuestamente, la IA deja huellas dactilares. El em dash es el sospechoso habitual. Tono monótono. El otro.

Pero, ¿pueden las herramientas detectar estos tics de forma fiable?

Ejecuté cinco detectores de IA populares en un experimento controlado. Por un lado: cuatro artículos que escribí a mano (sin bots). Por el otro: introducciones de 150 palabras generadas por ChatGPT, Gemini y Claude basadas en los títulos de mis artículos.

¿Los resultados? Algunas herramientas lo lograron. Otros no dieron en el blanco.

Pangram: El corrector confiado

Pangram afirma ser el detector que “realmente funciona”. No es gratis para siempre, pero el nivel gratuito permite cuatro cheques por día. Los planes pagos comienzan en $20.

Esto es lo que pasó:
*Mi escritura: 100% Humana. Alta confianza.
* ChatGPT/Claude texto: 100% IA.

Pangram identificó correctamente cada muestra. Incluso destacó obsequios específicos, como la estructura repetitiva “desde el momento en que…” en las muestras de IA.

Veredicto: 4/4 correcto.

Grammarly: El gigante gramatical entra al chat

Probablemente uses Grammarly para errores tipográficos. Ahora también marca la IA. Las cuentas gratuitas reciben tres cheques al día. Los planes pagos comienzan en $12.

¿Mis muestras? Cero por ciento de IA. Sin patrones. Pizarra limpia.

¿Las muestras de IA? No tan blanco y negro.
* Claude: 68% IA.
* Géminis: 66% IA.

Grammarly detectó las huellas dactilares de la IA. Pero no estaba del todo convencido. Vio los patrones pero dudó sobre el veredicto. Aún así, acertó en la llamada.

Veredicto: 4/4 correcto.

GPTZero: Preservando al ser humano

La misión de GPTZero es “preservar lo que es humano”. Los usuarios gratuitos pueden escanear 10.000 palabras al mes. Los planes pagos comienzan alrededor de $24.

Para la tercera herramienta, me estaba volviendo arrogante. Mi estilo de escritura debe ser claramente ajeno a la IA. GPTZero estuvo de acuerdo. “Estoy muy seguro de que este texto es enteramente humano”.

Cuando se le alimentaron con muestras de IA, también las atrapó. Incluso señaló qué frases parecían más robóticas. Luché por ver el patrón. Quizás esté ahí. Quizás no. Pero la herramienta no los pasó por alto.

Veredicto: 4/4 correcto.

Scribbr: el valor atípico gratuito

Scribbr ofrece servicios de edición y un detector gratuito. No se necesita cuenta. Simplemente pegue y verifique.

¿Mi escritura? Autorizado como 100% humano. Bien.

¿Las muestras de IA? También marcado como 100% escrito por humanos.

Aquí es donde se rompió. Scribbr afirmó que los textos de ChatGPT y Claude eran completamente humanos. La herramienta parecía muy segura de su respuesta incorrecta. Cualquiera que sea su algoritmo, necesita una actualización.

Veredicto: 2/4 correcto.

Copyleaks: El contendiente de media derecha

Copyleaks verifica texto, imágenes y videos. Cuatro escaneos gratuitos. Los niveles pagos comienzan en $17.

¿Mi texto? 100% libre de humanos.

¿La prueba de IA? Bolsa mixta.
* Géminis: 100% IA (Correcto).
* Claude: 0% IA (Incorrecto).

Copyleaks atrapó a un robot pero dejó pasar al otro. Parece tener problemas con la calibración según el modelo que estés probando.

Veredicto: 3/4 ​​correcto.

La conclusión final

No estaba seguro de qué esperar. Por eso los probé. ¿Pero ahora? Es más claro.

Los detectores de IA no son perfectos.

Trabajaron constantemente para identificar mi escritura humana. Cada herramienta marcó mi texto como humano. Parece más fácil confirmar qué no es IA que qué lo es.

Lo contrario no fue cierto. Scribbr fracasó gravemente. Copyleaks pasó por alto la mitad de los bots. Los demás quedaron perfectos en esta pequeña muestra.

Si realmente quiere captar la escritura de IA, no confíe en una sola herramienta. Utilice dos o tres en tándem. Busque patrones. Y tal vez actualice para obtener un razonamiento detallado si hay mucho en juego.

¿Existe una indicación definitiva? Tal vez. O tal vez sea simplemente un juego del gato y el ratón que cambia con cada actualización del modelo.

Divulgación: la empresa matriz de Popular Science demandó a OpenAI en abril de 2024 por infracción de derechos de autor. Este contexto puede influir en el panorama, aunque los resultados de las pruebas anteriores reflejan el rendimiento de las herramientas de forma aislada.

Попередня статтяCómo la optimización de la IA corre el riesgo de empeorar el estancamiento de la puntuación NAEP