Чи справді працюють детектори письма ШІ? Виставляємо 5 на тест.

1

Чи дійсно працюють детектори ІІ-текстів? Перевірка 5 інструментів

Ми живемо в епоху, коли просте перегортання стрічки в соціальних мережах може викликати параною. Хто це написав: людина чи штучний інтелект?

Від цієї відповіді багато що залежить. Whether ви перевіряєте твори, наймаєте авторів або просто втомилися від безликого контенту в інтернеті – вам потрібна правда. Говорять, що ІІ залишає свої відбитки. Зазвичай підозрюють тире (em dash), монотонний тон чи інші маркери.

Але чи інструменти можуть надійно виявляти ці ознаки?

Я провів тест п’ятьох популярних детекторів ІІ в контрольованих умовах. З одного боку: чотири статті, написані вручну (без участі роботів). З іншого: вступні частини по 150 слів, згенеровані ChatGPT, Gemini та Claude на основі заголовків моїх статей.

Результати? Деякі інструменти справився чудово. Інші промахнулися повз.

Pangram: Впевнений перевірник

Pangram стверджує, що це детектор, який справді працює. Він не безкоштовний назавжди, але безкоштовний тариф дозволяє робити чотири перевірки на день. Платні тарифи розпочинаються від $20.

Ось що сталося:
* Мій текст: 100% осіб. Висока упевненість.
* Текст від ChatGPT/Claude: 100% ІІ.

Pangram правильно визначив кожен зразок. Він навіть виділив конкретні докази, такі як структура, що повторюється, «від того моменту, як…» в ІІ-текстах.

Вердикт: 4 з 4 вірно.

Grammarly: Гігант граматики виходить на арену

Ймовірно, ви використовуєте Grammarly для перевірки помилок. Тепер він також зазначає ІІ-тексти. Безкоштовні облікові записи отримують три перевірки на день. Платні тарифи розпочинаються від $12.

Мої зразки? 0% ІІ. Жодних шаблонів. Чистий результат.

ІІ-зразки? Не настільки однозначні.
* Claude: 68% ІІ.
* Gemini: 66% ІІ.

Grammarly помітив сліди ІІ. Але він не був певний на 100%. Інструмент побачив патерни, але вагався у вироку. Тим не менш, він дав правильну відповідь.

Вердикт: 4 з 4 вірно.

GPTZero: Зберігаючи людське

Місія GPTZero – «зберігати людське». Безкоштовні користувачі можуть перевіряти 10 000 слів на місяць. Платні тарифи починаються приблизно із $24.

До третього інструменту я почав надмірно самовпевнений. Мій стиль листа має бути явно неІІ-шним. GPTZero погодився. “Висока впевненість у тому, що цей текст цілком написаний людиною”.

Коли я подав ІІ-зразки, він також їх розпізнав. Він навіть зазначив, які пропозиції виглядають найбільш роботизовано. Мені було важко побачити ці патерни. Можливо вони там є. А можливо, ні. Але інструмент їх не прогав.

Вердикт: 4 з 4 вірно.

Scribbr: Безкоштовний аутсайдер

Scribbr пропонує послуги редагування та безкоштовний детектор. Реєстрація не потрібна. Просто вставте текст та перевірте.

Мій текст? Виправданий на 100% як людський. Добре.

ІІ-зразки? Також відзначені як на 100% написані людиною.

Тут він провалився. Scribbr стверджував, що тексти від ChatGPT та Claude написані повністю людьми. Інструмент був дуже впевнений у своїй помилковій відповіді. Яким би не був його алгоритм, йому потрібне оновлення.

Вердикт: 2 з 4 вірно.

Copyleaks: contenders, який має рацію лише частково

Copyleaks перевіряє текст, зображення та відео. Чотири безкоштовні сканування. Платні тарифи розпочинаються від $17.

Мій текст? 100% без домішок ІІ.

Тест ІІ? Результат змішаний.
* Gemini: 100% ІІ (Вірно).
* Claude: 0% ІІ (Неправильно).

Copyleaks помітив одного бота, але пропустив іншого. Схоже, йому складно з калібруванням, залежно від того, яку модель ви тестуєте.

Вердикт: 3 із 4 вірно.

Головний висновок

Я не був певен, чого чекати. Ось тому я провів тест. Але ж тепер? Ситуація прояснилася.

Детектори ІІ не ідеальні.

Вони послідовно впоралися з ідентифікацією мого людського тексту. Кожен інструмент помітив мій текст як написаний людиною. Схоже, підтвердити те, що не є ІІ, простіше, ніж те, що є.

Зворотне твердження неправильне. Scribbr провалився повністю. Copyleaks пропустив половину роботів. Інші інструменти були ідеальні у цьому малому вибірці.

Якщо ви серйозно налаштовані на виявлення ІІ-текстів, не довіряйте одному інструменту. Використовуйте два чи три одночасно. Шукайте патерни. І, можливо, оновіться до платної версії для детального обґрунтування, якщо ставки високі.

Чи є однозначна ознака? Можливо. А можливо, це просто гра в кішки-мишки, що змінюється з кожним оновленням моделей.

*Відмова від відповідальності: Компанія-материнська компанія Popular Science подала до суду на OpenAI у квітні 2024 року за порушення авторських прав. Цей контекст може впливати на загальну ситуацію, хоча результати тесту вище відображають роботу інструментів ізольовано.

Попередня статтяЯк оптимізація ІІ може посилити стагнацію результатів NAEP