Чи дійсно працюють детектори ІІ-текстів? Перевірка 5 інструментів
Ми живемо в епоху, коли просте перегортання стрічки в соціальних мережах може викликати параною. Хто це написав: людина чи штучний інтелект?
Від цієї відповіді багато що залежить. Whether ви перевіряєте твори, наймаєте авторів або просто втомилися від безликого контенту в інтернеті – вам потрібна правда. Говорять, що ІІ залишає свої відбитки. Зазвичай підозрюють тире (em dash), монотонний тон чи інші маркери.
Але чи інструменти можуть надійно виявляти ці ознаки?
Я провів тест п’ятьох популярних детекторів ІІ в контрольованих умовах. З одного боку: чотири статті, написані вручну (без участі роботів). З іншого: вступні частини по 150 слів, згенеровані ChatGPT, Gemini та Claude на основі заголовків моїх статей.
Результати? Деякі інструменти справився чудово. Інші промахнулися повз.
Pangram: Впевнений перевірник
Pangram стверджує, що це детектор, який справді працює. Він не безкоштовний назавжди, але безкоштовний тариф дозволяє робити чотири перевірки на день. Платні тарифи розпочинаються від $20.
Ось що сталося:
* Мій текст: 100% осіб. Висока упевненість.
* Текст від ChatGPT/Claude: 100% ІІ.
Pangram правильно визначив кожен зразок. Він навіть виділив конкретні докази, такі як структура, що повторюється, «від того моменту, як…» в ІІ-текстах.
Вердикт: 4 з 4 вірно.
Grammarly: Гігант граматики виходить на арену
Ймовірно, ви використовуєте Grammarly для перевірки помилок. Тепер він також зазначає ІІ-тексти. Безкоштовні облікові записи отримують три перевірки на день. Платні тарифи розпочинаються від $12.
Мої зразки? 0% ІІ. Жодних шаблонів. Чистий результат.
ІІ-зразки? Не настільки однозначні.
* Claude: 68% ІІ.
* Gemini: 66% ІІ.
Grammarly помітив сліди ІІ. Але він не був певний на 100%. Інструмент побачив патерни, але вагався у вироку. Тим не менш, він дав правильну відповідь.
Вердикт: 4 з 4 вірно.
GPTZero: Зберігаючи людське
Місія GPTZero – «зберігати людське». Безкоштовні користувачі можуть перевіряти 10 000 слів на місяць. Платні тарифи починаються приблизно із $24.
До третього інструменту я почав надмірно самовпевнений. Мій стиль листа має бути явно неІІ-шним. GPTZero погодився. “Висока впевненість у тому, що цей текст цілком написаний людиною”.
Коли я подав ІІ-зразки, він також їх розпізнав. Він навіть зазначив, які пропозиції виглядають найбільш роботизовано. Мені було важко побачити ці патерни. Можливо вони там є. А можливо, ні. Але інструмент їх не прогав.
Вердикт: 4 з 4 вірно.
Scribbr: Безкоштовний аутсайдер
Scribbr пропонує послуги редагування та безкоштовний детектор. Реєстрація не потрібна. Просто вставте текст та перевірте.
Мій текст? Виправданий на 100% як людський. Добре.
ІІ-зразки? Також відзначені як на 100% написані людиною.
Тут він провалився. Scribbr стверджував, що тексти від ChatGPT та Claude написані повністю людьми. Інструмент був дуже впевнений у своїй помилковій відповіді. Яким би не був його алгоритм, йому потрібне оновлення.
Вердикт: 2 з 4 вірно.
Copyleaks: contenders, який має рацію лише частково
Copyleaks перевіряє текст, зображення та відео. Чотири безкоштовні сканування. Платні тарифи розпочинаються від $17.
Мій текст? 100% без домішок ІІ.
Тест ІІ? Результат змішаний.
* Gemini: 100% ІІ (Вірно).
* Claude: 0% ІІ (Неправильно).
Copyleaks помітив одного бота, але пропустив іншого. Схоже, йому складно з калібруванням, залежно від того, яку модель ви тестуєте.
Вердикт: 3 із 4 вірно.
Головний висновок
Я не був певен, чого чекати. Ось тому я провів тест. Але ж тепер? Ситуація прояснилася.
Детектори ІІ не ідеальні.
Вони послідовно впоралися з ідентифікацією мого людського тексту. Кожен інструмент помітив мій текст як написаний людиною. Схоже, підтвердити те, що не є ІІ, простіше, ніж те, що є.
Зворотне твердження неправильне. Scribbr провалився повністю. Copyleaks пропустив половину роботів. Інші інструменти були ідеальні у цьому малому вибірці.
Якщо ви серйозно налаштовані на виявлення ІІ-текстів, не довіряйте одному інструменту. Використовуйте два чи три одночасно. Шукайте патерни. І, можливо, оновіться до платної версії для детального обґрунтування, якщо ставки високі.
Чи є однозначна ознака? Можливо. А можливо, це просто гра в кішки-мишки, що змінюється з кожним оновленням моделей.
*Відмова від відповідальності: Компанія-материнська компанія Popular Science подала до суду на OpenAI у квітні 2024 року за порушення авторських прав. Цей контекст може впливати на загальну ситуацію, хоча результати тесту вище відображають роботу інструментів ізольовано.
































































