Действительно ли работают детекторы ИИ-текстов? Проверка 5 инструментов

3

Мы живем в эпоху, когда простое пролистывание ленты в социальных сетях может вызвать паранойю. Кто это написал: человек или искусственный интеллект?

От этого ответа многое зависит.Whether вы проверяете сочинения, нанимаете авторов или просто устали от безликого контента в интернете — вам нужна правда. Говорят, что ИИ оставляет свои отпечатки. Обычно подозревают тире (em dash), монотонный тон или другие маркеры.

Но могут ли инструменты надежно выявлять эти признаки?

Я провел тест пяти популярных детекторов ИИ в контролируемых условиях. С одной стороны: четыре статьи, написанные мной вручную (без участия роботов). С другой: вводные части по 150 слов, сгенерированные ChatGPT, Gemini и Claude на основе заголовков моих статей.

Результаты? Некоторые инструменты справился отлично. Другие промахнулись мимо.

Pangram: Уверенный проверщик

Pangram утверждает, что это детектор, который «действительно работает». Он не бесплатен навсегда, но бесплатный тариф позволяет делать четыре проверки в день. Платные тарифы начинаются от $20.

Вот что произошло:
* Мой текст: 100% человек. Высокая уверенность.
* Текст от ChatGPT/Claude: 100% ИИ.

Pangram правильно определил каждый образец. Он даже выделил конкретные улики, такие как повторяющаяся структура «от того момента, как…» в ИИ-текстах.

Вердикт: 4 из 4 верно.

Grammarly: Гигант грамматики выходит на арену

Вероятно, вы используете Grammarly для проверки опечаток. Теперь он также отмечает ИИ-тексты. Бесплатные аккаунты получают три проверки в день. Платные тарифы начинаются от $12.

Мои образцы? 0% ИИ. Никаких шаблонов. Чистый результат.

ИИ-образцы? Не столь однозначны.
* Claude: 68% ИИ.
* Gemini: 66% ИИ.

Grammarly заметил следы ИИ. Но он не был уверен на 100%. Инструмент увидел паттерны, но колебался в приговоре. Тем не менее, он дал правильный ответ.

Вердикт: 4 из 4 верно.

GPTZero: Сохраняя человеческое

Миссия GPTZero — «сохранять человеческое». Бесплатные пользователи могут проверять 10 000 слов в месяц. Платные тарифы начинаются примерно с $24.

К третьему инструменту я начал излишне самоуверен. Мой стиль письма должен быть явно неИИ-шным. GPTZero согласился. «Высокая уверенность в том, что этот текст целиком написан человеком».

Когда я подал ИИ-образцы, он тоже их распознал. Он даже указал, какие предложения выглядят наиболее роботизированно. Мне было сложно увидеть эти паттерны. Возможно, они там есть. А возможно, и нет. Но инструмент их не упустил.

Вердикт: 4 из 4 верно.

Scribbr: Бесплатный аутсайдер

Scribbr предлагает услуги редактирования и бесплатный детектор. Регистрация не нужна. Просто вставьте текст и проверьте.

Мой текст? Оправдан на 100% как человеческий. Хорошо.

ИИ-образцы? Также отмечены как на 100% написанные человеком.

Здесь он провалился. Scribbr утверждал, что тексты от ChatGPT и Claude написаны полностью людьми. Инструмент был очень уверен в своем ошибочном ответе. Каким бы ни был его алгоритм, ему нужно обновление.

Вердикт: 2 из 4 верно.

Copyleaks: contenders, который прав лишь отчасти

Copyleaks проверяет текст, изображения и видео. Четыре бесплатных сканирования. Платные тарифы начинаются от $17.

Мой текст? 100% без примесей ИИ.

Тест ИИ? Результат смешанный.
* Gemini: 100% ИИ (Верно).
* Claude: 0% ИИ (Неверно).

Copyleaks заметил одного бота, но пропустил другого. Похоже, ему сложно с калибровкой в зависимости от того, какую модель вы тестируете.

Вердикт: 3 из 4 верно.

Главный вывод

Я не был уверен, чего ожидать. Именно поэтому я провел тест. Но теперь? Ситуация прояснилась.

Детекторы ИИ не идеальны.

Они последовательно справлялись с идентификацией моего человеческого текста. Каждый инструмент пометил мой текст как написанный человеком. Похоже, подтвердить то, что не является ИИ, проще, чем то, что им является.

Обратное утверждение не верно. Scribbr провалился полностью. Copyleaks пропустил половину ботов. Остальные инструменты были идеальны в этом малом выборке.

Если вы серьезно настроены на выявление ИИ-текстов, не доверяйте одному инструменту. Используйте два или три одновременно. Ищите паттерны. И, возможно, обновитесь до платной версии ради подробного обоснования, если ставки высоки.

Есть ли однозначный признак? Возможно. А возможно, это просто игра в кошки-мышки, которая меняется с каждым обновлением моделей.

Отказ от ответственности: Компания-материнская компания Popular Science подала в суд на OpenAI в апреле 2024 года за нарушение авторских прав. Этот контекст может влиять на общую ситуацию, хотя результаты теста выше отражают работу инструментов изолированно.

Попередня статтяКак оптимизация ИИ может усугубить стагнацию результатов NAEP