Тема ИИ-детекции резко актуализировалась в академической среде не потому, что появилась совершенно новая проблема, а потому что старая, как мир, проблема плагиата получила математически иной, более гибкий и трудноуловимый инструмент атаки. Если раньше система проверки искала дословные совпадения, то сегодня она анализирует статистические аномалии самого стиля письма. Данный текст открывает серию из 11 статей, которая последовательно проведет читателя от механики одного алгоритма к историческим параллелям, математике атак, философии оценивания и практическим рекомендациям. Мы разберем, как вузы пытаются защитить академическую честность в контексте столетней гонки вооружений, изучим научный аппарат adversarial-атак и, наконец, перейдем к практическому инструментария преподавателя, когда текст сам по себе ничего не доказывает.
Перплексия: мера «удивления» модели
Фундамент большинства современных детекторов лежит понятие перплексии (perplexity). Формально она выражается формулой PPL(s) = exp(-1/N · Σ log p(w_i|w_
Человек же мыслит менее «оптимально» с точки зрения чистой языковой статистики. Мы делаем синтаксические прыжки, используем редкие обороты, нарушаем ожидаемые паттерны. Отсюда — более высокая и неравномерная перплексия человеческого текста. Детектор, по сути, прогоняет текст через собственную языковую модель и смотрит на логарифм вероятности каждого токена, выискивая излишнюю «гладкость» и предсказуемость.
Бурстность: ритм, который выдает машину
Второй ключевой метрикой является бурстность (burstiness) — неравномерность ритма текста. Чередование длинных и коротких предложений, сложных синтаксических конструкций и простых рубленых фраз абсолютно естественно для живого автора. У нейросети же, стремящейся к усредненной вероятности, ритм статистически более равномерен, а длина предложений подчинена жестким внутренним паттернам.
Для иллюстрации естественной бурстности обратимся к реальному кейсу. В абзаце о расчёте заработной платы в ООО «Сапиенс Солюшнс» первое предложение — длинное, с вложенной инфинитивной конструкцией, описывающее процесс. Второе и последующие — короче, конкретнее, с обрывистым ритмом. Такой перепад длины и структуры — маркер человеческого авторства.
Контрпримером служит другой документ, где абзацы стабильно занимают 150–250 слов и имеют одинаковую внутреннюю схему: тезис → пример → ссылка → вывод. Используется симметричная классификация («Первую группу составляют... Вторую группу...»), а также клише-связки («Действительно», «Особого внимания заслуживает», «Вместе с тем важно подчеркнуть»). Такая механическая выверенность иллюстрирует низкую бурстность, типичную для ИИ.
Важная сквозная методологическая оговорка: высокая или низкая плотность цитирования — ненадёжный маркер сам по себе. В последнем примере ссылки стоят почти на каждое предложение, но это может быть жанровой или институциональной нормой оформления («одна мысль — одна ссылка»), а не поведенческим признаком автора. Слепая вера в плотность ссылок ведет к ошибкам первого рода и ложным срабатываниям, цена которых для студента может быть неоправданно высока.
DetectGPT и кривизна правдоподобия
Более продвинутые алгоритмы, такие как DetectGPT и Fast-DetectGPT, используют детекцию через кривизну log-likelihood (правдоподобия). Логика здесь следующая: если текст уже «сидит» в локальном максимуме вероятности модели (что типично для сгенерированного ИИ контента), то небольшие искусственные пертурбации (замены слов на близкие синонимы) в среднем понижают likelihood сильнее, чем в случае с человеческим текстом. Человеческий текст уже находится в «долинах» и «склонах» вероятностного ландшафта, поэтому мелкие изменения не так радикально обрушивают его общую статистическую оценку.
Нужно убрать ИИ из текста? Пишите, сделаем с гарантией!
Почему человек читает смысл, а детектор — статистику
Здесь кроется ключевой тезис всей серии: перплексия и бурстность — это статистические, а не семантические свойства текста. Человеческий мозг не оценивает текст через вероятностную модель языка token-by-token. Мы читаем по смыслу, опираясь на контекст, фактологию и логику. Детектор же — это, по сути, ещё одна языковая модель, которая прогоняет текст через LLM и смотрит исключительно на математическое распределение токенов. Именно поэтому гениальный по смыслу, но написанный сухим академическим языком текст может быть помечен как ИИ, а бессвязный набор слов, полный редких идиома, — признан человеческим. Этот разрыв между статистической предсказуемостью и смысловой нагрузкой порождает множество этических дилемм использования ИИ в учёбе, где формальная метрика подменяет оценку реальных знаний.
Локальная неоднородность: тепловая карта текста
Важно понимать, что отчёт детектора — это не единая оценка для всего документа, а тепловая карта по фрагментам (chunking). Алгоритм разбивает текст на куски и анализирует каждый независимо. Это означает, что локальная неоднородность внутри документа — нормальное явление.
Возьмем для иллюстрации техническое задание по модернизации электроснабжения нефтебазы. Гипотеза, которую стоит проверить при наличии доступа к реальному отчёту по фрагментам: «шаблонные» фрагменты, содержащие итоговые оценочные фразы и общие выводы, вероятно, показывают более высокий процент ИИ. В то же время фрагменты с чистой числовой фактурой, специфическими ГОСТами и марками оборудования, будут отмечены как человеческие. Такая неоднородность подсветки фрагментов должна быть поводом для ручной проверки, а не для автоматического выставления «незачёта», о чем мы подробно поговорим, разбирая инструментарий преподавателя в условиях неопределённости.
Витрина систем РФ: Антиплагиат.ВУЗ и Думейт
На российском рынке академической проверки сегодня доминируют две системы, реализующие описанные принципы. «Антиплагиат.ВУЗ» внедрил модуль ИИ-детекции, а в мае 2025 года заявил об обновлении алгоритма, которое обеспечило +35% точности (до 98% по заявлениям разработчика). Это классический одноалгоритмический подход, базирующийся на перплексии и бурстности.
Ему на смену или в конкуренцию приходит «Думейт», запустивший детектор нового поколения в мае 2026 года. Система заявляет базу в 1,8 млрд источников и, что важнее, мультиметодный анализ вместо одного алгоритма. Это принципиальный архитектурный сдвиг, если заявление подтверждается на практике. Обе цифры требуют независимой проверки на момент публикации, но именно эти две системы определяют конкретную реализацию принципов детекции в вузах России.
Что дальше: от механики к философии оценивания
Понимание того, как устроена детекция на уровне токенов и статистики, подводит нас к мысли, что слепая вера в «гладкость» текста опасна. Но если статистические методы уязвимы, есть ли пути сделать маркировку надёжной? Ответ на этот вопрос кроется в технологиях водяных знаков и криптографического встраивания меток на этапе самой генерации. Однако технические ограничения подводят нас к более общему вопросу: можно ли вообще свести сложную задачу оценки компетентности к одному числу, и не включается ли тут закон Гудхарта в высшем образовании?
Более того, паттерн гонки «брони и снаряда» универсален. Та же самая эволюция от простого поиска совпадений до сложных adversarial-атак происходит за пределами текста: в коде, изображениях и дипфейках. В конечном итоге, все эти технологические вызовы заставляют систему высшего образования искать новые пути, о чем мы расскажем в финальной статье о том, как вузы меняют формат оценивания после эры детекторов.
Нужно убрать ИИ из текста? Пишите, сделаем с гарантией!
