Введение. При написании данного опуса не была использована ни одна нейросеть.
Завязка. Я иногда делюсь своими экспертными наблюдениями в теме, которой занимаюсь уже более 10 лет. В том числе иногда использую нейросети для 2 задач: поиск новой информации, которая могла пройти мимо и финальная обработка текста перед публикацией, чтобы сложный текст сделать более удобным для читателя.
На днях на одной из площадок модераторы снесли статью с формулировкой «Сгенерированный текст». А когда я направил запрос в техподдержку, то в бан улетели еще 3 другие публикации, которые набрали более 50 тысяч просмотров.
На меня выходили журналисты, представители НИИ и государственных структур для получения разрешения на использования этих материалов. Иными словами в уровне экспертности вопросов вроде бы нет, но вот с ИИ‑детектором как‑то подкачал... И мне стало любопытно уже более профессионально посмотреть на этого зверя.
С точки зрения разумной логики в самом начале важно договориться, чего мы хотим добиться за счет тотального использования ИИ‑детекторов. Варианты: 1. Чтобы авторы писали сами. И точка! 2. Чтобы не наплодили миллиард единиц контента! 3. Чтобы..?
И тут я задаю уже сам себе вопрос: а что для меня важно получить от статьи/книги/очерка? И сам себе отвечу: удовольствие от прочтения/новую важную информацию/нового интересного автора или эксперта, чтобы к нему присмотреться. При этом использовались ли тут нейросети сети или нет — вообще не важно. Понравилось/не понравилось — вот главный критерий!
Развитие сюжета. За последние несколько веков мы можем вспомнить много историй, когда известные люди использовали помощников при написании романов или картин. Как утверждают злые языки, у того же Дюма вкалывал целый конвейер подмастерья, да и у скульпторов постарше тоже можно найти фабрику молодых каменотесов.
И Дисней копирует одни и те же модели движения персонажей в разных мультфильмах. И врачи, которые ставят диагнозы на основании «дерева решений» национальной медицинской ассоциации, или юристы, которые пользуются наработанными шаблонами при защите клиента.
Теперь про мат.часть. Как нас учили, в начале нужно дать операционное определение, а что такое «текст сгенерирован ИИ». И мы сразу пролетаем в "серую зону" — нет такого определения! Частные мнения, что «не те кавычки» или «длинное тире» таковым не являются. Иначе будет как шутка Сократа: человек — это двуногое без перьев.
Далее нужно выбрать метрики качества модели ИИ‑детектора. Если сильно упростить, то давайте посмотрим: точность результата (процент «угадываний»), стабильность (неизменность результата после разных махинаций) и интерпретируемость (а собственно почему такой результат). И тут мы понимаем, что все это полный ахтунг, поскольку нет этих данных при описании моделей. Как говорил один товарищ: «блажен, кто верует».
Развязка. Мне всегда интересно сопоставить свои мысли с другими. И тут я не одинок.
Едем в ведущие университеты мира. Ведь там самые «продвинутые» студенты. И вдруг обнаруживаем, что уже отключили ИИ-детекторы: Йельский университет, университет Вандербильта, университет Джонса Хопкинса, Массачусетский технологический институт, университет Ватерлоо в Канаде и многие другие. Вместо попыток «поймать» студентов многие учебные заведения фокусируются на их процессе мышления и рассуждениях
Компания OpenAI отозвала свой AI Classifier, поскольку точность определения текстов, сгенерированных ИИ, составляла 26%.
Вишенка на торте. Взял фрагмент из «Преступления и наказания» Достоевского и вставил его в Гигачек от Сбера... Вуаля! «Текст, скорее всего, написан генеративной моделью ИИ».

Может, Лев Толстой пройдет тест? «Война и мир», фрагмент про Аустерлиц. Та же история.

Достоевского и Толстого срочно в бан? Или дадим читателям право выбора? А вы что думаете?
P. S. пойду‑ка перечитаю Дюма, пока «еще можно».

