Обновить

Написал детектор ИИ‑текста на 13 правил и прогнал 59 своих статей: сумма баллов не забраковала ни одну

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели7.4K
Всего голосов 3: ↑1 и ↓2+1
Комментарии2

Комментарии 2

Делал похожее, только заходил с другой стороны: сначала снял эталон живой речи, а потом смотрел, что от него отличается. Корпус 331 тысяча сообщений из рабочих чатов и переписок, 12 миллионов слов.

Часть привычных правил на живых людях не подтвердилась. Тройное перечисление нашлось 35 256 раз, то есть люди так пишут постоянно. Отдельные “машинные” слова тоже оказались живыми: “без воды” 280 вхождений, “честно говоря” 155.

Зато сработало то, чего в списках обычно нет. Разброс длин предложений: человек роняет реплику в два слова, потом выдаёт фразу на тридцать, а модель держится середины, она в 3-5 раз менее вариативна. И разметка звёздочками там, где markdown не рендерится: жирный у моделей чаще в 43 раза, а у живых он есть всего в 0,05% сообщений.

Вопрос по вашим 13 правилам: на чём калибровали пороги? У меня без эталона половина правил давала ложные срабатывания на моих же старых текстах, написанных задолго до ChatGPT.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации