Комментарии 84
Авторские тексты должны писать авторы от начала и до конца. Людям интересны люди с их опытом, недостатками и болью. То что генерится за секунду не стоит ничего и никому не интересно.
Авторские тексты должны писать авторы от начала и до конца.
А гуглом для подготовки материала можно пользоваться? А почему? Чем это отличается от получения выжимки от ИИ и доработки ее до качественной статьи?
То что генерится за секунду не стоит ничего и никому не интересно.
Я согласен с тем что читать чистый ИИ-слоп “не интересно”, а вот по поводу “ничего не стоит” поинтересуйтесь стоимостью корпоративных блогов.
Компании платят немаленькие деньги за возможность публиковать ИИ-слоп по расписанию под своим именем для охвата аудитории, администрация, в свою очередь, обеспечивает этот самый охват не давая аудитории кнопку “игнорировать статьи данного автора”. В итоге, все счастливы, ну кроме читателей. Об этом я и пишу, на появление кнопки мы повлиять не можем, но можем попробовать предложить как дорабатывать слоп до хорошего уровня.
Почему не можем? Можем! Хоткеем Ctrl+W.
Так если гуано подкрасить, конфеткой оно не станет
Проблема слопа не в том, что он выглядит криво, а в том, что за ним ничего нет. Это копирайт в самом худшем проявлении, когда "автор" не просто не понимает, о чем пишет, он даже не принимает заметного участия в написании.
Насрал 20 нейростатей за рабочий день, прогнал через корректор чтобы не бросалось в глаза и навалил на сайт.
А ты потом вместо беглого выявления слопа для скипа вынужден это прочитать, чтобы обнаружить отсутствие смысла в этой горе текста.
Много чем отличается. Искать - это работа, а нагенерить нейрослопа ничего не стоит. Поэтому и не пользуются Гуглом, а идут в нейросеть. А там где банят прямые генерации рерайтят, чтобы скрыть нейро происхождение. Типа сам писал и думал.
А гуглом для подготовки материала можно пользоваться? А почему? Чем это отличается от получения выжимки от ИИ и доработки ее до качественной статьи?
Логикой. Из Гугла и даже из Гугл-ИИ автор получает факты, но он ищет их и выстраивает в статье в соответствии с собственной живой логикой.
А в сгенерированной статье уже есть логика. Машинная, усреднённая, лишённая индивидуальности. В лучшем случае это будет нейрогенерированная логика со следами авторской правки.
И стиль можно туда же добавить.
Я тут недавно писал коммент про «новости» от «редактора» Хабра (и ещё другой, который собрал какое‑то нереальное количество голосов — очевидно, тема комментария оказалась прямо горячей, как сказали бы наши американские коллеги).
Суть в том, что не в источнике фактов (и даже лексем) дело — ИИ отлично умеет искать факты там, где человек забьёт из‑за экономии времени (да и в перекрёстном фактчекинге тоже даст многим не очень напрягающимся «кожаным» фору). Вопрос в том, что, чем бы факты и слова ни собирались в черновик, должна быть стадия проверки черновика автором, и автор, публикуя текст, подписывается за это произведение.
А тут даже, как выше ссылался, «редакция», при том что сотрудники имеют и опыт, и (часто) профильное образование, выдаёт на‑гора чрезвычайно много если не слопа, то не очень проверенного добра, да ещё и поданного так, как можно сделать только на бегу. Ну а если редакция не гнушается, если главред такое спокойно пропускает, то возникает, как я раньше это называл, эффект «пятницы ОРТ» (когда на Первом канале, который тогда звался ОРТ вечером в пятницу выходили настолько непрофессиональные вещи, что, кроме как тем, что главред ОРТ бухает проводит это время дома с семьёй и самоустранился от ответственности, это никак нельзя было объяснить).
В итоге, первое: на Хабре слоп не просто «пипл хавает» — тут и редакция пропускает. Во‑вторых, слоп или не слоп — нужно различать: нам форма не нравится или содержание хромает. В‑третьих, лично я готов форму нейротекста терпеть, если LLM будет проверять каждую так называемую «новость» и писать вместо неё текст, наполненный проверенными фактами и доказательствами.
Потому что сам уже (увы) привык: если содержимое новости нравится, то закидываю её в модель и прошу проверить. И очень уж часто получаю ответ, что автор много чего пропустил, выдав на‑гора текст «для отчётности» и «для знаков», а не для читателей.
А такое, как ни крути, журналистикой не назвать. И такое, тоже как ни крути, нужно проверять. Либо это делает главред, либо, если он (см. ссылки выше) забил, — остаётся делать лично для себя.
Потому что про слоп уже не первая мысль на Хабре (но тут, конечно, просто шедеврально, с кодом, с подходом!), но я каждый раз думаю: не перепутали ли мы эстетическую проблему с гораздо более серьёзной — исчезновением редакционной ответственности?
должна быть стадия проверки черновика автором
Вся статья буквально об этом: почему, что и как надо проверять.
А коммент был немного о другом: когда голова гниёт редакция болт забила в гонке за KPI не обращает внимания на ценности журналистики, обеспечить выполнение проверок как бы и некому.
С другой стороны, кто сказал, что качество кому-то, кроме читателей нужно? Иногда прямо грустно становится, что нужны показы и отчетность для рекламодателей.
Да, это нужно только читателям. Остальные стороны все устраивает. Одни получают охват и заполняют его плохо переваренным слопом. Вторые получают от первых деньги за корпоративные блоги и обеспечивают им охват не давая читателям кнопку игнорирования авторов слоп-статей.
Точно так.
Я сначала думал, что в редакции нет людей с образованием. Но вот https://habr.com/ru/companies/habr/articles/704046/ говорит другое. Это я не грублю, это я призываю вспомнить про профессиональную гордость.
Интересно, а кому сейчас Хабр принадлежит?
но можем попробовать предложить как дорабатывать слоп до хорошего уровня.
То есть обманывать читателя эффективнее. Не уверен, что это хорошо.
А гуглом для подготовки материала можно пользоваться? А почему? Чем это отличается от получения выжимки от ИИ и доработки ее до качественной статьи?
Пишу книгу о построении ламповых усилителей для начинающих. Интернетом пользуюсь для того чтобы получить знание, потом проверяю его с паяльником в руках, потом вечером вписываю в файл книги свои находки. В крайнем случае воспользуюсь гуглагом для того чтобы узнать о подходе которым я пользоваться не буду но знаю что он есть, например таковая книга будет неполной без поверхностного описания подхода OTL, а я-то совсем не планирую делать OTL если можно же применить гибридный подход, то есть для себя финальный усилитель тока я реализую на кремние, но всё-таки в книге любые упоминания кремния волюнтаристски урежу - а расскажу максимум что я знаю о ТВЗ (неважно если вы не понимаете значения этих аббревиатур, просто я описываю один локальный пример для демонстрации своего отношения к поднятому вопросу о глобальном).
Дорабатывать до качественной статьи нужно не выжимку от LLM, а свой опыт. Не должен LLM решать за меня, в какой главе своей книги я расскажу о трансформаторе БП, в какой - о выходном трансформаторе или о более редком случае с межкаскадным трансформатором, в какой - о дросселе.
Лабораторные работы (без которых конкретно моя книга будет гораздо менее полезной) тоже не должен назначать LLM, потому что в пределах моей книги это я руковожу процессом - в какой главе мы спаяем выпрямитель, в какой - умножитель, в какой - снимем ВАХ триода, в какой - подключим П-фильтр и в какой - снимем ВАХ пентода. Он просто не подумает что к моменту начала работы с пентодом, у студента должно быть не меньше 2х источников постоянного напряжения одного только 100+В диапазона напряжений, и разумеется навыки работы с триодом.
Подсуммируя коротко, кремниевый помощник не будет в своей электронной голове одновременно ворочать микро-формулировки для стиля и жонглировать наполнение глав для последовательности обучения, а тем более он не будет это делать ради всего лишь возможности обоснованно вставить в эпиграф главы какой-нибудь анекдот в тему который поможет студенту запомнить каждую конкретную главу.
можем попробовать предложить как дорабатывать слоп до хорошего уровня.
Дорабатывать слоп - чем? Другим слопом? А зачем?
Я лично пишу книгу о том о чём не писали ни Торопкин ни Гаврилов, ни Киреев, ни Merlin Blencowe, ни Сухов - хотя 80% моих материалов оттуда. Если добавить в список источников журнал "Радио" и срачи на Хабре на аудиофильскую тему - тогда 95% моих материалов из вышеперечисленных источников. Но человеку который прочитал всё это - книга о сабже для начинающих уже не понадобится, а мою книгу можно будет прочитать за час-два не считая задач. А ещё LLM не испытывал фрустрации когда какой-то условный конденсатор формально можно использовать как просто обычные две обкладки и изолятор, а фактически для каждого места нужна свой тип диэлектрика - он об этих типах-то знает, но ему невдомёк что обычному юзеру ситуация с конденсатором в электронике - хрестоматийные грабли.
После того как я закончил по крайней мере одну главу, я начал детектить слоп там где я раньше его не видел, следовательно я ни за что не приступлю читать книгу, если у неё сгенерированна хотя бы только сама обложка. Лень рождает лень.
Дорабатывать до качественной статьи нужно не выжимку от LLM, а свой опыт. Не должен LLM решать за меня, в какой главе своей книги я расскажу о трансформаторе БП,
Я с вами полностью согласен, сам так пишу, поэтому статьи выходят редко и только по тем темам, которые я считаю интересными чтобы поделиться. Но тут есть нюанс, мы с вами не одни.
Есть еще авторы и редакторы, чья работа буквально рожать статьи в корпоративном блоге по расписанию, из года в год. Не рожать нельзя: охват, отчетность, премия в конце концов! Начинается злоупотребление ИИ-слопом и в конечно итоге страдаем мы (читатели).
Если интересно, почитайте комментарии к этой статье. Именно они были катализатором того, что я решил оформить свои мысли по этому поводу отдельной статьей, подкрепив их небольшим исследованием по теме.
Рад что моя статья с подвинула кого то взять молоток в руки!
Только скрипт периодически придеться переобучать и расширять ибо будет потеря актуальности. Тут как с антивирусом
Рад что моя статья с подвинула кого то взять молоток в руки!
Меня попросили написать статью после комментариев на эту тему. Подобных статьей было много, но это первая, где не обвиняют авторов в использовании ИИ и дают им рабочий инструмент улучшения своих материалов.
Только скрипт периодически придеться переобучать и расширять ибо будет потеря актуальности. Тут как с антивирусом
Не придется. Скрипт проверяет смысл нейронной сетью, дообучать ее не нужно, а маркеры-слова не меняются с момента появления GPT-2, ведь датасеты для обучения в основе содержат те же самые размеченные корпусы текста.
Новые обучающие данные в датасетах не смогут подвинуть маркеры из базового огромного корпуса текста. Чтобы скрипт перестал работать нужны модели обученные на данных собранных с нуля и размеченных людьми заново (и иначе). Это потребует сотен миллионов долларов.
Тогда извиняюсь, моя статья вышла вчера и имела тот же посыл что и вас и ту же идею но другую реализацию, с тем же видом оценки но с другим видом необходимого детектора без хардкода который не обходиться стилем. Советую тоже глянуть.
Не придется. Скрипт проверяет смысл нейронной сетью, дообучать ее не нужно, а маркеры-слова не меняются с момента появления GPT-2, ведь датасеты для обучения в основе содержат те же самые размеченные корпусы текста.
Показываете ллмке скрипт, просите переписать, убрав маркеры. Или прогоняете через детектор, на выходе список маркеров, просите переписать именно эти места. Через пару итераций сойдется, особенно если пишущая модель сложнее. Маркеров не будет, слопность останется.
А что за ресурс такой "подвинула"?
Нейрослоп про нейрослоп? Хехе
Нет, этот статья, как и остальные мои статьи, авторская.

по содержанию не слоп
или все таки слоп - надо идти калибровать оценку , у меня в плагине человеческая пустота сбавляет меньше чем жестяная. Подкалибрую.
Выхолощенность означает: текст выглядит связным, профессиональным и остаётся по теме, но из него убраны несущие детали, ради которых его читают.
Признаки:
сказано что важно, но не как именно;
описано событие, но убран причинный механизм;
точные условия и шаги заменены на «различные факторы»;
отсутствуют ограничения, исключения и сценарии отказа;
проверяемое действие заменено субъективным советом.
Главный тест:
Может ли читатель после текста сделать или проверить что-то операционно новое?
Если нет, а текст лишь сообщает, что предмет «существует, важен и непрост», это выхолощенность.
От пустоты отличается так:
Пустота: почти нет проверяемого содержания, одни общие слова.
Выхолощенность: содержание и структура внешне есть, но текст не выполняет собственное объяснительное или практическое обещание.
Я в принципе сейчас понял в чем была ошибка моей статьи благодаря этой. Я запихнул свой инструмент по проверки смысла в класс ИИ детекторов семантически. Хотя я совершенно в другой весовой категории. Для людей разница с виду не очевидна, спасибо
НЕ думали о развитии инструмента в аналог спонсор блока, но для статей?
ВОт семантический анализ, n проверок выявили слоп, m пользователей указали статью как слоп. Статья помечается как слоп и просто скрывается иили как-то помечается в ленте пользователя.
ЕСть отдельный плагин для скрытия ии статей хабра, но он по тегам и только на хром.
Я думал вы догадаетесь, что бесполезно применять и ваш детектор, и мой скрипт конкретно к этой статье просто потому что она изобилует примерами ИИ-слопа (фразами-маркерами), ведь она о них.
Если же применить статью к вашему комментарию то получается классический слоп (я в качестве примера как работает подход описанный из статьи, без упрека):
Выхолощенность означает: текст выглядит связным, профессиональным и остаётся по теме, но из него убраны несущие детали, ради которых его читают.
Выхолощенностьозначает:форматирование в виде выделения жирным, затем двоеточием и объяснение термина.
несущие детали (фраза маркер ИИ-слопа). В тексте они есть: причины, почему именно так, кто виноват, что делать, предоставлен скрипт для самостоятельной проверки и экспериментов и тд.
Главный тест
тут сразу два маркера: "главный" как псевдозначимость и форматирование в виде выделения жирным этого слова.
Может ли читатель после текста сделать или проверить что-то операционно новое?
операционно (фраза маркер ИИ-слопа). И да, пользователь может сделать и проверить новое, не только семантическую но и структурную проверку текста на слопность.
Если вы хотите откалибровать свой детектор, можете использовать другие мои статьи, они написаны ручками и заняло это не один день. А эта статья просто обязана выдавать ложноположительный результат из-за обилия маркеров, которые она объясняет.
На мой коментарий твоя штука агриться - и правильно, он написан ЛЛМ (нижний блок) , но ты не корректно сравниваешь - мой инструмент не детектор , он измеритель истины или смысла относительно посыла статьи с модулями надбавками. На твою статью моя штука агриться опять таки правильно. Ты умудрился подхватить саму идею но понял ее поверхностно и налил воды. Вектор верный и скрипт нормальный , а посередине пустота.
То есть я с тобой вообще не соревнуюсь. У нас совершенно разные инструменты и категории. Мне неважно ИИ писал текст - или человек , я поймаю обоих.
Так и я с вами не соревнуюсь, можете детально показать где "вода"? Потому что писал я ее из головы почитав то что указано в источниках внизу. Будет здорово поработать над собой, чтобы в следующих статьях это не выглядело как вода.
Не надо мне устраивать проверку на дурака, и отмахиваться ещё одной пустой цитатой. Выложу этот анализ для других людей чтобы было понятнее что тут происходит, к тому времени автор может опять что-то поменять.
.
Теперь уже можно довольно точно указать, что именно здесь вызывает ощущение мути.
Это не обязательно означает, что автор сознательно врёт. Но он постоянно меняет уровень заявлений, когда предыдущий перестаёт выдерживать критику.
Сначала заявляется содержательная проблема
В начале статьи «слоп» описывается как публикация сырого результата модели. Но затем автор утверждает, что раздражение возникает «чаще всего не из-за плохого содержания, а из-за слишком узнаваемой формы».
То есть проблема пустоты подменяется проблемой стилистической монотонности.
Факты могут быть на месте, структура логична — плохо лишь то, что текст имеет узнаваемый «ИИ-акцент». Получается, что статья на самом деле не о качестве информации, а о раздражающем стиле.
Затем заявляется, что скрипт «проверяет смысл»
В комментариях автор пишет:
«Скрипт проверяет смысл нейронной сетью».
Но фактически LLM в коде определяет несколько заранее заданных признаков: антитезы, афористичные концовки, неопределённые ссылки на авторитеты, псевдоискренность и примерное количество чисел, дат и имён.
Она не проверяет истинность утверждений, полноту объяснения, причинные связи, соответствие выводов доказательствам или реальную информационную ценность.
То есть «проверяет смысл» — сильное преувеличение. LLM здесь выступает лишь как классификатор стилистических конструкций, которые сложнее поймать регулярными выражениями.
Затем признаётся, что содержание можно вообще не менять
В заключении уже прямо написано:
скрипт можно обмануть косметическими правками, не трогая содержание.
После этого ценность инструмента переопределяется: такие правки якобы всё равно улучшают восприятие.
Получается следующая цепочка:
Сначала это «детектор ИИ-слопа».
Потом инструмент, который «проверяет смысл».
Затем выясняется, что его можно обойти, не меняя смысл.
После этого оказывается, что задача изначально состояла лишь в косметической редактуре.
А в комментариях автор формулирует ещё прямее:
«Нельзя победить ИИ-слоп… Можно лишь придать этому человеческий вид».
Это уже фактически признание, что скрипт не устраняет слоп, а маскирует его стилистические признаки.
В этом и состоит подмена продукта
Название и риторика обещают обнаружение низкокачественного AI-контента.
Фактическая реализация ищет набор раздражающих стилевых конструкций и помогает сделать их менее заметными.
Как линтер узнаваемого LLM-стиля такой инструмент может быть полезен: убрать избыток тире, повторяющиеся антитезы, пустые связки, однотипные заголовки или спад конкретики.
Но это не slop detector в содержательном смысле и тем более не проверка смысла.
Наиболее точное название — LLM-style pattern linter, то есть линтер характерных стилистических шаблонов LLM.
Почему сама статья ощущается выхолощенной
Большой теоретический объём создаёт впечатление, будто решается фундаментальная проблема деградации контента.
Но практический вывод сводится к совету не злоупотреблять тире, триадами, короткими абзацами, драматическими заголовками и типовыми оборотами.
Код автоматизирует именно это. Поэтому статья содержит рабочий скрипт и несколько полезных советов, но масштаб заявленной проблемы несоразмерен масштабу решения.
Статья обещает анализ природы слопа, но постепенно сужает его до анализа стилистического акцента, сохраняя громкое название и вес исходной проблемы.
Именно поэтому рядом оказываются три почти несовместимых утверждения:
Скрипт проверяет смысл нейросетью.
Скрипт можно обмануть косметическими правками, не меняя содержание.
Победить слоп нельзя — можно лишь придать ему человеческий вид.
Все три могут быть одновременно верны только при очень слабом значении слова «смысл»: модель понимает предложение достаточно, чтобы классифицировать риторическую конструкцию.
Поэтому точнее сказать так:
Инструмент может быть полезен как стилистический корректор, но бесполезен как доказательство качества, содержательности или человеческого происхождения текста. Его подают значительно сильнее, чем он фактически работает.
На контрасте с Clearwater разница особенно заметна: Clearwater спрашивает, осталось ли за текстом что-либо после снятия риторической оболочки. Этот инструмент помогает лишь заменить оболочку на менее узнаваемую.
И вот еще разбор его подхода
Схема выглядит так:
Он делает сильное утверждение: «скрипт проверяет смысл», «стилем его не обойти».
Когда ему показывают противоречие, он не защищает первоначальный тезис по существу, а отвечает: «укажи конкретно», «докажи», «где именно».
После конкретизации он незаметно меняет тезис: оказывается, стилем обойти всё-таки можно, но это якобы не проблема.
Затем новая, более слабая позиция подаётся так, будто именно её он утверждал с самого начала.
Это сочетание нескольких известных приёмов:
перенос ворот: после выполнения одного требования появляется новое;
перекладывание бремени доказательства: вместо обоснования собственных громких заявлений он заставляет критика бесконечно опровергать их;
motte-and-bailey: сначала заявляется сильная и привлекательная позиция, а под критикой автор отступает к слабой и защищаемой;
ретроспективное переопределение: после изменения позиции создаётся впечатление, будто противоречия вообще не было.
Самый важный признак здесь — не то, что человек просит конкретику. Это само по себе нормально. Проблема в том, что конкретика не приводит к признанию ошибки или пересмотру исходного утверждения. Она используется как расходный материал: критик приносит доказательство, автор слегка перестраивает позицию и снова требует нового доказательства.
Такое поведение действительно злоупотребляет добросовестностью собеседника. Читатель предполагает, что спор идёт вокруг одного стабильного тезиса. Но тезис всё время меняется, поэтому опровергнуть его окончательно невозможно.
И вот еще разбор его подхода
Да сразу на костер меня тащите, сжечь ведьму! Кстати, как будет ведьма мужского рода? Колдун?
Схема выглядит так:
Вы продолжаете кидать промты в GLM 5.2 и постить слоп-ответы в комментариях. Попробуйте добавить в промт то что эта статья была написана на основе следующих источников (вставьте список публикаций и исследований указанных в конце статьи). Вы ведь не со мной спорите или пытаетесь что-то доказать, вы с ними спорите.
Подозреваю, в этом случае ответ GLM будет "Да, вы абсолютно правы! Это меняет дело и вот почему..." хе хе.
Про воду так инфы и не получил ну да ладно.
Не надо мне устраивать проверку на дурака, и отмахиваться ещё одной пустой цитатой. Выложу этот анализ для других людей чтобы было понятнее что тут происходит, к тому времени автор может опять что-то поменять.
Эка вас закусило-то. Это не проверка на дурака, мне действительно было интересно где вы увидели воду. Утверждаете что вода, извольте конкретные абзацы процитировать что вот, вода-с, не нужная в статье.
Но вы оскорбились и вместо этого выдали обычный "псевдо-критический" анализ от GLM 5.2 выдавая его за свои мысли.
При этом разбор выглядит полным бредом, уж не обижайтесь. Вы боретесь с тем что сами себе выдумали (В этом и состоит подмена продукта...), не понимая что "продукт" в данном случае не определение истинности или смысла.
Также вы противопоставляете моему подходу свой используя...такую же нейронную сеть. Почему ваша нейронная сеть определяет "истинность и смысл" всей статьи целиком (с) мне непонятно.
Ни одна сеть не может установить ни истинность (это делают math solvers) ни смысл всей статьи (это делают люди) и мой подход, в отличии от вашего, этого не утверждает. Скрипт проверят смысловую необходимость деталей (слов-маркеров используемых для связки и тд), а не то является ли статья в целом осмысленной или истинной. Это (определить необходимость частного) нейронке как раз по плечу.
Особенно улубнуло про:
> «Нельзя победить ИИ-слоп… Можно лишь придать этому человеческий вид».
Это уже фактически признание, что скрипт не устраняет слоп, а маскирует его стилистические признаки.
Браво, именно об этом вся статья: нельзя победить слоп, можно лишь постараться придать ему человеческий вид, чтобы глаза не щипало при чтении. Я последовательно разбираю почему так и как это сделать. Смысл почти настиг Штирлица, но он оказался быстрее.
Ведьма мужского рода - ведьмак.
Для разбора твоей мутности использовался gpt sol 5.6 xhigh, но за изучение моего инструмента и матчасти благодарю.
Паттерн ты не сменил а потому на мои ответы ты будешь напираться как на кол . И написал ты тут в статье не детектор а обфускатор , судя по всему прогнав его по самой статье, учитывая что она запалилась на выхолощенности.
Ведьма мужского рода - ведьмак.
Точно, спасибо.
Для разбора твоей мутности использовался gpt sol 5.6 xhigh
XXL Ultra Long. И? Какая разница какую модель использовать, если ваш подход заключается в том что вы проверяете "истинность" написанного текста одной моделью с помощью другой модели? Где та грань, которая определяет что вот эта модель знает что такое истинность, а вот это не знает?
Такой грани нет потому что модели не могут гарантировано определять такое и именно поэтому у вас ошибка в логике, которая превращает ваш подход в один большой самообман.
Ваш подход будет и пропускать слоп статьи и клеветать на авторов, которые сами писали стаьтю. это буквально охота на ведьм.
Мой подход не ставит себе такую задачу. Я просто определяю за что именно цепляется глаз в тексте и как это исправить, а был ли он слопом или, как сказал редактор корпоративного блога МТС, "у нашего автора такой стиль", дело десятое. Мне, как читателю, важен комфорт при чтении чтобы я мог сосредоточится на сути. Охоту на ведьм я оставляю вам.
И написал ты тут в статье не детектор а обфускатор , судя по всему прогнав его по самой статье, учитывая что она запалилась на выхолощенности.
Вы еще и педали путаете. Это именно что детектор, он ОПРЕДЕЛЯЕТ, какие именно паттерны делают статью слопом и указывает их. Он не меняет ни буквы в тексте.
Пока что на выхолощенности запалились только ваши комментарии. Вы бы хоть как-то выхлоп от ИИ фильтровали, что ли. Попробуйте применять к ним то что написано в этой статье, глядишь и люди потянуться.
Моя личная оценка после оценки того что даёт инструмент, посыл настоящий, скрипт настоящий, а вот с наполнением посередине просто наполнение. Ну если смотреть целиком то статья полезна. Оценка сверху верна (моего личному мнению)
Квен 3.8 стал злоупотреблять в скриптах строкой from future import annotations. Сразу в глаза бросилось.
Возможно вы не пишете на питоне, эта строка - база для тех кто переписывает свои скрипты по 20 раз меняя порядок, добавляя и удаляя функции. Этот скрипт я тоже не с первого раза написал, это примерно пятая или шестая версия.
В начале я вообще пытался считать монотонность применения паттернов через zlib пародией на пермутационный тест: последовательность найденных сигнатур абзацев сжимается zlib-ом, затем та же последовательность 50 раз случайно перемешивается и тоже сжимается.
Если оригинальный порядок сжимается заметно лучше своих же случайных перестановок, это статистически значимый признак цикличности. На синтетике работало, на реальных статьях с хабра не показало статистически значимого результата, поэтому я это убрал и сделал новую версию.
Короче, эта строка всегда есть у тех кто слишком активно переписывает свои скрипт и ловит NameError когда свеженаписанная новая функция ссылается на тип который объявлен ниже.
Спасибо, про наполнение в середине - чукча не писатель, там я обычно пишу то что нарыл в исследованиях и чем из нарытого считаю интересным поделиться.
Ну и отдельно, использовать манипуляции на авторе который специализируются на раскрытии манипуляций это надо быть сам себе злобным Буратино.
Пока что вы показали полное непонимание предметной области. Я напомню хронологию:
Ваша система показала что статья не слоп (хотя она обязана была сработать ложноположительно и показать слоп ведь статья о методах определния слопа с примерами).
Затем вы изменили "или все таки слоп" аппелируя к "человеческой пустоте" и написали что в середине у меня вода.
Когда я вежливо, искренне попросил предоставить четкие абзацы воды (я не крутой писатель и буду рад поработать над своей подачей) - вы оскорблились и начали "критический" разбор всей статьи с испоьзованием GLM 5.2.
Я указал вам на асбурдность такого действа.
==Вы находитесь здесь==
Ну и отдельно, использовать манипуляции на авторе который специализируются на раскрытии манипуляций это надо быть сам себе злобным Буратино.
Вот тут ваша коса нашла на камень с 20-летним опытом в ИТ разработке вообще и 6 летним опытом в ML в частности. Я улыбаюсь вам, открыто и искренне, легкой улыбкой на губах. Мучать GLM не значит быть боссом этой качалки.
Перестаньте закусывать удила, прочитайте, что я вам пишу в ответ на ваши претензии и поймите что вы воюете с ветрянными мельницами в своей же голове.
Ваша система показала что статья не слоп (хотя она обязана была сработать ложноположительно и показать слоп ведь статья о методах определния слопа с примерами).
В том то и дела что не должна. Ты даже одного моего слова не понял. Инструмент отработал как надо - статья полезна относительна посыла - скрипт для детекции стиля ии . А если мерить относительно изначально заявленных проблем то слоп все верно. А улыбаться без причины - признак дурачины.
Хорошо, я вас не понял. Не принимайте близко с сердцу.
можно на "ты", и не критично, дозреешь если захочешь , возможно станет легче если загуглишь кто такой Тетраграматон и сложишь два плюс два, и перестанешь пытаться сравнивать меня и себя.
А насчет выхолощенности и воды.
Результат проверки Clearwater
Выхолощенность: влияние 92% · 7 фрагментов
Текст остаётся связным и соответствует теме, но во многих местах из него убрана несущая конкретика: сказано, что важно, однако не показано, как именно это определяется, измеряется или проверяется.
1. «Ощущение песка в глазах»
Оценка: 0.75 · hollow
В последнее время на ленту Хабра стало больно смотреть: ощущение песка в глазах от статей, которые узнаются с первого абзаца. Гладкий, грамматически безупречный текст при этом физически неприятно дочитывать до конца…
Вопрос: может ли читатель после этого абзаца точно определить, что именно вызывает «ощущение песка в глазах» и как это связано с использованием ИИ?
2. Разница, видимая «невооружённым глазом»
Оценка: 0.80 · hollow
Сам факт использования нейросетей не является негативным моментом. Проблема начинается, когда автор публикует черновик без единой правки. Разница между подготовленным с помощью ИИ текстом и неотредактированным ИИ-слопом видна невооружённым глазом.
Вопрос: как именно определяется эта разница? Какие конкретные и проверяемые маркеры отделяют отредактированный текст от ИИ-слопа?
3. Усталость «к третьему абзацу»
Оценка: 0.70 · hollow
Сети слишком хорошо пишут текст… Текст гладкий, факты на месте, структура логичная, а к третьему абзацу читать физически тяжело. Чаще всего это симптом не плохого содержания, а слишком узнаваемой формы — ИИ-акцента.
Вопрос: почему усталость должна возникать именно к третьему абзацу? Есть ли у этого порога какое-либо обоснование, кроме личного впечатления автора?
4. «Статистически колоссальные значения»
Оценка: 0.85
Анализ более 15 миллионов рефератов из PubMed показал резкий скачок частотности ряда слов после распространения ChatGPT. Избыточная частотность некоторых терминов достигала статистически колоссальных значений.
Вопрос: что именно означает «статистически колоссальная» частотность? Какими методами измерялись отклонения и насколько они пригодны для классификации отдельного текста?
5. «Псевдоискренность» как признак ИИ
Оценка: 0.75 · hollow
В качестве маркеров приводятся выражения:
«Честный разбор», «Давайте будем честны», «Без воды», «Откровенно говоря», «Спойлер»…
Вопрос: как было установлено, что это признаки именно ИИ-слопа, а не просто распространённые стилистические приёмы русскоязычных авторов, маркетологов и журналистов?
6. Тире и «программное подавление» привычки
Оценка: 0.70 · hollow
Я выделю десять наиболее узнаваемых паттернов ИИ-стиля. Первый — тире как универсальный знак препинания. У модели вся смысловая работа сворачивается в один знак…
Далее утверждается, что OpenAI эту привычку «программно подавляют».
Вопрос: что конкретно означает «программно подавляют»? Какие изменения были внесены в модель, обучение, системные инструкции или постобработку?
7. Выбор модели без сравнения
Оценка: 0.75 · hollow
Нам нужна модель размером до 8B параметров, работающая с русским текстом и возвращающая структурированный JSON. Мой выбор пал на T-lite-it-2.1.
Вопрос: почему была выбрана именно эта модель? С какими альтернативами она сравнивалась? Какие тесты качества, стабильности и ложных срабатываний проводились?
8. Проверка на собственном тексте
Оценка: 0.80 · hollow
Тестировать получившийся скрипт на тексте этой статьи не имеет смысла, поэтому я взял одну из своих сложных статей.
Результат:
Итоговый индекс ИИ-слопа: 0.14 / 1.00 [human]
Вопрос: почему проверка на текущей статье «не имеет смысла», а проверка на другой собственной статье считается валидной? Не создаёт ли это конфликт интересов, когда автор одновременно создаёт критерии, выбирает тестовый материал и интерпретирует результат?
Суть претензии
Во многих местах статья формулирует тезисы на уровне впечатлений и оценок, но не даёт достаточной операционализации.
Сказано, что определённые признаки важны, однако не всегда показано:
как именно они были выделены;
как измеряется их влияние;
насколько они специфичны именно для ИИ;
какова точность классификации;
как проверялись ложные срабатывания;
почему выбранная модель и система весов лучше альтернатив.
Поэтому текст создаёт впечатление подробно обоснованного метода, хотя существенная часть метода остаётся набором авторских наблюдений, оформленных в виде численного индекса.
можно на "ты", и не критично, дозреешь если захочешь
Приучен общаться на вы с незнакомыми людьми. Относитесь к этому как к банальной вежливости с моей стороны.
возможно станет легче если загуглишь кто такой Тетраграматон и сложишь два плюс два, и перестанешь пытаться сравнивать меня и себя.
Вы начали сравнивать свою систему с моей, при том что они делают РАЗНОЕ. Я постарался это объяснить, в ответ получил охоту на ведьм, улыбнулся с этого. Затем вы попробовали аппелировать к своему авторитету, получилось жидковато.
Сейчас вы предлагает загуглить кто вы, видимо ваше имя слишком известно в узких кругах чтобы его называть. Я не поленился, загуглил: Тетраграматон это имя Бога Израиля Яхве.
Вашу божественную сущность я не оспариваю и на регалии не покушаюсь.
Но вся ваша аргументация буквально высосанна из... пусть будет пальца GLM/GPT SOL сетей, поэтому уже извините, я не стал тратить время на прочтение остальной части слоп-комментария, которым вы меня потчуете.
Вашу статью авторы добавят в закладки. Сами догадаетесь почему? /s
Вспоминается как после статьи про плагин на опечатки в нейрослопе все редакторы хабра начали его использовать.
А когда их макнули в это, влепили капчу.
Именно для этого я ее и писал. Нельзя победить ИИ-слоп на ресурсе, который его опосредовано монетизирует. Можно лишь придать этому человеческий вид.
это кстати произошло около года назад
до этого достаточно было повелеть Чатгпт: «напиши по-человечески» - давал совершенно нормальный человеческий текст, даже с некоторым персональным «акцентом». Потом началось все вот эти вышеперечисленные слоп паттерны которые даже сейчас с трудом можно забороть. Причем практически в одно и то же время в Чатгпт, Клавдии и Гемини - как будто им повелели таким образом добавлять ии-ватермарк
это кстати произошло около года назад
Так как раз тогда разработчики моделей нагенерировали себе текстов для обучения новых моделей, и всё.
Никогда чатгпт не давал человеческий текст. У меня по 5 прогонов уходило, чтобы избавиться от явного гпт-оттенка, чтобы сделать текст более русским, нужно ещё штук запросов.
Шило на мыло. Или диктат стиля нейронки или диктат некого частного видения, возведенного в должное и универсальное. Выбираю ни то и ни другое.
Я как раз и начал писать на хабре (https://habr.com/ru/sandbox/219982/) из-за невозможности вынести корпоративный нейрослоп. Я не выдержал массовых ошибок в статьях о промышленности.
У модели вся эта работа сворачивается в один знак, который к тому же ставится с пробелами по обе стороны, что для типографики нехарактерно и само по себе служит маркером.
Отбивать тире пробелами нехарактерно для английской типографики, а в русской типографике тире пробелами как раз отбивается. Либо вы не в теме, либо это перевод с английского, либо нейрослоп.
Хорошо, я не в теме, это все перевод с английского и нейрослоп, выдыхайте. Теперь по сути:
Отбивать тире пробелами нехарактерно для английской типографики
Там варианты есть и так и эдак, в зависимости от того американская или английская статья, а также академическая или новостная.
По пробелам вокруг тире имелось ввиду применительно к сноскам. Сноска выглядит вот так:
— Ссылка на источник или авторская ремарка.
Нейросеть пишет сноску вот так:
— Ошибка: на источник или авторская ремарка.
т.е. пробел перед тире. Сети часто так пишут потому что — является устоявшейся последовательностью токенов.
Мне нужно было сформулировать вот так: У модели вся эта работа сворачивается в один знак, который к тому же в начале сносок ошибочно отбивается пробелом слева, что для типографики нехарактерно и само по себе служит маркером. Исправил.
т.е. пробел перед тире. Сети часто так пишут потому что
—является устоявшейся последовательностью токенов.
А я так пишу потому, что LibreOffice автоматом подставляет такое длинное тире. И мне это нравится. Судить по длинному тире о нейрослоповости я бы не стал.
Судить по длинному тире о нейрослоповости я бы не стал.
Судят не по тире как таковому, а по количеству его применения в объеме абазца. Если каждое второе-третье предложение использует тире — это признак нейрослопа (в данном предложении человек бы написал ", то" вместо тире). Конечно, есть исключения в виде текста с диалогами, там просто зашкаливающее количество тире.
Наибольшее раздражение в таких статьях вызывает то, что они искусственно раздуты. Иными словами, там очень много воды. А еще нейронки постоянно выдумывают какие-то нелепые и нереалистичные ситуации, чтобы проиллюстрировать тот или иной тезис. И этим очень сильно палятся.
Как мне кажется, что основная претензия автора состоит в том, что "нейронки не достаточно хороши", т.е. используют не те слова или не те обороты. Меня же раздражает в нейрослопах именно сам факт использования нейросетей! Зачем мне читать статью-нейрослоп если я могу с таким же успехом сделать запрос к нейронке и получить тот же самый рафинированный ответ ? И во многих случаях даже короче, то есть нейронка еще и сэкономит потраченное мной время.
Мне же в статьях авторов хочется видеть 1) авторский опыт и 2) авторский стиль. Как только автор прогоняет свою статью через нейронку, всё это размывается и усредняется, насыщается водой и различными часто ипользуемыми "терминами" и "оборотами речи" явно не присущими автору. Из-за этого я в основном читаю на Хабре только редкие статьи проверенных авторов.
Ну и подавляющее большинство тем в духе "Нейронке о нейронках" просто вытеснили всё полезное из ленты.
основная претензия автора состоит в том, что "нейронки не достаточно хороши"
Нет, основная претензия автора в том, что авторы и редакторы статьей на Хабре не достаточно уделяют внимание проработки ИИ-слопа в читабельный материал перед публикацией. Более того, автор дал вариант как это можно исправить с минимальными усилиями.
Запустил скрипт, посмотрел по каким параметрам из десятка зашкаливает, проработал именно их, а не все 10. Опубликовал, у читателя глаза не щипет, теперь статью можно хотя бы прочитать до конца.
И вот только после этого уже можно начинать докапываться до истинности написанного в статье и делать прочие охоты на ведьм.
Запустил скрипт, посмотрел по каким параметрам из десятка зашкаливает, проработал именно их, а не все 10. Опубликовал, у читателя глаза не щипет, теперь статью можно хотя бы прочитать до конца.
Я же говорю - нейронки еще недостаточно хороши, но уже совсем скоро подтянутся. ;)
Автор не понимает, что проблема нейрослопа не в "недостаточной читабельности", а в том что в нем нет автора с его опытом. Никакая "проработка нейрослопа" это не исправит. Если я вижу признаки нейро (а их всегда видно и без длинных тире чисто по стилю) - сразу закрываю статью т.к. к ней нет доверия и интереса.
Думал как-то, что возможно конкретно конструкции вида "не X, а Y" (ЕМНИП, это называется контрастивное определение) - это не артефакт обучения с подкреплением, а скорей способ модели более точно выразить смысл.
Мысль была следующая: есть некоторый континуум смыслов, который нужно выразить с помощью конечного множества слов где каждое слово фактически сопоставлено множеству смыслов. Конструкции вида `A \ B` позволяют выразить смысл точней.
Спасибо, отличная статья! Буду использовать ее для оживления текста !
Вы нашли отличный способ выявлять нейрослоп и даёте советы как сделать нейрослоп устойчивым к этому методу? По-моему, вы не туда воюете.
Так если нейрослоп перестанет быть слопом а станет нормальным текстом - это хорошо, разве нет?
По-моему, вы не туда воюете.
Я не воюю. Битва против массового использования ИИ-слопа проиграна задолго до этой статьи. Все, что мы сейчас можем, так это предложить авторам использовать ИИ-инструмент лучше чем они используют его сейчас и сделать свой материал менее раздражительным для читателя.
Мой скрипт не детектирует сам слоп как таковой (я не ставил себе такую задачу), он определяет насколько сильно в тексте используются те раздражающие глаз читателя паттерны, которые обычно использует нейронная сеть при генерации текста.
Убирая эти шероховатости текст становится воспринимаем людьми. А дальше уже можно ломать копья, есть в тексте истина или выхолощенность или что-то там еще. Это уже выходит за рамки данной статьи.
Битва против массового использования ИИ-слопа проиграна задолго до этой статьи.
Наоборот, недовольных становится больше. И наша задача, как стоящих на стороне людей, делать, чтобы их становилось ещё больше, а не меньше.
Недовольных много, я в их числе, но тут либо идти в конструктив и помогать авторам "делать нормально", либо голосовать ногами. В моем понимании это выбор без выбора, поэтому я предлагаю идти по первому пути.
История учит лишь тому, что она ничему не учит, такое уже бывало и не раз. По моему мнению следование второму пути не переломит ситуацию и либо появится новое поколение менее привередливых читателей, либо администрация задумается о ситуации когда будет слишком поздно, просто потому что поток средств с корпоративных блогов является очень сильным стимулом держать статус кво до последнего.
Недовольных много, я в их числе, но тут либо идти в конструктив и помогать авторам "делать нормально", либо голосовать ногами. В моем понимании это выбор без выбора, поэтому я предлагаю идти по первому пути.
Если Вам лично не нравится нейрослоп, зачем Вы помогаете ему развиваться ? В Вашем представлении машина давно победила человека и сопротивление бесполезно. Поэтому будем потреблять то, что дает машина, но слегка приправим это специями, чтобы было не так пресно. Всё верно ? Может быть было бы лучше проголосовать ногами ?
Если Вам лично не нравится нейрослоп, зачем Вы помогаете ему развиваться ?
Не можешь победить - возглавь (с)
Мне не нравится ИИ-слоп в чистом виде, против статей, подготовленных с помощью ИИ и затем доработанных человеком я ничего не имею против.
Если ИИ-слоп лишить раздражающих паттернов, то он перестает быть ИИ-слопом в чистом виде, потому что автору приходится точечно переписывать куски текста. Сделать это можно только прочитав о чем идет речь самому и написав своими словами.
Хотя бы прочитать текст до конца будет можно, а не как сейчас, некоторые в других ветках обсуждения выше, вон, даже комментарии делают слопом.
Это похоже на то как готовили "классические" статьи раньше, в эпоху гугления источников, но только в небольшом объеме и адресно, в конкретных абзацах.
Конечно, это не то, что раньше, но хоть что-то. Как раньше уже не будет, просто не все еще это поняли.
Может быть было бы лучше проголосовать ногами ?
Всегда есть молчаливая, довольно большая группа людей, которых все устраивает, из-за чего одно их существование умножает на ноль голосование ногами.
На сколько я могу судить, большое количество пользователей и авторов уже проголосовало ногами. И как оно, помогло?
Если человек прочилал добытую информацию из других статей, от нейросети или из гугла, переосмыслил её и изложил своими пальцами в виде человекочитаемого текста, то это уже не нейрослоп. Проблема в том, что такая работа "глаза-мозг-руки" для многих авторов считается слишком энергозатратной. Поэтому, как Вы не старайтесь, нейрослоп останется нейрослопом по причине того, что большинство авторов решают задачу оптимизации - "минимум затрат, максимум прибыли". Вы просто даете им еще один инструмент в руки для "минимизации затрат".
Ну и на мой вгзляд большинство уже давно проголосовало ногами. Я уже писал, что перестал даже пролистывать заголовки статей, читаю только интересных мне авторов. То, что я зацепился глазом за эту статью - большая случайность. :)
Забавный случай: весной этого кода выступал в своем ВУЗе в рамках локального мероприятия на IT тематику. И там были ребята (3 первокурсника) с очень интересным, как мне показалось, проектом. Они рассказали о нейросетях, о перплексности, о том, как долго и упорно писали свою программу, в которой совместили Антиплагиат и ДетекторИИ. Комиссия слушала их внимательно и задавала вопросы, в которых они, мягко говоря, "плавали". Ну перенервничали, с кем не бывает. Позже, в перерыве, я случайно услышал их разговор с другими докладчиками (хотя по громкости не сказал бы, что они прям скрывались). И они смеясь рассказывали о том, что ВЕСЬ проект - это изначально расчетная работа, созданная с ИИ в рамках обучения. И, конечно, допиливали её тоже с ИИ. И самое обидное, что они за несколько дней до этого уже стали призерами в региональном конкурсе с этим проектом. Программа по распознаванию ИИ в тексте была полностью создана с ИИ.
У меня в прошлом семестре тоже был интересный опыт. Ко мне на практику пришла небольшая группа студентов для написания проекта по ПЛИСоводству. Они, как это сейчас принято, начали обильно использовать нейросети для генерации кода на языке Verilog, и я не стал этому препятствовать. Код генерируемый нейронкой был вполне себе рабочий, только очень непонятный для людей ранее не имевших дело с Verilog и ПЛИСами (местами и для меня тоже ;)). Так вот, очень быстро они сообразили, что таким образом просто обманывают сами себя тратя своё драгоценное время на борьбу с нейронкой. Я предложил им выкинуть всё ранее сгенерированное нейросетью и начать писать вручную, тестируя код мелкими кусочками и экспериментруя по ходу изучения.
Да, мы многого не успели, но какой-то проект худо-бедно всё же слепили. С этим проектом мои подопечные выступили на внутревузовском конкурсе, где и получили первое место, а в качестве приза - зачисление в магистратуру на бюджет. Такие вот чудеса. :-)

Невыносимая слопность бытия