Комментарии 13
Интересные мысли и интересная позиция.
Когда Хабр завалило нейрослопом, то все были этим недовольны.
Теперь, когда Хабр запретил сгенерированные тексты, то находятся те, кто говорит "Я использовал ИИ, но только во благо, а вы сняли мою статью". А также те, кто использовал ИИ, но говорит, что этого не делал.
Это так не работает. Или мы разрешаем ИИ, или запрещаем. Каждый автор, генерирующий статьи, свято верит, что его статья прекрасна и её непременно все должны увидеть и прочесть.
При этом, иногда автор может даже не знать, что текст сгенерирован, если он надёргал частей из разных источников, а они были сгенерированы.
Но сидеть и перечитывать все тексты, пытаясь понять, в каких из них есть смысл, а в каких нет - заведомо бессмысленная задача. Тексты генерируются быстро и в огромных количествах, а модераторы по умолчанию не могут быть компетентны во всех темах, чтобы определять наличие смысла. Кроме того, модераторы в принципе не занимаются проверкой достоверности статей. @wataru привел хорошее сравнение про пользователей калькуляторов и мегабайты мусора.
Я смотрю на это как на порог входа. Если ты хочешь написать статью на Хабре, то ты должен уметь хорошо и интересно писать. Нельзя быть автором статей, не умея писать статьи. Как нельзя быть токарем, не умея работать на станке.
Вывод, сделанный автором статьи относительно паттерна "Теоретическая часть" считаю ошибочным, поскольку это лишь один конкретный паттерн, сработавший в определенном контексте. Так просто совпало в конкретном случае.
Допустим, что возможны какие-то неточности в срабатывании. Но обсуждаемая статья https://habr.com/ru/articles/1058542/ даже сейчас, после обращения в поддержку и "исправлений", значится, как человеческая менее чем наполовину. Там ИИ в разных частях и абзацах. Что же там было до исправлений?
Также, хочу обратить внимание, что автор жалуется на ложно положительный результат проверки. А как аргумент, приводит пример ложно отрицательного.
При этом, я неоднократно в подобных дискуссиях говорил, что используемый нами алгоритм настроен "мягко". Он никогда не скажет на человеческий текст, что он сгенерирован. А вот сгенерированный он может принять за человеческий. И именно это и говорит оператор поддержки в приведенной цитате.
Эта настройка на 100% в пользу авторов. Но в любом случае, что бы не показывали нам цифры, решение за модератором. Никакой инструмент самостоятельно не скрывает статьи.
Тут есть две противоположные проблемы.
С технологической точки зрения, пользователи и алгоритмы должны действовать в различных адресных пространствах, то есть — это разделение должно быть реализовано на уровне вычислительной архитектуры.
С концептуальной точки зрения, генерация призвана, как раз, приблизиться по качеству к человеку, а это значит, что любые формальные признаки будут заведомо выдавать ложные результаты. Очень плохая идея, проверять алгоритм при помощи другого алгоритма. Да, применение алгоритма может дать много разной полезной информации, но затем нужно принимать решение, а решение принимается уже не только на полученной при анализе информации. При этом, вовсе не обязательно, что если текст порождён алгоритмом, это плохо само по себе. Такой тест вполне может раскрывать тему, зачем же такой текст (и его автора) банить?
Ограничивать платформу следует не от искусственно созданных текстов как таковых, а от текстов плохого качества. То есть — задача ограничения платформы от искусственных текстов сама по себе не вполне корректная задача. Даже если ставить задачу именно так, то решение "против алгоритма" должен принимать никак не "другой алгоритм", а человек, а человек может, например, вступить в диалог с автором и получить подтверждения своей гипотезы (относительно авторства текста) или опровержения.
Мы живём в очень странное время. Очень многое подменяется искусственным. Но если сказать правду, то у нас часто на всё ботоподобная реакция. Вот алгоритмы её и воспроизводят. Потому как всякий типичный собеседник почти всегда реагирует вполне ожидаемым образом, то есть — порождает наиболее вероятный токен. Вот мы и оказываемся в ловушке! С чем нас всех я и поздравляю. ;-)
Пойду причиню вред человеку. Чтобы доказать, что я не робот…
Ограничивать платформу следует не от искусственно созданных текстов как таковых, а от текстов плохого качества.
Вот с этим прямо на 100% согласен. Но все почему-то борются с генерацией, а не с плохим качество. Спрашивается, зачем тогда вообще ИИ нужен, если им не разрешают пользоваться?
Вообще, оценка по «сгенерировано — не сгенерировано» — это неправильный подход. LLM — это инструмент, и когда он появился, не использовать его нет смысла. Мы же не ищем признаков расчетов на калькуляторе или набора текста на клавиатуре компьютера. И следы лопаты в яме не ищем. Важен результат, его качество, а не метод получения. Для чего сгенерированный LLM надо помечать? Для того чтобы не было коллапса моделей, чтобы бороться с нейрослопом. Но всё это только потому, что обычно качество результата генерации оставляет желать лучшего. Это единственная причина. Если человек приложил усилия и написал статью с помощью ИИ, получил хороший результат, и этот результат лучше, чем был бы без ИИ, это не повод этим результатом не пользоваться. Повод — плохое качество. Нужно совершенствовать механизм оценки качества статьи, а не проверять и банить за генерацию. А то такими темпами и на пальмы можно обратно залезть.
Тут проблема с тем, что пользователи калькуляторов не заваливают хабр мегабайтами мусора, а пользователи нейронок - заваливают. Иначе бы были и автоматические проверки на использование калькуляторов.
И это не для создателей нейронок делается, чтобы они не дай бог не испортили свое детище воровнным с хабра материалом, а для читателей хабра. Если 99.99% статей будет нейрослопом, то читатели все уйдут и хабр можно закрывать, а кто захочет почитать что-то нейронное, всегда сможет с тем же успехом открыть чат бот самостоятельно и попросить его написать статью.
Автоматически сгенерированные тексты можно проверять только автоматически, иначе генератор всегда завалит все ручные фильтры хрючевом.
По поводу описанного тут случая - автору просто не повезло: его уникальный стиль весьма похож на нейрослоп. Статью все-таки опубликовали, так что система работает. Лучше уж некоторый процент авторов будет вынужден писать аппеляции, чем хабр потонет под низкопробным слоем нейрослопа.
Хорошего решения у проблемы нет. Можно еще вводить фильтры по рейтингу, чтобы писать могли только проверенные пользователи с системой рекомендаций, но тогда количество контента сильно упадет. Можно вводить плату за регистрацию и жесткие баны при жалобах на нейрослоп. Но все решения будут по своему плохи.
Да я понимаю, что все из-за мегабайт мусора. Но что делать если автор провел 100500 итераций чтобы привести статью в нормальный вид и при этом использовал LLM? проблема же в мусоре, а не генерации. Непонятно почему карма не работает. Думаю ее и надо как-то модифицировать, а не банить за использование инструментов
А карма каким-то образом спасает автора от лености перечитать за нейронкой? Карма — не индульгенция. Сам факт хорошей кармы говорит, что ранее автор был молодцом, но не гарантирует, что автор не ушибся головой, не заболел какой-нибудь нейроболячкой, не решил, что нейронки сделают лучше него, и забил...
А что мешает вместо проверки на сгенерирвоанность проверять статьи на литературную и информационную ценность? Вполне можно модель обучить этому, предъявив ей плохие и хорошие тексты
Если человек постарался, то статья будет человеческая. А если человек не даёт себе труд даже перечитать текст после нейронки — увольте от такого текста.
случаи ложноположительного срабатывания инструмента нам пока не известны
Фактически поддержка всерьёз утверждает, что ими разработан (или куплен) идеальный инструмент.
При этом самые известные детекторы генерации хорошо работают на собственных тестовых наборах компании, и хуже на независимых проверках.
Ответ поддержки, как по мне, лежит в категории "Я ошибку не нашёл, значит, её нет".
Интересные мысли и интересная позиция.
Когда Хабр завалило нейрослопом, то все были этим недовольны.
Теперь, когда Хабр запретил сгенерированные тексты, то находятся те, кто говорит "Я использовал ИИ, но только во благо, а вы сняли мою статью". А также те, кто использовал ИИ, но говорит, что этого не делал.
Это так не работает. Или мы разрешаем ИИ, или запрещаем. Каждый автор, генерирующий статьи, свято верит, что его статья прекрасна и её непременно все должны увидеть и прочесть.
При этом, иногда автор может даже не знать, что текст сгенерирован, если он надёргал частей из разных источников, а они были сгенерированы.
Но сидеть и перечитывать все тексты, пытаясь понять, в каких из них есть смысл, а в каких нет - заведомо бессмысленная задача. Тексты генерируются быстро и в огромных количествах, а модераторы по умолчанию не могут быть компетентны во всех темах, чтобы определять наличие смысла. Кроме того, модераторы в принципе не занимаются проверкой достоверности статей. @wataru привел хорошее сравнение про пользователей калькуляторов и мегабайты мусора.
Я смотрю на это как на порог входа. Если ты хочешь написать статью на Хабре, то ты должен уметь хорошо и интересно писать. Нельзя быть автором статей, не умея писать статьи. Как нельзя быть токарем, не умея работать на станке.
Вывод, сделанный автором статьи относительно паттерна "Теоретическая часть" считаю ошибочным, поскольку это лишь один конкретный паттерн, сработавший в определенном контексте. Так просто совпало в конкретном случае.
Допустим, что возможны какие-то неточности в срабатывании. Но обсуждаемая статья https://habr.com/ru/articles/1058542/ даже сейчас, после обращения в поддержку и "исправлений", значится, как человеческая менее чем наполовину. Там ИИ в разных частях и абзацах. Что же там было до исправлений?
Также, хочу обратить внимание, что автор жалуется на ложно положительный результат проверки. А как аргумент, приводит пример ложно отрицательного.
При этом, я неоднократно в подобных дискуссиях говорил, что используемый нами алгоритм настроен "мягко". Он никогда не скажет на человеческий текст, что он сгенерирован. А вот сгенерированный он может принять за человеческий. И именно это и говорит оператор поддержки в приведенной цитате.
Эта настройка на 100% в пользу авторов. Но в любом случае, что бы не показывали нам цифры, решение за модератором. Никакой инструмент самостоятельно не скрывает статьи.

О нейросетях, детекторах генерации и правовых аспектах использования ИИ