Pull to refresh
8K+
9
3,6
Rating
6
Subscribers
Send message

Если текст сгенерирован определенной LLM, то проверять надо соответствующим ей детектором (то есть детектор от Google подходит только для Gemini, детектор от Anthropic - только для Claude и т.д.), только он способен распознать наличие вотермарки. Ну и соответственно для переписывания текста нужно использовать другую LLM с открытыми весами, так как в нее вотермарку впихнуть проблематично. Тут правда встает вопрос, а почему бы сразу не генерить текст такой LLM или просто писать руками, но, как я уже писал, статья не про это.

Хорошо бы ещё написать, а зачем "их обходить"? Типа, если нельзя использовать ИИ, но хочется?

Ну да, почему нет? Просто в последние два дня поднялось много шума вокруг всего этого, и мне стало интересно, насколько сложно от этой самой вотермарки избавиться.

А откуда автор информацию получил, которую описывает далее? Так как основной вопрос - а это точно все классы таких схем описаны или только один из них?

Справедливо, добавил в статью ссылку на статью по SynthID от гугла + описал еще одну похожую схему. Что там у Антропика, неизвестно, но есть основания полагать, что что-то похожее.

Автор сам проверил, что это работает? Типа: "Вот текст пестрит метками и это обнаружено внешней системой (не автора), а вот после программы автора это внешнее обнаружение уже не работает".

Справедливо, добавил в статью тесты. В репозитории они тоже доступны, можно поиграться, если интересно.

ИИ написал текст, затем его дважды перевели, далее другой ИИ его переписал...
а) Предположу, что такая борьба "визуально" заметна будет человеку (как минимум, некоторым) стилистически и т.д. из-за чего-то внесённого странного во всей этой цепочке переделок.

б) Очевиден риск потери смысла. Игра "испорченный телефон" широко известна. При этом искажение может быть и не очевидным.

Да, будет заметна, но задачи сделать текст человекоподобным и не стояло. Все что я сделал, это просто свел более сложную задачу избавления от вотермарок к более легкой задаче приведения текста к нормальному виду, которая решается точечными правками, а не тотальным переписыванием текста.

  • нет, это закрытый ключ, он лежит где-то на серверах провайдера, так что только условный Антропик может проверить вывод модели того же Антропика

  • С кодом хреново это все будет работать, но там тебе и вряд ли кто-то предъявит за то, что нейрокой кодишь)

Любой в принципе можно, в настройках задается

Неправильно объяснил, без разницы, насколько тексты разнообразны. Там это как работает, если в деталях: есть фиксированный ключ, есть последние m токенов в тексте, дальше на основании этого ключа и последних токенов разбивают словарь на две примерно равные части, условно красную и зеленую. И следующий токен выбирают только из зеленой части. При выборе следующего токена раскраска меняется и как бы не получается, что всегда одни и те же токены выбирают.

А дальше на проверке, зная ключ и зная предыдущие токены просто смотрим из какой половины раскраски данный токен - зеленой или красной. И вот, если раз за разом на протяжении 10-20-30 токенов стабильно получается так, что токен всегда из зеленой части, очень похоже, что текст сгенерирован. Причем даже если какие-то слова в тексте менять, что-то выкидывать и т.д., все равно останется множество подпоследовательностей в которых эти зеленые токены будут идти подряд один за другим. Поэтому от ватермарки так сложно избавиться.

Добавил это объяснение в текст статьи, а то действительно не очень понятно, как это все так ловко работает.

А зачем обладать полной базой данных вероятностей для все моделей, температур и т.д.? Достаточно обладать информацией о распределении слов в обычном, не написанном ИИ тексте, их совместной встречаемости и т.д. И соответственно если вдруг встречаешь текст, в котором частота появления отдельных слов или их сочетаний резко отличается от нормальной - значит это вероятно нейрослоп.

Это я неправильную ссылку разместил) Сейчас все должно быть доступно.

потом будет блокировка AppStore

Не будет. У нас почти все чиновники и депутаты продукцией Apple пользуются. Уважаемым людям неудобства создавать это не комильфо, за это и по шапке получить можно.

Спасибо за комментарий! Применял, но на базовом уровне. Нужно было файнтюнить небольшую LLM на нескольких видеокартах. Там все обошлось обычным Data Parallelism, потому что все влезало с запасом на один GPU и даже приблизительный анализ показывал что там все будет Compute Bound даже при небольшом размере батча.

Да-да. Тот самый Свинцов, который регулярно постит поклонники которого регулярно постят в инсте и телеге всякое разное. Тот самый Свинцов, который уже почти месяц ничего не постил на своем канале с 53 подписчиками в замечательном мессенджере Max. Хотя казалось бы чего сложного - идешь по парковке, думаешь о том, что бы еще заблокировать, чтобы согражданам стало жить совсем хорошо, ну так и запости свои мысли об этом в единственном мессенджере, который там ловит. Вот этот вот Свинцов будет нам тут рассказывать, как хорошо будет от блокировок всего западного.

В Австралии неофициально начал действовать запрет на использование социальных сетей подростками — мера затронула более чем 20 млн человек.

Что-то тут не то, в Австралии всего живет 27 миллионов. Либо цифра завышена, либо у Австралии все ооочень хорошо с демографией)

Termfy и DocDecoder что-то подобное делают, можно их для этой задачи использовать.

Как выше писали, потом был стрим, на котором был отдельный цирк с конями. Туда позвали барышню-маркетолога, которая прямо говорила на стриме, что все, кто попал на эту подписку, это мамонты (лохи то есть) и что главный пострадавший это их контора, ведь это у них теперь будут убытки из-за репутационных потерь. Потом пришел директор, который до этого достал личные данные одного из блогеров и угрожал ему в личке отправкой на СВО. На стриме он заявил, что угрозы отправкой на СВО это шутка такая, а на вопрос, как он личные данные достал, ответил что-то в духе "Ребят, ну вы же все понимаете, вы же знаете, как подобные данные достаются".

Так что нет там никакой логики, они в каком-то в своем мире живут, в котором 90-е еще не закончились, а Мавроди стал президентом.

Все индивидуально очень, зависит от опыта, резюме и от того, на какие вакансии откликаешься. Но по моему опыту на НН конверсия больше раза в 3-4.

Поправил, должно работать.

Да, посмотрел из-под своего аккаунта, LinkedIn обновил UI. Поначалу только для премов, теперь видимо для всех. Надо будет обновлять логику работы программы, это займет некоторое время.

Похоже, что у вас премиум аккаунт. Похожая проблема у другого владельца премиум аккаунта была. Видимо LinkedIn другой UI для премов предоставляет. Советую зарегать не прем и попробовать с него.

Мне кажется, вы описываете разные use cases. В описываемом вами случаем пользователь точно знает, какая работа ему нужна. В таком случае AI driven поиск подойдет лучше, это да. Но если пользователь просто ищет работу, которая подходит под его резюме, AI driven поиск тут не поможет, потому что просто не умеет искать работу, основываясь на деталях пользовательского профиля, LinkedIn прямо об этом пишет. А мой бот с этим справится, и даже если старая версия Job Search выдаст совсем не релевантную работу, LLM на следующей ступени поиска ее просто отфильтрует как неподходящую.

Поправил версию библиотеки Levenstein, теперь должно работать с python 3.13. Также поправил баг с логином.

Насчет вашего 15-летнего акка, я бы на вашем месте не рисковал, а завел бы второй акк. С него бы искал подходящие вакансии, а откликался бы уже руками с основного.

Если еще возникнут вопросы, пишите в Telegram чат, ссылка на него есть в README.

Я на python 3.13 не тестировал, вполне возможно, что Levenstein не совместим с ней, проверял только на python 3.12.

Насчет логина, бот только один раз должен входить в аккаунт, после первого входа он сохраняет сессию в cookies и при дальнейших запусках логин уже не требуется.

Насчет того, что кнопку не нашел, посмотрю сегодня, видимо LinkedIn опять сайт поменял.

1

Information

Rating
1,523-rd
Registered
Activity