Обновить
8K+
11
Александр@beatwad

Embedded и ML инженер

18
Рейтинг
6
Подписчики
Отправить сообщение

Да по идее сама электроника не должна стоить дорого, особенно при промышленном производстве. Вот оптика и камера это да, как верно указали в комментарии выше, их придется делать устойчивыми к вибрациям от выстрелов, может влететь в копеечку.

При таком кропе уверенно классифицировать объект именно как дрон вряд ли возможно

Возможно вы правы, нужно попробовать несколько классов классифицировать, если не получится, придется увеличивать кроп.

он должен держать дрон строго в пределах рабочей зоны

Это правда, но делать это нужно в течение десятков миллисекунд, отсюда и такие строгие требования к скорости.

Так я уже в текущей версии кропаю, просто вырезаю нужный мне кусок из центра на препроцессинге, это 2 мс примерно. Угол обзора не критичен, считаем, что задачу грубого наведения решает оператор, наводя прицел на дрон вручную, дальше работает система. Если дронов несколько, то берем тот, который ближе к центру, остальные игнорим.

Спасибо за комментарий!

Насчет разрешения согласен, нужно больше, хотя конечно низкое разрешение можно частично нивелировать обрезкой кадра с сохранением только центральной области.

Я просто пытался решить задачу распознавания дрона в ситуации, когда он уже подобрался на близкую дистанцию и хочет бахнуть где-нибудь рядом с тобой. Тут важна скорость и детерминированность, отсюда и берется FPGA, потому что это единственное устройство, которое может запускать нейронки и гарантировать при этом фиксированную задержку.

А все остальные приколы в виде низкого разрешения, квантизации, YOLOv8 и т.д. берутся из ограничений FPGA, потому что либо не влезает, либо нейронка содержит в себе операции, которые тупо не поддерживают компиляторы FPGA (типа блоков внимания в YOLOv26).

Да и к тому же я сам в прошлом разработчик FPGA, поэтому склонен решать поставленные задачи известными инструментами :)

Так это Proof-of-Concept. Для прода нужно будет либо, как вы сказали, на несколько небольших и дешевых FPGA раскидывать, либо, как я в конце статьи писал, вообще на ее базе ASIC делать, а последние слои хранить на небольшой ПЛИС для дальнейшего файнтюна.

Так ему и литкод учить не надо по сути (разве что если оффлайн собесы будут). Поставил (или написал кодексом) приблуду, которая экран скринит и ответ выводит (но так, чтобы он в очках не отражался xD) или в наушник нашептывает, научился все это выдавать так, как будто сам все придумал, и все - можно вообще теперь не думать - ни на собесе, ни на работе, никогда.

Если текст сгенерирован определенной LLM, то проверять надо соответствующим ей детектором (то есть детектор от Google подходит только для Gemini, детектор от Anthropic - только для Claude и т.д.), только он способен распознать наличие вотермарки. Ну и соответственно для переписывания текста нужно использовать другую LLM с открытыми весами, так как в нее вотермарку впихнуть проблематично. Тут правда встает вопрос, а почему бы сразу не генерить текст такой LLM или просто писать руками, но, как я уже писал, статья не про это.

Хорошо бы ещё написать, а зачем "их обходить"? Типа, если нельзя использовать ИИ, но хочется?

Ну да, почему нет? Просто в последние два дня поднялось много шума вокруг всего этого, и мне стало интересно, насколько сложно от этой самой вотермарки избавиться.

А откуда автор информацию получил, которую описывает далее? Так как основной вопрос - а это точно все классы таких схем описаны или только один из них?

Справедливо, добавил в статью ссылку на статью по SynthID от гугла + описал еще одну похожую схему. Что там у Антропика, неизвестно, но есть основания полагать, что что-то похожее.

Автор сам проверил, что это работает? Типа: "Вот текст пестрит метками и это обнаружено внешней системой (не автора), а вот после программы автора это внешнее обнаружение уже не работает".

Справедливо, добавил в статью тесты. В репозитории они тоже доступны, можно поиграться, если интересно.

ИИ написал текст, затем его дважды перевели, далее другой ИИ его переписал...
а) Предположу, что такая борьба "визуально" заметна будет человеку (как минимум, некоторым) стилистически и т.д. из-за чего-то внесённого странного во всей этой цепочке переделок.

б) Очевиден риск потери смысла. Игра "испорченный телефон" широко известна. При этом искажение может быть и не очевидным.

Да, будет заметна, но задачи сделать текст человекоподобным и не стояло. Все что я сделал, это просто свел более сложную задачу избавления от вотермарок к более легкой задаче приведения текста к нормальному виду, которая решается точечными правками, а не тотальным переписыванием текста.

  • нет, это закрытый ключ, он лежит где-то на серверах провайдера, так что только условный Антропик может проверить вывод модели того же Антропика

  • С кодом хреново это все будет работать, но там тебе и вряд ли кто-то предъявит за то, что нейрокой кодишь)

Любой в принципе можно, в настройках задается

Неправильно объяснил, без разницы, насколько тексты разнообразны. Там это как работает, если в деталях: есть фиксированный ключ, есть последние m токенов в тексте, дальше на основании этого ключа и последних токенов разбивают словарь на две примерно равные части, условно красную и зеленую. И следующий токен выбирают только из зеленой части. При выборе следующего токена раскраска меняется и как бы не получается, что всегда одни и те же токены выбирают.

А дальше на проверке, зная ключ и зная предыдущие токены просто смотрим из какой половины раскраски данный токен - зеленой или красной. И вот, если раз за разом на протяжении 10-20-30 токенов стабильно получается так, что токен всегда из зеленой части, очень похоже, что текст сгенерирован. Причем даже если какие-то слова в тексте менять, что-то выкидывать и т.д., все равно останется множество подпоследовательностей в которых эти зеленые токены будут идти подряд один за другим. Поэтому от ватермарки так сложно избавиться.

Добавил это объяснение в текст статьи, а то действительно не очень понятно, как это все так ловко работает.

А зачем обладать полной базой данных вероятностей для все моделей, температур и т.д.? Достаточно обладать информацией о распределении слов в обычном, не написанном ИИ тексте, их совместной встречаемости и т.д. И соответственно если вдруг встречаешь текст, в котором частота появления отдельных слов или их сочетаний резко отличается от нормальной - значит это вероятно нейрослоп.

Это я неправильную ссылку разместил) Сейчас все должно быть доступно.

потом будет блокировка AppStore

Не будет. У нас почти все чиновники и депутаты продукцией Apple пользуются. Уважаемым людям неудобства создавать это не комильфо, за это и по шапке получить можно.

Спасибо за комментарий! Применял, но на базовом уровне. Нужно было файнтюнить небольшую LLM на нескольких видеокартах. Там все обошлось обычным Data Parallelism, потому что все влезало с запасом на один GPU и даже приблизительный анализ показывал что там все будет Compute Bound даже при небольшом размере батча.

Да-да. Тот самый Свинцов, который регулярно постит поклонники которого регулярно постят в инсте и телеге всякое разное. Тот самый Свинцов, который уже почти месяц ничего не постил на своем канале с 53 подписчиками в замечательном мессенджере Max. Хотя казалось бы чего сложного - идешь по парковке, думаешь о том, что бы еще заблокировать, чтобы согражданам стало жить совсем хорошо, ну так и запости свои мысли об этом в единственном мессенджере, который там ловит. Вот этот вот Свинцов будет нам тут рассказывать, как хорошо будет от блокировок всего западного.

В Австралии неофициально начал действовать запрет на использование социальных сетей подростками — мера затронула более чем 20 млн человек.

Что-то тут не то, в Австралии всего живет 27 миллионов. Либо цифра завышена, либо у Австралии все ооочень хорошо с демографией)

Termfy и DocDecoder что-то подобное делают, можно их для этой задачи использовать.

Как выше писали, потом был стрим, на котором был отдельный цирк с конями. Туда позвали барышню-маркетолога, которая прямо говорила на стриме, что все, кто попал на эту подписку, это мамонты (лохи то есть) и что главный пострадавший это их контора, ведь это у них теперь будут убытки из-за репутационных потерь. Потом пришел директор, который до этого достал личные данные одного из блогеров и угрожал ему в личке отправкой на СВО. На стриме он заявил, что угрозы отправкой на СВО это шутка такая, а на вопрос, как он личные данные достал, ответил что-то в духе "Ребят, ну вы же все понимаете, вы же знаете, как подобные данные достаются".

Так что нет там никакой логики, они в каком-то в своем мире живут, в котором 90-е еще не закончились, а Мавроди стал президентом.

Все индивидуально очень, зависит от опыта, резюме и от того, на какие вакансии откликаешься. Но по моему опыту на НН конверсия больше раза в 3-4.

1

Информация

В рейтинге
433-й
Зарегистрирован
Активность