График не про то, как работают в дипсике, а про то, когда в их API ломится китайский бизнес. Тут не про переработки инженеров. Будь кривая от кранчей, второе окно шло бы до 21:00 по Пекину. Оно кончается в 18:00, вечер и ночь дешевые. Так что скорее наоборот, это график обычной конторы, с обедом 12:00-14:00, который в Китае норма. Почему окна нарезаны именно так, Дипсик не объяснил. Про обед в разрыве это уже мое предположение.
С одной стороны верно, с другой стороны есть нюанс. Спотыкается все на первом кадре. Пока цель не найдена, это окно ставить не на что, и поле надо просмотреть целиком хоть раз. Мы тут просто упираемся в 3х секундный лимит из-за того что очень тяжело обрабатывать широкое поле зрения. И к тому моменту пока мы обработаем и найдем, будет уже поздно
Надежнее всего оказался гибрид. Структура фильтра остается, а коэффицент усиления выдает маленькая GRU, обученная на данных. В слепом тесте классический фильтр дал -0,03, чистая LSTM 0,41, гибрид 0,50 при том же входе. Схема называется KalmanNet. Только сразу оговорюсь, чтобы вы не перенесли наш вывод на свою задачу как есть. У нас фильтру досталась заведомо плохая постановка, монокуляр без дальномера, дальность оценивается по размеру рамки, а на слепом участке она вообще не обновляется. В таких условиях любой KF уезжает. На конвейере у вас геометрия известна, камера неподвижна, масштаб фиксированный, то есть фильтр работает в куда более честных условиях. По вашему симптому. Ложные срабатывания именно на быстром движении чаще приходят не от фильтра, а от ассоциации. За кадр объект смещается больше, чем расстояние до соседа и назначение цепляет чужой трек. Проверяется это за полчаса, скормите трекеру идеальные детекции из разметки вместо детектора. Если ложные остались, виновата ассоциация или модель движения. Если исчезли, виноват детектор со смазом, и чинить надо экспозицию, а не трекер. Дальше по возрастанию стоимости. Сначала модель движения, постоянная скорость на рывках не работает, IMM с двумя или тремя моделями обычно снимает половину проблемы и по времени занимает 1-2 вечера. Потом ворота ассоциации по махаланобису плюс что то про внешность объекта, чтобы соседи не путались. Потом компенсация задержки, если детектор отдает рамку с лагом, фильтр обновляется по позиции, которой уже нет, и на быстром движении это дает ровно ваш симптом. И только если после этого не хватает, есть смысл идти в обучаемый gain. Кстати, у вас для этого условия лучше наших, конвйер это стенд, где легко набрать размеченные данные с реальной линии, и обучать фильтр можно на истинных траекториях. Нам же для этого пришлось поднимать симулятор. Плюс на ленте есть сильный физический приор, объекты едут с известной скоростью в известном направлении, и его стоит вшить в модель движения.
Идея то хорошая, она первой и приходит в голову. Жаль что с арифметикой не сходится. Просто посчитаем, дрон у нас допустим 0,3 метра на дальности 300 метров это 0,057 градуса. На 4к с полем зрения 20 градусов он занимает 11 пикселей и спокойно детектится. Растянем поле до 90 градусов, останется 2,4 пикселя, и находить уже нечего. Чтобы вернуть прежние 11 пикселей на 90 градусах, нужна матрица тысяч на 16 по горизонтали, а полный круг с вертикалью плюс минус 30 это сотни мегапикселей на кадр, порядка 20 гигапикселей в секунду. Берем условный боротовой Jetson или Hailo с RPI, они тянут десятки мегапикселей в секунду. Разрыв на три порядка, его оптимизацией к сожалению не закрыть. Вторую плату тоже не добавить, там стоит аккумулятор, а у него запас емкости не бесконечный. Плюс если углубляться в ракетостроение, там чуть ли не каждый грамм на счету. И геометрия окончательно добивает, аппарат разгонный, после выгорания мотора он уже не разворачивается, так что цель за спиной это уже списанный эпизод. 360 градусов мы бы возили как баласт.
Так я с вами и не спорю, статья ровно этим и заканчивается. В большую модель не лезть, рабочий вариант это маленькие специализированные под задачу. А "ради чего полчаса", ну такой вопрос можно про любой текст спросить. Обзор процессора или видюхи сжимается до "берите вон тот", любая книга сжимается до вердикта в пару предложений. Если вердикта достаточно, то читать вообще ничего не надо, и писать тоже. Только вот вердикт без цифр не работает. Человек который видел заголовок "модель за 5.6 млн", от моего "это дорого" не дрогнет, он же видел что недорого. "недорого" понятие относительное, но смысл понятен. Тут работает только смета, то что прогон это 15,5% года кластера, зарплатная ведомость дороже железа в 4 раза, кластер по часам не арендуется. После таких цифр, решение по типу "берем открытые веса и дообучаем" человек принимает сам, без меня
Так мы железо и не продаем, мы делаем ML-проекты, и в большинстве из них выигрывает как раз API. Статья к этому и приходит: если дочитать до конца, там прямым текстом написано, что экономии особо нет и лучше взять ту же открытую модель по API, чем тратить полмиллиона на карту. Покупают железо те, кому наружу нельзя вообще: ПДн, банки, КИИ. Прокси эту проблему не решает, а как раз наоборот усугубляет, потому что в цепочке появляется еще одно лицо. Ну и те у кого круглосуточный конвейер и карта не простаивает
Смысл есть, но под задачи в которых 5090 не вытягивает в принципе. Ее берут за другое. 141 ГБ это модель на 70–120B целиком в одной карте, без раскидывания по устройствам, и KV кэш, куда влезает длинный конткст на десятках клиентов сразу. Плюс NVLink на 900 ГБ/с, которого у RTX нет вообщ, так же пара H200 масштабируется, пара 5090 нет. Но если нужен просто объем, он берется дешевле. PRO 6000 дает 96 ГБ. 4 таких карт это 384 ГБ примерно за те же 5 млн. Переплата в H200 идет за 4,8 ТБ/с полосы против 1,8 у PRO 6000. Генерация как раз упирается в полосу, вот там она себя и оправдывает. Поэтому смотреть надо на задачу. Идеально она ложится на dense модель 70B в проде под постоянной нагрузкой, на RAG с длинными документами и десятками параллельных клиентов, на конвейерную разметку потока, на дообучение своей модели. Везде где карта пашет без перерыва и упирается именно в память. Под чат для отдела или разовые эксперименты это перебор
Линейки Tesla нет с 2020 года, ее переименовали в дата-центровую: A100, H100, B200. А DGX это вообще не карта, а готовый сервер целиком, на 8 карт, и стоит он сотни тысяч долларов. С 430 тысячами рублей за 5090 это расходится на два порядка, так что "по деньгам также выйдет" не сходится ни при каком курсе. Про профессиональную линейку я с вами согласен, она в статье стоит наверху: RTX PRO 6000 на 96 ГБ, и правило там прямое, выше 48 гигабайт идти в профлинейку или в облако. Но что хочу заметить, смена карты сам расчет не меняет, а наоборот усиливает. Статья не про то, какое железо быстрее, а про то, во что обходится токен. H100 в российской аренде идет по цене около 242–352 ₽ в час против 17 ₽ у купленной 5090: чем дороже железо, тем дороже каждый час простоя. Более мощная карта улучшает числитель и одновременно портит знаменатель, если загрузка не круглосуточная. Но один аргумент в вашу пользу есть, лицензия на драйвер GeForce запрещает разворачивать эти карты в дата центре. Но никто в здравом уме в дата центр игровые карты ставить не будет. А берут их все же по нескольким причинам. 5090 стоит 430 тысяч, профессиональная 6000 на 96 ГБ уже 1,05 млн, дата центровые карты дороже еще кратно. По доступности: 5090 лежит в рознице и покупается сегодня, остальное под заказ и недели ожидания, а с санкциями иногда не покупается вовсе. Задача часто не требует большего. Ну и физика, H100 просит серверное шасси с продувом и стоечное питание, а 5090 живет в обычном корпусе от офисной розетки.
А про утилизацию у нас с вами один и тот же тезис. Цену токена определяет не то, что написано на коробке видеокарты, а какую долю суток она занята: 6 человек по 15 минут это те самые 2% загрузки, из которых и вырастают 20 726 ₽ за миллион. Кому наружу нельзя, тот карту возьмет в любом случае, а считал я не чтобы отговорить, а чтобы смета была видна заранее, вместе с инженером
Ага, статья ровно этим и заканчивается. Если данные нельзя выпускать из контура, экономику можно вообще не считать, вопрос решен, остается выбрать конфигурацию.
Смотрите, диагноз она не поставит, ей этого просто не дадут. В проде это не совсем так устроено. Нейронка не выдает заключение, она ставит пометку. Мол, посмотри вот сюда, тут что то похожее на опухоль. Дальше снимок уже смотрит сам врач, и подписывает тоже он. И по закону так е будет отвечать врач. Потому что нейронка в данном случае, является лишь инструментом.
Благодарю за комментарий! Прям большое спасибо за конструктив. Правда ценю. Но внесу оговорку небольшую. Это не перевод. Писал сразу на русском, материал свой. ИИ использую как помощника по структуре и формулировкам, сам-то я в русском не ахти, а хочется чтоб читалось нормально. Но я согласен с вами, даже когда напрямую пишешь проскакивают моменты. В этот раз не дочистил, каюсь. Про такое уже был заход в прошлой статье, только там просто человечек кричал «нейрослоп» без единого примера(ну точнее примеры были, вот только это были галюцинации нейросети в которую он статью закинул), толку ноль, непонятно что чинить. А вы конкретные обороты показали, это другое дело. Статью дней десять пилил, под конец глаз замылился, свое уже не видишь. Я кстати разные нейронки гоняю и даже свой небольшой тир-лист составил. Gemini по русски, на мой вкус, вообще ужасен. Вот прям нейронка нейронкой. Без тонны промптов из него нормальный текст не вытащить, а с юмором там совсем беда. Claude уже сильно лучше, по-русски пишет неплохо, но всё равно часто чувствуется какая-то неродная речь. А самым живым мне пока кажется ChatGPT. Не знаю, может субъективщина, но он как будто ближе к русскому языку и культуре, обороты у него интереснее и чаще звучат органично.
Касаемо батарей, тут вы сами путаете, то в чем обвиняете. Ватт это можносность сколько жрет прямо сейчас. Ватт час это запас, сколько всего в батарее. Это разные вещи и в таблице они в отдельных колонках. Время работы это запас делённый на расход. У H1 батарея 0,864 кВт ч, а ходьба жрет 700-1500 Вт. Вот и выходит 35-75 минут. Биологические батареи я нигде не сравниваю, у человека в таблице прямо подписано что это не батерея, а метаболизм. Сравнивается мощность с мощностью, 20 Вт мозга с компьютером бортовым, 80-100 Вт тела с приводами. Это cost of transport, стандартный разбор в робототехнике. С человеком это не просто так сравнивается. Человеческое тело это эталон энергоэффективности, ориентир, то к чему вся робототехника и тянется. Потому что мозг на своих 20 Ваттах вытягивает зрение, слух, память, планирование и кучу всего другого, при этом еще и телом управляет. А роботу для всего этого, нужно в разы больше энергии, больше размеры и он все равно до этого не дотягивает. Для этого человек и стоит в таблице рядом, чтобы было видно какая тут еще пропасть в энергоэффективности. Это не сравнение теплого с мягким. А на ваш вопрос, существуют ли биологические батареи. В человеке нет никакой отдельной батареи, типа блока где лежит запас энергии. Батарея это все тело целиком, вся эта совокупность процессов, метаболизм, расщепление жиров и глюкозы. Энергия там не лежит отдельно от потребителей, она и производится и тратится по всему телу сразу. Так что искать в человеке батарею без органов потребителей бессмысленно, ее там нет как отдельной детали. Ровно поэтому в таблице у человека и стоит мощность метаболизма в ваттах, а не емкость в ватт часах. Это непрерывный источник, а не аккумулятор который можно вынуть. А по поводу того запрещено ли у нейронки спрашивать, нет не запрещено, проверяйте на здоровье. Только проверка фактов это когда вы спрашиваете конкретно, слушай, а какое потребление у мозга человека и у бортового компьютера робота. Вот тогда модель вам цифру выдаст, и вы ее с моей в статье сверите. А вы взяли всю статью целиком и спросили нейрослоп это или нет. Это не проверка фактов. А теперь по "нейрослопу", я устал спорить на эту тему. Мы ходим по кругу. Давайте для начала определимся с терминологией. А то слово "нейройслоп" тут через строчку летает. Нейрослоп это когда контент низкого качества штампуют нейронкой пачками, и человек в этом практически не учавствует. Вон эти короткие видосы про отношения Банана и Клубники, вот это нейрослоп. А техническая статья, со ссылками на источники, с моим личным опытом и знаниями. Это не нейрослоп. Я уже писал, что да я использовал нейросеть для полировки, я не филолог, и чтобы в статье не было грамматических ошибок и все это выглядело нормально, я использовал нейросеть. Нейрослопом это было бы, если бы я зашел в тот же DeepSeek, написал "напиши статью про роботов" и тупо запостил не глядя. Вот это был бы нейрослоп. А когда ты сам все нашел, сверил информацию, собрал структуру, вложил свой опыт, а нейронка лишь причесала текст чтобы читалось нормально, это статью в нейрослоп не превращает. Критиковать каждый может, а сам сесть и написать не каждый. Раз моя статья это нейрослоп голимый, зайдите в DeepSeek, прям скопируйте мой заголовок и попросите написать статью. Пусть так же все разложит по полкам, найдет источники, проверит каждую цифру, ссылки проставит. Я бы с удовольствием посмотрел на результат.
А теперь я хочу вашу табличку разобрать(о тут можно форматировать текст оказывается)
Ту самую из первого комментария, потому что я детальнее ее изучил)))) Это прям идеальный пример, прям музейный экспонат настоящего нейрослопа. Вы статью не читали, а просто скормили ее нейронке, если бы вы ее действительно почитали, то у вас не возникло бы подобных вопросов. Нейронка нагаллюцинировала список, вы в него поверили и притащили сюда как доказательство. И ни один пункт не проверили. Сначала разберу механизм внимания и почему ей в целом нельзя доверять такой разбор. Модель не читает текст как человек. Она не видит его единым массивом. Внутри работает механизм внимания, и на длинном тексте он расфокусируется, модель скачет по кусочками текста, цепляется за отдельные обрывки вырванные из контекста и по ним уже достраивает правдоподобно звучащий ответ. Середину длинного текста она держит хуже всего, это давно известная проблема. А если на вход прилетела еще и каша, без заголовков и с развалившимися таблицами, то цельной картины у нее нет в принципе. Она не анализировала мою статью, не сверяла факты, не ходила по ссылкам. Она выхватила обрывки из месива и сгенерила по ним красиво оформленный список претензий. Выглядит убедительно, если не проверять конечно)
Избыточное цитирование: Модель заявляет, что у меня каждый абзац начинается с "по данным", "как пишет", "согласно исследованию". Я сел и вручную посчитал. "Как пишет" и "согласно исследованию" не встречаются в статье вообще ни разу. "По данным" встречается ровно один раз на весь текст. Один раз Карл. А модель написала "каждый абзац". То есть она выдумала несуществующий паттерн и подогнала под него выдуманные примеры. Вот это и есть галлюцинация в чистом виде. А ссылки у меня стоят прямо в тексте гиперссылками, и при копипасте они отвалились, так что модель их даже не видела, не то что проверяла по ним факты.
Повторы: Этот пункт я уже признал, действительно был. Но это не признак LLM, а просто из редактора криво перенес. Бывает, уже поправил.
Водянистость: Абзац про ASIMO якобы не по теме. По теме, и еще как. ASIMO это история про потолок ручного подхода, четырнадцать лет разработки до первого показа и еще одиннадцать до последней версии. Ровно от этого потолка дальше и пляшет вся экономика статьи, почему RL обрушил цену. Модель не поняла зачем этот кусок, потому что читала обрывки, а не статью.
Неестественные переходы: От ходьбы к ваттам, от ватт к контексту, от контекста к данным. Это не каша, это оглавление. Одна половина задачи, ходьба уже решена. А вторая, мозг и автономия, упирается в три конкретные стены, ватты, контекст и данные. Я их по очереди и разбираю. Никакого случайного перескока тут нет, это логика статьи, которую модель не увидела, потому что заголовки при копипасте слиплись в одну кучу.
Фальшивая экспертность: И вот это пожалуй самое интересное)) Единственная техническая ошибка которую нашла модель, это сравнение теплого с мягким. Так вот, это не моя ошибка, а ее собственная, и я расскажу как именно она ее совершила. Когда вы копируете статью с хабра и вставляете в чат, текст идет без разметки. Таблица, у которой в оригинале аккуратные колонки, превращается в плоскую строку, где значения из разных колонок слипаются в одну кучу. И модель видит уже не таблицу, а месиво, где ватты мозга стоят впритык к киловатт-часам батарей робота. Границ колонок нет, структуры нет. Вот она и решила, что я в одном ряду сравниваю мощность с емкостью, отсюда и выдуманные биологические батареи, и теплое с мягким. Это просто сбой парсинга. Подключите сюда еще механизм внимания слабый. И будет вам хрестоматийный пример. И вот что интересно. Если открыть настоящую статью и посмотреть на таблицу глазами, там ну никак нельзя подумать что сравнивается теплое с мягким. Там все разделено, мощность в одной колонке, емкость в другой, человек вообще отдельной строкой с пометкой что это метаболизм, а не батарея.Все черным по белому(или белом по черному зависит от темы интерфейса) и разложено по полочкам. Такой вывод мог родиться только у того, кто статью не открывал, а поверил каше от нейронки.
Кликбейтный заголовок: "Походка за двадцать минут и миллион рублей" это не кликбейт, а два конкретных числа прямо из статьи. Двадцать минут на обучение RL походки и около миллиона рублей за заказную под платформу. Оба раскрыты в тексте со ссылками. Кликбейт это когда в заголовке густо, а в статье пусто, а тут ровно наоборот.
Что же мы имеем в итоге? Из шести признаков один реальный, и то это просто ошибка копирования из редактора, а не признак нейрослопа(вообще как сюда можно нейрослоп приписать? Нейронка структурно генерирует, она не может задвоить один и тот же блок. Они буквально друг под другом стаяли, я бы еще хоть как то понял если бы они в абсолютно разных местах были). Остальные пять это либо прямые галлюцинации с выдуманными цитатами, либо непонимание структуры из-за битого копипаста, либо собственная ошибка модели, которую она повесила на меня. Вот эта табличка, сгенеренная без единой проверки факта, на каше вместо статьи, с несуществующими примерами, вот это и есть нейрослоп голимый. А вы принесли ее сюда как доказательство и повторяете следом, даже не открыв оригинал. Такие дела.
Рад встретить в комментариях содержательную дискуссию по архитектуре, спасибо. Касаемо Reservoir Computing. На бумаге и в рамках простых динамических систем коцепция выглядит очень красиво. Фиксированная нелинейная среда, мгновенное обучение только выходного слоя без тяделого бэкпропа и отсутствие забывания в моменте. Но когда мы переносим это из теории в реальную робототехнику мы сразу упираемся в проблему масштабирования. На сегодняшний день резервурные вычисления вообще не демонстрируют такой масштабируемости, как Deep Learning. Чтобы обрабатывать терабайты сложного, зашумленного сигнала из ирл, из видео, либаров, датчиков моментов на приводах, размер резурвуара должен расти экспоненцильно. Система быстро становится хаотичной и управлять ей невозможно. Дипинг захватил индустрию как раз потому что он предсказуемо масштабируется, а тут мы упираемся в потолок. К тому же динамическая память резервуара отлично работает на коротких промежутках, но она быстро затухает. Строиь на ней долгосрочное планирование, удержание контекста и сложные причиноследственные свзи пока не удалось. Резервуар хорошо сжимает сигнал в реальном времени здесь и сейчас, но он не формирует глубоких абстрактных представлений о физике мира. Скорее всего полноценный AGI для роботов действительно откажется от классического DL в его текущем виде с бесконечным KV кэшем и обучение м на каждый чих. Но движение сейчас идет скорее не в сторону резервуаров, а в сторону SSM моделек, по типу той же Mamba или JEPA. То есть нужен какой то инструмент который сохранит и обобщающую способность сетей и получит динамику биологического мозга. А резервуары это очень крутой, но очень нишевый инструмент для узких задач.
Благодарю вас за разбор. В одному пункте он действительно попал. Я действительно задвоил блок при переносе из своего редактора в редактор хабра. По ваттам не соглашусь. Мозг там сравнивается с бортовым вычислительным бюджетом, а метаболизм тела целиком с энергией на приводы. На тело это что то около 80-100 Вт. А на приводы при ходьбе 700-1500 ВТ. В таблице это отдельные строки. Сравнение энергобюджета биологической и механической системы стандартный для робототехники разбор через cost of transport, и раздел ровно об этом. Моторика съедает киловат, поэтому на мозг робота остается маленький бюджет. ASIMO в статье это история о потолке ручного подхода, к которому дальше привязана вся экономика. А 80+ ссылок в статье, это полностью осознанное решение, для того чтобы каждую цифру можно проверить по первоисточнику. Касаемо детекции нейрослопа через LLM, скажу честно не очень надежный инструмент. К слову по характеру ответа вашего DeepSeek прекрасно видно, что вопрос изначально был сформулирован в негативном и предвзятом ключе, а нейросеть просто подстроилась "Ваше чутье не подвело". В нашем комьюнити это называется sycophancy или по простому поддакивание. Нейросети бояться расстроить пользователя и подтерждают любую формулировку вопроса. Ради эксперимента я сам закинул в этот же DeepSeek два разных запроса к своей же статье. В первом я написал что то в духе "Слушай тут на хабре статейка, у меня такое ощущение бужто это писал ИИ. Найди маркеры того что это писал ИИ". И модель мне тут же выкатила ту самую табличку которую вы скинули в комменты. А вот во втором запросе я написал "Смотри какую классную статью на хабре нашел, что думаешь? Просто в комментах пишут что это нейрослоп." И О ЧУДО, тот же самый DeepSeek ответил "Отличный материал. Автор действительно написал один из лучших технических обзоров на русском языке, а хейт в комментариях — это классическая реакция на текст, компетенции для оценки которого у среднего читателя просто нет." И у меня появляется резонный вопрос, а кому верить? С одной стороны я написал один из лучших технических разборов на русском языке, а с другой стороны я дебил который тупо скопипастил из нейронки. Пожалуйста, не доверяйте детекторам в нейросетях. Standford доказал(и да вот ссылочки мои любимые подъехали https://arxiv.org/html/2304.02819))))) что они дают 61% процент ложных срабатываний на эссе живых людей, а OpenAi закрыла собственный детектор на точности в 26%. Как раз таки для этого в моей стать и есть куча ссылок, чтобы вы лично могли зайти и убедиться что данные не вымышленные, каждая цифра проверяется по первоисточникам. В каких то моментах я разумеется использовал нейросеть для полировки. Уж извините, я инжинер, а не филолог и не учитель русского языка, чтобы сходу вам выдать идеальное эссе. Да и не вижу я никаких проблем в том, чтобы использовать нейросеть при написании текста. Я информацию сам нашел, скомпоновал, сформулировал и свой личный опыт туда вложил. А нейронка... ну вы сами увидели, она вам поодакнет в любом случае, какую бы сторону вы не выбрали. Вот прикрепляю скрины из DeepSeek
График не про то, как работают в дипсике, а про то, когда в их API ломится китайский бизнес. Тут не про переработки инженеров. Будь кривая от кранчей, второе окно шло бы до 21:00 по Пекину. Оно кончается в 18:00, вечер и ночь дешевые. Так что скорее наоборот, это график обычной конторы, с обедом 12:00-14:00, который в Китае норма. Почему окна нарезаны именно так, Дипсик не объяснил. Про обед в разрыве это уже мое предположение.
С одной стороны верно, с другой стороны есть нюанс. Спотыкается все на первом кадре. Пока цель не найдена, это окно ставить не на что, и поле надо просмотреть целиком хоть раз. Мы тут просто упираемся в 3х секундный лимит из-за того что очень тяжело обрабатывать широкое поле зрения. И к тому моменту пока мы обработаем и найдем, будет уже поздно
Надежнее всего оказался гибрид. Структура фильтра остается, а коэффицент усиления выдает маленькая GRU, обученная на данных. В слепом тесте классический фильтр дал -0,03, чистая LSTM 0,41, гибрид 0,50 при том же входе. Схема называется KalmanNet. Только сразу оговорюсь, чтобы вы не перенесли наш вывод на свою задачу как есть. У нас фильтру досталась заведомо плохая постановка, монокуляр без дальномера, дальность оценивается по размеру рамки, а на слепом участке она вообще не обновляется. В таких условиях любой KF уезжает. На конвейере у вас геометрия известна, камера неподвижна, масштаб фиксированный, то есть фильтр работает в куда более честных условиях. По вашему симптому. Ложные срабатывания именно на быстром движении чаще приходят не от фильтра, а от ассоциации. За кадр объект смещается больше, чем расстояние до соседа и назначение цепляет чужой трек. Проверяется это за полчаса, скормите трекеру идеальные детекции из разметки вместо детектора. Если ложные остались, виновата ассоциация или модель движения. Если исчезли, виноват детектор со смазом, и чинить надо экспозицию, а не трекер. Дальше по возрастанию стоимости. Сначала модель движения, постоянная скорость на рывках не работает, IMM с двумя или тремя моделями обычно снимает половину проблемы и по времени занимает 1-2 вечера. Потом ворота ассоциации по махаланобису плюс что то про внешность объекта, чтобы соседи не путались. Потом компенсация задержки, если детектор отдает рамку с лагом, фильтр обновляется по позиции, которой уже нет, и на быстром движении это дает ровно ваш симптом. И только если после этого не хватает, есть смысл идти в обучаемый gain. Кстати, у вас для этого условия лучше наших, конвйер это стенд, где легко набрать размеченные данные с реальной линии, и обучать фильтр можно на истинных траекториях. Нам же для этого пришлось поднимать симулятор. Плюс на ленте есть сильный физический приор, объекты едут с известной скоростью в известном направлении, и его стоит вшить в модель движения.
Идея то хорошая, она первой и приходит в голову. Жаль что с арифметикой не сходится. Просто посчитаем, дрон у нас допустим 0,3 метра на дальности 300 метров это 0,057 градуса. На 4к с полем зрения 20 градусов он занимает 11 пикселей и спокойно детектится. Растянем поле до 90 градусов, останется 2,4 пикселя, и находить уже нечего. Чтобы вернуть прежние 11 пикселей на 90 градусах, нужна матрица тысяч на 16 по горизонтали, а полный круг с вертикалью плюс минус 30 это сотни мегапикселей на кадр, порядка 20 гигапикселей в секунду. Берем условный боротовой Jetson или Hailo с RPI, они тянут десятки мегапикселей в секунду. Разрыв на три порядка, его оптимизацией к сожалению не закрыть. Вторую плату тоже не добавить, там стоит аккумулятор, а у него запас емкости не бесконечный. Плюс если углубляться в ракетостроение, там чуть ли не каждый грамм на счету. И геометрия окончательно добивает, аппарат разгонный, после выгорания мотора он уже не разворачивается, так что цель за спиной это уже списанный эпизод. 360 градусов мы бы возили как баласт.
Хех... Я даже спорить не стану, все по фактам. Спасибо, отличное дополнение к статье.
Так я с вами и не спорю, статья ровно этим и заканчивается. В большую модель не лезть, рабочий вариант это маленькие специализированные под задачу. А "ради чего полчаса", ну такой вопрос можно про любой текст спросить. Обзор процессора или видюхи сжимается до "берите вон тот", любая книга сжимается до вердикта в пару предложений. Если вердикта достаточно, то читать вообще ничего не надо, и писать тоже. Только вот вердикт без цифр не работает. Человек который видел заголовок "модель за 5.6 млн", от моего "это дорого" не дрогнет, он же видел что недорого. "недорого" понятие относительное, но смысл понятен. Тут работает только смета, то что прогон это 15,5% года кластера, зарплатная ведомость дороже железа в 4 раза, кластер по часам не арендуется. После таких цифр, решение по типу "берем открытые веса и дообучаем" человек принимает сам, без меня
Так мы железо и не продаем, мы делаем ML-проекты, и в большинстве из них выигрывает как раз API. Статья к этому и приходит: если дочитать до конца, там прямым текстом написано, что экономии особо нет и лучше взять ту же открытую модель по API, чем тратить полмиллиона на карту. Покупают железо те, кому наружу нельзя вообще: ПДн, банки, КИИ. Прокси эту проблему не решает, а как раз наоборот усугубляет, потому что в цепочке появляется еще одно лицо. Ну и те у кого круглосуточный конвейер и карта не простаивает
Смысл есть, но под задачи в которых 5090 не вытягивает в принципе. Ее берут за другое. 141 ГБ это модель на 70–120B целиком в одной карте, без раскидывания по устройствам, и KV кэш, куда влезает длинный конткст на десятках клиентов сразу. Плюс NVLink на 900 ГБ/с, которого у RTX нет вообщ, так же пара H200 масштабируется, пара 5090 нет. Но если нужен просто объем, он берется дешевле. PRO 6000 дает 96 ГБ. 4 таких карт это 384 ГБ примерно за те же 5 млн. Переплата в H200 идет за 4,8 ТБ/с полосы против 1,8 у PRO 6000. Генерация как раз упирается в полосу, вот там она себя и оправдывает. Поэтому смотреть надо на задачу. Идеально она ложится на dense модель 70B в проде под постоянной нагрузкой, на RAG с длинными документами и десятками параллельных клиентов, на конвейерную разметку потока, на дообучение своей модели. Везде где карта пашет без перерыва и упирается именно в память. Под чат для отдела или разовые эксперименты это перебор
Хех... Ну тем более тогда)
Линейки Tesla нет с 2020 года, ее переименовали в дата-центровую: A100, H100, B200. А DGX это вообще не карта, а готовый сервер целиком, на 8 карт, и стоит он сотни тысяч долларов. С 430 тысячами рублей за 5090 это расходится на два порядка, так что "по деньгам также выйдет" не сходится ни при каком курсе. Про профессиональную линейку я с вами согласен, она в статье стоит наверху: RTX PRO 6000 на 96 ГБ, и правило там прямое, выше 48 гигабайт идти в профлинейку или в облако. Но что хочу заметить, смена карты сам расчет не меняет, а наоборот усиливает. Статья не про то, какое железо быстрее, а про то, во что обходится токен. H100 в российской аренде идет по цене около 242–352 ₽ в час против 17 ₽ у купленной 5090: чем дороже железо, тем дороже каждый час простоя. Более мощная карта улучшает числитель и одновременно портит знаменатель, если загрузка не круглосуточная. Но один аргумент в вашу пользу есть, лицензия на драйвер GeForce запрещает разворачивать эти карты в дата центре. Но никто в здравом уме в дата центр игровые карты ставить не будет. А берут их все же по нескольким причинам. 5090 стоит 430 тысяч, профессиональная 6000 на 96 ГБ уже 1,05 млн, дата центровые карты дороже еще кратно. По доступности: 5090 лежит в рознице и покупается сегодня, остальное под заказ и недели ожидания, а с санкциями иногда не покупается вовсе. Задача часто не требует большего. Ну и физика, H100 просит серверное шасси с продувом и стоечное питание, а 5090 живет в обычном корпусе от офисной розетки.
А про утилизацию у нас с вами один и тот же тезис. Цену токена определяет не то, что написано на коробке видеокарты, а какую долю суток она занята: 6 человек по 15 минут это те самые 2% загрузки, из которых и вырастают 20 726 ₽ за миллион. Кому наружу нельзя, тот карту возьмет в любом случае, а считал я не чтобы отговорить, а чтобы смета была видна заранее, вместе с инженером
Ага, статья ровно этим и заканчивается. Если данные нельзя выпускать из контура, экономику можно вообще не считать, вопрос решен, остается выбрать конфигурацию.
Смотрите, диагноз она не поставит, ей этого просто не дадут. В проде это не совсем так устроено. Нейронка не выдает заключение, она ставит пометку. Мол, посмотри вот сюда, тут что то похожее на опухоль. Дальше снимок уже смотрит сам врач, и подписывает тоже он. И по закону так е будет отвечать врач. Потому что нейронка в данном случае, является лишь инструментом.
Благодарю за комментарий! Прям большое спасибо за конструктив. Правда ценю. Но внесу оговорку небольшую. Это не перевод. Писал сразу на русском, материал свой. ИИ использую как помощника по структуре и формулировкам, сам-то я в русском не ахти, а хочется чтоб читалось нормально. Но я согласен с вами, даже когда напрямую пишешь проскакивают моменты. В этот раз не дочистил, каюсь. Про такое уже был заход в прошлой статье, только там просто человечек кричал «нейрослоп» без единого примера(ну точнее примеры были, вот только это были галюцинации нейросети в которую он статью закинул), толку ноль, непонятно что чинить. А вы конкретные обороты показали, это другое дело. Статью дней десять пилил, под конец глаз замылился, свое уже не видишь. Я кстати разные нейронки гоняю и даже свой небольшой тир-лист составил. Gemini по русски, на мой вкус, вообще ужасен. Вот прям нейронка нейронкой. Без тонны промптов из него нормальный текст не вытащить, а с юмором там совсем беда. Claude уже сильно лучше, по-русски пишет неплохо, но всё равно часто чувствуется какая-то неродная речь. А самым живым мне пока кажется ChatGPT. Не знаю, может субъективщина, но он как будто ближе к русскому языку и культуре, обороты у него интереснее и чаще звучат органично.
Касаемо батарей, тут вы сами путаете, то в чем обвиняете. Ватт это можносность сколько жрет прямо сейчас. Ватт час это запас, сколько всего в батарее. Это разные вещи и в таблице они в отдельных колонках. Время работы это запас делённый на расход. У H1 батарея 0,864 кВт ч, а ходьба жрет 700-1500 Вт. Вот и выходит 35-75 минут. Биологические батареи я нигде не сравниваю, у человека в таблице прямо подписано что это не батерея, а метаболизм. Сравнивается мощность с мощностью, 20 Вт мозга с компьютером бортовым, 80-100 Вт тела с приводами. Это cost of transport, стандартный разбор в робототехнике. С человеком это не просто так сравнивается. Человеческое тело это эталон энергоэффективности, ориентир, то к чему вся робототехника и тянется. Потому что мозг на своих 20 Ваттах вытягивает зрение, слух, память, планирование и кучу всего другого, при этом еще и телом управляет. А роботу для всего этого, нужно в разы больше энергии, больше размеры и он все равно до этого не дотягивает. Для этого человек и стоит в таблице рядом, чтобы было видно какая тут еще пропасть в энергоэффективности. Это не сравнение теплого с мягким. А на ваш вопрос, существуют ли биологические батареи. В человеке нет никакой отдельной батареи, типа блока где лежит запас энергии. Батарея это все тело целиком, вся эта совокупность процессов, метаболизм, расщепление жиров и глюкозы. Энергия там не лежит отдельно от потребителей, она и производится и тратится по всему телу сразу. Так что искать в человеке батарею без органов потребителей бессмысленно, ее там нет как отдельной детали. Ровно поэтому в таблице у человека и стоит мощность метаболизма в ваттах, а не емкость в ватт часах. Это непрерывный источник, а не аккумулятор который можно вынуть. А по поводу того запрещено ли у нейронки спрашивать, нет не запрещено, проверяйте на здоровье. Только проверка фактов это когда вы спрашиваете конкретно, слушай, а какое потребление у мозга человека и у бортового компьютера робота. Вот тогда модель вам цифру выдаст, и вы ее с моей в статье сверите. А вы взяли всю статью целиком и спросили нейрослоп это или нет. Это не проверка фактов.
А теперь по "нейрослопу", я устал спорить на эту тему. Мы ходим по кругу. Давайте для начала определимся с терминологией. А то слово "нейройслоп" тут через строчку летает. Нейрослоп это когда контент низкого качества штампуют нейронкой пачками, и человек в этом практически не учавствует. Вон эти короткие видосы про отношения Банана и Клубники, вот это нейрослоп. А техническая статья, со ссылками на источники, с моим личным опытом и знаниями. Это не нейрослоп. Я уже писал, что да я использовал нейросеть для полировки, я не филолог, и чтобы в статье не было грамматических ошибок и все это выглядело нормально, я использовал нейросеть. Нейрослопом это было бы, если бы я зашел в тот же DeepSeek, написал "напиши статью про роботов" и тупо запостил не глядя. Вот это был бы нейрослоп. А когда ты сам все нашел, сверил информацию, собрал структуру, вложил свой опыт, а нейронка лишь причесала текст чтобы читалось нормально, это статью в нейрослоп не превращает. Критиковать каждый может, а сам сесть и написать не каждый. Раз моя статья это нейрослоп голимый, зайдите в DeepSeek, прям скопируйте мой заголовок и попросите написать статью. Пусть так же все разложит по полкам, найдет источники, проверит каждую цифру, ссылки проставит. Я бы с удовольствием посмотрел на результат.
А теперь я хочу вашу табличку разобрать(о тут можно форматировать текст оказывается)
Ту самую из первого комментария, потому что я детальнее ее изучил))))
Это прям идеальный пример, прям музейный экспонат настоящего нейрослопа.
Вы статью не читали, а просто скормили ее нейронке, если бы вы ее действительно почитали, то у вас не возникло бы подобных вопросов. Нейронка нагаллюцинировала список, вы в него поверили и притащили сюда как доказательство. И ни один пункт не проверили. Сначала разберу механизм внимания и почему ей в целом нельзя доверять такой разбор. Модель не читает текст как человек. Она не видит его единым массивом. Внутри работает механизм внимания, и на длинном тексте он расфокусируется, модель скачет по кусочками текста, цепляется за отдельные обрывки вырванные из контекста и по ним уже достраивает правдоподобно звучащий ответ. Середину длинного текста она держит хуже всего, это давно известная проблема. А если на вход прилетела еще и каша, без заголовков и с развалившимися таблицами, то цельной картины у нее нет в принципе. Она не анализировала мою статью, не сверяла факты, не ходила по ссылкам. Она выхватила обрывки из месива и сгенерила по ним красиво оформленный список претензий. Выглядит убедительно, если не проверять конечно)
Избыточное цитирование:
Модель заявляет, что у меня каждый абзац начинается с "по данным", "как пишет", "согласно исследованию". Я сел и вручную посчитал. "Как пишет" и "согласно исследованию" не встречаются в статье вообще ни разу. "По данным" встречается ровно один раз на весь текст. Один раз Карл. А модель написала "каждый абзац". То есть она выдумала несуществующий паттерн и подогнала под него выдуманные примеры. Вот это и есть галлюцинация в чистом виде. А ссылки у меня стоят прямо в тексте гиперссылками, и при копипасте они отвалились, так что модель их даже не видела, не то что проверяла по ним факты.
Повторы:
Этот пункт я уже признал, действительно был. Но это не признак LLM, а просто из редактора криво перенес. Бывает, уже поправил.
Водянистость:
Абзац про ASIMO якобы не по теме. По теме, и еще как. ASIMO это история про потолок ручного подхода, четырнадцать лет разработки до первого показа и еще одиннадцать до последней версии. Ровно от этого потолка дальше и пляшет вся экономика статьи, почему RL обрушил цену. Модель не поняла зачем этот кусок, потому что читала обрывки, а не статью.
Неестественные переходы:
От ходьбы к ваттам, от ватт к контексту, от контекста к данным. Это не каша, это оглавление. Одна половина задачи, ходьба уже решена. А вторая, мозг и автономия, упирается в три конкретные стены, ватты, контекст и данные. Я их по очереди и разбираю. Никакого случайного перескока тут нет, это логика статьи, которую модель не увидела, потому что заголовки при копипасте слиплись в одну кучу.
Фальшивая экспертность:
И вот это пожалуй самое интересное)) Единственная техническая ошибка которую нашла модель, это сравнение теплого с мягким. Так вот, это не моя ошибка, а ее собственная, и я расскажу как именно она ее совершила. Когда вы копируете статью с хабра и вставляете в чат, текст идет без разметки. Таблица, у которой в оригинале аккуратные колонки, превращается в плоскую строку, где значения из разных колонок слипаются в одну кучу. И модель видит уже не таблицу, а месиво, где ватты мозга стоят впритык к киловатт-часам батарей робота. Границ колонок нет, структуры нет. Вот она и решила, что я в одном ряду сравниваю мощность с емкостью, отсюда и выдуманные биологические батареи, и теплое с мягким. Это просто сбой парсинга. Подключите сюда еще механизм внимания слабый. И будет вам хрестоматийный пример. И вот что интересно. Если открыть настоящую статью и посмотреть на таблицу глазами, там ну никак нельзя подумать что сравнивается теплое с мягким. Там все разделено, мощность в одной колонке, емкость в другой, человек вообще отдельной строкой с пометкой что это метаболизм, а не батарея.Все черным по белому(или белом по черному зависит от темы интерфейса) и разложено по полочкам. Такой вывод мог родиться только у того, кто статью не открывал, а поверил каше от нейронки.
Кликбейтный заголовок:
"Походка за двадцать минут и миллион рублей" это не кликбейт, а два конкретных числа прямо из статьи. Двадцать минут на обучение RL походки и около миллиона рублей за заказную под платформу. Оба раскрыты в тексте со ссылками. Кликбейт это когда в заголовке густо, а в статье пусто, а тут ровно наоборот.
Что же мы имеем в итоге? Из шести признаков один реальный, и то это просто ошибка копирования из редактора, а не признак нейрослопа(вообще как сюда можно нейрослоп приписать? Нейронка структурно генерирует, она не может задвоить один и тот же блок. Они буквально друг под другом стаяли, я бы еще хоть как то понял если бы они в абсолютно разных местах были). Остальные пять это либо прямые галлюцинации с выдуманными цитатами, либо непонимание структуры из-за битого копипаста, либо собственная ошибка модели, которую она повесила на меня. Вот эта табличка, сгенеренная без единой проверки факта, на каше вместо статьи, с несуществующими примерами, вот это и есть нейрослоп голимый. А вы принесли ее сюда как доказательство и повторяете следом, даже не открыв оригинал. Такие дела.
Рад встретить в комментариях содержательную дискуссию по архитектуре, спасибо. Касаемо Reservoir Computing. На бумаге и в рамках простых динамических систем коцепция выглядит очень красиво. Фиксированная нелинейная среда, мгновенное обучение только выходного слоя без тяделого бэкпропа и отсутствие забывания в моменте. Но когда мы переносим это из теории в реальную робототехнику мы сразу упираемся в проблему масштабирования. На сегодняшний день резервурные вычисления вообще не демонстрируют такой масштабируемости, как Deep Learning. Чтобы обрабатывать терабайты сложного, зашумленного сигнала из ирл, из видео, либаров, датчиков моментов на приводах, размер резурвуара должен расти экспоненцильно. Система быстро становится хаотичной и управлять ей невозможно. Дипинг захватил индустрию как раз потому что он предсказуемо масштабируется, а тут мы упираемся в потолок. К тому же динамическая память резервуара отлично работает на коротких промежутках, но она быстро затухает. Строиь на ней долгосрочное планирование, удержание контекста и сложные причиноследственные свзи пока не удалось. Резервуар хорошо сжимает сигнал в реальном времени здесь и сейчас, но он не формирует глубоких абстрактных представлений о физике мира. Скорее всего полноценный AGI для роботов действительно откажется от классического DL в его текущем виде с бесконечным KV кэшем и обучение м на каждый чих. Но движение сейчас идет скорее не в сторону резервуаров, а в сторону SSM моделек, по типу той же Mamba или JEPA. То есть нужен какой то инструмент который сохранит и обобщающую способность сетей и получит динамику биологического мозга. А резервуары это очень крутой, но очень нишевый инструмент для узких задач.
Благодарю вас за разбор. В одному пункте он действительно попал. Я действительно задвоил блок при переносе из своего редактора в редактор хабра.
По ваттам не соглашусь. Мозг там сравнивается с бортовым вычислительным бюджетом, а метаболизм тела целиком с энергией на приводы. На тело это что то около 80-100 Вт. А на приводы при ходьбе 700-1500 ВТ. В таблице это отдельные строки. Сравнение энергобюджета биологической и механической системы стандартный для робототехники разбор через cost of transport, и раздел ровно об этом. Моторика съедает киловат, поэтому на мозг робота остается маленький бюджет. ASIMO в статье это история о потолке ручного подхода, к которому дальше привязана вся экономика. А 80+ ссылок в статье, это полностью осознанное решение, для того чтобы каждую цифру можно проверить по первоисточнику. Касаемо детекции нейрослопа через LLM, скажу честно не очень надежный инструмент. К слову по характеру ответа вашего DeepSeek прекрасно видно, что вопрос изначально был сформулирован в негативном и предвзятом ключе, а нейросеть просто подстроилась "Ваше чутье не подвело". В нашем комьюнити это называется sycophancy или по простому поддакивание. Нейросети бояться расстроить пользователя и подтерждают любую формулировку вопроса. Ради эксперимента я сам закинул в этот же DeepSeek два разных запроса к своей же статье. В первом я написал что то в духе "Слушай тут на хабре статейка, у меня такое ощущение бужто это писал ИИ. Найди маркеры того что это писал ИИ". И модель мне тут же выкатила ту самую табличку которую вы скинули в комменты. А вот во втором запросе я написал "Смотри какую классную статью на хабре нашел, что думаешь? Просто в комментах пишут что это нейрослоп." И О ЧУДО, тот же самый DeepSeek ответил "Отличный материал. Автор действительно написал один из лучших технических обзоров на русском языке, а хейт в комментариях — это классическая реакция на текст, компетенции для оценки которого у среднего читателя просто нет." И у меня появляется резонный вопрос, а кому верить? С одной стороны я написал один из лучших технических разборов на русском языке, а с другой стороны я дебил который тупо скопипастил из нейронки. Пожалуйста, не доверяйте детекторам в нейросетях. Standford доказал(и да вот ссылочки мои любимые подъехали https://arxiv.org/html/2304.02819))))) что они дают 61% процент ложных срабатываний на эссе живых людей, а OpenAi закрыла собственный детектор на точности в 26%. Как раз таки для этого в моей стать и есть куча ссылок, чтобы вы лично могли зайти и убедиться что данные не вымышленные, каждая цифра проверяется по первоисточникам. В каких то моментах я разумеется использовал нейросеть для полировки. Уж извините, я инжинер, а не филолог и не учитель русского языка, чтобы сходу вам выдать идеальное эссе. Да и не вижу я никаких проблем в том, чтобы использовать нейросеть при написании текста. Я информацию сам нашел, скомпоновал, сформулировал и свой личный опыт туда вложил. А нейронка... ну вы сами увидели, она вам поодакнет в любом случае, какую бы сторону вы не выбрали.
Вот прикрепляю скрины из DeepSeek