Я уже месяца три хочу про это написать. Наверное, на следующей неделе выкрою пару часов на тесты.
Предлагаю направить нашу дискуссию в конструктивное русло и раскрыть эту тему с обеих сторон. Я попробую с технической стороны выработать если не методику определения, то хотя бы систематизировать характерные признаки и на их основе предоставить рекомендации для авторов как бороться с ИИ-шностью собственных текстов, те как улучшать свой материал при активном использовании ИИ.
Вы же, как редактор с огромной насмотренностью текстов, можете раскрыть эту же мысль в своей статье так сказать с гуманитарной стороны.
Таким образом, мы получим взгляд на текущую ситуацию и со стороны читателей и со стороны писателей.
вы не поверите - прямо здесь, на Хабре, кидали предъявы, что это ИИ-генерация.
Охотно поверю. Более того, я ничего не имею против использования ИИ в качестве помощника для написания текстов как таковых, при условии доработки его автором до читаемого состояния.
Тут сугубо проблема восприятия. Когда много читаешь "человеческие" тексты, а потом годами работаешь в ML постоянно сталкиваясь с сгенерированным текстом в NLP (обработка естественных языков), получаешь определенную насмотренность текстов и LLM генерация вызывает ощущение песка в глазах.
Думаю, стоит исследовать эту проблему более детально, сформулировать методику и проанализировать русскоязычные тексты различных статей авторов на Хабре. Цель: не поймать за руку тех кто использует LLM (ее только луддиты не используют), а определить что именно раздражает при прочтении.
Надеюсь, это поможет авторам сделать свои статьи более "живыми" понимая что именно делает текст похожим на LLM-ный. А пользователи перестанут попадать в ситуацию "читать это интересно, но больно".
Как я понимаю, главная проблема была в не самом качественном машинном переводе, который в итоге и дал "AI-generated gloss" ИИ текстам. Более детально, в отдельном комментерии.
То есть если человек научился красиво писать до нейросетей, он должен разучиться и специально допускать ошибки?
Можно было бы расставить все точки над i: взять тексты автора до 2022 (начало использования LLM в текстах) и после, сделать два корпуса текста и сравнить по указанным выше признакам, посчитать "становление авторского стиля" так сказать математически.
Но, к сожалению, я не нашел текстов автора до 2022 года (возможно, плохо искал). Получается, что проследить эволюцию авторского стиля "похожего на LLM" до появления LLM не представляется возможным.
Поэтому я не вижу смысла спорить, пусть каждый останется при своем мнении. Лично для меня (как для читателя) плотность LLM-признаков в статье зашкаливает и вызывает отторжение при прочтении, хотя сама тема интересная. Можете считать это профдеформацией человека, который седьмой год плотно работает с нейросетями.
Давайте по частям разберем (не) вами написанное. Я попробую сформулировать претензии к тексту в общем виде, т.к. это относится ко всем текстам, авторы которых не вычитывают и не корректируют выхлоп нейронной сети:
Тире используется как знак препинания через слово.
Оно становится основным связующим элементом почти в каждом абзаце: “Теория разума — это когда…”, “Убеждение только вывести — и эта невозможность…”, “Тот же нейрон, то же срабатывание — но движения не было”, “Мозг в этой модели — не детектор убеждений, а машина предсказаний”.
У живого автора тире это акцент, редкий инструмент. Здесь оно заменяет двоеточия, скобки и просто точки, т.е. выполняет работу, которую в обычной русской пунктуации распределяют между разными знаками. Из-за этого текст звучит однообразно ритмично: тук-тире-тук, тук-тире-тук, кто-там.
Постоянное использование антитезы “не X, а Y”.
Это отдельный маркер, который встречается настолько часто, что превращается в тик: “не единое умение, а минимум два”, “не теория о другом человеке, а симуляция от первого лица”, “не в дефиците у одной стороны, а в том, что…”, “не детектор убеждений, а машина предсказаний”.
Приём хорош один-два раза за текст как риторический жест. Когда он повторяется семь-десять раз, мозг узнает шаблон, и красивая мысль перестаёт восприниматься как мысль, вместо этого она становится частью стиля повествования не-тук-а-тук, не-тук-а-тук, войдите.
Однострочные абзацы-обрывы для драматического эффекта.
“А потом теория разума посыпалась.”, “Хуже того, орган оказался не единым.”, “Но здесь уже знакомая трещина.”, “Круг замкнулся.”. Это классический приём для нагнетания сюжетного поворота в тексте, который вообще-то научно-популярный обзор, а не детектив. Один такой обрыв смотрится эффектно. Пять-шесть на статью и мозг уже автоматически детектирует потсоянное “а вот и не так!”.
Заголовки-клиффхэнгеры со схематичной структурой.
“Невидимый орган”, “Трещина в фундаменте”, “Как рухнул главный тест”, “Бесконечный спор”, “И как быть?” и тд. Каждый подзаголовок построен по одной и той же формуле: метафора + обещание драмы. Причём под каждым заголовком текст идёт по одинаковой схеме: тезис, пример, неожиданный поворот, вывод-афоризм. Такая жёсткая повторяемость структуры на уровне разделов именно та вещь, на котороую мозги читателя реагируют негативно.
Слова-связки, которые ничего не говорят, но создают видимость логики.
“Грубо говоря”, “казалось бы”, “на самом деле”, “по сути”, “выходит”, “хуже того” и тд. Эти слова используются для связывания абзацов, а не потому что автору правда нужно смягчить или уточнить мысль. Уберите половину и смысл не изменится. Туда же идет постоянное использование слова “честно” в текстах от некоторых ИИ.
Афористичные “закрывающие” фразы в конце почти каждого блока. “Мы измеряем поведение и называем это чтением умов.”, “Круг замкнулся.”, “Спустя полвека исследований мы все еще не знаем…”. Cтремление закончить каждый смысловой кусок красивой фразой-выводом у человека получается редко, потому что не каждая мысль естественно сворачивается в афоризм. У ИИ это происходит почти всегда, потому что это оптимизируется под “цепляющую” подачу.
Искусственная симметрия и триады там, где не нужно. “Не в четыре года… Способность формируется гораздо раньше”, “быстрая автоматическая и медленная осознанная”, “когнитивный ToM… аффективный ToM” и т.д., все это парность, поданная как открытие. Мозг любит закономерности, и ИИ-текст их производит слишком равномерно, без той шероховатости, которая бывает у настоящих рассуждений.
Затухание “живых” деталей ближе к концу текста. Первая половина статьи (эксперимент с Салли, шимпанзе Сара) написана с частностями. К середине-концу текст всё больше уходит в обобщённые формулировки метафор клише (“оказался не единым”, “оркестр, но не солист”). Генерация теряет специфику по мере разворачивания длинного текста.
Обобщить эти пункты можно общей претензией: проблема в частоте и монотонном чередовании этих приемов: тире - антитеза - короткий обрыв - риторический вопрос - афоризм, и так по кругу в каждом разделе. Это и создаёт странное ощущение: вроде читаешь увлекательно написанный текст, но подсознательно чувствуешь усталость от предсказуемости конструкций быстрее, чем от объёма материала.
Предлагаю хабравчанам добавить свои пункты, т.к. наверняка я что-то упустил.
Дело в том, что при обучении больших моделей использовался не только русский корпус текстов, но и аугментация в виде машинного перевода английских текстов на русский язык с дальнейшим использованием таких переводов в обучении. Отсюда такие ломающие глаза предложения. ИИ не специально это делает, так исторически сложилось. Это можно довольно просто причесать, если прочитать текст перед отправкой и исправить то за что цепляется глаз. Но, видимо, проще молча пройтись по моей карме. Как-то так.
От себя хочу добавить о таком методе защиты как Sandwich Defense, когда часть инструкций системного промта добавляется в конец каждого сообщения пользователя. Это довольно известный, старый и слабый метод, который обходят 95% атакующих. Но! Я столкнулся с тем что этот метод внезапно хорошо работает на современных thinking моделях семейств Gemma 4 и MiniMax 2.6. Почему? Пока не знаю.
Спасибо за интересную статью! В похожем виде собирался препарировать J-space по возвращению из отпуска, но вы уже это сделали и сэкономили кучу времени, за что вам плюсы вовсе места куда дотянулся. Вместо этого, наверное, всуну спайковые слои в современную LLM и изучу практическое применение.
Самоотчёт модели о собственном рассуждении нельзя принимать как свидетельство того, что за отчётом стоит несущее вычисление.
Это следствие ограничения самой архитектуры модели, у генерации только одно направление и сама генерация одна в каждый момент времени.
Ставьте лайки и пишите комментарии, если эта статья была полезна и если желаете по-скорее увидеть вторую часть :)
Да тут и карму плюсануть не жалко, отличная статься о реальной головной боли в MLOps. Не понимаю, почему Nvidia сама до сих пор не выпустила свой аналог Volcano.
это четыре-пять карт, киловатт из розетки и цена автомобиля
Там самой модели доступно что-то типа 96Gb на винде и ~110Gb на линуксе. Это две RTX A6000, те примерно в 2 раза дороже. Зато там 768 ГБ/с (GDDR6) вместо ~256 ГБ/с (LPDDR5X), но не суть. То что тестил автор вообще влезет в одну такую карту и будет работать быстрее, а стоить чуть дороже.
Strix Halo берёт не скоростью, а тем, что модель, которая больше никуда не влезает, здесь просто работает. А vllm с paged attention раскрывается на десятках параллельных запросов – дома с одним пользователем вы повторите не "реальный контур", а его декорацию.
Я с вами полностью согласен, для одного пользователя с последовательными НЕБОЛЬШИМИ запросами это хорошее решение, при условии, что вам не нужно больше 64к контекста и с ним вы готовы ждать по 2 минуты на обработке каждого запроса.
Поделитесь в комментариях, как у вас устроено ревью агентного выхода?
Другой (это принципиально важно) сетью, пусть небольшой, с хорошим контекстном окном, возможностью рассуждений и доступом к поиску через MCP. Ревью либо говорит что не так и отправляет обратно, либо говорит что можно приступать к human-in-the-loop оценке методом прищуренного глаза.
Для примера, в локальных решениях Gemma 4 31В проверяет выход от Qwen Coder Next 80B, а в облачных сети от Google проверяют выход от сетей Antropic.
Вообще, позиция архитектора сейчас сильно меняется в том плане, что раньше синьоры/лиды становились архитектами, а теперь архитекты все больше становятся пишушими код синьорами, пусть и с помощью ИИ.
Мы говорим на разных языках, хотя и занимаемся примерно одним и тем же. Вы не указали в статье сразу для чего эта система поэтому ваше - - parallel 1 на strix B выглядело как залипуха. Остальное - лирика.
По совокупности ответов я понял, что это ваше внутреннее решение, стриксы вы взяли тк нормальное оборудование долго идёт и у вас оч специфичный кейс в виде запросов от одного пользователя, ризкну предположить, что от другой большой сети и они не частые. В этом свете ваше решение начинает выглядеть логично.
Наверное, опять неправильно понял, но это уже не важно.
Начну с того, что вынесло меня сильнее всего: вопрос про дообучение. Слово «обучение» в ней не встречается ни разу. Вы спорите со статьёй «домашняя лаба ML‑инженера», которая у вас в голове
В начале статьи написано "На узле моей AI‑платформы крутятся.." и дальше описано то что обычно крутится на домашней лабе. Поэтому я предположил что это домашняя лаба, а значит и обучению есть место. Если это не домашняя и не лаба, то прошу прощения, значит я понятия не имею что это. И не понимаю зачем это нужно, потому и написал комментарий. Ответа впрочем так и не получил. Ну ок.
моя про другое: выдержит ли эта коробка роль постоянного инфраструктурного узла.
Так вы этого не показали. Вы показали p95 на - - patallel 1, те буквально то что сборка запускается, работает месяцами и не падает при работе с одним пользователем. Ну ок 2.
Как это все будет работать в проде на реальных пользователях и запросах - для меня вопрос остаётся открытым. Мне видимо не хватает воображения осознать чем это будет лучше обычной одной или паре RTX A6000 с выгузкой в обычную RAM на vllm без всяких танцев с бубном.
Она тем и хороша, что едет каждый день, пока нормальное железо согласовывает бюджет.
Я правильно понял, что вы впариваете клиентам вот эти сугубо инференсные однопользовательские амдшные коробки с RAM вместо нормального железа? Если да, то вопросов больше не имею.
Все время прочтения статьи меня не покидала мысль: "на что люди не пойдут лишь бы нормальное железо не использовать". Эксперимент безусловно интересный и спасибо что поделились, но я смотрю на это с точки зрения практика. Мне непонятна конечная цель.
Если это просто домашняя лаба энтузиаста с инференсом то все ок, снимаю шляпу, оно работает и хорошо.
Если это домашняя лаба ML инженера, то это немного странно, тк каждый инженер стремится повторить реальный контур у себя в миниатюре, с vllm, paged attention, continuous batching и прочим простыми тихим радостями современного ML продакшна.
На сколько я понимаю, в этой лабе этого нет и быть не может по совокупности причин. Опять же, инференс (пусть и без параллельных запросов) это хорошо, но как быть с обучением, вернее дообучением?
Морозить верхние слои сети, 4 часа собирать flash attention 2 из исходников, запускать обучение в peft долгими вечерами получая LoRA странного качества?
Для прода такая система не подходит, для дома - Франкенштейн (хотя не мне в чужих Франкенштейнов пальцем тыкать, со своими бы разобраться). И все же, в чем космический эффект такой сборки?
Я, внимательно прочитал раздел "Что я хотел проверить", но так и не понял "Зачем":
1. Держит ли машина полный Docker‑стек приватной AI‑платформы в непрерывной работе.
Докер стек держит, но LLM-сервер запущен с --parallel 1 те физически не может обслуживать больше одного запроса одновременно. Второй пользователь или запрос просто встанет в очередь.
2. Есть ли linux/amd64‑образы для всего каталога, или придётся собирать своё.
Я так понял, что собрали свое.
3. Работает ли Radeon 8060S (gfx1151) через Vulkan как основной путь инференса.
Работает.
4. Сколько из 128 ГБ общей памяти реально достаётся GPU и какой настройкой.
Здесь важнее что dify-sandbox дошёл до 95% лимита при синтетическом тесте без реальной нагрузки (это контейнер, который исполняет код агентов, при реальной работе отдела с агентами будет ещё хуже). Получается, что памяти впритык уже на одном пользователе.
4. Пригодны ли локальные эмбеддинги и реранкер для рабочего RAG‑пайплайна.
Неизвестно: embed/rerank тестировались с 4+2 потоками 90 секунд. Это не нагрузка, это микро-бенчмарк. Также, p99 не измерялся нигде, только p50/p95 на одиночных последовательных запросах. Вы сами об этом пишете, а p99 это база проверки.
5. Какие ограничения у ROCm и мониторинга на этой платформе.
Общая память свободна (98,8 ГиБ), но GPU-память считается по трём разным механизмам одновременно, которые расходятся в разы (18,6 ГиБ vs 1,5 ГиБ vs 39,5 ГиБ для одного и того же процесса в разных снимках). Стандартные инструменты capacity planning (autoscaling по cgroup-лимитам) тут не сработают те управления нагрузкой не, а значит при контексте 256K и нескольких параллельных длинных сессиях памяти может банально не хватить.
Ни в коем случае не хочу умалить ваших достижений, поймите пожалуйста меня правильно, эксперимент интересный, просто сильно напоминает буханку и коробок спичек.
Даже если системный промт не спасёт, то это решится небольшой моделью, дообученной на отлов рекламного мусора. Но вы правы в том, что это будет решение не для всех, для большинства будет платная премиум функция с отключением такой выдачи.
Спасибо за интересный материал, у вас получилось сделать текст живым, видно, что над ним работали. Претензии к дефисам как к маркеру нейрослопа будут ещё очень долго (тяжёлое наследие первых версий gpt моделей), также как и к обилию слова "честно" (наследие Antropic моделей).
Сам периодически пишу статьи и реально спотыкаюсь о каждое место где стоит поставить дефис, закрадывается мысль: а не подумают ли читатели что это очередной нейрослоп? Дефисофобия какая-то.
Вы так и не поняли, что речь шла не об их использовании в принципе, а об их количестве на единицу смыслового блока.
Предлагаю направить нашу дискуссию в конструктивное русло и раскрыть эту тему с обеих сторон. Я попробую с технической стороны выработать если не методику определения, то хотя бы систематизировать характерные признаки и на их основе предоставить рекомендации для авторов как бороться с ИИ-шностью собственных текстов, те как улучшать свой материал при активном использовании ИИ.
Вы же, как редактор с огромной насмотренностью текстов, можете раскрыть эту же мысль в своей статье так сказать с гуманитарной стороны.
Таким образом, мы получим взгляд на текущую ситуацию и со стороны читателей и со стороны писателей.
Охотно поверю. Более того, я ничего не имею против использования ИИ в качестве помощника для написания текстов как таковых, при условии доработки его автором до читаемого состояния.
Тут сугубо проблема восприятия. Когда много читаешь "человеческие" тексты, а потом годами работаешь в ML постоянно сталкиваясь с сгенерированным текстом в NLP (обработка естественных языков), получаешь определенную насмотренность текстов и LLM генерация вызывает ощущение песка в глазах.
Думаю, стоит исследовать эту проблему более детально, сформулировать методику и проанализировать русскоязычные тексты различных статей авторов на Хабре. Цель: не поймать за руку тех кто использует LLM (ее только луддиты не используют), а определить что именно раздражает при прочтении.
Надеюсь, это поможет авторам сделать свои статьи более "живыми" понимая что именно делает текст похожим на LLM-ный. А пользователи перестанут попадать в ситуацию "читать это интересно, но больно".
Сарказм хорош, но ровно до слова "дефис", LLM-маркером является не он, а тире.
Как я понимаю, главная проблема была в не самом качественном машинном переводе, который в итоге и дал "AI-generated gloss" ИИ текстам. Более детально, в отдельном комментерии.
Можно было бы расставить все точки над i: взять тексты автора до 2022 (начало использования LLM в текстах) и после, сделать два корпуса текста и сравнить по указанным выше признакам, посчитать "становление авторского стиля" так сказать математически.
Но, к сожалению, я не нашел текстов автора до 2022 года (возможно, плохо искал). Получается, что проследить эволюцию авторского стиля "похожего на LLM" до появления LLM не представляется возможным.
Поэтому я не вижу смысла спорить, пусть каждый останется при своем мнении. Лично для меня (как для читателя) плотность LLM-признаков в статье зашкаливает и вызывает отторжение при прочтении, хотя сама тема интересная. Можете считать это профдеформацией человека, который седьмой год плотно работает с нейросетями.
Давайте по частям разберем (не) вами написанное. Я попробую сформулировать претензии к тексту в общем виде, т.к. это относится ко всем текстам, авторы которых не вычитывают и не корректируют выхлоп нейронной сети:
Тире используется как знак препинания через слово.
Оно становится основным связующим элементом почти в каждом абзаце: “Теория разума — это когда…”, “Убеждение только вывести — и эта невозможность…”, “Тот же нейрон, то же срабатывание — но движения не было”, “Мозг в этой модели — не детектор убеждений, а машина предсказаний”.
У живого автора тире это акцент, редкий инструмент. Здесь оно заменяет двоеточия, скобки и просто точки, т.е. выполняет работу, которую в обычной русской пунктуации распределяют между разными знаками. Из-за этого текст звучит однообразно ритмично: тук-тире-тук, тук-тире-тук, кто-там.
Постоянное использование антитезы “не X, а Y”.
Это отдельный маркер, который встречается настолько часто, что превращается в тик: “не единое умение, а минимум два”, “не теория о другом человеке, а симуляция от первого лица”, “не в дефиците у одной стороны, а в том, что…”, “не детектор убеждений, а машина предсказаний”.
Приём хорош один-два раза за текст как риторический жест. Когда он повторяется семь-десять раз, мозг узнает шаблон, и красивая мысль перестаёт восприниматься как мысль, вместо этого она становится частью стиля повествования не-тук-а-тук, не-тук-а-тук, войдите.
Однострочные абзацы-обрывы для драматического эффекта.
“А потом теория разума посыпалась.”, “Хуже того, орган оказался не единым.”, “Но здесь уже знакомая трещина.”, “Круг замкнулся.”. Это классический приём для нагнетания сюжетного поворота в тексте, который вообще-то научно-популярный обзор, а не детектив. Один такой обрыв смотрится эффектно. Пять-шесть на статью и мозг уже автоматически детектирует потсоянное “а вот и не так!”.
Заголовки-клиффхэнгеры со схематичной структурой.
“Невидимый орган”, “Трещина в фундаменте”, “Как рухнул главный тест”, “Бесконечный спор”, “И как быть?” и тд. Каждый подзаголовок построен по одной и той же формуле: метафора + обещание драмы. Причём под каждым заголовком текст идёт по одинаковой схеме: тезис, пример, неожиданный поворот, вывод-афоризм. Такая жёсткая повторяемость структуры на уровне разделов именно та вещь, на котороую мозги читателя реагируют негативно.
Слова-связки, которые ничего не говорят, но создают видимость логики.
“Грубо говоря”, “казалось бы”, “на самом деле”, “по сути”, “выходит”, “хуже того” и тд. Эти слова используются для связывания абзацов, а не потому что автору правда нужно смягчить или уточнить мысль. Уберите половину и смысл не изменится. Туда же идет постоянное использование слова “честно” в текстах от некоторых ИИ.
Афористичные “закрывающие” фразы в конце почти каждого блока. “Мы измеряем поведение и называем это чтением умов.”, “Круг замкнулся.”, “Спустя полвека исследований мы все еще не знаем…”. Cтремление закончить каждый смысловой кусок красивой фразой-выводом у человека получается редко, потому что не каждая мысль естественно сворачивается в афоризм. У ИИ это происходит почти всегда, потому что это оптимизируется под “цепляющую” подачу.
Искусственная симметрия и триады там, где не нужно. “Не в четыре года… Способность формируется гораздо раньше”, “быстрая автоматическая и медленная осознанная”, “когнитивный ToM… аффективный ToM” и т.д., все это парность, поданная как открытие. Мозг любит закономерности, и ИИ-текст их производит слишком равномерно, без той шероховатости, которая бывает у настоящих рассуждений.
Затухание “живых” деталей ближе к концу текста. Первая половина статьи (эксперимент с Салли, шимпанзе Сара) написана с частностями. К середине-концу текст всё больше уходит в обобщённые формулировки метафор клише (“оказался не единым”, “оркестр, но не солист”). Генерация теряет специфику по мере разворачивания длинного текста.
Обобщить эти пункты можно общей претензией: проблема в частоте и монотонном чередовании этих приемов: тире - антитеза - короткий обрыв - риторический вопрос - афоризм, и так по кругу в каждом разделе. Это и создаёт странное ощущение: вроде читаешь увлекательно написанный текст, но подсознательно чувствуешь усталость от предсказуемости конструкций быстрее, чем от объёма материала.
Предлагаю хабравчанам добавить свои пункты, т.к. наверняка я что-то упустил.
Дело в том, что при обучении больших моделей использовался не только русский корпус текстов, но и аугментация в виде машинного перевода английских текстов на русский язык с дальнейшим использованием таких переводов в обучении. Отсюда такие ломающие глаза предложения. ИИ не специально это делает, так исторически сложилось. Это можно довольно просто причесать, если прочитать текст перед отправкой и исправить то за что цепляется глаз. Но, видимо, проще молча пройтись по моей карме. Как-то так.
Спасибо за хорошую статью.
От себя хочу добавить о таком методе защиты как Sandwich Defense, когда часть инструкций системного промта добавляется в конец каждого сообщения пользователя. Это довольно известный, старый и слабый метод, который обходят 95% атакующих. Но! Я столкнулся с тем что этот метод внезапно хорошо работает на современных thinking моделях семейств Gemma 4 и MiniMax 2.6. Почему? Пока не знаю.
Как вычитывать и приводить к нормальному виду сгенерированный ИИ слоп выдаваемый за обзорную статью.
RTX A5000 и RTX A6000, обе под водяным охлаждением, 0 писка.
Спасибо за интересную статью! В похожем виде собирался препарировать J-space по возвращению из отпуска, но вы уже это сделали и сэкономили кучу времени, за что вам плюсы вовсе места куда дотянулся. Вместо этого, наверное, всуну спайковые слои в современную LLM и изучу практическое применение.
Это следствие ограничения самой архитектуры модели, у генерации только одно направление и сама генерация одна в каждый момент времени.
Да тут и карму плюсануть не жалко, отличная статься о реальной головной боли в MLOps. Не понимаю, почему Nvidia сама до сих пор не выпустила свой аналог Volcano.
Давайте вторую часть.
Там самой модели доступно что-то типа 96Gb на винде и ~110Gb на линуксе. Это две RTX A6000, те примерно в 2 раза дороже. Зато там 768 ГБ/с (GDDR6) вместо ~256 ГБ/с (LPDDR5X), но не суть. То что тестил автор вообще влезет в одну такую карту и будет работать быстрее, а стоить чуть дороже.
Я с вами полностью согласен, для одного пользователя с последовательными НЕБОЛЬШИМИ запросами это хорошее решение, при условии, что вам не нужно больше 64к контекста и с ним вы готовы ждать по 2 минуты на обработке каждого запроса.
Другой (это принципиально важно) сетью, пусть небольшой, с хорошим контекстном окном, возможностью рассуждений и доступом к поиску через MCP. Ревью либо говорит что не так и отправляет обратно, либо говорит что можно приступать к human-in-the-loop оценке методом прищуренного глаза.
Для примера, в локальных решениях Gemma 4 31В проверяет выход от Qwen Coder Next 80B, а в облачных сети от Google проверяют выход от сетей Antropic.
Вообще, позиция архитектора сейчас сильно меняется в том плане, что раньше синьоры/лиды становились архитектами, а теперь архитекты все больше становятся пишушими код синьорами, пусть и с помощью ИИ.
Мы говорим на разных языках, хотя и занимаемся примерно одним и тем же. Вы не указали в статье сразу для чего эта система поэтому ваше - - parallel 1 на strix B выглядело как залипуха. Остальное - лирика.
По совокупности ответов я понял, что это ваше внутреннее решение, стриксы вы взяли тк нормальное оборудование долго идёт и у вас оч специфичный кейс в виде запросов от одного пользователя, ризкну предположить, что от другой большой сети и они не частые. В этом свете ваше решение начинает выглядеть логично.
Наверное, опять неправильно понял, но это уже не важно.
В начале статьи написано "На узле моей AI‑платформы крутятся.." и дальше описано то что обычно крутится на домашней лабе. Поэтому я предположил что это домашняя лаба, а значит и обучению есть место. Если это не домашняя и не лаба, то прошу прощения, значит я понятия не имею что это. И не понимаю зачем это нужно, потому и написал комментарий. Ответа впрочем так и не получил. Ну ок.
Так вы этого не показали. Вы показали p95 на - - patallel 1, те буквально то что сборка запускается, работает месяцами и не падает при работе с одним пользователем. Ну ок 2.
Как это все будет работать в проде на реальных пользователях и запросах - для меня вопрос остаётся открытым. Мне видимо не хватает воображения осознать чем это будет лучше обычной одной или паре RTX A6000 с выгузкой в обычную RAM на vllm без всяких танцев с бубном.
Я правильно понял, что вы впариваете клиентам вот эти сугубо инференсные однопользовательские амдшные коробки с RAM вместо нормального железа? Если да, то вопросов больше не имею.
Все время прочтения статьи меня не покидала мысль: "на что люди не пойдут лишь бы нормальное железо не использовать". Эксперимент безусловно интересный и спасибо что поделились, но я смотрю на это с точки зрения практика. Мне непонятна конечная цель.
Если это просто домашняя лаба энтузиаста с инференсом то все ок, снимаю шляпу, оно работает и хорошо.
Если это домашняя лаба ML инженера, то это немного странно, тк каждый инженер стремится повторить реальный контур у себя в миниатюре, с vllm, paged attention, continuous batching и прочим простыми тихим радостями современного ML продакшна.
На сколько я понимаю, в этой лабе этого нет и быть не может по совокупности причин. Опять же, инференс (пусть и без параллельных запросов) это хорошо, но как быть с обучением, вернее дообучением?
Морозить верхние слои сети, 4 часа собирать flash attention 2 из исходников, запускать обучение в peft долгими вечерами получая LoRA странного качества?
Для прода такая система не подходит, для дома - Франкенштейн (хотя не мне в чужих Франкенштейнов пальцем тыкать, со своими бы разобраться). И все же, в чем космический эффект такой сборки?
Я, внимательно прочитал раздел "Что я хотел проверить", но так и не понял "Зачем":
1. Держит ли машина полный Docker‑стек приватной AI‑платформы в непрерывной работе.
Докер стек держит, но LLM-сервер запущен с --parallel 1 те физически не может обслуживать больше одного запроса одновременно. Второй пользователь или запрос просто встанет в очередь.
2. Есть ли linux/amd64‑образы для всего каталога, или придётся собирать своё.
Я так понял, что собрали свое.
3. Работает ли Radeon 8060S (gfx1151) через Vulkan как основной путь инференса.
Работает.
4. Сколько из 128 ГБ общей памяти реально достаётся GPU и какой настройкой.
Здесь важнее что dify-sandbox дошёл до 95% лимита при синтетическом тесте без реальной нагрузки (это контейнер, который исполняет код агентов, при реальной работе отдела с агентами будет ещё хуже). Получается, что памяти впритык уже на одном пользователе.
4. Пригодны ли локальные эмбеддинги и реранкер для рабочего RAG‑пайплайна.
Неизвестно: embed/rerank тестировались с 4+2 потоками 90 секунд. Это не нагрузка, это микро-бенчмарк. Также, p99 не измерялся нигде, только p50/p95 на одиночных последовательных запросах. Вы сами об этом пишете, а p99 это база проверки.
5. Какие ограничения у ROCm и мониторинга на этой платформе.
Общая память свободна (98,8 ГиБ), но GPU-память считается по трём разным механизмам одновременно, которые расходятся в разы (18,6 ГиБ vs 1,5 ГиБ vs 39,5 ГиБ для одного и того же процесса в разных снимках). Стандартные инструменты capacity planning (autoscaling по cgroup-лимитам) тут не сработают те управления нагрузкой не, а значит при контексте 256K и нескольких параллельных длинных сессиях памяти может банально не хватить.
Ни в коем случае не хочу умалить ваших достижений, поймите пожалуйста меня правильно, эксперимент интересный, просто сильно напоминает буханку и коробок спичек.
Даже если системный промт не спасёт, то это решится небольшой моделью, дообученной на отлов рекламного мусора. Но вы правы в том, что это будет решение не для всех, для большинства будет платная премиум функция с отключением такой выдачи.
Спасибо за интересный материал, у вас получилось сделать текст живым, видно, что над ним работали. Претензии к дефисам как к маркеру нейрослопа будут ещё очень долго (тяжёлое наследие первых версий gpt моделей), также как и к обилию слова "честно" (наследие Antropic моделей).
Сам периодически пишу статьи и реально спотыкаюсь о каждое место где стоит поставить дефис, закрадывается мысль: а не подумают ли читатели что это очередной нейрослоп? Дефисофобия какая-то.