Pull to refresh

Comments 38

Интересно, спасибо. Было бы круто услышать и про ту часть, где что-то не получилось. Это ведь самое интересное)

Принято, спасибо) Возможно, следующий текст будет как раз о провалах.

Занимательный эксперимент

Возможно, следующий текст будет как раз о провалах.  

Уже в этом с провалами все хорошо:

Около $80-100 на подписки LLM на всех не‑ИТ сотрудников.

Похоже, что вы используете зарубежные облачные модели в проде.

У вас сейчас конфетно-букетный период ИИ-автоматизации. Все радостно слопают код и задачи отдавая все облака.

И знаете, это было бы нормально для не ИТ компании, сейчас у нас на рынке период такой, "становление", но вы же внедряете ИИ клиентам!

У вас на сайте прямо написаны услуги: "Автоматизация бизнеса с помощью ИИ" и "Внедрение ИИ в бизнес". И вы не можете для самих себя внедрить ваше же готовое решение без подписок на облака и проблем с этим связанных?

Т.е. своим же готовым решениям вы предпочитаете облачные. Видимо, вы и клиентам также подписки оформляете, но это уже совсем за гранью 152-ФЗ.

$0 Free forever, self-hosted.

Вы путаете AI Gateway с облачными моделями.

Я к тому, что зачем ставить диагнозы по фотографии? Вы ведь не знаете точно, что и как там оформляется клиентам? Или знаете?

Я к тому, что зачем ставить диагнозы по фотографии? Вы ведь не знаете точно, что и как там оформляется клиентам? Или знаете?

Единственные облака которые разрешены по 152-ФЗ (и имеют смысл использовать, если не хочется разворачивать свое) находятся в РФ, т.е. оплата идет в рублях. В статье же цены указаны в долларах, как раз за месячную подписку от Антропиков.

Но проблема даже не в этом. Проблема в том что компания, занимающаяся внедрением ИИ для бизнеса (так заявлено на сайте) для своей внутренней работы предпочитает облачные решения вместо собственных.

Не очень понимаю, почему это проблема. Полмира на Amazon AWS сидит и не жужжит. Тот же Zapier торгует и своими инференсами и амазоновскими. Или это как с проводами из бескилородной меди? Если инференс не свой, то автоматизация не настоящая? Мне кажется, тут все же важнее смотреть на результат, а не на способ. Но я далеко не такой спец, как вы (почитал ваши статьи - круто!), могу ошибаться.

Не очень понимаю, почему это проблема. Полмира на Amazon AWS сидит и не жужжит.

Похоже, вы не знакомы с реалиями требований к ведению бизнеса в РФ. Есть определенные требования, которые за последний год стали обязательными, а штрафы за их неисполнение - ощутимыми.

Если инференс не свой, то автоматизация не настоящая?

Ни в коем случае. Можно брать облака в России и РКН слова худого не скажет. Проблема только в том что в облаках модель будет недообучена под конкретную задачу в большинстве случаев. Я сейчас не об автоматизации ИТ отдела где люди пишут код, я об автоматизации всех остальных отделов.

Похоже, вы не знакомы с реалиями требований к ведению бизнеса в РФ

К сожалению, знаком. Правда, в другой сфере, с еще более взаимоисключающими требованиями.

Насколько мне известно, закон не запрещает (пока) использовать западные несуверенные ИИ. Кто мешает закинуть туда обезличенные данные? 152-ФЗ это же не нарушит.

в облаках модель будет недообучена под конкретную задачу в большинстве случаев

Мне кажется, вы с позиции эксперта чересчур усложняете этот вопрос, как в том меме про разработчика, который везде factory пихал. Конкретная задача какого-нито условного бухгалтера не так уж уникальна, чтобы под него разворачивать локальное решение с дообучением модели.

Или вот в статье пример с маркетологом, который что-то там сеошное анализирует и составляет отчетики себе. На кой черт тут огород городить. Об этом и речь. Результат есть. Да, в облаке. Ну и что? Правда не понимаю.

Кто мешает закинуть туда обезличенные данные?

Сами сотрудники предприятия, которые кидают в чат прямо куски выгрузок из CRM. Это настолько повсеместно сейчас (из моих наблюдений и практики), а сотрудники настолько непуганные эльфы, что я писал об этот статью и кидаю ссылку клиентам, коллегам (они уже дальше своим клиентам). Проблема есть и она существенная.

Более того, я ожидаю дальнейшего ужесточения законодательства по этому поводу вплоть до прямого запрета использовать зарубежные облачные решения.

Мне кажется, вы с позиции эксперта чересчур усложняете этот вопрос, как в том меме про разработчика, который везде factory пихал.

Конечно, у меня есть свои проф деформации, но я пишу не только о своем практическом опыте, но и об обезличенном опыте компаний, у которых я наблюдал происходящее.

Я же не могу называть конкретные компании, которые так или иначе обожглись, они мои контрагенты. Когда я вижу, одну и ту же боль или ошибки внедрения у нескольких компаний из разных отраслей, которые приходят в итоге к одним и тем же решениям, я их систематизирую (в первую очередь для себя, как для участника рынка).

Затем я пишу статью на Хабре, и чтобы окончательно закрепить материал в голове, и чтобы предоставить информацию для своих клиентов и компаний, которые занимаются ML-внедрением (у меня частенько конкуренты становятся контрагентами).

Главное непонимание в комментариях происходит от того, что я пишу для предприятия (бизнеса), а комментаторы пишут с позиции физлиц (ну или самозанятых). СЕО-шник удаленно работающий, программист и тд.

Отсюда и непонимание. Физлицу действительно не нужно разворачивать локальную модель или по крайней мере выгода от этого спорная. Но я и не веду о них речь.

Или вот в статье пример с маркетологом, который что-то там сеошное анализирует и составляет отчетики себе. На кой черт тут огород городить. Об этом и речь. Результат есть. Да, в облаке. Ну и что? Правда не понимаю.

Качество текста. ИИ-слоп vs текст, на который не агрятся. Вот разница между облачной большой моделью и дообученной небольшой.

Сами сотрудники предприятия, которые кидают в чат прямо куски выгрузок из CRM.

Тут отчасти соглашусь. Хотя проблема тут не в облаке как таковом, а в низкой корпоративной ответственности и процессах в компании, которые в принципе допускают что-то напрямую перенести в чат. Даже если решение будет свое, то этот же самый сотрудник все равно откроет в браузере чатик и туда все скопирует "потому что так быстрее" или еще по какой-то причине.

Качество текста. ИИ-слоп vs текст, на который не агрятся.

А можете пример показать? И примерную стоимость такого решения. Друг спрашивает :)

А можете пример показать? И примерную стоимость такого решения. Друг спрашивает :)

Это уже будет саморекламой, что запрещено правилами Хабра. Поэтому такие вещи спрашивают в личку.

Могу только сказать, что мои модели не делают ошибки, которые я описал здесь.

Так если в курсе, о чём спор? При любом раскладе инференс от провайдера будет дешевле чем своими силами. Под задачи без ПД какой смысл использовать self-hosted? Там где есть ПД - проще взять инференс у отечественного провайдера.

Я что-то сильно сомневаюсь, что сотрудники, о которых речь в статье, работают с гостайной или чем-то таким, требующим локальные модели.

Так если в курсе, о чём спор?

Эм, это не спор.

Я, как читатель, читаю статью, вижу "CEO компании по разработке цифровых решений Siberian.pro".

Интересно, дальше натыкаюсь на "Около $80-100 на подписки LLM".

Ну ок, очередная компания, которая еще не в курсе что использовать зарубежные облака это отложенный выстрел в ногу из-за изменений в нашем законодательстве и утечке коммерческой инфы конкурентам. Это нормально, по личным ощущениям, под 90% компаний не в курсе.

Вывод о западных облаках сделал по оплате в $, далее автор не опроверг это.

После прочтения статьи, как ответственный читатель, иду на указанный сайт и читаю, автор же для этого указал ссылку в начале стати?

Вижу, что они активно представляют себя как внедренцев ML-автоматизации для бизнеса, там целые разделы, нагенеренные ИИшкой (не осуждаю).

И тут у меня возникает вопрос который я хочу уточнить: компания, которая для своих внутренних решений использует либо западные фронтир модели по подписке, видимо, также предлагает своим клиентам этот же подход, сливая ПДн и коммерческую инфу, либо разворачивают открытые веса моделей как есть, без какого-либо дообучения, т.е. предлагают посредственное качество.

Именно это я и пытался уточнить, судя по ответам автора статьи я оказался прав, к сожалению.

При любом раскладе инференс от провайдера будет дешевле чем своими силами.

Бизнес cмотрит CAPEX/OPEX и ROI. Так вот, окупаемость одной конкретной системы происходит примерно за 1.5 года при грамотном подходе. Я думаю написать отдельную статью об этом, тк в этой сфере развелось слишком много ML-цыган (не относится к компании в статье!) и бедные клиенты не могут сориентироваться как вообще считать эту саму ML-автоматизацию и отделять зерна от плевел.

Пока что только описал общую ситуацию на рынке.

Под задачи без ПД какой смысл использовать self-hosted?

  1. Предотвращение утечки коммерческой информации в общий доступ конкурентам (см. статьи выше и ситуацию с доказательством Навье‑Стоксгейт)

  2. Значимо лучшее качество работы самой системы (см. статью об общей ситуации на рынке).

Я вижу много гипотез. не могу сказать что все они необоснованные 🤷 но и подтвердить их тоже из текста статьи никак не выходит. Например гипотеза про $ в ценах значит ЛЛМ забугорные. Я, как Беларус, всю свою сознательную жизнт всё и всегда считаю в долларах. По этому мне глаз не режет.

Ещё вижу радикальную позицию "западные LLM - это зло". С чем в корне не согласен. Ну давай посчитаем ROI например той же задачи генерации разделов ИИшкой (с твоих слов).

Предположим 1 раздел привлечёт 1 клиента. Его мог написать человек, например за 5 часов (цифры из головы). А так же этот человек мог взять ИИ и за 1 час управиться. Предположим SEOшник или копирайтер или кто там эти разделы пишет, делает по одному в день. и имеет план 20 в месяц. Благодаря ИИ он делает теперь по 2 статьи в день и укладывается за 2 недели вместо месяца а ещё и другую работу успевает сделать больше. Экономия ~4ч на 1 раздел, умножаем на 20 разделов - получаем 80ч экономии. Я хз сколько сейчас SEOшники стоят из головы предположу что 1000 российских рублей в час. ИТОГО 80.000 экономии. При этом затраты на условный клодкод - с учётом наценки за оплату из РФ ну допустим 10.000. ROI (80.000 * 12 - 10.000 * 12) / 10.000 × 100% = 700%.

Теперь берём того же SEOшника и что бы получить модель уровня opus (которую он получит в клодкоде) покупаем ему железо для запуска топовой opensource модели. Возьмём к примеру Kimi-K3. Берём сервер с полутора террабайтами видеопамяти. На вскидку 50.000.000. ROI (80.000 * 12 - 50.000.000) / 50.000.000 × 100% = 98%. И срок окупаемости 50 лет. Это не считая стоимости обслуживания такого сервера. Можно ещё посчитать вариант аренды такого сервера у Selectel например... но мне лень :D

И да, никакой выгоды этот SEOшник не получит, ведь с ПДн о и так не работает. Но зато теперь селфхостед, а не эти страшные американские облака, которые конечно же абсолютно зло.

Ну давай посчитаем ROI например той же задачи генерации разделов ИИшкой (с твоих слов).

Давайте. Посчитаем для SEO-специалиста в компании.

что бы получить модель уровня opus (которую он получит в клодкоде)

Зачем? Вот зачем SEO-специалисту Клод, который ВСЕ делает примерно одинаково хорошо, если ему нужен инструмент заточенный под SEO и делающий это отлично?

SEO-тексты не творческая литература и не сложные рассуждения. Требования к ним обычно такие: связность, соблюдение структуры (заголовки, ключевые слова, длина), фактическая точность в рамках темы, естественность языка.

Это задачи, где качество данных для дообучения и правильный пайплайн генерации значат больше, чем размер параметров модели.

Достаточно дообучить модель размером примерно 9-12B, что поместится вместе с контекстом в карту с 16Гб памяти. И тексты будет на русском выдавать не хуже, а лучше, без такого количества воды и явных маркеров монотонности ИИ-слопа.

Никакой Клод этого не сможет просто потому что он на это не заточен, Клод заточен на все сразу и изменить это мы не можем.

Другими словами: размер это не главное.

Сейчас многие пытаются улучшить качество за счет использования модели общего назначения с большим количеством весов.

Вернемся к малой модели: получаем CAPEX в виде затрат на обучение модели и видеокарты на 16Gb. OPEX в виде ежемесячного счета за электричество. ROI в данном случае все также лежит в пределах 1.5-2 лет тк стоимость дообучения под эту задачу невелика. Бизнес обычно считает на 3 года и там уже явная прибыль.

Вряд ли требования к SEO текстам настолько кардинально изменятся за 3 года, чтобы пришлось менять модель.

Возьмём к примеру Kimi-K3. Берём сервер с полутора террабайтами видеопамяти.

А можно не надо. Вы из пушки по воробьям стреляете.

Но зато теперь селфхостед, а не эти страшные американские облака, которые конечно же абсолютно зло.

Не страшные, но у меня лично был случай когда я советуясь с Клодом написал сильно оптимизированный вариант GLV под параллельные вычисления на CUDA и через пару недель (до месяца) Клод стал на чужих сессиях выдавать это решение просто сходу, со тем кодом, что мы писали вместе.

Когда я его писал такого решения еще не существовало в мире в открытом доступе (я долго искал и изучал вопрос) поэтому Клод очень буксовал и мы вместе прорывались к решению больше недели.

В настройках разрешение обучения на моих сессиях было ессно отключено. Совпадение? Конечно.

Ну это я, никому неизвестный нонейм. Но выводы для себя я сделал.

Сейчас у всех на слуху скандал Навье‑Стоксгейт, на Хабре несколько хороших статей об этом, поинтересуйтесь. Еще одно совпадение?

ну тут всё просто
чем дешевле модель - тем больше денег/времени нужно вложить в инженерию харнесса. и наоборот. чем умней модель - тем меньше усилий и танцев с бубном.

Может ли Gemma-4B дать тот же результат в SEO текстах - моё мнение что нет.

Может ли GLM-5.3-flash дать тот же результат - да, но через танцы с бубном и значительную работу по настройке и обслуживанию пайплайна (да да, текст тоже теперь как и код пайплайнами пилят, а не ваншотят. во всяком случае мне так копирайтер знакомый рассказывал)

Но затраты на железо даже под GLM-5.3-flash внушительные (пусть и не 50 лямов). А затраты на подготовку харнесса?

Тут всё тот же вопрос возврата инвестиций и окупаемости вложений. Если мы всегда при любых условиях отказываемся от облаков - мы всегда идём по долгому и дорогому пути, с шансом прийти в самом конце к отрицательной маржинальности. И если бы это хоть давало какую-то ещё выгоду (например как в истории с 152ФЗ, но далеко не каждая задача сотрудников условного SMB под этот 152ФЗ попадает. а точнее практически ни одна не попадает)

Я за взвешенный подход.

RND без коммерческой и прочих тайн - в SOTA модели американских (на сегодняшний день именно США тут лидер) провайдеров

Повторяющиеся рутинные задачи без тайн - в китайские модели развернутые там где дешевле (не у себя) с переключением всякий раз как выходит что-то дешевле и эффективней

Задачи с ПД - в китайские модели (индивидуально подобранные под задачи) у российских провайдеров соответсвующих 152ФЗ

Задачи с гостайной, военной тайной и т.п. - в китайские модели на собственном железе.

Возможно когда-то где-то в этом списке появятся и российские или например европейские модели, но пока что цена/качество у них сильно отстают от конкурентов.

чем дешевле модель - тем больше денег/времени нужно вложить в инженерию харнесса

Зачем SEO-специалисту харнесс? Для написания текстов? Вы действительно понимаете то о чем рассуждаете? Пайплайн написания SEO-текста гораздо проще и не требует харнеса вообще.

Нет, конечно можно собрать Франкенштейна обмазывая харнесс SEO плагинами, но это опять же только от непонимания как решается подобная задача правильно.

Может ли Gemma-4B дать тот же результат в SEO текстах - моё мнение что нет.

А причем тут 4B если я пишу о 9-12B?

Но затраты на железо даже под GLM-5.3-flash внушительные (пусть и не 50 лямов). А затраты на подготовку харнесса?

Какой GLM-5.3-flash, какой харнес, какие 50 млн? Вы сильно далеки от реалий.

Зачем SEO-специалисту харнесс? Для написания текстов? Вы действительно понимаете то о чем рассуждаете? ... Какой GLM-5.3-flash, какой харнес, какие 50 млн?

Вот эти вопросы как раз показывают насколько вы далеки от реалий. и живёте до сих пор в 2025 когда, видимо всем кроме разрабов, достаточно выдать OpenWebUI или LibreChat и надеятся что это закроет все их потребности в ИИ.

---

А причем тут 4B если я пишу о 9-12B?

окей окей. Gemma-4-12B так же не справится

Вот эти вопросы как раз показывают насколько вы далеки от реалий. и живёте до сих пор в 2025 когда, видимо всем кроме разрабов, достаточно выдать OpenWebUI или LibreChat и надеятся что это закроет все их потребности в ИИ.

На этом можно закончить общение. У вас нет задачи меня услышать, а у меня нет желания вас переубеждать. Все что я хотел, я вам уже сказал.

Вы имеете полное право сувать Сеошникам харнесс для написания текста. Я имею полное право с этого покекать.

окей окей. Gemma-4-12B так же не справится

У меня другие практические результаты. А о подобных ML-цыганах, решающих вообще все фронтир моделями я напишу в отдельной статье.

Вы меня не так поняли. Не предлагаю я всё решать фронтирами. Я предлагаю под разные задачи использовать разные соответствующие модели. Где-то это зарубежное облако, где-то местное, где-то селфхостед модель, а где-то микромодель на устройстве пользователя.

Я лишь оспариваю позицию что "облако = плохо. селфхостед = хорошо". Это не так. Мир не чёрно-белый

Я лишь оспариваю позицию что "облако = плохо. селфхостед = хорошо". Это не так. Мир не чёрно-белый

Я с вами в этом полностью согласен и не утверждал подобного.

Выбранная и дообученная под задачу модель на российском хостинге с договором поручения для обработки ПДн это хорошее решение. К сожалению, так делают процентов 5 из общего числа.

Ситуация сейчас следующая.

Большинство строит решения на базе зарубежных облачных моделей вне зависимости от условий задачи. Это их единственная опция так сказать, они другое не умеют.

Меньшая часть разворачивает открытые веса небольших моделей пытаясь без обучения, чистым промт-инжиниренгом поднять точность, с переменным успехом.

Единицы разворачивают дообученные небольшие модели локально или в российских облаках.

Это правильный подход, но тут в большинстве случае развертывание небольшой дообученной модели локально выигрывает по совокупности факторов у развертывания этой же модели в облаке на дистанции от 1.5 лет эксплуатации.

А тк большинство считает TCO на 3 года, то там выгода еще больше.

Отвечу по пунктам:

1) Мы нигде не заявляли, что предоставляем ИИ-инференс. Это высокотехнологичный процесс, который с приемлемой маржинальностью могут позволить себе только гиганты вроде Selectel или MWS. С последними, к слову, сотрудничаем в рамках тех проектов, где у клиентов есть данные, требующие особого внимания по 152-ФЗ.

2) Также мы нигде не заявляли, что у нас есть собственная LLM-модель, если под "внедрить ваше же готовое решение без подписок" вы подразумевали именно это. При необходимости занимаемся файнтюнингом существующих моделей, но это очень нишевая история и у нас в данный момент нет продукта, основанного на модели такого рода.

3) Многие облака вполне соответствуют 152-ФЗ, как уже написали другие комментаторы. Например, облако наших партнеров MWS Model Hub

Если ИИ-инференс вы клиентам не предоставляете, модели не дообучаете под клиентов (или делаете это редко), то что вы продаете под соусом ИИ-автоматизацией бизнеса?

Мне действительно интересно, ведь если брать готовую модель как есть и разворачивать в облаке, то там остается настройка условного n8n и написание системного промта.

Или я вас неправильно понял?

Не совсем так. Модель — это просто процессор, а мы строим вокруг нее работающую систему. Написать промпт в n8n составит примерно 5% задачи на стадии MVP. Оставшиеся 95% — выстроить RAG-пайплайн под терабайты корпоративных данных, обеспечить интеграцию с внутренними системами (1C, CRM, ERP, базы данных), отказоустойчивость, гардрайлы безопасности, контроль качества ответов, SLA и пр. Бизнес платит за то, чтобы решение стабильно экономило часы сотрудников, а не за сам факт обращения к API.

Спасибо за ответ. У меня был вопрос сугубо к качеству процессора. Я понял, что вы используете либо фронтир либо базовые модели в открытом доступе как есть и этого качества вам (вашим клиентам) хватает. Собственно это все, что я хотел понять.

Про RAG пайплайн и тд полностью принимаю и поддерживаю.

В госкорпарациях вырубили все ИИ из-за таких вот бухаглтеров, манагнров, маркетологов и иже с ними, которые начали сливать все корпоративные доки в сеть )))

Так это от неграмотности. В том числе топ-менеджеров. Если уборщица сервер из розетки выдернет, в госкорпорациях не будет уборщиц? А флешки? Телефоны с камерой и, кстати, тоже с ИИ? Вариантов случайно или намеренно слить информацию - тысячи.

Во времена золотой лихорадки зарабатывали те, кто продавал лопаты и кирки

Мне тоже близка мысль, что ИИ лучше осваивать не на абстрактном курсе, а на своей реальной задаче. Когда за час удаётся автоматизировать рутину, которую раньше каждую неделю делал руками, как по мне, отношение к инструменту меняется)

Только вот интересно, что происходит с теми, кто при добровольном формате так и не втягивается? Их просто оставляют в покое или со временем всё-таки начинают мягко подталкивать — в духе «вот Петя уже себе всё автоматизировал, а ты пока нет»?

Их просто увольняют. или сложно увольняют. но оставляют редко и только в тех конторах где в принципе уводить кого то трудно из за отсутствия очереди за забором. Но таких сейчас всё меньше и платят там хорошо если мрот.

что происходит с теми, кто при добровольном формате так и не втягивается? 

Можно стул забрать. Они получается любят, когда посложнее. Ну вот.

Пользую ИИ на работе, но в код сделаный им стараюсь не смотреть, нервы они то не железные.

Вот сейчас подумал, а что же там в бухгалтерии ускоренной тем же ИИ, скорее всего такой же писец.

Т.е. вы пишете заведомо плохой код? Может быть, еще и за деньги? И почему-то уверены, что так делают все. Ок.

Sign up to leave a comment.

Articles