Обновить

Комментарии 5

(со вздохом и смотря вверх): Триста тридцать пять (с) ДМБ

Сейчас есть 2 тренда:

  1. Цены на подписки растут и будут расти, т.к. Antropic до сих пор не показывает прибыль.

  2. Китайские модели с открытыми весами не только становятся компактнее, но и уверено сокращают дистанцию до фронтирных моделей по качеству.

Исходя из этого рассмотрим вариант self-hosted решения для компании с командой из тридцати разработчиков, которые используют модели от Antropic.

Выбор модели

Возьмем для примера свежую модель Qwen3.8-27B, которая обучалась с уклоном в нужную нам сферу.

Qwen3.8-27B превосходит Claude Opus 4.6 Max на 16 из 24 бенчмарков, сильнее всего в агентном кодинге (SWE-bench Pro: 61.7 против 53.4), следовании инструкциям (IFBench: 79.5 против 62.5) и работе с компьютером (OSWorld-Verified: 84.3 против 72.7).

При этом она проигрывает на задачах, завязанных на чистые знания, например, Humanity’s Last Exam (30.8 против 40.0), но как раз это нам не важно.

Независимая проверка LLM Stats показывает, что модели идут почти вровень (45.2 у Opus против 45.4 у Qwen). Т.е. по синтетике модели сопоставимы по качеству. Уровень Opus 4.6 Max более чем достаточен для ежедневной разработки.

Квантование FP8 (~28 ГБ весов) является эталоном для использования, с учетом необходимости KV-кеша (Q8_0) и максимального контекста (262К) нам понадобятся карты уровня NVIDIA RTX PRO 5000 Blackwell 48GB.

Общая формула расчета количества карт для комфортной работы разработчиков:

(кол-во разработчиков) / 10 + 1 => 30/10 + 1 = 4 карты

С учетом кеша и батчинга, а также неравномерности нагрузки от разных разработчиков этого будет достаточно.

Одна такая карта сейчас стоит 1 133 100 руб/шт. Я взял первую ссылку в гугле, уверен, что можно найти дешевле, но сейчас считаем максимально “неудачный” по средствам вариант.

Стоимость железа (CAPEX)

4шт RTX PRO 5000 Blackwell (1 133 100 руб/шт) 4 532 400 руб

Сервер (2U/4U, CPU, ОЗУ, БП, охлаждение под 4 карты) ≈ 1 500 000 руб

Внедрение: развёртывание inference-стека (vLLM/TensorRT), интеграция с IDE, тестирование ≈ 700 000 руб

CAPEX итого ≈ 6 730 000 руб

Веса самой модели открыты и бесплатны для использования.

Ежемесячные расходы (OPEX)

Электричество (4шт 300 Вт GPU + сервер, ~1,7 кВт, почти круглосуточно) ≈ 10 000 руб

Администрирование (0,3-0,5 ставки ML/DevOps-инженера на поддержку, мониторинг, обновление модели) ≈ 100 000 руб

OPEX итого ≈ 110 000 руб/мес

Стоимость подписок по методике статьи (30 разработчиков, Claude Max $200)

На человека/мес

Счёт от лучшего агента (БизнесПэй, курс ЦБ +15%) = 19 984 руб

То же с учётом экономии на налоге на прибыль = 14 988 руб

На 30 человек/мес

Счёт от лучшего агента (БизнесПэй, курс ЦБ +15%) = 599 520 руб

То же с учётом экономии на налоге на прибыль = 449 640 руб

На 30 человек/год

Счёт от лучшего агента (БизнесПэй, курс ЦБ +15%) = 7 194 240 руб

То же с учётом экономии на налоге на прибыль = 5 395 680 руб

Для сравнения: если бы платили через худшего агента (Global Payments из статьи), было бы дороже ещё на ~70%.

Окупаемость (ROI/payback)

Экономия в месяц = (стоимость подписок, которую перестали платить) − (OPEX своего железа):

По валовому счёту агента (599 520 руб) ≈ 489 520 руб ≈ 14 месяцев

По чистой стоимости после налога на прибыль (449 640 руб) ≈ 339 640 руб ≈ 20 месяцев

То есть окупаемость около 1,5 лет, что вполне достойно.

Совокупная стоимость за 3 года:

Своя инфраструктура (CAPEX + OPEX) ≈ 10,7 млн руб

Подписки через лучшего агента (чистая стоимость) ≈ 16,2 млн руб

Подписки через лучшего агента (валовая) ≈ 21,6 млн руб

И это при условии что стоимость подписок не вырастет со временем.

Вывод

Делайте сами.

Вау, спасибо за такой детальный расчёт

Согласен, что большую часть бытовых задач уже можно решать опенсорсными моделями

Тем не менее, фронтирные модели вроде Fable или Astra, вокруг которой в последние пару дней столько шума, гораздо лучше будут справляться со сложными задачами

Предполагаю, что крупные команды действительно, с большой вероятностью, будут разворачивать локальные модельки, чтобы решать с их помощью большую часть задач, но какой-никакой расход на доступ к SOTA сохранится

Тем не менее, фронтирные модели вроде Fable или Astra, вокруг которой в последние пару дней столько шума, гораздо лучше будут справляться со сложными задачами

Я не вижу в потоковой разработке таких сложных задач, для которых нужны эти модели. Их просто нет. Исключение разве что в написании низкоуровневых драйверов. А уж веб-разработку локальные модели перекрывают с запасом.

Даже код параллельных вычислений на NVIDIA CUDA (вот где геморрой с правильным пиннингом памяти и расчетом грида) локальные модели уже достойно пишут.

но какой-никакой расход на доступ к SOTA сохранится

Безусловно, он сохранится в R&D задачах, правда они редки в массе своей и будет достаточно одной-двух подписок. Через год-полтора и эту часть будут полностью покрывать локальные модели.

Уже сейчас правильно построенный harness для R&D задач показывает уровень Fable (на части задач даже опережает Fable! Mythos по понятным причинам не тестил).

Я не знаю что Антропики будут со всем этим делать. Бизнес в массе своей (да и многие разработчики) пока не знают о том что Антропики практически потеряли лидерство, а китайцы догоняют их семимильными шагами. Одно дело маркетинг и синтетические бенчмарки и совсем другое практические тесты на реальных задачах.

Илья, спасибо за тесты платежных систем, часто информация на сайтах скромно умалчивает все комиссии, и пока не проведешь платеж - не знаешь сколько это будет стоить!

Антон, пара уточняющих вопросов. Тоже думал над своим железом, но

  • иметь единственный сервер - достаточно большой риск, нужен второй на время переустановки моделей и на случай неисправностей первого, а это 1,5 - 2 раза увеличивает затраты

  • закладываться на 2-3 года вперед, когда модельки выходят чуть ли каждый месяц - по мне тоже рискованно, так популярные недавно H100 уже не слишком подходят для последних моделек, B200/B300 тоже могут через пару лет стать анахронизмом. Как вариант железо можно арендовать - это дороже чем купить свое, но решает вопрос со сменой конфигурации и бэкапом.

  • у меня не только задачи кодинга, но работа с текстами, и база знаний по проекту разрастается достаточно быстро, с окном 128к работать сложно - надо часто перегружать сессии, а это и время и токены. Окно 1М значительно комфортнее и быстрее. Я подозреваю что для больших проектов, где уже много кода и документации, также окно в 1М необходимо по крайней мере для написания ТЗ. А окно в 1М еще в 1,5 - 2 раза дороже.

Для себя сделал вывод, что свой/арендованный сервак нужен только тогда, когда никак нельзя делиться своим кодом, а в остальных случаях проще подписка через свое зарубежное ИП или платежные системы.

  • иметь единственный сервер - достаточно большой риск, нужен второй на время переустановки моделей и на случай неисправностей первого, а это 1,5 - 2 раза увеличивает затраты

Не встречал такого резервирования. Общий подход к LLM-серверу ничем не отличается подхода к серверу БД или, например, 1С. Вы же не делаете полное дублирование сервера для бухгалтерии, вместо этого используете бекапы. Тут тоже самое, те же бекапы и стандартное обслуживание ОС.

Сама модель это несколько файлов на диске с весами и конфигами и время ее разворачивания примерно равно времени пока эти файлы скопируются на диск в нужную папку.

  • закладываться на 2-3 года вперед, когда модельки выходят чуть ли каждый месяц - по мне тоже рискованно, так популярные недавно H100 уже не слишком подходят для последних моделек, B200/B300 тоже могут через пару лет стать анахронизмом. Как вариант железо можно арендовать - это дороже чем купить свое, но решает вопрос со сменой конфигурации и бэкапом.

С одной стороны вы правы, но тут есть нюанс. Производители железа (видеокарт) пекут новые карты как горячие пирожки и заинтересованы в несовместимости форматов. Но это формат, те, например, выходит модель в новом MXFP4 формате, который поддерживают карты начиная с Blackwell семейства, а остальные просто используют ненативную поддержку те либо модель работает чуть медленнее, либо будет занимать чуть больше места в памяти, но будет работать.

Все эти новые форматы пытаются уменьшить размер и вычисления пытаясь представить веса модели меньшим количество чисел до и после запятой. И они уже уперлись в предел. Подробнее об этой гонке я писал здесь.

Помимо этого, сами разработчики моделей теперь стремятся сделать модели одновременно меньше и быстрее за счет инновации в архитектуре моделей, а не в ее квантовании. Поэтому на современных картах ближайшие 6-8 лет проблем с запуском не будет.

Для примера, все модели вышедшие до сегодняшнего дня и помещающиеся на мою карту запускаются без проблем, а она была произведена в декабре 2020 года, т.е. почти 6 лет назад.

  • у меня не только задачи кодинга, но работа с текстами, и база знаний по проекту разрастается достаточно быстро, с окном 128к работать сложно - надо часто перегружать сессии, а это и время и токены. Окно 1М значительно комфортнее и быстрее. Я подозреваю что для больших проектов, где уже много кода и документации, также окно в 1М необходимо по крайней мере для написания ТЗ. А окно в 1М еще в 1,5 - 2 раза дороже.

Вы не совсем правильно строите свою систему. Попытка положить вообще все в контекст это тупиковый путь. Вам необходима RAG-система с контекстуальным чанкингом. Я работаю с моделями на 262К контекста и его полностью хватает.

Почитайте о RAG-системах, думаю вы поймете как использовать их в своей работе. Я целые юридические отделы на них перевожу и ИИ-ассистент выдает информацию со точным ссылками на конкретные законы/акты и нормативные документы.

Тоже самое с внутрикорпоративными порталами, могу показать простой демо пример на обезличенных данных.

Помимо такой организации базы знаний по проекту полезно заставить харнесс написать скиллы по конкретной кодовой базе проекта и использовать их. Тогда и контекста хватает и качество отличное.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации