Комментарии 16
В других компаниях эти расчеты разбиваются о фактор ИБ (комплаенс) и сценарии использования:
Выбор между свой картой и облачным API в большинстве случаев вообще не является выбором. Закрытые данные, коммерческую тайну, ПДн и банковские контуры физически и юридически нельзя отправлять в публичные сторонние API (кроме нескольких российских провайдеров). Для компаний с четкими регламентами ИБ опции “взять API OpenAI/Anthropic” просто не существует, поэтому выбор On-Premise предопределен требованиями безопасности, а не ценником за 1M токенов.
Железо покупается не для того, чтобы 6 человек из команды заходили раз в день погонять промпты по 15 минут. Локальные карты берутся под постоянные фоновые процессы, автоматизированные пайплайны, агентов, ETL и различные сервисы с постоянным обращением (чат-боты поддержки, маршрутизаторы входящих данных от клиентов и тд и тп). Там утилизация совсем другая и экономика начинает работать иначе.
Сведения выбора инфраструктуры только к сравнению стоимости токена “на холостом ходу” в отрыве от безопасности контура, контроллируемости задержек и владения данными это классическая экономия на спичках.
Ага, статья ровно этим и заканчивается. Если данные нельзя выпускать из контура, экономику можно вообще не считать, вопрос решен, остается выбрать конфигурацию.
А про утилизацию у нас с вами один и тот же тезис. Цену токена определяет не то, что написано на коробке видеокарты, а какую долю суток она занята: 6 человек по 15 минут это те самые 2% загрузки, из которых и вырастают 20 726 ₽ за миллион. Кому наружу нельзя, тот карту возьмет в любом случае, а считал я не чтобы отговорить, а чтобы смета была видна заранее, вместе с инженером
Не один разумный человек не будет покупать карты серии RTX для профессионального использования AI, как всё в одном ок, но не более.
Для этого есть серии DGX и Tesla, по деньгам также выйдет но мощи существенно прибавиться.
Для этого есть серии DGX и Tesla, по деньгам также выйдет но мощи существенно прибавиться.
в каких именно тестах вы хотите заменить rtx на dgx? dgx же проиграет по всем параметрам кроме энергопотребления
Не один разумный человек не будет покупать карты серии RTX для профессионального использования AI, как всё в одном ок, но не более.
Наверное вы имели ввиду игровую серию RTX?
Потому что RTX A5000, RTX A6000, RTX A6000 Ada являются классической рабочими лошадками нормальной ML-автоматизации компаний наравне с H100/A100/V100, а NVIDIA RTX PRO 6000 Blackwell так вообще хит этого лета.
Линейки Tesla нет с 2020 года, ее переименовали в дата-центровую: A100, H100, B200. А DGX это вообще не карта, а готовый сервер целиком, на 8 карт, и стоит он сотни тысяч долларов. С 430 тысячами рублей за 5090 это расходится на два порядка, так что "по деньгам также выйдет" не сходится ни при каком курсе. Про профессиональную линейку я с вами согласен, она в статье стоит наверху: RTX PRO 6000 на 96 ГБ, и правило там прямое, выше 48 гигабайт идти в профлинейку или в облако. Но что хочу заметить, смена карты сам расчет не меняет, а наоборот усиливает. Статья не про то, какое железо быстрее, а про то, во что обходится токен. H100 в российской аренде идет по цене около 242–352 ₽ в час против 17 ₽ у купленной 5090: чем дороже железо, тем дороже каждый час простоя. Более мощная карта улучшает числитель и одновременно портит знаменатель, если загрузка не круглосуточная. Но один аргумент в вашу пользу есть, лицензия на драйвер GeForce запрещает разворачивать эти карты в дата центре. Но никто в здравом уме в дата центр игровые карты ставить не будет. А берут их все же по нескольким причинам. 5090 стоит 430 тысяч, профессиональная 6000 на 96 ГБ уже 1,05 млн, дата центровые карты дороже еще кратно. По доступности: 5090 лежит в рознице и покупается сегодня, остальное под заказ и недели ожидания, а с санкциями иногда не покупается вовсе. Задача часто не требует большего. Ну и физика, H100 просит серверное шасси с продувом и стоечное питание, а 5090 живет в обычном корпусе от офисной розетки.
RTX PRO 6000 на 96 ГБ минимум 1,2 Млн. рублей. Сейчас дороже.
Хех... Ну тем более тогда)
А в H200 NVL за 5 Млн есть смысл?
Смысл есть, но под задачи в которых 5090 не вытягивает в принципе. Ее берут за другое. 141 ГБ это модель на 70–120B целиком в одной карте, без раскидывания по устройствам, и KV кэш, куда влезает длинный конткст на десятках клиентов сразу. Плюс NVLink на 900 ГБ/с, которого у RTX нет вообщ, так же пара H200 масштабируется, пара 5090 нет. Но если нужен просто объем, он берется дешевле. PRO 6000 дает 96 ГБ. 4 таких карт это 384 ГБ примерно за те же 5 млн. Переплата в H200 идет за 4,8 ТБ/с полосы против 1,8 у PRO 6000. Генерация как раз упирается в полосу, вот там она себя и оправдывает. Поэтому смотреть надо на задачу. Идеально она ложится на dense модель 70B в проде под постоянной нагрузкой, на RAG с длинными документами и десятками параллельных клиентов, на конвейерную разметку потока, на дообучение своей модели. Везде где карта пашет без перерыва и упирается именно в память. Под чат для отдела или разовые эксперименты это перебор
Тут зависит от того как и когда считать. Например сейчас можно найти предложения аренды rtx5090 с 128гб ОЗУ и 2тб диском за 50 тысяч рублей, где то дороже может быть. В октябре 2025 года взял комп с такими же характеристиками за 350 тысяч рублей. Если запускать обучение моделей, то это работа 24/7 и за электричество в среднем оплата 5-6 тысяч рублей, собственный ПК окупится уже через 8-9 месяцев. Сейчас же такой ПК будет стоить около 750 тысяч рублей, ну и срок окупаемости в 2 раза больше. По аренде как и с своими серверами тоже не все бывает гладко, что то выйдет из строя и с технической поддержкой даже в селектеле переписка может быть 2 недели, а время затраченное на перепись никто не компенсирует.
Интересен такой вопрос: кому как вы это продаете и кто покупает когда сервисов прокси типа опенроутера пруд пруди?
Так мы железо и не продаем, мы делаем ML-проекты, и в большинстве из них выигрывает как раз API. Статья к этому и приходит: если дочитать до конца, там прямым текстом написано, что экономии особо нет и лучше взять ту же открытую модель по API, чем тратить полмиллиона на карту. Покупают железо те, кому наружу нельзя вообще: ПДн, банки, КИИ. Прокси эту проблему не решает, а как раз наоборот усугубляет, потому что в цепочке появляется еще одно лицо. Ну и те у кого круглосуточный конвейер и карта не простаивает
Еще вариант: это может быть запасным путем на случай IPO антропика и опенАИ. Цена за токен, скорее всего пойдет вверх. (Предсказуемо, аренда тоже поднимется). Но планирование на такой горизонт не всем нужно. (И разумеется, вариант без LLM с другими задачами очевиден и мимо темы.)

Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле