Обновить

Сколько на самом деле стоит решённая задача: считаем экономику self-hosted моделей vs API токены

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели11K
Всего голосов 9: ↑9 и ↓0+15
Комментарии14

Комментарии 14

Такое ощущение что вы делали расчеты исключительно теоретически, без оглядки на практику и реальность.

В расчетах абсолютно не учтены токены попавшие в кеш, а, в зависимости от использованного агента и задачи соотношение новых и кешированных может отличить на порядок.

Почему кеш важен, потому что self-hosted решения стоят не за токены, а за время работы, а кеш токены время практически не требуют (миллисекунды против минут) и математика их стоимости завязана на нехватку памяти под кеш при многопользовательском использовании (модель провайдеров). Если вы один пользователь, для вас кеш почти бесплатен (до определенного уровня).

Еще почему алгоритм (используемый агент и задача) так же важны, они определяют, есть ли принципиальная возможность распаралеливать запросы, или большую часть времени ресурсы машины будет поставить или утилизированы не полностью.

И ещё пример, swe и прочие агенты тупо складируют всю информацию в контекст, до его исчерпания (режим диалога, это кстати сильно использует кеширование), затем запускают сжатие и... скорее всего после этого идёт провал. А вот к примеру letta сжимает контекст постоянно, это ломает кеш, увеличивает токены генерации но контекст не растет так сильно. Эти два противоположных подхода будет стоить по разному у провайдера и на своем железе.

Если вы запускали swe-bench на своем железе, поделитесь пожалуйста полным логами и статистикой, что бы делать расчет правильно.

Спасибо за комментарий!

Про кэш - действительно упустил этот момент. В self-hosted мы платим за время работы железа, а не за токены, поэтому для одного пользователя закешированный префикс практически ничего не стоит, пока хватает KV-памяти. У API-провайдеров «стоимость кэша» появляется в основном потому, что память приходится делить между большим количеством клиентов. Помимо этого Я специально прайсил API в самом дорогом виде: без кэша, батча и роутинга, => в самом выгодном для self-hosting сценарии. И раз даже так API выигрывает, вывод не ломается

Насчёт параллелизма тоже согласен. Сколько реальной конкуренции получится набрать, зависит не только от модели, но и от самой задачи и того, как устроен агент. Иногда железо загружено , а иногда часть времени простаивает, именно это я и пытался спрятать в коэффициент утилизации U.

Что касается цифр в self-hosted, тут всё честно: я специально пометил их как иллюстративные, потому что полноценный end-to-end прогон SWE-bench на своём железе ещё не делал. Придумывать результаты не хочу. Когда сниму нормальные замеры (cache hit rate, prefill/decode, достигнутая конкуренция и всё остальное), выложу их во второй части. Если есть замечания по методике - с удовольствием обсужу заранее.

На своём железе запускают квантованные версии, а не исходные. Соответственно расходы будут в 2-4 раза меньше.

Это для дома может копейки считают, а крупной конторе смысл экономить на дистиллятах?

Нода 8×H200 HGX при покупке — примерно $320–420 тыс. (типично ~$370 тыс., то есть ~$46 тыс. за GPU).

В статье речь о промышленном оборудовании. На домашнем железе экомика будет считаться совсем по-другому, если вы не фрик.

Part 3. Что формула не ловит

Формула не ловит, что для огромного количества задач в бизнесе вообще не нужны топовые модели, достаточно 30-80B моделей в Q8. Их качества после файнтюнинга под специфику конкретного бизнеса хватает с головой для решения поставленных задач.

Полностью поддерживаю. Многое зависит от задач и сценариев использования. В статье скорее речь идёт об использовании топовых моделей. Обучение или же использование специально обученных моделей это совсем другая история. Для многих приенений достаточно смартфона.

Полностью согласен. Статья только про верхний сегмент лидербордов, а для массы бизнес-задач 30 80B в Q8 с файнтюном под домен закрывают эти задачи. Но все же статья не о них

Мамкин Майнер, почему нет ссылки на твой проект? Нече что у тебя будет 20-59 токенов в секунду? А скорее 7?

Вы, похоже, перепутали иллюстративный параметр с результатом измерений. В статье единственное упоминание T = 5000 ток/с прямо сопровождается пометкой «иллюстративно, заменить измеренными». Это не замер производительности, а параметр для примера на графике. Чисел 7 или 20–59 ток/с в статье вообще нет

Плюсую за 2 раздел с харнессами.

По расчёту две придирки.

Первая: API взят в самом невыгодном для него виде. Ни кэша промпта, ни batch, ни роутинга по моделям. При r=10:1 весь счёт — это вход, а кэш бьёт именно во вход. Плюс базлайн по Opus: в проде никто не гоняет весь трафик на топовой модели, обычно дешёвая + фронтир на сложном хвосте. На ваших же цифрах: против Opus порог ~1,3 млрд токенов/мес, против микса с Haiku — уже ~6,4 млрд, с кэшем ещё вдвое. Порог сдвигается почти в десять раз. То есть вы свой же вывод недооценили и он получается жёстче.

Вторая: утилизацию нельзя крутить свободно, её держит латентность. При U→1 очередь съедает p95, реальный потолок 60-70%. И, кажется, это и есть ответ на вопрос, почему провайдер выигрывает: не «нагрузка больше», а он держит высокую загрузку, не ломая latency, за счёт тысяч тенантов. Один арендатор так не умеет.

И момент по энергии: PUE применён к одним GPU (5,6×1,4), а остальная нода потерялась — CPU, вентиляторы, сеть. По факту забор 10-11 кВт, с PUE ~14-15. На итог это не влияет, но там ещё и модель оплаты другая: при аренде стойки в дата-центре платят не за фактические киловатт-часы, а за оговорённый лимит мощности. А 15 кВт на стойку - это уже серъезно.

Большое спасибо за комментарий, почти со всем согласен, по поводу кеша честное упущение. Я специально прайсил API в самом дорогом виде: без кэша, батча и роутинга, => в самом выгодном для self-hosting сценарии. И раз даже так API выигрывает, вывод не ломается. Но все равно с моей стороны упущение не упомянуть и не добавить это в формулу. Планирую вторую часть, где учту это и остальные замечания, а также выложу личные замеры на разной технике

С нетерпением буду ждать!

Спасибо за статью. Возник только один вопрос. В чем проблема перепродавать токена во время явной просадки потребности. Да, все не продадите. Но даже часть сильно изменит экономику. Сейчас горы площадок как русский опен роутер. Судя по доступным там моделям им точно партеры лишними не будут с оборудованием

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации