Информация
- В рейтинге
- 516-й
- Зарегистрирован
- Активность
Специализация
Десктоп разработчик, Фулстек разработчик
Ведущий
Java
C#
C++
Объектно-ориентированное проектирование
.NET
Разработка программного обеспечения
Алгоритмы и структуры данных
Visual Studio
Благодарю вас, за наставление!) Внедрю!
Благодарю, учту.
Благодарю, учту.
С нетерпением буду ждать!
Плюсую за 2 раздел с харнессами.
По расчёту две придирки.
Первая: API взят в самом невыгодном для него виде. Ни кэша промпта, ни batch, ни роутинга по моделям. При r=10:1 весь счёт — это вход, а кэш бьёт именно во вход. Плюс базлайн по Opus: в проде никто не гоняет весь трафик на топовой модели, обычно дешёвая + фронтир на сложном хвосте. На ваших же цифрах: против Opus порог ~1,3 млрд токенов/мес, против микса с Haiku — уже ~6,4 млрд, с кэшем ещё вдвое. Порог сдвигается почти в десять раз. То есть вы свой же вывод недооценили и он получается жёстче.
Вторая: утилизацию нельзя крутить свободно, её держит латентность. При U→1 очередь съедает p95, реальный потолок 60-70%. И, кажется, это и есть ответ на вопрос, почему провайдер выигрывает: не «нагрузка больше», а он держит высокую загрузку, не ломая latency, за счёт тысяч тенантов. Один арендатор так не умеет.
И момент по энергии: PUE применён к одним GPU (5,6×1,4), а остальная нода потерялась — CPU, вентиляторы, сеть. По факту забор 10-11 кВт, с PUE ~14-15. На итог это не влияет, но там ещё и модель оплаты другая: при аренде стойки в дата-центре платят не за фактические киловатт-часы, а за оговорённый лимит мощности. А 15 кВт на стойку - это уже серъезно.