Обновить

Комментарии 22

Не читая, дайте угадаю: опять считаем API за "себестоимость"?

UP:

Автор пересчитал замеренные квоты на четыре недели: у Codex получилось токенов на $536 по API-прайсу

:)

нет, я же там написал
Автор там имеется ввиду автор исследования - и дальше я написал почему это не корректно - читайте про кэш и смотрите электрисити-бенчмарк

как говорится "Красота в глазах смотрящего" - вы увидели то что хотели увидеть - но ровно это я подсветил в статье

Хорошо, виноват, буду читать! :)

Что касается официальных цифр, я бы им тоже не верил - там скорее всего наоборот преуменьшают, те же антропики сколько там триллионов себе насчитали?

да, все так - просто ровно эти "экспертные" посты что бедные ИИ-провайдеры по 500 баксов токенов в подписку за 20 пихают и побудили написать - совсем так не считаю - и в целом тут очень тяжело выудить истину - вот собрал что мог и написал)
удачного чтения!

никогда не страдал токенмаксингом, все для дела

меня смущают очень маленькие цифры в статье по фронтир моделям

4 млрд токенов за 3 недели, GLM 5.3
4 млрд токенов за 3 недели, GLM 5.3

Подскажите пожалуйста - что конкретно имеете ввиду? там большая задачка/средняя и маленькая - что то из этого? пока не до конца понятно

На моём скрине слева направо:

4 млрд токенов за 3 недели, пик 900 млн в день, в пересчёте на непрерывную работу модели 2 дня (50 часов), длина текущей сессии 7 дней, самая длинная сессия 7 дней.

Задача - взлом*, конечно, что же ещё может столько потреблять.

Декомпиляция и сравнение результата с исходным, написание и прогон тестов.

*Программа моя, но исходники утеряны.

Судя по вашей статье на фронтир моделях я упрусь в лимиты гораздо раньше. Это и смущает

Слышал, что GLM жрет в разы больше токенов на те же задачи, но это надо гуглить для надежности.

Да, раза в 2 больше токенов на задачу в сравнении с топовыми. Но 10х токенов в сравнении с ними же перебьют эту разницу. В пределах аналогичной подписки.

А если надо ещё раза в 3-4 больше то glm 5.3 flash. Я не использовал.

Тут может быть вот какая схема. В будущем (3-5 лет) чипы станут более оптимизированными под цели LLM и цены повышать не придется. А сейчас главное удержать рынок на себе, не проиграть в конкурентам.

Сговор и одновременная отмена подписок - вряд ли возможна, это уже повод для антимонопольного расследования.

Говорят, что от ускорителя не очень то и зависит. В память упирается. Скорее, программные оптимизации помогут как у deepseek V4.1

Среднестатистический подписочник делает меньше 10 запросов в день, в тот день когда вообще делает. Меньше 300 в месяц. Если считать по средней модельке типа gemini 3.8 flash то тратит меньше 3 долларов в месяц. Зачем он оплачивает подписку если то же самое ему доступно бесплатно - отдельный вопрос.

Любой активный юзер может легко сжирать сотню долларов в день по ценам апи, и бесплатные версии у него заканчиваются за 2 минуты.

Тоже есть такое ощущение - но статистику такую не встречал, если встретите такое - пришлите пожалуйста ссылку, будет интересно почитать

Что такое запрос? Если по упомянутой Electricity Bench то в среднем 3 минуты на запрос.

А если агентская задача изменить функционал, запустить блок playwright E2E тестов, проверить ошибки и исправить, то у меня в среднем 30 минут (15-200 минут).

10 таких запросов это весь рабочий день.

Да просто скорее по среднему берут, многие платят по 20$ и не используют и на 2

>интересно, что очевидный функционал по переезду от конкурента со всеми потрохами пока есть только у Gemini

Может быть потому, что такой очевидный функционал на столько очевиден, что он просто не нужен? Работаю одновременно клодом и кодексом, когда у тебя всё вынесено в единый репозиторий скилов, про которые оба знают, то вообще без разницы, кого в конкретный момент времени вызывать.

Ну я бы сказал что вы уже разобрались - большинство не-айтишных друзей у меня особо не разбирались что там внутри и им актуально

С другой стороны можно тот же codex попросить перенести gemini

Таблица с ограничениями не точная. У ChatGPT ограничения на 5 часов есть только в подписке за 8$ и 20$, на следующих подписках - на данный момент только недельные лимиты на все модели кроме 5.3 Codex Spark - у неё есть 5ти часовой лимит. (Но её все равно не возможно использовать, при очень высоком (~1000)TPS - очень маленькое контекстное окно).

Ну и ещё небольшое дополнение. Лимиты по ощущениям не то чтобы как-то линейно привязаны к количеству токенов. Потому что Astra потребляет токенов в ~3 раза меньше чем 5.6 Sol, по API стоит в ~2.5 раза дороже. Но на одинаковых настройках лимит выбирает определенно быстрее, при чем как будто-бы раза в 2.

Но все это усугубляется тем что взаимодействие с моделями постоянно тюнят и иногда бывает что расход токенов увеличивается кратно. После чего обычно приходит Tibo и дает сброс этих лимитов. Так что замеры даже в 2-3 соседних дня на одинаковой задаче могут отличаться разительно. Более или менее точно замерить это можно только на моделях которые перестали развивать, как мне кажется.

Час назад сессия 5x астры подходила к 1% недельному лимиту, я уже приготовился ресетить, а она сама снова 100% стала.

Наверное ИИшка не смогла оценить распределение использования токенов подписчиками, вот и пришлось сочинять бурные фантазии про "а сколько это будет в пересчете на АПИ, если я буду выжимать из подписки все до последнего токена каждый день месяцами". Кэп подсказывает, что так делают доли процента пользователей.

Конечно, и интересно понять общую картину - чем я и пытался заняться

имха надо начинать со статистики использования подписок вообще.

Потом считать себестоимость токенов и структуру расходов.

И только после этого считать себестоимость токенов.

Но мне тут кэп подсказывает что все это(в отличии от пересчетов одних тарифов в другие основываясь на предположениях) - закрытая инфа. Поэтому имха либо искать инсайды, либо расслабиться и тратить токены. :)

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации