
Комментарии 14
Некоторые модели, такие как DeepSeek Pro или GLM, не поддерживают изображения.
Потраченные мною 500 миллионов токенов – это примерно 1000 долларов, если пользоваться моделями не через подписки.
А где дипсик по подписке доступен?
Он доступен в OpenCode Go и в Ollama Cloud


Это все замечательно, а вы сами то что покупали? :)
Вот вы на OpenCode Go сослались - по их же расчетам для типичного использования ваши 500кк на deepseek v4 pro обойдется в $5.29 без всяких подписок. И Go не x10, просто дают $60 лимита (с ограничениями) за $10.
500 миллионов токенов звучит мощно, но почти все они улетят в кэш :)
Это все замечательно, а вы сами то что покупали? :)
Я использовал роутинг через Manifest (даже попытался законтрибьютить в него, но увы). Благодаря ему я и увидел, сколько токенов было израсходовано суммарно.
Модели и способы оплаты использовались разные.
Сначала я расходовал лимиты подписок, которые в основном использовал для кодинга (Claude Code и Codex). Позже добавил более дешёвые варианты через OpenCode и Ollama. Когда и их не хватало, последним fallback-уровнем был OpenRouter.
Сейчас у меня домашняя лаборатория не работает, поэтому актуальную конфигурацию я показать не смогу, но ниже прикладываю скрин того, как роутинг был настроен, когда я пытался сэкономить.

В частности, я выяснил, что на такой конфигурации из одной подписки OpenCode можно выжать 60 миллионов токенов. Но там в основном довольно слабые модели. С ними можно делать совсем простые повседневные вещи, но что-то серьёзное уже вряд ли.
И ещё по вашему расчёту. Если считать по средней цене модели с нормальным балансом цены и качества (например, GPT-5.6 Terra), что примерно соответствует моему смешанному использованию разных моделей, то итоговая оценка будет заметно ближе к сумме, указанной в статье.
А почему с кодингом плохо? Вроде же там просто вызов соответствующей модели с промптом по сути? Репо подключается и индексируется. Сам hermes что-то делает с результатами?
Все зависит от модели
Я пробовал там много разных, начиная от минимакс 2.7 и Кими 2.6, заканчивая всеми моделями Open ai( 5.3, 5.4, 5.5, 5.6 sol )
Минимакс был очень плох, постоянно уходил в циклы
Кими уже можно было пользоваться и решать задачи
Гпт 5.5 был прям очень мощным, хорошо держал задачу и доводил до конца
Плюс сам опыт отличался, слабые модели не используют весь потенциал гермеса
Это я вам говорю как человек, который ежедневно тратит по 2млр токенов на гпт 5.6 сол
Правда я сам ушел обратно в кодекс, т.к. он работает тупо быстрее и тратит меньше токенов на задачу
А у вас агент от начала и до конца выполнял задание? Какой размер контекста требовался для выполнения задачи? У меня, сначала задача делится на подзадачи так, чтобы ожидаемый размер контекста на выполнение был процентов на 20 меньше ожидаемого размера контекстного окна модели. Так сразу стало гораздо меньше глюков.
Хотя тут даже не в том, что контекст не влезает, а что теряется внимание к середине контекста.
Так а какие задачи вы решали через Hermes?
Я для себя понял, что проще запустить агента с нужными MCP и просто через него делать ту рутину, которую предлагается решать через Hermes/OpenClaw. Да, это не в чате телеграма, но будто это даже лучше.
Хорошая статья, но многие описанные проблемы не из-за гермеса, а из-за использованных с ним моделей. Так, весь блок про хорошо/плохо кодит - почти полностью упирается в использованные модели, гермес просто их использует
Я думаю, дело здесь вообще не в модели. Когда всё происходит в кодовом агенте, процесс планирования и дизайна идёт в более явном и строгом виде. Перед реализацией можно было бы сначала проверить эндпоинт и все доступные операции, а потом дать чёткую задачу агенту (оберни это в MCP и протестируй).
Когда такой агент закончил бы, я бы посмотрел на кодовую базу, проверил, полную ли он сделал обёртку и реальные ли тесты написал. В итоге получился бы качественный MCP-сервер, который потом можно подключать куда угодно.
В моём же случае с Hermes сам процесс работы не подразумевал такой строгости и наблюдаемости. Я ему, по сути, поставил задачу на продуктовом языке, далее как-то обсудил техническую сторону, а потом он начал через миллион агентских вызовов кодировать, тестировать и клепать костыли.
При этом, несмотря на всю продвинутость, Hermes даёт мало инструментов для наблюдаемости получаемых результатов. То есть я ни дифы не могу посмотреть, ни структуру проекта. Мне так или иначе приходится залезать на сервер и смотреть через lazygit, nvim и yazi, что он там наделал. А это, мягко говоря, далеко от идеи универсального агента, в которого можно кинуть любую задачу, и он её качественно решит.
Короче говоря, всё это в совокупности приводит к ощущению, что Hermes является лишней прослойкой в кодировании. То есть опять же дело не в модели. Вдобавок он тянет в разработку весь свой harness, который добавляет накладные расходы и непредсказуемость.
Настоящая причина здесь не в том, что скиллы плохо срабатывают, а в том, что описание архитектуры и запретов внутри скилла – это просьба к модели, а не ограничение. Любую просьбу, живущую в тексте, который агент сам же и читает, он волен проигнорировать в любой сессии. Защита работает только уровнем ниже: отдельная учётка без прав на gateway и Caddy, сеть, где агент физически не дотягивается до того, что даёт ему доступ. Тогда "это не трогай" превращается из вежливой надписи на двери в стену.
Согласен.
Но мне кажется, тут тоже есть важный краевой случай. Например, если бы я ему не дал доступ к основной Proxmox-машине, то ему было бы значительно сложнее диагностировать и определять, какие действия нужно сделать, чтобы прокинуть GPU.
То есть, по факту, чем сильнее ограничения у агента, тем менее деструктивны возможные последствия. Но, с другой стороны, если ему не дать достаточно свободы, то трудные и рутинные действия снова упадут на юзера.
Автоматизация ценна только тогда, когда её можно предсказать. Если процесс нельзя гарантированно повторить дважды с одинаковым результатом, это баловство, а не инструмент. Если после недели настройки ты всё ещё боишься оставить иснтрумент без присмотра, значит ты автоматизировал не работу, а собственный контроль над ней.
Автоматизация ценна только тогда, когда её можно предсказать. Если процесс нельзя гарантированно повторить дважды с одинаковым результатом, это баловство, а не инструмент. Если после недели настройки ты всё ещё боишься оставить иснтрумент без присмотра, значит ты автоматизировал не работу, а собственный контроль над ней.
Так это не автоматизация, а делегирование.
Человека/сотрудника/джуна/etc можно попросить сделать что-то, но нельзя гарантировать, что он сможет повторить это дважды с одинаковым результатом. И после недель брифинга и онбоардинга такого человека, внезапно, надо контролировать результаты, особенно первое время, а потом контроль остается, но становится все более и более быстрым/поверхностным по мере роста доверия/уверенности в результате.
Hermes оказался для меня игрушкой