Эх 27B медленный конечно 27tps всего, Вот если бы они сделали версию MoE 35B - Qwen3.6 35B A3B то цены бы ему не было. Хотя он и в 2bit квантовании от Unsloth очень неплох. Но занимает 10ГБ.
Сильно зависит от задачи. Например для некоторых данных проще использовать реляционную базу данных, скил и хелпер скрипты для получения данных и обновления и в таком варианте ллм может работать лучше с структурированными и с точными данными.
Немного не в тему статьи, но в тему ПК для Апокалипсиса и сжатия страниц и википедии, вспомнился такой древний бенчмарк архиваторов от Matt Mahoney который до сих пор обновляется. Там собраны все лучшие известные архиваторы и сделаны бенчмарки на 1GB текстов Английской Википедии. Есть замеры времени сжатия и распаковки, использования оперативки и размера архиватора. Тем кто захочет сжимать Википедию возможно будет полезно)
Я для этих целей использую KaraKeep. Это self-hosted bookmark приложение, которое позволяет сохранять ещё и текст и искать по нему и создаёт саммари и тэги для страниц с помощью ИИ. И есть режим чтения сохранённого текста. Да, бывает часто что страницы и информация пропадают и это позволяет сохранить информацию, не всё, но хотя бы основной текст сайта.
Странный какой-то калькулятор, видимо он считает только цены использования моделей через API ? И не учитывает подписки? Я не использую через API - это будет сильно дороже. А использую подписку и подключаюсь через Oauth. OpenAI разрешили использовать подписки для подключения внешних тулов таких как OpenClaw, Codex и т.д.
Отнюдь))) Подписка ChatGPT Plus за $20 в месяц с Codex. Лимиты там большие. Повесил на одном аккаунте и VSCode и OpenClaw и в лимиты дневные и недельные не упираюсь. Сейчас уже пользуюсь моделью GPT 5.4 на ней тоже в лимиты не упираюсь. Ниже в коментах аналогичный опыт люди описывают.
Пользуюсь Кодексом, но 5.3 версии с утра до вечера по работе. Редко выбираю больше 30% лимита и к вечеру ещё процентов 70% остаётся + OpenClaw на нём же висит. Хотя если стаи агентоа пачками запускать, то можно и лимит наверное увидеть)
Что-то зачастили) То Y-Combinator своего рабочего агента выпустил, теперь Cloudflare. Все хотят кусок от пирога OpenClaw и Hermes откусить.
Эх 27B медленный конечно 27tps всего, Вот если бы они сделали версию MoE 35B - Qwen3.6 35B A3B то цены бы ему не было. Хотя он и в 2bit квантовании от Unsloth очень неплох. Но занимает 10ГБ.
Теперь нужно запустить Дум на карте проездной от метро.
Взяли бы тогда Python, его ИИ поддерживает хорошо))
Много букв сейчас разных понаделали. Ещё MLP есть - Minimal Lovable Product - не обделённый любовью продукт)
И мамы Била Гейтса которая работала вместе с исполнительным директором IBM. Я думаю комментатор выше это имел в виду говоря о случайностях.
Сильно зависит от задачи. Например для некоторых данных проще использовать реляционную базу данных, скил и хелпер скрипты для получения данных и обновления и в таком варианте ллм может работать лучше с структурированными и с точными данными.
В 24GB VRAM прикрасно влезут и свежие Qwen3.5-3.6 27B и 35B и будут сильно лучше чем устаревший Mistral 7B.
Немного не в тему статьи, но в тему ПК для Апокалипсиса и сжатия страниц и википедии, вспомнился такой древний бенчмарк архиваторов от Matt Mahoney который до сих пор обновляется. Там собраны все лучшие известные архиваторы и сделаны бенчмарки на 1GB текстов Английской Википедии. Есть замеры времени сжатия и распаковки, использования оперативки и размера архиватора. Тем кто захочет сжимать Википедию возможно будет полезно)
https://mattmahoney.net/dc/
Я для этих целей использую KaraKeep. Это self-hosted bookmark приложение, которое позволяет сохранять ещё и текст и искать по нему и создаёт саммари и тэги для страниц с помощью ИИ. И есть режим чтения сохранённого текста. Да, бывает часто что страницы и информация пропадают и это позволяет сохранить информацию, не всё, но хотя бы основной текст сайта.
Похоже быстрее будет несколько раз спросить Qwen и поправить ошибки если будут чем один ответ дождаться от glm.
Если делать такой бенчмарк(сравнение), то ещё с учётом скорости ответов надо.
Или Психиатр)
Шестой сделай сам)
Можно ещё Qwen3.5 27B или 35B попробовать.
Ну если взять llm-ку которую запускали на ZXSpectrum И ... )))
Нужно по другому показателю смотреть, что программисы стали больше спать и отдыхать, ну или "залипать" в тиктоках)))
Странный какой-то калькулятор, видимо он считает только цены использования моделей через API ? И не учитывает подписки?
Я не использую через API - это будет сильно дороже. А использую подписку и подключаюсь через Oauth.
OpenAI разрешили использовать подписки для подключения внешних тулов таких как OpenClaw, Codex и т.д.
Отнюдь))) Подписка ChatGPT Plus за $20 в месяц с Codex. Лимиты там большие. Повесил на одном аккаунте и VSCode и OpenClaw и в лимиты дневные и недельные не упираюсь. Сейчас уже пользуюсь моделью GPT 5.4 на ней тоже в лимиты не упираюсь. Ниже в коментах аналогичный опыт люди описывают.
Пользуюсь Кодексом, но 5.3 версии с утра до вечера по работе. Редко выбираю больше 30% лимита и к вечеру ещё процентов 70% остаётся + OpenClaw на нём же висит. Хотя если стаи агентоа пачками запускать, то можно и лимит наверное увидеть)
Где?