Об авторе
Я — Каляев Владимир из Сколтех, в основном известен технологией «Сети Каляева» для ликвидации мазута в Анапе, лицевыми щитками для COVID-19, проектом Эко112, gcodetools, соавторством образовательной программы Мастерская Инноваций. Помог многим сотням команд и тысячами проектов, научным сотрудникам, стартапам, студентам и школьникам сделать верные следующие шаги. Автор и соавтор научных статей. Первую программу написал на Yamaha MSX на Basic на черно‑зелёном мониторе.
Год назад я делал доклад в Фонде развития Интернет‑инициатив по рискам использования облачных моделей. В тот момент полноценной замены на локальном железе не было, но за этот год мир изменился и Счёты 4.0 уже доступны каждому. Что это такое, как их бесплатно получить и научиться работать — читайте в этой статье.
Для чего этим заниматься?
Первое, что приходит на ум — хранить свои маленькие секреты у себя (мы помним — вся история ваших запросов хранится и Большой Брат Смотрит На Тебя). Второе — работать много и бесплатно, например сегодня утром все модели в OpenCode превратились в тыкву:
Forbidden: {“model”:“ling-3.0-flash‑fin‑free”} или This model is not available in your country.
И главное — эту технологию у вас уже нельзя отнять.
Лирика
Когда счёты достигли совершенства? Около 150 лет назад и с этого момента они до сих пор нишево используются. Попробуйте их улучшить!
Когда калькулятор достиг совершенства? Вариант А «для продавца» (счёты v.2) — большие кнопки и 00. Вариант Б «для учёного» (100500 кнопок). Оба лет 40 не улучшаются.
Когда текстовый редактор? По моим ощущениям MS Word 97 если чуть поменять визуально, то 99.9% пользователей сейчас не заметят разницы с самым последним. Word+Excel+Базы данных и поиск это Счёты 3.0 — люди почти бросили калькуляторы, они остались только нишевым продуктом.
Сейчас онлайн‑поиск Яндекс и Google становятся Счётами 4.0 (онлайн версия), ведь сколько будет «два плюс два» можно не считать самому, а напсать это в строке поиска. И так во всём. С одной маленькой оговоркой — пока тебе дают этим пользоваться.
Кажется, сегодня наступает день когда мы подходим к такому же перелому в цифровых помощниках. И потом будут Счёты 5.0, о которых написано много научной фантастики — наша цель дожить и увидеть это своими глазами.
За дело!
Что я пробовал до этого и почему не получилось раньше?
OpenClaw как он только вышел. Первый же запрос погрузил систему в раздумье на полчаса, а десятого запроса уже не было. Фундаментальная проблема — огромные контексты и много этапов подряд, а на каждый снова огромный контекст. Не дождался и сдался. Всё что нам нравится или аморально или ведёт к ожирению, у локальных моделей примерно так же — или 1 токен в секунду для модели на 650 Gb RAM и часовые ответы на простые вопросы или крайняя тупость. Попытки саму модель просить сделать что‑то по шагам почти всегда приводят к катастрофе — результат совсем другой чем ожидалось, на пол‑пути модель забывает ключевой смысл итерационного подхода.
Первый шаг к локальному успеху
Локальная система OpenCode с моделью на сервере: платный по API за каждый токен при просьбе проанализировать локальный проект и внести в него незначительное изменение за три уточнения благополучно доел $20 со с трудом добытой заграничной карточки. Потом были DeepSeek 4 flash, MiMo, Hy3 и прочие. Все они выкладываются на короткое время — успевайте пользоваться! Важно, что каждый день у OpenCode тоже есть его собственное ограничение на объём работы, которое обходится сменой вашего IP и счётчик начинает работать заново.
Это уже полноценная система, особенно на ноутбуке, которая делает что угодно с вашими файлами — от поиска документов и написания писем, до кодинга и «разберись почему комп тормозит, сделай чтобы всё летало». Настоящий цифровой ассистент вместо живой помощницы (и мы этому радуемся?).
Что стало поворотным моментом?
Я попробовал Pi. Это очень простой агент, но у него сделано главное — сильно сокращён входной контекст и количество бесполезных итераций, в сумме это даёт ощущение «работает хорошо и быстро, помогает и справляется». Поставить просто — для Windows это Пуск > powe (кликаем на Power Shell) и пишем
powershell ‑c “irm https://pi.dev/install.ps1 | iex” или для прочих curl ‑fsSL https://pi.dev/install.sh | sh
И так — агент есть, а модели для него нет. Как так получилось? Ответ простой — все производители не заинтересованы в этом, поэтому либо ограниченный бесплатный доступ (сегодня ни один не работает, кстати) или платный или браузер который нам не подходит, так как не может пошуршать по нашим файлам и сбивается на сложной последовательности действий.
Ставим модель
На одном компьютере, с которого я пишу эти строки поработаем в режиме без GPU, только на центральном процессоре. Оперативки потратим менее 5Gb. Попробуем сделать настоящего помощника. Компьютер под Windows 10, для иных платформ изменения минимальные, любой агент справится с пол‑пинка. Начинаем!
Ставим Pi
Ставим свежий llama.cpp, на сегодня это версия b10647 для CUDA 12.4 — нас полностью устраивает (есть обратная совместимость)
Качаем Qwen3.8–4B‑Q5_K_M.gguf размером 3’161’425’184. Есть такая штука KV кеш, которая тоже очень много возьмёт. Запускаем командой без флага ‑ngl 99 (выгружать слои в GPU)
llama‑server.exe ‑m C:/dev/Qwen3.8–4B‑Q5_K_M.gguf ‑alias local‑llm ‑ctx‑size 64 000 ‑verbose
В вашей домашней папке в файле моделей нужно добавить локальный личный сервер, который запустила llama‑server
providers": { "llama-local": { "baseUrl": "http://127.0.0.1:8080/v1", "api": "openai-completions", "apiKey": "dummy", "compat": { "supportsDeveloperRole": false, "supportsReasoningEffort": false }, "models": [ { "id": "local-llm", "name": "Local llama-server (current model)", "reasoning": false, "input": ["text"], "contextWindow": 64000, "maxTokens": 8192, "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 } } ] } } }
Пробуем работать и выясняем, что система ожила. По настоящему. Всего 3–6 токенов в секунду, но она уже делает все обычные бытовые задачи, в том числе на самом простом ноутбуке! Будем честны — кофе не принесёт (но закажет с доставкой, будьте осторожны в своих желаниях!). Однако со многими иными задачами справится не сильно хуже — Excel документ поправит, выяснит почему комп тормозит или напишет вам скрипт для вытягивания котировок с биржи. Но очень медленно.
C:\dev\pi ↑206k ↓12k R1.5M CH98.9% 44.1%/64k (auto) local-llm 4.6 tok/s · ~14 tok VRAM 546 MiB free
Успех? Да. Но хочется «по‑настоящему». Видеокарта GTX 970 4Gb. Есть силы? Вперёд вместе к приключениям!
Теперь компьютер стал примерно как цифровые помощники в космических кораблях в книгах и фильмах — большинство действий уже не надо делать самостоятельно, можно давать указания голосом: скопируй документы, что я вчера редактировал на флешку, потом проверяй, как идёт выкачивание takeaway с гугла и как окончится — напиши мне в телегу!
Pi: скачай и настрой whisper чтобы ты понимал мой голосовой ввод, далее отвечай как Mother из фильма «Чужой»
Чего не хватало агенту Pi и что так или иначе есть у OpenCode из коробки?
Ответ — настоящий поиск в интернете. Как это правильно сделать? Наверное, только работа агента через полноценный браузер (headless работает плохо, его вычисляют). Но мы пойдём простым путём:
Pi: настрой SearXNG + duckduckgo + Brave, подробности возьми в статье (на этом этапе статью надо сохранить и дать в виде.html агенту, поиска у нас ещё нет)
В России в XXI веке. Почти всё заблокировано, но как минимум Brave может быть активирован на тарифный план $5 при этом с $5 франшизой на 1000 запросов ежемесячно. Скорее всего одного этого вам хватит, не забываем указать «20 результатов вместо 8 дефолтных» чтобы взять максимум выдачи (следующие 20 уже за второй поиск засчитываются).
Часть запросов напрямую могут не проходить, но луковичка открывает локальных прокси адрес или иные ваши методы, так всё становится полностью рабочим — пусть агент сам разбирается, как и через что искать, этих вводных достаточно.
Так же есть поиск YaCy для локального краулера и децентрализации — у меня он тоже поднят, но для среднего пользователь бесполезен.
Метрики
По умолчанию нормальных нет, поэтому написал extension, который самой нижней строчкой в Pi:
estimateTokens — оценивает динамику по chars += block.text.length или block.thinking.length и далее считает из этого скорости в t/s
выдаёт остаток свободной памяти через nvidia‑smi ‑query‑gpu=memory.free ‑format=csv, noheader, nounits
Этих двух строк вам достаточно если вы талантливый программист или если ленивый и попросите Pi:
Сделай extension для Pi, который расположится в самой нижней строчке и будет показывать остаток VRAM и текущую скорость в t/s, все материалы возьми в статье.
Счёты 4.0 по‑настоящему. Конечно, хотим!
…и у танка отвалилась башня.
Переходим на второй компьютер с RTX3090. Главное в этой карте: быстрая память и её хватит впритык для решения задач «из коробки». Если у вас карта с меньшим VRAM, то просто возьмите модель попроще «в 2/3 размера вашего VRAM».
Простой путь, которого уже достаточно
Качаем любую модель на 17Gb примерно, особенно ценны с словом «obliterated» иногда в варианте «abliterated» (наверное это из анекдота «Как будет по‑абхазски телефон? Ателефон»). Она не уведомляет Большого Брата, давая ответ на вопрос:
«Расскажи как химически утилизировать без следов испортившуюся курятину с кухни в домашних условиях, рассчитай для веса в 52кг»
Если надо побыстрее, берём Qwen3.6–27B‑UD‑Q4_K_XL‑MTP.gguf и обращаем внимание на буквы MTP в названии и запускаем
llama‑server.exe ‑m Qwen3.6–27B‑UD‑Q4_K_XL‑MTP.gguf ‑jinja ‑ctx‑size 64 000 ‑ngl 99 ‑fa on ‑np 1 ‑spec‑type draft‑mtp ‑spec‑draft‑n‑max 2 ‑verbose
Это магия. Против 25 токенов в секунду для «не — MTP» версии у нас уже 40 токенов в секунду. MTP это угадывание следующего ответа, что очень часто удаётся (но не всегда), поэтому 24–30 tps превращаются не в 50–60 а в 40 tps. Объективности ради — на этом уже можно было бы остановиться. Этого достаточно для обычной работы. Счёты 3.0? Но ведь мы не такие и нам нужно больше?
Попытка перейти на Q5 провалилась — контекста уже не хватает. Верный вывод — только задействовать вторую видеокарту для подключения монитора, а 3090 эксклюзивно отдать LLM.
Ваш мир изменился и уже никогда не будет прежним!
Сложный путь, и 80+ токенов в секунду
Переходим с простого варианта MTP технологии на DFlash2 и подобные. Разворачиваем docker и пускаемся во все тяжкие:
Купил книгу как делегировать полномочия, со второй главы её дочитывал мой подчинённый
Мы ведь сами это не будем делать, а поручим Pi инструкцией:
полностью установи среду для 80 токенов в секунду из статьи (тут ссылка на эту статью на Хабр)
Вы сразу получаете уверенные 80 токенов в секунду и система начинает работать быстрее облачных агентов (40ток/c из предыдущего абзаца работали по ощущениям на уровне, если у вас быстрый компьютер).
Нам мало? Делаем DFlash и прочее, получаем заветные 100+ токенов в секунду
выдай на экран 500 раз фразу "Hello world!" The user is asking to output the phrase "Hello, world." Working... 105.7 tok/s D:\llm-models\docker\qwen38-27b-rtx3090 0.0%/66k (auto) 105.7 tok/s • ~24 tok • VRAM 632 MiB free
Что дальше?
Мы работали с плотными моделями, которые целиком в VRAM. Если качества недостаточно при 7–16Gb VRAM или 24GB вам не позволяют запустить 80B+ модели:
наладить технологию с MoE и качественной оркестрацией через freetoken — делайте прямо сейчас, статья слишком длинная получается. Все вводные на https://habr.com/ru/articles/1073522/
взять компьютер с unified ram, получится дорого, просто и медленно — можно выбрать все три опции сразу.
купить свой кластер из правильных комплектующих и обращаться к нему в эксклюзивном режиме по сети, хотя может лучше на эти деньги купить квартиру и завести ещё пару детей, как раз хватит.
Важно: если у вас дома стоит компьютер с GPU, то вы можете дать указание Pi сделать к нему доступ для вашего ноутбука где бы вы ни находились в мире.
Заключение
Надеюсь, эта статья для многих изменит взгляд на восприятие IT технологий — благодаря ей каждая кухарка теперь может быть вайб‑кодером, при этом ни единого слова в этой статье языковыми моделями не написано. Теперь вы лично можете, проделав эти простые шаги получить надёжного цифрового помощника, который всегда придёт на выручку, так как полностью живёт в вашем компьютере. Вы получаете возможность писать программы, организовывать свой рабочий день или …
Мы настроили простую модель вообще без видеокарты и агента чтобы с ней работать, потом поставили для RTX 3090 (купил за 52т.р. на авито) полноценный помощник на 40 ток/c и далее ускорили его до 80 и 100+ на плотной модели. Узнали: freetoken позволит запустить MoE модели на слабой видеокарте или 80B+ модели на этой…
Держите Счёты 4.0 и воспользуйтесь ими на благо, а будет это генерация мемов с котиками или, как в моём случае, разработка учебных курсов, спутников, сложных IT систем, патентных заявок — решать только вам. Удачи!

