Об авторе

Я — Каляев Владимир из Сколтех, в основном известен технологией «Сети Каляева» для ликвидации мазута в Анапе, лицевыми щитками для COVID-19, проектом Эко112, gcodetools, соавторством образовательной программы Мастерская Инноваций. Помог многим сотням команд и тысячами проектов, научным сотрудникам, стартапам, студентам и школьникам сделать верные следующие шаги. Автор и соавтор научных статей. Первую программу написал на Yamaha MSX на Basic на черно‑зелёном мониторе.

Год назад я делал доклад в Фонде развития Интернет‑инициатив по рискам использования облачных моделей. В тот момент полноценной замены на локальном железе не было, но за этот год мир изменился и Счёты 4.0 уже доступны каждому. Что это такое, как их бесплатно получить и научиться работать — читайте в этой статье.

Для чего этим заниматься?

Первое, что приходит на ум — хранить свои маленькие секреты у себя (мы помним — вся история ваших запросов хранится и Большой Брат Смотрит На Тебя). Второе — работать много и бесплатно, например сегодня утром все модели в OpenCode превратились в тыкву:

Forbidden: {“model”:“ling-3.0-flash‑fin‑free”} или This model is not available in your country.

И главное — эту технологию у вас уже нельзя отнять.

Лирика

  • Когда счёты достигли совершенства? Около 150 лет назад и с этого момента они до сих пор нишево используются. Попробуйте их улучшить!

  • Когда калькулятор достиг совершенства? Вариант А «для продавца» (счёты v.2) — большие кнопки и 00. Вариант Б «для учёного» (100500 кнопок). Оба лет 40 не улучшаются.

  • Когда текстовый редактор? По моим ощущениям MS Word 97 если чуть поменять визуально, то 99.9% пользователей сейчас не заметят разницы с самым последним. Word+Excel+Базы данных и поиск это Счёты 3.0 — люди почти бросили калькуляторы, они остались только нишевым продуктом.

  • Сейчас онлайн‑поиск Яндекс и Google становятся Счётами 4.0 (онлайн версия), ведь сколько будет «два плюс два» можно не считать самому, а напсать это в строке поиска. И так во всём. С одной маленькой оговоркой — пока тебе дают этим пользоваться.

  • Кажется, сегодня наступает день когда мы подходим к такому же перелому в цифровых помощниках. И потом будут Счёты 5.0, о которых написано много научной фантастики — наша цель дожить и увидеть это своими глазами.

За дело!

Что я пробовал до этого и почему не получилось раньше?

OpenClaw как он только вышел. Первый же запрос погрузил систему в раздумье на полчаса, а десятого запроса уже не было. Фундаментальная проблема — огромные контексты и много этапов подряд, а на каждый снова огромный контекст. Не дождался и сдался. Всё что нам нравится или аморально или ведёт к ожирению, у локальных моделей примерно так же — или 1 токен в секунду для модели на 650 Gb RAM и часовые ответы на простые вопросы или крайняя тупость. Попытки саму модель просить сделать что‑то по шагам почти всегда приводят к катастрофе — результат совсем другой чем ожидалось, на пол‑пути модель забывает ключевой смысл итерационного подхода.

Первый шаг к локальному успеху

Локальная система OpenCode с моделью на сервере: платный по API за каждый токен при просьбе проанализировать локальный проект и внести в него незначительное изменение за три уточнения благополучно доел $20 со с трудом добытой заграничной карточки. Потом были DeepSeek 4 flash, MiMo, Hy3 и прочие. Все они выкладываются на короткое время — успевайте пользоваться! Важно, что каждый день у OpenCode тоже есть его собственное ограничение на объём работы, которое обходится сменой вашего IP и счётчик начинает работать заново.

Это уже полноценная система, особенно на ноутбуке, которая делает что угодно с вашими файлами — от поиска документов и написания писем, до кодинга и «разберись почему комп тормозит, сделай чтобы всё летало». Настоящий цифровой ассистент вместо живой помощницы (и мы этому радуемся?).

Что стало поворотным моментом?

Я попробовал Pi. Это очень простой агент, но у него сделано главное — сильно сокращён входной контекст и количество бесполезных итераций, в сумме это даёт ощущение «работает хорошо и быстро, помогает и справляется». Поставить просто — для Windows это Пуск > powe (кликаем на Power Shell) и пишем

powershell ‑c “irm https://pi.dev/install.ps1 | iex” или для прочих curl ‑fsSL https://pi.dev/install.sh | sh

И так — агент есть, а модели для него нет. Как так получилось? Ответ простой — все производители не заинтересованы в этом, поэтому либо ограниченный бесплатный доступ (сегодня ни один не работает, кстати) или платный или браузер который нам не подходит, так как не может пошуршать по нашим файлам и сбивается на сложной последовательности действий.

Ставим модель

На одном компьютере, с которого я пишу эти строки поработаем в режиме без GPU, только на центральном процессоре. Оперативки потратим менее 5Gb. Попробуем сделать настоящего помощника. Компьютер под Windows 10, для иных платформ изменения минимальные, любой агент справится с пол‑пинка. Начинаем!

  1. Ставим Pi

  2. Ставим свежий llama.cpp, на сегодня это версия b10647 для CUDA 12.4 — нас полностью устраивает (есть обратная совместимость)

  3. Качаем Qwen3.8–4B‑Q5_K_M.gguf размером 3’161’425’184. Есть такая штука KV кеш, которая тоже очень много возьмёт. Запускаем командой без флага ‑ngl 99 (выгружать слои в GPU)

    llama‑server.exe ‑m C:/dev/Qwen3.8–4B‑Q5_K_M.gguf ‑alias local‑llm ‑ctx‑size 64 000 ‑verbose

  4. В вашей домашней папке в файле моделей нужно добавить локальный личный сервер, который запустила llama‑server

providers": {
    "llama-local": {
      "baseUrl": "http://127.0.0.1:8080/v1",
      "api": "openai-completions",
      "apiKey": "dummy",
      "compat": {
        "supportsDeveloperRole": false,
        "supportsReasoningEffort": false
      },
      "models": [
        {
          "id": "local-llm",
          "name": "Local llama-server (current model)",
          "reasoning": false,
          "input": ["text"],
          "contextWindow": 64000,
          "maxTokens": 8192,
          "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 }
        }
      ]
    }
  }
}
  1. Пробуем работать и выясняем, что система ожила. По настоящему. Всего 3–6 токенов в секунду, но она уже делает все обычные бытовые задачи, в том числе на самом простом ноутбуке! Будем честны — кофе не принесёт (но закажет с доставкой, будьте осторожны в своих желаниях!). Однако со многими иными задачами справится не сильно хуже — Excel документ поправит, выяснит почему комп тормозит или напишет вам скрипт для вытягивания котировок с биржи. Но очень медленно.

C:\dev\pi
↑206k ↓12k R1.5M CH98.9% 44.1%/64k (auto) local-llm
4.6 tok/s · ~14 tok VRAM 546 MiB free

Успех? Да. Но хочется «по‑настоящему». Видеокарта GTX 970 4Gb. Есть силы? Вперёд вместе к приключениям!

Теперь компьютер стал примерно как цифровые помощники в космических кораблях в книгах и фильмах — большинство действий уже не надо делать самостоятельно, можно давать указания голосом: скопируй документы, что я вчера редактировал на флешку, потом проверяй, как идёт выкачивание takeaway с гугла и как окончится — напиши мне в телегу!

Pi: скачай и настрой whisper чтобы ты понимал мой голосовой ввод, далее отвечай как Mother из фильма «Чужой»

Чего не хватало агенту Pi и что так или иначе есть у OpenCode из коробки?

Ответ — настоящий поиск в интернете. Как это правильно сделать? Наверное, только работа агента через полноценный браузер (headless работает плохо, его вычисляют). Но мы пойдём простым путём:

Pi: настрой SearXNG + duckduckgo + Brave, подробности возьми в статье (на этом этапе статью надо сохранить и дать в виде.html агенту, поиска у нас ещё нет)

  • В России в XXI веке. Почти всё заблокировано, но как минимум Brave может быть активирован на тарифный план $5 при этом с $5 франшизой на 1000 запросов ежемесячно. Скорее всего одного этого вам хватит, не забываем указать «20 результатов вместо 8 дефолтных» чтобы взять максимум выдачи (следующие 20 уже за второй поиск засчитываются).

  • Часть запросов напрямую могут не проходить, но луковичка открывает локальных прокси адрес или иные ваши методы, так всё становится полностью рабочим — пусть агент сам разбирается, как и через что искать, этих вводных достаточно.

  • Так же есть поиск YaCy для локального краулера и децентрализации — у меня он тоже поднят, но для среднего пользователь бесполезен.

Метрики

По умолчанию нормальных нет, поэтому написал extension, который самой нижней строчкой в Pi:

  1. estimateTokens — оценивает динамику по chars += block.text.length или block.thinking.length и далее считает из этого скорости в t/s

  2. выдаёт остаток свободной памяти через nvidia‑smi ‑query‑gpu=memory.free ‑format=csv, noheader, nounits

Этих двух строк вам достаточно если вы талантливый программист или если ленивый и попросите Pi:

Сделай extension для Pi, который расположится в самой нижней строчке и будет показывать остаток VRAM и текущую скорость в t/s, все материалы возьми в статье.

Счёты 4.0 по‑настоящему. Конечно, хотим!

…и у танка отвалилась башня.

Переходим на второй компьютер с RTX3090. Главное в этой карте: быстрая память и её хватит впритык для решения задач «из коробки». Если у вас карта с меньшим VRAM, то просто возьмите модель попроще «в 2/3 размера вашего VRAM».

Простой путь, которого уже достаточно

  • Качаем любую модель на 17Gb примерно, особенно ценны с словом «obliterated» иногда в варианте «abliterated» (наверное это из анекдота «Как будет по‑абхазски телефон? Ателефон»). Она не уведомляет Большого Брата, давая ответ на вопрос:

    «Расскажи как химически утилизировать без следов испортившуюся курятину с кухни в домашних условиях, рассчитай для веса в 52кг»

  • Если надо побыстрее, берём Qwen3.6–27B‑UD‑Q4_K_XL‑MTP.gguf и обращаем внимание на буквы MTP в названии и запускаем

    llama‑server.exe ‑m Qwen3.6–27B‑UD‑Q4_K_XL‑MTP.gguf ‑jinja ‑ctx‑size 64 000 ‑ngl 99 ‑fa on ‑np 1 ‑spec‑type draft‑mtp ‑spec‑draft‑n‑max 2 ‑verbose

  • Это магия. Против 25 токенов в секунду для «не — MTP» версии у нас уже 40 токенов в секунду. MTP это угадывание следующего ответа, что очень часто удаётся (но не всегда), поэтому 24–30 tps превращаются не в 50–60 а в 40 tps. Объективности ради — на этом уже можно было бы остановиться. Этого достаточно для обычной работы. Счёты 3.0? Но ведь мы не такие и нам нужно больше?

  • Попытка перейти на Q5 провалилась — контекста уже не хватает. Верный вывод — только задействовать вторую видеокарту для подключения монитора, а 3090 эксклюзивно отдать LLM.

Ваш мир изменился и уже никогда не будет прежним!

Сложный путь, и 80+ токенов в секунду

  1. Переходим с простого варианта MTP технологии на DFlash2 и подобные. Разворачиваем docker и пускаемся во все тяжкие:

https://github.com/syv‑ai/qwen38-27b‑rtx3090

Купил книгу как делегировать полномочия, со второй главы её дочитывал мой подчинённый

  1. Мы ведь сами это не будем делать, а поручим Pi инструкцией:

полностью установи среду для 80 токенов в секунду из статьи (тут ссылка на эту статью на Хабр)

  1. Вы сразу получаете уверенные 80 токенов в секунду и система начинает работать быстрее облачных агентов (40ток/c из предыдущего абзаца работали по ощущениям на уровне, если у вас быстрый компьютер).

  2. Нам мало? Делаем DFlash и прочее, получаем заветные 100+ токенов в секунду

выдай на экран 500 раз фразу "Hello world!"
The user is asking to output the phrase "Hello, world."
Working... 105.7 tok/s
D:\llm-models\docker\qwen38-27b-rtx3090
0.0%/66k (auto) 105.7 tok/s • ~24 tok • VRAM 632 MiB free

Что дальше?

Мы работали с плотными моделями, которые целиком в VRAM. Если качества недостаточно при 7–16Gb VRAM или 24GB вам не позволяют запустить 80B+ модели:

  1. наладить технологию с MoE и качественной оркестрацией через freetoken — делайте прямо сейчас, статья слишком длинная получается. Все вводные на https://habr.com/ru/articles/1073522/

  2. взять компьютер с unified ram, получится дорого, просто и медленно — можно выбрать все три опции сразу.

  3. купить свой кластер из правильных комплектующих и обращаться к нему в эксклюзивном режиме по сети, хотя может лучше на эти деньги купить квартиру и завести ещё пару детей, как раз хватит.

  4. Важно: если у вас дома стоит компьютер с GPU, то вы можете дать указание Pi сделать к нему доступ для вашего ноутбука где бы вы ни находились в мире.

Заключение

Надеюсь, эта статья для многих изменит взгляд на восприятие IT технологий — благодаря ей каждая кухарка теперь может быть вайб‑кодером, при этом ни единого слова в этой статье языковыми моделями не написано. Теперь вы лично можете, проделав эти простые шаги получить надёжного цифрового помощника, который всегда придёт на выручку, так как полностью живёт в вашем компьютере. Вы получаете возможность писать программы, организовывать свой рабочий день или …

Мы настроили простую модель вообще без видеокарты и агента чтобы с ней работать, потом поставили для RTX 3090 (купил за 52т.р. на авито) полноценный помощник на 40 ток/c и далее ускорили его до 80 и 100+ на плотной модели. Узнали: freetoken позволит запустить MoE модели на слабой видеокарте или 80B+ модели на этой…

Держите Счёты 4.0 и воспользуйтесь ими на благо, а будет это генерация мемов с котиками или, как в моём случае, разработка учебных курсов, спутников, сложных IT систем, патентных заявок — решать только вам. Удачи!